常说的拥有某数据中心拥有“**P算力”,这里面的算力是什么呢?

什么是“1P”算力
什么是“1P”算力

网络上搜索一些内容,整理如下:

“1P算力”里的 P 是数量级前缀 Peta(10¹⁵,千万亿),所以“1P算力”通常指 1 PFLOPS,即每秒 1×10¹⁵ 次浮点运算(1000万亿次/秒)。

1. 单位是 FLOPS,不是 FLOP

算力的常用单位是 FLOPS(每秒浮点运算次数),是个速率。

1P = 1000T(TFLOPS)= 100万G(GFLOPS)

所以业内说的“1P卡”、“100P集群”基本都是指 PFLOPS 规模。

2. 必须看精度,否则数字没意义。 同一张卡在不同精度下算力差好几倍,“1P算力”本身是不完整的说法。完整的应该是包含FP64、FP32、TF32、FP16、BF16、INT8,还是 INT4?

本篇内容以“1P”的说法为入口,了解了解这方面的基础知识。

相关概念:

以一个实例开始:

  • 一张 NVIDIA H100,FP16/BF16 峰值约 1 PFLOPS 量级(开稀疏更高),所以“1P”差不多就是“约一张高端 AI 卡”的体量。

  • “百P算力中心”“千P智算集群”这类说法,就是把成百上千张这种卡堆在一起的总峰值。

  1. 算力单位相关

FLOPS:全称 Floating Point Operations Per Second,即“每秒浮点运算次数”,是衡量算力的速率单位。注意结尾的 S 是 Second(秒),不是复数。

FLOP:去掉 S,指“一次浮点运算”本身,是个数量而非速率。训练一个模型“总共要算多少次”用 FLOP(或 FLOPs,小写 s 表示复数次数),“每秒能算多少次”用 FLOPS。两者常被混用,但严格意义不同。

浮点运算:对带小数的数字(浮点数)做的加减乘除等运算。之所以强调“浮点”,是因为它和整数运算的硬件实现、速度都不同,神经网络里大量是浮点计算。

Peta / P:国际单位制的数量级前缀,10¹⁵(千万亿)。同系列还有 G(Giga,10⁹/十亿)、T(Tera,10¹²/万亿)、E(Exa,10¹⁸/百亿亿)。换算:1P = 1000T = 100万G。现在最顶级的超算到了 E 级(ExaFLOPS)。

  1. 精度相关

精度:指一个数字用多少位(bit)来表示。位数越多,能表示的数值范围越大、越精确,但占的存储和计算资源也越多。AI 领域为了提速和省显存,倾向用更低的精度。

FP64:双精度浮点,64 位。精度最高,主要用于科学计算、天气模拟这类对数值误差极敏感的场景。

FP32:单精度浮点,32 位。传统通用计算和早期深度学习的默认精度。

FP16 / BF16:半精度浮点,16 位。是 AI 训练的主流。两者都是 16 位但内部结构不同——BF16(Brain Float 16)牺牲了小数精度换取更大的数值范围,更不容易在训练中数值溢出,所以现在大模型训练更常用 BF16。

FP8:8 位浮点,更激进的低精度,近两年在大模型训练和推理上开始普及(H100 这代硬件原生支持)。

INT8:8 位整数。注意它是整数不是浮点,主要用于推理阶段的“量化”,进一步压缩模型、提速。

  1. 计算场景相关

HPC:High Performance Computing,高性能计算,指传统超算领域(科学仿真、流体力学、基因测序等),通常吃 FP64 双精度。和 AI 算力是两套不同的需求。

AI 训练:让模型从数据中学习、更新参数的过程,计算量极大,对精度有一定要求(主流 BF16/FP16)。

AI 推理:模型训练好之后,拿来实际回答问题/做预测的过程。计算量比训练小,可以用更低精度(FP8/INT8)来提速降本。

量化(Quantization):把模型里原本用高精度(如 FP16)存的权重,转换成低精度(如 INT8、INT4)的过程。好处是模型变小、跑得快、省显存;代价是可能损失一点精度。

  1. 性能衡量相关

峰值算力 / Peak:硬件在理论最理想情况下的算力上限,是厂商宣传时标的数字。现实中几乎不可能持续达到。

实测算力:实际跑任务时真正发挥出来的算力,受各种瓶颈拖累,通常远低于峰值。

显存带宽:GPU 显存和计算核心之间搬运数据的速度。很多时候算力核心没“吃饱”不是因为算得慢,而是数据喂不过来(带宽不够),这叫“内存墙”。

MFU:Model FLOPs Utilization,模型算力利用率。= 实际有效算力 ÷ 理论峰值算力。大模型训练能做到 30%–50% 就算不错了,意味着标称“1P”的卡,实际有效可能只有 0.3–0.5P。

稀疏 / Sparsity:让矩阵里一部分数值为 0,硬件跳过这些 0 不计算,从而“翻倍”算力。厂商标算力时如果带“稀疏”条件,数字会比实际稠密计算高一倍,看的时候要留意是不是“开稀疏”的数。

  1. 硬件/集群相关

H100:NVIDIA 的高端 AI 训练/推理 GPU(Hopper 架构),目前主流大模型训练的主力卡之一,FP16 峰值在 1P 量级。

智算中心 / 智算集群:专门为 AI 计算(而非传统超算)建设的大规模算力基础设施,把成百上千张 AI 卡用高速网络连起来,对外报的“百P”“千P”是所有卡峰值算力的总和。

FP64/FP32/TF32/FP16/BF16/INT8/INT4间的差距

“1P算力”在不同精度下不是同一张卡的固定值,而是同一颗芯片在不同精度下的吞吐能力本就不同。 现代 GPU 的张量核心大致遵循“精度每减半,算力翻倍”的规律。

NVIDIA H100 SXM5 为例(最权威、也最有代表性),取 稠密(dense,不开稀疏) 的官方白皮书数据,并以 FP16/BF16 = 1P 为基准做横向比较:

精度H100 稠密峰值相对 FP16 倍率单位/性质
FP6460 TFLOPS1/16 ≈ 0.06P双精度,科学计算
FP3260 TFLOPS1/16 ≈ 0.06P单精度
TF32500 TFLOPS1/2 = 0.5P张量核心专用格式
FP161000 TFLOPS1P(基准)半精度,AI训练主力
BF161000 TFLOPS1P(基准)半精度,训练更稳
FP82000 TFLOPS2P低精度训练/推理
INT82000 TOPS2P整数,推理量化
INT4H100 不支持(≈4P)见下方说明

由表格知:

  1. 从高精度往低走,基本是一条“翻倍阶梯”:FP64 → FP32 → TF32 → FP16/BF16 → FP8/INT8 → FP4/INT4,每跨一档约 ×2。所以同一张卡,FP16 的 1P 到了 INT8 就是约 2P,而到了 FP64 只剩约 1/16。

  2. 同一张“1P(FP16)”的卡,大致是 FP64≈0.06P、TF32≈0.5P、INT8≈2P;但 FP64 这一档极度依赖具体芯片,国产卡和消费级卡往往远低于这个比例。

适用场景

格式位宽类型精度速度显存占用训练推理典型评价
FP6464浮点最高最大少量特殊场景很少科研级
FP3232浮点中等传统标准可用但贵稳但贵
TF32约19浮点变体中高类似 FP32 输入NVIDIA 训练加速少用训练加速折中
FP1616浮点很快可用但需技巧常用快但易不稳
BF1616浮点很快大模型常用常用稳定性好
INT88整数较低很快很小基本不用常用推理部署主力
INT44整数更低很快/省显存极小不用于常规训练本地推理常用省显存但损质量

不同算力卡比较

芯片厂商FP16/BF16折算P (H100=1P)INT8显存带宽状态
H100 SXM5NVIDIA~1000 T1P(基准)2000 TOPS80G HBM33.35 TB/s禁售
H20(特供)NVIDIA~148 T0.15P96G HBM34.0 TB/s可买
昇腾 910C华为~752–800 T~0.8P~1504 TOPS128G3.2 TB/s量产旗舰
BR100壁仞~1024 T~1P2048 TOPS64G HBM2e2.3 TB/s受制裁难量产
昇腾 910B华为~320–376 T~0.35P~640 TOPS64G HBM2e0.4–1.2 TB/s量产主力
BW100/深算海光~300+ T~0.3P量产
思元 590寒武纪~256–300 T~0.26P64G量产(约A100七成)
曦云 C500/C550沐曦~240 T~0.24P64G量产
天垓 150天数智芯~224 T~0.22P量产
P800昆仑芯~128–345 T*~0.13–0.35P~256 TOPS96G HBM3量产,出货量大
MTT S5000摩尔线程~A100级~0.3P64G万卡部署
A100(老旗舰参照)NVIDIA312 T0.31P624 TOPS80G2.0 TB/s禁售
  • H100 禁售,所以现实里真正要比的对象其实是英伟达 H20(被大幅阉割,FP16 只有约 148 TFLOPS)。上图以**完整版 H100(FP16 稠密 ≈ 1000 TFLOPS = 1P)**作为“1P 基准”来归一化。

  • *:P800 各来源数字打架严重:一处说峰值 256 TOPS@INT8、128 TFLOPS@FP16,但行业全景图把它归到“接近 A100(312T)梯度”。P800 部署的话以官方规格书为准。

  • 纸面 FP16 差距没有想象中大, 昇腾 910C 纸面约 0.8P,壁仞 BR100 甚至约 1P,看起来很接近 H100。但 BR100 因制裁基本量产不了;真正能规模出货的旗舰是 910C,910C 的纸面算力是 H20 的 5 倍以上。

  • FP8 支持:H100 原生 FP8(2P),是大模型训练/推理提速的关键。多数国产卡(910B/C、思元 590、C500 这代)主打 FP16/INT8,FP8 支持弱或没有。华为要到下一代昇腾 950 系列才在 FP8 下达到 1 PFLOPS、FP4 下 2 PFLOPS,这才追上 H100 的低精度路线。

  • 互联/组网:H100 的 NVLink 900 GB/s。国产芯片互联能力普遍较弱,除华为外带宽普遍在 400 GB/s 以下。这直接决定能不能高效堆千卡、万卡——单卡再强,组不起大集群也白搭。华为靠 CloudMatrix 超节点是唯一例外。

  • 软件生态:H100 = CUDA,生态成熟。国产卡各搞各的(华为 CANN、昆仑飞桨、寒武纪 BANG…),迁移和调优成本高,实际利用率(MFU)往往明显低于英伟达。

  • 实测 ≠ 峰值:这些都是峰值。考虑到生态不成熟,国产卡的有效 MFU 通常比 H100 低,所以“0.8P 纸面”落到实际任务可能只剩 0.4–0.5P 的体感。

  • 910C 的 128GB、P800 的 96GB HBM3,都超过 H100 的 80GB。百度昆仑芯三代 P800 拥有 96GB HBM3 显存。对跑大模型来说,显存大意味着单卡能塞下更大的模型,这是国产卡的一个实打实优势点。

  • 数据来源:

    1. https://www.cnblogs.com/wujianming-110117/p/18939581
    2. https://blog.csdn.net/Rong_Toa/article/details/151322568
    3. https://blog.csdn.net/Peter_Changyb/article/details/151934401
    4. https://zhuanlan.zhihu.com/p/1908027882829244313
    5. https://www.cnblogs.com/wujianming-110117/p/19101958

按“1P = 完整 H100 FP16”算,国产第一梯队(910C ≈0.8P、BR100 ≈1P)纸面已经接近H100,第二梯队(思元590/曦云C500/天垓150/P800)在 0.2–0.35P 即“A100 量级”。但真正拉开差距的是 FP8、互联、生态三项,而不是 FP16 峰值数字——再加上 H100 中国禁售这个前提,当下的现实定位是“全面超过可买到的 H20、对标被禁的 A100、向 H100 靠近”。