常说的拥有某数据中心拥有“**P算力”,这里面的算力是什么呢?

网络上搜索一些内容,整理如下:
“1P算力”里的 P 是数量级前缀 Peta(10¹⁵,千万亿),所以“1P算力”通常指 1 PFLOPS,即每秒 1×10¹⁵ 次浮点运算(1000万亿次/秒)。
1. 单位是 FLOPS,不是 FLOP。
算力的常用单位是 FLOPS(每秒浮点运算次数),是个速率。
1P = 1000T(TFLOPS)= 100万G(GFLOPS)
所以业内说的“1P卡”、“100P集群”基本都是指 PFLOPS 规模。
2. 必须看精度,否则数字没意义。 同一张卡在不同精度下算力差好几倍,“1P算力”本身是不完整的说法。完整的应该是包含FP64、FP32、TF32、FP16、BF16、INT8,还是 INT4?
本篇内容以“1P”的说法为入口,了解了解这方面的基础知识。
相关概念:
以一个实例开始:
一张 NVIDIA H100,FP16/BF16 峰值约 1 PFLOPS 量级(开稀疏更高),所以“1P”差不多就是“约一张高端 AI 卡”的体量。
“百P算力中心”“千P智算集群”这类说法,就是把成百上千张这种卡堆在一起的总峰值。
- 算力单位相关
FLOPS:全称 Floating Point Operations Per Second,即“每秒浮点运算次数”,是衡量算力的速率单位。注意结尾的 S 是 Second(秒),不是复数。
FLOP:去掉 S,指“一次浮点运算”本身,是个数量而非速率。训练一个模型“总共要算多少次”用 FLOP(或 FLOPs,小写 s 表示复数次数),“每秒能算多少次”用 FLOPS。两者常被混用,但严格意义不同。
浮点运算:对带小数的数字(浮点数)做的加减乘除等运算。之所以强调“浮点”,是因为它和整数运算的硬件实现、速度都不同,神经网络里大量是浮点计算。
Peta / P:国际单位制的数量级前缀,10¹⁵(千万亿)。同系列还有 G(Giga,10⁹/十亿)、T(Tera,10¹²/万亿)、E(Exa,10¹⁸/百亿亿)。换算:1P = 1000T = 100万G。现在最顶级的超算到了 E 级(ExaFLOPS)。
- 精度相关
精度:指一个数字用多少位(bit)来表示。位数越多,能表示的数值范围越大、越精确,但占的存储和计算资源也越多。AI 领域为了提速和省显存,倾向用更低的精度。
FP64:双精度浮点,64 位。精度最高,主要用于科学计算、天气模拟这类对数值误差极敏感的场景。
FP32:单精度浮点,32 位。传统通用计算和早期深度学习的默认精度。
FP16 / BF16:半精度浮点,16 位。是 AI 训练的主流。两者都是 16 位但内部结构不同——BF16(Brain Float 16)牺牲了小数精度换取更大的数值范围,更不容易在训练中数值溢出,所以现在大模型训练更常用 BF16。
FP8:8 位浮点,更激进的低精度,近两年在大模型训练和推理上开始普及(H100 这代硬件原生支持)。
INT8:8 位整数。注意它是整数不是浮点,主要用于推理阶段的“量化”,进一步压缩模型、提速。
- 计算场景相关
HPC:High Performance Computing,高性能计算,指传统超算领域(科学仿真、流体力学、基因测序等),通常吃 FP64 双精度。和 AI 算力是两套不同的需求。
AI 训练:让模型从数据中学习、更新参数的过程,计算量极大,对精度有一定要求(主流 BF16/FP16)。
AI 推理:模型训练好之后,拿来实际回答问题/做预测的过程。计算量比训练小,可以用更低精度(FP8/INT8)来提速降本。
量化(Quantization):把模型里原本用高精度(如 FP16)存的权重,转换成低精度(如 INT8、INT4)的过程。好处是模型变小、跑得快、省显存;代价是可能损失一点精度。
- 性能衡量相关
峰值算力 / Peak:硬件在理论最理想情况下的算力上限,是厂商宣传时标的数字。现实中几乎不可能持续达到。
实测算力:实际跑任务时真正发挥出来的算力,受各种瓶颈拖累,通常远低于峰值。
显存带宽:GPU 显存和计算核心之间搬运数据的速度。很多时候算力核心没“吃饱”不是因为算得慢,而是数据喂不过来(带宽不够),这叫“内存墙”。
MFU:Model FLOPs Utilization,模型算力利用率。= 实际有效算力 ÷ 理论峰值算力。大模型训练能做到 30%–50% 就算不错了,意味着标称“1P”的卡,实际有效可能只有 0.3–0.5P。
稀疏 / Sparsity:让矩阵里一部分数值为 0,硬件跳过这些 0 不计算,从而“翻倍”算力。厂商标算力时如果带“稀疏”条件,数字会比实际稠密计算高一倍,看的时候要留意是不是“开稀疏”的数。
- 硬件/集群相关
H100:NVIDIA 的高端 AI 训练/推理 GPU(Hopper 架构),目前主流大模型训练的主力卡之一,FP16 峰值在 1P 量级。
智算中心 / 智算集群:专门为 AI 计算(而非传统超算)建设的大规模算力基础设施,把成百上千张 AI 卡用高速网络连起来,对外报的“百P”“千P”是所有卡峰值算力的总和。
FP64/FP32/TF32/FP16/BF16/INT8/INT4间的差距
“1P算力”在不同精度下不是同一张卡的固定值,而是同一颗芯片在不同精度下的吞吐能力本就不同。 现代 GPU 的张量核心大致遵循“精度每减半,算力翻倍”的规律。
以 NVIDIA H100 SXM5 为例(最权威、也最有代表性),取 稠密(dense,不开稀疏) 的官方白皮书数据,并以 FP16/BF16 = 1P 为基准做横向比较:
| 精度 | H100 稠密峰值 | 相对 FP16 倍率 | 单位/性质 |
|---|---|---|---|
| FP64 | 60 TFLOPS | 1/16 ≈ 0.06P | 双精度,科学计算 |
| FP32 | 60 TFLOPS | 1/16 ≈ 0.06P | 单精度 |
| TF32 | 500 TFLOPS | 1/2 = 0.5P | 张量核心专用格式 |
| FP16 | 1000 TFLOPS | 1P(基准) | 半精度,AI训练主力 |
| BF16 | 1000 TFLOPS | 1P(基准) | 半精度,训练更稳 |
| FP8 | 2000 TFLOPS | 2P | 低精度训练/推理 |
| INT8 | 2000 TOPS | 2P | 整数,推理量化 |
| INT4 | H100 不支持 | (≈4P) | 见下方说明 |
由表格知:
从高精度往低走,基本是一条“翻倍阶梯”:FP64 → FP32 → TF32 → FP16/BF16 → FP8/INT8 → FP4/INT4,每跨一档约 ×2。所以同一张卡,FP16 的 1P 到了 INT8 就是约 2P,而到了 FP64 只剩约 1/16。
同一张“1P(FP16)”的卡,大致是 FP64≈0.06P、TF32≈0.5P、INT8≈2P;但 FP64 这一档极度依赖具体芯片,国产卡和消费级卡往往远低于这个比例。
适用场景
| 格式 | 位宽 | 类型 | 精度 | 速度 | 显存占用 | 训练 | 推理 | 典型评价 |
|---|---|---|---|---|---|---|---|---|
| FP64 | 64 | 浮点 | 最高 | 慢 | 最大 | 少量特殊场景 | 很少 | 科研级 |
| FP32 | 32 | 浮点 | 高 | 中等 | 大 | 传统标准 | 可用但贵 | 稳但贵 |
| TF32 | 约19 | 浮点变体 | 中高 | 快 | 类似 FP32 输入 | NVIDIA 训练加速 | 少用 | 训练加速折中 |
| FP16 | 16 | 浮点 | 中 | 很快 | 小 | 可用但需技巧 | 常用 | 快但易不稳 |
| BF16 | 16 | 浮点 | 中 | 很快 | 小 | 大模型常用 | 常用 | 稳定性好 |
| INT8 | 8 | 整数 | 较低 | 很快 | 很小 | 基本不用 | 常用 | 推理部署主力 |
| INT4 | 4 | 整数 | 更低 | 很快/省显存 | 极小 | 不用于常规训练 | 本地推理常用 | 省显存但损质量 |
不同算力卡比较
| 芯片 | 厂商 | FP16/BF16 | 折算P (H100=1P) | INT8 | 显存 | 带宽 | 状态 |
|---|---|---|---|---|---|---|---|
| H100 SXM5 | NVIDIA | ~1000 T | 1P(基准) | 2000 TOPS | 80G HBM3 | 3.35 TB/s | 禁售 |
| H20(特供) | NVIDIA | ~148 T | 0.15P | — | 96G HBM3 | 4.0 TB/s | 可买 |
| 昇腾 910C | 华为 | ~752–800 T | ~0.8P | ~1504 TOPS | 128G | 3.2 TB/s | 量产旗舰 |
| BR100 | 壁仞 | ~1024 T | ~1P | 2048 TOPS | 64G HBM2e | 2.3 TB/s | 受制裁难量产 |
| 昇腾 910B | 华为 | ~320–376 T | ~0.35P | ~640 TOPS | 64G HBM2e | 0.4–1.2 TB/s | 量产主力 |
| BW100/深算 | 海光 | ~300+ T | ~0.3P | — | — | — | 量产 |
| 思元 590 | 寒武纪 | ~256–300 T | ~0.26P | — | 64G | — | 量产(约A100七成) |
| 曦云 C500/C550 | 沐曦 | ~240 T | ~0.24P | — | 64G | — | 量产 |
| 天垓 150 | 天数智芯 | ~224 T | ~0.22P | — | — | — | 量产 |
| P800 | 昆仑芯 | ~128–345 T* | ~0.13–0.35P | ~256 TOPS | 96G HBM3 | — | 量产,出货量大 |
| MTT S5000 | 摩尔线程 | ~A100级 | ~0.3P | — | 64G | — | 万卡部署 |
| A100(老旗舰参照) | NVIDIA | 312 T | 0.31P | 624 TOPS | 80G | 2.0 TB/s | 禁售 |
H100 禁售,所以现实里真正要比的对象其实是英伟达 H20(被大幅阉割,FP16 只有约 148 TFLOPS)。上图以**完整版 H100(FP16 稠密 ≈ 1000 TFLOPS = 1P)**作为“1P 基准”来归一化。
*:P800 各来源数字打架严重:一处说峰值 256 TOPS@INT8、128 TFLOPS@FP16,但行业全景图把它归到“接近 A100(312T)梯度”。P800 部署的话以官方规格书为准。
纸面 FP16 差距没有想象中大, 昇腾 910C 纸面约 0.8P,壁仞 BR100 甚至约 1P,看起来很接近 H100。但 BR100 因制裁基本量产不了;真正能规模出货的旗舰是 910C,910C 的纸面算力是 H20 的 5 倍以上。
FP8 支持:H100 原生 FP8(2P),是大模型训练/推理提速的关键。多数国产卡(910B/C、思元 590、C500 这代)主打 FP16/INT8,FP8 支持弱或没有。华为要到下一代昇腾 950 系列才在 FP8 下达到 1 PFLOPS、FP4 下 2 PFLOPS,这才追上 H100 的低精度路线。
互联/组网:H100 的 NVLink 900 GB/s。国产芯片互联能力普遍较弱,除华为外带宽普遍在 400 GB/s 以下。这直接决定能不能高效堆千卡、万卡——单卡再强,组不起大集群也白搭。华为靠 CloudMatrix 超节点是唯一例外。
软件生态:H100 = CUDA,生态成熟。国产卡各搞各的(华为 CANN、昆仑飞桨、寒武纪 BANG…),迁移和调优成本高,实际利用率(MFU)往往明显低于英伟达。
实测 ≠ 峰值:这些都是峰值。考虑到生态不成熟,国产卡的有效 MFU 通常比 H100 低,所以“0.8P 纸面”落到实际任务可能只剩 0.4–0.5P 的体感。
910C 的 128GB、P800 的 96GB HBM3,都超过 H100 的 80GB。百度昆仑芯三代 P800 拥有 96GB HBM3 显存。对跑大模型来说,显存大意味着单卡能塞下更大的模型,这是国产卡的一个实打实优势点。
数据来源:
按“1P = 完整 H100 FP16”算,国产第一梯队(910C ≈0.8P、BR100 ≈1P)纸面已经接近H100,第二梯队(思元590/曦云C500/天垓150/P800)在 0.2–0.35P 即“A100 量级”。但真正拉开差距的是 FP8、互联、生态三项,而不是 FP16 峰值数字——再加上 H100 中国禁售这个前提,当下的现实定位是“全面超过可买到的 H20、对标被禁的 A100、向 H100 靠近”。