发布会上,厂商介绍自己产品说:“这张卡有20P算力。”

台下鼓掌,媒体标题写“史上最强”。

但如果你去翻这张卡的官方数据表,会在某些Tensor Core算力项目旁边发现一个不起眼的星号(*),点开脚注可能写着一句话:这些数字采用稀疏(with sparsity)口径,不开稀疏时规格减半。

也就是说,发布会现场说的“20P”,实际稠密算力可能只有10P,甚至更低。这不是哪家厂商偷偷作弊,而是官方规格表里公开写明、但作为读者很容易忽略的口径差异。稀疏算力到底是怎么把数字翻倍的,各家发布会都是怎么报的,你自己该怎么一眼识别。

一、稀疏矩阵:先搞懂“挑重点做事”是什么意思

2:4 结构化稀疏到底在跳过什么
2:4 结构化稀疏到底在跳过什么

想象一张100道题的试卷,你负责批改。

如果学生认认真真答满了100道题,你就得老老实实判100道。这叫稠密(dense)——矩阵里的每一个格子都有实际数值,硬件必须逐一参与计算,一个都不能少。

但现在硬件支持一种更规整的做法:如果模型权重已经满足每连续4个数里,至少2个是0,硬件就可以跳过这些0,只处理剩下的非零值。于是同样一张卡,理论吞吐量能翻一倍。这套规则在业内有个专门的名字,叫 2:4结构化稀疏(structured sparsity):每4个权重里,至少2个被清零,硬件按这个固定模式压缩权重,再用专门的稀疏Tensor Core路径做乘加运算。

这里有个关键点很容易被忽略:试卷本身还是100道题,矩阵的规模一点没变。稀疏拿到的“2倍算力”,本质上是“跳过一半计算量”换来的相对加速比,而不是芯片真的凭空多长出一倍的晶体管。而且,这活儿不是白捡的——想让权重乖乖满足“每4个里至少2个是0”这个苛刻条件,通常需要专门用稀疏化训练或剪枝去“驯服”模型,很多实际生产模型并不会做这一步,也就吃不到这个加速。这也是为什么行业里有个粗暴但好用的经验:只要数据表里出现“稀疏”字样,这个数字大概率要打对折才是普通任务能拿到的真实水平。

二、稀疏vs稠密算力对照表:以H100、B200为例

这套“稀疏=稠密两倍”的写法,其实不是从H100、B200才开始的,往前翻一代就能找到源头。NVIDIA官方A100规格页上,同一类Tensor Core算力经常以稠密和稀疏两个口径出现:比如BF16/FP16可以看到312 TFLOPS和624 TFLOPS这一组数字,脚注专门标注了“With sparsity”。也就是说,从Ampere架构这一代开始,“稀疏峰值”就已经是NVIDIA官方规格表里的正式口径了,H100、Blackwell只是把这套写法延续了下去。

不用猜,直接看NVIDIA自己的官方规格页怎么写。H100 SXM的BF16/FP16 Tensor Core写成1979 TFLOPS,FP8写成3958 TFLOPS,脚注说明这些数字采用稀疏技术显示,不采用稀疏技术时规格降低一半。换成稠密口径,H100 SXM的BF16/FP16大约是989.5 TFLOPS,FP8大约是1979 TFLOPS。到了Blackwell一代,NVIDIA GB200 NVL72的规格表延续同样的写法,直接把sparse和dense并排列出,GB200 Grace Blackwell Superchip的NVFP4张量算力写成“40 | 20 PFLOPS”,脚注同样注明稠密规格是稀疏规格的一半——这里的40 PFLOPS是稀疏口径,20 PFLOPS才是稠密口径,而且它背后其实叠了两层变化:一层是从FP16/FP8换到更激进的FP4(精度每降一档,算力翻一倍),另一层才是稀疏本身。两层叠在一起,喊出来的最大数字很容易比一张卡在常规模型里能用上的算力高很多。

不止NVIDIA一家这么标。AMD Instinct系列的官方规格页也会把“普通峰值”和“结构化稀疏峰值”分开列:8卡MI300X平台的FP16矩阵算力,官方给的是稠密约10.5 PFLOPS、带结构化稀疏约20.9 PFLOPS;更新的MI355X单卡上,FP16/BF16矩阵算力是稠密2.5 PFLOPS、稀疏5 PFLOPS,INT8则是稠密约5 POPS、稀疏约10.1 POPS。可以看到,AMD的倍率关系和NVIDIA完全一致,都是稀疏正好翻一倍,只是AMD官方页面通常把两栏都摆在明面上,读者不用扒脚注就能看到对比。

稀疏算力 vs 稠密算力,为什么总是 2×
稀疏算力 vs 稠密算力,为什么总是 2×
芯片 / 精度稠密算力(真实基线)稀疏算力(发布会/宣传常用)倍率
A100 SXM · BF16/FP16312 TFLOPS624 TFLOPS
H100 · FP16/BF16约990 TFLOPS约1980 TFLOPS
H100 · FP8约1980 TFLOPS约3960 TFLOPS
B200 SXM · FP8/FP6约4.5 PFLOPS约9 PFLOPS
B200 SXM · FP4约9 PFLOPS约18 PFLOPS
GB200 Grace Blackwell Superchip · NVFP420 PFLOPS40 PFLOPS
AMD MI300X(8卡平台)· FP16约10.5 PFLOPS约20.9 PFLOPS
AMD MI355X(单卡)· FP16/BF162.5 PFLOPS5 PFLOPS

这里要提醒一句:稀疏加速不是“想用就用”。2:4结构化稀疏要求每连续4个权重里至少2个为零,模型通常需要经过剪枝和微调,才能满足这个模式并尽量恢复精度。不做这一步,硬件的稀疏加速路径就用不上。所以对很多直接部署、没有专门做稀疏化处理的生产模型来说,实际更接近表格左边那一列,稠密算力。

三、各家发布会,常用哪种口径?

不同厂商如何呈现 dense / sparse 算力
不同厂商如何呈现 dense / sparse 算力

NVIDIA:明牌打稀疏,但脚注写得清清楚楚。 从A100那代开始,NVIDIA就把“稀疏”当成官方精度阶梯的正式一环写进数据表,发布会喊的都是打满buff后的数字,但官方PDF里从来没藏着不给稠密数字——脚注一直都在,只是没人细看。这算是“阳谋”:数字最好看,但证据也留在纸面上。

AMD:两栏都摆在明面上,反而更好读。 AMD Instinct系列的官方规格页习惯把“普通峰值”和“带结构化稀疏峰值”并排列出,不用翻脚注就能直接对比。不过要注意,AMD在对外做竞品对比图(比如拿MI300X对比H100)时,用的同样是稀疏口径,这一点和NVIDIA是一致的——两家比拼的“更强”,往往都是稀疏对稀疏。

Intel Gaudi:干脆不把稀疏当成主打卖点。 Intel Gaudi系列的公开资料更常强调FP8、BF16相比上一代提升了多少,以及网络、显存这些系统层面的特性,“稀疏”没有被当作首页最核心的标签来讲。这提醒我们一件事:不是所有厂商都爱打稀疏这张牌,读到Gaudi这类页面时,重点应该先看精度和系统口径,不要把所有的“翻倍”都自动脑补成稀疏在起作用。

国产芯片:公开资料里较少直接拆出dense / sparse两栏,不能主动脑补。 从公开的路线图和评测材料看,国内不少芯片发布页面会直接报FP16、FP8、FP4或INT8算力,但不一定像NVIDIA、AMD那样,把稠密和稀疏两栏拆得很清楚。比如2026年7月华为在世界人工智能大会(WAIC)上真机首秀的Atlas 950 SuperPoD超节点,官方对外公布的是1024卡规模、1 EFLOPS FP8、2 EFLOPS FP4,以及256TB全局统一内存编址空间——这个页面强调的是超节点规模、低精度格式和互联架构,公开文本里没有把这些数字拆成“稠密 / 稀疏”两种口径。

遇到这种情况,最稳妥的做法是按页面标出的这个数字直接理解,既不要自己主动打对折,也不要脑补成“这背后一定还有个稀疏翻倍版本”——没有证据支持的方向,宁可不脑补,对文章里没写清楚的一方也不要替它下结论。换句话说:同样是“没标注稀疏”的数字,含义可能是不一样的——有的是因为产品资料压根不讲这件事,有的是因为功能、软件栈、应用场景还没展开说明。这个格局本身在快速变化,后续型号什么时候开始正式打“稀疏”这张牌,值得持续关注,读者看到具体型号时最好还是按下面的自查方法过一遍,而不是直接套用“国产=稠密”这个印象。

通用规律:越靠近推理场景(FP8/FP4/INT8),厂商越爱强调稀疏;越靠近训练和科学计算(FP16/FP32/FP64),稀疏这张牌用得越少。 原因也很直接——训练阶段模型权重本身很少满足2:4稀疏的苛刻条件,稀疏加速在训练里能落地的场景有限;反而是推理阶段,配合量化和裁剪,更容易凑出这个“每4个里2个是0”的结构。

四、读者怎么在参数表里一眼识别?

读显卡参数表的 6 步自查法
读显卡参数表的 6 步自查法

最简单的办法是先问自己四个问题:这是FP16/BF16、FP8还是FP4?这是稠密还是稀疏?这是单卡还是整机、整柜?这是理论峰值还是模型实测吞吐? 只要这四个问题里有任何一个答不上来,这个数字基本上就只是用来挂在PPT上好看的,先别急着拿来做判断依据。

想再细一点,可以按这几步快速自查:

  1. 先找“sparsity / 稀疏 / 2:4”这几个字。只要数据表任何角落出现这几个词,不管是不是加了星号,都要先确认这个数字是不是打了2倍buff之后的口径。
  2. 看是不是并排列了两个数字。规范一点的数据表通常会把稠密和稀疏两栏并排列出来。比如GB200官方表格把NVFP4写成40 | 20 PFLOPS,挑小的那个当作稠密基线。
  3. 认精度。FP4 < FP8 < FP16/BF16 < TF32 < FP32 < FP64,精度每降一档,理论算力大致翻一倍。发布会如果拿最激进的FP4/INT4数字去和别家的FP16数字比,这已经不是稀疏的问题了,是连精度基准都没对齐。
  4. 两把尺子叠加算总账。如果一个数字同时踩中了“更低精度”和“开启稀疏”两个buff,相对于稠密FP16基线,理论上限可能被放大4倍左右——这也是“2P算力”实际到手可能只有1P甚至更低的常见来源。
  5. 对训练场景多一份警惕。凡是宣传“能训练XX亿参数大模型”却只报了稀疏/低精度数字的,建议直接打对折甚至打两折去理解,因为训练阶段真正吃满稀疏加速的场景并不多,实际有效算力(MFU)通常还要再打折扣。
  6. 确认这是单卡还是整机整柜。看到platform、rack、NVL72、8-GPU这类字样,先搞清楚这是把好几张卡加总之后的数字,不是单卡本身的算力——单卡数字和整柜数字放在一起比,本身就不是一回事。

说到底,“稀疏算力”不是骗局,它是真实存在的硬件能力,前提是你的模型愿意为它做专门的适配。但对大多数人来说,脱离“是否稀疏、什么精度”去谈一个孤零零的算力数字,基本等于没说——先问清楚这个“P”是哪个“P”,才是看懂一张显卡参数表的第一步。

主要参考资料