这两年看智算中心新闻,经常会看到一个很大的数字:千P、万P、多少EFLOPS。

这个数字当然不是假的。它背后通常有真实的机房、服务器、GPU、交换机、电力和冷却系统。但它也不是一个完整答案。一个智算中心说自己有1000P,只能说明它有一批账面峰值资源,不等于这些资源在训练大模型时都能高效跑起来。

国家数据局指导下,全国数据标准化技术委员会在2025年6月发布过一组《全国一体化算力网》技术文件征求意见稿。里面有一个很值得注意的变化:算力衡量已经不只看峰值计算能力,还要看计算负载率、网络带宽利用率、时延、丢包率、吞吐率、存储IOPS、访问延迟等指标。

这说明,连标准口径都已经不满足于一个孤立的P数了。

普通读者看智算中心,不需要马上钻进所有工程细节里。抓住三个数字就够了:

  • 这个P是什么精度算出来的?
  • 卡和卡之间用什么网络连起来?
  • 真实任务跑出了多少有效算力?

这三个数字连起来,才比较接近一个智算中心真实的训练能力。

峰值P数是怎么加出来的

同一张GPU,为什么能写成接近2P,也能写成接近1P
同一张GPU,为什么能写成接近2P,也能写成接近1P

P是peta的缩写。1P FLOPS,大约就是每秒1000万亿次浮点运算。一个智算中心说自己有1000P,最朴素的算法通常是:

1
总峰值算力 = 单卡峰值算力 × 卡数

这个公式看起来很直观,麻烦在于“单卡峰值算力”本身有很多口径。

以NVIDIA H100 SXM为例,NVIDIA官方规格页写的是:FP16/BF16 Tensor Core为1979 TFLOPS,FP8 Tensor Core为3958 TFLOPS,NVLink带宽为900GB/s。但同一个表格下面有脚注:这些带星号的Tensor Core数字是采用稀疏技术显示的,不采用稀疏技术时规格降低一半。

也就是说,同一张H100 SXM,如果按FP16/BF16稀疏口径看,接近2P;如果按不采用稀疏的稠密口径看,大约接近1P。

这不是文字游戏,也不是博客作者的猜测,而是官方规格表里的口径差异。

再往下看,精度口径也会让数字变化很大。大模型训练常见的是FP16、BF16、FP8这些低精度格式;科学计算常看FP64;推理场景又经常出现INT8、INT4、FP4。它们都可能被折算成某种OPS或FLOPS,但不能直接混在一起比较。

可以粗略记成这张表:

精度口径常见场景读者需要注意什么
FP64科学计算、高性能计算不等于大模型训练主口径
FP32通用单精度计算常被用于统一折算
TF32NVIDIA Tensor Core计算主要是张量核心相关口径
FP16/BF16大模型训练主力看清是稠密还是稀疏
FP8新一代训练和推理不能直接和FP16数字混比
INT8量化推理更偏推理,不宜直接代表训练能力
INT4/FP4更低精度推理数字会更大,但适用任务更窄

所以,看到一个千P集群,第一反应不要是“强不强”,而是补一句:千P@什么精度?

更严谨的写法应该像这样:

1
2
3
1000P@FP16 dense
1000P@FP16 sparse
1000P@FP8

少了精度和稀疏口径,这个P数就只讲了一半。

网络带宽决定这些卡能不能一起干活

训练集群的强弱,取决于GPU能不能像一个系统协同工作
训练集群的强弱,取决于GPU能不能像一个系统协同工作

大模型训练不是一张卡把自己的活干完就结束。训练过程中,GPU之间要不断同步参数、梯度、激活值和中间状态。模型越大,并行方式越复杂,通信压力越明显。

很多时候,训练卡住的地方不在“有没有卡”,而在“这些卡能不能像一个系统一样工作”。

可以先看三层网络。

层级典型案例公开带宽口径
节点内H100 SXM / DGX H100H100 SXM单GPU NVLink 900GB/s;DGX H100单机8张H100,通过NVSwitch互联
节点间DGX H100集群网络ConnectX-7支持400Gb/s InfiniBand或400GbE
集群级DGX H100 SuperPOD32台DGX H100、256张H100,NVLink Network跨256张GPU,双向带宽57.6TB/s

这张表里最容易被忽略的是单位。900GB/s和400Gb/s不是一个量级,也不是同一个位置的网络。前者是GPU节点内的高速互联,后者是节点间网络接口的典型口径。GB是字节,Gb是比特,1字节等于8比特。

训练为什么对网络这么敏感?

可以把一个训练step想象成一群人同时跑接力。每张GPU都在算自己那部分,但下一步开始前,经常要等所有人把数据同步完。只要有一张卡慢了,整个step就要等它。

工程里会把这种拖后腿的节点叫straggler。它可能来自网络拥塞、某条链路不稳、某台机器温度或故障、某个batch负载不均,也可能来自通信和计算没有重叠好。对训练集群来说,平均值好看还不够,尾部延迟很要命。

MoE模型会把这个问题放大。字节跳动和北京大学等作者在MegaScale-MoE论文里提到,他们训练一个内部MoE模型时,通信在前向传播中占总时间的43.6%,在整个训练过程中占32%。这不是所有模型的通用比例,但它说明了一件事:在大规模训练里,通信开销已经不是边角料。

所以,智算中心宣传高速网络时,读者可以多问几句:

  • 是节点内NVLink/NVSwitch,还是节点间InfiniBand/RoCE?
  • 交换网络是怎么组的,是否支持大规模多机多卡训练?
  • 标称400G、800G之后,压测出来的网络带宽实现率是多少?
  • 时延、丢包率、拥塞控制有没有指标?

国家数据局那份《算力算效衡量技术要求》征求意见稿里,把网络资源衡量拆成了带宽、时延、抖动、丢包率等指标,还明确提到要支持PCIe、NVLink、InfiniBand/RoCE等网络协议的衡量。另一份《算力中心能力评估要求》征求意见稿里,也把网络带宽实现率单独列为传输能力指标,计算方式是压测出的网络峰值速率除以网络带宽。

这套口径很工程化。不是看你宣传页写了多少G,而是看实际能跑出来多少。

有效训练能力,要看任务跑出来什么

峰值P数是规格书上的能力。训练任务真正拿到多少,要看有效算力。

这里可以借MLPerf Training的思路。MLPerf Training不是简单比较峰值FLOPS,它衡量的是系统把模型训练到目标质量所需要的墙钟时间。也就是从用户视角看:同样一个任务,多久能训练到合格结果。

这个口径比峰值P数更贴近实际。用户付钱买算力,最终关心的不是规格表上写了多少P,而是模型训练多久、成本多少、中间会不会频繁失败。

训练效率里还有一个常见指标,叫MFU,Model FLOPs Utilization,可以理解为模型训练实际完成的FLOPs占硬件理论峰值的比例。

MFU不等于nvidia-smi里看到的GPU利用率。

nvidia-smi里的GPU利用率,更多是在采样周期里有没有GPU kernel在跑。它显示90%,只能说明GPU很忙,不代表Tensor Core都在做高效的大模型训练。GPU可能忙在数据搬运、通信等待、非矩阵计算、低效kernel、显存访问、checkpoint,甚至各种调度和同步开销上。

一个智算中心如果只说“GPU利用率很高”,但不说明训练任务、模型规模、精度、batch size、token/s、step time、MFU、失败重试和通信开销,这个数字的信息量有限。

公开报道里也能看到这种反差。腾讯云张晋在2026年MWC上海相关演讲报道中提到,国内智算中心GPU平均利用率不足30%,并用“标称算力 × 效能系数 × 满载系数”来解释算力产出。钛媒体报道中也引用资料称,上半年国内已上线智算中心17亿卡时,实际使用5.6亿卡时,利用率32%,行业平均上架率不足60%。

这些是媒体报道和会议转述,统计口径不一定完全一致,不能当成全国统一结论。但它们指向同一个问题:卡买回来、机架建起来、P数写出来,只是第一步。真正难的是让这些卡长期、稳定、高效地跑真实任务。

普通人判断智算中心,看三个数字

判断智算中心是真强还是纸面强,看三个数字
判断智算中心是真强还是纸面强,看三个数字

如果不做采购、不做集群运维,读者没必要背所有硬件参数。判断一个智算中心是真强还是纸面强,可以抓三个数字。

第一个数字:P数的精度口径

问清楚它说的P是FP64、FP32、FP16/BF16、FP8,还是INT8、FP4。再问一句,这个数字有没有采用稀疏口径。

国家数据局《算力中心能力评估要求》征求意见稿里,计算能力本来就是分开看的:算力总规模按FP32折算,智能计算规模看FP16,超级计算规模看FP64,可调度计算规模又单独列出来。

这个分法很重要。一个中心可以有很大的总算力,但如果适合大模型训练的FP16/BF16资源不够,或者很多资源不能被统一调度,对大模型用户来说就没那么有用。

第二个数字:网络带宽实现率

只看400G、800G、NVLink不够。要看这些带宽发生在哪一层,实际压测能跑出多少,跨节点训练时有没有稳定低丢包,拓扑是不是适合大规模同步。

节点内高速互联很重要,节点间网络同样重要。一个8卡服务器内部跑得很好,不代表128卡、1024卡训练也能线性扩展。卡数越多,网络和调度越容易暴露问题。

第三个数字:真实任务的有效产出

最有价值的披露,不是“我们有多少P”,而是:

  • 某个模型训练到目标质量用了多久;
  • 单卡或集群token/s是多少;
  • MFU大概多少;
  • 任务失败率、重试率、checkpoint成本如何;
  • 可调度计算规模占总规模多少;
  • 资源负载率和满载时长如何。

《算力中心能力评估要求》征求意见稿里把“算力总规模”和“可调度计算规模”分开写,已经把这件事讲得很清楚:采购清单上的算力,和真正能纳入调度、稳定给用户用的算力,不是一回事。

一个披露样本:港科大广州HPC AI智算平台

正面例子可以看香港科技大学(广州)HPC AI智算平台的公开介绍。

它对HPC三期的披露不是只写“千P”,而是同时写了:

  • 2025年1月上线运行;
  • 18.933Pflops@FP64;
  • 1078.322Pflops@FP16;
  • 68个先进计算设备节点;
  • 400Gb/s RoCE v2网络协议;
  • 17PB分布式存储系统。

这份披露的价值不在于1078.322P这个数字特别漂亮,而在于它把精度口径、节点规模、网络协议、网络带宽、存储规模一起写出来了。

读者至少能知道,这里的千P是FP16半精度AI算力,不是FP64,也不是一个没说明精度的混合数字。还能继续追问:这些节点具体是什么芯片,训练任务实际吞吐怎样,跨节点扩展效率如何。

好的披露不是把所有问题都回答完,而是让外部读者知道该从哪里继续问。

几种常见宣传口径,怎么拆

看到“千P智算中心”,先问精度,问稀疏口径,问是否全量投产,问可调度规模。

看到“支持大模型训练”,问训练过什么规模的模型,有没有训练到目标质量的时间,有没有稳定性和故障恢复数据。

看到“高速网络”,问是节点内NVLink,还是节点间InfiniBand/RoCE。标称带宽是多少,压测实现率是多少,训练高峰时丢包率和尾部延迟怎样。

看到“国产化智算”,问芯片、通信库、训练框架、调度系统、模型适配分别到了哪一层。能跑demo和能稳定训练大模型,中间还有很长一段工程距离。

看到“绿色算力”,问PUE、单位功耗算力输出、绿电比例、液冷方案、负载率。空置的绿色机房,经济账也未必好看。

千P不是假数字,但它只是第一行

千P集群当然重要。它代表真实的资金投入、设备规模、机房工程和地方产业布局。没有这些硬件底座,大模型训练根本跑不起来。

但真正值钱的从来不是PPT上的千P,而是可用的千P。

下次再看到一个智算中心宣布自己有多少P,可以先不急着判断强不强。把三个问题问完:这个P是什么精度算出来的,卡之间怎么连起来的,真实任务跑出了多少有效算力。

能把这三件事摊开讲的智算中心,才算把算力从采购清单变成了生产力。

资料与数据来源

  • NVIDIA H100 Tensor Core GPU官方规格页:用于H100 SXM FP16/BF16、FP8、NVLink 900GB/s,以及稀疏技术脚注。https://wwwdev.nvidia.cn/data-center/h100/
  • NVIDIA DGX H100/H200 User Guide:用于DGX H100单机8张H100、NVSwitch、ConnectX-7网络模块等信息。https://docs.nvidia.com/dgx/dgxh100-user-guide/
  • NVIDIA ConnectX-7 Adapter Cards User Manual:用于ConnectX-7支持NDR 400Gb/s、400GbE等网络口径。https://networking-docs.nvidia.com/connectx7hw/introduction
  • NVIDIA Technical Blog, Upgrading Multi-GPU Interconnectivity with the Third-Generation NVIDIA NVSwitch:用于DGX H100 SuperPOD的32台DGX H100、256张H100、1 exaflop、57.6TB/s等案例。https://developer.nvidia.com/blog/upgrading-multi-gpu-interconnectivity-with-the-third-generation-nvidia-nvswitch/
  • MLCommons MLPerf Training官方页面:用于“训练到目标质量所需墙钟时间”的基准口径。https://mlperf.pw/benchmarks/training/index.html
  • 国家数据局《全国一体化算力网 算力算效衡量技术要求(征求意见稿)》:用于计算、网络、存储资源衡量指标。https://www.nda.gov.cn/sjj/ywpd/szkjyjcss/0608/ff808081-96b466bd-0197-4f0d710c-0731.pdf
  • 国家数据局《全国一体化算力网 算力中心能力评估要求(征求意见稿)》:用于FP32/FP16/FP64、可调度计算规模、网络带宽实现率、资源负载率等指标。https://www.nda.gov.cn/sjj/ywpd/szkjyjcss/0608/ff808081-96b465bf-0197-4f0dae39-0700.pdf
  • 香港科技大学(广州)HPC AI智算平台公开介绍:用于HPC三期1078.322Pflops@FP16、68个ACD节点、400Gb/s RoCE v2、17PB存储等披露样本。https://docs.hpc.hkust-gz.edu.cn/docs/intro/
  • MegaScale-MoE: Large-Scale Communication-Efficient Training of Mixture-of-Experts Models in Production:用于MoE训练通信占比、1440张NVIDIA Hopper GPU、1.41M tokens/s等论文数据。https://arxiv.org/abs/2505.11432
  • 腾讯云张晋2026年MWC上海演讲相关报道:用于行业GPU利用率不足30% 等会议转述。https://lmtw.com/mzw/content/detail/id/255725
  • 钛媒体《智算中心太“多”,大模型不够用了》:用于17亿卡时、5.6亿卡时、利用率32%、上架率不足60% 等媒体报道数据。https://m.thepaper.cn/newsDetail_forward_29400934

资料边界:国家数据局两份文件为征求意见稿,不等于已经正式生效的强制标准;腾讯云演讲和钛媒体数据属于公开报道与会议转述,统计口径和时间点可能不同,文中只作为行业现象参考。硬件规格、网络带宽和训练基准口径优先采用官方文档、标准组织页面和论文原文。