一个问题:昇腾910C到底能打H100的几成?
这个问题看着简单,实际很容易问偏。推理、小规模部署、大模型训练、千卡集群,根本不是同一场比赛。910C在每一场里的表现都不一样。
先把结论摆在前面:如果只看公开报道里的特定推理任务,可以谈6成左右的口径;如果看大模型训练和大规模集群,答案要保守得多;如果看FP8这类前沿训练能力,差距会更明显。
这篇文章不是要证明国产芯片行不行,而是想把一件事讲清楚:910C的价值不是无损替代H100,而是在AI基建很难稳定获得H100的现实里,提供一块可规模部署、可系统堆叠、可持续优化的算力底座。
一、纸面参数对比表,先把口径摆正
先看硬件规格。这张表只放最核心的几项,后面每一个结论都要能回到这里。
| 规格 | 昇腾910C | NVIDIA H100 SXM |
|---|---|---|
| FP16/BF16算力 | 约752-800 TFLOPS,来自Atlas 900 A3整机规格和CloudMatrix论文口径反推 | 约989.5 TFLOPS稠密;1,979 TFLOPS为稀疏口径 |
| FP8算力 | 公开权威资料未给出可直接对标的910C单卡FP8峰值 | 约1,979 TFLOPS稠密;3,958 TFLOPS为稀疏口径 |
| 片上内存容量 | 128GB,见Atlas 900 A3和CloudMatrix相关资料 | 80GB HBM3 |
| 片上内存带宽 | 最高约3.2TB/s,见Atlas 900 A3和CloudMatrix相关资料 | 3.35TB/s |
| 芯片/节点内互联 | Atlas 900 A3标注D2D双向784GB/s;CloudMatrix论文给出UB平面每NPU约392GB/s单向 | NVLink 900GB/s |
| 系统形态 | Atlas 900 A3最多384张NPU组成超节点 | HGX/DGX H100常见为8卡节点,并可通过NVLink/NVSwitch与InfiniBand扩展 |

这张表后面必须加三条提醒,不然很容易被数字带偏。
第一,H100的1979 TFLOPS和3958 TFLOPS不是稠密口径。NVIDIA官方规格表在这些Tensor Core峰值后面标了星号,说明是with sparsity,也就是带稀疏加速。要和没有明确稀疏口径的数据比较,H100的FP16/BF16稠密峰值应按约989.5 TFLOPS看,FP8稠密峰值应按约1979 TFLOPS看。
第二,910C的单卡数据目前最稳妥的公开来源,不是华为单独发布的一张芯片规格表,而是Atlas 900 A3、CloudMatrix384这类系统级资料。Atlas 900 A3官方页写的是384张NPU、48TB片上内存、片上内存带宽最高3.2TB/s、FP16总算力307.2/288.7 PFLOPS。按这个口径反推,单NPU大约是128GB片上内存、最高3.2TB/s带宽、约800/752 TFLOPS FP16算力。
第三,网上常见的96GB、1.8TB/s、HCCS 400GB/s等数字,有些来自分析机构、媒体或早期推断,有些可能对应不同板卡、不同可用容量或不同互联层级。它们不是完全没有参考价值,但不适合写成已经核实确认的统一官方规格。本文后面会尽量用公开来源更清楚的系统级数据,同时把推断和报道口径分开。
如果只看FP16稠密峰值,910C和H100的差距没有很多文章写得那么夸张;如果看FP8训练、生态成熟度和大规模集群效率,参数表又会显得太乐观。这就是这篇文章要展开的地方。
二、真实差距一:FP8,不只是一个数字
FP8是这轮AI芯片竞争里很关键的一项。它不是把精度从16位砍到8位这么简单,而是牵扯训练稳定性、损失缩放、算子实现、框架支持和模型配方。
H100的优势不只是官方表里有FP8峰值。NVIDIA把FP8做进了Hopper架构和Transformer Engine,再配上CUDA、cuDNN、NCCL、TensorRT-LLM、Megatron等工具链和训练经验,形成的是一整套能把低精度真正用起来的工程体系。低精度训练最怕的不是算力不够,而是数值不稳定、精度对不齐、训到一半才发现收益吃不到。
910C这一代公开资料里更确定的是FP16/BF16和INT8相关能力。华为在2025全联接大会上强调,从Ascend 950系列开始,会支持FP8、MXFP8、HiF8、MXFP4等更多低精度格式,并把互联带宽提升到2TB/s。这个信息很重要,但它不能直接算到910C头上。
也就是说,讨论910C时不能把950的路线图提前借过来。910C已经能承担很多推理和部分训练任务,但如果场景是追求极致效率的FP8大模型训练,H100仍然有明确优势。
三、真实差距二:互联,单卡接近不等于集群接近

AI训练不是一张卡跑满就结束。模型越大、并行策略越复杂,卡和卡之间的通信、同步、故障恢复就越重要。
H100的强项在于NVLink、NVSwitch、InfiniBand和Magnum IO这套组合已经跑了很多年。单节点内,H100 SXM的NVLink带宽是900GB/s。扩到多节点时,NVIDIA生态里还有成熟的网络、通信库、调度和调优经验。
910C这边的路线更像系统工程。华为的Atlas 900 A3通过灵衢高速互联,让384张NPU像一台逻辑计算机一样工作;CloudMatrix384论文进一步给出了384颗Ascend 910C、192颗鲲鹏CPU、统一总线网络的设计,把UB、RDMA、VPC三张网络分开处理不同流量。论文里还提到,每颗910C在UB平面可提供约392GB/s单向带宽,跨节点带宽下降不到3%,延迟增加小于1微秒。
这些数字说明华为确实在用超节点架构补互联短板,尤其适合MoE推理、KV Cache访问、Prefill和Decode拆分这类通信很重的服务场景。但这里要注意边界:CloudMatrix论文展示的是特定系统和特定推理框架下的结果,不能直接外推成所有训练场景都能接近H100集群,也不能说910C单卡互联已经追平H100。
更准确的说法是:H100强在成熟的通用集群范式,910C强在华为把硬件、CPU、NPU、总线、推理框架和云服务打包成一个系统后,可以在某些大模型推理场景里把效率做得很高。
四、真实差距三:生态,CUDA的优势不是一个API
CUDA的优势不是某一个API,也不是把代码里的函数名替换掉就能追平。真正难追的是CUDA、cuDNN、TensorRT、NCCL、PyTorch原生生态、调试工具、性能分析工具和开发者经验叠在一起的结果。
昇腾这边也不是空白。CANN承担底层算子和编译,MindSpore是框架层,MindSpeed做训练加速,MindIE做推理引擎,MindCluster做集群调度。华为在2025全联接大会上还明确说,CANN编译器和虚拟指令集接口会开放,其他软件会开源,Mind系列套件也会全面开源。
问题在于,生态不是发布一个版本就完成迁移。真正的成本在算子覆盖、精度对齐、性能调优、故障定位、长周期训练稳定性,以及团队有没有足够多踩坑经验。很多模型迁移到昇腾上可以跑起来,但要跑到接近硬件上限,仍然需要大量工程优化。
这也是为什么910C的推理表现可以在特定场景里给人惊喜,但训练场景更难用一个百分比说清楚。推理更容易针对模型和算子做专项优化,训练对稳定性、通信、框架和调参链路的要求更长。
五、所以,910C到底是H100的几成?

到这一步,几成这个问题要分层回答,不能用一个数字打发。
看FP16/BF16稠密峰值,910C大约可以达到H100的七成多到八成左右。这个算法是用910C约752-800 TFLOPS,对比H100稠密约989.5 TFLOPS。这里必须强调,不能拿H100带稀疏的1979 TFLOPS去比910C没有稀疏说明的数字,否则会把差距人为放大。
看FP8训练能力,910C不能简单按纸面几成算。H100有明确的FP8 Tensor Core峰值和Transformer Engine生态,910C这一代公开资料没有给出同等清晰、可直接对标的FP8单卡口径。FP8这块更适合写成H100明确领先,而不是硬凑一个百分比。
看公开报道里的特定推理任务,约6成左右这个说法可以引用,但要标明来源边界。Tom’s Hardware等媒体曾转述DeepSeek相关测试,称910C在推理任务中达到H100约60%的性能。这个数字对应具体模型、具体工程优化和具体测试条件,不能写成910C全面等于H100的六成。
看CloudMatrix384这类系统级推理方案,结论又会变得更复杂。论文展示的是超节点和推理框架一起优化后的效果,某些指标可以超过已发表的H100/H800系统结果。但这是系统级方案的胜利,不是单颗910C全面胜过H100。把这两件事混在一起,文章就会失真。
所以,更稳的结论是:910C是一颗已经能支撑国内大模型推理和部分训练需求的国产大算力芯片,但它不是H100的无损替代。单看FP16稠密峰值,它离H100并不远;看FP8、生态和通用大规模训练,它和H100仍有清晰差距;看华为超节点方案,它的真正竞争力来自系统工程,而不是单卡参数。
结尾:这不是一场单卡战争,而是一场基础设施战争
NVIDIA的强项,是单卡、互联、软件生态同时领先,三层叠在一起才是它真正的护城河。华为的强项,是国内可规模获得、超节点级别的系统组织能力,加上全栈持续投入。
未来中国AI算力竞争的核心,大概率不是某一代芯片能不能追平H100,而是国产算力能不能把硬件、互联、软件、模型优化、运维这几块磨合成一套可以持续迭代的系统。
910C最值得讨论的地方,也不是它到底有H100的几成,而是它让中国AI第一次可以在不完全依赖英伟达的条件下,认真讨论大模型算力的系统工程该怎么搭。
参考资料
- NVIDIA H100官方规格页,H100 SXM Tensor Core峰值、HBM容量、带宽、NVLink带宽及with sparsity说明:https://www.nvidia.com/en-us/data-center/h100/
- 华为企业业务Atlas 900 A3 SuperPoD官方页,384张NPU、48TB片上内存、FP16总算力、D2D互联、片上内存带宽等规格:https://e.huawei.com/cn/products/computing/ascend/atlas-900-a3-superpod
- 华为全联接大会2025徐直军演讲,Ascend 950/960/970路线图、FP8/MXFP8/HiF8支持、2TB/s互联、CANN与Mind系列开源计划:https://www.huawei.com/cn/news/2025/9/hc-xu-keynote-speech
- CloudMatrix384论文《Serving Large Language Models on Huawei CloudMatrix384》,384颗Ascend 910C、192颗Kunpeng CPU、UB/RDMA/VPC三平面、128GB片上内存、3.2TB/s带宽、推理评测等数据:https://www.researchgate.net/publication/392736927_Serving_Large_Language_Models_on_Huawei_CloudMatrix384
- Tom’s Hardware关于DeepSeek测试910C推理性能约为H100 60%的报道:https://www.tomshardware.com/tech-industry/artificial-intelligence/deepseek-research-suggests-huaweis-ascend-910c-delivers-60-percent-nvidia-h100-inference-performance
资料边界说明: H100数据以NVIDIA官方规格为准,并区分稠密与稀疏口径。910C单卡数据优先采用Atlas 900 A3和CloudMatrix384等公开系统级资料反推,不把未经官方统一确认的96GB/1.8TB/s等口径写成确定规格。涉及DeepSeek推理性能、CloudMatrix推理效率和950系列路线图的内容,分别按媒体报道、论文测试和厂商路线图处理,不混作同一层证据。