上一篇说到,这次WAIC真正的信号不是某个数字漂不漂亮,而是“系统”能不能跑通。这一篇就从系列里分量最重的硬件说起——昇腾950超节点,7月17日真机首秀,展台前排的队伍绕了一圈,还拿下了大会Superior超越赛道的SAIL最高奖。
先把两个“Atlas 950”分清楚

写这篇之前,先得澄清一个容易混淆、而且第一版也没分清楚的地方:WAIC现场展出的真机,和华为路线图里讲的满配版本,根本不是同一个规模。
现场展出的昇腾950超节点,官方口径是“业界最大1024卡规模”:FP8算力1 EFLOPS,FP4算力2 EFLOPS,256TB全局统一内存编址空间,TB级NPU互联带宽,3微秒级RTT时延,走的是“灵衢互联协议”(也就是UnifiedBus)。需要说清楚的是,真机公开展示不等于已经实现大规模商业交付——目前能确认的是这套1024卡系统完整亮相并给出了这些技术指标,至于实际客户部署数量、长期运行稳定性、有效算力利用率和单位Token成本,还需要后续商业项目和第三方测试来验证,这里先按“WAIC 2026公开展示的1024卡配置”这个更准确的说法来称呼它,而不是直接说它是“当前已商用交付的版本”。
而华为此前在路线图里讲过的Atlas 950 SuperPoD满配版要大得多:8192颗昇腾950DT芯片,160个机柜(128个计算柜、32个互联柜),占地约1000平方米,FP8算力8 EFLOPS、FP4算力16 EFLOPS,整机内存1152TB,总互联带宽16PB/s,计划2026年第四季度上市。
| WAIC现场真机 | 路线图满配版 | |
|---|---|---|
| 规模 | 1024卡 | 8192卡 |
| FP8算力 | 1 EFLOPS | 8 EFLOPS |
| FP4算力 | 2 EFLOPS | 16 EFLOPS |
| 内存 | 256TB | 1152TB |
| 状态 | 已首秀,公开展示配置 | 路线图规划,2026 Q4上市 |
两者规模正好相差8倍,可以看作同一条技术路线下的两个系统规模,但不能混用参数,更不能把满配版的路线图数据直接写成WAIC现场真机的数据。后面所有对比英伟达的“6.7倍”“56.8倍”这类数字,说的都是满配版对NVL144,不是现场这台1024卡真机——这个区分如果不讲清楚,后面的分析就会站不住脚,这也正是很多参数稿容易写乱的地方。
对比英伟达:先弄清楚在跟谁比
“Atlas 950算力是英伟达NVL144的6.7倍”这个说法,最早来自华为2025年公布路线图时给出的对比,当时的完整说法是:总算力约6.7倍、内存容量约15倍、互联带宽约62倍。
| 对比对象 | 世代 | 规模 | 华为给出的说法 |
|---|---|---|---|
| NVL144 | 2025年路线图对比基线 | 144颗GPU/机架 | 满配版算力约为其6.7倍,内存约15倍,互联带宽约62倍 |
| NVL576(Rubin Ultra) | 下一代,预计2027年下半年上市 | 576颗GPU/机架,FP8训练5 EFLOPS | 满配版8 EFLOPS对比其5 EFLOPS,多项指标称保持优势 |

但这里有个值得注意的地方:“NVL144”这个名字,英伟达自己这一年也在往不同方向延伸。 2025年9月英伟达发布了专攻长上下文推理和视频生成的Rubin CPX,对应的机架级方案就叫“Vera Rubin NVL144 CPX”——单机架AI算力同样标称8 EFLOPS(NVFP4精度),配100TB高速内存,预计2026年底上市。也就是说,“NVL144”这个名字下面,英伟达自己这一年就有不止一种配置,华为2025年发布会上用来做基线的那个“NVL144”,不能不加说明地直接套到2026年所有叫这个名字的新配置上。产品代际、系统定位和精度口径都在变化,“6.7倍”更适合理解成一个特定时间点、特定对比对象、特定厂商口径下的路线图数字,而不是一句可以永久成立的结论。
精度、口径与一个不该轻易下的除法
第一个问题,是精度不能随便横向比。 FP8、FP4这类低精度格式,在不同厂商、不同芯片上的实现方式不完全一样,理论峰值(铭牌数字)和模型实际跑起来的有效吞吐,从来都是两回事。更严谨的表述应该是“按华为公布的系统规格口径,满配版峰值总算力约为其选定NVL144比较方案的6.7倍”,而不是“第三方测试证明Atlas 950比英伟达快6.7倍”——这两句话看着差不多,但严谨程度完全不同。
第二个问题,是“超节点”和“单机架”这两个统计单位本身不对等。 满配版Atlas 950 SuperPoD是可以跨160个机柜组网的超节点概念,NVL576描述的是单机架内的Scale-up方案,拿两者的总算力直接做除法,多少有点关公战秀才的意味。
第三个问题,是在这个系列第一版里犯过的一个错误,这次专门纠正一下。 原来的推导是:满配版用8192颗芯片,NVL144是144颗,芯片数量是56.8倍,但总算力只多出6.7倍,所以昇腾单芯片效率明显落后。这个除法看起来直观,但并不严谨——原因在于两边的“芯片”未必是同一层级的计算单元:一张加速卡可能对应一颗芯片,也可能包含多个计算Die;一个GPU封装本身也可能由多颗芯粒组成;再加上稀疏计算口径、低精度格式、功耗限制、产品定位都可能不同。8192除以144,只能说明系统内加速器数量存在差异,不能在缺少统一规格和实测数据的情况下,直接得出单芯片性能相差多少倍这个结论。要严谨比较单芯片能力,至少需要统一精度、稀疏口径、功耗范围、模型、Batch Size、上下文长度和有效算力定义——目前公开资料还不足以完成这样的比较。
这套数字真正想说明的,不是昇腾单芯片已经反超英伟达,而是华为在尝试证明:当单芯片能力暂时难以完全对齐时,可以通过互联、内存和系统架构,把更多芯片组织成一台逻辑计算机,用“系统规模”重新定义比较单位。
至于“领先两年”这个说法,也值得拆开看:满配版号称2026年Q4就能规模化交付,而Rubin Ultra要到2027年下半年才上市,这个时间差是真实的。但“领先”到底指产品可交付的时间、公开发布的时间,还是路线图规划的时间,三者混在一起讲,是发布会常见的话术陷阱。
系统工程,华为自己也是这么说的
现场工作人员被问到这次能拿下SAIL最高奖的原因时,给出的答案是“架构创新、系统工程,以及商用能力的超越和领先”——注意,这句话是华为自己讲的,不是媒体总结出来的角度。能支撑起1024卡规模、256TB统一内存编址的,核心是高密设计和光电互联这类“看起来不如EFLOPS好传播”的工程细节,而不是单颗芯片又快了多少。

这也不是华为第一次做超节点:上一代昇腾384超节点已经“商用落地750多套”,覆盖互联网、运营商、金融、教育、医疗、交通、制造等多个行业——950超节点不是从零起步的新故事,而是有真实商用基础的延续。
往技术里再拆一层:为什么芯片数量堆得越多,反而越考验互联和内存?大模型训练和推理正卡在两堵墙上。一堵是内存墙——芯片计算单元的速度增长很快,但数据从内存搬到计算单元的速度没有同步跟上,尤其在Decode阶段,系统要不断读取模型权重和KV Cache,计算单元可能没被占满,瓶颈反而出现在内存带宽。另一堵是通信墙——模型越大,需要参与计算的设备越多,设备间交换的数据也越多,如果互联带宽和时延跟不上,加芯片数量带来的收益会越来越低。Atlas 950真正想验证的,就是能不能用UnifiedBus、统一内存编址和光电互联,把大量芯片组织成一个效率可接受的计算域——这件事如果真能在实际业务里跑通,意义可能比某一代单芯片峰值性能更大。
比EFLOPS更该问的:真实代价是什么
峰值算力之外,一套系统能不能商业落地,还要看这些:
| 维度 | 需要关注的问题 |
|---|---|
| 功耗与供电 | 1024卡乃至8192卡规模的超节点,数据中心的电力和制冷能不能跟上 |
| 液冷散热 | 液冷已被行业称为“新建大型算力中心标配”,但方案成熟度和成本仍待验证 |
| 单位功耗产出 | 每瓦特能换来多少有效Token,而不是铭牌峰值 |
| 训练中断率 | 大规模集群实际能压到多低的中断率,恢复机制是否成熟 |
| 单位Token成本 | 真正有商业意义的算力,是能持续、稳定、低成本交付的Token,不是铭牌上的EFLOPS |
| 采购成本与TCO | 一次性采购价之外,五年总拥有成本(含电费、运维)才是客户真正要算的账 |
| 迁移与运维成本 | 客户从其他平台迁移过来之后,开发和维护成本会不会不降反升 |
华为目前公开了满配版的卡数、机柜数量、算力、内存和互联带宽,但尚未公布满载功耗、平均算力利用率、PUE、单位Token能耗和成本、长时间运行故障率这类能支撑起完整TCO比较的数据——在这些数据公开之前,不能仅凭8 EFLOPS或6.7倍,就判断哪套系统的经济性更好。这也是为什么“6.7倍算力”这类数字,只是这篇文章的开场白,而不是结论。
不止一代芯片:三年四芯与自研HBM
华为轮值董事长徐直军此前披露的路线图显示,这不是单点产品,而是一整条自研链路,而且按大模型推理的两个阶段分了工:Prefill阶段要一次性处理用户输入的大量Token,偏并行计算和高吞吐;Decode阶段要逐Token生成内容,对内存带宽、访问延迟和并发调度更敏感——把两种负载分开优化,是这份路线图背后的设计逻辑。
| 产品 | 时间 | 定位 |
|---|---|---|
| 昇腾950PR | 2026年Q1已推出 | 优化推理Prefill、推荐业务 |
| 昇腾950DT | 本次WAIC真机首秀 | 偏训练和Decode |
| 昇腾960 | 预计2027年Q4 | 下一代 |
| 昇腾970 | 时间待定 | 远期规划 |
更关键的是首次公布的两款自研HBM:HiBL 1.0(128GB、1.6TB/s,面向Prefill)和HiZQ 2.0(144GB、4TB/s,面向Decode/训练)。高带宽内存长期是国产芯片最卡脖子的一环,如果自研HBM能顺利量产,意味着“芯片—内存—互联—软件”这条链路在往自主可控的方向补齐,这比某一代芯片跑多快更能说明问题。
生态愿不愿意为它改架构
硬件之外,华为这次也在反复强调CANN异构计算架构已经开源,并适配openEuler、PyTorch、vLLM、Triton、TileLang、verl等主流开源项目和工具链,目标是降低开发者迁移门槛——但“支持某个框架”和“拥有成熟生态”不是一回事,这是“系统工程”里最容易被忽略、却决定硬件能不能真正落地的一层,下一篇会专门展开。
这里先说一个最直接的例子:DeepSeek-V4的官方技术报告首次同时验证了昇腾NPU和英伟达GPU两条路径,其中部分模型架构是针对昇腾推理协同设计的——新的注意力机制(HCA/CSA)、MoE量化方案、专家并行通信设计。这种深度适配比“能跑起来”难得多。直接体现在价格上:DeepSeek-V4-Pro的API价格永久下调到原价的四分之一;订单端,字节跳动被曝已经拿下昇腾950超节点近一半的产能。这两件事放在一起看,说明真机首秀这个时间点,Atlas 950背后已经站着愿意真金白银下注、也愿意为它改模型架构的客户。但“能运行”“经过优化”“形成成熟生态”是三个不同阶段,目前看到的更多是前两个阶段的进展,这个分寸下一篇细讲。
出海订单和出口管制的拉锯
昇腾950已经拿到韩国约2000片、马来西亚约3000台AI服务器的采购意向,俄罗斯、拉美地区也有批量采购动作。但几乎同一时间,美国商务部发布指导意见,认定昇腾910B、910C以及即将推出的910D违反出口管制,要求全球范围内禁止使用,个人和企业违规使用最高面临刑事指控(此前合法采购的原始昇腾910不受影响)。芯片能不能真正在海外站稳脚跟,这层博弈比参数本身更复杂,后面治理篇会专门展开。
不止华为一家在打这场仗
这次同台亮相的国产芯片阵营,比想象中更大:
| 企业 | 这次带来的产品 |
|---|---|
| 阿里 | 真武M890×磐久AL128超节点,首次公开展示 |
| 东方算芯 | 首发DF1000芯片 |
| 中兴 | 联合多家国产厂商推出Matrix超节点 |
| 壁仞科技 | 新品同台展示 |
| 沐曦股份 | 新品同台展示 |
十余家企业同时把“超节点”级别产品摆上台面,液冷也被明确称为“新建大型算力中心标配”。华泰证券把2026年定义为“国产超节点元年”,预测2028年国内市场规模3414亿元,年复合增速194%。
(以下产业链梳理仅为公开报道整理,不构成投资建议。)这波真机首秀也带火了一批A股“概念股”,包括光模块(中际旭创、华工科技)、高速连接器(华丰科技、航天电器、意华股份)、液冷散热(高澜股份、川润股份)、服务器整机(紫光股份、浪潮信息、华勤技术)等,资金关注的已经不是昇腾这一个点,而是一整条协同产业链能不能跑起来。
Atlas 950的优势和风险
把前面这些信息收一收,基于目前公开信息,优势主要在三点:系统规模足够大,1024卡公开展示加8192卡路线图,说明华为在尝试构建超大规模统一互联域;强调自主系统链路,从芯片、灵衢互联、内存到CANN软件栈,正在补齐完整的AI基础设施链条;也适合国内在高端GPU供应受限背景下,对可持续获得的国产计算平台的真实需求。
风险同样清晰:峰值指标目前主要来自厂商披露,独立第三方基准测试还没跟上;满配系统仍停留在路线图阶段,能否按期交付、交付多少、运行效果如何都待观察;系统成本尚不透明,功耗、散热、机房改造、维护和软件迁移都会影响真实的总拥有成本;软件生态仍是长期任务,CUDA的优势积累了近二十年,不是一次真机首秀能补齐的;系统规模越大,故障管理和任务恢复的复杂度也会被放大。
真正值得盯的,不是这场发布会说了什么,而是接下来几个月:1024卡到8192卡的满配版能不能如期在Q4批量交付、自研HBM能不能量产、除了字节还有多少大厂愿意迁移核心业务。这几个问题的答案,比任何一次真机首秀都更接近真相。国产算力真正的分水岭,不是“能不能替代”,而是能不能做到“值得使用”——也就是能不能稳定、经济地把这套系统变成持续的Token产出。
下一篇转到软件这一侧:DeepSeek和昇腾的协同适配,是不是就等于国产AI生态已经跑通了。
参考资料
- 华为昇腾950超节点真机首次公开亮相,昇腾384超节点已商用落地750多套 - IT之家
- WAIC上的算力重器:华为昇腾950超节点真机现身 - 新浪财经
- 华为昇腾950超节点亮相:1024卡,FP4算力2EFLOPS!- 电子工程专辑
- WAIC2026探展|斩获大会SAIL最高奖的昇腾950超节点真机首次亮相引爆会场 - 网易
- 华为昇腾950超节点真机首次公开亮相!业界最大1024卡规模 - 金融界
- Huawei Atlas 950 SuperPoD claims 6.7x more computing power than Nvidia NVL144 - Huawei Central
- NVIDIA Unveils Rubin CPX: A New Class of GPU Designed for Massive-Context Inference - NVIDIA Newsroom
- 英伟达突然发布新GPU!单机架AI性能暴涨6500%,100TB大内存,专攻长上下文推理 - 与非网
- Nvidia’s Rubin Ultra NVL576 rack expected to be 600kW, coming second half of 2027 - Data Center Dynamics
资料边界说明: 本文涉及的Atlas 950及满配版规格主要来自华为公开披露,属于产品规格和路线图信息,不等同于独立第三方性能测试;英伟达NVL144、NVL144 CPX、NVL576/Rubin Ultra相关数据同样来自厂商公开披露。涉及尚未正式交付的产品,最终规格、上市时间和实际性能都可能发生变化。