一、先讲一个今年最好的“芯模协同”案例

今年4月24日,DeepSeek发布V4系列(V4-Pro和V4-Flash),总参数1.6万亿,原生支持100万token上下文。这次发布有一个容易被忽略、但比跑分更重要的细节:昇腾实现了Day0适配——模型发布当天,昇腾超节点全系列产品就完成了支持验证。

更关键的是适配的深度。V4这一代的核心架构创新,是CSA(压缩稀疏注意力)与HCA(重度压缩注意力)的混合交错设计:CSA把每4个token的KV合并成1条再做稀疏筛选,HCA更激进,128:1压缩后直接做全量密集注意力,两种层在网络里隔层交替。配套的还有KV缓存混合精度存储、异构KV缓存管理这些工程细节。这不是“拿一个现成模型移植到另一块芯片上”,而是注意力机制的设计本身就考虑了目标硬件的计算与访存特性——DeepSeek官方文档也确认,细粒度专家并行(EP)方案同时在英伟达GPU和昇腾NPU上完成了验证。

CSA/HCA混合注意力与硬件协同
CSA/HCA混合注意力与硬件协同

再加上一个价格信号:DeepSeek官方明确表示,预计下半年昇腾950超节点批量上市后,V4-Pro的价格还会大幅下调——而在此之前,V4-Pro已经把75%的限时折扣转成了永久价格,输入$0.435/百万token、输出$0.87/百万token。芯片的量产节奏,直接写进了大模型的降价路线图。这就是2026年本届WAIC上被反复引用的“芯模协同”叙事的由来。

这个案例确实好。但正因为它太好了,在这一篇里做一件相反的事:给这个叙事踩一脚刹车,看看“能跑起来”和“生态护城河”之间,到底还隔着多少东西。

二、“生态协同”和“单纯能跑”,不是一回事

“单纯能跑” 指的是:模型权重能加载、算子能执行、推理结果数值正确、benchmark能出分。这件事的技术门槛真实存在,但它是一次性的、可以靠攻坚团队突击完成的。厂商发布会上的“完成适配”,绝大多数指的是这一层。

“生态协同” 指的是另一回事:主流框架原生支持、算子库覆盖长尾场景、编译器能自动优化而不是靠人肉调优、出了问题有工具能定位、社区里搜得到答案、第三方开发者愿意在没有厂商驻场支持的情况下自己把系统跑起来。这一层没有发布会,只有日复一日的issue、PR和版本迭代。

打个比方:前者相当于一辆车通过了出厂测试,后者相当于全国有加油站、有4S店、有二手市场、有路边随处能找到的修车铺。买车的人真正依赖的是后者,但发布会只会展示前者。

三、生态成熟度的批判性检验清单

如果你想判断一个算力生态到底走到了哪一步,媒体通稿帮不了你。下面这份清单是一个可用的检验框架,每一条都对应一个媒体很少报道、但工程团队天天面对的现实。

1. 推理适配 ≠ 后训练适配 ≠ 完整预训练

这是三件难度完全不同的事。推理适配只需要前向计算正确、吞吐达标,新闻里说的“已完成适配”绝大多数停在这一层。后训练适配的战线立刻拉长:LoRA微调、SFT、RLHF/DPO、模型量化、蒸馏、检查点格式转换——每一项背后都是一批工具链要重新适配,反向传播、优化器状态、混合精度全链路都不能出错。而完整预训练——几千甚至上万张卡、连续运行数周到数月、checkpoint稳定保存、通信不掉链、编译器和调度器不抽风、节点故障后还能恢复续训——是对整个软硬件栈的终极压力测试。“DeepSeek能在昇腾上跑推理”是事实,但它不等于“昇腾已经能扛起大模型的全生命周期”。V4本身的预训练在什么硬件上完成,官方技术报告里写得很清楚,这个信息差值得每个读者自己去核对,而不是从“适配成功”四个字里自行脑补。

2. CANN对CUDA:目前是“补课”,还不是“超越”

很多人把CUDA理解成一个开发工具,实际上它更像一整套AI操作系统:编译器、Runtime、驱动、算子库、数学库、通信库(NCCL)、Profiling与Debug工具,再加上庞大的第三方生态,共同构成了今天AI开发最成熟的软件平台。CANN是华为对标这套体系的异构计算架构,覆盖图编译、算子融合、内存优化、并行策略。客观地说,CANN这几年进步的斜率很陡。但要认清生态位关系:CUDA有近二十年的积累,全球几乎所有AI论文的参考实现默认写给它,PyTorch的每一个新特性第一时间在它上面验证。CANN目前做的大部分工作,本质是把CUDA生态里已经存在的能力补齐,让开发者迁移时少踩坑——这是必要且艰难的补课,但补课和超越是两个阶段,混为一谈对谁都没好处。

3. 框架适配深度、算子库完整度、编译器成熟度——开发者体验的核心,却几乎没人报道

通常我们看到的是“模型快不快”,而工程团队关心的是另一串问题:PyTorch支持是否完整、动态图有没有暗坑?算子库对主流模型结构覆盖良好,但碰到一个论文里的新算子、一个非标准的attention变体,是不是要自己写Ascend C算子?编译时间是否稳定,图编译器在偏离标准路径后的性能悬崖有多陡?OOM了能不能快速定位到是哪层、哪个张量?PyTorch在昇腾上的支持走的是torch_npu插件路线,而不是上游原生后端,这意味着版本跟随总有时间差。这些才是决定一个工程团队愿不愿意长期使用这套平台的核心,但它们无法浓缩成一条新闻标题,于是在公共讨论里近乎不存在。

4. 迁移成本:从英伟达搬到昇腾,工程团队要付出什么

一次真实的迁移,账单大致包括:环境与驱动栈重建、依赖库逐个排查替换、自定义算子重写、数值精度逐层对齐(同一个模型在两种硬件上输出不完全一致是常态,定位差异来源可能耗掉数周)、性能重新调优(在A卡上调好的并行策略在N卡上未必最优,反之亦然)、以及CI/CD和监控体系的重做。对一个中型团队,这不是“改几行代码”,而是以人月为单位的工程投入。厂商的迁移工具能覆盖多少比例,剩下的长尾要靠多少驻场工程师填,这才是采购决策里真正该问的问题。说到底,企业真正要算的从来不是采购价,而是未来三年的总体拥有成本(TCO)——这些迁移账单不会因为芯片便宜就自动消失,只有当迁移成本持续下降、生态摩擦持续减少,价格优势才能真正转化为规模化部署优势。这一点,正是第一篇TCO讨论在生态层面的延伸。

5. 看不见的软件基建:调试、稳定性、可观测性

profiler好不好用?训练到第37天集群里一块卡静默出错,能不能快速定位到是哪个节点、哪层通信?日志和监控指标的粒度够不够做根因分析?长时间运行的稳定性MTBF是多少?这些“看不见”的能力,恰恰是生态是否真正成熟的试金石——因为它们无法靠一次发布会攻坚补齐,只能靠大规模真实负载长年累月磨出来。CUDA生态里的Nsight、NCCL调试经验、无数StackOverflow问答,都是二十年真实故障喂出来的。这个过程没有捷径。

6. 一个容易被忽略的风险:低价的另一面是什么?

客户在享受“75%降价”和国产算力补贴红利的同时,值得冷静问一句: 我是否正在被绑定进一个相对封闭的技术栈? 如果两年后需要迁回,或者迁向第三种硬件,成本几何?当模型迁移困难、工具替换困难、开发接口差异越拉越大,新平台同样会形成新的锁定效应(Vendor Lock-in)——锁定从来不是靠合同条款实现的,而是靠迁移成本的自然堆积。开源兼容是这个问题的部分答案,但只是部分:开源降低了“理论上可迁移”的门槛,却不自动消除上面第4条列出的那些实际工程成本。开源是生态成长的必要条件,不是生态成熟的终点 ——能否持续维护、能否快速跟进主流框架、社区是否足够活跃、能否切实降低企业迁移成本,这四件事才是开源之后真正的考题。

能跑起来 ≠ 生态成熟
能跑起来 ≠ 生态成熟

三点五、两个可验证的背景事实

需要注意区分的是“这次WAIC的新进展”和“更早就存在、这次只是被反复提及的背景”。有两件事属于后者,容易被当成新料:

第一,CANN的开源不是WAIC的新闻。“CANN全面开源开放”早在2025年8月的昇腾生态大会上就已官宣。本届WAIC上它被反复提及,是作为既成事实的背景板,不是新进展。

第二,vLLM-Ascend是一个可以自己去看的观察对象。 它是GitHub上真实、持续更新的开源项目(vllm-project/vllm-ascend),有独立的安装文档、发布说明和中文社区支持;同类的还有torch_npu、MindSpore等。与其空泛地说“华为在做生态”,不如定期去看这些仓库:issue的响应速度、版本跟随上游主线的时间差、支持的模型列表增长曲线——生态成熟度不需要相信谁的判断,它是可以被持续观测的

四、换个视角:本届WAIC的Agent产品群像,在争夺什么?

把镜头从芯片层拉高,本届WAIC(7月17日—20日,上海,1100余家企业、超300款产品全球首发)最密集的火力,其实集中在另一个层面——调度层

扫一眼产品群像:努比亚发布了AI智能体手机(联合豆包),倪飞的表态很直白——AI手机的下半场要从“功能叠加”走向“原生智能体”;阶跃星辰拿出了全球首个智能体原生操作系统Step AOS,配套的智能体手机STEPX Neo拿了“镇馆之宝”;MiniMax展出了6月开源的M3——原生多模态、百万token上下文,配合MiniMax Code能直接完成编程和调研报告;百度这边,“芯云模体”全栈矩阵发布升级,通用智能体“百度搭子”同样入选“镇馆之宝”,主打自然语言下达任务后自主拆解、调用工具、一站式交付。

Agent调度层:AI时代的安卓/iOS 之争
Agent调度层:AI时代的安卓/iOS 之争

这些产品形态各异,但争的是同一个位置:未来竞争的不只是模型,而是谁来调度模型——那个理解用户意图、拆解任务、调度底层能力的入口。这个逻辑我们并不陌生——移动互联网时代,安卓和iOS真正建立优势,不是因为内核更先进,而是因为它们掌握了应用生态和开发者入口,硬件厂商再强也要按平台的规则玩。现在同样的剧本在AI上重演:芯片和模型是底层能力,但谁掌握了Agent调度层,谁就掌握了流量分发和价值分配的规则制定权。这也是为什么手机厂商、模型厂商、云厂商会同时挤进这条赛道。

五、Token经济:给“生态能力”一个可量化的商业指标

本届WAIC把“Token经济”列为核心议题之一,这是把前面所有讨论收拢到一起的那根线。

“Token正在成为AI商业的新语言”——这个判断值得认真对待。往下拆会发现,越来越多AI企业本质上在做同一件事:卖Token。算力厂商在卖Token(把单位Token的生产成本压到比客户自建更低,靠规模和降本获利),云平台在卖Token,大模型厂商无论表面上卖API还是卖订阅、本质也是在卖Token,Agent平台还是在卖Token。于是竞争焦点变得非常朴素:谁能更便宜地生产Token、谁能让市场消耗更多Token、谁能把Token消耗转化成实际收入

这就和第一篇讨论的TCO与单位Token成本接上了。生态能力听起来抽象,但它最终会沉淀为一个可以算的数字:同样一个模型、同样的服务质量,在你这套软硬件栈上,每百万token的全摊成本是多少? DeepSeek把V4-Pro压到输出$0.87/百万token并预告随昇腾950量产继续下调,就是在用价格公开宣示自己这套协同栈的单位Token成本曲线。生态成熟度的所有细节——算子效率、编译器优化、集群稳定性、故障率——最后都会算进这个数字里。Token单价,就是生态能力的财务报表。

单位Token成本构成瀑布图
单位Token成本构成瀑布图

六、结论:适配成功是起点,不是终点

回到标题的问题。

一个旗舰模型能在国产芯片上完成Day0适配,甚至在架构设计阶段就做了协同优化——这是真实的、值得肯定的进展,它证明这条路走得通。但“走得通”是生态建立的起点,不是终点。一颗优秀的芯片,可以解决算力问题;一个成熟的生态,才能解决产业问题。

真正的护城河要回答的是另一组问题:能不能规模化地跑?能不能低成本地跑?能不能在没有攻坚团队驻场的情况下,让千千万万普通开发者稳定地跑?推理之后能不能扛后训练、扛完整预训练?工具链、可观测性、社区这些看不见的基建,能不能经受住大规模真实负载的长期磨损?

CUDA的护城河不是某一次成功适配挖出来的,是二十年里无数开发者的时间沉淀出来的。国产生态要走的也是同一条路——没有捷径,但好消息是,这条路现在肉眼可见地有人在走,而且走的速度不慢。 我们要做的,是既不因为一次成功适配就宣布护城河已成,也不因为差距真实存在就否认斜率的意义。说到底,AI产业真正的护城河,从来不是一块芯片,而是一整套能够长期、低成本、稳定运转的系统工程。


资料来源

  1. DeepSeek-V4技术报告(官方,含CSA/HCA架构与预训练细节):https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf
  2. 《读懂DeepSeek V4技术报告(二):Hybrid Attention(CSA+HCA)》,知乎:https://zhuanlan.zhihu.com/p/2031146581542580917
  3. 《DeepSeek V4正式发布,昇腾超节点系列产品全面支持》,昇腾CANN开发者社区(Day0适配、芯模协同):https://cann.csdn.net/69eaff630a2f6a37c5a5cad4.html
  4. 《DeepSeek-V4昇腾首发|基于CANN的训推优化实践》,鲲鹏昇腾开发者社区(CANN全链路优化、950PR/DT整网方案):https://hwcomputing.csdn.net/69eb344254b52172bc6fc7fa.html
  5. DeepSeek V4发布报道(细粒度EP在英伟达GPU与昇腾NPU双验证;官方预告昇腾950超节点批量上市后V4-Pro价格下调),新浪科技:https://www.sina.cn/news/detail/5291558486413456.html
  6. 《DeepSeek V4 Pro永久降价75%:旗舰推理模型进入白菜价时代》,博客园($0.435/$0.87永久价、缓存命中价格):https://www.cnblogs.com/itech/p/20131311
  7. WAIC 2026前瞻报道(努比亚AI智能体手机、阶跃Agent操作系统、百度芯云模体、Token经济议题、300余款全球首发),智通财经/中财网:https://www.cfi.net.cn/newspage.aspx?id=20260713000158
  8. 《WAIC首日探展》,界面新闻(阶跃Step AOS、STEPX Neo获“镇馆之宝”、大会规模数据):https://finance.sina.cn/stock/jdts/2026-07-17/detail-iniickaz8201285.d.html
  9. 《2026 WAIC多款AI应用亮相“镇馆之宝”》,网易(百度搭子入选“镇馆之宝”、MiniMax M3多模态与百万上下文):https://www.163.com/dy/article/L22IL7QJ0511U82T.html
  10. vLLM-Ascend开源项目,GitHub:https://github.com/vllm-project/vllm-ascend
  11. “CANN全面开源开放”官宣于2025年8月昇腾计算产业发展峰会(背景事实,链接待补华为官方新闻稿)