理解Atlas 950的“6.7倍算力”:它说明了什么,又没有说明什么

上一篇说到,这次WAIC真正的信号不是某个数字漂不漂亮,而是“系统”能不能跑通。这一篇就从系列里分量最重的硬件说起——昇腾950超节点,7月17日真机首秀,展台前排的队伍绕了一圈,还拿下了大会Superior超越赛道的SAIL最高奖。 先把两个“Atlas 950”分清楚 1024卡展示配置 vs 8192卡路线图 写这篇之前,先得澄清一个容易混淆、而且第一版也没分清楚的地方:WAIC现场展出的真机,和华为路线图里讲的满配版本,根本不是同一个规模。 现场展出的昇腾950超节点,官方口径是“业界最大1024卡规模”:FP8算力1 EFLOPS,FP4算力2 EFLOPS,256TB全局统一内存编址空间,TB级NPU互联带宽,3微秒级RTT时延,走的是“灵衢互联协议”(也就是UnifiedBus)。需要说清楚的是,真机公开展示不等于已经实现大规模商业交付——目前能确认的是这套1024卡系统完整亮相并给出了这些技术指标,至于实际客户部署数量、长期运行稳定性、有效算力利用率和单位Token成本,还需要后续商业项目和第三方测试来验证,这里先按“WAIC 2026公开展示的1024卡配置”这个更准确的说法来称呼它,而不是直接说它是“当前已商用交付的版本”。 而华为此前在路线图里讲过的Atlas 950 SuperPoD满配版要大得多:8192颗昇腾950DT芯片,160个机柜(128个计算柜、32个互联柜),占地约1000平方米,FP8算力8 EFLOPS、FP4算力16 EFLOPS,整机内存1152TB,总互联带宽16PB/s,计划2026年第四季度上市。 WAIC现场真机 路线图满配版 规模 1024卡 8192卡 FP8算力 1 EFLOPS 8 EFLOPS FP4算力 2 EFLOPS 16 EFLOPS 内存 256TB 1152TB 状态 已首秀,公开展示配置 路线图规划,2026 Q4上市 两者规模正好相差8倍,可以看作同一条技术路线下的两个系统规模,但不能混用参数,更不能把满配版的路线图数据直接写成WAIC现场真机的数据。后面所有对比英伟达的“6.7倍”“56.8倍”这类数字,说的都是满配版对NVL144,不是现场这台1024卡真机——这个区分如果不讲清楚,后面的分析就会站不住脚,这也正是很多参数稿容易写乱的地方。 对比英伟达:先弄清楚在跟谁比 “Atlas 950算力是英伟达NVL144的6.7倍”这个说法,最早来自华为2025年公布路线图时给出的对比,当时的完整说法是:总算力约6.7倍、内存容量约15倍、互联带宽约62倍。 对比对象 世代 规模 华为给出的说法 NVL144 2025年路线图对比基线 144颗GPU/机架 满配版算力约为其6.7倍,内存约15倍,互联带宽约62倍 NVL576(Rubin Ultra) 下一代,预计2027年下半年上市 576颗GPU/机架,FP8训练5 EFLOPS 满配版8 EFLOPS对比其5 EFLOPS,多项指标称保持优势 为什么6.7倍不能直接理解成芯片快6.7倍 但这里有个值得注意的地方:“NVL144”这个名字,英伟达自己这一年也在往不同方向延伸。 2025年9月英伟达发布了专攻长上下文推理和视频生成的Rubin CPX,对应的机架级方案就叫“Vera Rubin NVL144 CPX”——单机架AI算力同样标称8 EFLOPS(NVFP4精度),配100TB高速内存,预计2026年底上市。也就是说,“NVL144”这个名字下面,英伟达自己这一年就有不止一种配置,华为2025年发布会上用来做基线的那个“NVL144”,不能不加说明地直接套到2026年所有叫这个名字的新配置上。产品代际、系统定位和精度口径都在变化,“6.7倍”更适合理解成一个特定时间点、特定对比对象、特定厂商口径下的路线图数字,而不是一句可以永久成立的结论。 精度、口径与一个不该轻易下的除法 第一个问题,是精度不能随便横向比。 FP8、FP4这类低精度格式,在不同厂商、不同芯片上的实现方式不完全一样,理论峰值(铭牌数字)和模型实际跑起来的有效吞吐,从来都是两回事。更严谨的表述应该是“按华为公布的系统规格口径,满配版峰值总算力约为其选定NVL144比较方案的6.7倍”,而不是“第三方测试证明Atlas 950比英伟达快6.7倍”——这两句话看着差不多,但严谨程度完全不同。 ...

WAIC 2026最大的信号:AI竞争不再只看芯片,而是看系统

从Atlas 950真机首秀说起,整理这届WAIC里芯片、生态、机器人、治理、资本五条线为什么会在同一周里集中爆发,以及接下来这个系列打算怎么拆。 现场两个画面 常说“这届WAIC参展企业创纪录、展品超过3000件”,但这类描述读完基本等于没读——真正值得记下来的信号是什么呢? Atlas 950 SuperPoD集群(图片来自网络) 7月17日上午,上海世博展览馆华为展台前排起了长队,大家排队不是为了摸新手机,是为了看一台线缆密布、占地极大的“大家伙”——Atlas 950 SuperPoD,第一次以真机形态出现。往展馆深处走,具身智能馆更热闹,314件机器人展品挤在一起,有的在拧螺丝,有的在叠衣服,有的干脆站着一动不动等观众合影。 这两个画面单拎出来,都能写成一条“国产黑科技又上新”的热搜。但连起来看,会得到一个更值得记住的判断: 真正决定胜负的,不再是某一项技术有没有反超,而是能不能把硬件、供应链、软件生态、机器人量产、全球化部署、规则制定权拧成一套跑得通的系统。 会期里几家媒体不约而同的判断 这不是自己脑补的角度。会期这几天转下来,把几家平时报道立场都不太一样的媒体判断整理了一下: 澎湃新闻:标题直接是《告别参数竞赛,AI全链路商业化》,文章里把“集群协同调度、软硬件一体化适配、全生命周期成本控制”列为新的竞争壁垒,单卡参数不再是唯一门槛。 第一财经:把国产算力的这次转折定义为“迈入系统时代”,原话是“决定AI系统能力的关键因素,正从单颗芯片性能逐渐转向整个计算系统的组织效率”。 钛媒体:总结的“六个趋势”里第一条就写着——“‘最强模型’不再是唯一赢家,竞争重心已从参数规模转向如何把模型整合进完整产品体系”。 网易科技:干脆用了“国产算力告别单打,生态组队加速落地”这样的标题,把“单打”和“组队”直接对立起来。 四家媒体报道立场、擅长的领域都不太一样,却在同一周里几乎异口同声,说明这不是哪家媒体的一家之言,而是这届大会自己“长”出来的共识。 “系统”拆开是哪五层 拆开看,“系统”具体是五层叠在一起,每一层都对应着这次会场上一个具体的例子: AI竞争的五层系统 第一层,芯片本身够不够快。 这是最容易被拿来做标题的一层——“8 EFLOPS”“6.7倍算力”这类数字,但恰恰是最容易掺水、也最不该单独拿出来看的一层。 第二层,能不能把几千颗芯片高效互联成一台“大计算机”。 华为这次的说法是8192颗昇腾950DT芯片通过UnifiedBus 2.0连成一个逻辑统一体,但芯片数量堆得越多,互联架构跟不上,理论峰值和实际吞吐之间的差距只会越拉越大。 华为昇腾950超节点(图片来自网络) 第三层,有没有软件生态和大模型愿意为它专门改架构。 DeepSeek-V4的技术报告里提到部分模型架构是“针对昇腾推理协同设计”的,这种深度适配比单纯“能跑起来”难得多,也是这一层真正的门槛。 第四层,机器人这类硬件产品能不能从展会演示走到工厂真交付。 具身智能馆里314件展品看着热闹,但全行业2744家具身智能企业里,这次真正参展的只有200家,能拿到真实市场流量的更是只有个位数——门槛在这一层体现得最直接。 第五层,能不能把订单和规则谈到海外去,又不撞上出口管制这堵墙。 昇腾950这次拿到了韩国、马来西亚等地的采购意向,但美国商务部同一时间发布指导意见,认定昇腾910B/910C/910D违反出口管制、全球范围禁止使用——这一层已经不只是技术问题。 任何一层掉链子,前面攒的优势都可能白费,这也是“系统”这个词比“参数”更适合形容这次WAIC的原因。 系列地图:接下来六篇分别讲什么 接下来这个系列,就沿着这五层往下拆,一篇看一个维度: 篇目 核心问题 硬件篇 Atlas 950的参数该怎么看,“6.7倍算力”背后藏着什么口径问题 生态篇 DeepSeek和昇腾的协同适配,是不是等于国产生态已经跑通 机器人篇 从“演示”到“量产”,为什么这个赛道正迅速分化成极少数头部玩家 治理篇 中国牵头成立的WAICO,为什么是“全球首个AI政府间国际组织”这么重的分量 资本篇 二级市场这波“概念股”行情,钱到底在为什么投票 收官篇 给国产算力路线出五道题,作为未来一年的验证清单 WAIC 2026系列地图 为什么是现在写 之所以是现在写,是因为这几条线这次第一次挤在同一个时间点集中爆发。光是芯片这一层,同台亮相的就不止华为一家: 企业 这次带来的产品 华为 Atlas 950 SuperPoD,8192颗昇腾950DT芯片真机首秀 阿里 真武M890×磐久AL128超节点,首次公开展示 东方算芯 首发DF1000芯片 中兴 联合多家国产厂商推出Matrix超节点 壁仞科技 新品同台展示 沐曦股份 新品同台展示 十余家企业同时把“超节点”级别的产品摆上台面,华泰证券干脆把2026年定义为“国产超节点元年”。与此同时,DeepSeek和字节跳动的适配、锁单消息几乎同步曝出;机器人企业一边宣布量产下线,一边被曝出行业头部效应加剧;中国牵头成立的世界人工智能合作组织(WAICO)又把这一切拉高到了国家层面的博弈——这些信号单看都不算新鲜,但同时挤在一周之内发生,就值得多写几篇,慢慢拆。 ...

xAI开源Grok Build,代码里的codex/opencode血统藏不住

7月15日,xAI 把 Grok Build(也就是 grok 命令行工具)的源码放到了 GitHub 上,仓库地址 xai-org/grok-build。README 第一句话说得很直接:“SpaceXAI’s coding agent harness and TUI”——xAI 内部把这套东西挂在 SpaceXAI 名下。 这篇文章不打算复述“xAI 又开源了什么”这种通稿式的内容,而是把仓库拆开看:代码从哪来、架构怎么分层、这次开源发生在什么时间点、以及“开源”这两个字在这里到底是什么意思。 一、代码溯源:codex 和 opencode 的血在这里 仓库根目录的 THIRD-PARTY-NOTICES 文件里有一句话写得很清楚:这个仓库包含 “in-tree source ports”,明确点名了 openai/codex 和 sst/opencode 的工具实现。更具体的说明放在 crates/codegen/xai-grok-tools/THIRD_PARTY_NOTICES.md 里——这是给 codex 和 opencode 移植代码专门写的一份notice,里面附带了完整的许可证文本和 Apache 协议 §4(b) 要求的“变更声明”。 Apache 2.0 的 §4(b) 条款要求:如果你修改了一份 Apache 许可的文件,必须在文件里注明“这份文件被修改过”。换句话说,xAI 不是简单引用了这两个项目的接口或者协议,而是直接拿了源码进来改,改完之后按协议要求留了痕迹。 这一点值得说清楚的是它的性质——这不是抄袭,因为 codex 和 opencode 本身也是开源项目,License 允许这么做;但它说明一件事:xAI 在 agent 的“工具层”(terminal 执行、文件编辑、代码搜索这些具体能力)上,没有从零设计,而是站在两个已经跑通的开源实现上做二次开发。这是效率选择,不是能力缺陷,但也说明 coding agent 这个赛道走到今天,底层工具调用的实现已经开始趋同——大家在复用相近的工具层模式,只是壳不一样。 如果想验证到底改了多少,值得做的事情是把 xai-grok-tools crate 里的具体文件和 codex/opencode 对应源文件拉出来做 diff,而不是只看 NOTICE 文件的自述。我实际 clone 了三个仓库做了一遍: ...

KV Cache:每读1个token,就要交一笔“显存税”

本文是「术语解构」系列之一。上一篇《上下文窗口:标称 1M 的 token,为什么 32K 就开始变笨》讲了模型“读不进去”的问题,结尾留了:KV Cache 出场一次,就吃掉了 64GB 显存。这一篇兑现承诺,拆这张“草稿纸”。 先纠正上一篇的一个数字。当时写的是:一个32B模型在1M上下文满载时,仅KV Cache就需要64GB以上显存。 在这篇中把公式摆出来,你会发现“以上”两个字有多克制——按Qwen3-32B的公开架构参数算,是256GB。 一台24GB的MBP,别说1M,把上下文开到128K,光这张草稿纸就要32GB,模型本体还没算,机器已经装不下了。 这就是本地部署时候都遇到过的两个现象的共同根源:上下文长度往大调,内存肉眼可见地飙升;对话越聊越长,生成越来越慢。 今天来看:KV Cache到底是什么、这笔显存账怎么算、以及行业和你各自能拿它怎么办。 一、KV Cache是什么:不是优化技巧,是生成机制本身 没有 KV Cache 时,每生成一个 token 都要重算全部前文;有 KV Cache 时,把 K/V 草稿纸存下来复用。 之前在显存篇讲过大模型推理分两个阶段:Prefill(把你的输入一次性读完)和Decode(一个token一个token地往外吐)。 问题出在Decode阶段。当Transformer生成每一个新token时,都要通过注意力机制“回看”前面所有的token。而回看的原材料,是每个token在每一层算出来的两组向量:K(Key)和V(Value)。 现在做一道选择题。生成第1000个token时,前面999个token的K和V从哪来? 方案A:现算。把前文999个token从头再过一遍模型。生成下一个token时,再过一遍1000个。每个字都要重算全部前文——计算量随长度平方增长,长对话会慢到不可用。 方案B:存下来。第一次算出来的K和V留在显存里,之后每个新token直接查表。代价是:这些向量得一直占着显存。 方案B就是KV Cache。它不是某种可开可关的“缓存加速”,而是所有主流推理框架的默认工作方式——没有它,长文本生成在算力上根本不成立。 所以KV Cache的本质一句话就能说清:拿显存换算力。草稿纸这个比喻的准确之处在于——你可以不打草稿,但那样每一步都得心算全部前文;打草稿快得多,只是纸会越用越厚。 它和模型权重还有一个关键区别:权重一次加载、所有请求共用一份;KV Cache 是每个会话、每段上下文各有一份,而且随长度一路长大。这个区别,是理解后面所有账目的钥匙。 二、算一笔明细账:显存税的税率是多少 KV Cache 显存占用:随上下文线性膨胀,与内容无关 这笔账有公式,而且不难: 每个token的KV Cache=2(K和V两份)× 层数 × KV 头数 × 每头维度 × 每参数字节数 拿两个公开架构参数的模型代进去(FP16 精度,每参数 2 字节): ...

AI干完了853个人的活,为什么签字的还得是人?

最近把2024到2026年这三年里,AI直接面对客户的新闻放在一起看,发现了一个很有意思的矛盾。 一边,AI已经在真实商业场景里大规模直接服务客户了。Klarna的AI客服上线30天处理了230万次对话,相当于700名全职客服的工作量;到2025年三季度,这个数字涨到了853人,每年节省约6000万美元。京东的数据显示,2026年一季度数字人累计服务商家突破7万家,头部商家的数字人开播率达到80%。 另一边,监管在同一时间段里连续画出硬红线。国家卫健委明确规定,严禁使用人工智能自动生成处方;2026年5月,国家药监局发布《处方药网络零售合规指南》,严禁AI替代药师审方;2026年2月1日施行的《直播电商监督管理办法》规定,AI数字人直播如果出现违法违规行为,由直播间运营者承担全部责任。 同样是AI,为什么一边可以直接面对几百万客户,另一边连一张处方单都不能碰? 这三年的案例和法规拼在一起,答案已经很清楚了:决定AI能不能直接商用的,从来不是它的能力够不够强,而是它出错之后,责任能不能找到人。 而“签字”,就是责任找到人的那个动作。 一、签字的本质:不是流程,是责任的锚点 AI说错话,责任仍然回到公司和签字人 商业合同、审计报告、诊断书、处方单,这些东西的本质是确定性承诺——签字的那个人在声明:“我为此负责,出了错你可以来找我。”换句话说,签字从来不是在声明“这是我亲手做的”,而是在声明“我审过,我认可,我愿意承担后果”。 而大语言模型是一个概率系统。它的每一次输出都是概率采样的结果,哪怕做到99%的准确率,放到日均一万次调用的场景里,就是每天100次错误。错误率可以用工程手段压低,但永远不会归零。 所以真正的问题从来不是“如何消灭错误”,而是“错误发生的时候,责任流向哪里”。 来看三个案例: 案例一:加拿大航空,812加元。2024年2月,加航官网的聊天机器人向一位乘客错误承诺了丧亲票价可以事后退款。乘客索赔,加航的辩护理由堪称经典:聊天机器人是一个“独立实体”,应该为自己的话负责。不列颠哥伦比亚省民事仲裁庭直接驳回,判加航赔偿约812加元。金额很小,但它确立了一个原则:AI说的话,在法律上就是公司说的话。 案例二:纽约律师,5000美元。2023年,两名律师用ChatGPT写诉状,引用了6个不存在的判例,被纽约南区法院罚款5000美元。注意被罚的是谁——是签字提交诉状的律师,不是OpenAI。签字的人兜底,这正是签字制度在正常运转。 案例三:德勤澳大利亚,44万澳元。2025年7月,德勤给澳大利亚就业与劳资关系部交付了一份约44万澳元的报告;8月,悉尼大学学者发现其中含有AI编造的学术引用和一段虚构的联邦法院判词;德勤在修订版中承认制作过程使用了AzureOpenAIGPT-4o,并在10月确认退还尾款。这个案例最有价值的地方在于:连四大会计师事务所的多层审核体系都会失守,而失守之后,承担金钱和商誉损失的,仍然是德勤这个法人——不是模型。 三个案例,三个不同的行业,同一个结论:AI可以生成99%的工作量,但那1%出错时的责任,无法转移给一个没有法律人格、没有资产、无法被惩罚的系统。 二、Klarna的完整弧线:AI直接面客的天花板在哪里 Klarna是最值得完整讲的案例,因为它在两年半里,把“激进上线”和“翻车回调”两章都演完了。 上半场,效率神话。2024年2月,Klarna上线与OpenAI合作开发的AI客服。30天内处理230万次对话,自动化了67%的客户对话,问题解决时长从11分钟降到2分钟以内,客户满意度与真人客服持平。效率数字后来还在涨:到2025年三季度,AI承担的工作量相当于853名客服,年节省约6000万美元,NPS达到73。 下半场,公开回调。2025年5月,Klarna宣布重新招聘真人客服。CEO公开承认,成本驱动的自动化带来了“更低的质量”,并承诺客户“想找真人时,永远能找到真人”。原因有三条:复杂争议、欺诈申诉、困难客户案例上,AI的解决质量明显下降;模型偶尔会对费率、政策、付款条款给出自信但错误的回答——在金融行业,关于钱的错误回答是合规问题,不只是满意度问题;而当初“替代700人”的说法本身也有水分——那是增长期避免新招的人数,不是裁掉的人数。 行业事后复盘时指出了一个关键点:Klarna的场景几乎是AI最容易吃下的客服负载——结构化数据、已认证的用户、有限且高频的意图集合。把它的成功直接推广到复杂B2B支持、医疗服务或保险理赔,是范畴错误。 Klarna不是孤例。Gartner预测,到2027年,50%原本计划大幅削减客服人力的组织将放弃该计划。2026年的行业标准已经收敛成一个混合模型:AI处理70%到85%的量,人处理最难的15%到30%。Klarna自己也承认,约30%的工单仍然要转到人工。换个说法:成熟的AI商用,不是把人拿掉,而是把人挪到更关键的位置——AI处理高频,人处理例外、争议和判断。 从这些案例里,可以提炼出适合AI直接面客的五个特征:高频低风险、意图有限、数据结构化、错误可逆、有人工兜底。订单查询错了可以重查,退款发错了可以撤销——错误可逆,所以AI可以直接上。 还有一条反直觉但重要的工程结论:在受监管的场景里,50%自动化率配98%准确率,好过75%自动化率配90%准确率。正确的做法是按风险给问题分层,只对低风险层全自动,而不是追求一个漂亮的总自动化率。 但请注意,即使在Klarna这种“成功”场景里,责任一秒钟都没有转移给AI。AI说错了费率,赔钱的是Klarna;直播新规写得更直白——AI数字人违规,运营者担全责。 所以严格来说,“AI直接商用”这个说法本身就不成立——真实存在的是:AI直接交付,法人直接担责。 三、一条光谱:什么决定AI能站多靠前 AI面客的风险光谱 把所有场景排在一条光谱上,规律就出来了。 光谱左端,完全放开:订单查询、物流跟踪、夜间数字人直播讲解。特征是单次错误的责任成本接近零——说错了重说,发错了重发。 光谱中间,混合模式:Klarna式的分层路由。AI吃下高频简单问题,低置信度和高风险问题带着上下文转人工。这是2026年绝大多数商业场景的现实形态。 光谱右端,绝对禁区:处方、审方、诊疗决策、高风险金融决策。中国的监管在这一端写得非常具体——医师本人接诊、处方由接诊医师本人开具、审方必须由药师完成。欧盟AIAct也把生物识别、关键基础设施、教育、就业、信贷评分等列为高风险,核心义务就是人工监督(humanoversight)。 《处方药网络零售合规指南》里还有一个容易被忽略的细节:除了严禁AI替代审方,它还要求“审方数量控制在合理范围”。这半句话堵住了最后一个漏洞——名义上人签字、实际上人只是橡皮图章。一个药师一天“审核”一万张处方,那个签字就是假的。监管要的不是签字这个动作,是签字背后真实发生的审查。 决定一个场景落在光谱哪个位置的变量,只有一个:单次错误的责任成本。查错一个订单,成本是几分钟;审错一张处方,成本可能是一条命。责任成本越高的场景,人的签字就越不可替代。 落到操作层面,这条光谱可以压缩成一个三分法:低风险任务,AI自动做;中风险任务,AI先做、人来确认;高风险任务,AI只能辅助,最终决定必须由人做出。再具体一点:凡是咨询、查询、解释、预约、状态更新,可以大胆交给AI;凡是诊断、裁决、承诺、授权、处罚、拒赔、拒贷、录取、解雇,最后都必须有一个人签字负责。 四、两种造假:当署名和能力对不上号 两种AI造假:遥控与包壳 理解了“能力、署名、责任必须对齐”这个框架,就能看穿当下AI行业的两种典型造假——它们正好是同一枚硬币的两面。 在讲造假之前,先说一种更普遍、更隐蔽的姿态:不愿讲清楚边界。很多AI产品的问题不是能力不够,而是宣传和免责各说一套——宣传时是“智能体、无人值守、端到端解决问题”,真出了问题又变成“AI只是辅助工具,最终责任在用户”。这套说法的危险在于它想同时占住两头:拿走自动化的估值,只留下辅助工具的责任。诚实的做法只有两种:如果AI只是辅助,就明确标注哪些内容由AI生成、哪些经过人工确认、什么时候转人工;如果AI能自动执行,就说明它能调用哪些接口、权限和金额上限是多少、风险动作要不要二次确认、日志能不能追溯。一个既不敢开放能力、又不愿承认自己只是辅助的系统,大概率不是产品成熟,而是包装过度。 而下面这两种,就是包装过度的极端形态。 第一种:能力在人,署名给AI——遥控机器人。 1770年,肯佩伦的下棋机器人“土耳其人”轰动欧洲宫廷,秘密是柜子里藏着一个真人棋手。今天一些发布会上的“AI机器人”在结构上一模一样:观众看到的是具身智能,柜子里藏的是一个握手柄的操作员,区别只是柜子从木头变成了无线电。最著名的例子是特斯拉2024年10月的“We,Robot”发布会——Optimus现场调酒、聊天、猜拳,事后彭博社援引知情人士证实:行走是AI自主完成的,但与来宾的对话和大量互动由远程员工操控,起因是发布会前三周才决定让Optimus参展、软件来不及准备。特斯拉全程未主动说明这一点,摩根士丹利分析师在研报中直接写明机器人“依赖遥操作”。自主的行走和遥控的对话混在一起、不加区分地展示——这正是问题所在。 这种表演在经济上是负生产力:AI商用的全部价值在于监督比——一个人能看住几台机器。而遥控机器人的监督比是1:1,一台机器背后站着一个操作员,成本结构比直接雇人更贵、更慢、更不可靠。需要澄清的是,遥操作本身是正当的技术环节——采集训练数据、做安全兜底、明示的娱乐竞技都没有问题。遥控不可耻,隐瞒遥控才可耻。判断标准只有一条:观众是否被明确告知“此刻是人在操作”。还有一种更恶劣的变体:宣传时说这是AI机器人,出了事故又说“当时是人工操作”——宣传时让AI署名,出事时让操作员担责,把署名和担责硬生生拆开。而商业社会全部制度设计的目的,恰恰是防止这两样东西被拆开。 第二种:能力不存在,署名给AI——包壳蹭概念。 这个现象有个现成的英文词,AI-washing,仿照“漂绿”(greenwashing)造的。产品没变,文案变了:关键词匹配改叫“AI客服”,传感器加阈值判断的电饭煲改叫“AI电饭煲”,价格翻倍。最极端的案例是Builder.ai——号称用AI让开发应用“像点披萨一样简单”,拿到微软投资、累计融资超过4.5亿美元、估值一度超过10亿美元,2025年5月进入破产程序。其实早在2019年《华尔街日报》就报道过,它的大部分编码工作由人类工程师而非AI完成;而压垮它的最后一击,是彭博曝出的循环交易虚增收入——2024年销售额向债权人夸大了约300%。它是包壳和遥控的合体:既蹭壳,壳里藏着人,账上还藏着假数字。 监管的处罚已经落地。美国SEC在2024年3月开出首批AI-washing罚单,两家投资顾问公司因虚假宣称使用AI合计被罚40万美元。注意处罚的落点——罚的仍然是在宣传材料上签字的法人和高管。监管的逻辑一以贯之:谁署名,谁担责。 四个拆穿包壳的问题: 第一,关掉AI它还能用吗?真AI产品的AI是承重墙,假AI产品的AI是贴纸。 第二,它的输出会随输入变化吗?让“AI客服”回答一个话术库里没有的问题,三秒现原形。 第三,它敢开放什么权限、留下什么日志?真正跑在生产环境里的AI产品,说得清自己能调用哪些接口、失败时怎么复盘、高风险时怎么转人工;只活在演示视频里的产品,这几个问题一问就哑。 第四,也是终极检验:公司愿意为AI的输出承担什么责任?真把AI当核心能力的公司,会在服务协议里认真定义AI输出的责任边界;蹭壳的公司,宣传页上全是AI,合同里一个字都不敢提。 宣传里的AI浓度和合同里的AI浓度之差,就是包壳的厚度。 五、结论:签字环节不是遗留物,是前提条件 把全文的逻辑收拢成一张图: 签字制度解决的是“AI有能力、没责任”的空洞——能力在AI,责任必须锚在人身上; 遥控造假制造的是“AI没能力、有署名”的幻觉——能力在人,功劳记给了AI; 包壳蹭概念更进一步——能力根本不存在,署名照给AI。 市场和监管这三年做的其实是同一件事:强制“能力、署名、责任”三者对齐。 直播新规的“显著标识”管的是署名,SEC的罚单管的是能力造假,处方审方的禁令管的是责任。 最后说一个经济学视角。律师、审计师、医生的高收费里,很大一块买的不是他们的产出,而是他们的执照、他们的职业保险、他们可以被追责的资产。AI把产出的边际成本打到接近零,但责任的价格一分钱都没降。 所以“最后需要人签字”不是AI时代的过渡状态,更不是即将被淘汰的遗留物——它是AI商用的前提条件。AI商用的真实形态从来不是“AI直接交付”,而是“AI生产,人签收”。而那个签字的位置,正在成为AI时代价值上升最快的岗位。 参考来源 监管文件(中国) 国家卫生健康委《互联网诊疗监管细则(试行)》(国卫医发〔2022〕2号):其他人员、人工智能软件等不得冒用、替代医师本人提供诊疗服务;处方应由接诊医师本人开具,严禁使用人工智能等自动生成处方。相关解读见科技日报《AI不能替代医生直接进行诊疗决策》:https://www.ncsti.gov.cn/kjdt/kjrd/yyjk_kjrd/202502/t20250227_196974.html 国家药监局《处方药网络零售合规指南》(2026年5月发布):“严禁AI替代审方、重复使用处方,审方数量控制在合理范围”。报道见光明网:https://m.gmw.cn/2026-05/25/content_1304470337.htm;新浪财经:https://finance.sina.com.cn/jjxw/2026-05-27/doc-inhzhxzw9376834.shtml 国家市场监督管理总局、国家互联网信息办公室《直播电商监督管理办法》(2026年2月1日施行):AI生成的人物图像、视频从事直播电商须显著标识并持续提示;AI直播违法违规由直播间运营者承担全部责任。解读见:https://zhuanlan.zhihu.com/p/2038221585249784127 监管文件(欧盟/美国) 欧盟《人工智能法案》(Regulation(EU)2024/1689):禁止性条款自2025年2月2日起适用;生物识别、关键基础设施、教育、就业等高风险领域规则经2026年5月“AIOmnibus”政治协议调整后,将自2027年12月2日起适用。欧盟委员会官方页面:https://digital-strategy.ec.europa.eu/en/policies/regulatory-framework-ai 美国SEC首批AI-washing处罚(2024年3月18日):投资顾问公司Delphia与GlobalPredictions因虚假宣称使用AI合计被罚40万美元。见SEC新闻稿2024-36。 司法案例 ...

大模型只是在预测下一个token吗?两个实验给出了一幅更复杂的图景

本文是术语解构系列文章。 2023 年,一组研究人员测试了 GPT-4。 他们问:“汤姆·克鲁斯的母亲是谁?”模型答出了 Mary Lee Pfeiffer。 换一个对话窗口,再问:“Mary Lee Pfeiffer 的儿子是谁?”模型却没能答出汤姆·克鲁斯。 同一条亲属关系,正着问会,反着问不会。 这不是研究者偶然截到的一次翻车。在一组包含 1000 位名人的测试中,GPT-4 回答“某位名人的父母是谁”时,正确率达到 79%;换成父母的名字,反过来问“他或她的孩子是谁”,成功率降到 33%。后一个数字还是在每道题可以尝试 10 次、答对一次就算成功的宽松标准下得到的。 这个结果很容易让人得出结论:大模型根本不懂亲属关系,不过是在顺着常见词语往下接。 另一项实验却展示了不同的一面。一个只有约 2500 万参数的小型 GPT,只接受“预测下一步棋”的训练,内部逐渐形成了一个可以被读出、也能影响落子判断的黑白棋棋盘。 一个实验暴露了知识调用的单向性,一个实验发现了结构化的内部表征。它们并不互相否定,而是拼出了一幅更接近现实的图景:预测下一个 token 可能逼出某种理解,但这种理解并不完整,也不等同于人类的理解。 “预测”和“理解”不在同一个层面 “大模型是在理解语言,还是在预测下一个 token?”这个问题把两件不同层面的事放在了一起。 预测下一个 token,描述的是模型接受了什么训练,又怎样逐步生成文本。给定前文后,模型计算接下来不同 token 出现的概率,再选择其中一个继续生成。这里的 token 可能是一个字、一个词,也可能只是词的一部分。 理解则可以指几种不同的东西。它可能指模型能否解释、区分、迁移和运用一个概念,也可能指模型内部是否形成了与概念和关系对应的结构。再往前走一步,“理解”还可能包含人的身体经验、自我意识和主观感受。 这三个问题不能靠一句“它只是在预测”一起回答。 考试可以帮助说明其中的区别。考高分是目标,学生可能真的掌握了知识,也可能只背过题库。只看分数,不容易区分两者;检查他能否换一种方式解释、能否解决新题,再观察他怎样组织知识,证据会更充分。 语言模型面对的预测任务同样有简单和复杂之分。“今天天气真……”后面接“好”,记住常见搭配就可能答对。若要补全一部侦探小说最后的“凶手是……”,模型需要处理人物关系、动机、时间线和前文线索。最终输出依然是几个 token,完成预测所需的内部计算已经复杂得多。 预测不自动等于理解,也不自动排除理解。关键要看模型为了完成预测,学到了什么。 预测棋步时,模型内部出现了棋盘 黑白棋实验适合回答一个具体问题:只从序列中预测下一步,模型会不会学到序列背后没有直接写出的状态? 2023 年,Kenneth Li 等人在 ICLR 发表了 Othello-GPT 研究。研究人员用大量黑白棋对局记录训练一个小型 GPT。模型看到的只有落子序列,比如 E3、D3、C4。它没有收到棋盘图片、格子相邻关系或黑白棋规则说明,训练任务只有一个,预测下一步可能落在哪里。 Othello-GPT:只看落子序列,也可能形成棋盘表征 训练后,模型预测非法落子的错误率降到很低。研究人员又删掉一种开局对应的训练数据,再用这部分棋局测试,模型依然能够较好地预测合法落子。这个结果说明,简单背下训练棋谱不足以解释模型的表现。 更关键的证据来自模型内部。 研究人员在中间层激活上训练了一个小分类器,也就是“探针”,尝试读出棋盘每个位置当前是黑子、白子还是空格。探针能够以很低的错误率还原棋盘状态。后续研究换用“我方棋子、对方棋子、空格”这套坐标后,还发现相关信息可以被线性读取。 能读出棋盘,只能证明内部包含相关信息。它有没有真的参与下一步预测,还需要因果证据。 研究人员随后直接修改模型内部对某个格子的表示,相当于在它的“脑内棋盘”上翻转一枚棋子。修改后,模型预测的合法落子也随之变化,而且变化方向符合新棋盘的规则。这表明棋盘状态不只是被动留在激活中的痕迹,它参与了模型的计算。 改动内部棋盘,预测结果随之改变 这个实验足以反驳一种过于简单的说法:序列预测只能记住表面搭配,不可能形成隐藏状态的内部表示。 它的边界也很清楚。黑白棋是封闭的合成环境,棋盘固定、规则稳定、合法状态可以精确计算。自然语言连接的是一个开放、含混且不断变化的世界。文本里既有事实,也有错误、隐喻和偏见。从一个棋盘状态表征,不能直接推出通用语言模型已经建立了完整的现实世界模型。 黑白棋实验说明这种内部结构可以出现。它没有证明这种结构在所有语言任务中都会出现,也没有证明模型因此拥有意识。 模型学到关系,却不一定能反过来调用 逆转诅咒展示的是另一种限制。 名人问答无法直接证明问题出在训练,因为研究者不知道 GPT-4 的预训练数据究竟怎样描述过这些人物。论文的核心实验因此使用了完全虚构的人名和作品。 ...

同一份材料,为什么第二次交给AI只收1/10?缓存计费拆解

本文为「术语解构」系列。 一、账单上差了 50 倍的两行数字 打开 DeepSeek 的官方定价页,V4-Flash 这个模型的输入价格写了两行: 输入(缓存命中):0.02 元 / 百万 tokens 输入(缓存未命中):1 元 / 百万 tokens 同样是把 100 万个 token 喂给同一个模型,价格差了 50 倍。V4-Pro 更夸张:命中 0.025 元,未命中 3 元,差 120 倍。 这不是 DeepSeek 独有的玩法。Anthropic 的 Claude,缓存读取按标准输入价的 10% 计费——Sonnet 4.6 的输入从 3 美元/百万降到 0.3 美元/百万。OpenAI 的 GPT-5.5,输入 5 美元/百万,缓存输入 0.5 美元/百万,同样是 1/10。 也就是说,2026 年主流大模型 API 的账单上,“你输入了多少 token”已经不是决定性变量了。决定性变量是:这些 token 里,有多少是模型“见过”的。 这个“见过”的判定机制,就是今天要拆的术语——前缀缓存(Prefix Caching),以及它背后的计费逻辑。 二、模型凭什么给你打一折:前缀缓存的极简原理 大模型处理你的提示词,不是“读一遍文字”这么轻松。每个 token 进来,模型都要为它计算一大堆注意力中间结果(专业名词叫 KV Cache,键值缓存),存在显存里,供后续生成使用。提示词越长,这一步烧的算力越多——这也是为什么长提示词的首字响应总是慢半拍。 前缀缓存的思路很直接:如果这次请求的开头部分,和之前某次请求的开头一模一样,那这部分的中间结果就不用重算了,直接复用上次存下来的。 打个比方。我整理邮票贴片时,前 30 页已经排定、贴好、写完说明的部分,不会因为要加第 31 页就全部拆掉重排——只有新的那一页需要动手。模型也一样:相同的前缀直接翻到“上次整理好的位置”,只算新增的后缀。 ...

同一个问题,上午9点问比凌晨贵一倍:DeepSeek峰谷定价的算力账

6月29日晚,一批使用DeepSeek API的开发者收到了一封调价邮件,DeepSeek开放平台首页也同步挂出了通知。 DeepSeek V4正式版计划于7月中旬上线。伴随新模型而来的,还有一套新的峰谷定价机制:每天上午9点到12点、下午2点到6点,API调用价格是其他时段的两倍。 有人说,AI也开始学电费分峰谷了;也有人认为,这就是换一种方式涨价。 但把价格表真正摊开来看,这次变化不只是“贵了一倍”那么简单。它把AI推理服务一直藏在后台的一条负载曲线,直接印在了价目表上。 一、先看价格:不是全天涨价,而是7个小时翻倍 DeepSeek API一天 24 小时的峰谷价格变化 按照DeepSeek公布的峰谷定价方案,高峰时段每天: 9:00—12:00; 14:00—18:00。 一共7个小时,其他17个小时维持平时价格。 这里顺带澄清一个流传较广的说法:有媒体解读称“周末不执行高峰价”。但从官方口径看,DeepSeek的调价邮件和开放平台通知,措辞都是“每日”;7月3日腾讯云上线DeepSeek-V4原厂直供模型、同步官网峰谷定价机制时,公告同样把高峰时段定义为“每日9:00至12:00和14:00至18:00(北京时间)”——两个官方渠道都没有出现周末豁免的表述。 在DeepSeek计费页面给出进一步细则之前,把“周末照常执行高峰价”作为预算假设,是更稳妥的做法。具体价格如下: 模型 计费项目 平时价格 高峰价格 V4 Pro 输入,缓存命中 0.025元/百万Token 0.05元/百万Token V4 Pro 输入,缓存未命中 3元/百万Token 6元/百万Token V4 Pro 输出 6元/百万Token 12元/百万Token V4 Flash 输入,缓存命中 0.02元/百万Token 0.04元/百万Token V4 Flash 输入,缓存未命中 1元/百万Token 2元/百万Token V4 Flash 输出 2元/百万Token 4元/百万Token DeepSeek给出的解释是,通过峰谷定价“更合理地配置资源、提升服务稳定性”。从价格表看,平时时段没有涨价,高峰时段整体翻倍。因此,它更接近一次“削峰填谷”,而不是全天统一提价。 还有一个背景值得放在一起看。现在的平时价格,是今年4月底V4 Pro那轮永久降价之后的结果——降到了首发定价的四分之一。也就是说,即便高峰时段翻倍,价格也只回到了首发价的一半。这张表里,有三个数字值得停下来看看。 第一,高峰只有7个小时 价格翻倍的时间,几乎覆盖了国内企业最主要的办公时段。 上午开工后到午休前,下午上班到下班前,正是客服、办公软件、代码助手和企业工作流调用最密集的时候。 所以,虽然它不是全天涨价,但对主要在工作时间调用API的国内企业来说,体感很可能接近涨价。 第二,缓存命中和未命中的差距达到120倍 以V4 Pro高峰时段为例: 缓存命中输入:0.05元/百万Token; 缓存未命中输入:6元/百万Token。 同样是100万Token输入,价格相差120倍。这比“高峰翻倍”更值得关注,它说明未来使用大模型,成本不只取决于用了多少Token,还取决于这些Token是不是每次都要重新计算。 第三,Flash和Pro之间也有明显价差 V4 Pro平时的未缓存输入价格是每百万Token 3元,V4 Flash是1元;输出分别是6元和2元——同样相差3倍,这意味着,真正有效的省钱方法不只是凌晨跑任务,还包括: ...

AI蒸馏是什么?不是复制大模型,而是让小模型学会做题方式

本文是「术语解构」系列之一。 DeepSeek-R1 满血版有 6710 亿参数,而你在 LM Studio 里下载的 R1-Distill-Qwen-14B 只有 140 亿——体积差了大约 48 倍,但它确实“学到了”大模型的推理能力。 这中间发生的事,就叫蒸馏(Distillation)。 打开任何一个本地模型下载页,名字里带 “Distill” 的模型比比皆是。但“蒸馏”到底蒸的是什么?它和我们熟悉的量化(比如 IQ4_XS)有什么区别?为什么有人说蒸馏是“教学生”,有人说蒸馏是“抄作业”? 这篇先把概念讲透,下篇上实测数据。 一、为什么叫“蒸馏”:从一锅混合物里提取精华 AI蒸馏不是复制大模型,而是从大模型中提取知识精华 化学里的蒸馏,是把一锅混合液加热,让沸点低的成分先变成蒸汽,再冷凝收集——留下的是你想要的精华,扔掉的是杂质。 2015 年 3 月,Geoffrey Hinton(就是后来拿了诺贝尔物理学奖的那位)和 Oriol Vinyals、Jeff Dean 发表了论文《Distilling the Knowledge in a Neural Network》,把这个词借到了神经网络领域: 把一个大模型(老师)学到的“知识”,提取出来,灌进一个小模型(学生)的身体里。 注意这个说法的微妙之处:提取的是“知识”,不是“参数”。学生模型的参数是从头训练的,只是训练的目标从“学习标准答案”变成了“模仿老师的判断”。 这和量化有本质区别——量化是给同一个模型降精度,人还是那个人,只是“说话没那么精确了”;蒸馏是重新培养一个新人。这一点我们后面展开。 二、暗知识:老师教的不是答案,是“感觉” 暗知识:老师教给学生的不只是答案,而是答案之间的相似性 这是整个蒸馏概念里最精彩的部分,也是 Hinton 那篇论文的核心洞察。 假设我们训练一个识别图片的模型,给它看一张猫的照片。 普通训练用的是硬标签(hard label): 正确答案:猫。就一个字,没了。 蒸馏训练用的是老师模型输出的软标签(soft label),也就是一整个概率分布: 猫:90% 狗:8% 老虎:1.5% 汽车:0.0001% 看出区别了吗?“狗 8%,而汽车几乎是零”——这个差异本身就是知识。它告诉学生:猫和狗长得像,猫和汽车完全不像。这种类别之间的相似性结构,硬标签里根本不存在,只藏在老师的概率分布里。 Hinton 给这东西起了个很浪漫的名字:暗知识(dark knowledge)——像暗物质一样,平时看不见(推理时只取概率最高的那个答案),但它确实存在,而且信息量巨大。 学生模型对着软标签学,相当于老师不仅告诉你答案是 A,还告诉你“B 有点像但差在哪、C 为什么完全不沾边”。一道题传递的信息量,是硬标签的很多倍——这就是为什么蒸馏出来的小模型,往往比同样大小、从零硬训的模型强。 顺便解决一个老疑问:温度参数是从这来的 你在 API 调参时天天见的 temperature,最早的出处之一就是这篇蒸馏论文。 ...

手机也能操控电脑:WorkBuddy微信小程序+Claw远程办公实战

WorkBuddy 实战手册 · 第8篇 有一种办公崩溃,很多人都遇到过:人已经离开公司,文件还在公司电脑里。更烦的是,别人不是明天要,也不是下周要,而是现在就要。 上个月有天下班路上,我在地铁里收到同事消息: 明天一早开会要用的方案,最终版是不是还在你电脑桌面上?能不能现在发我一下? 如果是以前,我大概率只有两个选择: 第一,掉头回公司。 第二,找还在办公室的同事帮我开电脑、找文件、传文件。 两个选择都不舒服。 那天我试了第三种方式:打开微信里的 WorkBuddy 小程序,切到本机模式,让它在我办公室电脑上找到那份文件,再用绑定好的邮箱发给同事。 几分钟后,同事回了两个字: 收到。 这件事给我的感觉很直接——WorkBuddy 不只是坐在电脑前用的 AI 助手,它还可以变成一个「手机遥控电脑」的工具。你人不在电脑前,但电脑上的文件、邮件、表格和任务,依然可以继续处理。 这篇就讲一个很具体的场景: 怎么用 WorkBuddy 微信小程序和 ClawBot,在手机上远程操控电脑,完成取文件、发邮件、处理本地资料这类办公任务。 一、手机端有三种入口 入口 适合场景 我的建议 微信客服号 简单问答、轻量任务 能用,但能力比较基础 ClawBot 插件 微信聊天里快速发指令 适合语音和临时操作 微信小程序 查看任务、下载文件、切换模式 最推荐,体验最完整 在微信里搜索「腾讯 WorkBuddy」,进入小程序后,就可以看到任务入口、模式切换、结果展示和文件下载。 ClawBot 更像一个微信聊天里的快捷入口,小程序更像一个完整的手机工作台。 临时一句话,用 ClawBot; 要看结果、下载文件、确认任务进度,用小程序。 两个配合起来,体验会顺很多。 二、云端模式和本机模式不是一回事 WorkBuddy云端模式和本机模式的区别 WorkBuddy 手机端通常会涉及两类任务: 云端模式:任务在云端跑。 本机模式:任务在你的电脑上跑。 这两个差别很大。 1. 云端模式:电脑关着也能用 云端模式适合不依赖你电脑本地文件的任务。 比如: 写一篇文章大纲; 整理一段文案; 生成一个活动方案; 分析你手动上传的资料; 做一个通用选题规划。 这些任务不需要访问你电脑桌面,也不需要打开你本地硬盘,所以电脑关着也没关系。你可以在地铁、高铁、咖啡馆里直接用手机发指令。 2. 本机模式:电脑必须开着 本机模式的重点是: WorkBuddy 可以远程操作你的电脑。 它适合这些任务: ...