模型标着671B参数,消费级显卡真的扛不住吗?
术语解构系列·MoE路由 文中模型参数数据查证于2026年7月,主要来自官方模型卡片、GitHub仓库或官方博客。模型规格和API价格都可能变化,具体以厂商最新发布为准。 消费级显卡到底能不能拿来做点正经AI的活? 这个问题不能只看显卡型号,也不能只看模型名字里那个很吓人的参数量。真正要拆成两件事:模型能不能装下,以及装下以后每生成一个token要算多少。 很多人看到DeepSeekV3标着671B参数,Qwen3-235B-A22B标着235B参数,Qwen3-Coder-480B-A35B标着480B参数,第一反应是:这肯定不是消费级设备能碰的东西。 但真实情况没这么简单。 这些模型名字里还有一个更容易被忽略的后缀:A3B、A22B、A35B。它说的不是模型下载包有多大,而是每个token大约激活多少参数。 这篇文章要讲的不是“消费级显卡能不能挑战大厂机房”,而是把这笔账拆清楚:为什么有些大模型看起来很大,跑起来却没那么夸张;为什么有些模型激活参数很小,本地还是很难装下。 一、消费级显卡先看两笔账:装不装得下,跑不跑得动 把几个真实模型摆在一起看: 模型 架构 总参数 激活参数 每token激活比例 DeepSeekV3/R1 MoE 671B 37B 约5.5% Qwen3-235B-A22B MoE 235B 22B 约9.4% Qwen3-Coder-480B-A35B MoE 480B 35B 约7.3% Qwen3-30B-A3B MoE 30.5B 3.3B 约10.8% Qwen3-32B(对照) 稠密 32B 32B 100% 最后一行放了一个稠密模型做对照。Qwen3-32B没有专家、没有路由,32B参数每次都参与计算,激活比例就是100%。 这才是很多人习惯里的“参数量≈计算量”。 但MoE模型不一样。上面几个MoE模型每次真正参与计算的参数,只占总参数的大约5%到11%。 如果DeepSeekV3是一个671B的稠密模型,不管是显存占用还是算力消耗,都会是另一种级别。仅按FP16权重粗略算,671B参数就需要超过1TB空间。可它每个token激活的是37B参数,粗略看主要前馈计算量,更接近一个几十B激活规模的模型,而不是完整671B稠密模型。 这就是消费级显卡选本地模型时最容易混淆的地方:总参数决定你要准备多大的显存/内存去装它,激活参数影响它每个token大概要算多少。 消费级显卡先看两笔账 MoE(Mixture-of-Experts,混合专家)架构做的就是这件事:模型可以有很大的参数池,但每次只用其中一部分。 二、一个类比:医院不需要让全体医生会诊 理解MoE,最直接的类比是医院分诊。 一家大医院可能有几百名医生,覆盖内科、外科、儿科、皮肤科、精神科等几十个科室。这是医院的规模,对应模型的总参数量。 但病人来了,医院不会让所有医生一起会诊。分诊台会先判断这个病人的情况,再派几个对口医生处理。这对应模型的激活参数量。 MoE路由机制:不是所有专家都上场 医院的规模决定了它能覆盖多广的问题;但看一个病人要花多少医疗资源,主要取决于实际出诊的那几位医生,而不是医院挂牌的医生总数。 这套机制翻译回模型架构,对应两个部件: 专家(Experts):模型里的一组前馈网络模块,可以理解成一批科室。Qwen3-30B-A3B有128个专家,Qwen3-Coder-480B-A35B有160个专家,DeepSeekV3的专家规模更大,还额外设置了所有token都会用到的共享专家。 路由器(Router/Gating Network):一个很小的判断网络,负责给每个token打分,决定它该交给哪几个专家处理。它就是模型里的分诊台。 路由不是人工写死的规则。不是程序员规定“中文交给1号专家,代码交给2号专家”,而是模型在训练过程中自己学出来的。它会逐渐学会什么样的token该送去哪些专家。 而且这个决策是逐层、逐token做的。同一句话里的不同字词,甚至同一个词在不同层,都可能被路由到不同的专家组合。 三、路由器怎么决定派谁出诊? 路由器的工作可以拆成三步。 第一步,打分。每个token经过路由器时,路由器会对全部专家各算出一个分数,表示这个专家有多适合处理当前token。 第二步,选择Top-K。模型只保留分数最高的K个专家,其余专家不参与这次计算。模型名里的A3B、A22B、A35B,说的就是每个token大约会激活多少参数。 第三步,加权合并。被选中的几个专家分别处理这个token,再按路由分数把结果加权合并,作为这一层的输出。 几个真实模型的Top-K配置如下: 模型 专家总数 每次激活 Qwen3-30B-A3B 128 8 Qwen3-235B-A22B 128 8 Qwen3-Coder-480B-A35B 160 8 DeepSeekV3 256个路由专家+1个共享专家 8个路由专家+共享专家 这里有个容易误解的地方:A22B不是说这个模型只有22B参数,也不是说下载包只有22B大小。它说的是每个token大约激活22B参数。 ...