在众多模型中找适合自己的模型时,会看到类似Qwen3-32B 和 Qwen3-30B-A3B名字很相似的模型名称,一个带“A”,一个不带。参数量看着差不多,到底差在哪?
这两个字母背后,藏着本地部署里最重要的一条分界线。搞懂它,你才知道自己那台机器该喂什么、该买什么。这篇就把它从头讲透,最后落到一个很实际的问题上:不同的一人公司,到底该怎么选本地模型。
一、一句话区别:处理一个字时,到底激活了多少参数
先建立一个直觉。你可以把一个大模型想象成一家公司,公司里有一大群员工——每个员工就是一个「参数」(实际上是几十亿、上千亿个数字)——这个比喻不严谨,但足够帮我们理解后面的选择逻辑。
所谓「32B 模型」,B 是 billion(十亿),就是这家公司有 320 亿名员工。
模型「思考」的过程,是把你输入的文字拆成一个个小单位(叫 token,大致是「字」或「词的一部分」),然后让员工对每个 token 算一轮,吐出下一个字。
稀疏和稠密的区别,不看公司一共多少人,只看处理一个字时,实际有多少人在干活。
- 稠密(dense):每来一个字,全部员工都上工。激活参数 = 总参数。
- 稀疏(MoE,混合专家):每来一个字,只叫醒一小撮人,其余继续睡觉。激活参数 ≪ 总参数。
学名叫「激活稀疏性」或「条件计算」。一句话:总参数决定它知道多少,激活参数决定它每个字算得多快、多贵。
二、稠密:全来一个字,全公司加班
传统模型是稠密的。规矩很简单粗暴:每处理一个 token,320 亿员工一个不落,全部上工。
好处是简单、稳定、质量扎实;坏处是贵。员工越多,处理每个字越慢、越耗电、越吃内存。你想让它更聪明(加更多员工),处理每个字的成本就线性地往上涨,逃不掉。
三、稀疏 MoE:路由器翻牌子,只叫醒几个专家
后来人们想了个偷懒的办法,这就是 MoE。
它把公司里干重活的那个部门(技术上叫 FFN 层)拆成了一群专家,比如 64 个、128 个,各有所长。然后在专家前面安排了一个前台调度员,叫「路由器」(router)。
每来一个 token,路由器先瞄一眼:「这个字大概讲代码,叫醒 2 号和 47 号就够了。」于是只有被点名的那几个专家干活,其余几十个继续睡觉,完全不参与这个字的计算。下一个字来了,路由器可能又翻别的牌子。
这个「每次只激活一小撮」的特性,就是「稀疏」这个名字的来历。

上图左边是稠密——每来一个 token,全部参数(亮的)都参与;右边是 MoE——路由器翻牌子,只有 2 个专家被叫醒,其余 4 个灰着不计算。颜色就是全部信息量:亮 = 真的在算,灰 = 睡觉不耗算力。
四、怎么一眼认出来?看名字里那个大写 A
这是最实用的技巧。模型名字里的「A」就是 Activated(激活):
Qwen3-32B:没有 A,稠密,320 亿员工全部上工。Qwen3-30B-A3B:有 A,MoE,总共 300 亿,但每个字只激活 30 亿(A3B)。Qwen3-235B-A22B:总 2350 亿,每个字只动用 220 亿。
在 Qwen 这类命名里,A 基本可以理解为 Activated,也就是每 token 激活参数量。看到 30B-A3B、235B-A22B,大概率就是 MoE。没有 A 的 Qwen3-32B,则是 dense。命名规则直接把答案写在脸上了。
五、内存、速度、质量:MoE 把这三件事拆开了
对抠 Apple Silicon 内存的人来说,MoE 真正的价值是把「要多少内存」和「跑多快」解耦了。记住三条经验法则:
- 基础内存占用主要看总参数,长上下文还要额外看 KV Cache。MoE 的专家虽然不是每次都激活,但权重通常仍要放在内存里;如果你把上下文从 8K 拉到 64K、128K,KV Cache 又会吃掉一大块内存。
- 速度 / 算力消耗 ≈ 激活参数。 M 系芯片推理几乎永远被内存带宽卡死,而 MoE 每个字只需读取被激活那部分权重,等于「大总参数换知识广度,小激活参数换速度」。
- 质量不能简单按“激活参数”线性估算。
30B-A3B通常会明显强于普通 3B dense,但它不等于“免费获得 30B dense 的全部能力”。MoE 的优势更像是:用较低的单 token 计算量,换取接近大模型的知识覆盖和任务泛化,但具体质量还要看训练、数据、量化和运行时。
所以一句话总结 MoE 的卖点:用大模型的脑子,跑出小模型的速度,代价是吃大模型的内存。
反过来,如果内存极度紧张,稠密模型「每一份内存换来的智力」反而更划算——它把全部预算压在一条路上,没把参数摊薄到一群专家身上。
六、回到正题:一人公司该怎么选
知道了区别,怎么落地?对一人公司来说,选模型最大的误区是问「哪个最强」。你没有 IT 团队,硬件是自己的钱,时间是最稀缺的资源——真正该问的是:「我这台机器到底在替我干哪种活?」
这个问题几乎直接决定你走 dense 还是 MoE。核心就一条线:
- 机器主要「陪你一个人深度用」(写作、对话、改代码、分析),评判标准是单次质量和延迟 → 内存有限时,dense 更划算。
- 机器主要「在后台跑量 / 服务多人」(批量、24h Agent、并发),评判标准是总吞吐和每 token 成本 → MoE 更划算。

| 场景 | 更适合 | 原因 |
|---|---|---|
| 一个人写作、问答、改稿 | dense 优先 | 单次质量稳定,少折腾 |
| 低延迟聊天、轻量工具调用 | MoE 可选 | 激活参数小,速度好 |
| 长文档 RAG | 看上下文和 KV Cache | 不只是模型大小问题 |
| 24h 自动化、批量任务 | MoE 优先 | 吞吐、电费、速度更划算 |
| 隐私合规、本地固定流程 | 稳定 dense 优先 | 可复现、少意外 |
| 局域网多人共用 | MoE + 批处理运行时 | 并发时更有优势 |
七、五种不同用途,对号入座
下面不是排行榜,只是按用途举几个代表性方向。模型生态变化太快,具体版本以模型卡为准。
① 自媒体、作者、翻译。 活是长文起草、洗稿、翻译、摘要,不需要工具调用,能容忍延迟,命门是中文质量。走 dense 优先质量。24GB 内存适合 14B 级 dense(Q5/Q6)当主力;要更快就上 Qwen3.6-35B-A3B——这个 MoE 只激活 3B,跑得快还能留出上下文,如果追求速度和可用质量的平衡,可以关注 Qwen3.6-35B-A3B 这类 35B 总参、约 3B 激活的 MoE;它更像是“轻量跑得动的大模型”,而不是纯质量优先的 dense 替代品。英文、推理、结构化输出场景,也可以关注 Gemma 4 系列;但中文写作主力,我还是会优先看Qwen。
②独立开发者。 拆两种活:行内补全看 FIM 优化模型,比如 Codestral 系、Qwen Coder 系这类专门做过代码补全/代码指令微调的模型;Qwen3-Coder-30B-A3B 这类 MoE 编码模型,在特定 agent 框架和评测设置下已经能跑出不错的 SWE-bench Verified 成绩;但这个数字强依赖工具链、turn 数、执行环境,不能简单理解成“本地一跑就有云端编码 Agent 的水平”。诚实提醒:复杂重构、长链 Agent 这类重活,本地仍追不上云端——顶级开源 agentic 编码(GLM-5.2、Kimi K2.6、DeepSeek V4)基本是服务器级。本地的甜区是:补全、隐私敏感代码、离线、省 API 钱的高频小任务。
③ 做分析 / 研究 / 咨询。 活是长文档摘要、问答、检索,命门是长上下文 + RAG,而不是模型本身多聪明。真正的超长上下文(1M token)几乎得靠 DeepSeek V4 这一级,本地塞不下,更适合「本地嵌入 + 脱敏后云端推理」的混合方案。关键认知:一套靠谱的 RAG 管线(嵌入 + 检索 + 生成)比单模型的参数量重要得多。
④ 跑自动化 / Agent (24h 后台、批量、信号系统)。 活是无人值守、高频、批量、工具调用要稳,单次质量可以不顶尖,但量大、要便宜、要快。这是 MoE 的绝对主场。 激活参数小让每 token 又快又省电,适合放在常开的便宜机器(Mac Mini)上。可选 Gemma 4 26B-A4B(消费级硬件约 85 t/s)、Nemotron Cascade 2(30B 总参 / 3.5B 激活)、或 Qwen 30B-A3B。跑量场景里吞吐和电费完胜单次质量。
⑤ 客户数据、法律、医疗、财务。 选本地的理由本身就是「数据不出机器」,质量第二位。这种反而要克制:在内存允许范围内挑一个最稳、可复现的 dense,别为了炫技硬塞一个勉强能跑的大 MoE。稳定性 > 峰值性能。
还有一种特殊情况:当机器从「陪你一个」变成「同时服务 3–5 人」(比如做局域网推理服务器),评判标准从单流延迟切换成总吞吐和并发。如果是 NVIDIA GPU 服务器,可以优先考虑 MoE + vLLM 这类支持批处理的运行时;如果是 Mac 本地,现实一点的选择还是 LM Studio、Ollama、llama.cpp 或 MLX 系工具链。
八、两个 2026 年的硬件现实
第一,推理速度很大程度看内存带宽,不只看芯片代数。例如 M4 Pro 的内存带宽是 273GB/s,而高配 M3 Max 可到 400GB/s。跑本地大模型时,老一代高带宽 Max 芯片,未必比新一代 Pro 芯片慢。买机器别只看 M3、M4、M5 这个代数,也要看 Max / Pro、内存容量和带宽。
第二,别把购买决策全部押在下一代。如果你半年内就要稳定跑本地模型,与其等传闻中的 M5 Studio,不如看现在能买到的 M4 Max / M3 Ultra。内存和存储价格已经明显受 AI 需求影响,后面未必更便宜。我的判断是:刚需可以买,非刚需再等。
结尾:
我现在选本地模型,已经不太问“哪个模型最强”了。
这个问题太容易把人带偏。真正该问的是:这台机器到底是陪我一个人慢慢干活,还是替我在后台跑量?
如果是前者,dense 往往更稳,内存花得更实在。
如果是后者,MoE 的价值才真正出来:它不一定每次回答都最强,但它便宜、快、吞吐好,适合长期跑。
先想清楚工作方式,再选模型架构,最后才看具体型号。顺序反了,就很容易买一台看起来很强、实际用起来别扭的机器。
本文涉及的模型版本、硬件信息为 2026 年年中数据,本地模型生态变化极快,落地前请以官方模型卡和最新发布为准。