这一篇是上篇,先看懂模型的名字、量化的门道,以及——凭什么是 Mac。
写在前面
想在 MacBook 上跑个本地模型,打开 LM Studio 的 Discover,搜了一下 Qwen3-32B,结果蹦出来 23 个。
9B、27B、35B、40B 一堆数字也就罢了,每个名字后面还拖着一长串字母:MLX、4bit、IQ4_XS、Q4_K_M、Thinking、abliterated、DWQ……
到底下哪个?哪个是给这台机器的?哪个下回来跑不动?哪个其实是个根本不需要的版本?
如果你也在这一步卡住过,这篇就是写给你的。这篇把本地大模型的命名规则、量化原理、为什么 Mac 适合干这事一次讲透。下篇再接着讲这台机器到底能跑多大、质量优先怎么选、以及怎么把 Qwen3-32B 实际跑通。
先从最让人头大的——名字——开始。

一、模型的名字,其实是四段拼起来的
看着乱,是因为四个不同维度的信息全挤在一个文件名里。拆成四段就清楚了:
模型名 + 参数规模 + 模型类型 + 量化格式
1. 参数规模:那个 B 是什么
9B、27B、32B 里的 B = Billion,十亿。指的是模型的参数量。数字越大,模型“脑容量”越大,能力上限越高,但也越吃内存、越慢。
这里有个容易踩的坑:MoE 模型。你会看到类似 Qwen3-30B-A3B 的写法——
30B是总参数A3B是 Active 3B,每次推理实际只激活 3B
这意味着:一个 30B-A3B 的 MoE,显存占用接近 30B,但速度接近 3B。它是“装得满、跑得快”的设计。这个特性后面选型时很关键,先记住。
2. 模型类型:这个模型“会做什么”
名字中间那段单词,决定了模型的用途:
| 后缀 | 含义 |
|---|---|
| Instruct / -it | 指令微调版,能听懂指令、能对话。日常用的就是它(it = instruction tuned) |
| Base | 只做了预训练、没对齐,是“续写型”。一般别下,除非你要自己微调 |
| Chat | 对话微调,和 Instruct 类似 |
| Coder / Code | 代码专用 |
| VL / Vision | 多模态,能看图(如 Qwen-VL) |
| Thinking / Reasoning / R1 | 推理模型,会先输出一大段思维链再回答 |
| Distill | 从更大的模型蒸馏出来的(如 DeepSeek-R1-Distill-Qwen-32B) |
| abliterated / uncensored | 社区改版,去掉了安全护栏 |
一句话:做日常任务认准 Instruct/-it 就对了,其余的是各有专门用途。
3. 量化格式:最让人困惑的那一坨
Q4_K_M、IQ4_XS、4bit……这些是同一个模型压缩程度不同的版本,决定文件大小和质量。
量化是什么、为什么能压缩,下一节专门讲。这里先认字:
GGUF 格式(llama.cpp / Ollama 用):
- Q4 / Q5 / Q8:量化到几 bit,数字越大越接近原始精度、文件越大
- _K:K-quants,新一代量化方法,同 bit 下质量比老的
_0/_1更好 - _S / _M / _L:Small / Medium / Large,同一档里的细分取舍。比如
Q4_K_M= 4bit、K 量化、中等档,这是社区最常推荐的“质量/体积平衡点” - IQ 开头(如
IQ4_XS):I-quants,低 bit 下比同位 K-quant 更省、质量更高
MLX 格式(Apple Silicon 专用):
- 通常直接写 4bit / 6bit / 8bit,没有 K/IQ 这套,方案更简单统一

拼起来看一个完整例子
Qwen3-30B-A3B-Instruct-MLX-4bit
拆开就是:
Qwen3—— 模型名30B-A3B—— 总参 30B、激活 3B 的 MoEInstruct—— 指令版MLX—— 格式(Apple Silicon)4bit—— 量化档位
是不是一下就读懂了?以后看任何模型名,都按这四段拆。
二、量化到底是什么:为什么能把模型压缩还不太掉质量
上面一直在说“量化”,这节讲清楚原理。搞懂它,你才知道为什么“4bit 是甜区”。
一句话定义
模型的每个参数(权重),原本是用 16bit 的浮点数(FP16)存的。量化,就是把它压成 4bit、5bit、8bit 来存。
8bit 就把体积砍掉一半,4bit 直接砍到 1/4。一个原本 60 多 GB 的 32B 模型,4bit 之后只剩 17~18GB——这才让它能塞进一台消费级 Mac。
一个关键概念:bpw
bpw = bits per weight,每个权重平均占多少比特。它是估算模型体积的根:
权重体积 ≈ 参数量 × bpw ÷ 8(字节)
比如 32B 模型、4bit(bpw≈4.3),体积 ≈ 32 × 4.3 ÷ 8 ≈ 17.2GB。下篇的占用表就是这么算出来的。
损失了什么?没你想的多
压缩总要付代价,代价是精度。但有意思的是——4bit 相比原始的 FP16,质量只掉一点点。
衡量这个“掉多少”的指标叫困惑度(perplexity),数值越低代表模型越“确信”、质量越好。实测下来,从 FP16 压到 4bit,困惑度只上升很小一截,但体积砍掉了 3/4。性价比极高。这就是为什么社区公认 4bit 是甜区。
一个会反直觉、但极重要的结论
很多人第一反应是“我内存够,那我就下最高精度的版本”。但真相是:
Q4 → Q5 → Q6 的质量差,很小。 14B → 32B,是能力的跨级提升。
换句话说——参数量带来的收益,远远大于量化精度带来的收益。
所以如果你的内存有限,正确策略不是“把一个小模型拉到 Q8 最高精度”,而是“在内存装得下的前提下,塞进尽可能大的模型,量化停在 4bit 这条线上”。
这条心法是整个选型方法论的地基,下篇会反复用到。
三、跑本地大模型,凭什么是 Mac?
讲完软件层,回头说硬件。为什么这两年“在 Mac 上跑大模型”突然成了热门?答案藏在 Apple Silicon 的架构里。

优势一:统一内存(UMA)
普通 PC 里,内存和显存是分开的。跑大模型靠的是显存(VRAM),而消费级显卡的显存普遍只有 8/12/16GB,想要 24GB 显存得上很贵的卡。
Apple Silicon 是统一内存架构(Unified Memory):CPU 和 GPU 共用同一块内存。这意味着——
你这台 24GB 的 Mac,这 24GB 全都能拿来装模型。
一台几千块到一万出头的 Mac,能装下需要 20GB 级“显存”才跑得动的模型。这是 Mac 跑大模型最大的底气。
优势二(也是限制):速度由带宽决定
但“装得下”不等于“跑得快”。本地推理的速度瓶颈,几乎都卡在内存带宽上(memory bandwidth bound)。
一个粗略但好用的直觉:
生成速度(token/s)≈ 内存带宽 ÷ 模型每生成一个 token 要读取的字节数
模型越大,每个 token 要读的数据越多,速度就越慢。这也解释了一个常见现象:同一台 Mac,小模型飞快,大模型能跑但明显变慢。
举几个参考数:入门级 Apple Silicon 带宽一百多 GB/s,到 M4 Pro 这一档 273GB/s,再往上 Max/Ultra 能到五六百甚至上千 GB/s。带宽越高,越能把大模型“喂饱”。这就是为什么真要跑大模型,大家盯着的是 Max/Ultra 加大内存的机型。
优势三:MLX,Apple 的亲儿子框架
回到开头那个困惑——MLX 和 GGUF 到底选哪个?
- GGUF(llama.cpp 生态):跨平台通吃,Windows/Linux/Mac 都能跑,生态最大、模型最全
- MLX:Apple 自己为 Apple Silicon 打造的框架,在 Mac 上更省内存、带宽利用更好、推理更快
结论很简单:如果你在 Mac 上,优先选 MLX 版本。 只有当某个模型没有 MLX 版、或你需要某些 GGUF 才有的特性(比如更灵活的 KV cache 量化)时,再退回 GGUF。
综上所述:
到这里,开头那串劝退的字母,应该都不再陌生了:
- 模型名 = 模型名 + 参数规模 + 模型类型 + 量化格式,四段拆开看
- 量化 = 把权重从 16bit 压到 4/8bit,4bit 是甜区;记住“参数量 > 量化精度”
- Mac 靠统一内存装得下大模型,速度由带宽决定,框架优先 MLX
下篇我们落到实处,回答三个最硬核的问题:
- 你这台 Mac 到底能跑多大的模型?(附 9B 到 40B 的内存占用速查表)
- 以输出质量为优先,到底该选哪个?(一套可复用的选型心法)
- 怎么把 Qwen3-32B 真正在 24GB 的 MacBook 上跑通?(从抬内存上限到避坑下载,一条龙实操)
下篇见。
本文是「本地大模型选型」系列上篇。如果觉得有用,欢迎转发给同样在 LM Studio 里挑花眼的朋友。