这一篇是上篇,先看懂模型的名字、量化的门道,以及——凭什么是 Mac。

写在前面

想在 MacBook 上跑个本地模型,打开 LM Studio 的 Discover,搜了一下 Qwen3-32B,结果蹦出来 23 个。

9B、27B、35B、40B 一堆数字也就罢了,每个名字后面还拖着一长串字母:MLX、4bit、IQ4_XS、Q4_K_M、Thinking、abliterated、DWQ……

到底下哪个?哪个是给这台机器的?哪个下回来跑不动?哪个其实是个根本不需要的版本?

如果你也在这一步卡住过,这篇就是写给你的。这篇把本地大模型的命名规则、量化原理、为什么 Mac 适合干这事一次讲透。下篇再接着讲这台机器到底能跑多大、质量优先怎么选、以及怎么把 Qwen3-32B 实际跑通

先从最让人头大的——名字——开始。

面对一堆模型名不知道该选哪个
面对一堆模型名不知道该选哪个

一、模型的名字,其实是四段拼起来的

看着乱,是因为四个不同维度的信息全挤在一个文件名里。拆成四段就清楚了:

模型名 + 参数规模 + 模型类型 + 量化格式

1. 参数规模:那个 B 是什么

9B27B32B 里的 B = Billion,十亿。指的是模型的参数量。数字越大,模型“脑容量”越大,能力上限越高,但也越吃内存、越慢。

这里有个容易踩的坑:MoE 模型。你会看到类似 Qwen3-30B-A3B 的写法——

  • 30B总参数
  • A3BActive 3B,每次推理实际只激活 3B

这意味着:一个 30B-A3B 的 MoE,显存占用接近 30B,但速度接近 3B。它是“装得满、跑得快”的设计。这个特性后面选型时很关键,先记住。

2. 模型类型:这个模型“会做什么”

名字中间那段单词,决定了模型的用途:

后缀含义
Instruct / -it指令微调版,能听懂指令、能对话。日常用的就是它(it = instruction tuned)
Base只做了预训练、没对齐,是“续写型”。一般别下,除非你要自己微调
Chat对话微调,和 Instruct 类似
Coder / Code代码专用
VL / Vision多模态,能看图(如 Qwen-VL)
Thinking / Reasoning / R1推理模型,会先输出一大段思维链再回答
Distill从更大的模型蒸馏出来的(如 DeepSeek-R1-Distill-Qwen-32B)
abliterated / uncensored社区改版,去掉了安全护栏

一句话:做日常任务认准 Instruct/-it 就对了,其余的是各有专门用途。

3. 量化格式:最让人困惑的那一坨

Q4_K_MIQ4_XS4bit……这些是同一个模型压缩程度不同的版本,决定文件大小和质量。

量化是什么、为什么能压缩,下一节专门讲。这里先认字:

GGUF 格式(llama.cpp / Ollama 用):

  • Q4 / Q5 / Q8:量化到几 bit,数字越大越接近原始精度、文件越大
  • _K:K-quants,新一代量化方法,同 bit 下质量比老的 _0/_1 更好
  • _S / _M / _L:Small / Medium / Large,同一档里的细分取舍。比如 Q4_K_M = 4bit、K 量化、中等档,这是社区最常推荐的“质量/体积平衡点”
  • IQ 开头(如 IQ4_XS):I-quants,低 bit 下比同位 K-quant 更省、质量更高

MLX 格式(Apple Silicon 专用):

  • 通常直接写 4bit / 6bit / 8bit,没有 K/IQ 这套,方案更简单统一
复杂模型名其实可以拆开理解
复杂模型名其实可以拆开理解

拼起来看一个完整例子

Qwen3-30B-A3B-Instruct-MLX-4bit

拆开就是:

  • Qwen3 —— 模型名
  • 30B-A3B —— 总参 30B、激活 3B 的 MoE
  • Instruct —— 指令版
  • MLX —— 格式(Apple Silicon)
  • 4bit —— 量化档位

是不是一下就读懂了?以后看任何模型名,都按这四段拆。

二、量化到底是什么:为什么能把模型压缩还不太掉质量

上面一直在说“量化”,这节讲清楚原理。搞懂它,你才知道为什么“4bit 是甜区”。

一句话定义

模型的每个参数(权重),原本是用 16bit 的浮点数(FP16)存的。量化,就是把它压成 4bit、5bit、8bit 来存。

8bit 就把体积砍掉一半,4bit 直接砍到 1/4。一个原本 60 多 GB 的 32B 模型,4bit 之后只剩 17~18GB——这才让它能塞进一台消费级 Mac。

一个关键概念:bpw

bpw = bits per weight,每个权重平均占多少比特。它是估算模型体积的根:

权重体积 ≈ 参数量 × bpw ÷ 8(字节)

比如 32B 模型、4bit(bpw≈4.3),体积 ≈ 32 × 4.3 ÷ 8 ≈ 17.2GB。下篇的占用表就是这么算出来的。

损失了什么?没你想的多

压缩总要付代价,代价是精度。但有意思的是——4bit 相比原始的 FP16,质量只掉一点点

衡量这个“掉多少”的指标叫困惑度(perplexity),数值越低代表模型越“确信”、质量越好。实测下来,从 FP16 压到 4bit,困惑度只上升很小一截,但体积砍掉了 3/4。性价比极高。这就是为什么社区公认 4bit 是甜区

一个会反直觉、但极重要的结论

很多人第一反应是“我内存够,那我就下最高精度的版本”。但真相是:

Q4 → Q5 → Q6 的质量差,很小。 14B → 32B,是能力的跨级提升。

换句话说——参数量带来的收益,远远大于量化精度带来的收益。

所以如果你的内存有限,正确策略不是“把一个小模型拉到 Q8 最高精度”,而是“在内存装得下的前提下,塞进尽可能大的模型,量化停在 4bit 这条线上”。

这条心法是整个选型方法论的地基,下篇会反复用到。

三、跑本地大模型,凭什么是 Mac?

讲完软件层,回头说硬件。为什么这两年“在 Mac 上跑大模型”突然成了热门?答案藏在 Apple Silicon 的架构里。

Apple Silicon 靠统一内存装下大模型,MLX 更适合 Mac
Apple Silicon 靠统一内存装下大模型,MLX 更适合 Mac

优势一:统一内存(UMA)

普通 PC 里,内存和显存是分开的。跑大模型靠的是显存(VRAM),而消费级显卡的显存普遍只有 8/12/16GB,想要 24GB 显存得上很贵的卡。

Apple Silicon 是统一内存架构(Unified Memory):CPU 和 GPU 共用同一块内存。这意味着——

你这台 24GB 的 Mac,这 24GB 全都能拿来装模型

一台几千块到一万出头的 Mac,能装下需要 20GB 级“显存”才跑得动的模型。这是 Mac 跑大模型最大的底气。

优势二(也是限制):速度由带宽决定

但“装得下”不等于“跑得快”。本地推理的速度瓶颈,几乎都卡在内存带宽上(memory bandwidth bound)。

一个粗略但好用的直觉:

生成速度(token/s)≈ 内存带宽 ÷ 模型每生成一个 token 要读取的字节数

模型越大,每个 token 要读的数据越多,速度就越慢。这也解释了一个常见现象:同一台 Mac,小模型飞快,大模型能跑但明显变慢。

举几个参考数:入门级 Apple Silicon 带宽一百多 GB/s,到 M4 Pro 这一档 273GB/s,再往上 Max/Ultra 能到五六百甚至上千 GB/s。带宽越高,越能把大模型“喂饱”。这就是为什么真要跑大模型,大家盯着的是 Max/Ultra 加大内存的机型。

优势三:MLX,Apple 的亲儿子框架

回到开头那个困惑——MLX 和 GGUF 到底选哪个?

  • GGUF(llama.cpp 生态):跨平台通吃,Windows/Linux/Mac 都能跑,生态最大、模型最全
  • MLX:Apple 自己为 Apple Silicon 打造的框架,在 Mac 上更省内存、带宽利用更好、推理更快

结论很简单:如果你在 Mac 上,优先选 MLX 版本。 只有当某个模型没有 MLX 版、或你需要某些 GGUF 才有的特性(比如更灵活的 KV cache 量化)时,再退回 GGUF。

综上所述:

到这里,开头那串劝退的字母,应该都不再陌生了:

  • 模型名 = 模型名 + 参数规模 + 模型类型 + 量化格式,四段拆开看
  • 量化 = 把权重从 16bit 压到 4/8bit,4bit 是甜区;记住“参数量 > 量化精度
  • Mac 靠统一内存装得下大模型,速度由带宽决定,框架优先 MLX

下篇我们落到实处,回答三个最硬核的问题:

  1. 你这台 Mac 到底能跑多大的模型?(附 9B 到 40B 的内存占用速查表)
  2. 以输出质量为优先,到底该选哪个?(一套可复用的选型心法)
  3. 怎么把 Qwen3-32B 真正在 24GB 的 MacBook 上跑通?(从抬内存上限到避坑下载,一条龙实操)

下篇见。


本文是「本地大模型选型」系列上篇。如果觉得有用,欢迎转发给同样在 LM Studio 里挑花眼的朋友。