
一句话背景:用一份「七板块结构化读书笔记」的硬 prompt,喂同一本书(Dan Koe《目的与利润 / Purpose & Profit》中英对照 PDF,正文约 3.1 万 token),把手头 12 个本地模型挨个拷打一遍。MLX(Metal GPU 推理)和 LM Studio 标准两条路线都上。结论先放这儿:在本地跑大模型,量化等级和那道 ~20GB 的内存墙,比「参数量」和「架构」更能决定你最终能用上谁。
这不是一次只看输出是否流畅的测试。我还把模型给出的“原文锚点”逐条回到原书核对,看它到底是在引用、转述,还是编造。
测试任务很简单,严格按七个板块输出:
| |
一、谁活下来了:运行结果总览
12 个模型里,6 个连门都没进(加载即失败),6 个跑出了结果——其中 5 个老实按格式来,1 个(qwen3-32b-mlx)跑是跑了,但完全没理会格式要求。

| 模型 | 运行方式 | 结果 |
|---|---|---|
| gemma-4-12b-it-mlx | MLX | ✅ 成功 |
| gemma-4-26b-a4b-it-qat | LM Studio(量化) | ✅ 成功 |
| qwen3-14b-dwq-053125-mlx | MLX | ✅ 成功(输出中暴露 <think> 标签) |
| qwen3-14b-dwq-053125 | LM Studio | ✅ 成功 |
| qwen3.6-35b-a3b | LM Studio(MoE) | ✅ 成功 |
| qwen3-32b-mlx | MLX | ⚠️ 跑通但格式失控 |
| deepseek-r1-distill-qwen-32b-mlx | MLX | ❌ 上下文超限(31439 > 16384)+ OOM |
| deepseek-r1-distill-qwen-32b | LM Studio | ❌ 系统内存不足(需 ~21.85 GB) |
| gemma-4-26b-a4b-mlx | MLX | ❌ GPU 内存不足(Metal OOM) |
| qwen3.6-27b-mlx | MLX | ❌ GPU 内存不足(Metal OOM) |
| qwen3.6-27b | LM Studio | ❌ 系统内存不足(需 ~22.54 GB) |
| qwen3.6-35b-a3b-mlx | MLX | ❌ GPU 内存不足(Metal OOM) |
口径说明:6 个跑出结果,但 qwen3-32b-mlx 没遵守格式,所以真正「合格交付」的只有 5 个,合格率 5/12 ≈ 42%。如果只看“能不能跑出内容”,通过率是 6/12;如果按“跑通且按要求交付”计算,合格率只有 5/12。
二、6 个模型为什么没跑起来:三道墙
失败不是玄学,全是物理墙,归成三类。

1. GPU 显存墙(Metal OOM)—— 3 个
gemma-4-26b-a4b-mlx、qwen3.6-27b-mlx、qwen3.6-35b-a3b-mlx 清一色报:
| |
这三个里既有 dense(qwen3.6-27b-mlx)也有 MoE(gemma-4-26b-a4b-mlx、qwen3.6-35b-a3b-mlx)。这里要破一个常见误解:MoE 省的是算力,不是显存——它的全部专家权重仍要按总参数量整个加载进内存,撑不撑得住和 dense 一样看总参数。在常见本地推理场景里,MoE 省的是每次推理激活的专家数量,也就是计算量;但模型权重通常仍要整体加载进内存。所以对 24GB 统一内存的 Mac 来说,MoE 不等于“显存占用按激活参数算”。在本轮测试的这台 24GB Mac 上,26B 及以上的 MLX 模型基本都顶穿了统一内存上限。,至少在本轮这套 MLX 运行方式下,它没有像 LM Studio 那样提前给出“内存不足,拒绝加载”的保护提示;一旦 Metal 内存不够,体感上就是直接OOM。
2. 系统内存墙(RAM 不足)—— 2 个
deepseek-r1-distill-qwen-32b:需 ~21.85 GBqwen3.6-27b:需 ~22.54 GB
两个都超出系统可用量。这里有个细节值得记一笔:LM Studio 是「拒绝加载」,不是「崩溃」。它的保护机制提前拦下,避免把整机拖死冻住。比 MLX 那种「先跑后崩」体感安全得多。
3. 上下文窗口墙 —— 1 个
deepseek-r1-distill-qwen-32b-mlx 报:
| |
整本书 3.1 万 token,直接超出它 16K 的上下文窗口一倍。其余模型没踩这个坑,说明它们窗口更大、或对长文处理更宽容。
小结:当前这台机器的实际天花板大约卡在 20GB 出头——凡是要 22GB+ RAM 的一律启动失败,26B+ 的 MLX 模型一律 Metal OOM。这就是所谓「内存墙」,也是本地大模型选型里第一个、也是最硬的约束。
三、跑通的模型,谁更听话:Prompt 遵从性
能跑 ≠ 听话。把 5 个合格 + 1 个失控放在一起看格式:
| 模型 | 七板块齐全 | 字数限制 | 无开场白/结语 | 纯简体中文 |
|---|---|---|---|---|
| gemma-4-12b-it-mlx | ✓ | ✓(37 字,按汉字计在限内) | ✓ | ✓ |
| gemma-4-26b-a4b-it-qat | ✓ | ✓ | ✓ | ✓ |
| qwen3-14b-dwq-053125-mlx | ✓(含 <think> 块) | ✓ | ✓ | ✓ |
| qwen3-14b-dwq-053125 | ✓ | ✓ | ✓ | ✓ |
| qwen3.6-35b-a3b | ✓ | 一句话超限(41 字) | ✓ | ✓ |
| qwen3-32b-mlx | ✗ 严重违规 | — | 自创段落结构 | ✓ |
qwen3-32b-mlx 是本次最大翻车现场:完全无视七板块,自创了「主要论点 / 关键概念 / 重要案例 / 实践路径」四段结构,硬生生缺了一句话总结、原文锚点、可执行建议、盲区四块。更关键的是,看它暴露出来的 <think> 推理链——模型从一开始就在按自己的框架想(“需要涵盖主要论点、关键概念、重要案例……不超过 600 字”),推理不但没纠偏,反而把错误方向固化了。
这里得出第一个反直觉的结论:参数量不等于指令遵从性。32B 的 qwen3-32b-mlx 格式最差,14B 的两个 qwen3 反而最规整。至少在这次任务里,小模型在 instruction-following 上反而更可靠。这件事在本地部署场景里非常实用。
四、逐板块拆解:质量到底差在哪
格式合格之后,才进入真正的内容比拼。挑三个最能见功力的板块说。
① 一句话总结(≤40 字)—— 最考验提炼能力
| 模型 | 输出 | 点评 |
|---|---|---|
| gemma-4-12b-it-mlx | 通过建立“创业精神”与“创造者”思维,将解决问题的能力转化为个人价值与社会贡献的路径。 | 是「路径描述」不是「主张」,略泛(37 字,字数其实达标) |
| gemma-4-26b-a4b-it-qat | 通过解决自身及他人的问题并创造价值,实现从生存到使命的进化与自我货币化。 | 准确,含核心论点 |
| qwen3-14b-dwq-053125-mlx | 创业精神与自我实现是超越生存与金钱的核心路径。 | 太模糊,更像主题词 |
| qwen3-14b-dwq-053125 | 将使命与收益结合,是实现个人价值的核心路径。 | 简洁,抓到核心 |
| qwen3.6-35b-a3b | 摒弃被动就业心态,以创业者视角主动解决自身问题并通过写作分享方案,实现目的与利润的统一。 | 最具体、最有力,但 41 字、超 40 字限 |
有意思的是:唯一栽在字数上的,反而是质量最高的 35b-a3b(41 字,超 1 字)——信息量足但收不住。最小的 gemma-12b 其实卡在限内(37 字),14b 标准版则拿捏得最稳,可以当「最小正确答案」参考。
② 原文锚点 —— 忠实度的试金石
这一板块要求精确转述原文要点并注明章节,是核对模型「是否在编」的关键。回原书逐句核对后,差距相当明显:
- qwen3.6-35b-a3b 最佳,也是唯一干净通过的:四处锚点全是逐字精确引用,回原文一字不差(如「问题即是道路」「真正的能动性只有在你将所有问题都归咎于自身时才能培养出来」),章节也标得上。这是它拿下总分第一的硬底气。
- gemma-4-26b-a4b-it-qat 次之,但栽了一处:把原文形容**「信息**」的那句「思维操作系统的密码」安到了**「写作**」头上——原文是「信息是你思维操作系统的密码」,张冠李戴。
- qwen3-14b 两版:都有「把转述加上引号当原文」的毛病。标准版更甚,编了一句原文压根没有的「写作是唯一能跨越时间、空间与技术限制的元技能」——看着像引用,其实是脑补。
- qwen3-32b-mlx:该板块直接缺失。
一句话:能不能逐字回引原文,是把「真读进去了」和「凭印象复述」区分开的分水岭。 这一关,只有 35b-a3b 走得干净。
③ 关键概念独特性 —— 谁读得更深
| 模型 | 抓到的特色概念 | 是否忠于原文 |
|---|---|---|
| gemma-4-26b-a4b-it-qat | 「精神熵增」(技能与挑战不匹配导致的无聊/焦虑) | ✓ 书中确有 |
| qwen3.6-35b-a3b | 「价值创造五问框架」(帮谁 / 解决什么 / 想去哪 / 何时见效 / 为何关心) | ✓ 对应原书价值创造章的 5 个问题 |
| qwen3-14b 两版 | 「自然的指南针」 | ✓ 书中确有 |
| gemma-4-12b-it-mlx | 「目的论」 | 解释偏哲学,与全书实操导向略有偏差 |
「精神熵增」和「价值创造五问」都是书里真实存在的硬概念——能把它们单独拎出来,说明模型不只是在复述,而是真读进去了。这是 35b-a3b 和 26b-qat 拉开身位的地方。
五、<think> 泄漏:推理模型的一把双刃剑
本次有 MLX 版思维链模型把 <think> 推理过程暴露在了最终输出里(qwen3-14b-dwq-053125-mlx、qwen3-32b-mlx),这是 MLX 运行时对思维链模型的适配问题,会污染交付质量,调用层得做过滤、或换适配版本。

但更值得玩味的是同样是推理链,结果天差地别:
- qwen3-14b-dwq-053125-mlx:推理链帮模型理清了结构,最终格式完全正确,是所有成功模型里「自我核查格式」最明确的一个——推理是助力;
- qwen3-32b-mlx:推理链从第一句就跑偏,并把错误框架越想越实——推理是反噬。
所以「会思考」不是质量保证。推理链的价值,完全取决于它的方向对不对。
六、综合排名
| 排名 | 模型 | 理由 |
|---|---|---|
| 🥇 1 | qwen3.6-35b-a3b | 最详细、原文引用最精确(唯一逐字回引原文)、章节概括最丰富,结构完整;唯一瑕疵是一句话超 1 字 |
| 🥈 2 | gemma-4-26b-a4b-it-qat | 格式严格合规、一句话精准、字数达标,独家抓到「精神熵增」;理解较深,仅锚点有一处张冠李戴 |
| 🥉 3 | qwen3-14b-dwq-053125 | 简洁流畅、格式零瑕疵、无废话,「最小正确输出」标杆 |
| 4 | qwen3-14b-dwq-053125-mlx | 内容与标准版相近,带推理链,推理质量不错、有格式自检 |
| 5 | gemma-4-12b-it-mlx | 格式正确、内容完整、字数达标,但一句话偏「路径描述」而非「主张」、个别概念(目的论)偏哲学化 |
| 末 | qwen3-32b-mlx | 格式完全不符,参数最大却质量最差,本次最大负面案例 |
七、结论与选型建议
把两轮观察压缩成几条能直接用的硬结论:
内存墙是第一约束,也是最硬的约束。 当前机器实际天花板 ~20GB 出头:22GB+ RAM 一律启动失败,26B+ dense 的 MLX 模型一律 Metal OOM。选型先算内存,再谈质量。
别误读 MoE:它省算力,不省显存。 本次
qwen3.6-35b-a3b能跑、qwen3.6-27bdense 反而 OOM,看着像「MoE 更省内存」,其实是两者量化等级不同造成的假象——那个 27b 用的是偏重的量化(需 ~22.54 GB),而跑通的 35b-a3b 用的是更轻的量化。同精度下,35B 的全部专家权重都要加载,占用按总参数 35B 算,比 27B dense 更高,不是更低。MoE 真正的红利在推理速度和算力,不在内存。参数量 ≠ 听话程度。 32B 格式最烂,14B 格式最稳。要稳定的指令遵从,别只盯参数表。
MLX vs LM Studio,要的不只是速度。 MLX 对 26B+ 模型无法稳定运行,而 LM Studio 有内存保护(拒绝加载而非崩溃),更安全;MLX 版思维链模型还会漏
<think>,需额外过滤。「会思考」不保证质量。 推理链能助力格式自检,也能固化错误方向,全看方向对不对。
实用选型(务必分清「质量最高」和「这台机器跑得动」是两件事):
- 本轮测出的质量榜首是
qwen3.6-35b-a3b,但它能不能落地完全取决于量化:在 24GB 这台机器上,常用量化版本会 OOM;要它跑起来,要么换更大内存(如计划中的 M4 Max 64GB),要么压到 IQ3 一档(约 13–14 GB,质量优势会被吃掉一部分)。「质量第一」≠「你现在用得上」。 - 这台机器今天就稳的选择:
qwen3-14b-dwq-053125(标准版)——实测可跑、质量也已在本轮验证,格式零瑕疵、内容扎实,是最稳的日常档。 - 想要更大体量又跑得动:
Qwen3.6-27B用 IQ4_XS(约 14–15 GB)在 24GB 机器上可稳定运行(本机已验证);不过它的总结质量本轮没测到(测试里那个 27B 用的是更重的量化、直接 OOM 了),建议拿 IQ4_XS 单独跑一遍这套 prompt 再定。 - 想用 MLX 提速:避开 26B+(不论 dense 还是 MoE),并在调用层处理好
<think>泄漏。
如果只让我在这台 24GB Mac 上保留一个日常读书笔记模型,我会先选
qwen3-14b-dwq-053125标准版。理由很简单:它不是本轮质量上限最高的模型,但它跑得动、格式稳、废话少、结果可控。对日常读书笔记来说,“稳定交付”比“理论上更聪明”更重要。本文为同一 prompt、同一本书(《目的与利润》)在本地多模型上的实测对比,硬件与软件版本会影响结果,仅供选型参考。