本文是「术语解构」系列之一。

DeepSeek-R1 满血版有 6710 亿参数,而你在 LM Studio 里下载的 R1-Distill-Qwen-14B 只有 140 亿——体积差了大约 48 倍,但它确实“学到了”大模型的推理能力

这中间发生的事,就叫蒸馏(Distillation)。

打开任何一个本地模型下载页,名字里带 “Distill” 的模型比比皆是。但“蒸馏”到底蒸的是什么?它和我们熟悉的量化(比如 IQ4_XS)有什么区别?为什么有人说蒸馏是“教学生”,有人说蒸馏是“抄作业”?

这篇先把概念讲透,下篇上实测数据。

一、为什么叫“蒸馏”:从一锅混合物里提取精华

AI蒸馏不是复制大模型,而是从大模型中提取知识精华
AI蒸馏不是复制大模型,而是从大模型中提取知识精华

化学里的蒸馏,是把一锅混合液加热,让沸点低的成分先变成蒸汽,再冷凝收集——留下的是你想要的精华,扔掉的是杂质

2015 年 3 月,Geoffrey Hinton(就是后来拿了诺贝尔物理学奖的那位)和 Oriol Vinyals、Jeff Dean 发表了论文《Distilling the Knowledge in a Neural Network》,把这个词借到了神经网络领域:

把一个大模型(老师)学到的“知识”,提取出来,灌进一个小模型(学生)的身体里。

注意这个说法的微妙之处:提取的是“知识”,不是“参数”。学生模型的参数是从头训练的,只是训练的目标从“学习标准答案”变成了“模仿老师的判断”。

这和量化有本质区别——量化是给同一个模型降精度,人还是那个人,只是“说话没那么精确了”;蒸馏是重新培养一个新人。这一点我们后面展开。

二、暗知识:老师教的不是答案,是“感觉”

暗知识:老师教给学生的不只是答案,而是答案之间的相似性
暗知识:老师教给学生的不只是答案,而是答案之间的相似性

这是整个蒸馏概念里最精彩的部分,也是 Hinton 那篇论文的核心洞察。

假设我们训练一个识别图片的模型,给它看一张猫的照片。

普通训练用的是硬标签(hard label):

  • 正确答案:猫。就一个字,没了。

蒸馏训练用的是老师模型输出的软标签(soft label),也就是一整个概率分布:

  • 猫:90%
  • 狗:8%
  • 老虎:1.5%
  • 汽车:0.0001%

看出区别了吗?“狗 8%,而汽车几乎是零”——这个差异本身就是知识。它告诉学生:猫和狗长得像,猫和汽车完全不像。这种类别之间的相似性结构,硬标签里根本不存在,只藏在老师的概率分布里。

Hinton 给这东西起了个很浪漫的名字:暗知识(dark knowledge)——像暗物质一样,平时看不见(推理时只取概率最高的那个答案),但它确实存在,而且信息量巨大。

学生模型对着软标签学,相当于老师不仅告诉你答案是 A,还告诉你“B 有点像但差在哪、C 为什么完全不沾边”。一道题传递的信息量,是硬标签的很多倍——这就是为什么蒸馏出来的小模型,往往比同样大小、从零硬训的模型强。

顺便解决一个老疑问:温度参数是从这来的

你在 API 调参时天天见的 temperature,最早的出处之一就是这篇蒸馏论文。

老师模型的输出分布往往太“自信”——猫 99.9%,其他全是零点零几,软标签又快退化成硬标签了,暗知识都被压没了。Hinton 的办法是在计算概率时除以一个温度 T:T 调高,分布被“捂软”,狗和老虎的概率被抬起来,类别间的相似性信息重新显形。学生就对着这个“加温软化”过的分布学。

蒸馏、软化、温度——你看,整套比喻是自洽的。

三、模型瘦身三兄弟:量化、剪枝、蒸馏

量化、剪枝、蒸馏三种模型瘦身方式的区别
量化、剪枝、蒸馏三种模型瘦身方式的区别

本地跑模型的朋友对“瘦身”都不陌生,但这三个词经常被混着用。放一张对比表:

量化 Quantization剪枝 Pruning蒸馏 Distillation
干的事降低每个参数的数字精度砍掉不重要的参数/结构重新训练一个小模型
参数数量不变变少全新的、更少的
需要重新训练吗基本不用通常要微调恢复必须,而且成本不低
一句话类比同一个人,说话保留小数点后 1 位同一个人,切掉冗余记忆教出一个新学生
之前的例子IQ4_XS、Q8_0结构化剪枝模型R1-Distill 全家桶

关键区别:量化和剪枝动的是“同一个模型”,蒸馏产出的是“另一个模型”。

所以这两件事完全可以叠加——你本地跑的 R1-Distill-Qwen-14B 的 IQ4_XS 版本,就是“先蒸馏、再量化”的产物:先教出一个 14B 的学生,再把学生的说话精度压到 4-bit 左右。

四、LLM 时代,“蒸馏”分裂成了两个词

到了大语言模型时代,“蒸馏”这个词的含义悄悄扩大了,很多科普文把两种东西混在一起讲,这里必须掰开:

白盒蒸馏:拿得到老师的“内心活动”

如果老师模型的权重在你手里(比如你自己训的大模型,或开源模型),你就能拿到它对每个 token 的完整概率分布(logits),让学生逐 token 对齐这个分布。

这是 Hinton 原教旨意义上的蒸馏:学的是软标签,吃的是暗知识。

黑盒蒸馏:只拿得到老师“说出口的话”

如果老师是一个闭源 API(你只能看到它输出的文本,看不到概率分布),那你能做的是:用老师生成大量高质量的问答数据,拿这些文本去做监督微调(SFT)

严格说,这已经不是概率分布层面的蒸馏了,本质是“用合成数据训练”。但业界习惯上也管它叫蒸馏——学生学的是老师的“言传”,而不是“心法”。

记住这个区分:白盒学分布,黑盒学文本。下篇要聊的那场著名争议(某闭源大厂指责某开源新贵“蒸馏”了自家模型),争的就是黑盒这一种。

五、把 DeepSeek-R1-Distill-Qwen-14B 这个名字拆开

之前写过一篇本地模型命名规则,这里正好用蒸馏的知识把这个经典名字彻底拆解:

  • DeepSeek-R1:老师是谁——6710 亿参数的推理模型 R1(MoE 架构,每次激活约 370 亿)
  • Distill:用了什么方法——DeepSeek 用 R1 生成了约 80 万条推理数据,对小模型做训练。按上面的分类,这是偏黑盒式的数据蒸馏,只不过老师和学生都在自己手里
  • Qwen:学生的底座是谁——拿 Qwen2.5 系列做基座,而不是从零训练。官方还发了 Llama 底座的版本
  • 14B:学生的体格——140 亿参数

所以这个名字翻译成人话就是:“R1 老师教出来的、Qwen2.5 底子的、14B 的学生”。官方一口气发了 1.5B、7B、8B、14B、32B、70B 六个尺寸,相当于同一个老师带了六个体格不同的学生。

它推理时的思考方式像 R1(会输出长长的思维链),但说话的底子、知识面的边界,还是 Qwen 的——这就是为什么它既不完全像 R1,也不完全像原版 Qwen。像谁更多、差距多大,得靠实测说话。

六、下篇预告:让学生和“没上过课的同龄人”同台考试

概念讲完了,下篇上数据。

在本地设备上让 R1-Distill-Qwen-14B原版 Qwen 14B 跑同一组题(复用之前 12 个模型读书笔记测试那套 prompt),看蒸馏到底带来了什么、丢掉了什么,顺便聊聊那场“蒸馏算学习还是算抄袭”的行业争议。


你本地跑过哪个带 Distill 的模型?和同尺寸的原版比,你感觉差别在哪?