知识蒸馏让小模型(学生)通过模仿大模型(教师)的输出分布来学习,而非直接从硬标签训练,使小模型在参数大幅减少的情况下保留教师模型大部分性能。DistilBERT、TinyBERT 都是蒸馏的经典产物。

| 类型 | 模型压缩技术 |
| 提出者 | Hinton et al., 2015 |
| 代表成果 | DistilBERT(-40% 参数,97% 性能保留) |
Geoffrey Hinton 2015 年提出知识蒸馏,核心洞见很优雅:当一个大模型预测「这张图是猫」时,输出的不只是「猫」这个硬标签,而是一个概率分布——比如猫 0.85、豹子 0.09、狗 0.04。这些「软标签」包含了大模型学到的类间相似关系(猫和豹子确实比猫和汽车更像),信息量远超 one-hot 标签。
小模型(学生)直接对齐教师模型的 softmax 输出(用温度参数 T 平滑分布,使非最大概率更显著),而不是对齐最终的预测类别。训练损失 = 学生自己的交叉熵损失 + 和教师软标签的 KL 散度,两者加权求和。[1]
NLP 领域的蒸馏案例:DistilBERT(HuggingFace,2019)在 BERT-base 基础上蒸馏,参数量减少 40%,推理速度提升 60%,同时保留 97% 的 GLUE 任务性能。TinyBERT(华为,2019)更激进,不只蒸馏输出层,还蒸馏中间层的注意力矩阵和隐藏状态,4 层版本只有 14.5M 参数,能在手机上实时推理。
LLM 时代出现了新形式的「蒸馏」:用 GPT-4 生成大量高质量的回答,用这些数据微调更小的开源模型(如 Vicuna、Alpaca 就是用 GPT-3.5/4 生成的对话数据微调 LLaMA 得到)。这种方式严格说是行为克隆而非传统蒸馏,但效果相当显著,7B 模型有时在特定任务上接近 GPT-3.5。OpenAI 服务条款禁止用其 API 输出训练竞争模型,这是明文规定的原因之一。

| 类型 | 模型压缩技术 |
| 提出者 | Hinton et al., 2015 |
| 代表成果 | DistilBERT(-40% 参数,97% 性能保留) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧