模型蒸馏(Distillation)是一种模型压缩技术,让小模型模仿大模型的输出来学习其能力,从而在大幅降低参数量和推理成本的同时尽量保留性能,广泛用于大语言模型轻量化和端侧 AI 部署。

| 类型 | 机器学习技术(模型压缩) |
| 英文名 | Knowledge Distillation |
| 主要提出者 | Geoffrey Hinton 等 |
| 核心机制 | 教师-学生模型、软标签学习 |
| 应用领域 | 大模型轻量化、端侧 AI 部署 |
| 相关概念 | 模型微调、模型量化、剪枝 |
模型蒸馏(Knowledge Distillation,知识蒸馏,简称 Distillation)是一种机器学习技术:用一个大而强的「教师模型」指导一个小而快的「学生模型」训练,让学生模仿教师的输出,从而以更少的参数量获得接近的能力。
大型神经网络性能强,但参数量巨大、推理成本高,难以在手机、嵌入式设备等资源受限环境部署。模型蒸馏的思路是:与其让小模型直接从原始数据学习,不如让它学习大模型「消化」后的知识。这一方法由 Geoffrey Hinton 等研究者在论文《Distilling the Knowledge in a Neural Network》中系统提出并推广,此后成为模型压缩领域的主流技术之一。
其关键在于教师模型输出的「软标签」:相比只标注正确答案的硬标签,教师给出的概率分布还包含类别之间的相似性等隐含信息(例如「这张图更像猫而不像卡车」),学生从中能学到远比标准答案丰富的知识。在大语言模型时代,蒸馏也常指用大模型生成的回答作为训练数据来训练小模型,DeepSeek、通义千问等厂商都发布过蒸馏版小模型。
蒸馏被广泛用于 NLP 和视觉领域,如从 BERT 蒸馏出的 DistilBERT 在保留大部分性能的同时明显缩小了体积;大模型厂商也用旗舰模型蒸馏出适合手机、边缘设备运行的轻量版本。此外,用竞争对手 API 的输出做蒸馏训练存在合规争议,多数商业大模型服务条款明确禁止此类行为。
问:蒸馏和微调有什么区别?答:微调是在已有模型上用新数据继续训练以适配特定任务;蒸馏则是知识迁移,目标是让一个小模型学会大模型的能力,二者可以结合使用。
问:蒸馏出的小模型能完全达到大模型的水平吗?答:不能。蒸馏是在性能和成本之间取舍,学生模型通常能保留教师的大部分能力,但在复杂推理等任务上仍会有差距。
问:蒸馏和量化选哪个?答:量化是降低数值精度、不改变结构,实施简单;蒸馏能换更小的模型结构、压缩幅度更大但需要重新训练。追求极致轻量时两者常配合使用。

| 类型 | 机器学习技术(模型压缩) |
| 英文名 | Knowledge Distillation |
| 主要提出者 | Geoffrey Hinton 等 |
| 核心机制 | 教师-学生模型、软标签学习 |
| 应用领域 | 大模型轻量化、端侧 AI 部署 |
| 相关概念 | 模型微调、模型量化、剪枝 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧