加载中...

| 类别 | AI术语 |
| 英文名 | Knowledge Distillation |
| 领域 | 人工智能 |
模型蒸馏(Knowledge Distillation,模型蒸馏)是一种模型压缩与知识迁移技术,通过让一个轻量的学生模型模仿一个性能强大但庞大的教师模型的行为,使学生模型以远小的规模逼近教师的能力。其核心思想是将教师模型中蕴含的暗知识提炼并传递给学生,从而在保持较高性能的同时显著降低部署成本。[1]
经典蒸馏由 Hinton 等人提出。教师模型输出的并非硬标签,而是经过温度软化的概率分布(软标签),这些软标签包含了类别之间的相对相似性信息,即所谓暗知识,其信息量远超单一的正确答案。学生模型的训练目标通常是一个复合损失:既拟合真实硬标签,又通过 KL 散度对齐教师的软标签输出。提高温度参数可使概率分布更平滑,凸显非目标类别的细微信息。除输出层蒸馏外,还可对中间层特征、注意力图或样本间关系进行匹配,实现更细粒度的知识传递。
蒸馏可分为多种范式:基于响应的蒸馏对齐输出分布;基于特征的蒸馏对齐隐层表示;基于关系的蒸馏对齐样本间结构。在大语言模型时代,序列级知识蒸馏让学生模仿教师生成的文本,而数据蒸馏则利用强大教师生成高质量合成数据来训练学生,成为打造高效小模型的重要手段。
模型蒸馏广泛应用于将大模型压缩为可在移动端、边缘设备运行的轻量版本,在推理速度、内存占用与能耗之间取得优良平衡。它常与量化、剪枝等压缩技术结合使用,是大模型走向规模化、低成本落地的关键环节,使先进 AI 能力得以普惠部署。

| 类别 | AI术语 |
| 英文名 | Knowledge Distillation |
| 领域 | 人工智能 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧