加载中...

| 类型 | 模型压缩与知识迁移技术 |
| 英文名 | Model Distillation |
| 所属领域 | 人工智能、机器学习 |
| 主要角色 | 教师模型、学生模型 |
| 主要用途 | 降低推理成本与部署门槛 |

模型蒸馏是一种模型压缩与知识迁移技术,通过让学生模型学习教师模型的输出或内部表示,在较小规模下尽量保留原模型的能力。
在普通监督学习中,模型主要学习训练数据提供的真实标签;模型蒸馏则会额外利用教师模型给出的概率分布、预测结果或中间特征。这些信息能够反映不同类别之间的相似程度,通常被称为软标签或蒸馏知识。
训练时,学生模型通常同时拟合真实标签和教师模型的输出。部分方法会使用温度参数调整概率分布,使教师模型对各候选结果的判断差异更容易被学生模型学习。完成训练后,部署阶段一般只需运行学生模型。
常见方案包括基于输出概率的响应蒸馏、基于隐藏层信息的特征蒸馏,以及学习样本或特征之间关系的关系蒸馏。实际应用中还可将蒸馏与量化、剪枝等压缩技术结合,但不同任务下的效果取决于数据质量、模型结构和训练目标。
问:模型蒸馏一定会提高准确率吗?答:不一定。它主要用于压缩和迁移能力,学生模型的表现取决于教师质量、容量差异和训练方法。
问:教师模型必须比学生模型大吗?答:通常如此,但并非硬性要求。自蒸馏等方法可以在相同或相近结构之间传递知识。
问:蒸馏后还需要教师模型吗?答:通常训练完成后只部署学生模型,因此可以减少线上推理所需的资源。

| 类型 | 模型压缩与知识迁移技术 |
| 英文名 | Model Distillation |
| 所属领域 | 人工智能、机器学习 |
| 主要角色 | 教师模型、学生模型 |
| 主要用途 | 降低推理成本与部署门槛 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧