加载中...
迁移学习将在大数据集上预训练的模型知识迁移到数据稀缺的新任务上,大幅降低了训练数据和计算资源的需求。ImageNet 预训练、BERT 微调范式是迁移学习最成功的两个工业化实践。

| 类型 | 机器学习方法论 |
| NLP 里程碑 | BERT(2018)、GPT-3 In-Context Learning(2020) |
| 关键技术 | Fine-tuning、LoRA、Prompt Tuning |
迁移学习的直觉来自人类学习:学会骑自行车的人学摩托车比从头开始快很多,因为平衡感和转向直觉是共通的。神经网络同理——在 ImageNet 130 万张图上训练的 ResNet,浅层卷积核学到的边缘和纹理检测,对医学 CT 图像分类同样有用,只需在医学数据上微调(fine-tune)最后几层。
NLP 领域,2018 年 BERT 横空出世后,「预训练 + 微调」成为标配:在千亿词的文本上预训练通用语言理解能力,再用几百到几千条标注数据微调到具体任务(情感分析、NER、问答)。相比从头训练,BERT 微调只需原来 1/100 的数据就能达到相近效果。[1]
GPT-3 提出了更激进的少样本学习(Few-Shot Learning):不更新任何参数,只在提示词里放几个示例,模型就能完成新任务。这依赖于预训练阶段隐式学到的通用推理能力,是迁移学习的极端形式。
另一个趋势是参数高效微调(PEFT):LoRA(Low-Rank Adaptation,2021)只冻结预训练权重,在每层旁边加一个低秩矩阵学习增量,可训练参数只占总参数的 0.1%-1%,但效果接近全量微调,让在消费级 GPU 上微调 70B 模型成为可能。

| 类型 | 机器学习方法论 |
| NLP 里程碑 | BERT(2018)、GPT-3 In-Context Learning(2020) |
| 关键技术 | Fine-tuning、LoRA、Prompt Tuning |
登录 后参与讨论
暂无讨论,来发表第一条评论吧