LoRA(低秩微调)是一种参数高效的大模型微调技术:冻结预训练模型原有权重,只训练少量新增的低秩矩阵,就能让大语言模型或绘图模型适配特定任务与风格,大幅降低显存和算力门槛。

| 类型 | 参数高效微调技术(PEFT) |
| 英文全称 | Low-Rank Adaptation |
| 提出方 | 微软研究人员 |
| 提出时间 | 2021 年 |
| 常见变体 | QLoRA 等 |
| 开源仓库 | github.com/microsoft/LoRA |
LoRA(Low-Rank Adaptation,低秩适配,常俗称「低秩微调」)是一种参数高效微调技术,通过在预训练模型中注入可训练的低秩矩阵,用极少的新增参数让大模型适配特定任务。
LoRA 由微软的研究人员于 2021 年提出,最初面向大语言模型的下游任务适配。传统的全量微调需要更新模型的全部权重,对显存和算力要求极高,而且每个任务都要保存一份完整的模型副本。LoRA 的思路是:冻结原模型权重不动,在指定层(通常是注意力层的权重矩阵)旁边并联两个很小的低秩矩阵,训练时只更新这两个小矩阵。
由于低秩矩阵的参数量通常只占原模型的千分之一甚至更少,LoRA 让消费级显卡微调大模型成为可能。训练完成后,低秩矩阵既可以合并回原权重(推理时不增加额外延迟),也可以作为独立的小文件单独分发和加载。
除了大语言模型,LoRA 在 AI 绘画社区同样流行:围绕 Stable Diffusion 等模型训练的画风、人物 LoRA 文件体积很小,便于分享与叠加使用,已成为开源模型生态的通用「插件」格式。
在 LoRA 基础上衍生出多种改进方案,其中 QLoRA 将基础模型量化为低精度后再训练 LoRA 模块,进一步压缩显存占用,使单卡微调更大规模的模型成为可能。Hugging Face 的 PEFT 库、各类绘图 WebUI 以及主流训练框架都内置了 LoRA 支持,它已成为参数高效微调(PEFT)方向最常用的方法之一。
问:LoRA 和全量微调该怎么选?答:资源有限、任务偏向风格或领域适配时优先 LoRA;若数据量很大且追求极致效果,或需要大幅改变模型能力,再考虑全量微调。
问:AI 绘画里的 LoRA 文件是什么?答:就是用 LoRA 方法训练出的低秩权重文件,体积小,加载到 Stable Diffusion 等基础模型上即可生成特定画风或角色。
问:LoRA 会让模型变笨吗?答:由于原权重被冻结,LoRA 对模型通用能力的破坏通常小于全量微调,但训练数据质量差或权重叠加过强时仍可能出现过拟合、画面畸变等问题。

| 类型 | 参数高效微调技术(PEFT) |
| 英文全称 | Low-Rank Adaptation |
| 提出方 | 微软研究人员 |
| 提出时间 | 2021 年 |
| 常见变体 | QLoRA 等 |
| 开源仓库 | github.com/microsoft/LoRA |
登录 后参与讨论
暂无讨论,来发表第一条评论吧