加载中...
| 类别 | AI术语 |
| 英文名 | Low-Rank Adaptation |
| 年份 | 2021 年 |
| 领域 | 人工智能 |
LoRA(Low-Rank Adaptation,低秩适配)是一种参数高效微调(PEFT)方法,由微软研究院于 2021 年提出。其核心思想是在冻结预训练模型原始权重的前提下,通过引入少量可训练的低秩矩阵来适配下游任务,从而以极低的计算与存储成本实现接近全量微调的效果。[1]
大模型微调的本质是对权重矩阵施加增量更新 ΔW。LoRA 基于一个关键假设:权重更新在适配过程中具有低「内在秩」。因此它将增量矩阵 ΔW 分解为两个低秩矩阵的乘积 ΔW = BA,其中 A 为降维矩阵、B 为升维矩阵,秩 r 远小于原始维度。训练时仅更新 A 与 B,原权重 W 保持冻结,前向计算为 h = Wx + BAx。由于 r 极小,可训练参数量可降低数百乃至上千倍。推理阶段可将 BA 合并入 W,不增加额外延迟。
LoRA 通常作用于 Transformer 的注意力投影矩阵(查询、键、值及输出)。关键超参数包括秩 r、缩放系数 alpha 以及作用的层位置。在其基础上衍生出多种变体:QLoRA 结合 4 比特量化进一步压缩显存;AdaLoRA 动态分配各层的秩预算;DoRA 将权重分解为幅度与方向分别适配。这些方法在效率与效果之间提供了灵活权衡。
LoRA 已成为大模型定制化的主流手段,广泛用于领域适配、指令微调、角色风格化以及文生图模型的概念注入。由于训练得到的适配器文件体积小巧,便于分发、共享与按需加载切换,在开源社区中催生了庞大的适配器生态,显著降低了大模型个性化定制的门槛。
| 类别 | AI术语 |
| 英文名 | Low-Rank Adaptation |
| 年份 | 2021 年 |
| 领域 | 人工智能 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧