加载中...

QLoRA 是华盛顿大学研究者于 2023 年提出的高效微调方法,将基座模型量化为 4-bit 冻结存放,仅在其上训练 LoRA 低秩适配器,大幅降低微调所需显存。
QLoRA 包含三项关键设计:一是 NF4(4-bit NormalFloat)数据类型,针对权重近似正态分布的特点设计,量化误差小于普通 4-bit 浮点;二是双重量化,对量化常数再做一次量化以进一步省显存;三是分页优化器,利用统一内存在显存不足时把优化器状态换页到内存,避免峰值溢出。反向传播时梯度穿过冻结的 4-bit 权重只更新 LoRA 参数。
论文以该方法在单张 48GB 显卡上微调 65B 模型并训练出 Guanaco 系列。QLoRA 经 bitsandbytes 与 Hugging Face PEFT 集成后,成为开源社区在消费级硬件上微调大模型的主流方案。
量化会带来一定精度损失,训练速度也慢于半精度 LoRA,但显存收益通常远超代价。

登录 后参与讨论
暂无讨论,来发表第一条评论吧