加载中...

GPTQ 是 2022 年由 IST Austria 等机构研究者提出的大语言模型训练后量化(PTQ)算法,论文题为《GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers》。
GPTQ 继承 Optimal Brain Quantization 的思路,逐层最小化量化前后输出的重建误差:利用 Hessian 矩阵的二阶信息,按列量化权重并把误差补偿到尚未量化的列上,通过 Cholesky 分解等工程优化使百亿参数模型能在数小时内完成 3/4 比特量化。
GPTQ 是最早让大模型 4 比特量化实用化的方法之一,催生了 AutoGPTQ、GPTQModel 等工具库,vLLM、TGI 等推理框架均支持加载 GPTQ 模型。
优点是压缩率高、推理省显存;缺点是量化需要校准数据且耗时长于 AWQ,个别任务上可能出现可感知的精度回退。

登录 后参与讨论
暂无讨论,来发表第一条评论吧