加载中...

AWQ(Activation-aware Weight Quantization,激活感知权重量化)是 MIT 韩松团队于 2023 年提出的大语言模型训练后量化方法,获 MLSys 2024 最佳论文奖。
AWQ 观察到权重的重要性并不均匀:约百分之一的显著权重通道对模型输出影响极大,而这些通道应依据激活值的幅度而非权重本身来识别。方法通过对显著通道施加逐通道缩放,在数学等价变换下降低其量化误差,再将全部权重量化到 4 比特,无需反向传播或重训练。
AWQ 是 W4A16(4 比特权重、16 比特激活)部署的主流方案之一,vLLM、LMDeploy、AutoAWQ、llama.cpp 生态等广泛支持,Hugging Face 上大量开源模型提供官方 AWQ 版本。
优点是校准快、泛化好、精度保持优于早期逐层重建方法;缺点是主要压缩权重,对激活量化和极低比特场景需其他方法配合。

登录 后参与讨论
暂无讨论,来发表第一条评论吧