加载中...
量化(Quantization)将神经网络的权重和激活从高精度浮点数(FP32/FP16)压缩为低比特整数(INT8/INT4/甚至 INT2),大幅降低模型显存占用和推理延迟,是让大模型在消费级硬件上运行的关键技术。

| 类型 | 模型压缩技术 |
| 主流精度 | INT8(精度好)/ INT4(显存小)/ FP8(训练用) |
| 关键工具 | GPTQ、llama.cpp GGUF、AWQ、bitsandbytes |
训练神经网络通常用 FP32(32 位浮点)或 FP16/BF16(16 位),但推理时这么多位精度并非必要——实验表明,模型权重从 FP16 压缩到 INT8(8 位整数)后,大多数任务的准确率损失不到 1%,但内存减少一半,矩阵乘法速度也因为整数运算更快而提升。
训练后量化(PTQ,Post-Training Quantization)不需要重新训练,只需用少量校准数据确定量化参数,是工业界最常用的方式。量化感知训练(QAT)在训练中模拟量化误差,精度更好但成本更高,适合对精度极敏感的场景。[1]
LLM 的量化比 CNN 困难,因为 Transformer 中某些层(特别是 MHA 中的激活值)存在异常大的数值,直接量化会严重失真。
目前量化到 4-bit 被认为是甜蜜点:显存减少 4 倍,性能损失可接受;继续压缩到 2-bit 则性能骤降。

| 类型 | 模型压缩技术 |
| 主流精度 | INT8(精度好)/ INT4(显存小)/ FP8(训练用) |
| 关键工具 | GPTQ、llama.cpp GGUF、AWQ、bitsandbytes |
登录 后参与讨论
暂无讨论,来发表第一条评论吧