加载中...
| 类别 | AI术语 |
| 英文名 | Quantization |
| 领域 | 人工智能 |
模型量化(Quantization)是一种模型压缩技术,通过将神经网络中原本以高精度浮点数(如 32 位或 16 位)表示的权重与激活值,转换为低比特的定点或低精度表示(如 8 位整数、4 位甚至更低),从而减小模型体积、降低内存占用并加速推理计算。它是大模型在资源受限环境中高效部署的关键手段。[1]
量化的本质是将连续的高精度数值范围映射到离散的低精度数值集合。以线性量化为例,通过缩放因子与零点将浮点数值区间均匀映射至整数区间,推理时再按需反量化或直接以整数运算执行。由于低比特表示的数值分辨率下降,量化不可避免地引入误差,关键在于将精度损失控制在可接受范围内。为应对权重与激活中的离群值,研究者发展出分组量化、混合精度量化以及对激活异常值特殊处理等策略。
量化主要分为两类:训练后量化(PTQ),在模型训练完成后直接量化,无需重新训练,流程简便、成本低,但低比特下可能损失较多精度,代表方法如 GPTQ、AWQ;量化感知训练(QAT),在训练或微调过程中模拟量化误差,使模型主动适应低精度,精度保持更好但需额外训练开销。量化粒度可细分至逐张量、逐通道或逐分组。
模型量化广泛用于在消费级显卡、移动设备与边缘端部署大语言模型,使原本需要高端硬件的模型得以在普通设备上运行。例如 4 比特量化可将显存需求降至约四分之一,极大降低了使用门槛。它与蒸馏、剪枝等技术互补,共同推动大模型的轻量化与普惠化,是推理优化领域不可或缺的核心技术。
| 类别 | AI术语 |
| 英文名 | Quantization |
| 领域 | 人工智能 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧