模型量化(Quantization)是把 AI 模型参数从高精度浮点数转换为低精度数值的压缩技术,能大幅减小模型体积、降低显存占用并加快推理速度,是在消费级显卡甚至手机上本地运行大模型的关键手段。

| 类型 | 模型压缩 / 优化技术 |
| 所属领域 | 人工智能、深度学习 |
| 常见精度 | INT8、INT4、FP8 等 |
| 代表方案 | GPTQ、AWQ、GGUF 量化 |
| 主要用途 | 降低显存占用、加速推理、本地部署大模型 |
模型量化(Quantization)是一种把神经网络中的参数(权重)和计算从高精度浮点数转换为低精度数值表示的模型压缩技术,可在基本保持模型效果的前提下,显著减小模型体积、降低显存占用并提升推理速度。
神经网络的参数通常以 32 位或 16 位浮点数存储和计算,一个拥有数十亿参数的大语言模型,仅权重就可能占用几十 GB 显存,远超普通显卡的容量。量化的思路是用更少的比特来近似表示这些数值,例如把 16 位浮点压缩到 8 位整数(INT8)甚至 4 位(INT4),模型体积可随之缩小到原来的几分之一。
量化的代价是数值精度下降,可能带来一定的效果损失。但实践表明,大模型对适度量化相当宽容:8 位量化通常几乎无损,4 位量化在多数日常任务中也能保持可用的质量,因此量化成了大模型落地部署的标配手段。像 Ollama、llama.cpp 等本地运行工具分发的 GGUF 格式模型,绝大多数就是量化版本。
问:量化会让模型变笨吗?答:会有一定影响,但通常比想象中小。8 位量化几乎无损,4 位量化在闲聊、写作等日常任务中差距不明显;对数学、代码等精细任务,低比特量化的损失会更容易显现。
问:量化和蒸馏、剪枝有什么区别?答:三者都是模型压缩手段。量化是降低数值精度,不改变模型结构;剪枝是删掉不重要的参数;蒸馏则是训练一个小模型去模仿大模型,思路各不相同,也可以组合使用。
问:普通用户如何用上量化模型?答:最简单的方式是使用 Ollama、LM Studio 等本地运行工具,它们下载的模型默认就是量化版;显存紧张时可选更低比特的版本,追求质量则选高比特版本。

| 类型 | 模型压缩 / 优化技术 |
| 所属领域 | 人工智能、深度学习 |
| 常见精度 | INT8、INT4、FP8 等 |
| 代表方案 | GPTQ、AWQ、GGUF 量化 |
| 主要用途 | 降低显存占用、加速推理、本地部署大模型 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧