加载中...

| 领域 | AI 工程 |
| 精度 | INT8/INT4 |
| 格式 | GGUF/GPTQ |

量化压缩(Model Quantization)是将模型权重与激活从高精度(如 FP16/BF16)降至低精度(如 INT8、INT4)的技术,以减小体积、提升推理速度。
常见格式有 GGUF(配合 llama.cpp)、GPTQ、AWQ 等,可在基本保持效果的同时让大模型在消费级硬件上运行。
是端侧大模型与低成本部署的基石,直接决定模型能否『跑得动、跑得快』。

| 领域 | AI 工程 |
| 精度 | INT8/INT4 |
| 格式 | GGUF/GPTQ |
登录 后参与讨论
暂无讨论,来发表第一条评论吧