加载中...

模型剪枝(Pruning)是一类模型压缩技术,通过识别并移除对输出影响较小的权重、神经元、注意力头或整层,在尽量保持精度的同时减小模型体积、降低计算量。
非结构化剪枝将单个权重置零,压缩率高但产生稀疏矩阵,需专门硬件或稀疏库(如 NVIDIA 的 2:4 半结构化稀疏)才能真正加速;结构化剪枝直接移除整行、整头或整层,得到的仍是稠密小模型,可在通用硬件上直接加速。剪枝准则常用权重幅值、梯度敏感度或二阶信息,流程上有「训练-剪枝-微调」迭代式与一次性(one-shot)剪枝之分。
「彩票假设」(Lottery Ticket Hypothesis)提出稠密网络中存在可独立训练至同等精度的稀疏子网络,推动了剪枝理论研究。大模型时代出现了 SparseGPT、Wanda 等免重训剪枝方法,以及对 LLM 做层级删减再少量恢复训练的深度剪枝路线。
剪枝与量化、蒸馏常组合使用;压缩率与精度、硬件友好度之间需要权衡。

登录 后参与讨论
暂无讨论,来发表第一条评论吧