加载中...

混合精度训练(Mixed Precision Training)是在神经网络训练中混合使用低精度(FP16、BF16 等)与单精度(FP32)浮点格式的方法:大部分前向与反向计算用低精度执行,权重主副本、梯度累加等对数值敏感的环节保留 FP32。NVIDIA 与百度研究者于 2017 年发表的论文确立了这一方法。
低精度使显存占用近乎减半、允许更大批量,并能利用 Tensor Core 等专用单元获得成倍吞吐提升。
PyTorch 的 AMP(自动混合精度)等框架功能已使其成为默认实践;训练精度进一步向 FP8 演进,推理则普遍使用 INT8/INT4 量化。

登录 后参与讨论
暂无讨论,来发表第一条评论吧