加载中...

FP8 是用 8 个比特表示浮点数的格式,由 NVIDIA、Arm、Intel 于 2022 年联合提出规范,包含两种变体:E4M3(4 位指数、3 位尾数,精度较高)和 E5M2(5 位指数、2 位尾数,动态范围较大)。
相比 FP16/BF16,FP8 将存储与带宽需求再减半,并让张量核心以更高吞吐执行矩阵乘法。实践中常配合逐张量或逐块的缩放因子(scaling factor)使用,以弥补窄动态范围;前向计算多用 E4M3,梯度常用 E5M2。
NVIDIA Hopper(H100)与 Ada Lovelace 架构率先提供 FP8 张量核心,后续架构继续强化;TensorRT-LLM、vLLM 等支持 FP8 推理量化,DeepSeek-V3 等模型更将 FP8 用于大规模训练。
FP8 是大模型推理降本增效的重要抓手,正逐步成为高端加速器的标准精度档位。

登录 后参与讨论
暂无讨论,来发表第一条评论吧