加载中...

Tensor Core(张量核心)是 NVIDIA 自 2017 年 Volta 架构起在 GPU 中集成的专用矩阵运算单元,在单个时钟周期内完成小块矩阵的乘累加运算(如 4x4 矩阵 FMA),吞吐量远高于常规 CUDA Core 的标量浮点运算。
Volta 首代支持 FP16 输入、FP32 累加;Ampere 增加 TF32、BF16 与结构化稀疏加速;Hopper 引入 FP8 与 Transformer Engine;Blackwell 进一步支持更低精度格式。每一代都围绕深度学习的精度需求扩展。
开发者通常不直接编程 Tensor Core,而是通过 cuBLAS、cuDNN、CUTLASS 或框架的混合精度训练功能间接使用;CUDA 也提供 WMMA/MMA 指令供内核级调用。发挥其性能要求矩阵维度对齐和合适的数据排布。
Tensor Core 是 GPU 从通用并行处理器向 AI 专用加速器演化的标志,直接推动了混合精度训练的普及,也是 NVIDIA 在大模型时代保持性能领先的关键硬件设计。

登录 后参与讨论
暂无讨论,来发表第一条评论吧