加载中...

GEMM(General Matrix Multiply,通用矩阵乘法)是 BLAS(基础线性代数子程序)第三级中定义的运算,形式为 C = alpha·A·B + beta·C。它是科学计算与深度学习中最重要的计算原语:全连接层、卷积(可转化为隐式 GEMM)、注意力机制的核心计算最终都归结为矩阵乘。
朴素三重循环实现受内存带宽限制,高性能 GEMM 的关键是分块(Tiling):把矩阵切成适配缓存/共享内存/寄存器的层级小块,最大化数据复用,使计算强度(每字节内存访问对应的运算量)足以逼近硬件峰值算力。GPU 上还需精心安排线程块布局、双缓冲预取和 Tensor Core 指令。
CPU 上有 Intel MKL、OpenBLAS 等;GPU 上有 NVIDIA cuBLAS 及开源模板库 CUTLASS,后者允许开发者定制融合内核。硬件评测常用 GEMM 实测值衡量芯片的实际可达算力。
「AI 计算本质上是 GEMM 的艺术」——从 Tensor Core 到 TPU 脉动阵列,当代 AI 芯片的设计核心正是高效执行矩阵乘。

登录 后参与讨论
暂无讨论,来发表第一条评论吧