加载中...

cuDNN(CUDA Deep Neural Network library)是 NVIDIA 于 2014 年发布的深度学习原语库,为卷积、池化、归一化、激活、RNN、注意力等神经网络核心运算提供经过深度手工优化的 GPU 实现,是 CUDA 生态在深度学习领域的关键组件。
同一个卷积在 GPU 上有多种实现路径(如隐式 GEMM、FFT、Winograd 变换),最优选择取决于张量形状、数据类型和硬件代际。cuDNN 内置多种算法并提供启发式或穷举式的自动选择机制,并针对 Tensor Core 提供混合精度加速。
PyTorch、TensorFlow、JAX 等主流深度学习框架的 GPU 后端大量调用 cuDNN,普通用户虽然很少直接接触其 API,但训练与推理性能在很大程度上由它决定。
cuDNN 与 cuBLAS、NCCL 等库共同构成了 CUDA 软件护城河的核心:硬件之外,多年积累的算子优化经验同样难以复制,这也是其他 AI 芯片厂商生态追赶的主要难点。

登录 后参与讨论
暂无讨论,来发表第一条评论吧