加载中...

Triton 是 OpenAI 开源的 GPU 内核编程语言与编译器,由 Philippe Tillet 创建(源于其 2019 年论文),让开发者用类 Python 语法编写接近手工 CUDA 性能的 GPU 内核。注意与 NVIDIA 的推理服务器 Triton Inference Server 同名但无关。
Triton 采用「以块(tile/block)为中心」的编程模型:开发者描述每个程序实例处理的数据块及块级运算,编译器基于 MLIR/LLVM 自动完成共享内存管理、访存合并、指令调度等传统上需要 CUDA 专家手工处理的优化,最终生成 PTX。
PyTorch 2.0 的编译器 TorchInductor 以 Triton 作为 GPU 代码生成后端,使其成为 PyTorch 生态的事实标准内核语言;FlashAttention 变体、量化算子等大量高性能自定义内核也用 Triton 编写。除 NVIDIA 外,AMD 等厂商也在为其开发后端。
Triton 降低了 GPU 编程门槛并提供跨硬件的可移植层,被视为削弱 CUDA 语言层锁定的重要力量。

登录 后参与讨论
暂无讨论,来发表第一条评论吧