加载中...

Triton 是 OpenAI 开源的 GPU 编程语言和编译器,允许开发者用类 Python 的语法编写高性能 GPU 内核,与 NVIDIA 的 Triton Inference Server 同名但完全无关。
开发者以「块(block)」为粒度描述计算,Triton 编译器自动处理线程分配、内存合并访问、共享内存管理等传统 CUDA 编程中最繁琐的部分,经 MLIR/LLVM 生成 PTX 等目标代码。
PyTorch 2.x 的 torch.compile 默认后端 TorchInductor 就用 Triton 生成 GPU 内核;FlashAttention 变体、量化算子、许多 vLLM 与开源推理项目的自定义算子也用 Triton 编写。
优点是开发效率远高于手写 CUDA,性能常可接近专家手工优化;缺点是对非 NVIDIA 硬件的支持仍在完善,极限性能场景仍可能需要手写内核。

登录 后参与讨论
暂无讨论,来发表第一条评论吧