加载中...

Triton Inference Server 是 NVIDIA 开源的模型推理服务器,前身为 TensorRT Inference Server,可在 GPU 与 CPU 上统一托管多种框架的模型。
Triton 采用可插拔后端架构,支持 TensorRT、PyTorch、ONNX Runtime、TensorFlow、Python 自定义后端等;对外提供 HTTP/REST 与 gRPC 接口,内置动态批处理(将并发请求合并成批)、并发模型实例、模型热更新和模型集成(ensemble)流水线。
常作为 Kubernetes 上的推理层,统一承载视觉、语音、推荐及 LLM(配合 TensorRT-LLM 后端)等异构模型,提供指标接口便于监控与弹性伸缩。
优点是框架无关、功能全面、生产特性成熟;缺点是配置项繁多、上手门槛较高,轻量场景使用略显笨重。

登录 后参与讨论
暂无讨论,来发表第一条评论吧