加载中...

TensorRT 是 NVIDIA 推出的深度学习推理优化 SDK,包含模型优化器与运行时:把训练好的模型(经 ONNX 等格式导入)编译为针对特定 GPU 高度优化的推理引擎。
面向大语言模型,NVIDIA 在其基础上推出 TensorRT-LLM,内置 KV 缓存管理、In-flight Batching、张量并行等推理关键技术,与 Triton Inference Server 配合完成服务化部署。
引擎与 GPU 型号和 TensorRT 版本绑定,需按部署环境分别构建;对包含非常规算子的模型需编写插件,灵活性不如通用框架直接推理。

登录 后参与讨论
暂无讨论,来发表第一条评论吧