将训练好的模型对外提供预测调用的服务。
『模型推理服务』是把训练好的模型封装为可远程调用的服务,负责接收请求、执行前向计算并返回预测。
它关注吞吐、延迟、成本与扩缩容,常配合量化、批处理与 GPU 池化(如 vLLM、Triton)优化。
是 AI 从『训好』到『用好』的最后一公里,决定线上效果与花费。
登录 后参与讨论
暂无讨论,来发表第一条评论吧