加载中...

模型服务化(Model Serving)指把训练完成的机器学习模型部署为长期运行的在线服务,通过 HTTP/gRPC 接口对外提供预测能力,是 MLOps 流程中连接训练与业务的关键环节。
服务化需要解决:请求批处理与并发调度、模型版本管理与灰度发布、多模型共享 GPU、弹性伸缩(含缩容到零)、监控告警与 A/B 测试等。与普通 Web 服务不同,推理负载重、显存昂贵,批处理效率直接决定成本。
通用框架有 Triton Inference Server、TorchServe、TensorFlow Serving;Kubernetes 生态有 KServe、Seldon;面向 LLM 则有 vLLM、SGLang 等专用引擎,以及 OpenAI 兼容 API 这一事实接口标准。
Serverless 推理和推理网关(路由、限流、缓存)正成为新的关注点,服务化能力已是 AI 基础设施团队的核心竞争力。

登录 后参与讨论
暂无讨论,来发表第一条评论吧