加载中...

NVIDIA NIM(NVIDIA Inference Microservices)是 NVIDIA 于 2024 年 GTC 大会推出的推理微服务产品,把预优化的模型与推理引擎打包成标准容器镜像,企业拉取后即可获得生产级模型 API。
每个 NIM 容器内置针对具体 GPU 架构调优的引擎(如 TensorRT-LLM 或 vLLM)、模型权重获取逻辑与 OpenAI 兼容接口,启动时自动探测硬件并选择最优配置;配合 Kubernetes 与 NIM Operator 可做弹性伸缩,属于 NVIDIA AI Enterprise 软件套件的一部分。
除大语言模型外,还提供嵌入、重排、语音、视觉、生物医药(如蛋白质结构)等多领域模型微服务,以及用于构建智能体检索流水线的 NeMo Retriever 系列。
NIM 体现了 NVIDIA 从卖硬件向「硬件加软件订阅」延伸的战略,降低了企业私有化部署优化推理栈的门槛,但也加深了对其生态的绑定。

登录 后参与讨论
暂无讨论,来发表第一条评论吧