加载中...

Xinference(Xorbits Inference)是国内未来速度(Xorbits)团队开源的模型推理服务平台,目标是让用户一条命令部署并统一管理各类 AI 模型。
平台内置大量模型的开箱配置,覆盖大语言模型、嵌入(embedding)模型、重排(rerank)模型、语音与多模态模型;底层可插拔多种引擎,包括 Transformers、vLLM、SGLang、llama.cpp、MLX 等,自动根据硬件与格式选择;对外统一暴露 OpenAI 兼容 API,支持分布式多机部署与模型多副本。
在国内 RAG 与知识库场景中流行,常与 Dify、RAGFlow、LangChain 等编排框架搭配,一站式提供生成、向量化与重排三类模型服务;对 Qwen、GLM 等国产模型适配及时。
优点是模型覆盖全、中文生态友好、部署简单;缺点是自身不做底层优化,极致性能取决于所选后端引擎。

登录 后参与讨论
暂无讨论,来发表第一条评论吧