加载中...

Text Generation Inference(TGI)是 Hugging Face 开源的大语言模型推理服务框架,用 Rust 编写 Web 服务层、Python 实现模型执行,为文本生成任务提供生产级 API。
TGI 支持连续批处理、张量并行、FlashAttention、PagedAttention,以及 GPTQ、AWQ、bitsandbytes 等多种量化方案;通过 gRPC 在路由层和模型分片间通信,提供 token 流式输出和与 OpenAI 兼容的接口。
它是 Hugging Face 推理端点(Inference Endpoints)和早期开源模型托管的核心引擎,许多公司在 vLLM 流行之前以 TGI 部署 Llama、Falcon 等模型;与 Hugging Face Hub 集成紧密,拉取模型即可启动。
随着 vLLM、SGLang 崛起,TGI 的社区声量有所下降,但仍在 Hugging Face 生态内广泛使用。

登录 后参与讨论
暂无讨论,来发表第一条评论吧