加载中...

首词延迟(Time To First Token,TTFT)指从客户端发出请求到收到模型生成的第一个 token 之间的时间,是大语言模型在线服务最重要的体验指标之一。
TTFT 主要由排队等待、提示词预填充(prefill)计算两部分构成,输入越长、并发越高,TTFT 越大。与之配套的指标还有 TPOT/ITL(每输出 token 时间、token 间延迟)和整体吞吐量(token/s),分别刻画生成流畅度与系统容量。
常见优化包括:分块预填充(chunked prefill)避免长提示词阻塞、前缀缓存复用公共系统提示、PD 分离、流式输出,以及在网关层做负载均衡与优先级调度。
对话、代码补全等交互式场景对 TTFT 极为敏感;服务等级目标(SLO)通常同时约束 TTFT 和 token 间延迟,推理框架的调度器需在吞吐与时延间权衡。

登录 后参与讨论
暂无讨论,来发表第一条评论吧