加载中...
尾延迟指请求响应时间分布中处于高百分位的那部分慢请求,如P99、P999延迟。它衡量的是最慢那一小撮请求的表现,在大规模服务中往往比平均延迟更能反映真实用户体验。

| 中文名 | 尾延迟 |
| 英文名 | Tail Latency |
| 常用指标 | P99、P999 |
| 关键成因 | 扇出放大 |
| 领域 | 性能工程 |
尾延迟(Tail Latency)是指系统响应时间分布尾部、即高百分位处的延迟数值,例如第99百分位(P99)或第99.9百分位(P999)延迟,代表最慢的1%或0.1%请求所耗的时间。它刻画的是极端慢请求的表现。
在服务性能评估中,平均延迟容易掩盖问题:即便均值很低,仍可能有少量请求异常缓慢。谷歌的杰夫·迪恩(Jeff Dean)在著名文章中指出,尾延迟在大规模分布式系统中会被显著放大,因为一个用户请求常需扇出到成百上千个后端,只要有一个慢,整体就慢。因此尾延迟被视为衡量服务质量的关键指标。
大型互联网服务普遍以P99延迟作为服务等级目标SLO的核心指标。降低尾延迟的常见手段包括对冲请求(向多个副本发请求取最快返回)、请求超时与重试、资源隔离、以及避免长时间垃圾回收停顿。监控系统通常持续采集并告警高百分位延迟。
问:为什么不只看平均延迟?答:平均值会被大量快速请求拉低,掩盖少数极慢请求;而真实用户中总有人恰好命中慢请求,尾延迟才反映这部分人的糟糕体验,对口碑影响很大。
问:对冲请求为何能改善尾延迟?答:同时或稍后向多个副本发送同一请求,只要其中一个快速返回即可,单个副本偶发的慢响应就被其他副本掩盖,从而压低整体尾部延迟。

| 中文名 | 尾延迟 |
| 英文名 | Tail Latency |
| 常用指标 | P99、P999 |
| 关键成因 | 扇出放大 |
| 领域 | 性能工程 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧