加载中...
健康端点监控是一种云与微服务架构中的模式:应用暴露一个专用的健康检查接口,外部监控工具或编排平台定期访问它以判断服务是否可用。它是负载均衡、自动扩缩容和故障自愈的重要基础。

| 中文名 | 健康端点监控 |
| 外文名 | Health Endpoint Monitoring |
| 类别 | 可靠性/云设计模式 |
| 典型平台 | Kubernetes |
| 检查类型 | 存活、就绪、启动 |
| 主要用途 | 故障检测与自愈 |
健康端点监控(Health Endpoint Monitoring)是一种可靠性模式,指应用程序对外暴露一个专门的健康检查接口,由外部监控系统、负载均衡器或容器编排平台按固定间隔请求该接口,依据其响应判断实例是否处于健康、可服务的状态。
在分布式与云环境中,服务实例数量众多且随时可能崩溃、卡死或依赖失效,仅凭端口是否监听并不能判断其真正可用。健康端点监控通过一个约定的接口把内部状态外化:接口返回成功表示实例可以正常处理请求,返回失败或超时则表示应将其摘除或重启。它把健康判定标准化,使自动化系统能据此做出流量调度与自愈决策。
该模式是容器编排的标配:Kubernetes 用 liveness、readiness、startup 探针周期性调用健康端点决定重启与流量接入;负载均衡器和服务网格据此摘除不健康后端;云平台的自动扩缩容和监控告警也依赖它。许多框架内置健康检查支持,可聚合各依赖组件的状态形成整体报告。
问:健康检查应该做多深?答:需权衡。检查太浅可能放过依赖故障,检查太深则可能因某个非关键依赖抖动而误判整体不健康,并放大级联失败,通常关键依赖做深检查、非关键依赖降级处理。
问:存活探针和就绪探针为何要分开?答:存活失败会触发重启,适合判断进程是否死锁;就绪失败只是暂时不接流量而不重启,适合启动预热或临时过载,混用会导致不必要的重启。

| 中文名 | 健康端点监控 |
| 外文名 | Health Endpoint Monitoring |
| 类别 | 可靠性/云设计模式 |
| 典型平台 | Kubernetes |
| 检查类型 | 存活、就绪、启动 |
| 主要用途 | 故障检测与自愈 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧