宕机(Downtime)指服务器、网站或应用因故障或维护停止运行、无法正常访问的状态。本词条介绍宕机的常见原因、计划内与计划外停机的区别、可用性与 SLA 的换算关系,以及监控和预防宕机的常用方法。

| 类型 | IT 运维 / 可用性术语 |
| 英文名 | Downtime |
| 又称 | 当机 停机 服务中断 |
| 相关指标 | 可用性(Uptime) SLA MTTR |
| 反义概念 | 正常运行时间(Uptime) |
| 应用领域 | 服务器运维 网站托管 云计算 |
宕机(Downtime)指服务器、网站或其他计算机系统停止运行、无法对外提供服务的状态,是 IT 运维和主机圈最常用的可用性术语之一,与「正常运行时间(Uptime)」相对。
「宕机」一词源自英文 down(停机、掉线),早期也音译写作「当机」,在中文技术圈逐渐固定为「宕机」的写法。当用户访问某个网站时页面打不开、App 提示服务异常,背后往往就是服务器宕机。对个人博客来说宕机可能只是短暂不便,但对电商、支付、游戏等业务,几分钟的宕机就可能造成直接的收入损失和用户流失,因此「减少宕机时间」是运维工作的核心目标。
宕机通常分为两类:计划内停机指提前安排的维护、升级、迁移,一般会发布公告并选择低峰时段进行;计划外宕机则是突发故障导致的意外中断,事先无法预知,危害也更大。服务商常用可用性百分比来承诺服务质量,并写入 SLA(服务等级协议),例如 99.9% 的可用性意味着每年允许的宕机时间约为 8.8 小时,99.99% 则约为 53 分钟。
业界通常从两方面入手:一是提前预防,通过冗余架构、负载均衡、异地容灾、UPS 不间断电源和定期备份,避免单点故障拖垮整个系统;二是及时发现,用 UptimeRobot、Uptime Kuma、哪吒探针等监控工具对网站和服务器做定时探测,一旦宕机立即通过邮件或即时消息告警,缩短故障响应时间。许多服务商还会提供状态页(Status Page),公开展示各项服务的实时可用性。
问:宕机和死机是一回事吗?答:日常口语中常混用,但侧重点不同:死机多指个人电脑卡死、无响应;宕机更多用于服务器和在线服务,强调「服务不可用」,机器本身未必完全停止运行。
问:网站宕机了应该怎么排查?答:一般按「先外后内」的顺序:先确认是不是自己的网络或 DNS 问题,再检查服务器能否远程登录、服务进程和数据库是否存活、磁盘和内存是否耗尽,最后查看日志定位具体原因。
问:SLA 承诺 99.9% 可用性,宕机超时了怎么办?答:多数云服务商会按 SLA 条款对超出的宕机时间给予代金券或费用补偿,但通常需要用户主动提交工单申请,且赔偿上限有限,重要业务仍应自行做好容灾。

| 类型 | IT 运维 / 可用性术语 |
| 英文名 | Downtime |
| 又称 | 当机 停机 服务中断 |
| 相关指标 | 可用性(Uptime) SLA MTTR |
| 反义概念 | 正常运行时间(Uptime) |
| 应用领域 | 服务器运维 网站托管 云计算 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧