加载中...

站点可靠性工程(Site Reliability Engineering,SRE)是 Google 于 2003 年由 Ben Treynor Sloss 创立的工程学科,核心思想是「用软件工程的方法解决运维问题」:让工程师编写自动化系统来管理服务,而非依赖人工操作。2016 年出版的《Site Reliability Engineering》(俗称「SRE 圣经」)使其广为传播。
以服务等级目标(SLO)量化可靠性,用错误预算平衡稳定与创新——预算未耗尽可放心发布,耗尽则冻结新功能;限制琐事(toil)占比,要求工程师把足够时间投入自动化开发;并通过 on-call 轮值、免责事后回顾(blameless postmortem)与渐进式发布管理生产风险。
业界常引用 Google 的说法:「SRE 是 DevOps 这个抽象类的一种具体实现」——DevOps 提出打破开发与运维之墙的理念,SRE 给出了一套可操作的岗位设置、指标与流程。
SRE 已成为互联网行业标准岗位,国内大型互联网公司普遍设立 SRE 团队负责稳定性建设。

登录 后参与讨论
暂无讨论,来发表第一条评论吧