【えすあーるいー】
SRE とは?
最終更新:
💡 運用をソフトウェアの力で回す信頼性エンジニアリング
Site Reliability Engineering。Googleで生まれた、ソフトウェアエンジニアリングの手法でサービスの信頼性を高める運用のやり方、またはその職種。SLO・エラーバジェット・トイル削減が代表的な考え方。
📌 このページのポイント
SREって運用エンジニアと何が違うの?
SLI(Service Level Indicator)は「何を測るか」で、例えばリクエストの成功率や応答時間。SLO(Service Level Objective)はその目標値で、例えば「成功率99.9%以上」。SLA(Service Level Agreement)は顧客との契約で、守れないと返金などが決まっているものだよ
エラーバジェットって何?
なんで100%を目指さないの?
SREチームを作るにはGoogleみたいな大企業じゃないとダメ?
まとめ:ざっくりこれだけ覚えればOK!
SREって出てきたら「ソフトウェアエンジニアリングの手法でシステムの信頼性を高めるやり方・職種」と思えればだいたいOK!
📖 おまけ:英語の意味
「Site Reliability Engineering」 = サイト信頼性エンジニアリング
💬 2003年にGoogleのBenjamin Treynor Slossが始めたよ。「ソフトウェアエンジニアに運用チームを設計してもらったら生まれるもの」と説明されているんだ
参考資料
- Site Reliability Engineering, Chapter 1: Introduction(Google)
- Site Reliability Engineering, Chapter 3: Embracing Risk(Google)
- Site Reliability Engineering, Chapter 5: Eliminating Toil(Google)
- The Site Reliability Workbook: How SRE Relates to DevOps(Google)
- The Site Reliability Workbook: SRE Team Lifecycles(Google)