【えらーばじぇっと】

エラーバジェット とは?

最終更新:
💡 信頼性と新しい挑戦を、同じものさしで考える

サービスレベル目標(SLO)から決まる、一定期間に許容する失敗などの上限。信頼性と新機能の開発を両立するために、消費量と合意した運用方針を使って判断する。

📌 このページのポイント
エラーバジェット:目標から決める枠成功率のSLO:99.9%失敗の許容割合:0.1%例:対象のリクエストが100万件許容枠1,000件500件失敗したら枠を50%消費残量と消費速度で、開発と安定化を判断
リクエスト成功率で測る例。時間ベースで測る場合は時間で計算し、対応は合意した方針に従います。
ひよこ ひよこ
どうしてエラーに予算があるの?
ペンギン先生 ペンギン先生
信頼性を守りながら新機能も届けたいからだよ。目標の信頼性をSLOとして決め、どこまでの失敗を許容するかを数値にする。残量や消費速度を共有すると、開発と運用で判断するための共通のものさしになるんだ。
ひよこ ひよこ
どうやって計算するの?
ペンギン先生 ペンギン先生
成功率のSLOが99.9%なら、失敗の許容割合は100% − 99.9% = 0.1%だよ。対象のリクエストが100万件なら、許容枠は1,000件。時間ベースで30日間の稼働率を測る場合なら43.2分になる。同じ99.9%でも、測る対象によって件数か時間かが変わるんだ。
ひよこ ひよこ
残っていれば、壊してもいいの?
ペンギン先生 ペンギン先生
意図的に利用者を困らせるための枠ではないよ。残っていてもテストや安全なリリース手順は必要。どれだけのリスクを取れるか、信頼性の改善をいつ優先するかを考えるために使うんだ。
ひよこ ひよこ
使い切ったら、全部止めるの?
ペンギン先生 ペンギン先生
事前に合意したエラーバジェットポリシーで決めるよ。新機能の変更を控えて信頼性改善を優先する方法がある。一方、Googleの公開例では緊急対応やセキュリティ修正に例外を設けている。どの変更を止めるか、誰が判断するかも明文化しよう。
ひよこ ひよこ
月が変われば、必ず復活する?
ペンギン先生 ペンギン先生
月ごとの固定期間なら区切りが変わるけれど、直近4週間などの移動する期間で測る方法もあるよ。古い失敗が期間外に出ると状況が変わる。まず測定期間と成功・失敗の数え方をそろえ、消費が急増したときにも気づけるようにしよう。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「エラーバジェット」って出てきたら「目標の信頼性から決める、失敗の許容枠」と思えばだいたいOK!
📖 おまけ:英語の意味
「Error Budget」 = エラー予算
💬 お金の予算のように、失敗の許容枠とその消費を把握して判断する考え方だよ。

参考資料

← 用語集にもどる