【ふぇいるおーばー】

フェイルオーバー とは?

最終更新:
💡 障害時に別の系へ切り替える仕組み

稼働中のシステムに障害が起きたとき、別の系へ切り替えてサービスを復旧・継続する仕組み。切替えは自動の場合も手動の場合もあり、中断やデータ損失への対策が必要になる。

📌 このページのポイント
フェイルオーバー:担当する系を切替え 通常時 切替え後 主系 担当中 旧主系 障害 待機系 待機中 新主系 担当中 切替え 待機側も起動する場合あり 自動・手動は構成次第。中断への対策も必要
主系と待機系の構成例。切替え先への接続と、旧主系が書き込みを続けない対策も考える。
ひよこ ひよこ
フェイルオーバーって何?
ペンギン先生 ペンギン先生
メインのサーバなどに障害が起きたとき、別の系へ切り替えてサービスを復旧・継続する仕組みだよ。自動で切り替える製品もあるけれど、手動で行う構成もある。必ず無停止になるという意味ではないんだ
ひよこ ひよこ
アクティブ-スタンバイって何?
ペンギン先生 ペンギン先生
普段サービスを担当する主系と、切替え先の待機系を用意する構成だよ。待機系も起動してデータの更新を受け取っている場合がある。一方、アクティブ-アクティブでは複数の系が普段からサービスを担当するんだ
ひよこ ひよこ
切替え先があれば、それだけで大丈夫?
ペンギン先生 ペンギン先生
データベースなら待機系の昇格、アプリの接続先変更、旧主系が書き込みを受け続けない対策が必要だよ。更新を非同期で伝えている場合、まだ届いていない更新を失う可能性もある。切替え手順を実際に試しておこう
ひよこ ひよこ
切替え時間はゼロにできるの?
ペンギン先生 ペンギン先生
アクティブ-アクティブでも無停止とは限らないよ。障害の検知や接続の再試行に時間がかかったり、残った系の処理能力が足りなかったりする。RTOは復旧まで何時間止められるか、RPOは何時間分の更新を失うことまで許容するか、という目標なんだ
ひよこ ひよこ
クラウドではどんな例があるの?
ペンギン先生 ペンギン先生
RDSのマルチAZ DBインスタンス構成では、障害時に別AZの待機側へ自動で切り替わるよ。公式資料では通常60〜120秒で、長いトランザクションなどで延びる場合もある。別リージョンでの復旧は別途設計・検証が必要で、マルチAZだけでリージョン全体の災害に備えられるわけではないんだ
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「フェイルオーバー」って出てきたら「障害時に別の系へ切り替える仕組み」と思えばだいたいOK!
📖 おまけ:英語の意味
「Failover」 = 障害時の切替え
💬 障害が起きた系から別の系へ役割を移すこと。切替え先を用意するだけでなく、接続先の変更や復旧手順も考えるよ

参考資料

← 用語集にもどる