【いんしでんとかんり】

インシデント管理 とは?

最終更新:
💡 影響を抑え、サービスの回復を進める

ITサービスの中断や品質低下への影響を抑え、通常のサービスを早く回復する活動。優先度、対応役割、問題管理との違いを解説します。

📌 このページのポイント
インシデント管理:影響を抑えて回復へ検知・判断影響と緊急性を確認役割・連絡指揮・技術対応状況を共有回復・確認回避策も含め使えるか確認対応中も連絡・記録を続ける結果と回復の確認を残して終了問題管理:原因・再発への対策は別に追跡調査を並行する場合もある詳しい振り返りの対象は条件で決める
サービス回復を進める対応例です。連絡と記録は途中も続き、問題管理や原因調査は必ず終了後だけに行うものではありません。
ひよこ ひよこ
インシデント管理は、障害の原因を見つけること?
ペンギン先生 ペンギン先生
原因の調査も対応に関わるけれど、中心の目的は影響を抑え、サービスを早く回復することだ。例えば、ログインできなくなったサービスを、利用者が再び使える状態へ戻すために対応する。
ひよこ ひよこ
問題管理とは何が違う?
ペンギン先生 ペンギン先生
インシデントは予定外の中断や品質低下、問題はインシデントの実際の原因や潜在的な原因を指す。インシデント管理では回復を進め、問題管理では原因や再発への対応を扱う。必ず別々の時期に行うとは限らず、調査を並行することもある。
ひよこ ひよこ
どの障害から対応する?
ペンギン先生 ペンギン先生
影響と緊急性で優先度を考える。誰のどの業務が止まるか、影響が広がるまでどのくらい時間があるかを確認する。メールだから必ず最優先、プリンターだから低優先とは決められない。分類や応答目標は組織で共有しておこう。
ひよこ ひよこ
みんなで一斉に調べれば早い?
ペンギン先生 ペンギン先生
誰が対応をまとめるか、誰が技術的な操作をするか、誰が状況を知らせるかを決めると、重複や混乱を減らせる。GoogleのSREの例では、指揮、実作業、連絡などを分担し、現在の状況を共有する文書を使う。小さな障害では兼務することもあるよ。
ひよこ ひよこ
原因を完全に直さないと、復旧と呼べない?
ペンギン先生 ペンギン先生
回避策で通常のサービスを回復する場合もある。例えば問題のある変更を戻して、利用できる状態へ回復する。操作のリスクや承認も確認し、監視や利用者への確認で回復を確かめる。原因の恒久対策は別に追跡できる。
ひよこ ひよこ
終わったら、何を残す?
ペンギン先生 ペンギン先生
起きた影響、時刻、対応、回復の確認などを記録する。重大な障害など、事前に決めた条件に当てはまる場合は振り返りを行う。人を責めるためではなく、仕組みの改善と、その実施を追うための記録にするんだ。
もっと詳しく知りたい人へ

重大度と優先度は、いつも同じ?

重大度は影響の深刻さを示し、優先度は対応の相対的な重要さや急ぎ方を示します。名称や尺度は組織ごとに違います。重大度のラベルだけで機械的に決めず、業務影響と緊急性を共通の基準で評価します。

すべてのインシデントで、詳しい事後報告が必要?

すべてに同じ深さの報告を求めるとは限りません。GoogleのSREの例では、利用者への影響やデータ損失、復旧の手間などの条件をあらかじめ決めています。通常の対応記録と、詳しい振り返りの対象を区別します。

ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「インシデント管理」って出てきたら「ITサービスの中断や品質低下の影響を抑え、通常の状態へ回復する活動」と思えばだいたいOK!
📖 おまけ:英語の意味
「Incident Management」 = インシデント管理
💬 ITIL 4の管理プラクティスの一つです。インシデントという出来事と、それへの対応を管理する活動を区別します。

参考資料

← 用語集にもどる