【かんし】

監視(モニタリング) とは?

最終更新:
💡 システムの状態を継続的に確かめる

システムの状態や利用者から見た動作を継続的に確かめる活動。収集・表示・通知の役割、監視する指標と対応につながるアラートを解説します。

📌 このページのポイント
監視:状態を集め、必要な対応へ内部の情報利用者からの動作負荷・エラー等ページが開く?収集・整理・表示状態や変化を確認する条件に応じ、必要な通知担当者が確認・対応する傾向や調査にも利用。通知だけで原因は決まらない
内部情報と外からの動作を組み合わせて確かめます。利用者への影響と対応方針から通知条件を設計し、収集や通知の経路も確認します。
ひよこ ひよこ
監視は、壊れたら知らせる仕組み?
ペンギン先生 ペンギン先生
通知は役割の一つだよ。状態に関する情報を集めて表示し、長期の変化や変更前後の比較、問題の調査にも使う。収集・表示・通知を分けて考えると分かりやすい。
ひよこ ひよこ
CPUを見れば、サイトが使えるか分かる?
ペンギン先生 ペンギン先生
CPU使用率などの内部の情報と、利用者から見た動作の確認は役割が違う。内部の数値が正常でも、必要なページが開かない場合がある。両方を組み合わせて確かめよう。
ひよこ ひよこ
どの数字から見るとよい?
ペンギン先生 ペンギン先生
GoogleのSREでは、応答にかかる時間・利用量・エラー・資源の余裕の少なさを、四つの重要な信号として挙げている。サービスの目的に合わせ、平均だけでなく遅い応答や失敗した処理も確認するんだ。
ひよこ ひよこ
少し変わるたび、全部通知したほうがよい?
ペンギン先生 ペンギン先生
対応不要な通知が多いと、本当に必要な知らせが埋もれる。緊急対応が必要か、あとで調べればよいかを分けよう。担当者が何を確認して対応するかまで考えて、通知の条件を決めるんだ。
ひよこ ひよこ
通知が来たら、原因も分かる?
ペンギン先生 ペンギン先生
必ず分かるわけではない。症状を手掛かりに、ログや処理の経路などを調べる。観測可能性は、出力される情報から内部の状態や未知の問題を理解しやすくする性質だ。監視が症状だけ、観測可能性が原因だけ、という完全な区分ではないよ。
もっと詳しく知りたい人へ

CPU使用率が80%なら、必ず異常?

一律には決まりません。必要な応答性能、負荷の特徴、継続時間、資源の上限などと合わせて判断します。CPUだけで利用者の問題や原因を断定せず、サービスに合った条件を決めます。

通知が来なければ、正常と考えてよい?

監視対象にしていない問題や、情報の収集・通知経路の不具合は見逃す場合があります。対象や確認間隔を明らかにし、情報が届いているか、必要な通知が担当者へ届くかも確かめます。

ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「監視」って出てきたら「システムの状態や動作を、継続的に確かめること」と思えばだいたいOK!
📖 おまけ:英語の意味
「Monitoring」 = 状態を継続的に観察・確認すること
💬 ITではサーバーやサービスなどの状態を扱います。画面を人がずっと見続けることだけを指すわけではありません。

参考資料

← 用語集にもどる