【めとりくす】

メトリクス とは?

最終更新:
💡 システムの様子を、数字で見てみよう

CPU使用率や応答時間、エラー件数など、システムやサービスの状態を数値で測った指標。時刻・単位・集計期間と合わせて、変化や傾向を調べるために使います。

📌 このページのポイント
数字で見る、システムの状態CPU使用率70%平均応答時間120 msエラー率2%リクエスト数1,200件数値は説明用の例(集計期間:直近5分)単位・期間・対象・集計方法も見よう
ダッシュボードのイメージ。数値は正常・異常の基準ではなく、意味や表示方法を説明するための例です。
ひよこ ひよこ
サイトが遅いと言われたら、何を見ればいい?
ペンギン先生 ペンギン先生
応答時間やエラー率、リクエスト数などのメトリクスを、普段の状態と比べてみよう。CPUやメモリの値も手掛かりになるよ。ただし、数値だけで原因を断定せず、いつ・どの機能で変化したかを調べるんだ。
ひよこ ひよこ
ログやトレースとは違うの?
ペンギン先生 ペンギン先生
メトリクスは件数や時間などを数値で測り、集計して傾向を見るのに向いているよ。ログは個々の出来事の記録で、文章だけでなく構造化した形式もある。トレースはリクエストが各処理を通る流れを追うもの。組み合わせると調査の手掛かりが増えるんだ。
ひよこ ひよこ
数値なら全部同じ扱いでいい?
ペンギン先生 ペンギン先生
累積リクエスト数のようなカウンター、現在の使用量のようなゲージ、応答時間の分布を集めるヒストグラムなどがあるよ。累積件数が増えたというだけでは異常とは限らない。一定期間でどれだけ増えたかなど、目的に合う見方をしよう。
ひよこ ひよこ
平均応答時間が短ければ大丈夫?
ペンギン先生 ペンギン先生
少数のとても遅い応答が、平均では見えにくいこともあるよ。分布や、95パーセンタイルのような値も手掛かりになる。これはおおむね95%の観測値がその値以下という意味で、95%の成功率ではないんだ。比較するときは期間や計算方法もそろえよう。
ひよこ ひよこ
どのくらいの間隔で集めて、通知すればいい?
ペンギン先生 ペンギン先生
検知したい変化の速さや保存・処理の負荷に合わせて決めよう。短い変化を長い平均だけで見ると見落とすこともある。通知も「CPUが高い」という一つの値だけでなく、継続時間やエラー率などの利用者への影響と合わせて設計すると判断しやすくなるよ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「メトリクス」って出てきたら「システムの状態や変化を、数字で確かめるための指標」と思えばだいたいOK!
📖 おまけ:英語の意味
「Metrics」 = 指標・測定値
💬 Metricの複数形だよ。ITでは、システムやサービスについて集めた数値を指す場面が多いんだ。

参考資料

← 用語集にもどる