【えーあいおぶざーばびりてぃ】

AIオブザーバビリティ とは?

最終更新:
💡 AIアプリで、何が起きたかを記録して調べる

AIアプリケーションの実行を、トレースや数値指標、出力の評価などで把握する取り組み。LLM呼び出し、検索、ツール利用などを追い、品質・性能・利用量の調査や改善に役立てる。

📌 このページのポイント
AIアプリで、何が起きたかを調べる AIアプリの実行 出力 入力 モデル等 返答 観測情報 トレース 呼び出しの流れ 実行を関連づけ 指標 遅延・トークン数 評価 基準に沿い確認 内部の思考を完全に読むものではない
上段は実行、下段は観測と評価の例で、固定の3層構造を定める図ではない。矢印は入力から出力、実行から観測情報への向き。品質評価には基準が必要で、入力・出力の記録範囲は設定と情報の機密性を踏まえて決める。
ひよこ ひよこ
普通の監視と、何が違うの?
ペンギン先生 ペンギン先生
AIアプリでは、サーバーや通信の状態に加えて、モデルに渡した情報や返答、検索やツール実行の流れも調べるよ。モデル呼び出しだけが遅いのか、その前の検索で時間がかかったのか、といった切り分けに役立つんだ。
ひよこ ひよこ
具体的には何を記録するの?
ペンギン先生 ペンギン先生
トレースは一つの処理に含まれるモデル呼び出しやツール利用などを関連づけるよ。数値指標では遅延、エラー、トークン数などを見る。記録できる範囲は実装や設定によるので、何も設定せず全処理が見えるわけではないんだ。
ひよこ ひよこ
それでハルシネーションも分かる?
ペンギン先生 ペンギン先生
出力品質には、別に評価基準や確認方法が必要だよ。参照資料との整合性、人の確認、コードのルール、LLMによる評価などを使い分ける。トレースを集めただけで、誤った回答の割合が自動的に正確に分かるわけではないんだ。
ひよこ ひよこ
AIが何を考えたかも全部見えるの?
ペンギン先生 ペンギン先生
実行記録で分かるのは、記録された入力・出力や呼び出しの関係などだよ。モデル内部の思考や、その返答に至った原因を完全に取り出すものではない。記録と評価を照らし合わせて、問題が起きた箇所や条件を調べよう。
ひよこ ひよこ
とにかく入力も出力も全部保存すればよい?
ペンギン先生 ペンギン先生
会話には機密情報や個人情報が含まれる場合があるよ。記録する範囲、保存先、閲覧できる人などを考えよう。OpenTelemetryのGenAI規約も、入力・出力などの本文を既定で収集せず、必要なときに選べる設計を示している。観測用の保存量も考える必要があるね。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「AIオブザーバビリティ」って出てきたら「AIアプリの実行と品質を、記録や評価で把握すること」と思えればだいたいOK!
📖 おまけ:英語の意味
「AI Observability」 = AIの可観測性
💬 Observability(可観測性)は、観測できる情報からシステムの状態を把握する考え方だよ。ここでは主にLLMを使うアプリの実行記録や評価を扱い、AIの内部思考を直接読むという意味にはしないんだ。

参考資料

← 用語集にもどる