【えーあいおぶざーばびりてぃ】
AIオブザーバビリティ とは?
最終更新:
💡 AIアプリで、何が起きたかを記録して調べる
AIアプリケーションの実行を、トレースや数値指標、出力の評価などで把握する取り組み。LLM呼び出し、検索、ツール利用などを追い、品質・性能・利用量の調査や改善に役立てる。
📌 このページのポイント
- モデル呼び出し・検索・ツール実行などの流れをトレースする
- 遅延・エラー・トークン数などの指標と、出力品質の評価を組み合わせる
- 実行の記録は、モデル内部の思考や因果関係を完全に説明するものではない
- 入力・出力には機密情報もあり、記録範囲や保存先を設計する
普通の監視と、何が違うの?
具体的には何を記録するの?
トレースは一つの処理に含まれるモデル呼び出しやツール利用などを関連づけるよ。数値指標では遅延、エラー、トークン数などを見る。記録できる範囲は実装や設定によるので、何も設定せず全処理が見えるわけではないんだ。
それでハルシネーションも分かる?
出力品質には、別に評価基準や確認方法が必要だよ。参照資料との整合性、人の確認、コードのルール、LLMによる評価などを使い分ける。トレースを集めただけで、誤った回答の割合が自動的に正確に分かるわけではないんだ。
AIが何を考えたかも全部見えるの?
実行記録で分かるのは、記録された入力・出力や呼び出しの関係などだよ。モデル内部の思考や、その返答に至った原因を完全に取り出すものではない。記録と評価を照らし合わせて、問題が起きた箇所や条件を調べよう。
とにかく入力も出力も全部保存すればよい?
会話には機密情報や個人情報が含まれる場合があるよ。記録する範囲、保存先、閲覧できる人などを考えよう。OpenTelemetryのGenAI規約も、入力・出力などの本文を既定で収集せず、必要なときに選べる設計を示している。観測用の保存量も考える必要があるね。
📖 おまけ:英語の意味
「AI Observability」 = AIの可観測性
💬 Observability(可観測性)は、観測できる情報からシステムの状態を把握する考え方だよ。ここでは主にLLMを使うアプリの実行記録や評価を扱い、AIの内部思考を直接読むという意味にはしないんだ。