【えるえるえむおぶざーばびりてぃ】
LLMオブザーバビリティ とは?
最終更新:
💡 LLMアプリが何をして、どこで困ったかを追う
LLMアプリのモデル呼出し・検索・ツール実行などをトレースや指標で追い、遅延・費用・エラーや回答品質の問題を調べるための取り組み。
📌 このページのポイント
- 一つのリクエストに含まれるモデル・検索・ツールの処理をつなげて追う
- 処理時間・トークン数・費用・エラーなど、収集できる指標を確認する
- 記録は原因調査や評価に役立つが、回答の正しさを保証しない
- 入力・応答には機密情報も含まれるため、記録範囲や送信先を設計する
LLMアプリがどのモデルやツールを呼び、どこで時間がかかり、何が失敗したかを調べるんだ。取得したトレースや指標を手がかりに、動作を理解する取り組みだよ。
普通のログを集めるだけとは違う?
個々の記録を、質問から回答までの処理の流れに結び付ける点が大切だよ。検索・モデル呼出し・ツール実行などの各ステップを関連付ければ、遅い場所やエラーの前後を調べやすいんだ。
使ったトークンや費用も全部分かる?
対応するツールと収集設定によるよ。例えばLangSmithでは、トークン数とモデルの単価から費用を計算したり、独自の費用を送ったりできる。必要な情報が欠けているのに、請求額まで完全に分かるとは考えないでね。
記録さえあれば、間違った回答はなくなる?
記録そのものが回答を正しくするわけではないよ。トレースを見て原因を探し、評価や利用者のフィードバックと組み合わせて改善するんだ。LangSmithはそのためのツールの一例だよ。
プロンプトや応答は、そのまま全部保存してよい?
機密情報や個人情報が入ることがあるので、保存する項目や閲覧できる人、送信先を決めよう。例えばLangSmithには入力・出力を隠す設定やマスキングがある。必要なら記録しない処理も設けるんだ。
📖 おまけ:英語の意味
「LLM Observability」 = LLM可観測性
💬 ソフトウェアの「オブザーバビリティ(可観測性)」をLLMアプリに適用した概念だよ