【エルエルエムアズアジャッジ】

LLM-as-a-Judge とは?

最終更新:
💡 LLMに質問と評価基準を渡して、回答を審査してもらう

LLMを評価者として使い、回答の品質を基準に沿って採点・比較する手法。評価の自動化に役立つ一方、順番や長さによる偏り、正誤の取り違えがあるため、人による確認とも組み合わせる。

📌 このページのポイント
質問・基準・回答を渡して比較 質問:3+2は? 基準:計算結果が正確か 回答A 「6です」 回答B 「5です」 審判LLM 回答を比較 判定の例:B 理由:3+2=5 順番・長さの偏りや誤判定も確認
回答AとBを比べる架空の例。基準は計算結果の正確さで、3+2=5なのでBを選ぶ例を示しています。実際のモデル評価や正答を保証する図ではありません。
ひよこ ひよこ
LLM-as-a-Judgeって、AIが審判をすること?
ペンギン先生 ペンギン先生
そうだよ。質問と回答、何を評価するかという基準をLLMに渡すんだ。一つの回答に点数を付ける方法や、二つの回答を比べて、どちらがよいか、あるいは同点かを判断する方法があるよ。
ひよこ ひよこ
人間と同じように評価できるの?
ペンギン先生 ペンギン先生
元のMT-Bench論文では、特定のモデルと評価条件で、人の好みとよく一致する結果が得られたよ。ただし、どんな質問でも同じ精度とは限らない。自分たちの基準に合うか、人の評価と照合して確かめるんだ。
ひよこ ひよこ
どんな場面で使うの?
ペンギン先生 ペンギン先生
モデルやプロンプトを変えたときに、回答の品質を比較する手がかりになるよ。MT-BenchやAlpacaEvalが例だね。評価を繰り返しやすくする一方、費用や処理時間はモデル・件数・回答の長さなどで変わるんだ。
ひよこ ひよこ
公平に判断できるのかな?
ペンギン先生 ペンギン先生
回答を出す順番で結果が変わったり、長いだけの回答を好んだりする偏りが報告されているよ。審判自身が正誤を間違えることもある。「点数が高いから正しい」と決めつけないことが大切なんだ。
ひよこ ひよこ
どうすれば評価を役立てられる?
ペンギン先生 ペンギン先生
基準を明確にし、二つの回答の順番を入れ替えて比べたり、必要に応じて参考解答を渡したりするよ。ただし、対策で誤りがなくなる保証はない。重要な判断では、人による評価や別の検査も組み合わせよう。
もっと詳しく知りたい人へ

好まれる回答を選ぶ評価と、正確さの評価は同じ?

同じとは限りません。AlpacaEvalの開発者も、見た目や文体を事実の正しさより好む偏りや、評価用の質問が実際の用途を代表しない場合を説明しています。何を測る基準かを明示し、正確さが重要なら参考解答や人による確認も使います。

ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「LLM-as-a-Judge」って出てきたら「LLMを回答の採点・比較に使う手法」と思えればだいたいOK!
📖 おまけ:英語の意味
「LLM-as-a-Judge」 = 審判としてのLLM
💬 Judgeは審判や評価者という意味。2023年のMT-Bench論文では、LLMを評価者にする方法と、その限界を調べているよ

参考資料

← 用語集にもどる