【エルエルエムアズアジャッジ】
LLM-as-a-Judge とは?
最終更新:
💡 LLMに質問と評価基準を渡して、回答を審査してもらう
LLMを評価者として使い、回答の品質を基準に沿って採点・比較する手法。評価の自動化に役立つ一方、順番や長さによる偏り、正誤の取り違えがあるため、人による確認とも組み合わせる。
📌 このページのポイント
そうだよ。質問と回答、何を評価するかという基準をLLMに渡すんだ。一つの回答に点数を付ける方法や、二つの回答を比べて、どちらがよいか、あるいは同点かを判断する方法があるよ。
人間と同じように評価できるの?
元のMT-Bench論文では、特定のモデルと評価条件で、人の好みとよく一致する結果が得られたよ。ただし、どんな質問でも同じ精度とは限らない。自分たちの基準に合うか、人の評価と照合して確かめるんだ。
どんな場面で使うの?
モデルやプロンプトを変えたときに、回答の品質を比較する手がかりになるよ。MT-BenchやAlpacaEvalが例だね。評価を繰り返しやすくする一方、費用や処理時間はモデル・件数・回答の長さなどで変わるんだ。
公平に判断できるのかな?
回答を出す順番で結果が変わったり、長いだけの回答を好んだりする偏りが報告されているよ。審判自身が正誤を間違えることもある。「点数が高いから正しい」と決めつけないことが大切なんだ。
どうすれば評価を役立てられる?
基準を明確にし、二つの回答の順番を入れ替えて比べたり、必要に応じて参考解答を渡したりするよ。ただし、対策で誤りがなくなる保証はない。重要な判断では、人による評価や別の検査も組み合わせよう。
もっと詳しく知りたい人へ
好まれる回答を選ぶ評価と、正確さの評価は同じ?
同じとは限りません。AlpacaEvalの開発者も、見た目や文体を事実の正しさより好む偏りや、評価用の質問が実際の用途を代表しない場合を説明しています。何を測る基準かを明示し、正確さが重要なら参考解答や人による確認も使います。
📖 おまけ:英語の意味
「LLM-as-a-Judge」 = 審判としてのLLM
💬 Judgeは審判や評価者という意味。2023年のMT-Bench論文では、LLMを評価者にする方法と、その限界を調べているよ