【ほうしゅうもでる】
報酬モデル とは?
最終更新:
💡 回答に点数をつける、AIの採点役
行動や出力への評価を、数値の報酬として予測する学習済みモデル。言語モデルのRLHFでは、人間による回答の比較評価などを学び、回答にスコアを付けるために使われる。
📌 このページのポイント
報酬モデルって、文章を作るAIとは違うの?
言語モデルのRLHFでは役割が違うよ。文章を作るモデルに対して、報酬モデルは質問と回答を受け取り、評価を数値として予測する。毎回すべての回答を人が採点する代わりに、学んだ評価基準を使うんだ。
どうやって評価基準を教えるの?
例えば、同じ質問に対する複数の回答を人に比較してもらうよ。InstructGPTの論文では、どちらの回答が好まれるかという比較データで学習している。評価者の好みや、示した評価方針を反映するので、誰にとっても唯一の正解になるわけではないんだ。
点数が0.9なら、90%正しいという意味?
そのように決めつけないでね。報酬スコアの尺度は設計による。InstructGPTの報酬モデルは1つの数値を出すけれど、回答が正しい確率をそのまま表しているわけではないよ。
点数を上げれば、回答は必ず良くなる?
採点基準が本当の目的とずれることがあるよ。例えば、もし長さを過大に評価する採点役なら、内容が良くなくても長い回答に高得点を付けかねない。これは理解のための仮定の例。モデルの点数だけでなく、人による評価などで実際の品質を確かめよう。
AIの品質を上げるには、必ず報酬モデルが必要なの?
まとめ:ざっくりこれだけ覚えればOK!
「報酬モデル」って出てきたら「学んだ評価基準で、AIの回答などに点数をつけるモデル」と思えばだいたいOK!
📖 おまけ:英語の意味
「Reward Model」 = 報酬モデル
💬 Reward(報酬)を予測するModel(モデル)。評価の基準を学習して数値を返す役割だよ。