【ほうしゅうもでる】

報酬モデル とは?

最終更新:
💡 回答に点数をつける、AIの採点役

行動や出力への評価を、数値の報酬として予測する学習済みモデル。言語モデルのRLHFでは、人間による回答の比較評価などを学び、回答にスコアを付けるために使われる。

📌 このページのポイント
報酬モデル:評価を学び、採点する人が回答を比較して評価その傾向を報酬モデルが学ぶ質問と回答評価する入力報酬モデルスコアを予測スコア調整に使う点数は、正しさを必ず保証しないよ
人の比較評価から学習し、質問と回答を採点するRLHFの例。得られたスコアを言語モデルの調整に利用します。
ひよこ ひよこ
報酬モデルって、文章を作るAIとは違うの?
ペンギン先生 ペンギン先生
言語モデルのRLHFでは役割が違うよ。文章を作るモデルに対して、報酬モデルは質問と回答を受け取り、評価を数値として予測する。毎回すべての回答を人が採点する代わりに、学んだ評価基準を使うんだ。
ひよこ ひよこ
どうやって評価基準を教えるの?
ペンギン先生 ペンギン先生
例えば、同じ質問に対する複数の回答を人に比較してもらうよ。InstructGPTの論文では、どちらの回答が好まれるかという比較データで学習している。評価者の好みや、示した評価方針を反映するので、誰にとっても唯一の正解になるわけではないんだ。
ひよこ ひよこ
点数が0.9なら、90%正しいという意味?
ペンギン先生 ペンギン先生
そのように決めつけないでね。報酬スコアの尺度は設計による。InstructGPTの報酬モデルは1つの数値を出すけれど、回答が正しい確率をそのまま表しているわけではないよ。
ひよこ ひよこ
点数を上げれば、回答は必ず良くなる?
ペンギン先生 ペンギン先生
採点基準が本当の目的とずれることがあるよ。例えば、もし長さを過大に評価する採点役なら、内容が良くなくても長い回答に高得点を付けかねない。これは理解のための仮定の例。モデルの点数だけでなく、人による評価などで実際の品質を確かめよう。
ひよこ ひよこ
AIの品質を上げるには、必ず報酬モデルが必要なの?
ペンギン先生 ペンギン先生
いいえ。報酬モデルを使うRLHFは1つの方法だよ。DPOは、好まれる回答と好まれない回答のデータから言語モデルを直接調整し、独立した報酬モデルを学習する段階を省く方法なんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「報酬モデル」って出てきたら「学んだ評価基準で、AIの回答などに点数をつけるモデル」と思えばだいたいOK!
📖 おまけ:英語の意味
「Reward Model」 = 報酬モデル
💬 Reward(報酬)を予測するModel(モデル)。評価の基準を学習して数値を返す役割だよ。

参考資料

← 用語集にもどる