【ほうしゅうもでるがくしゅう】

報酬モデル学習 とは?

最終更新:
💡 比較の評価から、回答を採点するモデルを学習する

回答の比較などの評価データから、出力の望ましさをスコアで推定する報酬モデルを訓練すること。人間の選好を用いるRLHFでは、そのスコアを生成モデルの学習に使う。

📌 このページのポイント
比較の評価から、採点モデルを学習 同じ質問 回答を生成 回答 A 候補 回答 B 候補 人間が比較 この例では A を選択 比較データ 質問・A・B・選好 報酬モデル 質問+回答を採点 学習 スコア 生成モデルの 更新に利用
人間の選好を使う報酬モデル学習の例。採点モデルと回答を作るモデルは役割が異なる。
ひよこ ひよこ
何を学習するの?
ペンギン先生 ペンギン先生
たとえば同じ質問への回答AとBを人間が比較し、どちらが望ましいかを選んだデータを使う。報酬モデルは、その選好に沿って回答を採点するように学習するんだ。
ひよこ ひよこ
比較しかしていないのに、点数を出せる?
ペンギン先生 ペンギン先生
好まれた回答のスコアが、好まれなかった回答より高くなるように訓練できるよ。学習後は質問と回答を入力して、スコアを推定する。点数の単位や値そのものが、人間の絶対評価と同じという意味ではないんだ。
ひよこ ひよこ
RLHFでは必ず第2フェーズなの?
ペンギン先生 ペンギン先生
教師ありの調整、報酬モデル学習、強化学習という三段階の説明では、第2段階に当たるね。ただしこれは代表的な構成だよ。データ収集や学習を繰り返すこともあり、すべての方法が同じ固定手順ではないんだ。
ひよこ ひよこ
そのスコアは誰が使う?
ペンギン先生 ペンギン先生
生成モデルを更新するときの報酬に使うよ。PPOを用いる構成では、報酬モデルが出すスコアを高めるように学習する。回答を作るモデルと、回答を採点するモデルは役割が違うんだ。
ひよこ ひよこ
DPOでは同じ報酬モデルを作る?
ペンギン先生 ペンギン先生
DPOは選好データから生成モデルを直接調整し、独立した報酬モデルの明示的な学習や強化学習を省く方法だよ。同じ選好を使うことと、同じモデルや手順を使うことは別で、すべての場面で同じ結果を保証するわけではないんだ。
もっと詳しく知りたい人へ

報酬スコアが高ければ、回答は必ず正しい?

スコアは、学習に使った評価データや評価基準を反映した推定です。評価者の判断やデータの偏りも影響します。望ましいと評価された傾向を学ぶことは、すべての回答の事実関係や安全性を保証することではありません。

ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「報酬モデル学習」って出てきたら「評価データから回答を採点するAIを育てること」と思えばだいたいOK!
📖 おまけ:英語の意味
「Reward Model Training」 = 報酬を推定するモデルの訓練
💬 Rewardは報酬、Modelはモデル、Trainingは訓練という意味だよ。人間が選んだ回答の傾向などを学び、学習に使う報酬のスコアを推定するんだ。

参考資料

← 用語集にもどる