【ほうしゅうもでるがくしゅう】
報酬モデル学習 とは?
最終更新:
💡 比較の評価から、回答を採点するモデルを学習する
回答の比較などの評価データから、出力の望ましさをスコアで推定する報酬モデルを訓練すること。人間の選好を用いるRLHFでは、そのスコアを生成モデルの学習に使う。
📌 このページのポイント
何を学習するの?
たとえば同じ質問への回答AとBを人間が比較し、どちらが望ましいかを選んだデータを使う。報酬モデルは、その選好に沿って回答を採点するように学習するんだ。
比較しかしていないのに、点数を出せる?
好まれた回答のスコアが、好まれなかった回答より高くなるように訓練できるよ。学習後は質問と回答を入力して、スコアを推定する。点数の単位や値そのものが、人間の絶対評価と同じという意味ではないんだ。
RLHFでは必ず第2フェーズなの?
そのスコアは誰が使う?
もっと詳しく知りたい人へ
報酬スコアが高ければ、回答は必ず正しい?
スコアは、学習に使った評価データや評価基準を反映した推定です。評価者の判断やデータの偏りも影響します。望ましいと評価された傾向を学ぶことは、すべての回答の事実関係や安全性を保証することではありません。
📖 おまけ:英語の意味
「Reward Model Training」 = 報酬を推定するモデルの訓練
💬 Rewardは報酬、Modelはモデル、Trainingは訓練という意味だよ。人間が選んだ回答の傾向などを学び、学習に使う報酬のスコアを推定するんだ。