【ほうしゅうもでるがくしゅう】

報酬モデル学習 とは?

公開:
💡 「人間はこっちが好き」を学習する採点AI
📌 このページのポイント
報酬モデル学習(RLHFの第2フェーズ) ① 質問 「〇〇を説明して」 回答 A (詳しく丁寧) 回答 B (短すぎる) ② 人間が比較・選択 A > B 報酬モデル 人間の選好を スコア化 ③ 報酬信号 → PPO で本体を更新 選好 収集
人間のペアワイズ比較から報酬モデルを学習し、強化学習の報酬信号として使うプロセス
ひよこ ひよこ
ペンギン先生、報酬モデル学習って何をするの?
ペンギン先生 ペンギン先生
AIが出した複数の回答を人間が「こっちの方がいい」と選ぶデータを集めて、そのランキングを学習するモデルを作るプロセスだよ
ひよこ ひよこ
ランキングを学習するってどういうこと?
ペンギン先生 ペンギン先生
同じ質問に対してAIが2通りの回答をして、人間がどちらかを選ぶ「ペアワイズ比較」データを使うんだよ。その選好パターンを学習した報酬モデルが「点数化AI」として働くんだ
ひよこ ひよこ
RLHFの第2フェーズってどういう意味なの?
ペンギン先生 ペンギン先生
RLHFには3つのフェーズがあって、①事前学習済みモデル教師あり学習ファインチューニング → ②報酬モデルの学習 → ③強化学習(PPO等)で本体を更新、という順番になっているんだよ
ひよこ ひよこ
報酬モデルが出した点数は何に使うの?
ペンギン先生 ペンギン先生
PPOなどの強化学習アルゴリズムに渡すんだよ。AIが回答を出すたびに報酬モデルがスコアを計算して、そのフィードバックでAIの本体をより「人間好み」な方向に更新していくんだ
ひよこ ひよこ
DPOが出てきてから報酬モデルは不要になったってこと?
ペンギン先生 ペンギン先生
完全にではないけど、DPO報酬モデルを明示的に作らずに同じ効果を得られる手法だよ。ただ報酬モデルプロセス報酬モデル(PRM)としても活用されていて、引き続き重要な研究分野なんだ
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
報酬モデル学習」って出てきたら「人間の好みを点数化するAIを育てるプロセス」と思えればだいたいOK!
📖 おまけ:英語の意味
「Reward Model Training」 = 報酬モデル学習
💬 強化学習の「報酬(reward)」を人間の好みから学ぶモデルを作るプロセスだよ
← 用語集にもどる