【ほうしゅうもでるがくしゅう】
報酬モデル学習 とは?
公開:
💡 「人間はこっちが好き」を学習する採点AI
ペンギン先生、報酬モデル学習って何をするの?
AIが出した複数の回答を人間が「こっちの方がいい」と選ぶデータを集めて、そのランキングを学習するモデルを作るプロセスだよ
ランキングを学習するってどういうこと?
同じ質問に対してAIが2通りの回答をして、人間がどちらかを選ぶ「ペアワイズ比較」データを使うんだよ。その選好パターンを学習した報酬モデルが「点数化AI」として働くんだ
RLHFの第2フェーズってどういう意味なの?
報酬モデルが出した点数は何に使うの?
📖 おまけ:英語の意味
「Reward Model Training」 = 報酬モデル学習
💬 強化学習の「報酬(reward)」を人間の好みから学ぶモデルを作るプロセスだよ