【あーるえるえーあいえふ】
RLAIF とは?
最終更新:
💡 AIの評価を、強化学習の手がかりにする
AIが生成した評価や選好を、モデルを強化学習するための報酬信号に利用する手法。人手による評価収集を減らせる可能性がある一方、評価用AIの偏りや誤り、評価基準の設計に影響される。
📌 このページのポイント
RLAIFって、RLHFとどう違うの?
AIに回答を書き直させるだけでもRLAIF?
人が評価しなくてよくなるの?
評価を集める人手を減らせる可能性はあるけれど、目的や基準の設計、結果の検証は必要だよ。評価用AIにも誤りや偏りがあり、回答を見せる順序で選好が変わることも報告されているんだ。
Constitutional AIも同じもの?
その強化学習段階がRLAIFの一例だよ。Anthropicの2022年の研究では、人が与えた原則を使ってAIが回答を比較し、選好モデルを学習して報酬にした。Constitutional AI全体には、自己批評と修正による教師あり学習の段階もあるんだ。
必ず速く、安く、良いモデルになる?
📖 おまけ:英語の意味
「Reinforcement Learning from AI Feedback」 = AIフィードバックによる強化学習
💬 RLは強化学習、AI FeedbackはAIからの評価。RLHFのHuman Feedback(人間からの評価)と、主なフィードバックの生成元を比べた呼び名だよ。