【あーるえるえーあいえふ】

RLAIF とは?

最終更新:
💡 AIの評価を、強化学習の手がかりにする

AIが生成した評価や選好を、モデルを強化学習するための報酬信号に利用する手法。人手による評価収集を減らせる可能性がある一方、評価用AIの偏りや誤り、評価基準の設計に影響される。

📌 このページのポイント
AIの評価を、強化学習に使う 主な違いは、評価の生成元 RLHF 📄 回答候補 比較する 🧑 人間が評価 選好を作る ⚖️ 報酬モデル 選好を学ぶ ⚙️ 強化学習 更新する RLAIF 📄 回答候補 比較する 🤖 AIが評価 選好を作る ⚖️ 報酬モデル 選好を学ぶ ⚙️ 強化学習 更新する 上図は、報酬モデルを学ぶ方式の例 AIから直接報酬を得る方式もある 評価基準・AIの偏り・結果を検証
RLHFとRLAIFの評価元を比べる概念図。矢印は学習に使う情報の流れで、処理時間や費用の実測ではない。RLAIFには報酬モデルを別に学ばない方式もあり、評価の質や人による検証が必要。
ひよこ ひよこ
RLAIFって、RLHFとどう違うの?
ペンギン先生 ペンギン先生
主な違いは評価の生成元だよ。RLHFでは人間の評価を使い、RLAIFではAIが作った評価や選好を使う。たとえば複数の回答のうち、基準に合う方をAIに選ばせ、その情報を強化学習の報酬へつなげるんだ。
ひよこ ひよこ
AIに回答を書き直させるだけでもRLAIF?
ペンギン先生 ペンギン先生
それだけなら強化学習とは限らないよ。AIの選好から報酬モデルを学び、それを使ってモデルを強化学習する方式がある。研究には、別の報酬モデルを作らず、評価用AIから直接報酬を得る方式もあるんだ。
ひよこ ひよこ
人が評価しなくてよくなるの?
ペンギン先生 ペンギン先生
評価を集める人手を減らせる可能性はあるけれど、目的や基準の設計、結果の検証は必要だよ。評価用AIにも誤りや偏りがあり、回答を見せる順序で選好が変わることも報告されているんだ。
ひよこ ひよこ
Constitutional AIも同じもの?
ペンギン先生 ペンギン先生
その強化学習段階がRLAIFの一例だよ。Anthropicの2022年の研究では、人が与えた原則を使ってAIが回答を比較し、選好モデルを学習して報酬にした。Constitutional AI全体には、自己批評と修正による教師あり学習の段階もあるんだ。
ひよこ ひよこ
必ず速く、安く、良いモデルになる?
ペンギン先生 ペンギン先生
保証ではないよ。評価データを集めやすくする狙いはあるけれど、評価用AIの計算にも費用がかかる。研究でRLHFに近い結果が出た課題があっても、すべての用途で同じとは限らない。評価基準と人の判断への合い方を確認するんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「RLAIF」って出てきたら「AIの評価を使ってモデルを強化学習する手法」と思えばだいたいOK!
📖 おまけ:英語の意味
「Reinforcement Learning from AI Feedback」 = AIフィードバックによる強化学習
💬 RLは強化学習、AI FeedbackはAIからの評価。RLHFのHuman Feedback(人間からの評価)と、主なフィードバックの生成元を比べた呼び名だよ。

参考資料

← 用語集にもどる