【あーるえるえいちえふ】
RLHF とは?
最終更新:
💡 人間の「好み」を教師にしてAIを磨く学習法
人間の評価を報酬の手がかりにして、強化学習でAIの振る舞いを調整する手法。言語モデルでは、回答の比較評価から報酬モデルを学び、それを使って追加学習する構成が代表的。
📌 このページのポイント
RLHFって何?AIの学習方法の一つ?
うん。人間の評価を報酬の手がかりにして、強化学習で振る舞いを調整する方法だよ。言語モデルでは、どちらの回答が望ましいかを人が比べる方法がよく使われるんだ。
模範解答で学ぶのとは違うの?
人が毎回、AIの回答に点数を付けるの?
高評価の回答なら、正しいってこと?
そうとは限らないよ。評価者や基準の影響を受けるし、高評価を目指しても事実の誤りや有害な出力が残ることがあるんだ。すべての人の好みを代表できるとも限らないね。
DPOという方法も同じなの?
📖 おまけ:英語の意味
「Reinforcement Learning from Human Feedback」 = 人間のフィードバックによる強化学習
💬 Reinforcement Learning(強化学習)はゲームのAIでも使われる手法。そこに「Human Feedback(人間の評価)」を組み合わせたのがRLHF