【あーるえるえいちえふ】

RLHF とは?

最終更新:
💡 人間の「好み」を教師にしてAIを磨く学習法

人間の評価を報酬の手がかりにして、強化学習でAIの振る舞いを調整する手法。言語モデルでは、回答の比較評価から報酬モデルを学び、それを使って追加学習する構成が代表的。

📌 このページのポイント
人の評価から、報酬を学ぶ 準備済みの言語モデル(例:SFT後) 人の比較 回答AとBを 比べて選ぶ 報酬モデル 人の評価を 予測する 強化学習 PPOなどで 生成を調整 評価者や評価基準の影響を受ける 正確さ・安全性の保証ではない
言語モデルでの代表的なRLHFの構成を簡略化。人の評価を予測する報酬モデルを使って強化学習する。事前学習やSFTは準備の例で、全手法の固定手順ではない。
ひよこ ひよこ
RLHFって何?AIの学習方法の一つ?
ペンギン先生 ペンギン先生
うん。人間の評価を報酬の手がかりにして、強化学習で振る舞いを調整する方法だよ。言語モデルでは、どちらの回答が望ましいかを人が比べる方法がよく使われるんだ。
ひよこ ひよこ
模範解答で学ぶのとは違うの?
ペンギン先生 ペンギン先生
模範回答をまねる教師あり学習と、評価に基づいて強化学習する工程は違うよ。InstructGPTでは、まず人の回答例で調整し、その後に比較評価を使う工程を組み合わせていたんだ。
ひよこ ひよこ
人が毎回、AIの回答に点数を付けるの?
ペンギン先生 ペンギン先生
代表的な構成では、先に人の比較評価から報酬モデルを学ぶよ。そのモデルが出す評価を使い、PPOなどの強化学習で回答を生成するモデルを調整するんだ。報酬モデルは、人の評価を予測する仕組みだね。
ひよこ ひよこ
高評価の回答なら、正しいってこと?
ペンギン先生 ペンギン先生
そうとは限らないよ。評価者や基準の影響を受けるし、高評価を目指しても事実の誤りや有害な出力が残ることがあるんだ。すべての人の好みを代表できるとも限らないね。
ひよこ ひよこ
DPOという方法も同じなの?
ペンギン先生 ペンギン先生
DPOも回答の好みのデータを使うけれど、別の報酬モデルを学んで強化学習する工程を省き、生成モデルを直接調整する方法だよ。人間の好みを学ぶ方法が、すべて同じ学習手順というわけではないんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「RLHF」って出てきたら「人間の評価を手がかりに、強化学習でAIの振る舞いを調整する方法」と思えばだいたいOK!
📖 おまけ:英語の意味
「Reinforcement Learning from Human Feedback」 = 人間のフィードバックによる強化学習
💬 Reinforcement Learning(強化学習)はゲームのAIでも使われる手法。そこに「Human Feedback(人間の評価)」を組み合わせたのがRLHF

参考資料

← 用語集にもどる