【ディーピーオー(ちょくせつせんこうさいてきか)】

DPO(直接選好最適化) とは?

最終更新:
💡 どちらが好ましいかを比べて、AIを調整

同じ入力に対してどちらの回答を好むかという選好データで、言語モデルを調整する学習手法。別の報酬モデルの学習と強化学習のループを使わず、選好に沿うよう直接最適化する。

📌 このページのポイント
DPO:回答の好みを比べて学ぶ同じ質問・入力回答A✓ こちらを好む回答B比較する相手言語モデルを直接調整基本形では参照モデルも使う選好の比較 ≠ 事実の正しさの保証
回答Aを好む場合の例。好みの基準を決め、比較データの内容と学習後の回答を確かめます。
ひよこ ひよこ
DPOって、何をAIに教えるの?
ペンギン先生 ペンギン先生
同じ質問に対する回答を比べ、どちらが好ましいかという選好を学習に使うよ。例えば初心者向けの説明なら、Aの説明をBより好む、という比較データで言語モデルを調整するんだ。
ひよこ ひよこ
好ましい回答は、正しい回答という意味?
ペンギン先生 ペンギン先生
いつも同じではないよ。分かりやすさ、簡潔さ、丁寧さなど、何を基準に選ぶかで好みは変わる。選ばれた回答に誤りがあれば、その傾向も学んでしまうので、比較の基準や内容を確認しよう。
ひよこ ひよこ
RLHFとは、何が違うの?
ペンギン先生 ペンギン先生
代表的なRLHFの手順は、比較データから報酬モデルを学習し、その評価を使って強化学習で回答のモデルを調整する。DPOは、独立した報酬モデルの学習と強化学習のループを使わず、比較データから直接調整するんだ。
ひよこ ひよこ
比較データだけ用意すればいい?
ペンギン先生 ペンギン先生
調整する言語モデルや学習設定も必要だよ。DPOの基本形では、参照モデルと比べながら、好ましい回答とそうでない回答の相対的な出しやすさを調整する。ゼロから言語能力を教える方法ではなく、既にあるモデルの追加学習として使うんだ。
ひよこ ひよこ
シンプルなら、必ず性能も良くなる?
ペンギン先生 ペンギン先生
手順を簡素にできるけれど、効果はモデル、データ、設定やタスクによるよ。原論文の実験結果を、全ての用途で同じ結果になるという意味に広げないようにしよう。学習に使わなかったデータで、狙った改善と他の能力への影響を確かめるんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「DPO」って出てきたら「好ましい回答の比較から、AIを直接調整する学習法」と思えばだいたいOK!
📖 おまけ:英語の意味
「Direct Preference Optimization」 = 直接選好最適化
💬 Direct(直接)にPreference(人間の好み・選好)をOptimization(最適化)に組み込むという意味だよ

参考資料

← 用語集にもどる