【ディーピーオー(ちょくせつせんこうさいてきか)】
DPO(直接選好最適化) とは?
最終更新:
💡 どちらが好ましいかを比べて、AIを調整
同じ入力に対してどちらの回答を好むかという選好データで、言語モデルを調整する学習手法。別の報酬モデルの学習と強化学習のループを使わず、選好に沿うよう直接最適化する。
📌 このページのポイント
DPOって、何をAIに教えるの?
同じ質問に対する回答を比べ、どちらが好ましいかという選好を学習に使うよ。例えば初心者向けの説明なら、Aの説明をBより好む、という比較データで言語モデルを調整するんだ。
好ましい回答は、正しい回答という意味?
いつも同じではないよ。分かりやすさ、簡潔さ、丁寧さなど、何を基準に選ぶかで好みは変わる。選ばれた回答に誤りがあれば、その傾向も学んでしまうので、比較の基準や内容を確認しよう。
RLHFとは、何が違うの?
比較データだけ用意すればいい?
調整する言語モデルや学習設定も必要だよ。DPOの基本形では、参照モデルと比べながら、好ましい回答とそうでない回答の相対的な出しやすさを調整する。ゼロから言語能力を教える方法ではなく、既にあるモデルの追加学習として使うんだ。
シンプルなら、必ず性能も良くなる?
手順を簡素にできるけれど、効果はモデル、データ、設定やタスクによるよ。原論文の実験結果を、全ての用途で同じ結果になるという意味に広げないようにしよう。学習に使わなかったデータで、狙った改善と他の能力への影響を確かめるんだ。
まとめ:ざっくりこれだけ覚えればOK!
「DPO」って出てきたら「好ましい回答の比較から、AIを直接調整する学習法」と思えばだいたいOK!
📖 おまけ:英語の意味
「Direct Preference Optimization」 = 直接選好最適化
💬 Direct(直接)にPreference(人間の好み・選好)をOptimization(最適化)に組み込むという意味だよ