【おーぽ】

ORPO(オッズ比選好最適化) とは?

公開:
💡 SFTとアライメントを一括処理——参照モデル不要で軽量なLLMの好み学習手法

LLMのアライメント(選好学習)手法の一つ。DPOやRLHFと異なり、SFT(教師あり微調整)とアライメントを1ステップで同時に行い、参照モデル不要でシンプル。

📌 このページのポイント
ORPO:SFT + 選好最適化を1ステップで実現 プロンプト (入力) LLM (学習中) chosen(良い回答) オッズ比 ↑ 高める rejected(悪い回答) オッズ比 ↓ 下げる ORPO損失 = SFT損失 + オッズ比損失(λ × OR) 参照モデル 不 要!
ORPOの学習ループ:SFTと選好最適化を1ステップで行い、参照モデルが不要
ひよこ ひよこ
ペンギン先生、LLMに「良い答え方」を教えるって、どういう手順が必要なの?
ペンギン先生 ペンギン先生
普通はまず「教師あり微調整(SFT)」で基礎を教えて、次に「アライメント学習」で好ましい回答を優先させる、という2段階が必要なんだよ。
ひよこ ひよこ
2段階もあるんだね!それを1回で済ませるのがORPOなの?
ペンギン先生 ペンギン先生
そうだよ!ORPOはSFTの損失関数に「良い回答と悪い回答のオッズ比」を組み込んで、一度の学習で両方を同時に最適化するんだ。DPOだと参照モデルを別に用意する必要があるけど、ORPOは不要だよ。
ひよこ ひよこ
参照モデルが要らないってどういう意味なの?
ペンギン先生 ペンギン先生
DPOはベースモデルを参照として保持しながら学習するから、メモリを2モデル分使うんだ。ORPOはオッズ比で「選ばれた回答」と「却下された回答」の差を直接最適化するから、参照モデルなしでシンプルに計算できるんだよ。
ひよこ ひよこ
メモリも節約できてシンプルなんだね!RLHFと比べると何が違うの?
ペンギン先生 ペンギン先生
RLHF報酬モデルを学習してからPPO強化学習という複雑な3段階が必要なんだ。ORPOはそれを1段階に圧縮しているから、実装のしやすさとリソース効率が格段に高いよ。2024年以降、小〜中規模モデルのファインチューニングでよく使われるようになったんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「ORPO」って出てきたら「SFTとアライメントを一回でこなす軽量なLLM選好学習」と思えればだいたいOK!
📖 おまけ:英語の意味
「Odds Ratio Preference Optimization」 = オッズ比選好最適化
💬 2024年に発表されたアライメント手法。オッズ比(統計学の指標)を損失関数に使うのがユニークな点だよ。
← 用語集にもどる