【おーぽ】
ORPO(オッズ比選好最適化) とは?
公開:
💡 SFTとアライメントを一括処理——参照モデル不要で軽量なLLMの好み学習手法
LLMのアライメント(選好学習)手法の一つ。DPOやRLHFと異なり、SFT(教師あり微調整)とアライメントを1ステップで同時に行い、参照モデル不要でシンプル。
📌 このページのポイント
ペンギン先生、LLMに「良い答え方」を教えるって、どういう手順が必要なの?
普通はまず「教師あり微調整(SFT)」で基礎を教えて、次に「アライメント学習」で好ましい回答を優先させる、という2段階が必要なんだよ。
2段階もあるんだね!それを1回で済ませるのがORPOなの?
参照モデルが要らないってどういう意味なの?
DPOはベースモデルを参照として保持しながら学習するから、メモリを2モデル分使うんだ。ORPOはオッズ比で「選ばれた回答」と「却下された回答」の差を直接最適化するから、参照モデルなしでシンプルに計算できるんだよ。
メモリも節約できてシンプルなんだね!RLHFと比べると何が違うの?
まとめ:ざっくりこれだけ覚えればOK!
「ORPO」って出てきたら「SFTとアライメントを一回でこなす軽量なLLM選好学習」と思えればだいたいOK!
📖 おまけ:英語の意味
「Odds Ratio Preference Optimization」 = オッズ比選好最適化
💬 2024年に発表されたアライメント手法。オッズ比(統計学の指標)を損失関数に使うのがユニークな点だよ。