【じーあーるぴーおー】
GRPO とは?
最終更新:
💡 同じ問題の回答を比べて、良い答え方を学ぶ
同じ質問への複数の回答を生成し、グループ内の報酬を基準にモデルを更新する強化学習手法。DeepSeekMathで提案され、別の価値モデルを使わずに相対的な評価を求める。
📌 このページのポイント
- Group Relative Policy Optimizationの略
- 同じ質問への複数の回答に、報酬を付ける
- グループ内の評価を基準に、答え方を更新する
- 別の価値モデルを省けるが、報酬の設計と回答生成は必要
GRPOでは、何をグループで比べるの?
同じ質問に対して、モデルが複数の回答を生成する。その回答に報酬を付け、グループ内でどれが良いかを基準に学習するよ。DeepSeekMathで提案された、言語モデル向けの強化学習手法なんだ。
報酬って、正解ならプラス、不正解ならマイナス?
採点の決め方によるよ。例えば正解を1、不正解を0と採点してもよい。元の手法では、各回答の報酬からグループの平均を引き、標準偏差で調整して、相対的な評価を作る。元の点数と、そこから作る評価を分けて考えよう。
PPOで使うCriticがいらないの?
言語モデルのPPOでは、価値を予測するCriticを学習する構成が使われる。GRPOはグループの報酬を基準にするので、その別の価値モデルを省けるんだ。ただし、回答の良し悪しを採点する仕組みまで不要になるわけではないよ。
高い点数の回答を、そのまま暗記させる?
回答を選んで保存するだけではなく、その評価を使ってモデルのパラメータを更新するよ。元の手法は更新の変化を抑える仕組みも組み合わせる。良い回答が出やすくなることを目指すけれど、必ず正解する保証ではないんだ。
どんな注意点があるの?
報酬が正しさをうまく表していないと、点数だけを稼ぐ答え方を学ぶことがあるよ。DeepSeek-R1-Zeroでは、数学の正解や回答の形式などをルールで採点した。価値モデルを省いても複数の回答の生成・評価には計算が必要で、費用や効果は条件によるんだ。
まとめ:ざっくりこれだけ覚えればOK!
「GRPO」って出てきたら「同じ質問への回答をグループで評価して学ぶ強化学習手法」と思えばだいたいOK!
📖 おまけ:英語の意味
「Group Relative Policy Optimization」 = グループ相対ポリシー最適化
💬 グループ(集団)の中での相対評価でポリシーを最適化するという意味だよ