【じーあーるぴーおー】

GRPO とは?

最終更新:
💡 同じ問題の回答を比べて、良い答え方を学ぶ

同じ質問への複数の回答を生成し、グループ内の報酬を基準にモデルを更新する強化学習手法。DeepSeekMathで提案され、別の価値モデルを使わずに相対的な評価を求める。

📌 このページのポイント
GRPO:同じ質問の回答を比べる同じ質問例:数学の問題LLMが回答を生成グループの例:4個回答1✓ 正解報酬:1回答2× 不正解報酬:0回答3✓ 正解報酬:1回答4× 不正解報酬:0グループ内の平均などを基準に評価評価を使って、モデルを更新する別の価値モデル(Critic)は省ける採点する仕組みと、回答生成は必要
報酬の数字は説明用の例です。元の手法は平均と標準偏差を使い、更新の変化も調整します。
ひよこ ひよこ
GRPOでは、何をグループで比べるの?
ペンギン先生 ペンギン先生
同じ質問に対して、モデルが複数の回答を生成する。その回答に報酬を付け、グループ内でどれが良いかを基準に学習するよ。DeepSeekMathで提案された、言語モデル向けの強化学習手法なんだ。
ひよこ ひよこ
報酬って、正解ならプラス、不正解ならマイナス?
ペンギン先生 ペンギン先生
採点の決め方によるよ。例えば正解を1、不正解を0と採点してもよい。元の手法では、各回答の報酬からグループの平均を引き、標準偏差で調整して、相対的な評価を作る。元の点数と、そこから作る評価を分けて考えよう。
ひよこ ひよこ
PPOで使うCriticがいらないの?
ペンギン先生 ペンギン先生
言語モデルのPPOでは、価値を予測するCriticを学習する構成が使われる。GRPOはグループの報酬を基準にするので、その別の価値モデルを省けるんだ。ただし、回答の良し悪しを採点する仕組みまで不要になるわけではないよ。
ひよこ ひよこ
高い点数の回答を、そのまま暗記させる?
ペンギン先生 ペンギン先生
回答を選んで保存するだけではなく、その評価を使ってモデルのパラメータを更新するよ。元の手法は更新の変化を抑える仕組みも組み合わせる。良い回答が出やすくなることを目指すけれど、必ず正解する保証ではないんだ。
ひよこ ひよこ
どんな注意点があるの?
ペンギン先生 ペンギン先生
報酬が正しさをうまく表していないと、点数だけを稼ぐ答え方を学ぶことがあるよ。DeepSeek-R1-Zeroでは、数学の正解や回答の形式などをルールで採点した。価値モデルを省いても複数の回答の生成・評価には計算が必要で、費用や効果は条件によるんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「GRPO」って出てきたら「同じ質問への回答をグループで評価して学ぶ強化学習手法」と思えばだいたいOK!
📖 おまけ:英語の意味
「Group Relative Policy Optimization」 = グループ相対ポリシー最適化
💬 グループ(集団)の中での相対評価でポリシーを最適化するという意味だよ

参考資料

← 用語集にもどる