【ぷろせすほうしゅうもでる】

プロセス報酬モデル とは?

最終更新:
💡 答えだけでなく解き方の各手順を採点する審判

推論の途中のステップに評価スコアを付ける報酬モデル。PRM(Process Reward Model)と略し、数学の解答候補の選別や、段階的なフィードバックを使う学習などで研究されている。

📌 このページのポイント
評価を付ける単位:PRMとORM PRM:途中のステップを評価 手順1 手順2 手順3 評価 評価 評価 各手順へのフィードバックで学習 ORM:最終結果を評価 推論 最終結果 結果へのフィードバックで学習 候補の選別や強化学習に利用 評価モデルにも誤判定がある
PRMとORMの学習で与える評価単位の比較。図は具体的な実測スコアを示さない
ひよこ ひよこ
プロセス報酬モデルって普通の報酬モデルと何が違うの?
ペンギン先生 ペンギン先生
推論の途中のステップも評価する報酬モデルだよ。ORMと呼ぶ結果報酬モデルは、最終結果へのフィードバックで学習する。一方、PRMは途中のステップへのフィードバックを使って、手順の質を評価するんだ。
ひよこ ひよこ
なんでステップごとに見るの?
ペンギン先生 ペンギン先生
最終的な答えが正しくても、途中に計算ミスや根拠の飛躍がある場合があるからだよ。途中も評価すれば、どこで問題が生じたかを捉える助けになる。ただし、PRM自体が誤判定することもあるので、必ずミスを見抜けるわけではないんだ。
ひよこ ひよこ
Math-Shepherdって何なの?
ペンギン先生 ペンギン先生
北京大学やDeepSeek-AIなどの研究者による、2023年の数学推論の研究だよ。自動生成したステップごとの教師データでPRMを学習し、解答候補の並べ替えや強化学習に使った。OpenAIの人手評価を使う研究「Let’s Verify Step by Step」とは別の論文なんだ。
ひよこ ひよこ
推論するときの計算量とも関係がある?
ペンギン先生 ペンギン先生
複数の解答候補を生成して、PRMのスコアを手掛かりに選ぶ使い方があるよ。Math-Shepherdも候補の選別を評価している。候補を増やすと計算コストも増えるし、スコアの高い解答が必ず正しいとは限らないんだ。
ひよこ ひよこ
人間が全部採点しないと作れないの?
ペンギン先生 ペンギン先生
人間が途中の手順を評価する方法も、自動で教師データを作る方法もあるよ。自動化では人手を減らせても、追加の計算やラベルのノイズが課題になる。PRMがORMより有利かどうかも、問題、モデル、データ、候補数などの条件をそろえて比べよう。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「プロセス報酬モデル(PRM)」って出てきたら「推論の各ステップを採点するAI審判」と思えればだいたいOK!
📖 おまけ:英語の意味
「Process Reward Model」 = プロセス報酬モデル
💬 結果(outcome)ではなく「過程(process)」を評価するのが特徴で、ORM(Outcome Reward Model)と対比されるよ

参考資料

← 用語集にもどる