【ぷろせすほうしゅうもでる】
プロセス報酬モデル とは?
最終更新:
💡 答えだけでなく解き方の各手順を採点する審判
推論の途中のステップに評価スコアを付ける報酬モデル。PRM(Process Reward Model)と略し、数学の解答候補の選別や、段階的なフィードバックを使う学習などで研究されている。
📌 このページのポイント
なんでステップごとに見るの?
最終的な答えが正しくても、途中に計算ミスや根拠の飛躍がある場合があるからだよ。途中も評価すれば、どこで問題が生じたかを捉える助けになる。ただし、PRM自体が誤判定することもあるので、必ずミスを見抜けるわけではないんだ。
Math-Shepherdって何なの?
推論するときの計算量とも関係がある?
複数の解答候補を生成して、PRMのスコアを手掛かりに選ぶ使い方があるよ。Math-Shepherdも候補の選別を評価している。候補を増やすと計算コストも増えるし、スコアの高い解答が必ず正しいとは限らないんだ。
人間が全部採点しないと作れないの?
人間が途中の手順を評価する方法も、自動で教師データを作る方法もあるよ。自動化では人手を減らせても、追加の計算やラベルのノイズが課題になる。PRMがORMより有利かどうかも、問題、モデル、データ、候補数などの条件をそろえて比べよう。
📖 おまけ:英語の意味
「Process Reward Model」 = プロセス報酬モデル
💬 結果(outcome)ではなく「過程(process)」を評価するのが特徴で、ORM(Outcome Reward Model)と対比されるよ