【ぷろせすほうしゅうもでる】
プロセス報酬モデル とは?
公開:
💡 答えだけでなく解き方の各手順を採点する審判
なんでステップごとに採点した方がいいの?
最終答えが正しくても、途中の推論が間違っていることがあるんだよ。逆に途中で一つミスをしても、たまたま正解が出ることも。ステップ評価ならそういった「偶然の正解」に引っかからないんだ
Math Shepardって何なの?
2023年にOpenAIが発表した数学推論のPRM研究だよ。人間がステップごとに正誤を付けたデータを使ってPRMを学習させ、難しい数学問題の精度を大幅に上げることに成功したんだ
テスト時間計算(test-time-compute)との関係は?
PRMはビームサーチなどで複数の推論経路を探索するときに、どの経路が最も「ステップ品質が高いか」を評価するスコアラーとして使われるんだよ。推論時にコンピュートを増やして精度を上げる方法の核になってるんだ
PRMを作るのって大変なの?
📖 おまけ:英語の意味
「Process Reward Model」 = プロセス報酬モデル
💬 結果(outcome)ではなく「過程(process)」を評価するのが特徴で、ORM(Outcome Reward Model)と対比されるよ