【ぷろせすほうしゅうもでる】

プロセス報酬モデル とは?

公開:
💡 答えだけでなく解き方の各手順を採点する審判
📌 このページのポイント
PRM(プロセス報酬モデル)vs ORM(結果報酬モデル) PRM(各ステップ評価) ステップ 1 ステップ 2 ステップ 3 ✗ ✓ 0.95 ✓ 0.88 ✗ 0.12 各ステップに即座にフィードバック ORM(最終答えのみ評価) ステップ 1 ステップ 2 ステップ 3 最終答え 評価ここだけ 途中のミスを検出できない PRMの利点 ・途中ミスを即検出 ・偶然正解を排除 ・数学推論で高精度
PRMは各推論ステップを採点し、ORMは最終答えのみを評価する
ひよこ ひよこ
プロセス報酬モデルって普通の報酬モデルと何が違うの?
ペンギン先生 ペンギン先生
普通の報酬モデルORM)は最終的な回答だけを評価するけど、PRMは「step1は正しい、step2は間違い」とステップごとに採点するんだよ
ひよこ ひよこ
なんでステップごとに採点した方がいいの?
ペンギン先生 ペンギン先生
最終答えが正しくても、途中の推論が間違っていることがあるんだよ。逆に途中で一つミスをしても、たまたま正解が出ることも。ステップ評価ならそういった「偶然の正解」に引っかからないんだ
ひよこ ひよこ
Math Shepardって何なの?
ペンギン先生 ペンギン先生
2023年にOpenAIが発表した数学推論のPRM研究だよ。人間がステップごとに正誤を付けたデータを使ってPRMを学習させ、難しい数学問題の精度を大幅に上げることに成功したんだ
ひよこ ひよこ
テスト時間計算(test-time-compute)との関係は?
ペンギン先生 ペンギン先生
PRMはビームサーチなどで複数の推論経路を探索するときに、どの経路が最も「ステップ品質が高いか」を評価するスコアラーとして使われるんだよ。推論時にコンピュートを増やして精度を上げる方法の核になってるんだ
ひよこ ひよこ
PRMを作るのって大変なの?
ペンギン先生 ペンギン先生
ステップごとに人間がラベルを付けないといけないから、データ収集コストがORMより高いのが課題だよ。最近はAI自身にモンテカルロ法でステップ品質を推定させる自動ラベリング手法も研究されてるんだ
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
プロセス報酬モデル(PRM)」って出てきたら「推論の各ステップを採点するAI審判」と思えればだいたいOK!
📖 おまけ:英語の意味
「Process Reward Model」 = プロセス報酬モデル
💬 結果(outcome)ではなく「過程(process)」を評価するのが特徴で、ORM(Outcome Reward Model)と対比されるよ
← 用語集にもどる