【すいろんじけいさんすけーりんぐ】
推論時計算スケーリング とは?
最終更新:
💡 考える時間を増やして、AIの答えを磨き上げる
AIモデルが回答を生成するとき(推論時)に、より多くの計算を使って出力の質を高めるアプローチ。複数の答えを作って選ぶ、長く考えさせるなどの方法があり、効果は問題の難しさやモデルによって変わる。
📌 このページのポイント
そうだよ。テストの解答時間を30分から3時間に延ばしたら、もっと良い答案が書けることがあるよね。それと同じで、AIも回答を作るときに多くの計算を使わせると、出力の質が上がる場合があるんだ
学習をやり直さなくていいの?
方法によるね。同じ問題に何通りも考えさせて、いちばん多く出た答えを選ぶ「自己整合性(Self-Consistency)」のような方法なら、モデルはそのままで計算量だけ増やせる。一方、OpenAI o1のように長く考えてから答える推論モデルは、思考の連鎖を使って推論するように大規模な強化学習で訓練されているんだ
具体的にはどうやって計算量を増やしてるの?
代表的なのは、Chain-of-Thoughtで途中の考えを長く書き出させる方法、複数の候補を作って検証器で採点して選ぶ方法(Best-of-Nやビームサーチなど)、自分の答えを見直して修正させる方法だよ
でも計算量が増えるとコストも増えるよね?
その通り。だから「どの問題にどれだけ計算を割くか」が重要なんだ。2024年の研究では、問題の難しさに応じて計算を配分すると、単純なBest-of-Nより4倍以上効率よくなったと報告されているよ。ただ、効果が大きかったのは元のモデルがある程度解ける問題で、どんな問題でも計算を増やせば解けるわけではないんだ
📖 おまけ:英語の意味
「Inference-Time Compute Scaling」 = 推論時の計算量拡大
💬 inferenceは「推論」、computeは「計算」。学習時ではなく推論時にリソースを増やすアプローチだよ