【てすとじけいさん】

テスト時計算 とは?

最終更新:
💡 答えを出すとき、候補を増やして確かめる

学習済みモデルを使って回答する推論時の計算量。LLMでは、複数の解答候補の生成や評価、回答の見直しなどに追加の計算を使い、品質を高める方法が研究される。効果はモデル・問題・選び方で変わり、計算を増やせば必ず正しくなるわけではない。

📌 このページのポイント
推論時の計算:候補を作って選ぶ同じ質問から複数の候補を生成Best-of-N評価の点数で選ぶ候補B自己整合性答え A・A・B回答の一致を集約答えA計算を増やせば必ず正解、ではないよ
追加計算の使い方の比較例。Best-of-Nは評価モデルなどの点数による選択、自己整合性は異なる推論の最終回答の一致を集約する。Bの候補やAの答えが正解であることを保証する図ではない。
ひよこ ひよこ
テスト時計算は、ソフトのテストをすること?
ペンギン先生 ペンギン先生
機械学習では、学習済みモデルを使う推論時の計算を指すよ。LLMでは、回答する段階で追加の計算を使う方法がある。学習時にモデルを作る計算と区別するんだ。
ひよこ ひよこ
計算を増やすたびに、モデルを学習し直す?
ペンギン先生 ペンギン先生
この話の中心は、学習済みモデルを使って回答を作る段階だよ。たとえば候補を何個も生成し、評価して選ぶ。ファインチューニングのように、新しい学習でモデルの重みを調整することとは分けて考えよう。
ひよこ ひよこ
候補が多いと、どうやって一つに決める?
ペンギン先生 ペンギン先生
Best-of-NではN個の候補を作り、評価モデルなどの点数で選ぶ。自己整合性では異なる推論の道筋を生成し、最終回答の一致を集約するよ。点数で選ぶことと、多数の一致する回答を選ぶことは別の方法なんだ。
ひよこ ひよこ
たくさん考えれば、必ず正解になる?
ペンギン先生 ペンギン先生
モデルや問題の難しさ、候補の生成方法や評価の質で変わるよ。同じ誤りを繰り返す候補や、誤った評価では改善しない。研究で数学問題の成績が上がっても、すべての用途にそのまま保証されるわけではないんだ。
ひよこ ひよこ
実際には、どれくらい計算を使えばよい?
ペンギン先生 ペンギン先生
追加の計算で得られる品質と、時間・費用を比べよう。難しさに応じて見直しや探索の配分を変える研究もある。自分の用途の問題で測り、候補数や評価方法を選ぶのがよいね。長い回答そのものを正確さの証拠にはしないよ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「テスト時計算」って出てきたら「AIが回答する段階で使う計算量」と思えばだいたいOK!
📖 おまけ:英語の意味
「Test-Time Compute」 = テスト時・推論時の計算量
💬 学習済みモデルを評価したり利用したりする段階の計算を指すよ。LLMの推論時計算を増やす文脈でも使われるね。

参考資料

← 用語集にもどる