【てすとじけいさん】
テスト時計算 とは?
最終更新:
💡 答えを出すとき、候補を増やして確かめる
学習済みモデルを使って回答する推論時の計算量。LLMでは、複数の解答候補の生成や評価、回答の見直しなどに追加の計算を使い、品質を高める方法が研究される。効果はモデル・問題・選び方で変わり、計算を増やせば必ず正しくなるわけではない。
📌 このページのポイント
- 学習時ではなく、モデルを使う推論時の計算量を指す
- 複数候補の生成、評価による選択、回答の見直しなどに使う
- 多数決と評価モデルによる選択は異なる方法
- 効果は問題やモデルで変わり、待ち時間や費用との兼ね合いも見る
テスト時計算は、ソフトのテストをすること?
計算を増やすたびに、モデルを学習し直す?
候補が多いと、どうやって一つに決める?
Best-of-NではN個の候補を作り、評価モデルなどの点数で選ぶ。自己整合性では異なる推論の道筋を生成し、最終回答の一致を集約するよ。点数で選ぶことと、多数の一致する回答を選ぶことは別の方法なんだ。
たくさん考えれば、必ず正解になる?
モデルや問題の難しさ、候補の生成方法や評価の質で変わるよ。同じ誤りを繰り返す候補や、誤った評価では改善しない。研究で数学問題の成績が上がっても、すべての用途にそのまま保証されるわけではないんだ。
実際には、どれくらい計算を使えばよい?
追加の計算で得られる品質と、時間・費用を比べよう。難しさに応じて見直しや探索の配分を変える研究もある。自分の用途の問題で測り、候補数や評価方法を選ぶのがよいね。長い回答そのものを正確さの証拠にはしないよ。
まとめ:ざっくりこれだけ覚えればOK!
「テスト時計算」って出てきたら「AIが回答する段階で使う計算量」と思えばだいたいOK!
📖 おまけ:英語の意味
「Test-Time Compute」 = テスト時・推論時の計算量
💬 学習済みモデルを評価したり利用したりする段階の計算を指すよ。LLMの推論時計算を増やす文脈でも使われるね。