【せるふこんしすてんしー】
Self-Consistency とは?
最終更新:
💡 何通りも解き、答えの一致で候補を選ぶ
同じ問題について複数の異なるChain-of-Thoughtの出力をサンプリングし、最終回答の一致を使って答えを集約する推論時の手法。代表的には最も多く得られた回答を選ぶが、多数派が正しいとは限らない。
📌 このページのポイント
- 同じ問題から、異なる推論パスと最終回答を複数生成する
- 代表的には最終回答をそろえて数え、最も多い候補を選ぶ
- 論文では複数の推論ベンチマークで改善を報告。全問題の正解は保証しない
- 生成回数を増やすと計算負担も増えるため、効果と費用を評価する
Self-Consistencyって、何回も同じ問題を解かせるってこと?
同じモデルから異なる解き方の出力を複数生成し、最後の答えを集約する方法だよ。たとえば4出力の答えが13、16、13、13なら、最も多い13を採用する。3票集まったこと自体が、正解の証明になるわけではないんだ。
同じモデルなら毎回同じ答えにならない?
一つの決まった出力だけを使う代わりに、サンプリングで異なる候補を得るんだ。原論文ではtemperatureやtop-kなどの方式を扱っている。使うモデルやサービスで設定が違うので、温度を上げれば必ず良い解き方が増えるとは考えないでね。
何回くらい解かせるのがいいの?
一律の最適回数はないよ。論文では回数を変えて比較し、少数の候補から試す考え方も示している。効果は頭打ちになり得るし、生成を増やすと計算量や待ち時間などの負担もある。対象の問題で精度と負担を測って決めよう。
文章なら何でも多数決できる?
同じ答えかどうかを判断できることが大切だよ。数値や選択肢なら数えやすいけれど、自由な文章は言い換えをどうまとめるかが難しい。回答の抽出方法、表記のそろえ方、同票や判定不能の扱いも決める必要があるんだ。
多数派なら信じていいの?
同じモデルが同じ誤りを繰り返すこともあるよ。論文の改善結果を、どんなモデルや問題でも必ず正解する保証にはできない。答えの検算や根拠の確認は別に行おう。特定の推論モデルの内部がこの方式そのものかは、この手法の論文だけでは判断できないんだ。
まとめ:ざっくりこれだけ覚えればOK!
「Self-Consistency」って出てきたら「同じ問題を何通りも解いて多数決で答えを決める方法」と思えばだいたいOK!
📖 おまけ:英語の意味
「Self-Consistency」 = 自己整合性
💬 ここでは、同じモデルから得た異なる推論パスの最終回答が一致することを利用するよ。多数派の回答を選ぶことと、正しさを証明することは区別しよう。