【べんちまーくおせん】
ベンチマーク汚染 とは?
最終更新:
💡 評価用の問題が学習に混ざる問題
AIの評価用データがモデルの学習データに混入すること。未見の問題への能力を測りたい評価で、結果の解釈を難しくする。
📌 このページのポイント
- 評価用の問題や解答が学習データに混入すること
- 意図しない収集やフィルタリング漏れでも起こり得る
- 混入しても、必ず暗記やスコア上昇が起きるとは限らない
- 重複除去や新しい評価問題などでリスクを抑える
ベンチマーク汚染って何が問題なの?
評価に使う問題や解答が学習データにも含まれると、未見の問題を解く能力と、見た内容を利用する能力を区別しにくくなるんだ。スコアが高く出る場合があるけれど、混入したら必ずそうなるわけではないよ
なんでそんなことが起きるの?
公開された問題やその解説がWeb上に広がり、学習用に集めたデータへ入ることがあるんだ。除外処理の漏れなどでも起こるので、混入が見つかったことだけで意図的な不正とはいえないよ
どれくらいスコアに影響するの?
モデル、問題、解答も混ざったかなどによって違うよ。2024年の研究でも、混入の疑いがある問題群で成績が上がる場合と上がらない場合が報告されている。どのモデルでも一定割合だけ上がる、とはいえないんだ
どうやって防ぐの?
学習データとの重複を調べて除外したり、学習時期より後の新しい問題を使ったりする。LiveBenchのように問題を継続的に更新する設計もあるよ。ただし、出所の除外だけでは転載を見逃すことがあり、対策したというだけで混入ゼロとは断定できないんだ
高得点なら汚染を疑えばいい?
高得点だけでは混入の証拠にならないよ。評価問題の出所や作成時期、学習との重複調査、評価条件を確かめよう。学習データが非公開ならわからない部分もあるので、確認できた事実と推測を分けて読むのが大切だよ
まとめ:ざっくりこれだけ覚えればOK!
「ベンチマーク汚染」って出てきたら「評価用のデータが学習に混ざる問題」と思えばだいたいOK!
📖 おまけ:英語の意味
「Benchmark Contamination / Data Contamination」 = ベンチマーク汚染 / データ汚染
💬 評価用の問題などが学習データに混入することをContamination(汚染)と呼ぶよ。「カンニング」は比喩で、意図的な不正や丸暗記が必ずあるという意味ではないんだ