【べんちまーくおせん】

ベンチマーク汚染 とは?

最終更新:
💡 評価用の問題が学習に混ざる問題

AIの評価用データがモデルの学習データに混入すること。未見の問題への能力を測りたい評価で、結果の解釈を難しくする。

📌 このページのポイント
評価用のデータが学習に混入 学習データ 収集したデータなど 評価問題 学習 AI モデル 評価 スコア 未見の問題を解く能力と区別しにくくなる 混入しても、暗記・スコア上昇は必然ではない
赤は混入した評価用データ。意図的な不正や一定の点数上昇を示す図ではない。
ひよこ ひよこ
ベンチマーク汚染って何が問題なの?
ペンギン先生 ペンギン先生
評価に使う問題や解答が学習データにも含まれると、未見の問題を解く能力と、見た内容を利用する能力を区別しにくくなるんだ。スコアが高く出る場合があるけれど、混入したら必ずそうなるわけではないよ
ひよこ ひよこ
なんでそんなことが起きるの?
ペンギン先生 ペンギン先生
公開された問題やその解説がWeb上に広がり、学習用に集めたデータへ入ることがあるんだ。除外処理の漏れなどでも起こるので、混入が見つかったことだけで意図的な不正とはいえないよ
ひよこ ひよこ
どれくらいスコアに影響するの?
ペンギン先生 ペンギン先生
モデル、問題、解答も混ざったかなどによって違うよ。2024年の研究でも、混入の疑いがある問題群で成績が上がる場合と上がらない場合が報告されている。どのモデルでも一定割合だけ上がる、とはいえないんだ
ひよこ ひよこ
どうやって防ぐの?
ペンギン先生 ペンギン先生
学習データとの重複を調べて除外したり、学習時期より後の新しい問題を使ったりする。LiveBenchのように問題を継続的に更新する設計もあるよ。ただし、出所の除外だけでは転載を見逃すことがあり、対策したというだけで混入ゼロとは断定できないんだ
ひよこ ひよこ
高得点なら汚染を疑えばいい?
ペンギン先生 ペンギン先生
高得点だけでは混入の証拠にならないよ。評価問題の出所や作成時期、学習との重複調査、評価条件を確かめよう。学習データが非公開ならわからない部分もあるので、確認できた事実と推測を分けて読むのが大切だよ
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「ベンチマーク汚染」って出てきたら「評価用のデータが学習に混ざる問題」と思えばだいたいOK!
📖 おまけ:英語の意味
「Benchmark Contamination / Data Contamination」 = ベンチマーク汚染 / データ汚染
💬 評価用の問題などが学習データに混入することをContamination(汚染)と呼ぶよ。「カンニング」は比喩で、意図的な不正や丸暗記が必ずあるという意味ではないんだ

参考資料

← 用語集にもどる