【かがくしゅう】
過学習 とは?
最終更新:
💡 練習問題に合わせすぎて、初めての問題に弱くなる
モデルが訓練データに適合しすぎて、未知のデータへの予測がうまくいかなくなる現象。訓練データ固有の揺らぎや偏りまで学び、他のデータに通用する傾向を捉えられないことがある。
📌 このページのポイント
過学習ってどうやったらわかるの?
訓練データでの成績が改善しても、検証データでは改善が止まったり悪くなったりするのが兆候だよ。小さな差があるだけでは異常とは限らないので、同じ指標で推移を見る。図は損失が小さいほどよい場合の説明例だよ。
なんで起こるの?
訓練データ固有の揺らぎまで拾うと、新しいデータに通用しにくいんだ。データに対してモデルの容量が大きい場合や、学習を続けすぎた場合に起こり得る。ただしモデルの大きさや学習時間だけで決まるわけではないよ。
どうやって防ぐの?
テストデータを見ながら調整していい?
「二重降下」って何?
モデルの規模などを増やすと、テスト誤差が一度悪くなった後に再び改善する現象だよ。2019年のDeep Double Descentでは、規模だけでなく学習回数についても報告された。特定の実験条件での結果なので、大きくすれば必ずよくなるという保証にはならないんだ。
まとめ:ざっくりこれだけ覚えればOK!
「過学習」って出てきたら「訓練データに合わせすぎて、未知のデータへの予測が弱くなる現象」と思えばだいたいOK!
📖 おまけ:英語の意味
「Overfitting」 = 過剰な適合
💬 overは過度に、fittingは適合すること。モデルを大きくすること自体が、必ず過学習になるという意味ではないよ。