【データドリフト】
データドリフト とは?
最終更新:
💡 入力の傾向が変わったら、予測への影響を確かめよう
機械学習モデルが受け取る入力データの分布が、過去や学習時のデータと変わること。予測品質が落ちる可能性はあるが、変化だけでは精度低下を断定できない。比較期間や特徴量を決め、原因と実際の予測結果を確認する。
📌 このページのポイント
- 入力データの分布が、基準と変わる
- 分布の変化だけで、精度低下は断定しない
- 比較する期間・特徴量・しきい値を決める
- 原因と予測品質を調べ、必要な対策を選ぶ
データが、壊れることなの?
壊れるとは限らないよ。たとえば利用者の年齢層の割合が変わるなど、入力の分布が変わること。過去の運用データや学習時のデータを基準に比較するんだ。
変わったら、必ず予測が外れる?
必ずではないよ。変化してもモデルが対応できる場合がある。ドリフトは調査のきっかけで、正解データが得られるなら実際の予測品質も確かめよう。
どうやって、気づくの?
特徴量の平均や分布を期間ごとに比べる方法があるよ。統計的な検定や分布の距離も使う。比較期間やデータ量、しきい値で結果が変わるので、同じ条件で継続して見ることが大切だね。
見つけたら、すぐ再学習する?
先に原因を調べよう。入力の作り方や収集に問題がないか、実際の利用状況が変わったかを確認する。再学習が必要なら、適切な新しいデータで学習し、評価してから置き換えるんだ。
コンセプトドリフトとは、何が違う?
入力の分布の変化と、入力と正解の関係の変化を区別するよ。前者がデータドリフト、後者がコンセプトドリフト。両方が同時に起こることもあり、資料によって用語の範囲は少し違うんだ。
まとめ:ざっくりこれだけ覚えればOK!
「データドリフト」って出てきたら「AIに入るデータの傾向が、以前と変わること」と思えばだいたいOK!
📖 おまけ:英語の意味
「Data drift」 = データの傾向の変化
💬 driftはずれや変化を表す言葉。運用中の過去データとの比較と、学習データとの比較を分ける資料もあるよ。