【でーたぽいずにんぐ】
データポイズニング とは?
最終更新:
💡 AIが学ぶ「教科書」を細工して、判断を誘導する攻撃
学習データを悪意をもって追加・改変し、AIモデルの判断や動作を誘導する攻撃。全体の精度を下げるもの、特定の対象や合図で誤動作させるものなどがあります。単なるデータの誤りとは区別します。
📌 このページのポイント
- 学習データへの悪意ある混入・改変で、モデルへ影響を与える
- 全体の性能低下だけでなく、特定の対象や合図を狙う場合もある
- 出所・変更の管理、データ点検、モデルの評価を組み合わせる
データに毒を入れるって、どういうこと?
学習に使うデータを、攻撃者がわざと追加したり書き換えたりすることだよ。例えば犬の画像に猫というラベルを付けるのは、細工の一例。実際にどの判断へ影響するかは、データや学習方法、攻撃の設計によって変わるんだ。
間違ったデータが混じることとは違うの?
偶然の入力ミスや偏りも品質を下げるけれど、ポイズニングは悪意をもってモデルに影響を与える攻撃だよ。外部から集めるデータや、追加学習用のデータに入り込む場合がある。すべてが、見て分かる誤ラベルとは限らないんだ。
いつもAIの答え全部がおかしくなるの?
全体の性能を下げる攻撃も、特定の対象だけを狙う攻撃もあるよ。普段は正常に見えても、特定の印や言葉を合図に誤動作するバックドア型もあるんだ。平均的な精度だけで点検すると、見逃すことがあるね。
敵対的攻撃と、どう違うの?
敵対的機械学習の攻撃には、ポイズニングも含まれるよ。比較するなら、学習データを細工するポイズニングと、完成したモデルへの入力を細工する回避攻撃を分けよう。学習時を狙うか、使うときの入力を狙うかが違うんだ。
どう対策すればいいの?
データの出所や変更履歴、アクセス権を管理し、ラベルや異常な傾向を点検しよう。学習後も、信頼できる別のデータや想定する条件でモデルを評価するんだ。チェックやフィルターだけで、すべての攻撃を見つけられる保証はないよ。
まとめ:ざっくりこれだけ覚えればOK!
「データポイズニング」って出てきたら「AIの学習データを細工して、判断を誘導する攻撃」と思えばだいたいOK!
📖 おまけ:英語の意味
「Data Poisoning」 = データの汚染
💬 Poisoningは毒を盛ることを表す言葉だよ。学習データへの細工を、教科書に毒を入れるようなイメージで捉えると分かりやすいね。