【でーたぽいずにんぐ】

データポイズニング とは?

最終更新:
💡 AIが学ぶ「教科書」を細工して、判断を誘導する攻撃

学習データを悪意をもって追加・改変し、AIモデルの判断や動作を誘導する攻撃。全体の精度を下げるもの、特定の対象や合図で誤動作させるものなどがあります。単なるデータの誤りとは区別します。

📌 このページのポイント
学習データへの細工が、判断に影響学習データ画像とラベルなど犬の画像 → 犬悪意ある細工誤ラベルの例犬の画像 → 猫+AIが学ぶモデルの訓練判断へ影響誤り・性能低下出所・変更の管理と、データ・モデルの点検
誤ラベルによる細工の例。特定の合図を狙うなど、見えにくい攻撃もあります。
ひよこ ひよこ
データに毒を入れるって、どういうこと?
ペンギン先生 ペンギン先生
学習に使うデータを、攻撃者がわざと追加したり書き換えたりすることだよ。例えば犬の画像に猫というラベルを付けるのは、細工の一例。実際にどの判断へ影響するかは、データや学習方法、攻撃の設計によって変わるんだ。
ひよこ ひよこ
間違ったデータが混じることとは違うの?
ペンギン先生 ペンギン先生
偶然の入力ミスや偏りも品質を下げるけれど、ポイズニングは悪意をもってモデルに影響を与える攻撃だよ。外部から集めるデータや、追加学習用のデータに入り込む場合がある。すべてが、見て分かる誤ラベルとは限らないんだ。
ひよこ ひよこ
いつもAIの答え全部がおかしくなるの?
ペンギン先生 ペンギン先生
全体の性能を下げる攻撃も、特定の対象だけを狙う攻撃もあるよ。普段は正常に見えても、特定の印や言葉を合図に誤動作するバックドア型もあるんだ。平均的な精度だけで点検すると、見逃すことがあるね。
ひよこ ひよこ
敵対的攻撃と、どう違うの?
ペンギン先生 ペンギン先生
敵対的機械学習の攻撃には、ポイズニングも含まれるよ。比較するなら、学習データを細工するポイズニングと、完成したモデルへの入力を細工する回避攻撃を分けよう。学習時を狙うか、使うときの入力を狙うかが違うんだ。
ひよこ ひよこ
どう対策すればいいの?
ペンギン先生 ペンギン先生
データの出所や変更履歴、アクセス権を管理し、ラベルや異常な傾向を点検しよう。学習後も、信頼できる別のデータや想定する条件でモデルを評価するんだ。チェックやフィルターだけで、すべての攻撃を見つけられる保証はないよ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「データポイズニング」って出てきたら「AIの学習データを細工して、判断を誘導する攻撃」と思えばだいたいOK!
📖 おまけ:英語の意味
「Data Poisoning」 = データの汚染
💬 Poisoningは毒を盛ることを表す言葉だよ。学習データへの細工を、教科書に毒を入れるようなイメージで捉えると分かりやすいね。

参考資料

← 用語集にもどる