【てきたいてきこうげき】
敵対的攻撃 とは?
最終更新:
💡 入力や学習データを細工して、AIの動作を狙って乱す
機械学習モデルやそのデータを意図的に操作し、誤判断など望ましくない動作を引き起こす攻撃。入力を細工する回避攻撃だけでなく、学習データを汚染する攻撃なども含む。入力の変更が人に見えないとは限らない。
📌 このページのポイント
- 入力を細工して誤判断を狙うものは回避攻撃として整理される
- 小さな変化のほか、目に見える貼り付け模様を使う例もある
- 学習データを汚染する攻撃は、推論時の入力操作とは別
- 防御の効果はモデル・攻撃方法・評価条件によって異なる
どんなことをする攻撃なの?
少しノイズを加えれば何でも成功する?
その例は誤分類を起こす方向へ意図的に変更した入力だよ。ランダムな雑音なら何でも同じ結果になるわけではない。人に目立たない変更を使う例も、目に見える模様を使う例もある。攻撃の成立はモデルや入力、攻撃者に可能な操作に関係するんだ。
学習データへの攻撃も同じ言葉に入るの?
広い整理では含まれるよ。学習用データを汚染して学習結果へ影響を与える攻撃と、学習済みモデルへの入力を変える回避攻撃は、狙う段階が違う。この図は後者の研究例を模式化しているんだ。
どんな影響があるの?
対策はある?
誤判断を狙って作った入力を学習に使う、敵対的訓練という方法があるよ。普通の雑音を加えることとは区別しよう。特定の攻撃に強くなっても全攻撃を防げる保証にはならないので、攻撃方法を変えて防御の効果を評価することが大切なんだ。
まとめ:ざっくりこれだけ覚えればOK!
「敵対的攻撃」って出てきたら「入力や学習データを細工して、AIの動作を狙って乱す」と思えばだいたいOK!
📖 おまけ:英語の意味
「Adversarial Attack」 = 敵対的な攻撃
💬 Adversarialは敵対的な、Attackは攻撃を意味するよ。普通の入力ミスや偶然の雑音と区別し、攻撃者が目的を持って操作する点を覚えよう。