【てきたいてきこうげき】

敵対的攻撃 とは?

最終更新:
💡 入力や学習データを細工して、AIの動作を狙って乱す

機械学習モデルやそのデータを意図的に操作し、誤判断など望ましくない動作を引き起こす攻撃。入力を細工する回避攻撃だけでなく、学習データを汚染する攻撃なども含む。入力の変更が人に見えないとは限らない。

📌 このページのポイント
入力を細工する回避攻撃の研究例 モデルの分類 パンダ 狙って変更 モデルの分類 テナガザル 攻撃用の変更を加えた画像を再入力 全モデル・全入力で同じ結果になるわけではない
Goodfellowらの図1の画像認識実験を模式化。ここに描いたパンダや模様自体は攻撃画像ではない。敵対的攻撃には学習データへの攻撃などもあり、全てが目に見えない変更を使うわけではない。
ひよこ ひよこ
どんなことをする攻撃なの?
ペンギン先生 ペンギン先生
AIの動作を狙って乱す攻撃だよ。よく紹介されるのが入力を細工する回避攻撃。Goodfellowらの論文には、パンダの画像をわずかに変更すると、実験に使った画像認識モデルがテナガザルと分類する例があるんだ。
ひよこ ひよこ
少しノイズを加えれば何でも成功する?
ペンギン先生 ペンギン先生
その例は誤分類を起こす方向へ意図的に変更した入力だよ。ランダムな雑音なら何でも同じ結果になるわけではない。人に目立たない変更を使う例も、目に見える模様を使う例もある。攻撃の成立はモデルや入力、攻撃者に可能な操作に関係するんだ。
ひよこ ひよこ
学習データへの攻撃も同じ言葉に入るの?
ペンギン先生 ペンギン先生
広い整理では含まれるよ。学習用データを汚染して学習結果へ影響を与える攻撃と、学習済みモデルへの入力を変える回避攻撃は、狙う段階が違う。この図は後者の研究例を模式化しているんだ。
ひよこ ひよこ
どんな影響があるの?
ペンギン先生 ペンギン先生
AIの判断を使うシステムでは、誤分類が後続の判断へ影響するおそれがあるよ。ただし実験であるモデルをだませたことだけで、実際の車や認証システムでも同じ攻撃が成功すると決まるわけではない。対象と条件をそろえた評価が必要だね。
ひよこ ひよこ
対策はある?
ペンギン先生 ペンギン先生
誤判断を狙って作った入力を学習に使う、敵対的訓練という方法があるよ。普通の雑音を加えることとは区別しよう。特定の攻撃に強くなっても全攻撃を防げる保証にはならないので、攻撃方法を変えて防御の効果を評価することが大切なんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「敵対的攻撃」って出てきたら「入力や学習データを細工して、AIの動作を狙って乱す」と思えばだいたいOK!
📖 おまけ:英語の意味
「Adversarial Attack」 = 敵対的な攻撃
💬 Adversarialは敵対的な、Attackは攻撃を意味するよ。普通の入力ミスや偶然の雑音と区別し、攻撃者が目的を持って操作する点を覚えよう。

参考資料

← 用語集にもどる