【もでるはんてんこうげき】

モデル反転攻撃 とは?

最終更新:
💡 モデルの情報から、入力側の特徴を逆向きに推定する

機械学習モデルの出力や内部情報を手がかりに、学習データに関係する特徴や、特定のクラスを代表する入力などを推定する攻撃。元の学習データを完全に取り出せるとは限らない。

📌 このページのポイント
モデルの情報から、入力側を推定する 攻撃者 候補の入力を作る 学習済み モデル 問い合わせ スコアの応答 特徴・代表例を推定 元の写真を完全に取り出せるとは限らない 公開する情報・アクセス・学習方法を検討 攻撃条件に合わせて対策を評価
信頼度スコアを使うモデル反転攻撃の概念例。矢印は問い合わせ・応答・推定の方向です。得られる特徴や代表例は、元の学習データそのものとは限りません。
ひよこ ひよこ
モデル反転攻撃って、何を狙うの?
ペンギン先生 ペンギン先生
モデルが返すスコアや、手に入る内部情報を使って、入力側の特徴を推定する攻撃だよ。攻撃者が使える情報には、問い合わせだけの場合も、モデルの中身が分かる場合もある。大量に質問することだけが定義ではないんだ。
ひよこ ひよこ
元の学習データが、そのまま出てくるの?
ペンギン先生 ペンギン先生
必ずそうなるわけではないよ。たとえば、ある人物として認識されやすい顔画像を推定しても、それが学習時の写真そのものとは限らない。特徴を持つ代表例の推定と、個別の学習データの復元を区別するんだ。
ひよこ ひよこ
顔画像の研究では、何を使ったの?
ペンギン先生 ペンギン先生
Fredriksonらの2015年の研究では、人物名と顔認識モデルの信頼度スコアなどを使って、本人と認識できる画像を得た例があるよ。どのモデルでも同じように復元できるという保証ではなく、モデルや公開される情報が攻撃の条件に関わるんだ。
ひよこ ひよこ
出力を丸めたり、回数を制限したりすれば防げる?
ペンギン先生 ペンギン先生
詳しいスコアを公開する必要があるかを見直したり、問い合わせを制限したりする対策は検討できるよ。ただし、モデルの中身が公開されていればAPIの制限だけでは足りない。対策の効果も、攻撃者が持つ情報や手法に合わせて評価するんだ。
ひよこ ひよこ
差分プライバシーも対策になる?
ペンギン先生 ペンギン先生
個々の学習データから漏れる情報を抑えるための考え方で、DP-SGDなど学習に使う方法もあるよ。単に出力へ適当なノイズを加えればよいわけではなく、保護の単位やパラメーターを設計する。品質とのトレードオフも確認するんだ。
もっと詳しく知りたい人へ

メンバーシップ推論とは違う?

メンバーシップ推論は、あるデータが学習に使われたかを判定することを狙います。モデル反転攻撃は、入力側の特徴などの推定を狙います。何を知ろうとする攻撃かを区別すると整理できます。

ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「モデル反転攻撃」って出てきたら「モデルの情報から、入力側の特徴を逆向きに推定する攻撃」と思えればだいたいOK!
📖 おまけ:英語の意味
「Model Inversion Attack」 = モデル反転攻撃
💬 Inversionは逆向きにすること。通常は入力から予測を得るモデルを、入力側の情報の推定に使うイメージだよ

参考資料

← 用語集にもどる