【もでるせっしゅこうげき】

モデル窃取攻撃 とは?

最終更新:
💡 学習済みのモデルを盗む、応答から振る舞いを複製する

機械学習で学習済みのモデルを不正に取得・複製する攻撃。保存されたファイルを盗むほか、推論APIへの入力と応答から似た振る舞いをするモデルを作る抽出攻撃がある。

📌 このページのポイント
モデルを不正に複製する二つの経路学習済みモデルAPI応答ファイル入出力を集めて振る舞いを再現保存データを直接取得利用制限・監視アクセス制御抽出は全パラメータのコピーとは限らない
左はAPIの応答から似た振る舞いを作る抽出、右はモデルの保存ファイルを不正取得する経路です。青い矢印は取得元との関係、赤い枠は攻撃を示します。防止策は経路ごとに組み合わせます。
ひよこ ひよこ
モデル窃取攻撃って、AIのプログラムを盗むってこと?
ペンギン先生 ペンギン先生
プログラムだけでなく、学習で得たパラメータなどを含むモデルが対象だよ。保存されたファイルを不正に取得する場合と、推論APIの応答を利用して振る舞いを複製する場合があるんだ
ひよこ ひよこ
質問するだけでモデルがコピーできちゃうの?
ペンギン先生 ペンギン先生
入力と応答を集め、元に似た応答を返すものを作るモデル抽出が研究されているよ。ただし成功する範囲や必要な問い合わせ数は、モデルの種類や返す情報による。元の全てのパラメータや学習データが復元される、という意味ではないんだ
ひよこ ひよこ
防ぐにはどうすればいいの?
ペンギン先生 ペンギン先生
APIにはアクセス制限、利用頻度の制限、利用状況の監視などを組み合わせるよ。確信度の詳しい値を返さないことも対策の一つだけれど、それだけで抽出を完全に防げるわけではない。保存ファイルには別途アクセス制御などが必要だね
ひよこ ひよこ
ウォーターマークを付ければ盗まれない?
ペンギン先生 ペンギン先生
主に、疑わしいコピーが元のモデルに由来するかを確認する助けになる技術だよ。盗む操作自体を止めるものではなく、モデルの改変や抽出方法によって検出が難しくなる場合もある。防止策と、盗用後に調べる仕組みを分けて考えるんだ
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「モデル窃取攻撃」って出てきたら「学習済みのモデルや、その振る舞いを不正に複製する攻撃」と思えばだいたいOK!
📖 おまけ:英語の意味
「Model Theft / Model Extraction Attack」 = モデル窃取・モデル抽出攻撃
💬 APIの応答を分析してモデルを再現する手法は『モデル抽出攻撃』とも呼ばれるよ

参考資料

← 用語集にもどる