【かんせつぷろんぷといんじぇくしょん】

間接プロンプトインジェクション とは?

最終更新:
💡 AIが読む資料に、別の指示を紛れ込ませる

AIが読むWebページや文書などに指示を紛れ込ませ、利用者の依頼とは違う応答や操作へ誘導する攻撃。直接入力との違いと、資料・権限を分けて扱う対策を説明します。

📌 このページのポイント
間接注入:資料の指示が混ざる利用者の依頼「ページを要約して」参照する資料別の指示が混ざるAIが取り込む資料の指示に誘導される応答の改変など権限・操作を制限資料の分離と、出力・操作の検証も行う
参照する資料から別の指示が入る構成例。攻撃の影響はAIが扱う情報や権限に依存し、対策を一つ入れただけで完全に防げるとは限りません。
ひよこ ひよこ
間接プロンプトインジェクションは、どこから入るの?
ペンギン先生 ペンギン先生
AIが読むWebページや文書などから入るよ。利用者は「このページを要約して」と普通に依頼していても、参照先に紛れた別の指示がAIの応答を変える可能性があるんだ。
ひよこ ひよこ
攻撃用のプログラムを実行させるの?
ペンギン先生 ペンギン先生
コードは必須ではないよ。自然言語の指示を、資料の内容ではなく自分への命令として扱ってしまうことが問題。例えば、要約の代わりに特定の商品を薦めるように誘導する攻撃が考えられる。指示が人の目に見える場合もあるんだ。
ひよこ ひよこ
RAGなら安全になる?
ペンギン先生 ペンギン先生
RAGで取得する文書にも指示が混ざり得るよ。RAGを使うこと自体は防御にならない。応答の改変だけでなく、情報へのアクセスや外部への操作を許したAIでは、その権限に応じた影響も考える必要があるんだ。
ひよこ ひよこ
どう対策するの?
ペンギン先生 ペンギン先生
取得した資料を信用できない内容として明示し、依頼やシステムの指示と分ける。加えて、AIの権限を必要な範囲に絞り、出力や外部操作をコードで検証する。重要な操作の承認や攻撃を想定した試験も組み合わせよう。文章の除去や注意書きだけで完全に防げるとは限らないよ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「間接プロンプトインジェクション」って出てきたら「AIが読む資料に指示を紛れ込ませて操る攻撃」と思えばだいたいOK!
📖 おまけ:英語の意味
「Indirect prompt injection」 = 外部資料などを経由するプロンプト注入
💬 攻撃者がAIへの依頼を直接入力する方式と区別し、AIが取り込む外部の内容を経由するため「間接」と呼びます。

参考資料

← 用語集にもどる