【かんせつぷろんぷといんじぇくしょん】
間接プロンプトインジェクション とは?
最終更新:
💡 AIが読む資料に、別の指示を紛れ込ませる
AIが読むWebページや文書などに指示を紛れ込ませ、利用者の依頼とは違う応答や操作へ誘導する攻撃。直接入力との違いと、資料・権限を分けて扱う対策を説明します。
📌 このページのポイント
- Webページ・文書・取得したデータなどを経由して指示が入る
- 自然言語の指示でも成立し、プログラムコードは必須ではない
- 応答の改変や情報漏えいなど、影響は与えた権限にも左右される
- 資料の分離、権限の制限、出力や操作の検証を組み合わせる
間接プロンプトインジェクションは、どこから入るの?
攻撃用のプログラムを実行させるの?
コードは必須ではないよ。自然言語の指示を、資料の内容ではなく自分への命令として扱ってしまうことが問題。例えば、要約の代わりに特定の商品を薦めるように誘導する攻撃が考えられる。指示が人の目に見える場合もあるんだ。
RAGなら安全になる?
どう対策するの?
取得した資料を信用できない内容として明示し、依頼やシステムの指示と分ける。加えて、AIの権限を必要な範囲に絞り、出力や外部操作をコードで検証する。重要な操作の承認や攻撃を想定した試験も組み合わせよう。文章の除去や注意書きだけで完全に防げるとは限らないよ。
まとめ:ざっくりこれだけ覚えればOK!
「間接プロンプトインジェクション」って出てきたら「AIが読む資料に指示を紛れ込ませて操る攻撃」と思えばだいたいOK!
📖 おまけ:英語の意味
「Indirect prompt injection」 = 外部資料などを経由するプロンプト注入
💬 攻撃者がAIへの依頼を直接入力する方式と区別し、AIが取り込む外部の内容を経由するため「間接」と呼びます。