最終更新:
AIエージェントを外部の文章で誘導する — プロンプトインジェクションと対策
この記事は時点のニュースです。現在の提供状況とは異なる場合があります。誤りの訂正は随時行います。
AIがウェブの記事に騙されるって本当?
外部の文章に命令を混ぜ、AIを利用者の依頼から逸らす攻撃があるよ。間接プロンプトインジェクションと呼ばれ、ページだけでなく、メール、文書、ツールの出力も入口になるんだ。
人には見えない文字でないと起きないの?
隠された文字は一例で、普通に見える文章でも起こり得るよ。反対に、隠し文字を必ずAIが読むわけでもないんだ。ページから何を取り出すか、画面をどう認識するかは製品の仕組みによって違うよ。
AIは指示の違いがまったくわからないの?
指示の優先順位や出所を扱う仕組みはあるよ。ただし外部の文章を誤って指示として受け入れることがあり、それを完全に防ぐのは難しいんだ。「すべての文章を区別できない」と言い切ると、現在の防御も見落としてしまうね。
Googleは実際に何を見つけたの?
メールが全部見られるということではないの?
有名なサイトだけを使えば安心?
信頼しているサイトにも利用者の投稿や第三者の内容があるよ。ドメインが有名というだけで、そこにある文章を操作の命令として扱わないことが大切なんだ。
利用するときにできる対策は?
連携先とアクセス範囲を必要なものに絞ろう。送信、削除、購入などでは宛先や対象を確認し、不要になった連携は解除するんだ。確認画面を読み飛ばさず、依頼していない操作が出たら止めよう。
開発側は、注意書きを足せばいい?
モデルへの指示だけに任せず、使えるツールや通信先をアプリ側でも制限することが大切だよ。外部データを読んだ後に何が起きるかを記録して、意図しない操作を止めるテストも行おう。防御を重ね、失敗した場合の影響も小さくするんだ。
観測と被害を区別する
Googleの調査はCommon Crawlという公開Webのアーカイブを対象としています。ログインが必要なページや多くのSNSを網羅した調査ではなく、世界全体の攻撃成功率を示すものでもありません。本記事の情報漏えいの説明は、権限や送信経路がある場合のリスクです。
エラーログを入口にする具体例はAgentjackingの解説にまとめています。製品名だけで一律に安全・危険と判断せず、利用している機能と設定を確認してください。
参考資料
確認日:2026年9月20日。
- Google:AI threats in the wild — 2026年4月の観測結果、調査範囲と限界。
- NIST SP 800-207 — 接続元だけで信頼せず、資源へのアクセスを管理する原則。