【えーあいふぁいあうぉーる】
AIファイアウォール とは?
最終更新:
💡 AIとのやりとりを、検査とルールで見張る門番
LLMアプリへの入力や出力を検査し、設定した方針に応じて記録・遮断などを行う仕組みや製品の呼び名。検査対象や機能は製品ごとに異なり、攻撃や情報漏洩を完全に防ぐ保証はない。
📌 このページのポイント
- プロンプトインジェクション、有害な内容、機密情報などの検査に使う
- 入力だけを検査する機能も、入力と出力の両方を検査する機能もある
- 検出後に記録するか遮断するかなどは、製品の機能と設定による
- 検査の見逃しや誤検知を考慮し、権限管理やテストと組み合わせる
LLMアプリに渡す指示や、返ってくる応答を検査して制御する仕組みだよ。例えば、入力に紛れた不正な指示や、応答中の有害な内容を調べる。ただし、入力と出力のどちらを検査できるかは製品や機能によって違うんだ。
具体的に何を見つけるの?
プロンプトインジェクション、個人情報、有害な内容などが対象になるよ。検出できる種類は製品ごとに確認しよう。外部の文書に紛れた指示など、単純な禁止語だけでは見分けにくいものもあるんだ。
見つけたら必ず止めるの?
設定によるよ。検出結果を記録するだけの運用もあれば、ルールで要求を遮断する運用もある。AIによる内容の判定を使う機能でも、正常な内容を止める誤検知や、危険な内容の見逃しを考えて調整する必要があるんだ。
どんな製品があるの?
Cloudflareの旧Firewall for AIは、現名称AI Security for Appsで、条件に合う入力を検査してWAFのルールに使う例だよ。一方、同社のAI GatewayのGuardrailsは入力と応答を検査し、記録や遮断を選べる。名前が似ていても対象と設定を確認しよう。
入れれば、社内データを使うAIも安全?
それだけでは保証できないよ。文書に紛れた指示なども含めてテストし、AIが呼び出せる機能や参照データの権限を絞ることが必要だね。重要な操作には人の承認を組み合わせるなど、検査をほかの対策と一緒に使うんだ。
📖 おまけ:英語の意味
「AI Firewall」 = AIの防火壁
💬 通信を検査して制御するファイアウォールになぞらえた呼び名だよ。ここではLLMの入力や出力を調べる仕組みを扱い、全製品に共通の仕様を表す名前ではないんだ。