【じぇいるぶれいく】
ジェイルブレイク(AI) とは?
最終更新:
💡 AIの安全上の制限を回避しようとする行為
生成AIの安全上の制限を回避し、本来拒否される出力を引き出そうとする行為。プロンプトインジェクションとの関係と対策の限界を解説します。
📌 このページのポイント
- 生成AIの安全上の制限の回避を狙う
- 試みたからといって、必ず成功するわけではない
- プロンプトインジェクションと重なる概念
- 出力だけでなく、接続した機能の権限も管理する
AIのジェイルブレイクって、何をすること?
試したら、必ず制限が外れるの?
成功するとは限らない。モデルや対策、入力、利用する機能によって結果は変わる。ある入力で拒否できたから、すべての攻撃を防げるとも言えない。
プロンプトインジェクションとは違う?
重なる概念だ。入力でAIの動作を意図しない方向へ変える攻撃がプロンプトインジェクションで、安全上の制限の回避を狙うものをジェイルブレイクと呼ぶ。OWASPの2025年版は、その一形態として説明している。
普通に質問を言い換えるのも、攻撃?
言い換え自体で決まるわけではない。何を狙い、どの制限や指示を回避しようとしているかを見る。正当な質問が誤って拒否される問題と、安全上の制限を破る試みは区別する。
「禁止」と書いておけば、防げる?
指示や入力・出力の検査は対策の一部だが、それだけで完全に防げるとは限らない。モデルの安全対策の更新や、想定した攻撃への検証も組み合わせる。
AIにメール送信などを任せるときは?
AIの回答だけで権限を決めず、接続する機能側でも最小限の権限や操作の検証を行う。重要な操作の承認などを組み合わせ、制限を回避された場合の影響も抑える。
もっと詳しく知りたい人へ
入力でAIを操作できると、サーバーの権限も得られる?
同じではありません。実行できる操作は、接続したツールや認証、システム側の権限にも依存します。ただしAIに強い権限を与えていると影響が広がるため、出力の拒否だけに頼らない設計が必要です。
資料を読み込ませる場合にも対策が必要?
必要です。外部のページやファイルの内容を、AIが指示として解釈する間接的なプロンプトインジェクションもあります。資料と指示を区別し、外部内容だけで重要な操作を許可しないようにします。
まとめ:ざっくりこれだけ覚えればOK!
「AIのジェイルブレイク」って出てきたら「モデルの安全上の制限を回避し、本来拒否される出力を引き出そうとする行為」と思えばだいたいOK!
📖 おまけ:英語の意味
「Jailbreak」 = 脱獄
💬 制限を脱することになぞらえた呼び方です。iPhoneのiOSを無許可で改変する行為にも使われますが、このページは生成AIでの意味を扱います。