【じぇいるぶれいく】

ジェイルブレイク(AI) とは?

最終更新:
💡 AIの安全上の制限を回避しようとする行為

生成AIの安全上の制限を回避し、本来拒否される出力を引き出そうとする行為。プロンプトインジェクションとの関係と対策の限界を解説します。

📌 このページのポイント
AIのジェイルブレイク:制限の回避を狙う安全上の制限の回避を狙う入力生成AIと安全対策モデル・入力・運用次第拒否・制限など出力を確認回避される場合意図しない出力接続した機能の権限・重要な操作も管理する
回避の試みが必ず成功するわけではありません。入力・出力の対策に加え、ツール側の権限や操作も検証します。一度拒否できても、すべての攻撃を防げる保証にはなりません。
ひよこ ひよこ
AIのジェイルブレイクって、何をすること?
ペンギン先生 ペンギン先生
生成AIに設けた安全上の制限を回避し、本来拒否される出力を引き出そうとすることだ。AIが物理的な檻に入っているという意味ではない。
ひよこ ひよこ
試したら、必ず制限が外れるの?
ペンギン先生 ペンギン先生
成功するとは限らない。モデルや対策、入力、利用する機能によって結果は変わる。ある入力で拒否できたから、すべての攻撃を防げるとも言えない。
ひよこ ひよこ
ペンギン先生 ペンギン先生
重なる概念だ。入力でAIの動作を意図しない方向へ変える攻撃がプロンプトインジェクションで、安全上の制限の回避を狙うものをジェイルブレイクと呼ぶ。OWASPの2025年版は、その一形態として説明している。
ひよこ ひよこ
普通に質問を言い換えるのも、攻撃?
ペンギン先生 ペンギン先生
言い換え自体で決まるわけではない。何を狙い、どの制限や指示を回避しようとしているかを見る。正当な質問が誤って拒否される問題と、安全上の制限を破る試みは区別する。
ひよこ ひよこ
「禁止」と書いておけば、防げる?
ペンギン先生 ペンギン先生
指示や入力・出力の検査は対策の一部だが、それだけで完全に防げるとは限らない。モデルの安全対策の更新や、想定した攻撃への検証も組み合わせる。
ひよこ ひよこ
AIにメール送信などを任せるときは?
ペンギン先生 ペンギン先生
AIの回答だけで権限を決めず、接続する機能側でも最小限の権限や操作の検証を行う。重要な操作の承認などを組み合わせ、制限を回避された場合の影響も抑える。
もっと詳しく知りたい人へ

入力でAIを操作できると、サーバーの権限も得られる?

同じではありません。実行できる操作は、接続したツールや認証、システム側の権限にも依存します。ただしAIに強い権限を与えていると影響が広がるため、出力の拒否だけに頼らない設計が必要です。

資料を読み込ませる場合にも対策が必要?

必要です。外部のページやファイルの内容を、AIが指示として解釈する間接的なプロンプトインジェクションもあります。資料と指示を区別し、外部内容だけで重要な操作を許可しないようにします。

ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「AIのジェイルブレイク」って出てきたら「モデルの安全上の制限を回避し、本来拒否される出力を引き出そうとする行為」と思えばだいたいOK!
📖 おまけ:英語の意味
「Jailbreak」 = 脱獄
💬 制限を脱することになぞらえた呼び方です。iPhoneのiOSを無許可で改変する行為にも使われますが、このページは生成AIでの意味を扱います。

参考資料

← 用語集にもどる