【えーあいれっどちーみんぐ】

AIレッドチーミング とは?

最終更新:
💡 AIをさまざまな使い方で試し、危険な振る舞いを探す

AIモデルやそれを使うアプリケーションを多様な入力・利用状況で試し、有害出力や安全対策の弱点を探索する活動。攻撃者を想定した試験に加え、通常の利用で起きる問題も調べる。

📌 このページのポイント
弱点を探し、対策して、再び試す多様な入力で試験攻撃・通常の利用AIシステムモデル + アプリ問題を記録入力・出力・設定対策と効果の測定原因に合わせて改善対象の機能・範囲を決めて実施発見件数だけで、発生率は分からない
試験・問題の記録・対策・再試験の循環です。赤は攻撃などを含む試験、青は対象、橙は発見した問題、緑は対策を示します。破線は再試験へ戻る流れ。問題の探索に加え、別に系統的な測定が必要です。
ひよこ ひよこ
AIレッドチーミングでは何を調べるの?
ペンギン先生 ペンギン先生
有害な回答を出さないか、安全対策を回避されないかなどを試すよ。モデル単体だけでなく、モデルを組み込んだアプリも対象になる。攻撃者を想定する試験のほか、普通の利用者が予期せず危険な出力に出会う状況も調べるんだ
ひよこ ひよこ
具体的にはどんな問題?
ペンギン先生 ペンギン先生
例えば有害な内容を出力する、偏った扱いをする、悪意ある指示で本来の指示から外れる、といった問題だよ。対象の機能や用途に合わせて試験の範囲を決め、入力と出力、使ったモデルや設定を記録して、問題を再現できるようにするんだ
ひよこ ひよこ
AIを作る企業も実施しているの?
ペンギン先生 ペンギン先生
例えばAnthropicは、人間の専門家による試験、自動化、外部からの報告などの取り組みを説明しているよ。どの企業も全ての公開前に同じ試験を必ず行う、と一律には言えない。製品や用途に合わせた試験が必要なんだ
ひよこ ひよこ
人間と自動化ではどちらがいい?
ペンギン先生 ペンギン先生
役割が違うよ。自動化は多くの入力を試すのに役立ち、人間の専門家や利用者は、分野特有の問題や見落とした状況を探せる。方法ごとに得意な範囲が違い、組み合わせても全ての弱点を発見できる保証はないんだ
ひよこ ひよこ
見つけた問題は、再学習すれば直る?
ペンギン先生 ペンギン先生
対策は問題次第だよ。学習の改善に加えて、プロンプトやフィルターなどを見直す方法もある。対策後にはモデルとアプリの両方を再試験する。問題の発見件数だけでは、その問題がどれくらい起きるかや対策の効果は分からないので、別に系統的な測定も行うんだ
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「AIレッドチーミング」って出てきたら「AIを多様な状況で試して、危険な振る舞いを探す活動」と思えばだいたいOK!
📖 おまけ:英語の意味
「AI Red Teaming」 = AIに対するレッドチームの試験活動
💬 レッドチームは、攻撃者を想定して弱点を探す側の呼び方だよ。AI分野では、有害な出力を生む通常の利用状況まで含めて試すこともある

参考資料

← 用語集にもどる