【えーあいれっどちーみんぐ】
AIレッドチーミング とは?
最終更新:
💡 AIをさまざまな使い方で試し、危険な振る舞いを探す
AIモデルやそれを使うアプリケーションを多様な入力・利用状況で試し、有害出力や安全対策の弱点を探索する活動。攻撃者を想定した試験に加え、通常の利用で起きる問題も調べる。
📌 このページのポイント
有害な回答を出さないか、安全対策を回避されないかなどを試すよ。モデル単体だけでなく、モデルを組み込んだアプリも対象になる。攻撃者を想定する試験のほか、普通の利用者が予期せず危険な出力に出会う状況も調べるんだ
具体的にはどんな問題?
例えば有害な内容を出力する、偏った扱いをする、悪意ある指示で本来の指示から外れる、といった問題だよ。対象の機能や用途に合わせて試験の範囲を決め、入力と出力、使ったモデルや設定を記録して、問題を再現できるようにするんだ
AIを作る企業も実施しているの?
例えばAnthropicは、人間の専門家による試験、自動化、外部からの報告などの取り組みを説明しているよ。どの企業も全ての公開前に同じ試験を必ず行う、と一律には言えない。製品や用途に合わせた試験が必要なんだ
人間と自動化ではどちらがいい?
役割が違うよ。自動化は多くの入力を試すのに役立ち、人間の専門家や利用者は、分野特有の問題や見落とした状況を探せる。方法ごとに得意な範囲が違い、組み合わせても全ての弱点を発見できる保証はないんだ
見つけた問題は、再学習すれば直る?
対策は問題次第だよ。学習の改善に加えて、プロンプトやフィルターなどを見直す方法もある。対策後にはモデルとアプリの両方を再試験する。問題の発見件数だけでは、その問題がどれくらい起きるかや対策の効果は分からないので、別に系統的な測定も行うんだ
📖 おまけ:英語の意味
「AI Red Teaming」 = AIに対するレッドチームの試験活動
💬 レッドチームは、攻撃者を想定して弱点を探す側の呼び方だよ。AI分野では、有害な出力を生む通常の利用状況まで含めて試すこともある