【コンスティテューショナルエーアイ】

Constitutional AI とは?

最終更新:
💡 人が定めた原則を使い、AIの評価から学習する

人が定めた原則に基づくAIの批評・修正や回答の比較評価を、モデルの学習に使う手法。Anthropicが2022年に発表し、有害な回答の抑制と有用性の維持を目指した。

📌 このページのポイント
原則に基づくAIの評価を、学習に使う人が定める原則評価の基準AIが回答を生成学習用のデータを作る原則で批評・修正修正した回答で追加学習続く強化学習の段階回答A・B生成するAIが比較原則を参照評価を使う強化学習元論文は有用性に人の評価も使用毎回の応答手順や安全性の保証ではない
2022年の元論文の学習段階を簡略化した図。上段は批評・修正による追加学習、下段は回答比較のAI評価を使う強化学習です。矢印はデータ作成や評価の流れを示します。
ひよこ ひよこ
AIに憲法って、どういうこと?
ペンギン先生 ペンギン先生
回答を評価するための原則を、人が文章で定めることだよ。例えば有害な内容を助長しない、といった基準を示し、AIが回答を批評・修正したり、二つの回答を比較したりするときに使うんだ
ひよこ ひよこ
毎回の回答を、自分で直してから返すの?
ペンギン先生 ペンギン先生
元の研究は主に学習の作り方を説明しているよ。まず回答を生成し、原則に照らして批評・修正したデータでモデルを追加学習する。その後、AIによる回答の比較評価を使って強化学習する段階もある。利用時に毎回この手順を繰り返すという定義ではないね
ひよこ ひよこ
RLHFとはどう違うの?
ペンギン先生 ペンギン先生
RLHFは人の評価を使う強化学習だね。元論文の強化学習の段階では、有害性についての回答比較をAIの評価に置き換え、有用性には人の評価も使っている。AIの評価を使う部分をRLAIFと呼ぶよ。人の関与が全てなくなるわけではないんだ
ひよこ ひよこ
原則はAIが勝手に決めるの?
ペンギン先生 ペンギン先生
人が定めるよ。何を有害とみなすか、役立つ回答とのバランスをどう考えるかも設計の課題なんだ。原則を書くだけで望みどおりのモデルになるとは限らず、学習後の振る舞いを評価する必要があるね
ひよこ ひよこ
この方法なら、間違いや有害な回答はなくなる?
ペンギン先生 ペンギン先生
保証はないよ。AIの批評にも不正確なものがあり、元論文もそうした例に触れている。研究では有害性などの評価が改善したけれど、それは評価した条件での結果だよ。実際の用途に合わせた確認が必要なんだ
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「Constitutional AI」って出てきたら「人の原則に基づくAIの評価を使う学習手法」と思えばだいたいOK!
📖 おまけ:英語の意味
「Constitutional AI」 = 憲法的AI
💬 Constitutionalは「憲法の」という意味。ここでは、人が定めた原則をAIの評価基準にすることを憲法に例えているよ

参考資料

← 用語集にもどる