【コンスティテューショナルエーアイ】
Constitutional AI とは?
最終更新:
💡 人が定めた原則を使い、AIの評価から学習する
人が定めた原則に基づくAIの批評・修正や回答の比較評価を、モデルの学習に使う手法。Anthropicが2022年に発表し、有害な回答の抑制と有用性の維持を目指した。
📌 このページのポイント
AIに憲法って、どういうこと?
回答を評価するための原則を、人が文章で定めることだよ。例えば有害な内容を助長しない、といった基準を示し、AIが回答を批評・修正したり、二つの回答を比較したりするときに使うんだ
毎回の回答を、自分で直してから返すの?
RLHFとはどう違うの?
原則はAIが勝手に決めるの?
人が定めるよ。何を有害とみなすか、役立つ回答とのバランスをどう考えるかも設計の課題なんだ。原則を書くだけで望みどおりのモデルになるとは限らず、学習後の振る舞いを評価する必要があるね
この方法なら、間違いや有害な回答はなくなる?
保証はないよ。AIの批評にも不正確なものがあり、元論文もそうした例に触れている。研究では有害性などの評価が改善したけれど、それは評価した条件での結果だよ。実際の用途に合わせた確認が必要なんだ
📖 おまけ:英語の意味
「Constitutional AI」 = 憲法的AI
💬 Constitutionalは「憲法の」という意味。ここでは、人が定めた原則をAIの評価基準にすることを憲法に例えているよ