【あらいんめんと】
アラインメント(AI) とは?
最終更新:
💡 AIの振る舞いを、望む目的と守る条件へ
AIの振る舞いを、人間が意図する目的や価値、守るべき条件に沿わせる取り組み。望ましい応答を学習させる方法などがあるが、何に合わせるかの合意や評価も課題となる。
📌 このページのポイント
- 人間の意図や守るべき条件に、AIの振る舞いを合わせる
- RLHF・DPO・Constitutional AIなどは取り組みの例
- 利用者の指示への従順さだけでなく、害や真実性も考える
- 誰の価値・目的を採用するかと、未知の場面での評価が課題
AIの何を、何に合わせるの?
出力や行動を、人間が望む目的や守るべき条件に合わせるんだ。たとえば、質問に役立つ答えを返すだけでなく、事実を捏造しない、害につながる行動を避けるといった条件も考える。AIに心や願望があるという意味ではないよ。
指示に何でも従えばいい?
利用者の指示が他の人に害を与える場合もあるので、単純に何でも従うこととは違うよ。誰の利益や価値を考慮し、どんな条件を守るかを決める必要がある。人々の好みや目的が一致しないこと自体も、難しい課題なんだ。
RLHFは、どう使うの?
ほかの方法もある?
DPOは、好まれた回答と比較対象のデータから、別の報酬モデルを学習する手順などを省いてモデルを調整する方法だよ。Constitutional AIの公開研究では、人が決めた原則を使ったAIの批評・修正と、AIが比較した評価からの学習を組み合わせている。どれもアラインメントへの取り組みの一部なんだ。
調整が終われば、もう安心?
訓練で見ていない場面でも意図に沿うか、実際の振る舞いを評価する必要があるよ。誰の評価を使ったか、どの条件で試したかも重要。アラインメントはAI安全性に関わる課題の一つで、システムの安全対策すべてと同じ意味ではないんだ。
まとめ:ざっくりこれだけ覚えればOK!
「アラインメント」って出てきたら「AIの振る舞いを、人間の意図や守るべき条件に沿わせる取り組み」と思えばだいたいOK!
📖 おまけ:英語の意味
「Alignment」 = 方向や目的を合わせること
💬 AIに人間のような心があるという意味ではなく、出力や行動をどう合わせるかを考えるよ。