【あらいんめんと】

アラインメント(AI) とは?

最終更新:
💡 AIの振る舞いを、望む目的と守る条件へ

AIの振る舞いを、人間が意図する目的や価値、守るべき条件に沿わせる取り組み。望ましい応答を学習させる方法などがあるが、何に合わせるかの合意や評価も課題となる。

📌 このページのポイント
アラインメント:目的と条件に沿わせる目指す振る舞い役立つ・事実に沿う守る条件害につながる行動を避ける学習・調整し、振る舞いを評価RLHF・DPO・Constitutional AIなどそれぞれ取り組みの例誰の目的・条件に合わせるかも考えよう
目指す振る舞いと守る条件を考えて調整・評価するイメージ。手法を使うだけで完全な整合や安全を保証するものではありません。
ひよこ ひよこ
AIの何を、何に合わせるの?
ペンギン先生 ペンギン先生
出力や行動を、人間が望む目的や守るべき条件に合わせるんだ。たとえば、質問に役立つ答えを返すだけでなく、事実を捏造しない、害につながる行動を避けるといった条件も考える。AIに心や願望があるという意味ではないよ。
ひよこ ひよこ
指示に何でも従えばいい?
ペンギン先生 ペンギン先生
利用者の指示が他の人に害を与える場合もあるので、単純に何でも従うこととは違うよ。誰の利益や価値を考慮し、どんな条件を守るかを決める必要がある。人々の好みや目的が一致しないこと自体も、難しい課題なんだ。
ひよこ ひよこ
RLHFは、どう使うの?
ペンギン先生 ペンギン先生
言語モデルの例では、人が望ましい回答を示したり、複数の回答を比較したりする。その比較を学んだ報酬モデルを使って、回答の出し方を強化学習で調整する方法があるよ。ただし、人の評価を学んだことだけで正しさや安全が完全に保証されるわけではないんだ。
ひよこ ひよこ
ほかの方法もある?
ペンギン先生 ペンギン先生
DPOは、好まれた回答と比較対象のデータから、別の報酬モデルを学習する手順などを省いてモデルを調整する方法だよ。Constitutional AIの公開研究では、人が決めた原則を使ったAIの批評・修正と、AIが比較した評価からの学習を組み合わせている。どれもアラインメントへの取り組みの一部なんだ。
ひよこ ひよこ
調整が終われば、もう安心?
ペンギン先生 ペンギン先生
訓練で見ていない場面でも意図に沿うか、実際の振る舞いを評価する必要があるよ。誰の評価を使ったか、どの条件で試したかも重要。アラインメントはAI安全性に関わる課題の一つで、システムの安全対策すべてと同じ意味ではないんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「アラインメント」って出てきたら「AIの振る舞いを、人間の意図や守るべき条件に沿わせる取り組み」と思えばだいたいOK!
📖 おまけ:英語の意味
「Alignment」 = 方向や目的を合わせること
💬 AIに人間のような心があるという意味ではなく、出力や行動をどう合わせるかを考えるよ。

参考資料

← 用語集にもどる