【モデルアライメント】

モデルアライメント とは?

公開:
💡 AIに「人間が望む行動」を身につけさせるしつけの技術
📌 このページのポイント
モデルアライメントの仕組み 事前学習モデル インターネット全文で学習 人間が評価 回答A vs 回答B どちらが良い? RLHF調整 好まれる回答を 強化学習で学習 アライメント前 vs 後 アライメント前 有害な回答も生成 事実の誤りを断言 意図を誤解して応答 アライメント後 有害なリクエストを断る 不確かなことは「不明」と答える ユーザーの真意を汲む
モデルアライメントのイメージ:人間のフィードバックでAIを調整する
ひよこ ひよこ
ペンギン先生、モデルアライメントって何をアライン(整合)させるの?
ペンギン先生 ペンギン先生
AIモデルの「目指すこと」と「人間が望むこと」を一致させるんだよ。学習しただけのモデルは人間にとって有害なことも答えてしまうから、それを修正する作業だね。
ひよこ ひよこ
具体的にどんなことをするの?
ペンギン先生 ペンギン先生
代表的なのがRLHF(人間のフィードバックを使った強化学習)だよ。AIの回答を人間が評価して、良い回答をより多く生成するようにモデルを調整するんだ。ChatGPTもこれで作られているよ。
ひよこ ひよこ
有害コンテンツを出さないようにするだけじゃないの?
ペンギン先生 ペンギン先生
それも重要だけど、もっと幅広いよ。「ユーザーの真の意図を理解する」「事実を正確に答える」「指示に忠実に従う」「自分の限界を正直に伝える」なども全部アライメントの目標なんだ。
ひよこ ひよこ
なんで難しいの?完璧にできないの?
ペンギン先生 ペンギン先生
モデルは「評価者が高評価をつける回答」を学ぶから、本当に正確な回答より「もっともらしく聞こえる回答」を優先してしまう問題(報酬ハッキング)が起きやすいんだ。
ひよこ ひよこ
将来の超賢いAIにも重要なんだよね?
ペンギン先生 ペンギン先生
そうだね。AIが人間より賢くなったときに人類の価値観から逸脱しないようにするのが、AI安全研究の究極目標なんだよ。AnthropicやOpenAIが多くのリソースをアライメント研究に注いでいるのはそのためだよ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「モデルアライメント」って出てきたら「AIを人間の価値観・意図に合わせて調整すること」と思えればだいたいOK!
📖 おまけ:英語の意味
「Model Alignment」 = モデルの整合・調整
💬 「Alignment(整合)」は機械工学で軸を正確に合わせる作業を指す言葉で、AIでは「モデルの目標を人間の意図と合わせる」意味で使われるようになったんだよ
← 用語集にもどる