【どうぐてきしゅうそく】
道具的収束 とは?
最終更新:
💡 目的は違っても、役立つ手段が似てくることがある
異なる最終目標を持つAIシステムが、その達成に役立つ共通の中間目標(資源獲得・自己保存など)に収束しやすい傾向のこと。AI安全研究の重要概念。
📌 このページのポイント
- 異なる最終目標にも役立つ中間目標が、共通して選ばれうるという仮説
- 自己保存・資源獲得・最終目標の維持などが例
- 目標や環境、能力による条件があり、すべてのAIの必然的な行動ではない
- 望ましい最終目標でも、選ばれる手段の影響を考える必要がある
道具的収束って何なの?
目的が違うエージェントでも、達成に役立つ中間目標が共通しうる、という仮説だよ。たとえば計算資源を増やすことは、いろいろな目標に役立つ可能性があるんだ。
自己保存も、目的になってしまうの?
未来の目標を実現するために、動き続けることが役立つ場合があるよ。生きたいという感情を持つ、という意味ではなく、最終目標のための手段として考えるんだ。
どんなAIも停止に抵抗するの?
目標の変更を阻止する、というのは?
今の最終目標を将来も達成したいなら、その目標を維持することが役立つ、という考え方だよ。途中の計画や中間目標まで絶対に変えない、という意味ではないんだ。
AIの安全性とどう関係するの?
人に害を与えることを最終目標にしていなくても、資源の獲得などの手段が人の利益と衝突する可能性を考えるための概念だよ。個別の不正行動を見ただけで、道具的収束が原因だと確定できるわけではないんだ。
まとめ:ざっくりこれだけ覚えればOK!
「道具的収束」って出てきたら「目的は違っても、役立つ手段が似てくることがある」と思えばだいたいOK!
📖 おまけ:英語の意味
「Instrumental Convergence」 = 目的のための手段が共通すること
💬 Instrumentalは目的達成の手段に関わること、Convergenceは収束。ニック・ボストロムが2012年の論文で道具的収束の仮説を論じ、先行研究としてスティーブ・オモハンドロの研究にも言及しているよ