【めかにすてぃっくかいしゃくかのうせい】
メカニスティック解釈可能性 とは?
公開:
💡 「AIの脳をMRIで診る」——ニューラルネットの内部回路を解剖してブラックボックスを開ける研究
📌 このページのポイント
- ニューロンや注意ヘッドが何を「検出」しているか特定する
- Anthropicが中心的な研究機関の一つ
- Induction head(文脈内学習)などの回路が発見済み
- スーパーポジション仮説:1ニューロンが複数の概念を同時に表現
ペンギン先生、AIって「なぜその答えを出したか」って分からないって聞いたんだけど、それを解明しようとしてる研究があるの?
あるよ!「メカニスティック解釈可能性」って言って、ニューラルネットの内部回路をひとつひとつ解剖して、どのニューロンが何をしているか特定する研究だよ。
ニューロンって何を「している」の?具体的にはどういうことなの?
たとえば「フランス語の単語を見たときに反応するニューロン」とか「感情的な言葉を検出する注意ヘッド」とか、特定の概念に対応する部品を見つけ出すんだよ。人間の脳のMRI研究みたいなイメージだね。
すごいんだね!でも1つのニューロンが1つの概念を担当してるわけじゃないの?
それが「スーパーポジション仮説」っていうんだけど、実際には1つのニューロンが複数の概念を同時に表現してることが多いんだよ。だから解読がとても難しい。
Anthropicもその研究をしてるって聞いたんだけど、どんな発見があったの?
📖 おまけ:英語の意味
「Mechanistic Interpretability」 = 機械論的解釈可能性
💬 Anthropic・DeepMindなどが推進するAI安全性研究の中核分野。モデルが「なぜそう答えるか」を回路レベルで証明しようとしているよ。