【めかにすてぃっくかいしゃくかのうせい】

メカニスティック解釈可能性 とは?

最終更新:
💡 AIの内部の計算をたどり、答えを生む仕組みを調べる研究

ニューラルネットワークが出力を作る内部の計算や回路を調べ、動作の仕組みを解明しようとする研究分野。内部への介入実験などで仮説を検証する。

📌 このページのポイント
出力を生む内部の計算を調べる 入力 内部の計算 出力 観察 → 一部へ介入 → 変化を比較 内部の働きについて仮説を検証 一部の理解 ≠ モデル全体の理解
丸と線は内部の計算を簡略化したイメージ。観察や介入で働きを調べる。個々の丸が必ず1つの概念に対応するわけではない。
ひよこ ひよこ
AIがなぜその答えを出したか、内部から調べる研究はあるの?
ペンギン先生 ペンギン先生
あるよ。メカニスティック解釈可能性は、ニューラルネットワークの内部の計算を調べ、出力を生む仕組みを解き明かそうとする研究なんだ。
ひよこ ひよこ
どこを調べるの?
ペンギン先生 ペンギン先生
ニューロンや注意ヘッド、特徴の表し方などだよ。反応を見るだけでなく、特定の部分の働きを止めて出力がどう変わるかを調べ、仮説を検証することもあるんだ。
ひよこ ひよこ
1つのニューロンが1つの概念を担当するの?
ペンギン先生 ペンギン先生
必ずしもそうではないよ。スーパーポジションの研究では、限られた次元に、それより多くの特徴を重ねて表す仕組みを小さなモデルで示している。ニューロンと概念が単純に1対1にならない理由の一つなんだ。
ひよこ ひよこ
Induction headって何をするの?
ペンギン先生 ペンギン先生
前に「A、B」という並びがあったとき、再び出てきたAの後にBを予測する注意ヘッドだよ。2022年の研究では小規模なattention-onlyモデルで因果的な証拠を示した。大規模モデルの文脈内学習の大半を説明するという主張は、間接的な証拠に基づく仮説だよ。
ひよこ ひよこ
仕組みが分かれば、AIの安全も保証できる?
ペンギン先生 ペンギン先生
保証できる段階ではないよ。内部の理解を安全性の問題の発見や対策に役立てることが研究の目的の一つだけど、一部の回路が分かったこととモデル全体を理解できたことは別なんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「メカニスティック解釈可能性」って出てきたら「AI内部の計算の仕組みを解き明かす研究」と思えばだいたいOK!
📖 おまけ:英語の意味
「Mechanistic Interpretability」 = 機械論的解釈可能性
💬 ここでのmechanisticは、内部の部品や計算がどのように働いて結果を生むかという仕組みに着目することだよ。

参考資料

← 用語集にもどる