【めかにすてぃっくかいしゃくかのうせい】
メカニスティック解釈可能性 とは?
最終更新:
💡 AIの内部の計算をたどり、答えを生む仕組みを調べる研究
ニューラルネットワークが出力を作る内部の計算や回路を調べ、動作の仕組みを解明しようとする研究分野。内部への介入実験などで仮説を検証する。
📌 このページのポイント
- 出力の説明だけでなく、内部の特徴表現や計算の仕組みを調べる
- ニューロンや注意ヘッドを観察し、働きを変えたときの出力も調べる
- Induction headによるパターン補完は、研究で解析された具体例の一つ
- スーパーポジションでは、表現の次元数より多くの特徴が重ねて表される
AIがなぜその答えを出したか、内部から調べる研究はあるの?
あるよ。メカニスティック解釈可能性は、ニューラルネットワークの内部の計算を調べ、出力を生む仕組みを解き明かそうとする研究なんだ。
どこを調べるの?
ニューロンや注意ヘッド、特徴の表し方などだよ。反応を見るだけでなく、特定の部分の働きを止めて出力がどう変わるかを調べ、仮説を検証することもあるんだ。
1つのニューロンが1つの概念を担当するの?
必ずしもそうではないよ。スーパーポジションの研究では、限られた次元に、それより多くの特徴を重ねて表す仕組みを小さなモデルで示している。ニューロンと概念が単純に1対1にならない理由の一つなんだ。
Induction headって何をするの?
前に「A、B」という並びがあったとき、再び出てきたAの後にBを予測する注意ヘッドだよ。2022年の研究では小規模なattention-onlyモデルで因果的な証拠を示した。大規模モデルの文脈内学習の大半を説明するという主張は、間接的な証拠に基づく仮説だよ。
仕組みが分かれば、AIの安全も保証できる?
保証できる段階ではないよ。内部の理解を安全性の問題の発見や対策に役立てることが研究の目的の一つだけど、一部の回路が分かったこととモデル全体を理解できたことは別なんだ。
📖 おまけ:英語の意味
「Mechanistic Interpretability」 = 機械論的解釈可能性
💬 ここでのmechanisticは、内部の部品や計算がどのように働いて結果を生むかという仕組みに着目することだよ。