【スパースじこふごうかき(エスエーイー)】
スパース自己符号化器(SAE) とは?
公開:
💡 ごちゃ混ぜ信号から概念を分けるAI解剖ツール
LLMの内部表現から解釈可能な特徴量を抽出する手法。多意味性を解消し、各ニューロンが担う概念を特定することでAIの内部を可視化できる。
📌 このページのポイント
ペンギン先生、スパース自己符号化器ってなんだか難しそうな名前なの?
名前は長いけど役割はシンプルだよ!「AIの脳みその中身を人間がわかる形に翻訳するツール」だと思えばいいよ。
AIの中身を翻訳するってどういうことなの?
どうやって分けるの?
「スパース(疎)」という制約がポイントだよ。疎というのは「ほとんどの値がゼロ」という意味で、あるテキストを処理するとき、たくさんある特徴量のうち少数だけが強く反応するように学習させるんだ。これで各特徴が特定の概念に集中するんだよ。
自己符号化器ってなんなの?
実際に何かわかったことはあるの?
それって安全性にも関係あるの?
まとめ:ざっくりこれだけ覚えればOK!
「スパース自己符号化器」って出てきたら「AIの内部を概念単位に分解する解析ツール」と思えばだいたいOK!
📖 おまけ:英語の意味
「Sparse Autoencoder」 = スパース自己符号化器
💬 スパース(疎)な制約を加えることで特徴を一意に割り当てる自己符号化器で、Anthropicなどが解釈可能性研究に活用しているんだよ