【スパースじこふごうかき(エスエーイー)】

スパース自己符号化器(SAE) とは?

公開:
💡 ごちゃ混ぜ信号から概念を分けるAI解剖ツール

LLMの内部表現から解釈可能な特徴量を抽出する手法。多意味性を解消し、各ニューロンが担う概念を特定することでAIの内部を可視化できる。

📌 このページのポイント
SAE:密な内部表現を概念単位の疎な特徴に変換する LLM内部表現 (密・多意味) 各ニューロンが 複数概念を担う SAE スパース制約 +エンコード 疎な特徴ベクトル (各featureが1概念) feature1: バナナ 🍌 ●active feature2: 猫 🐱 ○zero feature3: 金融 💰 ○zero feature4: 果物 🍎 ●active ほとんどゼロ→1対1に対応
密な内部表現をSAEが変換し、概念ごとに分離された疎な特徴ベクトルを生成するイメージ
ひよこ ひよこ
ペンギン先生、スパース自己符号化器ってなんだか難しそうな名前なの?
ペンギン先生 ペンギン先生
名前は長いけど役割はシンプルだよ!「AIの脳みその中身を人間がわかる形に翻訳するツール」だと思えばいいよ。
ひよこ ひよこ
AIの中身を翻訳するってどういうことなの?
ペンギン先生 ペンギン先生
LLMには数千億のニューロンがあって、一つのニューロンが複数の無関係な概念を担当している(多意味性)という問題があるんだよ。SAEはその「ごちゃ混ぜ信号」をほどいて、概念ごとに分けてくれるんだ。
ひよこ ひよこ
どうやって分けるの?
ペンギン先生 ペンギン先生
「スパース(疎)」という制約がポイントだよ。疎というのは「ほとんどの値がゼロ」という意味で、あるテキストを処理するとき、たくさんある特徴量のうち少数だけが強く反応するように学習させるんだ。これで各特徴が特定の概念に集中するんだよ。
ひよこ ひよこ
自己符号化器ってなんなの?
ペンギン先生 ペンギン先生
入力を圧縮してから元に戻す「オートエンコーダー」の一種だよ。SAEはLLM中間表現を受け取って、より高次元の疎な特徴空間に変換してから復元するんだ。その変換後の特徴が「概念単位」になっているわけだね。
ひよこ ひよこ
実際に何かわかったことはあるの?
ペンギン先生 ペンギン先生
Anthropicは2024年にClaudeにSAEを適用して、「ゴールデンゲートブリッジ」の概念に対応する特徴を特定したり、モデルの内部で感情に相当する状態が起きていることを発見したりしているんだよ。AI解釈可能性研究を大きく前進させたツールなんだ。
ひよこ ひよこ
それって安全性にも関係あるの?
ペンギン先生 ペンギン先生
大ありだよ!AIが危険な行動をとるとき内部でどんな特徴が反応しているか追跡できれば、事前に抑止する仕組みが作れるかもしれない。SAEはAI安全性研究の重要な武器になっているんだね。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「スパース自己符号化器」って出てきたら「AIの内部を概念単位に分解する解析ツール」と思えばだいたいOK!
📖 おまけ:英語の意味
「Sparse Autoencoder」 = スパース自己符号化器
💬 スパース(疎)な制約を加えることで特徴を一意に割り当てる自己符号化器で、Anthropicなどが解釈可能性研究に活用しているんだよ
← 用語集にもどる