【かっせいかすてありんぐ】
活性化ステアリング とは?
最終更新:
💡 AIの内部の値に介入し、返答の傾向を変える
AIモデルの推論中の内部表現(活性化)に介入して、出力の傾向を変える手法。内部の値へアクセスできるモデルで用い、効果は操作する層や強さ、入力などに左右される。
📌 このページのポイント
- 推論中の内部表現に介入し、出力の傾向を変える
- 対照的な入力の活性化の差を加える方法などがある
- 内部の活性化を取得・変更できるモデルが必要
- 効果や副作用はモデル、入力、介入する層や強さによる
活性化ステアリングは、何を変えるの?
内部へ何を加えるの?
別の具体例はある?
Anthropicは2024年、ゴールデンゲートブリッジに対応する特徴を強める実験を紹介したよ。関係のない質問でも橋を話題にするようになった。これは返答の傾向が変わった例で、モデルが本当に橋になったわけではないんだ。
プロンプトより確実に従うようになるの?
必ずそうなるとは言えないよ。介入する層や強さ、モデルや入力によって効果が違い、失敗や文章品質への影響もある。内部の値を取得・変更できる必要があり、文章を送るだけのAPIでそのまま実行できるとは限らないんだ。
安全性を高めるのにも使える?
安全性に関わる特徴と出力の関係を調べる用途はあるよ。ただし介入によって望ましくない出力が増える実験も報告されている。内部を変えれば安全になると決めず、目的以外の能力や出力への影響も評価する必要があるんだ。
まとめ:ざっくりこれだけ覚えればOK!
「活性化ステアリング」って出てきたら「AIの内部表現に介入して返答の傾向を変える手法」と思えばだいたいOK!
📖 おまけ:英語の意味
「Activation Steering」 = 活性化の操舵・誘導
💬 Activationはモデル内部の計算で生じる値、Steeringは方向を誘導することだよ。人間の脳や気持ちを直接操作するという意味ではないんだ。