【かっせいかすてありんぐ】

活性化ステアリング とは?

最終更新:
💡 AIの内部の値に介入し、返答の傾向を変える

AIモデルの推論中の内部表現(活性化)に介入して、出力の傾向を変える手法。内部の値へアクセスできるモデルで用い、効果は操作する層や強さ、入力などに左右される。

📌 このページのポイント
内部表現に介入して、出力の傾向を変える 対照的な入力で、内部の値を比較 「Love」側 − 「Hate」側 → 差のベクトル 操作ベクトル 強さを調整 AIモデルの内部 推論中の活性化を変更 重みの追加学習とは別 出力の傾向が変わる 話題・感情表現など 利用には 内部の値への アクセスが必要 望んだ結果になる保証ではない
活性化を操作する一例。効果はモデル、入力、層や強さに左右され、望ましくない影響も評価する。
ひよこ ひよこ
活性化ステアリングは、何を変えるの?
ペンギン先生 ペンギン先生
AIモデルが返答を作る途中の内部の値に介入するんだ。入力文を変えるプロンプトの工夫とは介入する場所が違う。モデルの出力が特定の話題や表現へ寄るかを調べる研究にも使うよ。
ひよこ ひよこ
内部へ何を加えるの?
ペンギン先生 ペンギン先生
ActAddという方法では、対照的な2つの入力から得た活性化の差をベクトルにして加えるよ。たとえば「Love」と「Hate」の差を使い、返答の感情表現を変える研究がある。どのモデルでも同じベクトルが使えるという意味ではないんだ。
ひよこ ひよこ
別の具体例はある?
ペンギン先生 ペンギン先生
Anthropicは2024年、ゴールデンゲートブリッジに対応する特徴を強める実験を紹介したよ。関係のない質問でも橋を話題にするようになった。これは返答の傾向が変わった例で、モデルが本当に橋になったわけではないんだ。
ひよこ ひよこ
プロンプトより確実に従うようになるの?
ペンギン先生 ペンギン先生
必ずそうなるとは言えないよ。介入する層や強さ、モデルや入力によって効果が違い、失敗や文章品質への影響もある。内部の値を取得・変更できる必要があり、文章を送るだけのAPIでそのまま実行できるとは限らないんだ。
ひよこ ひよこ
安全性を高めるのにも使える?
ペンギン先生 ペンギン先生
安全性に関わる特徴と出力の関係を調べる用途はあるよ。ただし介入によって望ましくない出力が増える実験も報告されている。内部を変えれば安全になると決めず、目的以外の能力や出力への影響も評価する必要があるんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「活性化ステアリング」って出てきたら「AIの内部表現に介入して返答の傾向を変える手法」と思えばだいたいOK!
📖 おまけ:英語の意味
「Activation Steering」 = 活性化の操舵・誘導
💬 Activationはモデル内部の計算で生じる値、Steeringは方向を誘導することだよ。人間の脳や気持ちを直接操作するという意味ではないんだ。

参考資料

← 用語集にもどる