【ひょうげんエンジニアリング】

表現エンジニアリング とは?

公開:
💡 モデルの脳内を直接書き換えるハックツール

LLMの内部表現空間を直接操作することで、モデルの正直性・感情・偏見などの動作を制御する技術。プロンプトではなくモデルの「脳内」に働きかけるアプローチ。

📌 このページのポイント
表現エンジニアリング:内部ベクトル空間への介入 次元1 次元2 通常の出力クラスタ 正直性ベクトル適用後 +正直性ベクトル LLM内部 中間層の表現ベクトル +方向ベクトル(介入) 制御された出力
表現エンジニアリング:LLMの内部ベクトル空間に方向ベクトルを加えて出力を制御するイメージ
ひよこ ひよこ
ペンギン先生、表現エンジニアリングってプロンプトを工夫することとは違うの?
ペンギン先生 ペンギン先生
全然違うんだよ。プロンプトAIへの「お願いの言葉」だけど、表現エンジニアリングはAIの脳の中身——内部の数値ベクトル——を直接書き換えるアプローチだよ。
ひよこ ひよこ
脳の中身を書き換えるって、どうやるの?
ペンギン先生 ペンギン先生
LLMは各トークンを処理するとき、何千次元もの数値ベクトル(内部表現)を使っているんだ。そのベクトルに「正直性の方向」や「感情の方向」みたいな特定のベクトルを足し引きすると、モデルの出力が変わるんだよ。
ひよこ ひよこ
じゃあ「もっと正直に答えて」という方向ベクトルを足せば、ウソをつきにくくなるの?
ペンギン先生 ペンギン先生
そのとおりだよ!実験では、「正直性ベクトル」を内部表現に加えるとモデルが嘘をつきにくくなることが確かめられているんだ。逆に「有害性ベクトル」を引けば、有害な出力を抑制できる可能性もあるよ。
ひよこ ひよこ
なんか魔法みたいだけど、どうしてそんなことができるの?
ペンギン先生 ペンギン先生
LLMの内部表現空間では、「正直」「感情」「偏見」といった抽象的な概念が線形に分離できる方向として存在していると分かってきたんだ。これを「線形表現仮説」と呼ぶよ。
ひよこ ひよこ
ファインチューニングとはどう違うの?
ペンギン先生 ペンギン先生
ファインチューニングはモデルの重みを再学習で更新するから時間とデータが必要だけど、表現エンジニアリングは推論時にリアルタイムで介入できるんだよ。モデルを変えずに動作を細かく制御できる点が大きな違いだね。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「表現エンジニアリング」って出てきたら「LLMの内部ベクトルを操作してモデルの振る舞いを変える技術」と思えればだいたいOK!
📖 おまけ:英語の意味
「Representation Engineering」 = 表現エンジニアリング
💬 Zou ら(2023年)が提唱。モデルの内部状態に「方向ベクトル」を加えることで思考を誘導できる研究だよ
← 用語集にもどる