【ひょうげんエンジニアリング】
表現エンジニアリング とは?
公開:
💡 モデルの脳内を直接書き換えるハックツール
LLMの内部表現空間を直接操作することで、モデルの正直性・感情・偏見などの動作を制御する技術。プロンプトではなくモデルの「脳内」に働きかけるアプローチ。
📌 このページのポイント
- LLMの中間層に「方向ベクトル」を加算してモデルの思考を誘導できる
- 正直性・感情・有害性などの概念が内部表現空間に線形に存在する
- プロンプトチューニングやファインチューニングとは異なり、推論時にリアルタイムで介入できる
- Zou ら(2023年)が提唱し、解釈可能性研究と制御研究の交差点に位置する
ペンギン先生、表現エンジニアリングってプロンプトを工夫することとは違うの?
脳の中身を書き換えるって、どうやるの?
じゃあ「もっと正直に答えて」という方向ベクトルを足せば、ウソをつきにくくなるの?
なんか魔法みたいだけど、どうしてそんなことができるの?
LLMの内部表現空間では、「正直」「感情」「偏見」といった抽象的な概念が線形に分離できる方向として存在していると分かってきたんだ。これを「線形表現仮説」と呼ぶよ。
ファインチューニングとはどう違うの?
ファインチューニングはモデルの重みを再学習で更新するから時間とデータが必要だけど、表現エンジニアリングは推論時にリアルタイムで介入できるんだよ。モデルを変えずに動作を細かく制御できる点が大きな違いだね。
📖 おまけ:英語の意味
「Representation Engineering」 = 表現エンジニアリング
💬 Zou ら(2023年)が提唱。モデルの内部状態に「方向ベクトル」を加えることで思考を誘導できる研究だよ