【あてんしょんきこう】
アテンション機構 とは?
最終更新:
💡 文脈に応じた重みで、情報を混ぜ合わせる
クエリと各情報の対応度から重みを計算し、情報を重み付きで混ぜて出力を作るニューラルネットワークの仕組み。トランスフォーマーでは、トークン間の関係を扱う中心的な要素となる。
📌 このページのポイント
どうしてアテンションが使われるようになったの?
Q・K・Vは何をするの?
自己アテンションと交差アテンションは違う?
自己アテンションは同じ系列からQ・K・Vを作り、系列内の関係を扱うよ。交差アテンションではQとK・Vが別の系列に由来する。翻訳の出力側が入力側の情報を見るのはその例。次のトークンを予測する自己アテンションでは、未来のトークンを見ないように制限することもある。
マルチヘッドなら文法担当と意味担当がいる?
複数の学習した変換でアテンションを並行計算し、結果を結合する仕組みだよ。異なる関係を捉えられるけれど、各ヘッドの仕事をあらかじめ「文法担当」などと決めているわけではない。どんな関係を学ぶかは学習の結果によるんだ。
長い文章の計算は重いの?
全トークンの組合せを見る標準的な自己アテンションは、他の条件を固定すると系列長Nに対して二乗で計算量が増えるよ。実行時間が常にぴったり4倍になるという意味ではない。FlashAttentionはメモリーとのデータ転送を減らす工夫で、全組合せの計算量そのものが線形になるわけではないんだ。
まとめ:ざっくりこれだけ覚えればOK!
「アテンション機構」って出てきたら「文脈に応じた重みで情報を混ぜる仕組み」と思えばだいたいOK!
📖 おまけ:英語の意味
「Attention Mechanism」 = 注意機構
💬 Attentionは注意を向けるという意味だよ。ここでは情報に重みを付ける計算を表し、人間と同じ意識や注意があるという意味ではないんだ。