【マルチヘッドせんざいてきアテンション】

マルチヘッド潜在的アテンション(MLA) とは?

公開:
💡 キャッシュを「低ランク」に圧縮して、巨大モデルをメモリ効率よく動かす新発明

DeepSeekが提案したアテンション機構で、KVキャッシュを低ランク行列に圧縮することでメモリ使用量を大幅削減しながら通常のマルチヘッドアテンションに匹敵する品質を実現する。

📌 このページのポイント
MLA vs MHA:KVキャッシュサイズの比較 通常のMHA KVキャッシュ Head1: K, V Head2: K, V Head3: K, V Head4: K, V 全ヘッド分のK・Vを保存 メモリ: 大 (ヘッド数 × シーケンス長 × 次元) MLA(DeepSeek) 潜在ベクトルキャッシュ 低ランク圧縮済み c 使用時に復元 K, V を再構成 メモリ: 小(5〜13倍削減) vs 品質を維持しながらKVキャッシュを大幅に圧縮
通常のMHAとMLAのKVキャッシュサイズ比較。MLAは低ランク圧縮でメモリを削減する
ひよこ ひよこ
アテンション機構って、何がそんなにメモリを食うの?
ペンギン先生 ペンギン先生
長いテキストを処理するとき、過去のトークンのKeyとValueをキャッシュしておく必要があるんだよ。シーケンスが長くなるほどキャッシュがどんどん膨らむんだ。
ひよこ ひよこ
そのキャッシュを小さくするのがMLAなの?
ペンギン先生 ペンギン先生
そう! KとVを直接保存するんじゃなくて、低ランク行列に圧縮した「潜在ベクトル」だけ保存するんだよ。使うときに元のK・Vを復元する仕組みだね。
ひよこ ひよこ
圧縮して品質は落ちないの?
ペンギン先生 ペンギン先生
低ランク近似は情報を完全には保持できないけど、実験ではほぼ同等の精度が出てるんだよ。DeepSeek-V2がGPT-4級の性能を低コストで出したのもMLAのおかげだね。
ひよこ ひよこ
通常のマルチヘッドアテンションと比べてどれくらい違うの?
ペンギン先生 ペンギン先生
KVキャッシュのサイズが5〜13倍小さくなるとされているよ。同じGPUにより大きいモデルや長いコンテキストを乗せられるようになるんだよ。
ひよこ ひよこ
DeepSeekだけが使ってるの?
ペンギン先生 ペンギン先生
今はDeepSeek系モデルが代表的だけど、アーキテクチャとして公開されてるから他のモデルにも採用が広がりつつあるんだよ。効率的なアテンション設計の重要なアイデアだね。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「MLA」って出てきたら「KVキャッシュを圧縮してメモリを節約するDeepSeekの新しいアテンション技術」と思えればだいたいOK!
📖 おまけ:英語の意味
「Multi-Head Latent Attention」 = マルチヘッド潜在的アテンション
💬 Multi-Head(複数ヘッド)+ Latent(潜在的)+ Attention(注意機構)の組み合わせ。KeyとValueを直接保存せず「潜在ベクトル」に圧縮するところがLatentの意味だよ
← 用語集にもどる