【マルチヘッドせんざいてきアテンション】
マルチヘッド潜在的アテンション(MLA) とは?
公開:
💡 キャッシュを「低ランク」に圧縮して、巨大モデルをメモリ効率よく動かす新発明
DeepSeekが提案したアテンション機構で、KVキャッシュを低ランク行列に圧縮することでメモリ使用量を大幅削減しながら通常のマルチヘッドアテンションに匹敵する品質を実現する。
📌 このページのポイント
アテンション機構って、何がそんなにメモリを食うの?
そのキャッシュを小さくするのがMLAなの?
圧縮して品質は落ちないの?
通常のマルチヘッドアテンションと比べてどれくらい違うの?
DeepSeekだけが使ってるの?
📖 おまけ:英語の意味
「Multi-Head Latent Attention」 = マルチヘッド潜在的アテンション
💬 Multi-Head(複数ヘッド)+ Latent(潜在的)+ Attention(注意機構)の組み合わせ。KeyとValueを直接保存せず「潜在ベクトル」に圧縮するところがLatentの意味だよ