【フラッシュアテンション】
Flash Attention とは?
最終更新:
💡 GPUのメモリ読み書きを減らし、アテンションを効率化
Transformerのアテンションを、GPUのメモリ間の読み書きを減らして計算するアルゴリズム。大きな中間行列をHBMに保存せず、ブロック単位で処理してメモリ使用量と実行時間の削減を目指す。
📌 このページのポイント
ペンギン先生、Flash Attentionって普通のアテンションと何が違うの?
4倍!Flash Attentionならどうするの?
計算結果は同じになるの?近似計算とかじゃないの?
なんでそんな工夫ができるの?
実際に使うと必ず8倍速くなるの?
まとめ:ざっくりこれだけ覚えればOK!
「Flash Attention」って出てきたら「GPUメモリを賢く使うアテンション高速化技術」と思えばだいたいOK!
📖 おまけ:英語の意味
「FlashAttention」 = 高速なアテンション計算の名称
💬 GPUでアテンションを計算するアルゴリズムの名前だよ。データを保存するフラッシュメモリを指す言葉ではないんだ