【アテンションシンク】
アテンションシンク とは?
公開:
💡 教室の先生がいつも最前列の一人だけを見てしまう、それがアテンションシンク
LLMのアテンション機構で、先頭のトークン(改行や文頭記号など)が異常に高いアテンション重みを集め続ける現象。長文脈では本来重要なトークンへの注意が薄まる原因になる。
📌 このページのポイント
- 先頭トークンに全体のアテンションが集中する構造的な現象
- 長い文脈ほど「重要なのに無視される」トークンが増える
- StreamingLLMでは先頭トークンを「シンクトークン」として意図的に保持する対策が提案された
- Flash AttentionやPagedAttentionの効率化でも注目されている問題
アテンションシンクって、アテンションがどこかに吸い込まれるってこと?
先頭トークンって、たとえばどんなもの?
それって何か悪いことが起きるの?
文脈が長くなるほど問題が大きくなるんだよ。本来は重要な情報を持つトークンへの注意が薄まって、モデルが長い文章の後半を「忘れやすく」なる原因になるんだ。
StreamingLLMってどんな対策をしているの?
欠点を逆に活かす発想なんだね、すごいね!
まさにそうなんだよ。アテンションシンクの仕組みを理解することで、長文対応や無限長ストリーミング生成への応用研究が進んでいるんだ。
まとめ:ざっくりこれだけ覚えればOK!
「アテンションシンク」って出てきたら「先頭トークンにアテンションが集中する現象」と思えればだいたいOK!
📖 おまけ:英語の意味
「Attention Sink」 = アテンションの排水口・吸い込み口
💬 水が排水口(sink)に集まるように、アテンション重みが先頭トークンに吸い込まれていく様子を例えた呼び方だよ