【みくすちゃーおぶでぷす】

Mixture of Depths とは?

最終更新:
💡 計算する場所を選んで、AIの力を配分

Transformerのブロックごとに、計算するトークンと計算を迂回するトークンを選ぶ方式。各ブロックの計算枠を決め、トークンごとの計算の配分を学習します。

📌 このページのポイント
計算するトークンを、層ごとに選ぶトークンAトークンBトークンC層1計算計算迂回層2迂回計算計算層3計算迂回計算層4計算迂回計算各層で2個を選ぶ例:迂回後も再参加できる迂回したトークンも、入力の表現を引き継ぐ
ルーティングする4つの層を抜き出した模式図。緑は計算、白は迂回。通常のブロックなどは省略しています。
ひよこ ひよこ
AIの計算を途中でやめる仕組み?
ペンギン先生 ペンギン先生
MoDは各ブロックで「計算するか、迂回するか」を選ぶ方式だよ。あるトークンが途中のブロックを迂回しても、後のブロックで再び計算されることがある。途中で処理を終えて残りの層をすべて飛ばすEarly Exitとは違うんだ。
ひよこ ひよこ
助詞は浅く、専門用語は深く処理するの?
ペンギン先生 ペンギン先生
そうした固定のルールではないよ。ルーターが現在のトークンの表現からスコアを計算し、文脈や学習した判断に基づいて配分する。「この単語なら必ず何層」と決まっているわけではないんだ。
ひよこ ひよこ
計算するトークンの数はどう決めるの?
ペンギン先生 ペンギン先生
論文の学習方法では、各ブロックで計算に参加する数kをあらかじめ決め、スコアの上位k個を選ぶよ。処理する数を固定して計算枠を予測しやすくしながら、どのトークンを選ぶかは動的に変える。生成時には未来のトークンを見ずに判断するための工夫も必要なんだ。
ひよこ ひよこ
選ばれなかった情報は捨てられる?
ペンギン先生 ペンギン先生
捨てられないよ。選ばれなかったトークンは、そのブロックの自己注意やMLPの計算を迂回し、入力の表現を残差接続で引き継ぐんだ。ただし、そのブロックの自己注意に参加するトークンも選ばれた集合に限られるので、通常のTransformerと同じ計算を単に後回しにしているわけではないよ。
ひよこ ひよこ
MoEと組み合わせられるの?
ペンギン先生 ペンギン先生
MoEが専門家モジュールへの配分を選ぶのに対し、MoDはブロックの計算への参加を選ぶ。論文では両方を組み合わせたMoDEも検討されているよ。効率化の結果はモデルや計算枠、評価条件で変わるので、「いつでも同じ品質でコスト半分」とは言えないんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「Mixture of Depths」って出てきたら「トークンごとに、どの層で計算するかを選ぶAIの仕組み」と思えばだいたいOK!
📖 おまけ:英語の意味
「Mixture-of-Depths」 = 深さの混合
💬 トークンによって計算を受けるブロックの数が異なることを、深さの違いとして表しているよ。

参考資料

← 用語集にもどる