【みくすちゃーおぶえきすぱーつ】

Mixture of Experts(MoE) とは?

最終更新:
💡 入力に応じて、専門家の計算結果を組み合わせる

複数の専門家(Expert)のニューラルネットワークの出力を、入力に応じて重み付けして組み合わせるAIの構造。LLMで使われる疎なMoEでは一部の専門家だけを動かし、総パラメータ数を増やしながら計算量を抑える。

📌 このページのポイント
疎なMoE:一部を選んで組み合わせる 入力トークン ルーター 入力に応じて選択 Expert 1 選択 Expert 2 非選択 Expert 3 非選択 Expert 4 選択 選んだ出力を 重み付けして合成
4つ中2つを選ぶ仮例。緑の矢印が選ばれた専門家での処理と合成を示す。専門家の選択割合は、モデル全体の計算費用の割合ではない。
ひよこ ひよこ
ペンギン先生、「MoE」ってどんな仕組みなの?
ペンギン先生 ペンギン先生
Mixture of Expertsの略で、複数の専門家のニューラルネットワークの出力を、入力に応じた重みで組み合わせる構造だよ。そのうちLLMで使われる「疎なMoE」は、一部の専門家だけを選んで動かす。MoEすべてが一部だけを動かす方式、というわけではないんだ。
ひよこ ひよこ
専門家を選ぶって、どうやって判断するの?
ペンギン先生 ペンギン先生
学習したゲート(ルーター)が選ぶんだ。たとえばMixtral 8x7Bでは、各層でトークンごとに8つから2つを選ぶ。「この質問は数学担当」という人間の分業とは違うよ。Mixtralの論文でも、専門家の選択が話題ごとに明確に分かれるとは観察されていないんだ。
ひよこ ひよこ
8つ中2つなら、費用は25%になるの?
ペンギン先生 ペンギン先生
専門家の数では2÷8で25%だけど、モデル全体の費用が25%になるとは言えないよ。専門家以外の共通部分も計算するし、ルーターの処理や通信も必要なんだ。総パラメータ数と、一つのトークンを処理するときに使うパラメータ数を区別しよう。
ひよこ ひよこ
採用例は公開されているの?
ペンギン先生 ペンギン先生
Mixtral 8x7Bは、開発者の論文で構造と重みが公開された例だよ。各層のフィードフォワード部分が8つの専門家に置き換わっている。選ぶ数や配置はモデルごとに違うので、ほかのモデルも同じ構造だとは決めつけないようにしよう。
ひよこ ひよこ
MoEって欠点はないの?
ペンギン先生 ペンギン先生
計算する専門家を減らしても、使わない専門家の重みが消えるわけではないので、メモリや保存容量の負担は別に考える必要があるよ。専門家を複数のGPUへ分けると通信が必要になり、特定の専門家へ処理が偏る問題もある。実際の速度や費用は実装と実行条件で変わるんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「MoE」って出てきたら「入力に応じて専門家のニューラルネットワークを使い分け、出力を組み合わせるAIの仕組み」と思えばだいたいOK!
📖 おまけ:英語の意味
「Mixture of Experts」 = 専門家の混合
💬 複数の「Expert(専門家)」を「Mixture(混合・組み合わせ)」して使う、という意味だよ

参考資料

← 用語集にもどる