【みくすちゃーおぶえきすぱーつ】
Mixture of Experts(MoE) とは?
最終更新:
💡 入力に応じて、専門家の計算結果を組み合わせる
複数の専門家(Expert)のニューラルネットワークの出力を、入力に応じて重み付けして組み合わせるAIの構造。LLMで使われる疎なMoEでは一部の専門家だけを動かし、総パラメータ数を増やしながら計算量を抑える。
📌 このページのポイント
- 専門家はそれぞれ異なる重みを持つニューラルネットワーク。人間の専門職をそのまま表すものではない
- 疎なMoEではルーターが一部の専門家を選び、その出力を重み付けして足し合わせる
- Mixtral 8x7Bでは、各層でトークンごとに8つの専門家から2つを選ぶ
- 選ぶ数の割合だけで、モデル全体の計算費用や必要なメモリは決まらない
ペンギン先生、「MoE」ってどんな仕組みなの?
Mixture of Expertsの略で、複数の専門家のニューラルネットワークの出力を、入力に応じた重みで組み合わせる構造だよ。そのうちLLMで使われる「疎なMoE」は、一部の専門家だけを選んで動かす。MoEすべてが一部だけを動かす方式、というわけではないんだ。
専門家を選ぶって、どうやって判断するの?
学習したゲート(ルーター)が選ぶんだ。たとえばMixtral 8x7Bでは、各層でトークンごとに8つから2つを選ぶ。「この質問は数学担当」という人間の分業とは違うよ。Mixtralの論文でも、専門家の選択が話題ごとに明確に分かれるとは観察されていないんだ。
8つ中2つなら、費用は25%になるの?
採用例は公開されているの?
Mixtral 8x7Bは、開発者の論文で構造と重みが公開された例だよ。各層のフィードフォワード部分が8つの専門家に置き換わっている。選ぶ数や配置はモデルごとに違うので、ほかのモデルも同じ構造だとは決めつけないようにしよう。
MoEって欠点はないの?
まとめ:ざっくりこれだけ覚えればOK!
「MoE」って出てきたら「入力に応じて専門家のニューラルネットワークを使い分け、出力を組み合わせるAIの仕組み」と思えばだいたいOK!
📖 おまけ:英語の意味
「Mixture of Experts」 = 専門家の混合
💬 複数の「Expert(専門家)」を「Mixture(混合・組み合わせ)」して使う、という意味だよ