【エムオーイー】
MoE(Mixture of Experts) とは?
最終更新:
💡 複数の計算担当から、入力に応じて担当を選ぶ
複数のニューラルネットワーク(エキスパート)の出力を、入力に応じて組み合わせる構造。LLMで使われる疎なMoEでは、ルーターが一部のエキスパートを選んで計算する。
📌 このページのポイント
- 複数のエキスパートと、出力の組合せを決めるゲート・ルーターを使う
- 疎なMoEは一部だけを動かす。Mixtral 8x7Bでは各層・各トークンで8つから2つを選ぶ
- 全体の容量に対して計算量を抑えやすいが、モデルの保持や通信などの負担は残る
- エキスパートが「数学担当」「国語担当」のように分野別になるとは限らない
MoEってなに?エキスパートって誰のこと?
AIモデル内で計算を担当するニューラルネットワークのことだよ。複数の担当の出力を組み合わせるんだ。ただし「数学専門」「翻訳専門」のように、人が分野を決めたチームとは限らないよ。
全部のエキスパートを使わないの?もったいなくない?
ルーターってどうやって担当を決めてるの?
入力の表現からスコアを出し、そのスコアで担当を選ぶんだ。Mixtralではルーターとエキスパートを一緒に学習させるよ。選んだ担当の出力は重みを付けて組み合わせる。常に最適な担当を見抜けるという保証ではないんだ。
エキスパートを増やせば、安く賢くできる?
📖 おまけ:英語の意味
「Mixture of Experts」 = 専門家の混合
💬 Mixtureは「混合」、Expertsは「専門家たち」。ここでの専門家は、人や独立したチャットAIではなく、モデル内の計算を担当するネットワークを指すよ。