【えきすぱーとへいれつ】
エキスパート並列(EP) とは?
公開:
💡 AIの専門チームを、複数の計算機へ分担配置
エキスパート並列は、MoEモデルのエキスパートを複数のGPUなどへ分けて配置する並列化手法。入力を担当のエキスパートへ送り、計算結果を戻すための通信も必要になります。
📌 このページのポイント
- MoEのエキスパートを複数の計算デバイスへ分散する
- 入力はルーターが選んだエキスパートへ送る
- 処理の偏りとデバイス間通信が性能に影響する
- エキスパート数と並列グループの大きさは別の数
ペンギン先生、エキスパート並列って専門家が一緒にAIを作るの?
入力は、どのGPUへ渡すの?
ルーターが選んだエキスパートを持つデバイスへ送るよ。そこで計算し、結果を戻してまとめる。エキスパートが分かれているので、デバイス間の通信も重要になるんだ。
EPが4なら、エキスパートも4つ?
同じ数とは限らないよ。例えば8つのエキスパートを4台へ均等に配置すれば、1台あたり2つ。EPのグループサイズは、エキスパートを分けて置くデバイスの数を表すんだ。
台数を増やすだけで速くなる?
計算の分担には役立つけれど、通信や負荷の偏りが増える場合もあるよ。どのエキスパートに入力が集まるか、デバイス同士をどうつなぐかも含めて調整する必要があるんだ。
もっと詳しく知りたい人へ
テンソル並列との違いは?
エキスパート並列はエキスパートを分けて配置し、テンソル並列は行列など一つの計算の要素を分割します。組み合わせる構成もありますが、利用するフレームワークの対応条件を確認します。
📖 おまけ:英語の意味
「Expert Parallelism」 = エキスパートの並列化
💬 ExpertはMoE内で選ばれて計算を担う部分、Parallelismは並列化だよ。人間の専門家が同時に働くという意味ではないんだ。