MoE (Mixture of Experts)
用語名をコピー
技術用語約1分で読めます
モデルの全パラメータのうち、入力トークンの処理に必要な一部の「エキスパート」サブネットのみを選択的に活性化させることで、巨大モデルの知識容量と効率的な演算速度を同時に両立するニューラルネットワークアーキテクチャです。
別名
Sparse MoESMoE条件付き計算(Conditional Computation)
詳しい説明
MoEは、全パラメータのうち少数のパラメータのみを計算に使用する「疎な活性化(Sparse Activation)」方式の構造です。ニューラルネットワークのフィードフォワード(FFN)層を複数のエキスパート(Expert)サブネットに分割し、ルーター(Router)が各トークンの特性に応じて最適なエキスパートをリアルタイムで選択して処理を割り振ります。このアプローチにより、モデル全体の知識容量(総パラメータ数)を飛躍的に拡大させながらも、実際の推論時に発生する演算量(FLOPs)と遅延時間(レイテンシ)を低く抑えることができます。ただし、活性化されていないエキスパートを含む全パラメータをメモリに常駐させる必要があるため、モデルの規模に比例した大きなVRAM容量が求められます。近年、Mixtral 8x7BやDeepSeek-V3など、高性能なオープンソースおよび商用LLMの主要アーキテクチャとして採用されています。
ツール選定において重要な理由
MoEモデルは「同等性能のDenseモデルより高速で、同等演算コストのモデルよりスマートである」という特徴を持ちます。APIコストや推論サーバーの運用費を削減しつつ、最上位クラスの推論性能を得たい場合に必ず考慮すべきアーキテクチャです。特に、総パラメータ数に対するアクティブパラメータ(Active Parameters)の割合が少ないほど、コストパフォーマンスが高くなります。
確認すべき点
- 総パラメータ数に対するアクティブパラメータ(Active Params)の数:実際の推論速度を決定する指標
- VRAMの要求仕様:推論速度は速くても、総パラメータ数が大きい場合は高性能GPU(H100など)が大量に必要となる
- ルーティングの安定性:特定のエキスパートに負荷が偏らず、知識が均等に学習されているか
代表事例
Mixtral 8x7Bモデルは、総パラメータ数が46.7Bですが、推論時にはトークンあたり約12.9Bのパラメータのみを活性化します。これにより、70B規模のLlama 2と同等の性能を発揮しながらも、推論速度は約6倍高速です.