MoE (Mixture of Experts)

技術用語
約1分で読めます

モデルの全パラメータのうち、入力トークンの処理に必要な一部の「エキスパート」サブネットのみを選択的に活性化させることで、巨大モデルの知識容量と効率的な演算速度を同時に両立するニューラルネットワークアーキテクチャです。

別名
Sparse MoESMoE条件付き計算(Conditional Computation)

詳しい説明

MoEは、全パラメータのうち少数のパラメータのみを計算に使用する「疎な活性化(Sparse Activation)」方式の構造です。ニューラルネットワークのフィードフォワード(FFN)層を複数のエキスパート(Expert)サブネットに分割し、ルーター(Router)が各トークンの特性に応じて最適なエキスパートをリアルタイムで選択して処理を割り振ります。このアプローチにより、モデル全体の知識容量(総パラメータ数)を飛躍的に拡大させながらも、実際の推論時に発生する演算量(FLOPs)と遅延時間(レイテンシ)を低く抑えることができます。ただし、活性化されていないエキスパートを含む全パラメータをメモリに常駐させる必要があるため、モデルの規模に比例した大きなVRAM容量が求められます。近年、Mixtral 8x7BやDeepSeek-V3など、高性能なオープンソースおよび商用LLMの主要アーキテクチャとして採用されています。

ツール選定において重要な理由

MoEモデルは「同等性能のDenseモデルより高速で、同等演算コストのモデルよりスマートである」という特徴を持ちます。APIコストや推論サーバーの運用費を削減しつつ、最上位クラスの推論性能を得たい場合に必ず考慮すべきアーキテクチャです。特に、総パラメータ数に対するアクティブパラメータ(Active Parameters)の割合が少ないほど、コストパフォーマンスが高くなります。

確認すべき点

  • 総パラメータ数に対するアクティブパラメータ(Active Params)の数:実際の推論速度を決定する指標
  • VRAMの要求仕様:推論速度は速くても、総パラメータ数が大きい場合は高性能GPU(H100など)が大量に必要となる
  • ルーティングの安定性:特定のエキスパートに負荷が偏らず、知識が均等に学習されているか

代表事例

Mixtral 8x7Bモデルは、総パラメータ数が46.7Bですが、推論時にはトークンあたり約12.9Bのパラメータのみを活性化します。これにより、70B規模のLlama 2と同等の性能を発揮しながらも、推論速度は約6倍高速です.

関連用語

トランスフォーマーLLM