AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

混合エキスパートモデル(MoE:Mixture of Experts)とは?意味・仕組みと日本企業への示唆

公開:2026年9月19日, 最終更新:2026年9月19日

混合エキスパートモデル(Mixture of Experts: MoE)は、複数の専門サブネットワーク(エキスパート)と、入力に応じてどのエキスパートを使うかを決める制御ネットワーク(ゲート/ルーター)を組み合わせたニューラルネットワークの設計手法である。入力ごとに一部のエキスパートのみを動的に活性化させる「条件付き計算」の代表例として、大規模言語モデル(LLM)の効率化において広く注目されている。

概要

MoEは、1つの巨大なネットワークがすべての処理を担う代わりに、特定の処理やデータ領域に特化した複数の独立したサブネットワーク(エキスパート)を並列に持つアーキテクチャである。アンサンブル学習の一種に位置づけられる。基礎概念は1991年にRobert Jacobsらによる論文「Adaptive Mixtures of Local Experts」(Neural Computation誌)で提案され、1993〜1994年にはMichael I. JordanとRobert Jacobsによって階層化した「Hierarchical MoE(HME)」に発展した。現代のLLMで使われるスパース型MoEの直接的な基盤は、2017年にNoam Shazeerらが発表した論文「Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer」(ICLR 2017)に由来する。

仕組み・ポイント

主な構成要素

  • エキスパート: 通常は同一の構造(例:Feed-Forward Network)を持ちながら、それぞれ異なるパラメータを持つ複数の独立したサブネットワーク。
  • ゲート(ルーター)ネットワーク: 入力データ(トークンなど)を分析し、どのエキスパートに処理を割り振るかを学習によって決定する制御ネットワーク。

スパース活性化

現代のMoEでは、入力ごとに上位K個(Top-K、例えば1個や2個)のエキスパートのみを選択・活性化する「スパース活性化」が採用されている。これにより、モデル全体のパラメータ数(総パラメータ数)を大幅に増やして表現力を高めながら、1入力あたりの実際の計算量(アクティブパラメータ数)を低く抑えることができる。推論・学習の高速化とコスト削減を両立させる点が最大の特徴である。

負荷分散(Load Balancing)

特定のエキスパートに処理が集中する偏りを防ぐため、すべてのエキスパートが均等に活用されるよう促す補助損失関数(Auxiliary Loss)が導入される。

Transformerとの統合

現代のLLMでは、Transformerブロック内のFeed-Forward Network(FFN)層をMoE層に置き換える形で実装されることが一般的で、アテンション層は通常すべてのトークンで共有される。関連する主要技術として、大規模分散訓練を可能にした「GShard(2020年)」や、Top-1ルーティングで1.6兆パラメータ規模を実現した「Switch Transformer(2021〜2022年)」がある。

なぜ今注目されているのか

MoEは、LLMの規模拡大に伴う計算コストの問題を解決する現実的なアプローチとして、2020年代に入り急速に注目が高まっている。Mistral AIが2023年12月に発表した「Mixtral 8x7B」は、総パラメータ数46.7Bのうちトークンごとに約12.9Bのアクティブパラメータのみを使用し、Llama 2 70Bと同等以上の性能を約5分の1の推論計算コストで実現したとされ、オープンなMoEモデルの普及を大きく後押しした。2024年12月にDeepSeekが発表した「DeepSeek-V3」は総パラメータ671B・アクティブパラメータ37Bという規模で、独自のMoEアーキテクチャにより高いコストパフォーマンスを示している。2025年4月にはMetaが初のオープンウェイトMoEモデル「Llama 4」シリーズを発表し、「Llama 4 Maverick」では128エキスパート・総パラメータ約400Bながらアクティブパラメータを約17Bに抑える設計を採用した。また、OpenAIのGPT-4については非公式の報道でMoE採用が広く噂されているものの、OpenAI自身は技術仕様を公開していない。LLM推論のエネルギー消費や計算効率への関心が高まる中、MoEは「性能を落とさずコストを削減する」手段として産業界での採用が加速している。

日本企業への示唆

MoEアーキテクチャを採用したモデルは、同等性能の密なモデルと比べて推論時の計算コストを大幅に削減できる可能性があり、API利用コストやオンプレミス運用コストの観点から選定・評価の視点として重要になる。Mixtral 8x7BやLlama 4のようにオープンウェイトのMoEモデルが増加していることは、自社環境へのモデル導入や独自ファインチューニングを検討する企業にとって選択肢の拡大を意味する。一方で、MoEモデルは総パラメータ数が大きいためメモリ要件が高く、インフラ設計や運用体制の検討が必要な点には留意したい。


※ 本ページはAI News JAPAN編集部が最新の動向を踏まえて解説したものです。内容は随時見直します。