AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

MoE学習を10.4倍高速化:NVIDIAがJAX向け最適化スタックの詳細を公式ブログで解説

公開:2026年9月15日, 最終更新:2026年9月15日

30秒サマリー

  • NVIDIAがJAX+Transformer EngineによるMoEモデル学習の最適化手法を公式技術ブログで詳説
  • DeepSeek-V3(671Bパラメータ)でGPUあたり103→1,068 TFLOPSへ約10.4倍のスループット改善を実証
  • 1,024GPU規模でも97%のスケーリング効率を維持し、大規模LLM学習のコスト効率向上に直結

何が起きたか

NVIDIAは2026年9月14日付の技術ブログにて、JAXライブラリとNVIDIA Transformer Engineを組み合わせたMixture of Experts(MoE)モデル学習の最適化スタックを詳細に解説した。検証対象はDeepSeek-V3(671Bパラメータ)で、最適化前の素のJAXベースライン実装ではNVIDIA GB200上でGPUあたり103 TFLOPSにとどまり、GPU間通信がカーネル実行時間の84%を占めていた。同スタックの段階的な最適化を経て1,068 TFLOPSへと約10.4倍の改善を達成したとしている。

主な最適化の柱は三つ。第一に「Grouped GEMM」で、エキスパートごとにトークン数が異なる不規則なテンソル(Ragged Tensor)を単一カーネル呼び出しで処理し、cuBLAS/cuBLASLtでTensor Coreを最大活用する。NVIDIAのBlackwellアーキテクチャ(GB200/GB300)ではMXFP8ブロックスケーリングも適用可能としている。第二に「NCCL EPによるDispatch/Combine統合」で、エキスパート並列時のトークン送受信を専用通信バックエンドで融合し、複数エキスパートへ送信されるトークンの重複ネットワーク転送を削減する。第三に「XLAマルチストリーム集合通信」で、NVLinkとInfiniBandを並行利用し、通信と計算のオーバーラップを自動化する。

加えて、JAXのホストオフロードAPIを活用してクエリ・バリュー射影の中間活性化をホストメモリに退避させることでHBMボトルネックを緩和する手法も紹介された。NVIDIA GB300 NVL72ラック上での1,024GPU規模の検証では97%のスケーリング効率が得られたとしており、今後はNVFP4量子化やA2Aオーバーラップ等の追加最適化も予定されていると記述されている。

原典ハイライト

最適化前のJAXベースラインはGPUあたり103 TFLOPSで、GPU間通信がカーネル時間の84%を消費。Grouped GEMM・NCCL EP・XLAマルチストリーム等を段階的に適用し1,068 TFLOPSへ改善(約10.4倍)。1,024GPUスケールでも97%のスケーリング効率を維持。

出典: NVIDIA Technical Blog(公式ブログ)

So What?(なぜ重要か)

MoEアーキテクチャはDense(密)モデルよりも少ない計算コストで同等以上の性能を実現できる手法として主流化しつつある。一方、その学習効率はGPU間通信のボトルネックに左右されやすく、素朴な実装ではハードウェア能力の大半が無駄になる。今回の技術解説は、Transformer Engine+JAXという公開スタックで10倍超の改善が可能であることを示しており、同等の最適化を採用した競合・研究機関との学習コスト格差が拡大しうる。また、GB300 NVL72という最新ラック構成でのスケーリング効率の高さは、大規模クラスタ投資対効果の試算に影響を与える。

日本企業への示唆

日本の大手IT・製造・通信企業でLLM内製化や学習基盤整備を検討している場合、MoEアーキテクチャ採用時の学習コスト試算を見直す必要がある。NVIDIAが公開しているNGC MaxTextコンテナとTransformer Engineを用いれば、同記事で示された最適化パスを再現できるとされており、まず検証環境でのPoC(概念実証)を優先すべきだろう。一方、最大限の効果を得るにはGB200/GB300世代のGPUが前提条件となる点に注意が必要で、既存クラスタの世代が古い場合は効果が限定される可能性がある。また、GPU間通信の最適化がいかに重要かを示す事例でもあり、クラスタ調達時にはNVLinkとInfiniBandの構成を精査することが投資対効果の観点から重要になる。

背景・経緯

MoEモデルはDeepSeek・Qwen・Mixtralなど近年の主要LLMで採用が広がっており、少ない学習計算量で高性能を実現できる点が評価されている。ただし、トークンを動的にエキスパートへルーティングする仕組みが不規則なテンソル形状を生み出し、従来の行列演算ライブラリとの相性が悪く、GPU間通信が学習時間の大半を占めるという課題があった。NVIDIAはTransformer Engineをこうした課題への解答として位置づけており、今回の記事はその具体的な実装詳細と定量的な効果をまとめたものとみられる。