AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

AWS公式ブログ、EKSとDeepEPでMoEモデルのRL学習スループットを40%向上と解説

公開:2026年9月26日, 最終更新:2026年9月26日

30秒サマリー

  • AWSがAmazon EKS・EFA・DeepEPを組み合わせたMoE強化学習インフラの最適化手法を公式ブログで詳解
  • DeepEPをEFA上で動作させることで専門家並列通信のボトルネックを解消し、スループット40%向上を報告
  • EC2スポットインスタンス活用によるロールアウト生成コスト削減も含む実践的アーキテクチャを提示

何が起きたか

AWSのMachine Learning公式ブログは、Mixture-of-Experts(MoE)モデルに対して強化学習(RLHF/GRPO)を大規模にポストトレーニングする際のインフラ最適化手法を解説した。具体的には、Amazon EKS・Elastic Fabric Adapter(EFA)・DeepEPを組み合わせるアーキテクチャを提示し、このアプローチによってスループットが40%向上すると報告している。

MoEモデルは推論コスト削減のためにスパース性を高める方向に進化しているが、その結果として学習時の通信オーバーヘッドがコンピュートよりも支配的なボトルネックになる。特に「Expert Parallelism(EP)」が引き起こす動的なall-to-all通信が複数ノード間で発生すると、EFA経由のノード間通信が律速となる。DeepEPはこの問題に対し、汎用的なNCCL all-to-allコレクティブを、ノード内はNVLink、ノード間はEFA経由のRDMAを使う専用の「dispatch」「combine」カーネルに置き換えることで通信効率を改善する。

AWSはDeepEPの通信プリミティブをlibfabricへ移植する機能をコントリビュートしており、これによりDeepEP v2はEFAをネイティブサポートする。同記事ではEKSクラスター構成として、GPUノード(ポリシー学習・ロールアウト生成)、CPUノード(環境実行・前処理)、メモリ最適化インスタンス(経験バッファ・チェックポイントキャッシュ)を役割別に分離するトポロジーも示している。また、コスト削減策としてロールアウト生成フェーズにEC2スポットインスタンスを活用することも言及されている。

原典ハイライト

AWSが公式ブログで、DeepEPをlibfabric経由でEFA上に移植するコントリビューションを行い、DeepEP v2がEFAをネイティブサポートするようになったと明記。この構成により、MoEモデルの強化学習におけるロールアウト生成スループットが40%向上すると報告している。

出典: AWS Machine Learning Blog(公式ブログ)

So What?(なぜ重要か)

LLMのポストトレーニング(RLHF・GRPO)コストは、モデルがMoEアーキテクチャを採用するほど「通信インフラ」の設計に大きく左右される。DeepEP+EFAの組み合わせは、スループット向上だけでなく、GPU遊休時間の削減という形でコスト効率にも直結する。同様の課題を抱えるオンプレ・他クラウド環境においても、Expert Parallelismの通信最適化が次の設計上の必須論点になりつつあることを示している。

日本企業への示唆

自社でLLMのファインチューニングやRLHFを計画している日本企業、あるいはAWSを利用したAI基盤を構築中のSIer・MLエンジニアにとって、今回の解説は参照すべき実装指針となる。特に数百億パラメータ規模のMoEモデルを扱う場合、EKSのノードグループ設計とDeepEP導入の検討を早期に行うことで、学習コストの大幅な削減が見込める。スポットインスタンスをロールアウト生成に限定して使う構成は、コスト最適化と安定性のバランスを取る現実的なアプローチとして参考になる。

背景・経緯

MoEアーキテクチャはGPT-4やMixtralなど大規模LLMで採用が広がっており、少ないアクティブパラメータで高い表現力を実現できる反面、学習時の通信パターンが複雑になる。AWSはP5・P6インスタンスでEFAを提供しており、NCCL 2.31でもEFA向け最適化を取り込んでいる旨が原文に記載されている。DeepEPはオープンソースのライブラリであり、AWSはそのlibfabric対応に貢献したと原文は述べている。