AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

AI2がオープンなMoE大規模訓練基盤「Olmo-core 3」を公開、兆パラメータ規模に対応

公開:2026年10月2日, 最終更新:2026年10月2日

30秒サマリー

  • Allen Institute for AI(Ai2)が、MoEモデルの大規模訓練フレームワーク「Olmo-core 3」をオープンソースで公開した
  • 専門家数を8から128に増やしても訓練スループット低下を5%未満に抑え、1.2兆パラメータ規模の検証も実施済み
  • 次世代OlmoモデルのMoEアーキテクチャ基盤として位置づけ、研究者・開発者への無償提供を明言

何が起きたか

Allen Institute for AI(Ai2)は2026年10月1日、大規模言語モデル開発フレームワークの新版「Olmo-core 3」を公式ブログおよびGitHubで公開した。MoE(Mixture-of-Experts)モデルを兆パラメータ規模までスケールアップしつつ計算効率を維持することを主眼に置いた設計で、次世代Olmoシリーズの訓練基盤として開発されたとされる。

技術的な主な変更点として、従来のFSDP(完全シャード型データ並列)からDDP(分散データ並列)ベースのシステムへ切り替え、エキスパートをGPU上に常駐させてデータをルーティングする方式を採用した。NVIDIA B300 GPU 8枚での予備テストでは、47BパラメータのMoEモデルが1GPU当たり毎秒5万2,000トークンを処理し、旧実装比で約2.7倍のスループットを達成したとしている。

さらに、エキスパート並列・パイプライン並列・分散オプティマイザーの組み合わせにより、単一GPUで全モデルを保持せずに訓練できる構成を実現。低精度数値フォーマット「MXFP8」の適用により、BF16比でスループットが約21%向上し、ピーク使用メモリが103GiBから95GiBに削減されたことも計測されている。ベンチマークとしては512GPU上での1.2兆パラメータ構成(アクティブ約583億パラメータ/トークン)で858 TFLOP/s/GPUを記録しており、DeepEP v2を用いた限定テストでは2.38兆パラメータ構成にも到達したと報告されている。

同ブログでは「モデルウェイトは、その背後にあるインフラと訓練上の意思決定がオープンであってこそ有用性が高まる」と述べており、コード・技術レポート・インタラクティブデモもあわせて公開されている。

原典ハイライト

NVIDIA B300 GPU 8枚での予備テストで47BパラメータMoEが旧実装比約2.7倍のスループットを達成。512GPUでの1.2兆パラメータベンチマークでは858 TFLOP/s/GPUを記録。専門家数を8から128に拡張しても訓練スループット低下は5%未満に留まると報告されている。

出典: Hugging Face Blog(公式ブログ)

So What?(なぜ重要か)

大規模MoEモデルの訓練基盤がオープンソースで入手できるようになることで、億〜兆規模パラメータのモデル開発が特定クラウドベンダーや巨大テック企業に限られない状況が進む。Ai2が訓練インフラごと公開するアプローチは、コミュニティによる検証や改善を促しつつ、独自モデル開発コストの引き下げに寄与しうる。ただし今回の発表はフレームワークの公開であり、同基盤を用いて訓練された次世代Olmoモデルそのものの公開は現時点では別途予定されているものとみられる。

日本企業への示唆

日本の研究機関や独自LLM開発に取り組む企業にとって、Olmo-core 3は「訓練インフラをゼロから構築せずにMoEモデルを開発できる」選択肢になりうる。特に計算資源が限られるアカデミア・スタートアップでは、エキスパート並列やMXFP8によるメモリ・スループット最適化のノウハウをコードレベルで参照できる点が実務的に有益だ。一方、NVIDIA B300 GPUを前提としたベンチマークが多く、国内で整備が進むAMD・国産半導体環境との互換性は別途検証が必要である。訓練インフラのオープン化を競争優位の評価軸に加え、調達・研究開発計画の見直しを検討するタイミングといえる。

背景・経緯

Ai2はこれまでOlmoEでMoEアーキテクチャ(64ルーティングエキスパート)を採用し、Olmo 3では密(dense)アーキテクチャへ移行していた。Olmo-core 3はその両系譜を踏まえ、大規模MoEに特化した訓練スタックとして再設計されたと原文は説明している。NVIDIA Megatron-CoreをはじめとするMoE訓練の既存選択肢に対する位置づけも言及されている。