AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

Qwen3.8-2.4T-A95B(2.4兆パラメータ)をSageMaker HyperPodで動かす構成をAWSが解説

公開:2026年9月10日, 最終更新:2026年9月10日

30秒サマリー

  • AWSが、Alibaba製巨大MoEモデルQwen3.8-2.4T-A95BをSageMaker HyperPodとvLLMで自社運用する方法を公式ブログで詳説した
  • NVFP4量子化により重みを約1.2TBに圧縮し、B300 Blackwell Ultra GPU×8の単一ノードへの収容を実現
  • 推論制御・ツール呼び出し・投機的デコードなど本番運用に必要な設定が具体的なコマンドとともに公開されている

何が起きたか

AWSのMachine Learning公式ブログは2026年9月、Alibaba Qwen3.8-2.4T-A95BをAmazon SageMaker HyperPodとvLLMを組み合わせて展開する手順を詳述した記事を公開した。同モデルは2026年8月12日にAlibaba Qwenチームがリリースしたもので、総パラメータ数2.4兆(トークン当たり95億が活性化)のMixture-of-Experts(MoE)モデル。Qwen-Maxクラスのモデルとしてオープンウェイトで公開されるのはこれが初めてだと原文は説明している。

アーキテクチャ面では、92層のうち69層をGated DeltaNet(線形アテンション)、23層をGated Attention(フル二次アテンション)が担うハイブリッド設計を採用。DeltaNetの固定サイズ再帰状態によってKVキャッシュのコンテキスト長依存の膨張を抑え、最大100万トークンまでメモリが線形増加しない点を原文は「エージェント型ワークロードにとって重要な特性」と位置づけている。エキスパートは512個(+共有1個)の細粒度MoEを構成し、フォワードパスごとに約95Bのみ活性化される。

使用インスタンスはml.p6-b300.48xlarge(NVIDIA B300×8、GPU合計メモリ2.1TB)。BF16精度では重みだけで約4.8TBが必要だが、NVFP4(W4A4)量子化で約1.2TBに圧縮し、単一ノードへの収容を実現する。vLLMの主要フラグとして、8GPU全体へのテンソル並列分割(–tensor-parallel-size 8)、プレフィックスKVキャッシュ再利用(–enable-prefix-caching)、ネイティブMTPヘッドを活用した投機的デコード(num_speculative_tokens:1)、Qwen3専用の推論パーサーおよびツールコールパーサーが紹介されている。

HyperPod側の機能として、InferenceEndpointConfigカスタムリソース定義によるYAMLベースの宣言的デプロイ、KEDA連携のオートスケーリング、プレフィル・デコードの分離(DPD)、ノード障害時の自動交換が説明されている。なお、ml.p6-b300.48xlargeはオンデマンド提供ではなく、Flexible Training Planによる予約調達が必要とされている。

原典ハイライト

原文は「BF16では約4.8TBの重みが単一ノードを超えるが、NVFP4量子化で約1.2TBに圧縮し2.1TBのGPUメモリ内に収まる」と明示。またDeltaNetの固定再帰状態により69/92層でKVキャッシュ増加を排除できるため、コンテキストが1Mトークンに伸びてもメモリ消費が線形増加しないとの設計上の利点を技術的根拠とともに説明している。ベンチマーク数値(PaperBench 93.0、IFBench 82.8等)はベンダー自身の計測結果として紹介されている。

出典: AWS Machine Learning Blog(公式ブログ)

So What?(なぜ重要か)

2.4兆パラメータ級のオープンウェイトモデルを自社インフラで本番稼働させるための「量子化+専用インスタンス+推論スタック」の組み合わせが、AWSの公式手順として示されたことの意義は大きい。プロプライエタリAPIへの依存を避けつつフロンティア性能に近い推論能力を自社環境で得られる可能性が、実装レベルで具体化された。一方でml.p6-b300の予約調達が必須である点や、運用・監視の継続コストは依然として重いことも原文から読み取れる。

日本企業への示唆

コーディングエージェントや研究パイプラインの内製化を検討する日本企業にとって、本記事は実装可否を判断する具体的な参照点となる。留意点は三点ある。①ml.p6-b300.48xlargeはFlexible Training Plan(予約契約)が必要なため、需要見込みと契約期間のトレードオフを事前に精査すること。②NVFP4量子化は精度とメモリ効率を両立するが、BF16と比べた精度劣化を用途ごとに検証する工程を省かないこと。③HyperPodのInferenceOperatorを活用すればKubernetes運用の大部分がマネージド化されるが、社内にコンテナ・EKS基盤の知見がない場合は習熟コストを見込む必要がある。プロプライエタリAPIとの費用比較は、トークン量・並列数・SLAを揃えた条件で試算することを推奨する。

背景・経緯

本記事はAWSによる「SageMaker HyperPod上でのオープン兆パラメータモデル展開シリーズ」の第2弾として位置づけられており、第1弾はKimi K3の展開事例とされている。Qwen3.8-2.4T-A95Bは2026年8月12日にオープンウェイトとして公開されたばかりのモデルであり、本ブログはその約1ヶ月後に公開されたことになる。