30秒サマリー
- AWSがSageMaker AI上でBlackwell世代GPU搭載G7インスタンスの推論ベンチマーク結果を公式ブログで公開した
- 30BクラスのMoEモデル2種を用いた検証で、G7はG6比でスループット約61%向上・P99レイテンシー約55%削減を記録
- G7は4GPUのG5・G6と異なり2GPU・64GB構成ながら高スコアを示し、コストパフォーマンス面でも注目される
何が起きたか
AWSは公式のMachine Learning Blogにおいて、Amazon SageMaker AI上でG5(NVIDIA A10G)・G6(L4)・G7(RTX PRO 4500 Blackwell)の3世代GPUインスタンスを対象に、小規模LLM推論のベンチマーク結果を公開した。
検証に用いたモデルはいずれも30Bクラスの混合専門家(MoE)アーキテクチャ。ユースケース1ではコーディング用途向けに「Qwen3-Coder-30B-A3B-Instruct-FP8」をDJL LMI 28.0コンテナで展開し、同一モデル・同一ワークロード(同時接続4・リクエスト100件・入出力各128トークン平均)でG5・G6・G7の3インスタンスを比較した。出力トークンスループットはG5が346.3 tok/s、G6が243.4 tok/s、G7が391.3 tok/sとなり、G7はG6比で約60.8%、G5比で約13.0%高い値を示した。平均レイテンシーはG7が1,315.8msで、G6(2,109.7ms)比で約37.6%、G5(1,475.2ms)比で約10.8%低減。P99レイテンシーでは、G7の1,501.1msに対しG6は3,315.7msで、差はさらに拡大した(約54.7%削減)。G7のストリーミング計測では、中央値TTFTが約118ms、平均ITLが8.9msを記録した。
なお、G5・G6の12xlarge構成はいずれも4GPU・96GBの合計GPUメモリを持つのに対し、G7の12xlargeは2GPU・64GBと少ない構成であり、ハードウェアリソースが少ない状態での高パフォーマンスが確認された形となる。G7はNVIDIAのBlackwellアーキテクチャが持つFP4 Tensor Coreをネイティブサポートしており、NVFP4形式の重みを高速処理できる点が構造的な優位性として挙げられている。G5・G6はNVFP4形式の重みをハードウェアアクセラレーションなしで処理するため、G7との差が生じるとブログは説明している。
ユースケース2では「NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4」を用い、G6・G6e・G7をvLLMで比較する「Generative AI Inference Recommendations」による自動評価ワークフローを紹介している(詳細なベンチマーク数値は今回の原文取得範囲には含まれない)。なお、G7インスタンスは現時点でUS East(オハイオ)およびUS West(オレゴン)リージョンのみで利用可能とされている。
原典ハイライト
同一モデル・同一ワークロードの条件下で、G7(2GPU・64GB)はG6(4GPU・96GB)に対してスループット約61%増・P99レイテンシー約55%削減を達成。Blackwell世代のFP4 Tensor Coreネイティブサポートが、MoEモデルのメモリ帯域幅ボトルネック解消に寄与していると説明されている。
出典: AWS Machine Learning Blog(公式ブログ)
So What?(なぜ重要か)
編集部の見方として、今回の結果は「GPU世代交代がコスト構造を根本から変えうる」ことを具体的な数値で示した点が重要だ。G7はGPU数・総メモリ容量でG6を下回りながら全指標で上回っており、インスタンス単価次第ではトークン単価が大幅に改善する可能性がある。MoEモデルの普及が進む中、NVFP4のネイティブサポートはBlackwell世代の構造的優位であり、次世代モデル選定においてもGPUアーキテクチャの互換性が重要な評価軸になりつつある。
日本企業への示唆
生成AIの推論コストを管理しようとしている日本企業にとって、GPU世代の選択は「設定の工夫」ではなく「インフラ調達戦略」として経営判断レベルで検討すべき事項になっている。今回のベンチマークはAWSが提供する「Generative AI Inference Recommendations」を活用することで再現可能であり、自社モデル・自社ワークロードに即した比較検証を比較的低コストで実施できる。自社の生成AIワークロードがMoEモデルを採用している、またはNVFP4量子化モデルの利用を検討しているチームは、G7インスタンスの試験的評価を優先的に行う価値がある。一方、G7は現時点で米国2リージョンのみの提供であるため、東京リージョン等での利用可否は別途確認が必要だ。
背景・経緯
AWSのSageMaker AIは、機械学習モデルのデプロイ・推論基盤を提供するマネージドサービス。NVIDIAのBlackwellアーキテクチャはFP4演算のTensor Coreネイティブサポートを特徴とし、G7インスタンスファミリーに搭載されている。MoEモデルはトークン生成時に一部のエキスパートのみを活性化するため、メモリ帯域幅がボトルネックになりやすく、高帯域幅GPUの恩恵を受けやすいとされる。今回のブログは既存のG7インスタンスおよびSageMaker AI Inference Recommendationsの活用方法を解説したもので、原文ではこれらサービス自体の新規リリースには言及していない。




