AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

NVIDIA Vera Rubin NVL72、MLPerf v6.1で旧世代比最大3.7倍のスループットを記録

30秒サマリー

  • NVIDIAの次世代AI推論プラットフォーム「Vera Rubin NVL72」がMLPerf Inference v6.1に初登場し、GB300 NVL72比で最大3.7倍のスループットを達成
  • GB300 NVL72は288GPU(4ラック)構成で99%のスケーリング効率を実現し、ハードウェア増設に対してほぼ線形にスループットが向上
  • ソフトウェア最適化によりv6.0比で最大1.6倍の性能向上も確認され、インフラ投資の継続的な収益改善が可能であることを示した

何が起きたか

NVIDIAは2026年9月16日、MLPerf Inference v6.1の結果を公表した。同社の公式ブログによると、次世代プラットフォーム「Vera Rubin NVL72」が初のプレビュー結果を提出し、DeepSeek-R1およびQwen3-VLの2つのベンチマークで計測された。Qwen3-VLではGB300 NVL72比で最大3.7倍、DeepSeek-R1では最大2.5倍のスループット向上を記録したとされる。NVIDIAはこの性能向上の要因として、強化されたTensor CoreとTransformer Engine、NVFP4精度によるメモリフットプリント削減、プリフィルとデコードを分離した「 disaggregated serving」、第6世代NVLinkによる高速インターコネクトなど、ハードウェアとソフトウェアの全スタック協調設計を挙げている。

GB300 NVL72については、DeepSeek-R1のオフラインシナリオにおいて1ラック(72GPU)から4ラック(288GPU)へのスケールアップで99%のスケーリング効率を達成した。追加したGPU数にほぼ比例してスループットが伸びたことになる。また、テキスト→動画変換ベンチマーク「WAN 2.2」では単一ノード比でスループット9倍、レイテンシ7.5倍改善を達成したとブログは記している。

ソフトウェア面では、v6.0からv6.1にかけてQwen3-VLのスループットが最大1.6倍向上した。v6.1の提出締め切り後も最適化が継続されており、MLCommonsによる検証を経ていないポスト提出結果でもGPT-OSS-120BやDLRMv3でさらなる改善が確認されているという。AIエージェント向け性能を測る「SemiAnalysis AgentX」ベンチマークでは、プレビュー検証においてVera Rubin NVL72がGB300 NVL72比で30倍の性能を示したとNVIDIAは述べている。

今回の結果にはNebius、Azure、Dell Technologies、HPE、Oracle Cloud Infrastructureなど19社のパートナーも参加しており、うち8社がマルチノードのBlackwell NVL72システムで結果を提出した。エッジ向けでは「Jetson AGX Thor」を使ったQwen3.6-27Bの推論結果も提出されている。

原典ハイライト

Vera Rubin NVL72はQwen3-VLでGB300 NVL72比最大3.7倍、DeepSeek-R1で最大2.5倍のスループットを初回プレビュー提出で記録。GB300 NVL72は4ラック288GPU構成で99%のスケーリング効率を達成し、ソフトウェア最適化だけでもv6.0比最大1.6倍の性能向上を実現した。

出典: NVIDIA Blog(公式ブログ)

So What?(なぜ重要か)

編集部の見方として、今回の結果が示すのは単なる性能比較ではなく「AIインフラ投資の収益方程式」が変化しつつあるという点だ。同一ラック数でトークン生成量が最大3.7倍になれば、ユニットエコノミクス(トークン単価)は大幅に改善し、クラウド事業者やAI推論サービスの事業採算性に直接影響する。また99%というスケーリング効率は、大規模クラスターへの投資が「比例的なリターン」を生むことを意味し、過剰調達リスクを低減する。ソフトウェア最適化だけで1.6倍の性能向上が得られた事実は、既存ハードウェアへの投資が陳腐化するスピードを抑制できることも示唆している。

日本企業への示唆

日本企業への示唆として、まず生成AIの本番推論コストを試算・再試算するタイミングに来ている。Vera Rubin NVL72世代への移行を前提とすると、同等サービス品質を現行比で大幅に少ない台数・コストで提供できる可能性がある。自社でGPUクラスターを保有・計画している企業は、調達仕様のスペックロックインに注意し、世代間性能差を投資判断に組み込む必要がある。一方でクラウド経由で推論APIを利用する企業は、主要クラウドプロバイダー(Azure・Oracle等が今回パートナー参加)がVera Rubin世代を導入する時期に合わせ、ランニングコスト見直しの機会が生じると見ておくべきだ。AIエージェント用途で30倍という性能差は、複雑なマルチステップ処理を伴うユースケース(社内ナレッジエージェント、自律型業務自動化等)の実現可能性を引き上げる可能性があり、PoC計画の再評価を促す材料となる。

背景・経緯

MLPerf Inferenceは、MLCommonsが主催するAI推論性能の業界標準ベンチマークであり、各世代の結果が業界の調達・投資判断の参考指標として広く参照されている。NVIDIAは以前の世代「GB300 NVL72(Grace Blackwell)」をすでに市場投入しており、今回のVera Rubin NVL72は次世代プラットフォームとして初のMLPerfプレビュー提出となった。原文では「プレビュー結果」と明記されており、正式な商用提供状況については原文中に言及がない。