AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

NVIDIAがマルチGPU推論の実装方法を公式ブログで詳解、動画生成が8GPU構成で約4.6倍高速化

30秒サマリー

  • NVIDIA Dynamo-Triton 26.07がTensorRTマルチデバイス推論に対応し、単一エンドポイントで複数GPUを束ねた分散推論が可能に
  • Cosmos 3 Nanoによる動画生成で、1GPU時156秒の生成時間が8GPU構成で34秒へ短縮(約4.6倍高速化)
  • GPUリソースを積み増すことでレイテンシを大幅削減できるが、スループットやTCOは別途評価が必要

何が起きたか

NVIDIAは2026年9月21日付の公式テクニカルブログで、NVIDIA Dynamo-Triton(旧Triton Inference Server)リリース26.07におけるTensorRTマルチデバイス推論の実装方法を詳解した。同機能はTensorRT 11.0以降で完全サポートされており、単一のTensorRTネットワークをNCCLによる分散コレクティブ通信を介して複数GPU上で実行しつつ、TensorRTの推論最適化を維持できる。

Dynamo-Triton側の構成は、KIND_MODELインスタンスに複数のGPUを割り当て、設定ファイル(config.pbtxt)でenable_multi_deviceパラメータを有効化するだけで済む。クライアントアプリケーションは単一のgRPCエンドポイントに対してリクエストを送るだけで、GPUランクの調整処理を自分で行う必要がない。

動作検証にはNVIDIA Cosmos 3 Nanoを用いた動画生成ワークロードが使われた。解像度1280×720・189フレーム(24FPS)・35ステップの生成処理で、1GPU構成では平均156.6秒かかっていたエンドツーエンドの生成時間が、8GPU構成(CP8)では34.2秒に短縮され、約4.58倍の高速化を達成。トランスフォーマーRPC単体では6.09倍の高速化が確認された。また、CP2・CP4・CP8の各出力はMAE≦25・PSNR≧18dBの品質閾値をクリアしており、シード固定での視覚的一致も確認されている。

NVIDIAはベンチマーク結果について、同時リクエストのスループット・動画1本あたりのコスト・総所有コスト(TCO)は計測対象外であり、自社のSLOや経済的制約に基づいて評価することを推奨している。

原典ハイライト

1GPU構成で156.6秒かかったCosmos 3 Nano動画生成が、8GPU構成では34.2秒に短縮。トランスフォーマーRPCの処理時間に限ると6.09倍の高速化。クライアント側の変更なしに単一gRPCエンドポイントで複数GPUを利用可能。

出典: NVIDIA Technical Blog(公式ブログ)

So What?(なぜ重要か)

生成AIの推論において「単一GPU性能の限界」を回避する手段として、マルチGPU分散推論がサービングレイヤーで実用段階に入りつつあることを示している。従来は分散推論の組み込みにアプリケーション側の複雑な実装が必要だったが、Dynamo-Tritonを介することでその複雑さをインフラ層に閉じ込められる。動画・画像生成など長いシーケンスを扱うレイテンシ重視のワークロードにとって、GPUを積み増してSLAを維持するという選択肢が現実的になる。

日本企業への示唆

生成AI推論の商用展開を検討している日本企業・SIerにとって、以下の点が実務的な検討材料になる。①Dynamo-Triton 26.07とTensorRT 11.0の組み合わせにより、アプリケーションコードを変えずにマルチGPU推論へ移行できる。②レイテンシ要件が厳しい映像制作・リアルタイム生成業務では、GPU台数を増やすことで応答時間を大幅に短縮できる選択肢が生まれる。③ただしNVIDIA自身が明記するとおり、スループットやTCOは本ベンチマークでは未評価。導入前に自社ワークロードで並行リクエスト数やコスト効率を別途検証することが不可欠。④設定はconfig.pbtxtのパラメータ追加のみと比較的シンプルだが、事前にTensorRTプランを分散グラフとしてコンパイルしておく必要がある点に注意。

背景・経緯

NVIDIAは従来、マルチGPUでの推論にはアプリケーション側がGPUランクや通信ライブラリの管理を担う必要があった。TensorRT 11.0でNCCLベースのマルチデバイス推論機能が追加され、今回のDynamo-Triton 26.07でそのサービングレイヤーへの統合が実現した。Dynamo-TritonはTriton Inference Serverを改称したもので、NVIDIAの推論サービングの中核製品に位置付けられる。Cosmos 3 Nanoは動画生成モデルで、同ブログでは以前にも関連する技術記事が公開されている。