AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

マルチモーダルAI推論を最大7倍高速化するEPD分離の適用条件をNVIDIAが解説

公開:2026年9月10日, 最終更新:2026年9月10日

30秒サマリー

  • NVIDIAがDynamoフレームワークにおけるEPD(エンコード・プリフィル・デコード)分離の効果と適用条件を公式ブログで詳説
  • 画像多数・短〜中程度の出力・量子化MoEモデルの組み合わせでTTFT最大5倍、E2E応答を最大7倍改善
  • 長い出力シーケンスや大規模密結合モデルでは効果が薄れるため、ワークロードの特性把握が前提

何が起きたか

NVIDIAは2026年9月9日、公式テクニカルブログにて、マルチモーダルモデルの推論最適化手法「エンコード・プリフィル・デコード(EPD)分離」の適用条件と効果をオープンソース推論フレームワーク「Dynamo」を用いて詳説する記事を公開した。

EPD分離は、従来1つのワーカーがまとめて処理していたビジョンエンコード・LLMプリフィル・デコードの各ステージを独立したスケーラブルなステージに分離する技術だ。ブログでは、エンコーダーの配置方法として①集約型(分離なし)、②コロケーション型(PD用GPUにエンコーダーワーカーを同居)、③分離型(低コストGPU層をエンコーダー専用に使用し、NVIDIA Inference Transfer Library「NIXL」で接続)の3トポロジーを示し、ワークロード特性に応じた選択指針を提示している。

ベンチマークはQwen3.5 122B A10B NVFP4モデルをGB200 GPU 4基で実施。1リクエストあたり画像10枚・出力1024トークンの画像集約型ワークロードでは、コロケーション型でTTFT58%減、分離型で50%減を確認。混在トラフィック環境(テキストと画像が混在)では、EPD適用によりテキストリクエストのTTFTが平均42.2%、画像リクエストが30.8%改善した。また、LLM重みをNVFP4に量子化しつつビジョンエンコーダーをBF16のまま維持したケースでは、コロケーション型EPDのグッドプットが集約型比1.78倍から2.64倍へ向上した。

一方、出力シーケンスが長くなるほどデコード時間がレイテンシ全体を支配し、E2E改善幅が縮小する点も明示。出力2,048トークンの条件では、コロケーション型が集約型比11.8%改善から2.5%の悪化に転じるケースも報告されており、適用の可否はワークロード特性の精密な把握が前提となる。

原典ハイライト

EPD分離は「入力メディア負荷が高い」「出力が短〜中程度」「量子化またはMoEモデル」の3条件が重なる場面で最大の効果を発揮する。逆に、デコードがレイテンシを支配する長出力ワークロードや大規模密結合モデルでは効果が薄れるか逆効果になる可能性を、NVIDIAは実測値とともに明示している。

出典: NVIDIA Technical Blog(公式ブログ)

So What?(なぜ重要か)

マルチモーダルAI推論の高速化・コスト削減は「分離すれば必ず良くなる」という単純な話ではなく、ワークロードのプロファイリングが前提となることが実測データで示された。特に、高解像度画像・動画を多数含むリクエストが多い業務では、既存GPUクラスターにエンコーダー用低コストGPUを追加することで、プレミアムGPU(GB200相当)の予算を変えずにスループットを大幅に向上できる可能性がある。量子化MoEモデルとEPD分離の組み合わせは、コスト対性能比の改善余地が特に大きい。

日本企業への示唆

画像・動画入力を伴うマルチモーダルAIを自社システムや顧客向けサービスに組み込んでいる、または検討中の日本企業にとって、推論インフラ設計の見直し材料となる。特に①リクエストあたりの画像枚数・解像度、②生成トークン長の分布、③テキスト単独リクエストとのトラフィック混在比率の3点を計測・把握することが、EPD分離導入可否の判断に直結する。低コストGPUをエンコーダー層に充てるヘテロジニアス構成は、GPUコスト削減の選択肢として具体的に検討に値する。DynamoはオープンソースでありGitHubで実験再現が可能な点も、先行検証のハードルを下げる。

背景・経緯

マルチモーダルLLMの推論では、テキストのみのモデルと異なりビジョンエンコーダー(ViT)の処理が加わるため、GPUリソースの競合やレイテンシ増大が課題となっている。NVIDIAのDynamoは分散推論向けオープンソースフレームワークとして開発されており、プリフィル・デコード分離(PD分離)などの推論最適化技術を実装している。今回のEPD分離はその発展形として位置づけられる。ブログ内ではNIXLを用いたGPU間エンベディング転送(ピーク20Gbps)の実測値も示されている。