30秒サマリー
- NIM 2.0.12の最適化スタックにより、4枚構成B200でNemotron 3 Ultraの同時ユーザー数が最大2.5倍に増加
- 自動チューニングカーネル・テンソル並列化・投機的デコードなど複数の最適化技術の組み合わせが効果を生む
- NVIDIA AIPerf活用による自社ワークロードでのベンチマーク手順も具体的なコマンド付きで公開
何が起きたか
NVIDIAは2026年9月10日、推論マイクロサービス「NIM」のフルスタック最適化がNemotron 3 Ultraのスループットに与える効果を、公式テクニカルブログで詳説した。
ベンチマーク条件は4枚のB200 GPU・エージェンティックAIを想定した64Kトークン入力・KVキャッシュ再利用率76%・ユーザーあたり50トークン/秒(TPS/user、インタートークンレイテンシ目標20ms)。この条件下でNIM最適化なしのベースラインが718トークン/秒(tok/s)だったのに対し、NIM 2.0.12の最適化スタックは1,997 tok/sを達成し、2.5倍超の差となった。これは同じ応答速度を維持しつつ2.5倍以上の同時ユーザーをさばけることを意味する。
性能向上の要因は単一の機能ではなく、(1)Blackwell GPU向けに自動チューニングされたMoEおよびMambaカーネル、(2)4GPU間でのテンソル並列化と専門家認識型実行、(3)プレフィックスキャッシュ・部分プレフィックスマッチング・Mambaステートキャッシュによる文脈再利用、(4)スケジューラー・バッチサイズ・メモリ割り当てのチューニング、(5)MTP投機的デコードの組み合わせによるものと説明されている。ブログではNVIDIA AIPerf を使った自社ワークロードでのPareto曲線導出手順と具体的なDockerコマンドも掲載されている。
原典ハイライト
NIM最適化なし(baseline)718 tok/s対NIM 2.0.12最適化スタック1,997 tok/s——同一ハードウェア・同一レイテンシ目標下で2.5倍超のシステムスループットを達成。「性能向上は独立したスイッチの単純な足し算ではなく、相互作用する設定バンドルから生まれる」とブログは強調している。
出典: NVIDIA Technical Blog(公式ブログ)
So What?(なぜ重要か)
大規模LLMの本番運用では「モデルを動かす」こと自体はスタートラインに過ぎず、GPU資産あたりの同時ユーザー数がインフラコストを直接左右する。今回の事例は、同じB200×4構成でソフトウェア最適化だけで2.5倍のスループットが得られることを示しており、ハードウェア増設前にソフトウェアスタックの見直しが有効な選択肢になることを示唆している。エージェンティックAI用途のように長文コンテキスト・高KVキャッシュ再利用が発生するワークロードほど、この最適化の恩恵が大きい。
日本企業への示唆
国内でNVIDIA B200環境を利用中・導入検討中の企業にとって、NIM 2.0.12の最適化スタックはGPUコストを下げる即効性の高い手段となり得る。特に社内チャットボットや複数ステップの自動エージェントなど長文コンテキストを扱うサービスでは効果が顕著とみられる。まずNVIDIA AIPerf で自社の代表的トラフィクをリプレイしてPareto曲線を描き、現行のレイテンシSLO(サービスレベル目標)を維持できる最大スループット点を確認するアプローチが推奨されている。NIM Certified+NVIDIA AI EnterpriseによるCVE対応・商用サポートの有無も、本番移行の判断材料として検討に値する。
背景・経緯
NVIDIA NIMはLLMの推論を標準化されたAPIを持つコンテナとして提供する推論マイクロサービス。Nemotron 3 Ultraは550Bパラメータ・アクティブ55BのMoE+Mambaハイブリッドアーキテクチャのモデルで、エージェンティックAIを主な用途として設計されている。NIM 2.0.12は本ブログ公開時点(2026年9月)で対象バージョンとして言及されているが、サービス自体の最初の提供開始時期は原文では明示されていない。




