公開:2026年9月23日, 最終更新:2026年9月23日
30秒サマリー
- NVIDIAの技術ブログが、Confidential Computing有効時でもCC無効時比96%超のスループットを維持する手法を公開
- DeepSeek-R1モデルをB200 GPU×8台で検証し、トークン生成レイテンシのオーバーヘッドを5%未満に抑制
- ホスト-デバイス間データ転送・カーネル自動チューニング・マルチGPU通信の3点でCC対応最適化を実施
何が起きたか
NVIDIAは2026年9月22日付の公式技術ブログで、NVIDIA Confidential Computing(CC)環境下でのLLM推論における性能維持手法を詳説した。記事は、機密仮想マシン(CVM)やBlackwell GPUにまたがるCC環境では、メモリ移動・タイミング・スケジューリング・マルチGPU通信に関するランタイムの前提が変わり、適切な対応がなければ性能低下が生じると説明している。
検証には、NVIDIAのDeepSeek-R1モデル(NVFP4量子化)をTensorRT LLMのPyTorchバックエンドで動作させ、1台のDGX B200システム(B200 GPU×8)上でCC有効・無効を同一条件で比較する手法が採られた。入力32K・出力1Kトークン、同時リクエスト数1〜16という、CCオーバーヘッドが顕在化しやすいワークロード設定で計測した結果、CC有効時の出力トークンスループットはCC無効時比96.1〜98.2%を維持し、平均TPOTのオーバーヘッドは1.2〜4.3%にとどまったとしている。
性能維持を実現した主要な対策として、ブログは三点を挙げている。第一に、B200 CC環境ではホスト-デバイス間転送がソフトウェア暗号化バウンスバッファを経由するため、TensorRT LLMはピン留めメモリからページャブルメモリへの切り替えと、トークン読み返し処理の非同期ワーカーへの移行を実施した。第二に、CUDA Eventのタイムスタンプが不安定になる問題に対し、CC環境ではGPUのglobaltimer計測に切り替えてカーネル自動チューニングの精度を維持した。第三に、CC環境でNVLS(NVLink SHARP)マルチキャストが利用不可となるため、利用可能な通信アルゴリズムをワークロードに合わせて選択する必要があると指摘している。
原典ハイライト
B200 GPU×8台・CC有効環境のDeepSeek-R1推論で、出力トークンスループットCC無効比96.1〜98.2%、TPOT増加を5%未満に抑制。TensorRT LLMのCC対応適応(メモリ選択・非同期読み返し・globaltimer計測・通信アルゴリズム選択)が性能維持の鍵とされている。
出典: NVIDIA Technical Blog(公式ブログ)
So What?(なぜ重要か)
「セキュアにすると遅くなる」というトレードオフが、フレームワークレベルの最適化によって実用水準(性能劣化5%未満)まで圧縮できることを、NVIDIAが実測値で示した点が重要だ。金融・医療・官公庁など機密データを扱う業界でも、生成AIの本番推論へのCC適用が現実的な選択肢となりつつあることを示唆している。また、セキュリティ設定と推論最適化を別々に考えるのではなく、フルスタックの工学問題として統合的に設計する必要性がある。
日本企業への示唆
個人情報・機密文書・知財を含むプロンプトを扱う日本企業にとって、Confidential Computingは規制対応や社内ポリシー上の要件を満たすための有力な実装経路となり得る。本ブログが示す計測手法(CC有効・無効の同一条件比較)は、自社ワークロードでのオーバーヘッド定量化に直接応用できる。AI基盤の調達・設計段階でCC対応フレームワーク(TensorRT LLM等)の採用可否を評価リストに加えるとともに、セキュリティチームとMLOpsチームが連携してデプロイ仕様を策定する体制づくりが求められる。
背景・経緯
LLMが企業内の機密情報を処理するユースケースが増加する中、推論時のデータ保護が業界課題となっている。NVIDIAはConfidential Computingとして、メモリ暗号化CVM・機密GPU・暗号化NVLinkを組み合わせた保護基盤を提供しており、今回のブログはその本番運用への適用に向けた技術詳解として公開された。





