公開:2026年9月10日, 最終更新:2026年9月10日
30秒サマリー
- NVIDIAがCUDA Toolkit 13.4を公開し、Windows on Arm対応と次世代Rubinアーキテクチャのプレビューサポートなどを追加した
- GPU共有管理を刷新するMPS V3、NVLink越しのデータ転送API「CFT」など、大規模マルチGPU環境向けの機能も拡充
- CUDA PythonもPython APIの拡張やAoTコンパイル対応など開発者生産性を高める更新が行われた
何が起きたか
NVIDIAは2026年9月9日付の公式技術ブログで、CUDA Toolkit 13.4のリリースを告知した。今回の最大の変更点の一つは、Windows on Armプラットフォームへの対応だ。CUDAアプリケーションはこれまでもLinux on Armで動作してきたが、今回のリリースでWindowsのArmプラットフォームにも対応範囲が広がった。
次世代GPUアーキテクチャ「NVIDIA Rubin」(コンピュート能力107)のプレビューサポートも追加された。これはあくまで開発者が早期にアプリケーションの移植を開始できるようにするためのプレビューであり、正式なGA(一般提供)は将来のリリースで提供される予定だと原文は説明している。また、ホストコンパイラの互換性にGCC 16とClang 22が追加され、SM_107アーキテクチャターゲットによるRubin GPU向けコンパイルが可能になった。
GPU管理面では、Multi-Process Service(MPS)V3が導入された。スクリプタブルなCLI、名前付きサーバーインスタンス、TOML設定ファイル、cgroup統合型GPUメモリ制限などを備え、コンテナ環境での精緻なGPUパーティショニングを可能にする。また、NVLinkファブリック越しのデータ転送を扱う「CUDA Compute Fabric Transport(CFT)」が追加され、仮想アドレス空間への大規模マッピングを回避しながら非同期のデータ転送・削減操作を実行できる設計となっている。CFTはCUDA Driver APIを通じてのみ利用可能で、通信ライブラリ開発者向けの機能と位置付けられている。
CUDA Python側では、cuda.core 1.1.0がテクスチャ・サーフェスプログラミング対応やNUMAアウェアな管理メモリ、型スタブ(.pyi)の整備などを追加。cuda.compute 1.1はGPUなしのビルド環境でも複数アーキテクチャ向けにアルゴリズムをAoTコンパイルできる機能を加えた。なお、CUDAのSDKインストーラーからNVIDIAドライバのバンドルが廃止され、今後はドライバとツールキットを別途インストールする方式に変更されている。
原典ハイライト
「CUDA Toolkit 13.4はWindows on ArmへのCUDAアプリケーション対応を実現する。CUDAアプリケーションはこれまでArmプラットフォームでLinuxを通じてサポートされてきたが、今回のリリースでその対応をWindows on Armプラットフォームにまで拡張する」(NVIDIAテクニカルブログより要約)
出典: NVIDIA Technical Blog(公式ブログ)
So What?(なぜ重要か)
今回のリリースはArmエコシステムへのCUDA対応をWindowsにまで広げる点で重要だ。クラウドやエッジでArmベースのWindows環境を採用する動きが広がる中、CUDAアプリケーション資産をそのまま活用できる可能性が高まる。次世代RubinアーキテクチャのプレビューサポートにはAIエージェント時代に向けた布石の意味合いがあり、企業の開発者が正式リリース前に移植準備を進められる点も実用的だ。MPS V3はコンテナ・Kubernetes環境でのGPU共有を精緻に制御する手段となり、クラウドネイティブなAIインフラ運用の高度化に直結する。
日本企業への示唆
日本企業が検討すべき点は三つある。第一に、Windows on Armの対応拡大により、Armベースのサーバーやクライアント端末でCUDAを活用する選択肢が広がる。PoC環境や開発端末の選定に影響しうる。第二に、MPS V3のコンテナ統合強化は、GPU共有基盤をオンプレミスやプライベートクラウドで構築・運用する企業にとって管理コスト削減の機会となる。第三に、RubinアーキテクチャのプレビューサポートはGA前のアプリ移植猶予を意味する。将来のハードウェア更新を見据えてアプリケーションの対応検証を今から進めることが、競合に対するリードタイムの確保につながるとみられる。
背景・経緯
CUDAはNVIDIAのGPUコンピューティングプラットフォームの中核であり、AI・科学計算・シミュレーション分野で広く採用されている。Armアーキテクチャへの対応はLinuxで先行していたが、Windows on Armへの拡張は今回が初めてとされる。Rubinは原文において「エージェントAI時代を支える次世代GPUアーキテクチャ」と位置付けられているが、正式なGA時期については言及がない。




