公開:2026年9月17日, 最終更新:2026年9月17日
30秒サマリー
- NVIDIAがTileGymの24種すべてのCUDA TileオペレータをAIエージェントでRustへ変換し、Python比99.5%の性能を達成
- 変換パイプラインはTile IRの差分比較を含む多段階の機械検証を組み込み、構造的な正確性を担保
- エージェントスキルはTileGymリポジトリで公開されており、自社カーネルへの適用も可能
何が起きたか
NVIDIAのエンジニアリングチームは2026年9月16日付の公式テクニカルブログで、エージェントAIを活用してCUDA TileカーネルをPython(cuTile Python)およびTriton-TileIRからRust(cuTile Rust)へ変換するワークフローを解説した。
TileGymライブラリが蓄積してきた本番カーネル群をRustでも利用可能にするため、同チームはAIエージェントスキルを構築。element-wiseな演算からflash-attention decode、Multi-head Latent Attention(MLA)、Mixture-of-Experts(MoE)まで、合計約40のGPUカーネルを含む24オペレータ全てをRustへ移植し、NVIDIA DGX B200上でのベンチマークではcuTile Python比の幾何平均速度比が0.995(99.5%)に達したと報告している。
変換パイプラインは分析・デバイスカーネル・ホスト/FFIコード・ベンチマークの各フェーズで構成され、各フェーズの末尾に機械検証が設けられている。とくに「Tile IRの差分比較(IR diff)」により、参照実装と変換後のカーネルが同一のIR構造を持つかを関数テスト実行前に確認できる点が特徴だ。cuTile PythonとcuTile Rustは共通のCUDA Tile IR(cuda_tileダイアレクト)を経由するため、こうした構造的検証が成立するとしている。
主要な技術的課題は「特殊化(specialization)の明示化」にある。cuTile PythonはJITが呼び出し時に暗黙的に特殊化するのに対し、Rustはカーネルシグネチャに全ての特殊化を明示的に宣言する必要がある。この差異が翻訳作業の大部分を占めるという。変換済みカーネルはC-ABI層を介してTileGymのPythonディスパッチとテストフレームワークに統合され、テンソルディスクリプタをコピーや動的メモリ確保なしに渡す設計となっている。
原典ハイライト
全24オペレータの変換においてTile IRの差分比較を機械的な検証基盤とすることで、「通るが間違っている」変換(コストヒントの誤りや属性の欠落など)をテスト実行前に検出できる点が本手法の核心。DGX B200上での全24オペレータの幾何平均速度比は0.995で、設定した閾値0.95をすべてクリアした。
出典: NVIDIA Technical Blog(公式ブログ)
So What?(なぜ重要か)
本手法が示すのは、「共通の中間表現(IR)を持つ言語間であれば、AIエージェントによるコードベース移行を構造的に検証可能な形で自動化できる」という設計原則だ。AIによる変換を「動けばよい」ではなく、IRレベルの差分比較と段階的な機械検証でトレーサビリティを担保している点は、業務コードの移行に求められる信頼性水準と合致する。また変換スキルがオープンなリポジトリで提供されることで、同様のアーキテクチャを持つプロジェクトへの横展開が現実的な選択肢となる。
日本企業への示唆
GPUカーネル開発を行う日本の研究機関・AI企業・半導体関連企業にとって、Python資産をRustの安全性モデルで再利用する実証例として参照価値がある。より広く見れば、「AIエージェントによるコードベース移行の自動化」という手法は、レガシーコードの言語間移植やライブラリのバージョンアップにも応用しうる。ただし本手法が機能するのは共通IRという構造的検証基盤が存在するからであり、自社コードへ適用する場合は同等の「機械検証ポイント」を設計できるかを先に評価すべきだ。社内のAI活用ガイドラインにおいても、コード変換の自動化に際してどのレイヤーで正確性を検証するかを定義することが、実用化の鍵となる。
背景・経緯
cuTile Rust(cutile-rs)はRustの所有権モデルをタイルベースのGPUカーネルに拡張したシステム。cuTile Python、Triton-TileIR、cuTile Rustの3つのフロントエンドは共通のCUDA Tile IR(cuda_tileダイアレクト)に収束し、同一のtileirasコンパイラでGPUバイナリを生成する。この共通基盤がフロントエンド間の移植と検証を可能にしている。TileGymはNVIDIAが提供するCUDA Tileカーネルライブラリで、本ブログ執筆時点でPythonおよびTriton-TileIR向けに多数の本番カーネルが蓄積されていたと原文は説明している。





