公開:2026年9月5日, 最終更新:2026年9月5日
30秒サマリー
- AWSがNVIDIA Cosmos 3をSageMaker HyperPod上で動かし、ロボット・自動運転向けAI開発パイプラインを継続運用する方法を公式ブログで詳説
- Cosmos 3は合成データ生成・行動ラベリング・ポリシー推論を1つのモデルで担い、ステージごとに別GPU群を用意する従来構成を不要にする
- コスト指標は「GPUピーク性能」でなく「GPU goodput(予約GPU時間あたりの有用な進捗)」と位置付け、継続稼働型の1クラスター共有を推奨
何が起きたか
AWSのMachine Learning公式ブログは2026年9月5日、NVIDIA Cosmos 3をAmazon SageMaker HyperPod(EKS構成)上で用いて「Physical AIモデルファクトリー」を構築する方法を詳解する記事を公開した。Physical AIとは、ロボットや自動運転車のようにリアルワールドデータを物理的な行動に変換するシステムを指し、単発の学習ジョブではなく「合成データ生成→知覚・ポリシーモデルの追加学習→シミュレーション評価」を繰り返す継続的なパイプラインが必要になる。
Cosmos 3の設計上の特徴として同ブログは三点を挙げる。第一に、映像・画像・行動・音声を単一トークンストリームで扱う「オムニモーダル」構成。第二に、Mixture-of-Transformers(MoT)と呼ばれる各レイヤーで推論器(Reasoner)と生成器(Generator)を結合するアーキテクチャ。第三に、学習時は完全なデノイジングスケジュールと映像デコードを実施し、ロボット実機では数ステップのデノイジングのみ行い映像デコードを省略する「学習-推論非対称性」。この設計により、順動力学(合成データ生成)・逆動力学(行動ラベリング)・ポリシー(実機展開)の3モードを同一チェックポイントで切り替えて実行できる。
モデルの系列はCosmos3-Nano(16Bパラメータ、Qwen3-VLの密な8Bバックボーン使用)、Cosmos3-Super(64B、密な32Bバックボーン)、およびオンデバイス向けのCosmos3-Edge(4B、Qwen3-VLとは別系統のバックボーン)の3種。NVIDIAはLinux FoundationのOpenMDW-1.1ライセンスのもとで公開している。
インフラ面では、1つのSageMaker HyperPodクラスター(EKS)が全ステージを担うKubernetesワークロードとして稼働し、Amazon FSx for Lustreファイルシステムをすべてのステージが共有マウントする構成を解説している。合成データ生成・追加学習・評価が同一ストレージを参照することで、ステージ間の再プロビジョニングやテラバイト規模のデータ移送が不要になる。継続パイプラインの費用管理指標として「GPU goodput(予約GPU時間あたりの有用なパイプライン進捗)」を用いる考え方も示した。具体的な実装コードはawsome-distributed-ai GitHubリポジトリで公開されており、公開DROIDデータセットを用いたロボットポリシー段階のエンドツーエンドのウォークスルーが含まれる。
原典ハイライト
「Cosmos 3は生成・追加学習・評価という3つのモデルクラスを、異なるモードで動作する1つのモデルに統合する。これにより、ステージごとに別GPUプールを用意するのではなく、1つの永続的プールを時分割で利用するパイプラインが可能になる」(AWS Machine Learning Blogより要約)
出典: AWS Machine Learning Blog(公式ブログ)
So What?(なぜ重要か)
ロボット・自動運転AIの開発において最大のボトルネックはモデル単体の性能よりも「継続的なデータ生成→学習→評価ループ」の運用コストと複雑性にある。Cosmos 3+SageMaker HyperPodの組み合わせは、従来ステージごとに必要だった複数クラスターを1つに集約し、再プロビジョニングロスを削減する具体的な設計を示した。コスト指標をピークスループットからGPU goodputへ転換する考え方は、GPUリソースの予算計画そのものを変える可能性がある。
日本企業への示唆
製造・物流・建設分野でロボットや自動搬送システムへのAI適用を検討する日本企業にとって、今回の解説は実装参照事例として直接活用できる。特に注目すべきは(1)PoC段階では見えにくい「継続運用コスト」の設計論と、(2)合成データ生成を自社ロボットデータの希少性を補う手段として組み込む発想。Cosmos3-Edgeは4BパラメータでJetson Thor/Orin上での動作が示されており、エッジデバイスへの実装を前提にした開発ロードマップを描きやすい。AWSとNVIDIAの両方と取引実績がある場合は、awsome-distributed-aiリポジトリのマニフェストをそのまま検証環境に適用することで技術的な実現可能性を短期間で確認できる。
背景・経緯
Physical AI向け世界モデルはNVIDIA Cosmos 1/2に続く系列であり、今回のCosmos 3はMixture-of-Transformers設計とオムニモーダル対応を加えた次世代版とみられる。SageMaker HyperPodは大規模分散学習向けのマネージドクラスターサービスで、EKSとの統合によりKubernetesワークロードとして各種AIジョブを管理できる。NVIDIAはCosmos 3のアーキテクチャ詳細をCosmos 3技術レポートとして別途公開している(原文参照)。






