AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

AWS、SkyRLとSageMaker HyperPodでマルチモーダルRL学習の実装手順を公式ブログで解説

公開:2026年9月26日, 最終更新:2026年9月26日

30秒サマリー

  • AWSがSkyRLフレームワークをSageMaker HyperPod上で動かすマルチモーダルRL学習の構成手順を公式ブログで公開
  • 視覚言語モデルQwen3-VL-8BをGRPOでファインチューニングし、迷路解決率を43.75%から95%超に向上
  • ハードウェア障害の自動回復・チェックポイント保存・Grafanaダッシュボードによる監視が大規模RL学習の課題に対処

何が起きたか

AWSは公式機械学習ブログで、オープンソースのRLフレームワーク「SkyRL」をAmazon SageMaker HyperPod上で動作させ、マルチモーダルモデルの強化学習(RL)後学習を実施する構成の実装手順を詳細に解説した。

具体的には、視覚言語モデル「Qwen3-VL-8B」にLoRA(ランク32)を組み合わせ、GRPO(Group Relative Policy Optimization)を用いて2Dビジュアル迷路ナビゲーションタスクを学習させた。SFTチェックポイントを出発点とし、GRPO後学習を施すことで、固定64迷路の評価セットにおける解決率が43.75%から95%超に向上したと報告している。

インフラ構成として、GPUワーカー3ノード(ml.g7e.12xlarge×3、計6GPU)とCPUヘッドノード(ml.r5d.16xlarge)のRayクラスターを利用。推論(vLLM)と学習(PyTorch FSDP)を同一GPU上でコロケーションさせ、更新されたLoRAアダプター重みはAmazon FSx for Lustreの共有ストレージを介して同期する設計となっている。SageMaker HyperPodはノード障害時の自動交換やチェックポイントからの再開機能を提供し、長時間のマルチノードRL実行における障害リスクを低減する。

SageMaker Studioからのクラスター作成・リモートジョブ投入・Amazon Managed GrafanaダッシュボードによるメトリクスのモニタリングがHyperPodの機能として利用できると説明されている。

原典ハイライト

GRPOは各開始位置から複数の試行を行い、グループ内の平均を上回った軌跡を強化・下回った軌跡を抑制することでトレーニングシグナルを生成する。これにより、別途クリティックモデルや価値モデルを必要とせず、疎な報酬環境でも学習が成立する点が本手法の核心とされている。

出典: AWS Machine Learning Blog(公式ブログ)

So What?(なぜ重要か)

大規模マルチモーダルRLの実務上の障壁だった「長時間ジョブ中のハードウェア障害によるロールアウト進捗の喪失」と「複数ノードにわたるインフラ管理の複雑さ」に対し、HyperPodの自動ノード復旧・チェックポイント・Ray統合が具体的な解決策として機能しうることが示された。SFTから出発してGRPOで95%超の性能を達成したという実績は、マルチモーダルRLをプロダクション視野で検討する際の参考指標となる。

日本企業への示唆

日本企業が社内向けAIエージェントや視覚情報を扱う業務自動化モデルをRL後学習で高度化する際、AWSマネージドサービスを組み合わせたこの構成がそのまま参照できる実装テンプレートとなる。特に、GPUクラスターの障害耐性とジョブ監視体制の整備は、数百GPU時間規模のRL学習では不可欠であり、自社オンプレ環境で同等の基盤を構築するコスト・工数と比較した上でクラウド活用の是非を判断する材料として活用できる。LoRAとFSxによる軽量な重み同期設計は、GPU台数が限られる中規模組織にも適用しやすい点にも注目したい。

背景・経緯

RLを用いたLLMの後学習(RL post-training)は、推論・エージェント能力の向上手法として標準化しつつある。GRPOはDeepSeekらが採用したことで注目を集めた手法で、価値モデル不要でグループ内相対比較によりポリシーを更新する。SkyRLはNovaSky-AIが公開するオープンソースのRLフレームワークであり、VisGymはAnyscaleが提供する視覚迷路タスクの環境・データセット生成ツールとして原文に記載されている。