30秒サマリー
- AWSがSageMaker HyperPod推論のコールドスタートをNVMeローカルキャッシュで大幅短縮する「モデルキャッシング」機能の一般提供を開始した
- 600GB超のDeepSeek-R1で30分超かかっていたダウンロード待機が、キャッシュ利用で数秒レベルに短縮されるとしている
- 57〜145GBモデルの実測でスケールアウト速度が約60%向上、コンテナイメージキャッシュは最大97%のコールドプル時間削減を達成
何が起きたか
AWSは公式ブログにて、Amazon SageMaker HyperPod上のLLM推論における「モデルキャッシング」機能の一般提供開始を発表した。同機能はHyperPodが利用可能な全リージョンで提供される。
LLM推論では、ポッドの起動時にECRからのコンテナイメージ取得(vLLMやLMIなど数GBの規模で5〜7分)と、S3やFSx for Lustreからのモデル重みのダウンロードが逐次発生する。原文によれば145GBモデルでは20分超、DeepSeek-R1のような600GB超のモデルでは30分以上の待機が生じ、オートスケーリング要求から実際のトラフィック処理開始まで大きなタイムラグが発生していた。
新機能は「ウェイトキャッシュ」と「イメージキャッシュ」の2種類で構成される。ウェイトキャッシュはポッドのスケジュール前にモデル重みをノードのローカルNVMeストレージに事前ダウンロードしておき、約7GB/sの読み取り速度で起動を可能にする。イメージキャッシュはコンテナイメージをノードに事前取得し、ECRからのプルを省略する。両機能は独立して有効化でき、InferenceEndpointConfigまたはJumpStartModelリソースのYAMLに`modelCacheConfig`セクションを追加するだけで利用可能で、追加インフラ構築は不要としている。
キャッシュはポッドの優先スケジューリングに基づくため、キャッシュ済みノードが不足する急速なスケールアウト時でも、ポッドは従来通りネットワーク経由でダウンロードして起動するフォールバック動作が保証されている。InferenceEndpointConfigまたはJumpStartModelリソースを削除した際には、オペレータが自動でキャッシュデータ・DaemonSet・ノードラベルを削除し、NVMeストレージを解放する。
原典ハイライト
原文のベンチマーク結果では、57〜145GBモデルでウェイトキャッシュ有効時にスケールアウトが約60%高速化。イメージキャッシュはコールドプル時間を最大97%削減。600GB超モデルでは30分超のダウンロード待機をほぼ解消できるとしている。なお、初回のキャッシュ構築時は従来同様のダウンロードコストが発生する点、NVMe容量がモデルサイズを下回るインスタンスタイプでは利用不可である点、同一S3パスのモデルファイルを更新してもspec変更がなければキャッシュが自動更新されない点を原文は制約として明示している。
出典: AWS Machine Learning Blog(公式ブログ)
So What?(なぜ重要か)
編集部の見立てでは、LLM運用における最大の課題のひとつだった「スケールアウトの遅延」がインフラ構成変更なしに大幅に緩和される点が重要だ。トラフィックスパイク対応でオートスケーラーが発動してから実際にリクエストを捌けるまでのギャップが30分超から数秒規模に縮まれば、過剰な常時起動インスタンスを抱えるコスト圧力が低下し、よりアグレッシブなスケールイン戦略も取りやすくなる。一方、NVMeストレージ容量の確認とインスタンスタイプ選定、ならびにモデル重み更新時の手動spec変更の運用設計は引き続き必要となる。
日本企業への示唆
日本企業がSageMaker HyperPodでLLMを商用運用している場合、まずモデルサイズとインスタンスのNVMe容量を照合し、キャッシュ適用可否を確認することが先決だ。原文の表によれば例としてml.g5.12xlargeが3,800GB、ml.p5.48xlargeが30,000GBのNVMeを持つ。適用できれば、ピーク対応のためにインスタンスを常時多数確保するコストを削減できる可能性がある。また、モデルの重みをS3上で更新する際にInferenceEndpointConfigのspecを必ず変更しないとキャッシュが古いままになる仕様上、CI/CDパイプラインにspec更新ステップを組み込む運用ルールの整備を推奨する。複数デプロイメントで同一コンテナイメージを共有している環境では、イメージキャッシュのみ先行適用するだけでも効果が得られる。
背景・経緯
Amazon SageMaker HyperPodはKubernetesベースのML専用クラスタサービスで、推論ワークロード向けのInference機能を提供している。原文によれば、モデルキャッシングはHyperPod Inference Operatorが導入するカスタムリソース定義(CRD)によって管理され、既存のオペレータ基盤に統合される形で実装されている。サービス自体の登場時期については原文では言及がなく、今回のブログが本機能の一般提供開始(Generally Available)を告知するものとして記述されている。




