AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

SalesforceがSageMaker推論コンポーネントでマルチAZ冗長化とGPUコスト8分の1を両立した手法をAWSが解説

30秒サマリー

  • SalesforceはSageMaker推論コンポーネントのSchedulingConfig機能を活用し、GPU共有による8倍のコスト削減とマルチAZ高可用性を同時に実現した
  • AWSは新たなIC配置アルゴリズム(AvailabilityZoneBalance・PlacementStrategy)により、モデルコピーを複数AZに均等分散できる仕組みを提供している
  • エンタープライズAI基盤において「コスト最適化」と「コンプライアンス要件(2-AZ対応)」は従来トレードオフだったが、本手法で両立が可能になった

何が起きたか

AWSは公式機械学習ブログにて、SalesforceがAmazon SageMaker AIの推論コンポーネント(IC)を用いてAgentforce基盤のマルチAZ高可用性(HA)を実現した事例と実装手法を解説した。

Salesforceは複数モデルをGPUに共同ホストするICの仕組みにより、インフラコストを従来比8分の1に削減した。しかし、ICのデフォルト配置アルゴリズムはAZバランスを考慮せず、特定モデルのコピーが単一AZや単一インスタンスに偏るリスクがあった。Salesforceの内部コンプライアンス規定では、すべての本番モデルに2-AZサポートが義務付けられており、この要件を満たせないという課題が生じていた。

AWSはCreateInferenceComponent APIに`SchedulingConfig`パラメータを導入した。このパラメータ配下の`AvailabilityZoneBalance`でAZ間の均等分散とその許容誤差(MaxImbalance)を設定でき、`PlacementStrategy`では各AZ内での配置戦略としてSPREAD(インスタンス分散)またはBINPACK(高密度集約)を選択できる。Salesforceは障害分離を優先しSPREADを採用した。

スケールアウト・スケールイン時もSchedulingConfigの設定に従ってAZバランスが維持され、長期的な再整理にはエンドポイントのScaleInPolicyにCONSOLIDATIONストラテジーを設定することで、バックグラウンドでのコピー整理とアイドルインスタンス解放が自動実行される。また、SageMaker AI InsightsダッシュボードおよびAmazon CloudWatchを通じて、AZスキュー率やIC配置状況のモニタリングが可能とされている。

原典ハイライト

原文では、Salesforceが4インスタンス・2AZ構成のエンドポイントに複数のICを展開する具体的なコード例が示されている。`MaxImbalance: 0`を設定すれば各AZに厳密に1コピーずつ配置され、`MaxImbalance: 1`では最大1コピーの差を許容するベストエフォート均衡となる。また「CopyCountを1に設定してはならない(2-AZコンプライアンスが即座に破れる)」という注意点も明示されている。EnforcementModeは現時点でPERMISSIVE(ベストエフォート)のみが利用可能とされている。

出典: AWS Machine Learning Blog(公式ブログ)

So What?(なぜ重要か)

編集部の見立てでは、本事例が示す本質的な意義は「クラウドネイティブAI基盤において、コスト最適化ロジックと冗長性要件が構造的に衝突しうる」という点にある。SageMakerのデフォルト動作はコスト効率を優先するため、企業のコンプライアンス基準(特に金融・医療など規制業種)と相反するケースが生じやすい。SchedulingConfigの導入により、この衝突をAPIレベルで制御可能になったことは、エンタープライズ向けAI基盤設計の選択肢を広げる。一方、EnforcementModeがPERMISSIVEのみである点は、容量制約のある地域では期待通りの分散が保証されないリスクとして認識しておく必要がある。

日本企業への示唆

日本企業、特に金融・製造・通信など可用性要件が厳格な業種でAWS上のAI推論基盤を構築・運用している場合、以下の観点で即時に検討を推奨する。①既存のSageMaker ICエンドポイントがマルチAZ構成になっているか、かつAZバランスが実際に保たれているかをSageMaker AI Insightsで確認する。②内部のSLA・BCPポリシーで2-AZ以上の冗長化が求められる場合、SchedulingConfigの導入を優先課題として評価する。③GPU容量が逼迫するリージョン(東京・大阪など)では、ODCRの事前確保なしには意図したAZ分散が実現しない可能性があるため、容量予約戦略とセットで検討すること。④スケーリングポリシー設計時には、CopyCount最小値を2以上に設定し、CONSOLIDATIONストラテジーとの組み合わせで長期的なAZバランス維持を自動化することを検討する。

背景・経緯

SageMaker AIの推論コンポーネント(IC)は、複数のモデルを共有GPU上に同居させることでGPU利用率を高め、コストを削減する仕組みとして提供されている。Salesforceのエージェント向けAI基盤「Agentforce」はこのICを採用してコストを8分の1に削減した。一方、デフォルトの配置ロジックがAZ分散を考慮しなかったため、Salesforce独自の2-AZコンプライアンス要件を満たせないという問題が顕在化し、AWSが新たなSchedulingConfig機能を導入した経緯が原文に記されている。