AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

AWS、LLM推論のGPUルーティング最適化ツールを提供開始―初期トークン遅延を最大97%削減

公開:2026年9月19日, 最終更新:2026年9月19日

30秒サマリー

  • AWSがKubernetes向けGPU対応推論ルーティングアドオン「SageMaker HyperPod Inference Gateway」の提供を開始した
  • ラウンドロビン方式に代わりKVキャッシュ・キュー深度・LoRAアダプタ常駐状況を元にリクエストを最適配置し、初期トークン遅延を最大97%短縮
  • 既存のモデルサーバーやクライアントコードを変更せずEKSアドオン1つで導入可能

何が起きたか

AWSは公式ブログにて、Amazon SageMaker HyperPod Inference Gatewayの一般提供開始を発表した。既存のHyperPod/EKSクラスターにEKSマネージドアドオンとして単一コマンドでインストールできるKubernetes対応の推論ルーティングシステムで、アプリケーション側のコード変更は不要とされる。

アーキテクチャは2層構造で、現在提供中のTier 1(クラスター単位のゲートウェイ)はEnvoy Gateway、リクエスト本文に基づくルーター(BBR)、Prometheus指標を参照してバックエンドを選定するEndpoint Picker(EPP)の3コンポーネントで構成される。EPPはKVキャッシュ使用率・キュー深度・LoRAアダプタ常駐状況・プレフィックスキャッシュヒット率・実行中リクエスト数を加重スコアリングして最適なポッドを選択する。Tier 2(グローバル推論ルーター)はクロスクラスター・クロスリージョン対応として今後提供予定とされている。

AWSが公開したベンチマーク結果によると、標準のKubernetesラウンドロビンとの比較で、混在GPU世代の環境でLlama-3.1-8BとQwen3-32Bの初期トークン遅延P95がそれぞれ97%・98%削減、バースト的トラフィック下ではLlama-3.1-70BのP99が98%削減された。一方、均一フリート・安定トラフィックの条件ではラウンドロビンと同水準の結果となっており、効果は運用環境の不均一性が高いほど大きいとブログは述べている。対象インスタンスはp5.48xlarge(H100)およびg5(A10G)で、8Bから235Bパラメータの4モデルを対象にテストが実施された。

原典ハイライト

AWSの公式発表では「チャットボットユーザーが初期トークンを得るまでの時間が4.4秒から800ミリ秒未満に短縮された」と具体例を示した。また、混在GPU世代環境でのQwen3-32Bはスループットが50%向上した一方、均一フリート・安定トラフィックでは効果が「測定誤差の範囲内」と明示されており、恣意的な過大評価を避けた記述になっている点が特徴的。

出典: AWS Machine Learning Blog(公式ブログ)

So What?(なぜ重要か)

LLM推論コストの大部分をGPUが占める中、デフォルトのKubernetesロードバランサーが引き起こす「稼働中のGPUへの集中」「アイドルGPUの放置」という構造的な無駄を、インフラ層で解消する手段が登場した。特にLoRAアダプタのスワップ遅延解消やプレフィックスキャッシュ活用は、複数モデル・アダプタを同一クラスターで運用する実際の本番環境で直接コスト削減に寄与しうる。アプリケーション無改修でアドオン追加のみ導入できる点は、既存システムへの適用障壁を低く保っている。

日本企業への示唆

AWS上でLLM推論を本番運用している日本企業・開発チームにとって、まず確認すべきは自社フリートの均一性とトラフィックパターンだ。ベンチマークが示す通り、混在GPU世代・バースト需要・共通プレフィックスという条件が重なる環境で効果が最大化される。チャット系・RAG系など共通プロンプト比率が高いユースケースでは特に導入メリットが大きい。一方、均一インスタンス・定常トラフィックの場合は改善幅が限定的であることをベンチマークが明示しており、自社ワークロードの特性を踏まえた費用対効果の事前評価が望ましい。Tier 2のクロスリージョンルーティングは今後の提供予定のため、マルチリージョン構成を検討中の場合はロードマップを継続モニタリングする必要がある。

背景・経緯

Kubernetesのデフォルトロードバランサーはラウンドロビンや最小コネクション数など汎用アルゴリズムを採用しており、GPU内部のKVキャッシュ状態やLoRAアダプタ常駐状況を把握しない。LLMのような長文生成・大容量メモリを要するワークロードでは、この「GPU内部不可視」が過負荷ポッドへのリクエスト集中と過剰プロビジョニングを招く課題として認識されていた。本ゲートウェイはKubernetes Gateway API公式のInference Extensionを基盤としており、オープンソース標準に準拠した実装とされている。