公開:2026年9月12日, 最終更新:2026年9月12日
KVキャッシュ対応プレフィックスルーティング(Prefix-aware Routing)は、LLMの分散推論において、共通のプロンプト先頭部分(プレフィックス)を持つリクエストを、そのKVキャッシュをすでに保持しているサーバーへ優先的に送り届ける負荷分散技術である。これにより、毎回発生していたPrefill(事前計算)処理を省略し、初回トークン生成時間(TTFT)の大幅な削減と計算コストの削減を両立する。
概要
LLMの推論では、Prefillフェーズで生成されるKey-Value Cache(KVキャッシュ)を再利用することで、TTFTを大幅に短縮できる。しかし従来のラウンドロビン方式などの一般的なロードバランサは、各サーバーのキャッシュ保持状態を考慮せずにリクエストを振り分けるため、同一のシステムプロンプトや会話履歴を持つリクエストでも毎回Prefillが発生し、キャッシュが無駄になっていた。
Prefix-aware Routingはこの課題を解決するアプローチである。ルーターがリクエストのプレフィックスを解析し、最長一致するKVキャッシュを保持しているインスタンスを特定して優先送信することで、キャッシュ再利用率を最大化する。システムプロンプト、指示文、会話履歴、RAGの参照文書など、複数リクエストにわたって共通するプロンプト先頭部分が長いほど、効果が大きくなる。
仕組み・ポイント
ルーティングの動作原理
ルーターはリクエストのプロンプト先頭部分をHashTrieやRadix Treeなどのデータ構造で管理し、どのサーバーインスタンスがどのプレフィックスのKVキャッシュを保持しているかをリアルタイムに追跡する。最長一致するキャッシュを持つインスタンスを特定し、そこへリクエストを集約することでキャッシュヒット率を高める。
負荷分散とのトレードオフと対策
キャッシュの局所性(Cache Locality)を優先しすぎると、特定のサーバーへ負荷が集中するリスクがある。多くのシステムでは、キューの長さを監視し、負荷の不均衡が閾値を超えた場合はPower of Two Choicesなどの通常の負荷分散アルゴリズムにフォールバックするマルチティア戦略が採用されている。
主な実装例
- vLLM Production Stack:Automatic Prefix Caching(APC)と連携し、同一プレフィックスを持つリクエストを同一インスタンスへルーティング
- Ray:`PrefixCacheAffinityRouter` として実装、負荷分散とキャッシュ局所性のバランスを制御
- llm-d:モデルサーバーからリアルタイムに送信されるKVキャッシュイベントを追跡するEndpoint Picker(EPP)コンポーネントとして提供
- Amazon SageMaker Inference:prefix-aware routingを導入(2026年9月発表)
- GKE Inference Gateway:Prefix Cachingと連携したインテリジェントルーティングを提供
- Ranvier:オープンソース実装として提供
なぜ今注目されているのか
LLMの本番環境での利用拡大に伴い、推論コストとレイテンシの最適化は経営上の優先課題となっている。RAGや長い会話履歴を前提とするAIエージェント、あるいはマルチターン対話アプリケーションでは、リクエスト間で共有されるプレフィックスが長く、Prefix-aware Routingの恩恵が特に大きい。
実証データもその効果を裏付けている。Amazon SageMakerではLlama 3.1 70BのベンチマークでP50 TTFTを最大77%削減、llm-dではキャッシュヒット率87.4%・TTFTを約88%高速化(約340msに短縮)・繰り返しプロンプトの計算コストを約70%削減、RanvierではP99レイテンシを79〜85%削減という数値が示されている。主要クラウドプロバイダーやオープンソースフレームワークが相次いで実装を提供し始めており、LLM推論基盤の標準的なコンポーネントとして位置づけられつつある。
日本企業への示唆
LLMを業務に組み込む日本企業にとって、同一のシステムプロンプトや社内文書を多数のリクエストで共有するユースケース(社内チャットボット、RAGを活用した問い合わせ対応、AIエージェントなど)ではPrefix-aware Routingの導入によって推論コストとレイテンシを大幅に改善できる可能性がある。vLLMやRayなどのオープンソースフレームワーク、あるいはAmazon SageMakerなどマネージドサービス上でも利用できるため、自社の推論基盤の構成に応じて選択肢を検討できる。一方で、負荷集中リスクを避けるためにフォールバック戦略の設定が不可欠であり、導入時はキャッシュ局所性と負荷分散のバランスをチューニングする運用設計が求められる。
※ 本ページはAI News JAPAN編集部が最新の動向を踏まえて解説したものです。内容は随時見直します。


