AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

KVキャッシュをランダム削除するだけで推論スループットが最大43%向上――arXiv論文

30秒サマリー

  • LLMの長い推論チェーンで生じるKVキャッシュのメモリ不足を、スコアリング不要のランダム削除で解決する手法を提案。
  • 4モデル・6タスクで既存の最強手法と同等の精度を維持しつつ、vLLMデプロイ環境でスループットを32〜43%上回った。
  • 「プロンプト部分さえ保護すれば、推論トレースは冗長性で自己保護される」という新知見が根拠となっている。

何が起きたか

arXivに2026年9月3日付で投稿された論文「Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning」は、LLMの推論タスクにおけるKVキャッシュ圧縮の新手法を報告している。著者はHeng Wang氏ら10名で、所属先等の詳細は原文には記載がない。

既存のKVキャッシュ圧縮手法は、将来の重要度を何らかの指標でスコアリングし、上位トークンを保持するという共通パラダイムをとる。論文はこのスコアリング信号がほぼ無意味であることを実験で示し、「Random Attention」と名付けた手法を提案した。同手法はプロンプト部分のキャッシュをそのまま保持し、各アテンションヘッド内で残りのトークンを一様ランダムに削除する。スコア計算を一切行わない。

4種のモデルと6種の推論タスクを対象にした評価では、既存の最強エビクタと同等の精度を達成しながら、vLLMデプロイ環境でのスループットを32〜43%上回ったと論文は述べている。この結果の説明として、(1)キャッシュの「脆弱な部分」はプロンプトであり、既存手法間の精度差はプロンプトを保持できたかどうかにほぼ起因する、(2)推論トレース(思考の連鎖)はテキスト上の言い換えとアテンションヘッド間の分散コピーという2層の冗長性により自己保護されているため、ランダム削除でも必要な情報が十分残る、という2点が示されている。コードは公開済みとされている。

原典ハイライト

論文の核心は「スコアリング信号はほぼ寄与しない」という主張。プロンプトを保護し残りをランダム削除するだけで、4モデル・6タスクにわたり既存最強手法と同精度を保ちつつvLLMスループットを32〜43%向上できると報告している。

出典: arXiv cs.CL(論文)

So What?(なぜ重要か)

この研究が正しければ、LLMの長文推論(Chain-of-Thought)を本番運用する際にKVキャッシュの精巧なスコアリング機構を設計・維持する必要がなくなる可能性がある。実装が単純な分、デプロイコストと計算オーバーヘッドの削減効果が大きく、同一GPUリソースで処理できるリクエスト数を大幅に増やせるとみられる。ただし、本論文はarXivへの投稿段階であり、査読を経た成果ではない点に留意が必要。

日本企業への示唆

LLMをAPIではなく自社インフラで運用している企業や、推論コスト削減を検討しているMLエンジニアにとって、実装難度が低い高効率化手法として注目に値する。vLLMを使用している環境であれば、プロンプト保護+ランダム削除というシンプルな変更でスループット向上を検証できる可能性がある。ただし、論文はまだ査読前のプレプリントであるため、自社タスクへの適用可否は独自検証が前提となる。

背景・経緯

LLMが長い推論チェーン(Chain-of-Thought)を生成する際、KVキャッシュがメモリボトルネックになる問題は広く認識されており、重要トークンを選別して保持するキャッシュ圧縮手法が複数研究されてきた。本論文はそのパラダイム自体を問い直す位置づけにある。