公開:2026年9月5日, 最終更新:2026年9月5日
動的スパースアテンション(Dynamic Sparse Attention: DSA)は、大規模言語モデル(LLM)の中核技術であるTransformerの自己注意機構において、入力内容に応じて計算対象トークンを動的に絞り込むことで、計算量とメモリ消費を大幅に削減する技術である。長文脈処理のコスト問題が顕在化するなか、実用的なLLM推論の効率化手法として急速に注目を集めている。
概要
Transformerの自己注意機構は、入力シーケンス長 $N$ に対して $O(N^2)$ の計算複雑度を持つため、長文脈になるほどコストが爆発的に増大する。DSAはこの問題に対し、クエリや入力文脈に応じて「注意を向けるべき重要なトークン」を動的に選択し、選ばれた少数のトークンに対してのみアテンション計算を実行する。これにより計算複雑度を $O(N \cdot K)$($K \ll N$)まで削減できる。
LongformerやBigBirdなど従来の静的スパースアテンション手法が、近傍トークンやグローバルトークンといった固定パターンを使用していたのに対し、DSAは入力データや文脈に応じて選択パターンを学習・決定するため、情報の損失が少なく高い表現力を維持できる点が本質的な違いである。
仕組み・ポイント
DSAの処理は「Select-then-Compute(選択してから計算)」というワークフローに基づく。
- Lightning Indexer(ライトニング・インデクサー): クエリトークンと先行トークンの関連性を予測する軽量なスコアリング機構。密なアテンションがどこに注目するかを予測するよう、蒸留などの手法で事前学習される。
- Top-K選択: インデクサーが算出したスコアに基づき、最も関連性の高い上位 $K$ 個のトークン(Key-Valueエントリ)のみを動的に選択する。例えば128Kのコンテキスト長において、約1.6%のトークンのみを選択してアテンション計算を行うことが可能とされる。
- スパースアテンション計算: 選択された少数のKVキャッシュに対してのみ高精度なアテンション計算を実行する。
一方で、トークン依存の動的な選択パターンはKVキャッシュへのアクセスを不規則にし、GPUのキャッシュ局所性低下やデコードスループットの低下といったシステム上のボトルネックも生じる。これに対し、階層的なHBM-DRAM管理によって推論を高速化するSparseServe や、DSAの選択パターンをKVキャッシュの追い出し(Eviction)に活用してメモリ容量を一定に保つLinear DSA といった補完的な手法も提案されている。
なぜ今注目されているのか
2021年に基礎的な手法が提案されたDSAが実用段階に入ったのは、DeepSeek-AIが2025年12月にリリースした「DeepSeek-V3.2」での採用がひとつの転機となった。独自の「DeepSeek Sparse Attention (DSA)」を導入し、長文脈シナリオにおける計算コストの大幅な削減を実証した。DeepSeekはKVキャッシュ圧縮技術であるMulti-Head Latent Attention (MLA)とDSAを組み合わせており、両技術の相乗効果によるメモリ効率化が注目された。
さらに2026年3月にはIntelのNoam Levy氏によるシステムレベルの詳細分析論文が発表され、同年8月にはNVIDIA cuDNN FrontendにDSAモジュールが統合され、HopperおよびBlackwellアーキテクチャ向けの最適化カーネルが提供されるに至った。ハードウェアとソフトウェアの両面でエコシステムが整備されつつある段階にある。
日本企業への示唆
DSAは長文脈処理のコストを根本から削減できる技術であり、大量の契約書・社内文書・カスタマー対応ログを扱うユースケースでのLLM活用コスト低減に直結する可能性がある。NVIDIA cuDNNへの統合により、既存のGPUインフラ上での利用障壁が下がりつつある点は、推論基盤を自社運用する企業にとって注目に値する。ただし、KVキャッシュの不規則アクセスに起因するシステムボトルネックは依然として課題であり、SparseServeのような管理システムとの組み合わせも含めた導入設計が求められる。MLAなど関連技術との組み合わせによる効果も含め、自社のコンテキスト長・ユースケースに合わせた技術選定の見極めが重要である。
※ 本ページはAI News JAPAN編集部が最新の動向を踏まえて解説したものです。内容は随時見直します。


