AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

グループクエリアテンション(GQA:Grouped Query Attention)とは?意味・仕組みと日本企業への示唆

公開:2026年8月29日, 最終更新:2026年9月1日

グループクエリアテンション(GQA:Grouped Query Attention)は、Transformerモデルの自己注意機構において、複数のクエリヘッドをグループ化し、グループ内でキーと値のヘッドを共有する手法です。推論時のメモリ効率と処理速度を改善する目的で設計されており、現在多くの主要な大規模言語モデル(LLM)に採用されています。

概要

GQAは、従来のMulti-Head Attention(MHA)とMulti-Query Attention(MQA)の中間に位置する、一般化された注意機構のアーキテクチャです。2023年5月にGoogleの研究者らによってarXiv(論文番号:2305.13245)で発表され、同年の自然言語処理国際会議「EMNLP 2023」に採択されました。

MHAではクエリ・キー・値のすべてのヘッド数が同数であるのに対し、MQAではすべてのクエリヘッドが単一のキー・値ヘッドを共有します。GQAはその中間として、クエリヘッドをいくつかのグループに分割し、グループ単位でキーと値のヘッドを共有する設計を採ります。グループ数をクエリヘッド数と同数にすればMHAと等価に、グループ数を1にすればMQAと等価になるため、「一般化された」手法と位置づけられています。

仕組み・ポイント

KVキャッシュの削減によるメモリ効率化

推論時、モデルは過去トークンのキー・値情報をキャッシュ(KVキャッシュ)として保持します。MHAではクエリヘッド数と同数のキー・値ヘッドが必要なため、このキャッシュが大きくなりメモリ帯域幅のボトルネックになります。GQAはキーと値のヘッド数をクエリヘッド数より少なく抑えることで、KVキャッシュのサイズを削減し、このボトルネックを緩和します。

品質と速度の両立

MQAはキャッシュを最小化できる一方で、すべてのクエリが単一のキー・値ヘッドを共有するためモデルの表現力が低下するリスクがあります。GQAはグループ単位での共有にとどめることで、MQAほどの品質低下を招かずに、MHAと比べた推論高速化とメモリ節約を実現します。

既存モデルからの変換(Uptraining)

MHAで事前学習済みのモデルのチェックポイントから、元の事前学習計算量の約5%という少量の追加学習を行うだけでGQAモデルへ変換できる「Uptraining」という手法も提案されています。これにより、既存のモデル資産を活用したままGQAの恩恵を得ることが可能です。

なぜ今注目されているのか

GQAはすでに理論的な提案にとどまらず、Llama 2(大型モデル)、Llama 3(8Bなど)、Qwen3、Gemma 3、Mistral、SmolLM3、Tiny Ayaといった現在広く利用される主要LLMのアーキテクチャとして標準的に採用されています。LLMの推論コストや実行環境のリソース制約がビジネス上の重要課題となるなか、GQAはモデルの品質を大きく損なわずにインフラコストを抑える実践的な技術として定着しつつあります。

日本企業への示唆

GQAを採用したモデルは推論時のメモリ消費と処理時間を抑えられるため、オンプレミス環境やローカル実行など、クラウドリソースに制約がある環境でのLLM活用においてコスト効率上の優位性があります。自社システムへのLLM組み込みを検討する際、採用モデルがGQAを実装しているかどうかはインフラ設計の前提条件として確認すべき要素の一つです。また、MHAモデルからGQAモデルへのUptrainingが比較的少ない計算コストで行える点は、既存の学習済みモデルを持つ組織にとっても選択肢として意識しておく価値があります。なお「GQA」という略称は画像質問応答のデータセットを指す場合もあり、技術文書や論文を参照する際には文脈の確認が必要です。


※ 本ページはAI News JAPAN編集部が最新の動向を踏まえて解説したものです。内容は随時見直します。