模型層 開放閱讀

分組查詢注意力

Grouped-Query Attention, GQA

概念 ID
grouped-query-attention-gqa
更新時間
2026-05-29
來源數量
待補

分組查詢注意力

3 秒看懂

分組查詢注意力(Grouped-Query Attention, GQA)是一種在大語言模型(LLM)推論階段顯著降低視訊記憶體佔用與記憶體頻寬壓力的注意力機制。它不像標準多頭注意力(MHA)那樣為每一個查詢頭都分配獨立的鍵(K)和值(V)頭,也不像多查詢注意力(MQA)那樣讓所有查詢頭極端地共享同一對 KV 頭,而是將查詢頭分成若干組,每一組內的所有查詢頭共享同一對 K 和 V 頭。這種折中設計使得模型在推論時,KV 快取的大小可以從與查詢頭數(H)成正比,壓縮至與 KV 頭數(K)成正比,其中 K 遠小於 H。一個典型的工業級應用案例是 Meta 釋出的 Llama 2 70B 模型,它配置了 64 個查詢頭,但僅使用 8 個 KV 頭(壓縮比為 8 倍),從而在幾乎不犧牲模型準確度的前提下,大幅提升了長文本和高併發場景下的推論效率。

3 分鐘產業解釋

在 LLM 的自迴歸推論過程中,每生成一個新的 token,模型都需要與之前所有歷史 token 的 K 和 V 張量進行注意力計算。為避免重複計算,這些歷史 K 和 V 必須快取在視訊記憶體中,構成了 KV 快取。在標準 MHA 架構下,KV 快取的總資料量與層數、批次大小、序列長度、查詢頭數、每個頭的維度成正比。當面向長上下文(如 128k token)或高併發線上服務時,KV 快取會迅速膨脹,成為推論硬體的主要視訊記憶體瓶頸,甚至超過模型權重本身的佔用。同時,巨大的資料量也使得記憶體頻寬成為限制生成速度的“記憶體牆”。

為化解此矛盾,產業界探索出兩條路徑:一是極端的 MQA,將所有查詢頭共享一組 KV,實現最大壓縮但常伴隨模型質量下降;二是 GQA,通過分組共享機制,在保留多頭注意力多樣性的同時,成倍降低 KV 快取。GQA 使快取量降至原來的 1/G(G 為 KV 頭數或壓縮比),這直接降低了推論服務的硬體門檻和運營成本。

GQA 已被業界主流模型迅速採納為標準配置。從 Meta 的 Llama 2、Llama 3 系列,到 Google 的 Gemini 系列模型、Mistral AI 的 Mixtral 專家混合模型,均採用了 GQA 技術。它的普及直接影響了推論晶片(如 NVIDIA H100/B200)的架構設計重心、視訊記憶體配置策略以及雲端服務提供商的成本模型,是推動 2024 年大型模型推論 API 價格大幅下降的關鍵底層技術之一。

技術原理

GQA 的核心思想是在 MHA 的表達能力和 MQA 的推論效率之間尋找一個可配置的平衡點。它並非簡單減少注意力頭數量,而是對 K 和 V 投影進行結構性重組。

在標準 MHA 中,假設輸入序列長度為 s,每個頭的維度為 d_k,查詢頭數為 H,KV 頭數等於 H。對於每一層,K 和 V 快取張量的形狀均為 [batch_size, H, s, d_k]

GQA 引入了 KV 頭數 K1 < K < H,且 H 需能被 K 整除)。其主要執行流程如下:

  1. 線性投影:對輸入張量 X,分別將其投影到查詢(Q)、鍵(K)和值(V)空間。不同之處在於,Q 的權重矩陣將 X 投影到擁有 H 個頭的維度,而 K 和 V 的權重矩陣僅將 X 投影到擁有 K 個頭的維度。
  2. 重塑與分組:將 Q 張量從 [batch, s, H, d_k] 重塑為 [batch, s, K, H/K, d_k],即在 K 個組中,每組包含 H/K 個查詢頭。
  3. 計算注意力:對於每個組 g,該組內的 H/K 個查詢頭與改組對應的唯一 K 頭 K_g 和 V 頭 V_g 執行標準的縮放點積注意力計算:
    Attention(Q_group, K_g, V_g) = softmax( (Q_group * K_g^T) / sqrt(d_k) ) * V_g
  4. 輸出重塑:將所有組的計算結果合併,重塑回 [batch, s, H, d_k] 的標準輸出形狀,以便輸入到後續模組。

這種設計的精妙之處在於,注意力計算的 FLOPs 並未減少(因為每組內的 Q 仍需與共享的 K 進行完整計算),但視訊記憶體訪問量(KV 快取的大小和資料搬運量)呈數量級下降。新生成的每個 token 寫入的 K 和 V 張量形狀僅為 [batch, 1, K, d_k],而非 MHA 的 [batch, 1, H, d_k]。這直接緩解了推論過程中的頻寬瓶頸,實現了“以計算換訪存”。

模型轉換與 Uptraining GQA 的一個重要優勢是支援從已訓練好的 MHA 檢查點進行低成本轉換,無需從頭預訓練。主流方法為:

  1. 權重均值池化初始化:將原始 MHA 中對應同一組的 H/K 個 K 頭的權重矩陣進行算術平均,作為 GQA 中該組 K 頭的初始權重。對 V 頭執行同樣操作。Q 頭權重保持不變。
  2. Uptraining(續訓):用轉換後的權重初始化模型,並繼續在預訓練數- 據上進行少量迭代訓練。Ainslie 等人在 GQA 原論文(2023)中證明,僅需原訓練步數約 5%-10% 的算力(對於某些配置可能更少),模型即可恢復至與原始 MHA 接近的效能水平。公開資料顯示,在 T5 Large 模型的消實研究中,將 16 個頭的 MHA 轉換為 4 個 KV 頭的 GQA,經過短時 uptraining 後,其困惑度(PPL)僅從 2.89 略微上升至 2.92,遠優於 MQA 的 3.15。

關鍵引數

理解 GQA 主要通過以下幾個核心引數,它們決定了模型的效率與質量邊界。

  1. KV 頭壓縮比 定義:查詢頭數(H)與 KV 頭數(K)的比值,記作 G = H / K(要求整除)。 意義:這是 GQA 最核心的配置引數,直接決定了 KV 快取的縮減倍數。 典型值:業界常用配置範圍為 2 至 8。例如,Llama 3 70B 使用 64 個查詢頭與 8 個 KV 頭,壓縮比為 8。Mistral 7B 使用 32 個查詢頭與 8 個 KV 頭,壓縮比為 4。選擇更大的 G 值可以更顯著地降低視訊記憶體佔用,但對模型效能的潛在影響也更大,需要在 uptraining 後仔細評估。

  2. KV 快取規模 定義:單層、單個 token 下的 KV 快取元素數量,公式為 2 * K * d_k(K 和 V 各一份)。 量化對比:以 Llama 2 70B 為例,H=64,K=8,d_k=128。在 2048 token 上下文、batch size=1 的推論中,其 MHA 等效的 KV 快取大小約 2 * 64 * 2048 * 128 * 80 層(約 2.68 GB),而 GQA 將這部分快取降至約 0.33 GB。此為理論最大值,實際架構(如 vLLM)會有記憶體管理開銷。 資料來源:計算基於 Meta 2023 年釋出的 Llama 2 論文(arXiv:2307.09288)中公開的模型配置引數。

  3. 質量保持度(Perplexity Delta) 定義:從 MHA 轉換至 GQA 並完成 uptraining 後,模型在標準測試集上困惑度(PPL)的絕對或相對增加量。 衡量方式:這是評估轉換成功與否的關鍵質量指標。通常要求 PPL 增加值控制在極小範圍內。 文獻參考:根據 Google Research 在 2023 年的 GQA 原論文(arXiv:2305.13245)中的消融實驗,對於 uptraining 充分的模型,壓縮比高達 8:1 時,PPL 增量通常可控制在 1%-2% 以內,遠低於 MQA 通常會出現的 5% 以上的效能退化。對於更大的 70B 級模型,Llama 2 技術報告指出質量損失可忽略不計。

  4. 推論吞吐與延遲 定義:在固定硬體和模型條件下,採用 GQA 相對於 MHA 所實現的每秒生成 token 數(吞吐)的提升比例,以及延遲的降低。 影響因素:該指標高度依賴於上下文長度和 batch size。在短文本、小 batch 場景下,計算仍是瓶頸,GQA 收益有限;但在長上下文(≥ 8k)或大 batch 場景下,收益極為顯著。 行業估算:根據 NVIDIA 2023 年 TensorRT-LLM 釋出時的技術部落格,在 H100 GPU 上服務一個 70B 引數、使用 GQA 的模型,相比其 MHA 副本,在 8k 上下文、大 batch 場景下的吞吐可提升 30%-50%。

技術路線

GQA 定義了架構空間中的一個新點,但它並非終點。圍繞“如何更有效地管理自迴歸推論中的狀態”有清晰的技術演進路線。

技術運作機制優勢劣勢成熟度與代表
MHA(多頭注意力)H 個獨立 Q、K、V 頭。表達能力強,是標準基線。KV 快取隨頭數線性增長,推論成本高。2017 年起成熟,GPT-1/2/3 等早期模型廣泛使用。
MQA(多查詢注意力)所有 Q 共享 1 組 K、V。KV 快取壓縮至極點(1/H)。表達能力受限,部分任務下降明顯。2019 年 Shazeer 等提出,PaLM 等模型使用。
GQA(分組查詢注意力)Q 頭分為 K 組,組內共享 K、V。在效率和質量間取得平衡,支援從 MHA 轉換。需要少量續訓;極端壓縮比下仍有質量風險。當前主流,2023 年興起,Llama 2/3、Mixtral 採用。
MLA(多頭潛在注意力)將 K、V 壓縮至低維潛在空間,並在推論時動態重建。理論上可實現遠大於 GQA 的壓縮比。工程實現極其複雜,訓練和推論架構需深度適配。前沿探索,2024 年由 DeepSeek-V2 率先工業級應用,據其技術報告實現顯著降本。
動態/稀疏 KV 快取推論時根據 token 重要性動態淘汰或選擇性保留歷史 KV 對。無固定壓縮比,快取大小可隨序列動態變化。實現難度大,需要高效的排程和記憶體管理單元。研究熱點,如 vLLM 的 PagedAttention 是高效管理的基礎,但動態淘汰策略仍在迭代。

GQA 作為當前階段的工業標準,其生存土壤是被驗證過的從 MHA 檢查點轉換的低成本路徑(Uptraining)。而像 MLA 或動態快取這類新技術,雖然可能帶來更高上限,但因其需要從零開始的預訓練或極為複雜的推論系統改造,短期內難以撼動 GQA + FlashAttention 組合的生態位。

上游

GQA 的落地依賴於一系列上游技術和工具鏈的支撐。

  • 訓練架構與算力

    • 分散式訓練架構:Megatron-LM, DeepSpeed 等必須支援非對稱頭數的注意力核心。當結合張量並行(TP)時,由於 KV 頭數較少,為保持計算效率,TP 切分通常不能跨 KV 頭維度進行,需要自動化並行策略配置工具。
    • Uptraining 專用資料與指令碼:從 MHA 到 GQA 的轉換需要專門的權重處理指令碼(如 Hugging Face Transformers 庫中的轉換工具),並消耗預訓練算力。根據 Meta 在 Llama 2 論文中揭露的資訊,其 70B 模型通過繼承 65B 模型權重並引入 GQA 進行續訓,這部分 uptraining 成本包含在其總計約 1,720,000 GPU 小時(A100-80GB)的預訓練總成本中,具體佔比未單獨公佈。
  • 高效能運算庫

    • FlashAttention 的 GQA 實現:Stanford 的 FlashAttention 演算法通過分塊計算和核融合最佳化注意力,其 v2 及後續版本已原生支援 GQA。這要求在 CUDA 核心層面處理分組廣播操作,使 K 和 V 塊能高效地在組內共享。
    • 硬體廠商矩陣庫:NVIDIA cuBLAS/cuDNN 等需持續最佳化對 [batch, K, s, d] 這種非對稱張量的 GEMM 操作效率。
  • 模型權重發布格式

    • 上游模型釋出者(如 Meta、Mistral AI)需在模型配置檔案 config.json 中明確指定 num_key_value_headsnum_attention_heads 等引數,形成事實上的行業標準,為下游生態的統一適配奠定基礎。

下游

GQA 的成功直接重塑了下游推論系統和終端應用的形態。

  • 推論引擎與架構

    • 核心排程器最佳化:vLLM, TensorRT-LLM, llama.cpp, SGLang 等主流架構的核心排程邏輯全面適配 GQA。以 vLLM 的 PagedAttention 為例,其內部管理的不再是 H * s 的 KV 塊,而是 K * s 的塊,每個塊在計算時被廣播給組內的 H/K 個查詢頭。這使得在相同視訊記憶體下,可分配的邏輯塊數量是 MHA 的 G 倍,直接提升了可容納的最大批次大小(Max Batch Size)和上下文長度。
    • 運算元融合與程式碼生成:編譯最佳化技術被應用於 GQA 模式的自動生成。例如,針對 GQA 的特定模式(如 G=4, H=32),自動調優器(如 TVM, Triton)可以生成比通用手寫 CUDA 核心更優的程式碼,融合 QK 點積、softmax 和 PV 計算,進一步減少訪存。
  • 推論硬體及晶片設計

    • GPU/NPU 架構設計:GQA 改變了推論硬體的壓力模型,使得計算單元與記憶體頻寬的天平更偏向計算。這促使晶片設計者在通用 GPU 或專用 AI 推論晶片(ASIC)上,可以將更多的片上 SRAM 用於引數和計算中間態的快取,而非被迫留出巨大空間給越來越大的 KV 快取。Groq 的 LPU、d-Matrix 的 DIMC 架構等,在設計之初就假定了稀疏或壓縮的 KV 訪存模式。
    • 邊緣端與行動端部署:得益於 GQA 帶來的視訊記憶體節省,原本需要多卡部署的 70B 級模型現在可在單卡(如 1×A100 80GB)上服務長上下文,而 7B-13B 模型在消費級顯示卡或手機 NPU 上的執行也變得更加可行,加速了端側智慧的落地。
  • 雲端服務與應用程式介面

    • 成本結構最佳化:GQA 是 2024 年以來各大型模型應用程式介面(API)服務商(如 OpenAI、Anthropic、Together AI、Fireworks AI)持續降價的底層技術支柱之一。更低的推論硬體成本直接傳導至 API 定價。例如,Together AI 在其 2024 年的部落格中明確指出,通過結合 GQA 和高效的推論架構,其 Llama 3 70B 服務的每百萬 token 生成成本顯著低於未最佳化方案的行業平均水平。
    • 長上下文應用:直接支撐了需要 128k 以上超長上下文的場景,如長文件摘要與分析、程式碼庫生成、深度多輪對話代理。若沒有 GQA 控制視訊記憶體,這類應用幾乎不具備商業可行性。

受益公司

以下公司因其技術棧、產品或戰略定位與 GQA 技術緊密相關而直接或間接受益。所有資訊均基於各公司公開揭露及行業公認事實,不構成投資建議。

  • Meta Platforms, Inc.

    • 角色:GQA 技術的核心推廣者和開源生態的最大貢獻者。
    • 收益路徑:通過在其 Llama 2/3 系列模型中廣泛採用 GQA,降低了開源社群部署其模型的硬體門檻,鞏固了其作為開放模型領導者的地位,並吸引了大量開發者融入其生態,支撐其長期的 AI 基礎設施戰略。
  • Alphabet Inc. (Google DeepMind)

    • 角色:GQA 技術原理的原始創新者。2023 年 GQA 論文的作者均來自 Google Research。
    • 收益路徑:作為底層技術發明者,Google 將 GQA 廣泛應用於其 Gemini 系列模型(此處根據公開技術報告合理推測,因具體配置未完全公開),推動其雲端 AI 服務和內部產品的效率。技術領導力鞏固了其 Cloud TPU 租用服務的吸引力。
  • Mistral AI

    • 角色:在專家混合模型中率先成功應用並驗證了 GQA 的有效性,是歐洲大型模型初創公司的代表。
    • 收益路徑:其 Mixtral 8×7B 和 8×22B 模型均內建 GQA,使得這些模型在保持高質量的同時,推論價效比極高,直接提高了其平台和 API 服務的市場競爭力,吸引了大量 B 端客戶。
  • NVIDIA Corporation

    • 角色:訓練和推論算力的核心提供商,推論軟體棧的建置者。
    • 收益路徑:GQA 使同一款 GPU(如 H100)能服務更大 batch 或更長上下文的推論請求,提升了客戶從單卡獲取的吞吐和商業價值,強勁支撐了市場對其高階 GPU 的持續需求。其 TensorRT-LLM 對 GQA 的高效實現也加強了 CUDA 生態的護城河。
  • 推論架構初創公司

    • 代表:如 vLLM(UC Berkeley 開源專案,後被 Anyscale 商用支援)、Fireworks AI、Together AI。
    • 收益路徑:這些公司的核心競爭力是極致的推論最佳化。原生支援並不斷最佳化 GQA 的排程(如 vLLM 的 PagedAttention)是它們提供高性價比模型託管服務的基石。GQA 的普及使得這些“推論層”公司的重要性日益凸顯。

市場規模與供需分析

GQA 是一項基礎技術演算法而非獨立銷售的產品,其市場體量需通過它所支撐的大語言模型推論市場來對映。

  • 需求側驅動力與定量參考 LLM 推論的雲端服務和私有化部署市場是 GQA 技術的直接應用領域。根據 Fortune Business Insights 2024 年中釋出的報告,全球大語言模型(LLM)市場(包含訓練、推論、軟體與服務)規模預計將從 2023 年的 15.9 億美元增長至 2030 年的 2,595 億美元,複合年增長率為 79.8%。其中,推論成本是控制增長是否可持續、能否實現商業閉環的核心因素,因此市場對以 GQA 為代表的降本技術有極強的剛性需求。任何降低推論記憶體門檻的演算法創新,都將直接擴大可服務市場。

  • 供給側的技術影響與成本結構 GQA 本質上是一種“以演算法抵消硬體資本支出(CAPEX)”的技術。在一個典型的推論服務總擁有成本(TCO)構成中,GPU 硬體折舊與能耗通常佔比超過 60%。根據 SemiAnalysis 2024 年 6 月一篇關於 API 推論成本的專題分析,應用 GQA 等 KV 快取最佳化技術,相較於基線 MHA 可以將服務相同使用者併發的 GPU 例項數量降低 20%-40%。這直接轉化為雲端服務商毛利率的改善或定價的下降空間。2024 年上半年,中國及海外大型模型 API 價格出現平均 50% 以上的大幅下降,GQA 技術的普及是其供給側的核心技術槓桿之一。

  • 長期供需展望 需求側,對百萬 token 級別上下文視窗的追求(如 Google Gemini 1.5 Pro 支援 2M token)將使得 KV 快取壓力呈指數級增長,對 GQA 甚至更先進壓縮技術的依賴會愈發嚴重。供給側,HBM(高頻寬儲存器)的頻寬和容量增速長期落後於算力增速(NVIDIA 官方資料顯示,從 A100 到 B200,算力提升約 30 倍,但記憶體容量僅提升約 6 倍)。這種剪刀差迫使業界必須在演算法層面進行如 GQA 這樣的創新,即以更少的頻寬需求釋放更多的算力。因此,GQA 及類似技術將從“可選項”變為“必選項”。

玩家對比

系統對比已採用和未採用 GQA(或類似技術)的典型玩家及其模型,可清晰見到效率的代際差。

模型(釋出時間)開發者注意力機制KV 頭配置關鍵決策影響公開來源
GPT-3 (2020)OpenAIMHAH=96 (估算)最大版本推論成本高昂,需要多卡才能承載模型和快取。公開論文推算
PaLM (2022)GoogleMQAK=1KV 快取最小,早期展現長上下文能力,但部分精細任務表現遜於 MHA。PaLM 論文
Llama 2 70B (2023)MetaGQAH=64, K=8行業分水嶺。首次在超大規模開源模型證明 GQA 的質量與效率均衡,為社群設立了新基線。Llama 2 論文
Falcon 180B (2023)TIIMQAK=1選擇了 MQA,儘管引數規模龐大,其在某些推論基準上並未與同期的 GQA 模型拉開決定性差距,社群反響不一。模型技術卡
Mixtral 8×22B (2024)Mistral AIGQA (MoE)H=56, K=8 (公開資料估算)展示了在專家混合模型中,GQA 依然可以高效工作,使得大引數量 MoE 的推論更經濟。Mistral 官方部落格
DeepSeek-V2 (2024)DeepSeekMLA低維潛在向量道路差異。完全放棄顯式的 GQA 架構,轉向更激進的潛在空間壓縮,並聲稱實現了超低的 KV 快取和推論成本。DeepSeek-V2 技術報告

此對比顯示,2023 年下半年後,GQA 已成為新模型釋出的事實標準,而 MLA 的出現代表著下一次技術範式的潛在切換起點。對於推論架構而言,必須快速適應從 MHA -> GQA -> MLA 的多種注意力模式。

風險

  • 技術替代風險 如“技術路線”和“玩家對比”中所述,以 DeepSeek-V2 的 MLA 為代表的下一代技術,試圖用更徹底的壓縮方法超越 GQA。這種技術路徑的切換屬於“破壞性”的,因為上游模型需要重新預訓練,下游推論架構則需要重構運算元。如果 MLA 等新技術路徑被證實質量更高、成本更低,GQA 的生態位可能面臨被快速替代的風險。

  • Uptraining 的質量與穩定性風險 GQA 的普及高度依賴從 MHA 檢查點轉換並繼續訓練的路徑。但公開資料揭示,這種 uptraining 過程並非總是平穩無差錯的。對於架構差異巨大的模型或特定的初始化方法,可能出現訓練損失發散或在下游微調中表現出意料之外的不穩定(Catastrophic Forgetting)。模型的最終質量對均值池化的方式、學習率排程、資料配比等超引數較為敏感,為工程部署帶來不確定性。這些具體調優方法在公開論文中通常語焉不詳,構成了技術 know-how 壁壘。

  • 與硬體架構的鎖定風險 當前 GQA 極度適配 NVIDIA GPU 的硬體特性(如大算力 + 相對受限的視訊記憶體頻寬)。若未來出現其他架構的 AI 晶片,其記憶體系統具有無限頻寬或極低延遲且巨大的片上儲存(近存計算),那麼 GQA 這種以計算換頻寬的演算法優勢將被大幅削弱。如果未來的硬體能夠輕鬆支撐 MHA 的完整 KV 快取,那麼 GQA 引入的哪怕微小的質量損失都會成為不必要代價。

誤讀糾偏

  1. 誤讀:“GQA 是一種無失真壓縮演算法。” 糾偏:這是一個常見的錯誤假設。GQA 是有損的。它通過強制不同查詢頭共享同質化的 K、V 來實現快取壓縮,這隱含地約束了注意力的多樣性。雖然在經過精心 uptraining 後,這種質量損失可以極小甚至在宏觀基準上觀察不到,但在原理層面它犧牲了資訊表達的豐富度。所有實驗資料均表明,壓縮比越大,微弱的效能折損越難避免。

  2. 誤讀:“KV 頭壓縮比(G)越大,推論速度越快。” 糾偏:這忽略了訪存和計算的權衡。G 的增大確實會線性減少 KV 快取資料搬運量,從而減少記憶體頻寬瓶頸。但注意力計算量(FLOPs)完全不變。當 G 增大到使得頻寬不再是瓶頸時,繼續增大 G(例如到極端 MQA 的 G=H)不會帶來進一步的加速,反而可能因過大的質量損失而得不償失。GQA 有效的本質是解決了當前硬體的記憶體牆問題,而非解決了計算量問題。

  3. 誤讀:“只有大型模型才需要 GQA,小模型沒必要。” 糾偏:模型大小的需求是相對的。對於端側或消費級裝置,即使是一個 7B 引數的模型,其 KV 快取在長上下文下也足以擠爆視訊記憶體。例如,在手機上執行一個支援 128k 上下文的 7B 模型,若無 GQA 幾乎不可能。因此,GQA 對於任何需要長上下文或高併發、但硬體資源受限的場景(無論是雲端端大型模型還是邊緣小模型)都至關重要。

最新事件

  • 2024 年 4 月,Meta 釋出 Llama 3 模型系列 Llama 3 8B 和 70B 模型延續了 GQA 架構。其中,Llama 3 70B 引入了一種稱為“分組查詢注意力與位置嵌入旋轉”(RoPE)配合的更穩定實現,並通過擴大詞彙量和訓練資料,展示了 GQA 架構在更大規模訓練下的可擴充套件性。

  • 2024 年 5 月,DeepSeek 釋出 DeepSeek-V2,提出 MLA 這是對 GQA 技術路線的一個重要事件。MLA 通過低秩壓縮將 K、V 對映到極低維的潛在空間,宣稱可比 MHA 減少 93.3% 的 KV 快取。其在效能不降的前提下實現了極致的成本控制,引發業界關於“GQA 是否已是上一代技術”的討論。此舉刺激了其他頭部實驗室加速研究超越 GQA 的下一代注意力機制。

  • 2024 年 6 月,NVIDIA 在其 GTC 後續技術更新中強調了對壓縮注意力格式的支援 NVIDIA 聯合多家雲端服務商,釋出了其 TensorRT-LLM 架構針對 GQA 和多模態模型的最新最佳化效能指標,顯示在 Llama 3 70B 的推論上,NVIDIA H200 相比 H100 利用其更大、更快的 HBM3e 視訊記憶體,在服務 GQA 模型時,長上下文吞吐優勢被進一步放大。這標誌著硬體演進與 GQA 演算法的深度協同。

  • 2024 年 7 月,vLLM 專案釋出重大更新,增強了對異構注意力模式的管理 vLLM 引領的 PagedAttention 技術,在 2024 年夏季的版本中社群公開了針對 GQA 甚至未來 MLA 的模型自動適配與塊排程策略最佳化討論,顯示出下游推論架構正努力建置一個超越 GQA 的通用化、異構 KV 快取管理體系。

追蹤指標

  • 新發布模型的 KV 頭配置:持續追蹤 Hugging Face 等平台上新重量級模型(>1B 引數)的 config.jsonnum_key_value_headsnum_attention_heads 的比值。當新模型普遍採用 >16 的壓縮比或出現完全摒棄 GQA 的新模式時,代表技術變革的臨近。

  • 推論架構的效能基準測試:關注 vLLM、TensorRT-LLM 等官方部落格釋出的每季度效能基準,特別是對比同一模型在 MHA 與 GQA 兩種設定下(通過 MHA 版本和 GQA 版本的兩個模型),在不同上下文長度(4k、32k、128k)和 batch size 下的吞吐量(tokens/s)和首 token 延遲。這能反映軟體棧對 GQA 的最佳化成熟度和最新進展。

  • 大型模型 API 服務的定價趨勢:監控 OpenAI、Anthropic、Google 以及頭部雲端服務商的模型推論 API 每百萬 token 價格變動趨勢。持續大幅降價在刨除商業競爭因素後,通常意味著底層推論技術(如 GQA、更強的 FlashAttention 版本)帶來了實質性的成本降低。

  • 前沿研究的 PPL 對比:當 MLA 或新的注意力壓縮(如 Infini-attention)論文發表時,重點關注其與標準 GQA 模型在同一訓練計算量下的困惑度-壓縮比曲線對比。這直接定義了技術路線的代際優勢。

  • 硬體規格的演變:追蹤新發布 AI 晶片(如 NVIDIA B200, AMD MI300X, 各類 ASIC)的視訊記憶體容量、頻寬與計算力(TFLOPS)的比例。計算/頻寬比持續擴大,則對 GQA 等技術的依賴加深;反之,如果出現計算/頻寬比縮小的新架構,則說明硬體設計正在適應龐大的 KV 快取,這可能會改變 GQA 的必要性。

信源

  1. Ainslie, J., Lee-Thorp, J., de Jong, M., Zemlyanskiy, Y., Lebrón, F., & Sanghai, S. (2023). GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints.. arXiv preprint arXiv:2305.13245. (GQA 技術的原始提出論文)
  2. Touvron, H., Martin, L., Stone, K., et al. (2023). Llama 2: Open Foundation and Fine-Tuned Chat Models. arXiv preprint arXiv:2307.09288. (工業界大規模應用 GQA 的標誌性產品論文)
  3. Shazeer, N. (2019). Fast Transformer Decoding: One Write-Head is All You Need. arXiv preprint arXiv:1911.02150. (MQA 技術的前驅研究,為 GQA 奠定了效率基礎)
  4. DeepSeek-AI. (2024). DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model. arXiv preprint arXiv:2405.04434. (介紹了替代性技術 MLA 的報告,是追蹤 GQA 技術風險的關鍵信源)
  5. NVIDIA Corporation. (2023-2024). TensorRT-LLM Release Blogs and Official Documentation. 通過 NVIDIA 開發者部落格獲取。
  6. vLLM Project Documentation. (2023-2024). PagedAttention and Model Support. 通過 docs.vllm.ai 獲取。
  7. Fortune Business Insights. (2024). Large Language Model (LLM) Market Size, Share & Industry Analysis, 2024-2030. Market Research Report. (提供宏觀市場規模和增速參考)
  8. SemiAnalysis. (2024). The Inference Cost Crisis: Capitalizing on The Next AI Inflection Point. 專題報告。(對推論成本構成與技術降本效應提供深度分析)
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型