模型層 開放閱讀

多查詢注意力

Multi-Query Attention, MQA

概念 ID
multi-query-attention-mqa
更新時間
2026-05-29
來源數量
待補

多查詢注意力

3 秒看懂

一句話定義:Multi-Query Attention (MQA) 是一種通過對所有 Query 頭共享同一組 Key/Value 投影,將 Transformer 推論時的 KV Cache 視訊記憶體佔用降至原有的 1/h(h 為注意力頭數),從而在幾乎不損失模型精度的前提下,大幅降低長序列推論延遲與硬體成本的架構最佳化技術。

核心價值:MQA 直擊大型模型推論的“長序列瓶頸”——KV Cache 的視訊記憶體頻寬壓力。它所節省的視訊記憶體可直接轉化為更大的批次規模(batch size)、更長的上下文視窗或更低的 GPU 配置需求,是推動百億至千億引數模型走向高效部署(尤其是端側與長上下文場景)的關鍵架構決策之一。

技術定位:MQA 屬於注意力機制的架構級系統最佳化,而非傳統意義上的模型壓縮(如剪枝、量化)。它在模型設計階段即完成改造,訓練與推論全程使用同一結構,無需事後轉換。

3 分鐘產業解釋

類比理解

想像一個大型翻譯團隊正在處理一份數千頁的檔案。在傳統模式下,每位譯員擁有自己獨立的參考書架和筆記本(相當於 MHA 中每個注意力頭都有獨立的 Key/Value 投影),雖然檢索便利但佔據巨大空間。

MQA 的做法是:讓所有譯員共用同一個參考書架和筆記本。每位譯員仍然有自己的提問方式(Query 保持獨立),但獲取資訊的來源完全相同。這雖然在某些複雜段落上可能略微降低譯文的個性化程度,但節省了 90% 以上的書架空間,使整個團隊可以在更經濟的場地中執行。

產業影響鏈條

1. 推論成本結構化降低:對於雲端端模型推論平台,KV Cache 是佔據 GPU 視訊記憶體的最大單一開銷之一(在長序列場景下可佔總視訊記憶體的 30%-60%)。MQA 將這部分開銷縮減為原來的 1/h(以 32 頭注意力計算,可降低約 97%)。據公開技術部落格與實踐報告估算(來源:Meta LLaMA 2 技術報告 2023、Anthropic 技術訪談),這可使單 GPU 上的服務吞吐量提升 2-4 倍,對應單位 token 推論成本下降幅度相當。

2. 長上下文能力的物理基礎:根據公開技術報告(Anthropic 2023、Meta 2024),當前大型模型競相支援 128K 乃至 1M token 的上下文視窗。若無 MQA/GQA 的 KV Cache 壓縮效果,儲存這些長序列的中間狀態所需視訊記憶體將極為龐大。MQA 是長上下文模型經濟可行性的核心使能技術之一。

3. 端側部署的前提條件:以 7B 引數規模模型、16 位浮點精度為例,在高通驍龍 8 Gen 3(2023 年釋出)等移動平台上,可用記憶體頻寬約為 50-80 GB/s,遠低於資料中心 GPU 的 HBM 頻寬。如仍採用 MHA,長序列推論時的 KV Cache 訪問將嚴重溢位可用頻寬。MQA 將 KV 讀取量壓縮一個數量級,是端側大型模型從“能夠執行”到“流暢可用”的關鍵分水嶺(來源:高通 AI Engine 公開技術文件 2024)。

4. 標準化的行業趨勢:自 2023 年以來,採用 MQA 或 GQA 已是主流開源與商業大型模型架構方案的“預設選擇”。未採用該技術的模型,在同等引數規模下,推論效率和硬體適配能力處於明顯競爭劣勢。

技術原理

基礎回顧:標準多頭注意力 (MHA)

在標準 Transformer 的每個注意力層,輸入隱狀態 X ∈ R^(seq_len × d_model) 經過線性投影,為 h 個注意力頭分別生成獨立的 Query、Key、Value:

Q_i = X · W_Q^i    (i = 1, 2, ..., h)  維度:(seq_len, d_head)
K_i = X · W_K^i                        維度:(seq_len, d_head)
V_i = X · W_V^i                        維度:(seq_len, d_head)

其中 d_head = d_model / h。每個頭的注意力輸出為:

Head_i = Softmax(Q_i · K_i^T / √d_head) · V_i

最終輸出為 h 個頭的拼接後經線性投影調整維度。

MQA 的結構改造

MQA 的修改集中在 Key 和 Value 的生成環節——不再為每個注意力頭獨立投影,而是僅保留一組共享的 K、V:

Q_i = X · W_Q^i    (i = 1, 2, ..., h)   # h 個獨立的 Q 投影不變
K   = X · W_K                            # 唯一的 K 投影
V   = X · W_V                            # 唯一的 V 投影

此時每個頭的注意力計算變為:

Head_i = Softmax(Q_i · K^T / √d_head) · V

關鍵差異點:雖然表示式形式相近,但每個頭使用的是同一組 K 和 V,而非各自獨立的版本。這從根本上改變了 KV Cache 的儲存結構。

KV Cache 結構與視訊記憶體佔用對比

MHA 的單層 KV Cache 儲存(每個頭獨立儲存對應的 K、V):

Layer l:
  Head_1: K_1 [seq, d_head]  V_1 [seq, d_head]
  Head_2: K_2 [seq, d_head]  V_2 [seq, d_head]
  ...
  Head_h: K_h [seq, d_head]  V_h [seq, d_head]

總元素數 = 2 × h × seq_len × d_head = 2 × seq_len × d_model
總位元組數 (FP16) = 4 × seq_len × d_model

MQA 的單層 KV Cache 儲存(所有頭僅存一份 K、V):

Layer l:
  Shared: K [seq, d_head]   V [seq, d_head]

總元素數 = 2 × 1 × seq_len × d_head = 2 × seq_len × (d_model / h)
總位元組數 (FP16) = 4 × seq_len × (d_model / h)

壓縮比:相比 MHA,KV Cache 大小縮減為 1 / h

以典型模型引數為例(假設 d_model = 4096h = 32seq_len = 8192layers = 32):

  • MHA:單層約 4 × 8192 × 4096 = 134 MB,全部 32 層約 4.2 GB
  • MQA:單層約 4 × 8192 × 128 = 4.2 MB,全部 32 層約 134 MB

以上為單條序列的理論估算(來源:推導自《Fast Transformer Decoding》Shazeer 2019 公式,結合常見模型架構引數)。批次推論時,該差異隨 batch size 線性放大。

計算量與延遲分析

Prefill 階段(並行處理初始輸入提示 token):MQA 在此階段的計算量(FLOPs)與 MHA 基本持平。原因在於雖 K、V 共享,但每個 Query 頭仍需分別與共享的 K 計算點積,總運算元不變。因此 MQA 對“首 token 延遲”(TTFT)的改善有限。

Decode 階段(逐 token 自迴歸生成):這是 MQA 的核心發力階段。生成每個新 token 時:

  • 計算新 token 的 Q:各頭分別投影,計算量不變
  • 讀取歷史 KV Cache 並與 Q 計算點積:MQA 需從視訊記憶體讀取的資料量為 2 × seq_len × d_head,而 MHA 為 2 × seq_len × d_model,相差 h 倍
  • K、V 共享帶來的另一個好處是:共享 K 的讀取結果可被所有 Q 頭複用,進一步減少了訪存衝突

瓶頸在於頻寬而非計算:Decode 階段的算術強度(每 byte 訪存的 FLOPs 數)極低——每次從視訊記憶體載入一個 KV 元素僅伴隨少量乘加運算。現代 GPU 的 HBM 頻寬(如 H100 為 3.35 TB/s,來源:NVIDIA H100 規格表 2023)遠小於其計算吞吐量(989 TFLOPS FP16)。因此 MQA 通過削減讀取量直接化解了記憶體頻寬瓶頸,這是 decode 延遲降低的根本原因,而非計算量的減少。

精度損失的機制分析

MQA 的精度損失來源於:不同的 Query 頭被迫使用同一份 Key/Value 作為“上下文”,失去了多頭注意力原本的模式多樣性。在 MHA 中,不同頭可能關注不同語義層面(如詞性、依存關係、長距離指代);MQA 中這些只能通過 Query 的差異化來近似補償。

實踐經驗表明(來源:Shazeer 2019 原論文實驗、Google PaLM 技術報告 2022、Meta LLaMA 2 技術報告 2023):

  • 在引數規模 10B 以上的模型中,MQA 帶來的困惑度上升通常在 1%-3% 範圍內,多數下游任務精度差異在噪聲級別
  • 小於 1B 引數的小模型對 MQA 的精度影響更為顯著,建議採用 GQA 或保持 MHA
  • 共享 KV 對需要細粒度 token 辨別能力的小樣本任務可能影響更明顯

關鍵引數

注意力頭數 h

決定 MQA 相對於 MHA 的最大理論收益(KV Cache 縮小比例 = 1/h)。現代大型模型常用 h = 3264。h 越大,MQA 節省的相對幅度越大,但也意味著共享可能帶來的多樣性損失更大。

鍵/值維度 d_head

通常 d_head = d_model / h,典型值為 64 或 128。MQA 保留了這一結構,共享 K、V 的維度仍為 d_head。較小的 d_head 意味著每個 K、V 維度表達的壓縮度更高,可能進一步增加共享風險。

序列長度 seq_len

MQA 的絕對收益隨序列長度線性增長。在短序列場景(如短問答,seq_len 512),MQA 與 MHA 的絕對 KV Cache 差異有限;在長文件分析、程式碼生成(seq_len 8192)時,MQA 從“加分項”上升為“必要條件”。

GQA 分組數 g

作為 MQA 與 MHA 之間的連續譜引數,g 控制 K/V 頭的組數:

  • g = 1:等同於 MQA(最激進)
  • g = h:等同於 MHA(無節省)
  • g 通常取 4 或 8(來源:LLaMA 2 70B 使用 g=4,Mistral 7B 使用 g=4)

分組數是可以根據模型規模和任務特性調優的架構超引數,是 MQA 思想在實際部署中的靈活化延伸。

整體壓縮比

指標MHAGQA (g=4)MQA
KV Cache 元素數2·h·seq·d_head2·g·seq·d_head2·1·seq·d_head
相對 MHA 儲存壓力100%約 12.5% (當 h=32)約 3.1% (當 h=32)
典型注意力頭配置h = 32/64h = 32, g = 4h = 32, g = 1

以上為理論推導值,實際視訊記憶體佔用還受 padding、對齊、實現差異等因素影響(來源:Hugging Face Transformers 原始碼實現,v4.35+,2024)。


技術路線

1. 起源:從 One Write-Head 到 MQA

2019 年,Noam Shazeer 在論文《Fast Transformer Decoding: One Write-Head is All You Need》(arXiv:1911.02150) 中首次正式系統化闡述 MQA。論文核心洞察:自迴歸解碼過程中,生成 token 是增量式的,每次只“寫入”一份新的 KV 條目,解碼延遲的瓶頸在於讀取已快取的龐大 KV 矩陣,而非寫入能力。因此賦予多個“寫入頭”(即 K、V 投影)對推論負擔極大,而對模型質量幫助有限——“一個寫頭就夠了”。

2. 早期驗證:Google PaLM 的 MQA 實踐

Google 釋出 540B 引數規模的大型模型 PaLM(Pathways Language Model)時(2022 年,來源:PaLM 技術報告 arXiv:2204.02311),明確採用了 MQA 架構。這一選擇表明,即使在千億引數級別,MQA 也能保證訓練穩定性和最終模型質量,為其技術可行性提供了關鍵的實踐背書。PaLM 在 540B 規模下訓練的困惑度和下游任務表現,證明了 MQA 的精度代價在工程上可控。

3. 折中方案:GQA 的出現

2023 年,Google Research 團隊釋出《GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints》(arXiv:2305.13245),系統提出 Grouped-Query Attention。GQA 的創新在於:

  • 允許將 h 個 Query 頭劃分為 g 個組(1 ≤ g ≤ h),每組共享一組 K/V
  • 提出從 MHA 訓練檢查點通過“平均池化”權重合並 K/V 頭的 uptraining 轉換方法,大幅降低了嘗試 GQA 的成本
  • 實驗證明 g 在 4-8 區間時,可在幾乎無損精度前提下,實現大部分 KV Cache 節省效果

4. 大規模採用與標準化

2023 年下半年起,主流開源與商業大型模型將 GQA 作為標準配置:

  • Meta LLaMA 2(2023 年 7 月):70B 版本採用 GQA(g=4),7B 和 13B 保持 MHA(來源:LLaMA 2 技術報告)
  • Mistral 7B(2023 年 9 月):明確採用 GQA(g=4),在 7B 規模上展示出 GQA 在中小模型的可行性(來源:Mistral 官方技術部落格)
  • Google Gemini(2023 年 12 月):模型架構細節未完全公開,但公開資料顯示延續了 Google 對 MQA/GQA 的技術路線
  • Meta LLaMA 3(2024 年 4 月):各級別模型均採用 GQA(來源:Meta LLaMA 3 技術公開說明)

5. 與 IO 感知演算法的協同融合

MQA/GQA 與 FlashAttention 系列演算法並非替代關係,而是互補關係。FlashAttention 解決的是“如何在 SRAM 和 HBM 之間高效排程注意力計算”,而 MQA 解決的是“KV Cache 本身需要儲存和讀取多少資料”。兩者的結合——在 IO 感知架構內進一步利用 KV 共享結構的冗餘——已成為現代高效推論棧的標配組合(來源:FlashAttention-2 論文,Dao 2023;vLLM 公開文件,2024)。


上游

Transformer 架構理論

MQA 的根本理論前提是 Transformer 的自注意力機制及其在自迴歸解碼中的計算圖展開。自迴歸生成造成的序列快取需求(即需要儲存所有歷史 token 的 K、V 以避免重複計算),是 MQA 存在的直接動因。

高效能運算硬體

MQA 設計所面向的訪存瓶頸,正是當前 AI 加速器硬體面臨的共性約束:HBM 頻寬增長遠慢於計算吞吐量增長(來源:NVIDIA GPU 架構演進白皮書,2018-2024)。以下是 2023-2024 年主流雲端端推論硬體的相關指標:

硬體HBM 頻寬FP16 算力位元組/FLOPs 比典型視訊記憶體公開來源
NVIDIA H100 (SXM)3.35 TB/s989 TFLOPS3.39e-380 GB規格表 2023
NVIDIA A100 (80GB)2.0 TB/s312 TFLOPS6.41e-380 GB規格表 2022
NVIDIA L40S864 GB/s362 TFLOPS2.39e-348 GB規格表 2023

資料來源:NVIDIA 各型號官方規格表。位元組/FLOPs 比越低,表明訪存相對計算更緊張,MQA/GQA 的加速效果越顯著。

AI 訓練/推論架構

  • PyTorch 生態:Hugging Face Transformers 庫從 v4.32 開始對 LLaMA 系列、Mistral 等模型的原生支援中,逐步完善了 GQA/MQA 的注意力實現(包括與 FlashAttention-2 的整合)(來源:Hugging Face GitHub Release Notes)
  • vLLM:開源推論引擎,通過 PagedAttention 等記憶體最佳化技術與 MQA/GQA 的 KV Cache 結構深度適配(來源:vLLM 論文 SOSP 2023)
  • TensorRT-LLM:輝達的推論最佳化架構,對 MQA/GQA 提供專用運算元融合最佳化(來源:NVIDIA TensorRT-LLM 文件 2024)
  • MLX:Apple 的統一記憶體架構天然適合 MQA 低訪存的推論模式(來源:Apple MLX GitHub 倉庫 2024)

下游

雲端端模型推論服務

MQA/GQA 使 API 服務商能在相同硬體上支援更大的推論吞吐量或更長的上下文視窗:

  • 單位 token 推論成本:公開資料中未見各服務商揭露具體的 MQA 節省資料,但根據硬體引數與 MQA 加速比(2-4 倍 decode 吞吐量提升)估算,雲端端推論服務中 KV Cache 相關視訊記憶體成本可顯著下降
  • 典型服務:Google Cloud Vertex AI(PaLM/Gemini 系列)、Meta 開源模型第三方 API、Mistral API 等均基於 MQA/GQA 模型提供服務(來源:各公司官方網站,2024)

端側大型模型部署

MQA 使 7B 級引數模型在移動裝置上實現實用級別的推論速度成為可能。根據公開評測(來源:MLCommons MLPerf Mobile 基準 2024、高通 AI Engine Demo 2023),在驍龍 8 Gen 3 平台上,採用 MQA/GQA 架構的 7B 級模型(以 INTS 量化格式),可實現 10-20 tokens/sec 的 decode 速度,達到可接受的即時互動體驗門檻。

端側晶片與 NPU 設計

移動/PC 晶片廠商的 NPU 設計開始將 MQA/GQA 的低 KV 訪存特性作為硬體最佳化的目標:

  • 高通:Hexagon NPU 的 Transformer 加速單元針對 GQA 的 KV 共享訪存模式做了專門對映(來源:高通 AI Engine 白皮書 2024)
  • 聯發科:天璣系列 APU 在 2024 年公開的 AI 架構中提及對 GQA 的支援(來源:聯發科開發者文件 2024)
  • Intel:Meteor Lake 的 NPU 及後續 Lunar Lake 架構在軟體棧中支援 GQA 推論(來源:Intel OpenVINO 文件 2024)

AI 應用生態

應用開發者獲得更低的 API 延遲與更經濟的端側執行能力,推動了多個領域的產品創新:

  • AI PC:Microsoft Copilot+ PC(2024 年釋出)對本地大型模型的支援,底層受益於 GQA 等技術(來源:Microsoft 官方技術部落格,2024 年 5 月)
  • AI 手機:Samsung Galaxy AI、Apple Intelligence 等端側 AI 功能集,在底層模型架構選擇中 MQA/GQA 是關鍵技術考量(來源:各公司 2024 年開發者大會公開資訊)

長上下文與多文件處理

2024 年以來,長上下文模型(100K+ token)成為差異化競爭焦點。MQA 的 KV Cache 節省在超長序列下從“技術最佳化”升級為“是否可行的門檻條件”。Google Gemini 1.5 Pro(公開演示支援 1M token,來源:Google DeepMind 部落格 2024 年 2 月)等極端長上下文能力的底層推論可行性,與 MQA/GQA 直接相關。


受益公司

直接技術受益方

Google (Alphabet) MQA 與 GQA 的核心研發方與持續推動者。PaLM、Gemini 系列採用此架構。Google Cloud TPU 與 MQA 的協同設計,構成其推論基礎設施的技術護城河。(來源:Google AI 論文與官方技術報告,2019-2024;企業年報檔案)

Meta 通過 LLaMA 2 (70B)、LLaMA 3(全系列)對 GQA 的全面採用,將這一技術從學術設定推向行業標準化。Meta 的開源策略使 GQA 生態極大豐富。(來源:Meta LLaMA 2/3 技術報告 2023-2024)

Mistral AI 作為新銳模型廠商,其 Mistral 7B 在相對較小引數規模上採用 GQA 並取得優異效能,證明了該技術路線的普適性。(來源:Mistral 技術部落格 2023)

基礎設施受益方

NVIDIA GPU 是 MQA/GQA 模型推論的核心載體。TensorRT-LLM 等軟體棧對 MQA/GQA 的支援是 NVIDIA 推論生態的關鍵能力。H100 / B200 等新一代 GPU 的更大 HBM 頻寬與 MQA 的低訪存特性形成正向疊加。(來源:NVIDIA 2024 財年年報;TensorRT-LLM 公開文件)

Qualcomm 端側 AI 最大的晶片平台商。其 Hexagon NPU 對 GQA 的最佳化直接關係到驍龍平台能否承載下一代端側大型模型體驗。在“AI 手機”換機潮敘事下,這一能力直接影響晶片定價權與生態粘性。(來源:高通 2024 投資者日公開檔案;Snapdragon Summit 技術釋出資料)

MediaTek 與高通在端側 AI 直接競爭的晶片廠商。天璣 9300+ 等旗艦 SoC 對 Transformer 的 NPU 支援是其在安卓旗艦市場份額擴大的技術賣點之一。(來源:聯發科 2024 年 Q4 投資者會議公開檔案)

間接生態受益方

Apple Apple Intelligence 的端側大型模型策略(2024 年 WWDC 釋出)依賴於模型架構的效率設計。Apple Silicon 的統一記憶體架構(UMA)具有高頻寬特性(M2 Ultra 為 800 GB/s,M3 Max 為 400 GB/s,來源:Apple 官方規格表 2023-2024),與 MQA 的低訪存需求高度匹配。

Microsoft Azure 雲端推論服務與 Copilot+ PC 本地模型部署的雙重角色,使 MQA/GQA 在雲端端降本與端側賦能兩端均直接受益。(來源:Microsoft 2024 財年年報;Build 2024 開發者大會資料)


市場規模

直接附屬:大型模型推論市場

MQA 本身不構成獨立的市場,而是通過降低推論成本、允許長上下文部署等方式,影響和放大其所屬的大型模型推論市場

  • 全球 AI 推論晶片與雲端服務市場:據第三方行業研究機構公開資料(IDC 2024 年 1 月,《Worldwide AI Infrastructure Tracker》),2023 年全球 AI 伺服器(主要用於訓練與推論)市場規模約為 300-400 億美元,其中推論佔比約 40%-50%,且增速高於訓練。預計到 2027 年,AI 推論總市場規模(含硬體、雲端服務)將超 1000 億美元(來源:IDC 預測 2024,具體數字需查閱最新付費報告)。
  • MQA 的成本貢獻估算:公開資料未見獨立評估 MQA 對推論晶片市場影響的完整報告。但基於 MQA 可使單位吞吐量硬體需求降低 2-4 倍的理論收益,MQA 所支撐的高效推論模式間接影響的市場規模可達數百億美元量級。

關聯市場:端側 AI 晶片

MQA 是端側大型模型推論實現的關鍵技術之一,其商業價值最終通過端側 AI 晶片出貨量體現:

  • 智慧手機 SoC 市場:據 Counterpoint Research 2024 年 Q3 報告,全球智慧手機 SoC 在 2023 年出貨量約 11 億片,支援 Transformer 加速的高階 AI 晶片(如高通驍龍 8 Gen 系列、聯發科天璣 9300 系列)在 2023 年合計出貨約 2.5-3 億片。這一比例為 2024-2025 年端側大型模型的目標硬體基礎。
  • AI PC 晶片市場:據 Canalys 預測,2024 年 AI PC 出貨量約 4800 萬臺,2025 年有望翻倍至逾 1 億臺(來源:Canalys 2024 年 5 月預測報告)。AI PC 對本地模型架構效率的依賴,使 MQA/GQA 為關鍵使能技術之一。

關鍵不確定性與侷限

上述均為關聯市場估算,MQA 本身無獨立的市場規模統計,其商業價值隱含在推論硬體效率提升和端側 AI 產品化程序中。投資者應關注推論成本下降趨勢與端側 AI 滲透率作為間接觀察指標,而非試圖劃分 MQA 的“獨立市場規模”。


玩家對比

主要大型模型架構選用情況(2023-2024)

模型(釋出方)引數規模注意力機制KV 頭數公開資訊來源
PaLM (Google, 2022)540BMQA1技術報告 arXiv:2204.02311
LLaMA 2 (Meta, 2023)7B / 13BMHAh = 32技術報告
LLaMA 2 (Meta, 2023)70BGQAg = 8 (h=64)技術報告
Mistral 7B (Mistral, 2023)7BGQA + SWAg = 4 (h=32)技術部落格
Falcon 180B (TII, 2023)180BMQA1技術報告
LLaMA 3 (Meta, 2024)8B / 70B / 405BGQA未公開 g 值(70B/405B);8B 用 GQA公開技術說明
Qwen 2 (Alibaba, 2024)7B / 72BGQAg = 4 (估算,公開資料未見確切數字)技術部落格
DeepSeek-V2 (DeepSeek, 2024)236B (MoE)MLA + GQA 變體未完全公開技術報告
Gemini 1.5 (Google, 2024)未公開未公開(推斷為 MQA 或 GQA)未公開公開技術報告簡版

注:部分模型的具體 GQA 分組數等細節尚未在公開技術報告中揭露,表格中標註為“估算”或“未公開”。

競爭格局簡析

MQA 純正派:Google 與 Falcon 等選擇極端設定(g=1),以儘可能小的精度代價獲取最大的 KV Cache 節省。這通常需要更大的引數規模和更充分的訓練來補償注意力多樣性的損失。適合千億引數級別、訓練資源充裕的團隊。

GQA 實用派:Meta、Mistral 等選擇 GQA(g=4-8)作為預設路線。這一折中路線已被證明在各種引數規模(7B - 405B)上都能良好工作,成為 2023-2024 年新發布大型模型的主流選擇。GQA 在工業界的勝利,實質上是 MQA 思想通過“引數化分組”實現的工程化落地。

差異化路線(MLA 等):以 DeepSeek-V2 為代表的模型開始探索 Multi-head Latent Attention (MLA),通過低秩壓縮排一步最佳化 KV Cache,可視為 MQA 思路的繼續深化。公開資料較少,成熟度有待驗證。


風險

1. 架構收斂風險

當行業高度趨同於 MQA/GQA 架構時,可能導致注意力機制創新的路徑依賴。如果未來出現全新的、更高效的注意力替代方案(如完全基於 SSM 的 Mamba 等),大量基於 MQA/GQA 訓練的模型將面臨架構遷移的高昂成本。目前這一風險為長期結構性風險,短期影響有限。

2. 精度天花板與任務敏感性

儘管在困惑度和多數基準測試上 MQA 損失微小,但部分研究報告(學術預印平台 arXiv 上的獨立復現研究,2023-2024)提示,在特定任務中(尤其是需要精細關鍵詞區分或多重複雜指代消解的任務),MQA 可能導致顯著精度下降。對於將 MQA/GQA 模型用於高精度需求場景(如醫療、法律文書處理)的開發者,需進行充分的領域內評估測試。

3. 硬體鎖定效應與反向依賴

MQA 的推論加速依賴於硬體對密集訪存模式的最佳化(如 GPU 的高頻寬 HBM、NPU 的專用記憶體層次)。若未來推論硬體的訪存能力出現代際飛躍(如存內計算、光互聯等顛覆性技術),MQA 帶來的相對優勢可能收窄。不過,截至 2024 年中,主流硬體路線未見突破摩爾定律的訪存革命訊號,此風險為中遠期。

4. 量化部署中的疊加精度損失

MQA/GQA 模型在量化(如 INT4/INT8)部署時,共享 KV 結構的精度敏感性可能與量化誤差產生互動影響,導致某些場景下的精度損失超出預期。公開資料中未見系統性的大規模對比研究,屬於值得追蹤的技術風險點。

5. 技術替代風險(非 Transformer 架構的崛起)

以 Mamba 為代表的 State Space Model (SSM) 架構,在長序列處理上具有與生俱來的線性複雜度,理論上不需要 KV Cache。若此類架構在未來獲得與 Transformer 同等或更優的質量,則圍繞 MQA 建置的最佳化生態將面臨替代風險。截至 2024 年中,SSM 類模型在大規模語言建模上的綜合表現仍落後於 Transformer 變體(來源:Mamba 論文 2023 及後續公開基準對比),但此方向值得持續追蹤。

6. 訓練成本與工程轉換成本(MHA→MQA 路徑)

對於已基於 MHA 完成預訓練的大型模型,通過 uptraining 轉換為 MQA/GQA 需額外的計算投入(GQA 論文中提及的平均池化權重合並方法需數千步的繼續訓練)。雖然成本遠低於從頭訓練,但對於資源有限的團隊可能構成門檻。


誤讀糾偏

誤讀 1:“MQA 就是簡單地少存了一些 K 和 V”

糾偏:MQA 不是在推論階段“選擇性丟棄”部分 KV 頭,而是從訓練之初就採用共享 KV 投影的結構。模型在整個訓練過程中學習的是在“所有 Q 頭共享同一組 K、V”這一約束下的最優引數。如果在訓練階段使用 MHA、推論階段簡單砍掉幾個 KV 頭,精度損失遠大於真正的 MQA。這是結構設計與事後壓縮的本質區別。

誤讀 2:“MQA 在所有引數規模的模型上都表現一樣好”

糾偏:實踐表明,MQA 在大引數規模(10B+)模型上效果最好,相對精度損失幾乎可以忽略。但對於引數量較小的模型(如 1B 以下),注意力頭的多樣性對整個模型的表達力貢獻比例更高,強行使用 MQA 可能導致較大的精度下降。Meta 在 LLaMA 2 中 7B/13B 保留 MHA、僅在 70B 採用 GQA 的決策,即是對這一規律的工程體現。(來源:LLaMA 2 技術報告 2023)

誤讀 3:“GQA 和 MQA 是完全不同的技術”

糾偏:GQA 是 MQA 思想的自然泛化——二者關係如同“單分類”與“多分類”。MQA(g=1)是 GQA 的特例,MHA(g=h)是 GQA 的另一個極端。GQA 論文的作者團隊與 MQA 論文有重疊(Google Research),GQA 是同一技術方向的工程化、引數化延伸,而非另起爐灶。

誤讀 4:“MQA 加速推論是因為減少了計算量”

糾偏:MQA 對 decode 階段的加速,主要來源於訪存量(KV Cache 讀取)的減少,而非 FLOPs 的減少。decode 階段總計算量與 MHA 幾乎相同。如果一款硬體的記憶體頻寬極大、遠不構成瓶頸(例如極端高頻寬的未來晶片),MQA 的推論加速效果將被弱化。理解“加速來自記憶體頻寬釋放,非計算量節約”這一點,對判斷技術邊界至關重要。

誤讀 5:“MQA 是某個公司的專利技術”

糾偏:MQA 最早由 Google 研究員 Noam Shazeer 在 2019 年公開發表於預印本平台 arXiv,屬於公開學術成果。後續在 GQA 論文、開源社群模型程式碼中廣泛實現,不存在單一實體的專利所有權封鎖。據公開資料查詢(USPTO 資料庫 2024 年檢索),未見阻礙行業通用實施的獨立關鍵專利障礙。


最新事件

2024 年 4 月:Meta 釋出 LLaMA 3,全面擁抱 GQA

Meta 於 2024 年 4 月釋出 LLaMA 3 系列(8B、70B 及後續的 405B),全系採用 GQA 注意力機制。這是繼 LLaMA 2 僅在 70B 採用 GQA 之後的重要技術路線升級,反映出即使在中型引數(8B)規模上,GQA 的精度-效率權衡已得到 Meta 內部驗證。(來源:Meta AI 官方部落格 2024 年 4 月)

2024 年 2 月:Google DeepMind 釋出 Gemini 1.5 Pro,支援 1M token 超長上下文

Gemini 1.5 Pro 以支援最高 100 萬 token 的上下文視窗引起業界關注。公開技術報告對其注意力機制實現細節揭露有限,但基於 Google 團隊此前的技術路線(MQA 在 PaLM、GQA 論文)推斷,該超長上下文能力的推論可行性高度依賴 MQA/GQA 類低訪存結構。(來源:Google DeepMind 技術報告 2024 年 2 月)

2024 年 5 月:Microsoft Build 大會,Copilot+ PC 宣佈端側 AI 能力

Microsoft 在 Build 2024 大會上釋出 Copilot+ PC 概念,內建端側大型模型。該模型的推論能力與續航表現,底層技術棧依賴 NPU 最佳化和模型架構效率。公開資料中未說明具體架構,但業內普遍認為採用了 GQA 類注意力機制。(來源:Microsoft Build 2024 主題演講及新聞稿)

2024 年 6 月:Apple WWDC 釋出 Apple Intelligence

Apple 在 WWDC 2024 上釋出 Apple Intelligence,確認將執行端側大型模型(約 3B 引數,具體未公開)。根據 Apple MLX 架構對 GQA 的支援及 Apple 論文發表的模型架構研究,端側模型將採用高效注意力機制。(來源:Apple WWDC 2024 主題演講;Apple Machine Learning Research 部落格,2024 年 4-6 月)

2024 年 Q2-Q3:高通、聯發科旗艦晶片集中強調 Transformer/NPU 加速

高通驍龍 8 Gen 3、聯發科天璣 9300+ 等 2024 年度旗艦晶片,在釋出資料中均將“Transformer 網路加速”與“長文本大型模型端側推論”作為核心賣點。這標誌著 MQA/GQA 結構從“學術實驗”經由“雲端端驗證”,已正式成為晶片設計階段考慮的硬體最佳化物件。(來源:各公司官網新聞稿與 2024 年投資者日演示材料)


追蹤指標

行業技術指標

新發布大型模型的注意力機制宣告 每當主要 AI 實驗室(Meta、Google、OpenAI、Anthropic、Mistral、各大中國廠商)釋出新模型,核查其技術報告/部落格中關於注意力機制(MHA/MQA/GQA/其他)的說明。這是判斷該技術路線是“強化趨勢”還是“開始分岔”的最直觀訊號。

主流模型上下文視窗長度擴充套件 MQA/GQA 的價值與上下文長度高度相關。若行業上下文中位值從 128K 繼續向 512K 甚至 1M token 遷移,MQA/GQA 的必需性將進一步強化;反之若長上下文應用落地不及預期,則其邊際價值可能下降。追蹤來源:各模型 API 文件、官方釋出說明。

相關論文引用與被引量、開源社群採納

  • MQA 原論文 (Shazeer 2019) 的累計引用量中近期增量
  • GQA 論文 (Ainslie et al. 2023) 的被引增速
  • Hugging Face 社群中帶 GQA/MQA 標籤的模型數量與下載量趨勢

以上指標反映學術界與工程界的持續關注度,可在 Google Scholar、GitHub、Hugging Face 平台上追蹤。

產業鏈訊號

NVIDIA / AMD 推論軟體棧更新日誌 以 TensorRT-LLM 為代表的推論最佳化引擎,其對 MQA/GQA 提供的新版本最佳化(如新增的融合運算元、對特定 GPU 世代的特化加速),是將學術優勢轉化為實際效能的關鍵橋樑。來源:官方 GitHub Release、開發者論壇。

端側晶片廠商的 NPU SDK 能力宣告 高通、聯發科、Apple、Intel 各季度釋出/更新的 AI 開發工具包(SNPE/NeuroPilot/CoreML/OpenVINO)對 GQA 等運算元的量化與排程支援情況,直接決定端側大型模型的落地節奏。來源:各廠商開發者入口網站。

AI 推論雲端服務的定價變化趨勢 MQA/GQA 的終極商業價值體現在雲端端推論成本的下降上。持續追蹤 OpenAI、Anthropic、Google Cloud、Together AI、Fireworks AI 等平台的 token 定價變動(特別是長上下文處理的附加費用變化),可作為觀察底層效率是否轉化為商業競爭力的參考。來源:各平台官網定價頁面。

宏觀訊號

端側 AI 功能的終端滲透率 關注旗艦手機 AI 功能的使用率資料(來源:移動網際網路第三方資料機構季度報告)、AI PC 出貨量資料(來源:Canalys/IDC 季度 PC 市場報告)等,以驗證 MQA/GQA 所支撐的端側模型是否為真實使用者提供價值,而非僅停留於廠商營銷層面。


信源

以下為本概念頁引用的主要公開資訊來源,按技術/產業維度歸類。所有連結與標識截止至 2024 年中有效:

核心論文

  • Shazeer, N. (2019). Fast Transformer Decoding: One Write-Head is All You Need. arXiv:1911.02150.
  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints. arXiv:2305.13245.
  • Dao, T. (2023). FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.

模型技術報告

  • Google, PaLM Technical Report (2022). arXiv:2204.02311.
  • Google DeepMind, Gemini 1.5 Technical Report (2024). 通過官方部落格釋出簡版。
  • Meta, LLaMA 2 Technical Report (2023). arXiv:2307.09288.
  • Meta, LLaMA 3 公開技術說明 (2024). Meta AI 官方網站。
  • Mistral AI, Mistral 7B 技術部落格 (2023).
  • DeepSeek, DeepSeek-V2 Technical Report (2024). arXiv.

開源實現與工具鏈

  • Hugging Face Transformers 庫: github.com/huggingface/transformers
  • vLLM: github.com/vllm-project/vllm
  • NVIDIA TensorRT-LLM: github.com/NVIDIA/TensorRT-LLM
  • Apple MLX: github.com/ml-explore/mlx

硬體與行業資料

  • NVIDIA GPU 規格表 (H100/A100/L40S). NVIDIA 官方網站.
  • 高通 AI Engine 白皮書與驍龍峰會技術資料. 高通官方網站.
  • 聯發科天璣開發者文件. 聯發科官方網站.
  • Intel OpenVINO 文件. Intel 官方網站.
  • Apple Silicon 規格表 (M2/M3 系列). Apple 官方網站.
  • IDC, Worldwide AI Infrastructure Tracker (2024). 付費報告,本概念頁引用其公開摘要資料。
  • Counterpoint Research, 全球智慧手機 SoC 出貨量報告 (2024 Q3).
  • Canalys, AI PC 出貨量預測報告 (2024 年 5 月).

公司公開檔案

  • Alphabet (Google) 2023 年年報及 2024 年 Q1/Q2 季度檔案
  • Meta 2023 年年報及 2024 年 Q1/Q2 季度檔案
  • Microsoft 2024 財年年報及 Build 2024 開發者大會資料
  • NVIDIA 2024 財年年報及 GTC 2024 主題演講
  • 高通 2024 年 Q2/Q3 季度檔案及投資者日公開演示材料
  • Apple WWDC 2024 主題演講及 Machine Learning Research 部落格

說明:所有引用資料均標註年份和來源口徑,其中市場預測類資料(IDC、Canalys、Counterpoint)需注意預測存在不確定性。凡標註“估算”、“公開資料未見確切數字”之處,表示筆者無法在公開渠道找到可直接引用的權威資料,建議讀者在決策時進一步核實最新情況。本概念頁不含任何形式的投資建議、薦股或交易方向預測。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型