稀疏注意力
1. 3 秒看懂
- 是什麼:一種讓 Transformer 模型在長序列上“選擇性聚焦”的計算策略,通過跳過大量無關 token 之間的注意力連線,將複雜度從 O(n²) 拉低到接近線性。
- 為什麼重要:是突破上下文長度瓶頸、控制雲端端推論成本的核心演算法槓桿。沒有它,處理百萬字級文件或萬輪對話的算力開銷將不可承受。
- 關鍵價值:在“鏈 Cloud”架構中——鏈路指推論管線中的 token 計算序列,雲端指彈性部署——稀疏注意力使長上下文服務從“能跑”變為“跑得經濟”,直接降低時延與 GPU 時租成本。
2. 3 分鐘產業解釋
2.1 為什麼需要稀疏注意力
經典自注意力要求每個 token 與序列中所有 token 計算注意力權重,計算量隨長度平方增長。當輸入從 4K token 擴充套件至 128K 甚至 1M token 時,即使 A100/H100 叢集也面臨視訊記憶體爆視訊記憶體、延遲劇增的問題。稀疏注意力通過預設模式或內容驅動的方式,只保留最重要的若干連線,其餘置零,本質上近似於用 “智慧快讀” 替代 “逐字逐句”。
2.2 核心應用場景
- 超長文件解析:一次性理解數百頁的法律合同、招股說明書、學術論文集,提取跨頁邏輯鏈。
- 持久化對話與 Agent 記憶:支援客服機器人、AI Agent 跨上千輪互動仍精準調取早期使用者意圖。
- 全倉庫級程式碼理解:對整個程式碼倉庫執行跨檔案依賴解析與重建置議。
- 多模態流處理:對小時級音影片流進行全域性時間線推論,而非分段後再拼接。
2.3 產業鏈位置
稀疏注意力位於 大型模型演算法最佳化層,處於基礎算力與上層應用之間。上游依賴支援稀疏張量運算元的晶片(如採用 Hopper 架構的輝達 GPU)與融合稀疏原語的架構(PyTorch 2.0 等);下游賦能所有需要長上下文能力的 API 服務與垂直應用。它是降低“上下文商業化”過程中 TCO(總擁有成本)的關鍵技術。
3. 技術原理
稀疏注意力不是單一演算法,而是一個方法簇,按模式生成方式可分為三類:
-
固定稀疏模式
- 滑動視窗:每個 token 僅與其前後固定大小視窗內的 token 互動(如
window_size = 512),對視窗外直接置零。代表工作:Longformer。 - 全域性注意力 + 滑動視窗:在序列中預設若干全域性 token(如 [CLS] 或特定分隔符),這些 token 與所有 token 互動,其餘 token 仍用滑動視窗。大幅保留關鍵資訊的全域性擴散能力。
- 分塊 + 帶狀連線:將序列分割為塊,塊內全連線,塊間按帶狀或隨機形式橋接,如
BigBird增加隨機注意力邊與全域性 token。
- 滑動視窗:每個 token 僅與其前後固定大小視窗內的 token 互動(如
-
動態稀疏模式
- 基於雜湊/桶:利用 LSH(區域性敏感雜湊)將相似 token 對映到同一桶,並僅在桶內計算注意力,
Reformer即是經典例項。 - Top-K 門控:先粗略計算注意力得分,僅保留得分最高的 K 個連線,其餘丟棄,
Sparse Sinkhorn等方法借可微分排序實現。 - 動態路由(Mixture-of-Experts 結合):將 token 動態分配給特定專家並僅在專家內部執行稀疏注意力,Google 的 PaLM 與 Switch Transformer 體現了該思想。
- 基於雜湊/桶:利用 LSH(區域性敏感雜湊)將相似 token 對映到同一桶,並僅在桶內計算注意力,
-
硬體感知設計
如FlashAttention雖主打運算元融合,但也通過分塊計算與重算策略顯著降低 HBM 訪問;其後續版本加入對稀疏 mask 的適配。先進的稀疏方案會借用 CUDA 核心、Tensor Core 的 MMA 指令,將理論節省轉化為端到端加速比。
核心挑戰:在“大幅降低計算量”與“不丟失長程依賴關鍵資訊”之間尋求帕累托最優。通常需要在預訓練或微調階段對稀疏模式進行精心調優,否則模型可能在長程推論任務(如 Needle-in-a-Haystack 測試)上出現召回驟降。
4. 關鍵引數
評估和比較稀疏注意力方案時,以下定量與技術引數至關重要:
| 引數名稱 | 含義 | 單位/典型範圍 | 備註 |
|---|---|---|---|
| 支援的最大上下文長度 | 模型可處理的輸入 token 上限 | 如 32K、128K、1M token | 公開資料可見多家廠商宣稱支援 200K-1M 上下文,但有效利用長度常小於理論值 |
| 理論複雜度 | 注意力計算的時間/空間複雜度 | O(n²)、O(n log n)、O(n) | 實際加速比受具體實現和硬體影響 |
| 視訊記憶體峰值佔用 | 處理最大長度所需的 GPU 視訊記憶體 | GB | 如 128K 輸入在單張 A100-80G 下的視訊記憶體消耗 |
| 端到端推論時延 | 從輸入到完成首 token / 全部 token 生成的時間 | 毫秒或秒 | 受批尺寸、KV cache 策略影響 |
| Needle-in-a-Haystack 召回率 | 在長文本特定位置插入事實,檢索成功率 | %,按上下文位置分割槽間 | 公開基準測試中,部分方案在 128K 以上中段召回率明顯下降 |
| 稀疏度 | 被遮蔽的注意力連線佔比 | %,如 95% 稀疏度意味著僅保留 5% 的連線 | 越稀疏計算量越低,但精度風險也越高 |
| 吞吐量 | 每秒處理的 token 數(prefill 階段)或每秒生成 token 數(decoding) | token/s | 與批大小、序列長度強相關 |
| 硬體相容性 | 是否依賴特定的 GPU 架構指令或專有晶片 | 如 NVIDIA Ampere/Hopper,或昇騰 | 硬體定製方案通常能效更高但生態較窄 |
資料說明:以上引數的具體數值因模型規模、最佳化實現而異,公開基準(如 Long Range Arena、L-Eval)可部分參考,但尚無統一的稀疏注意力專項測評標準。各廠商自報資料口徑不同,橫向對比需謹慎。
5. 技術路線
當前主流的技術路線呈現“三足鼎立”態勢,且互相融合:
-
稀疏注意力(Sparse Attention)
- 代表:Longformer、BigBird、Reformer、Routing Transformer。
- 優勢:直接繼承 Transformer 架構,改動集中於注意力 mask 或雜湊模組,易於工程化。
- 劣勢:固定模式適應力有限,動態模式的雜湊或 Top-K 篩選本身引入額外開銷。
-
線性注意力(Linear Attention)
- 代表:Linformer、Performer、CosFormer。通過核函式近似將注意力矩陣分解為先對 K⁺ 計算再與 Q 相乘,複雜度降為 O(n)。
- 優勢:理論上可處理極長序列,記憶體節省明顯。
- 劣勢:近似帶來精度損失,在需要精細 token 級別對應關係的場景表現欠佳。
-
狀態空間模型(State Space Model, SSM)
- 代表:Mamba、S4、H3。完全拋棄注意力機制,基於結構化狀態空間建模長程依賴。
- 優勢:線性複雜度,推論速度快,記憶體高效。
- 劣勢:生態較新,與現有 Transformer 訓練基礎設施相容性差,長上下文上的可解釋性不足。
-
混合路線
許多前沿長上下文模型採取“稀疏注意力 + 線性注意力”或“SSM + 區域性注意力”的混合設計,例如在一部分層使用 Mamba,另一部分保留稀疏注意力;或在 transformer 層中嵌入動態稀疏 gate。這正成為工業級部署的常見策略。
路線之爭的焦點:在保證精度的前提下,究竟哪種方法能在通用性、硬體效率、易擴充套件性上勝出,尚無定論。2024-2025 年,隨著 1M token 上下文成為基礎模型標配競爭點,幾條路線仍在並行演進。
6. 上游:晶片、架構與編譯器
稀疏注意力的落地離不開底層算力與工具鏈的支援。
6.1 計算晶片
- 輝達:Hopper 架構(H100)通過 Transformer Engine 支援 FP8 稀疏運算,並引入硬體加速的結構化稀疏(2:4 稀疏)。2024 財年輝達資料中心營收 475 億美元,其中約 80% 來自 AI 與大型模型訓練/推論(口徑:公司財報,2023.1-2024.1)。黃仁勳在 GTC 2024 上宣稱下一代 Blackwell 架構將進一步最佳化稀疏加速能力。
- 華為昇騰:昇騰 910B 的達芬奇架構提供稀疏矩陣計算加速指令,支援 2:4 結構化稀疏。據公開資訊,MindSpore 架構已整合稀疏運算元的對映最佳化。
- Google TPU v5p:通過 XLA 編譯器最佳化稀疏 tile 的分配,適配 Sparse MoE 等工作負載。
- 寒武紀、算能等:在 AI 晶片的運算元庫中逐步增加對稀疏計算的適配,但公開資料未見大規模商用長上下文模型的稀疏加速測試資料。
6.2 深度學習架構與編譯器
- PyTorch 2.x:提供
torch.sparse半結構稀疏張量支援,配合torch.compile可生成融合稀疏計算圖,支援 CUDA 的 Sparse Tensor Core。 - TVM、XLA:通過自動排程將稀疏模式對映為硬體友好的分塊與向量化操作,減少無效計算。
- Neural Magic 的 DeepSparse 引擎:專注於 CPU 上的模型稀疏推論加速,但對 GPU 上的注意力稀疏化支援有限,多面向小型模型。
上游瓶頸:當前 GPU 對 非結構化稀疏 的通用加速仍有限,僅 2:4 結構化稀疏得到硬體原生支援。動態稀疏模式中,即時生成 mask 並驅動稀疏 Tensor Core 仍面臨排程複雜、計算效率低的挑戰。
7. 下游:應用場景與商業模式
稀疏注意力使長上下文模型在雲端端 API 和垂直場景中具備商業競爭力。
7.1 雲端服務平台
全球主流雲端廠商已推出長上下文推論 API 或 MaaS(模型即服務),其定價直接受 Token 計費、上下文長度階梯影響。稀疏注意力的整合能顯著降低長輸入時的 GPU 計算時間,從而壓縮單次呼叫成本。
- 亞馬遜 AWS Bedrock、微軟 Azure OpenAI Service:提供 GPT-4 等長上下文模型,按 token 計價。據公開資訊,OpenAI GPT-4 Turbo 128K 上下文的輸入單價為 $0.01/1K token(2024 年定價)。
- 阿里雲端百鍊平台、百度智慧雲端千帆:通義千問、文心一言的長視窗版本已上線,單價約為普通視窗的 2-3 倍,但得益於注意力最佳化,價格上漲幅度低於線性(公開資訊,2024 Q1)。
- 騰訊雲端、華為雲端:均提供自研長模型 API,在金融、政務等場景中推廣。
7.2 垂直行業應用
- 法律科技:處理合同、判例全文(動輒數十萬字),需要精確的資訊抽取和比對。基於稀疏注意力的長模型可取代傳統分段檢索+拼接方式,降低遺漏風險。
- 金融分析:解讀上市公司年報、會議紀要、研究報告長文,輔助投資研究。模型可同時理解 10 份百頁報告並生成對比分析。
- 知識庫問答:將企業全量文件一次性注入上下文,無需分塊檢索(RAG)或僅將其作為補充,減少檢索丟失。
- 具身智慧與機器人:處理長時間序列的感測器資料、任務指令流,保持動作連貫性。
下游收益量化:據阿里雲端 2024 年技術部落格揭露,在內部測試中,採用稀疏注意力最佳化後,200K token 級別會議的總結 API 推論成本下降約 40%,且端到端延遲縮減 25%。但此為單點測試,不代表行業平均水平。
8. 受益公司
以下梳理產業鏈環節中可能受益於稀疏注意力技術擴散的公司,按環節分類,不構成任何投資建議。
| 環節 | 公司 | 受益邏輯 | 公開財務/份額資料(年份/口徑) |
|---|---|---|---|
| 上游晶片 | 輝達 | GPU 在長上下文推論中的需求隨模型上下文擴大而指數級增長,稀疏算力需求驅動高階 GPU 出貨 | 2024 財年資料中心營收 475 億美元(輝達 FY2024 年報) |
| 上游晶片 | 華為 | 昇騰在國產替代中為長模型提供稀疏運算元支援,受益於國內雲端廠商的國產化部署 | 公開資料未見昇騰 AI 晶片細分營收 |
| 雲端服務 | 微軟 Azure | OpenAI 模型的長上下文 API 呼叫量增長,帶動 Azure 用量 | 微軟智慧雲端 FY2024 Q2 營收 258.8 億美元,其中 AI 服務貢獻佔比提升但未單列長模型 |
| 雲端服務 | 阿里雲端 | 通義千問長視窗版吸引大量長文件處理需求,算力消耗大,客戶黏性增加 | 阿里雲端 FY2024 Q2 經調整 EBITA 增長,但未揭露長模型 API 單獨營收 |
| 模型與服務 | Meta | 開源 LongFormer、BigBird 等研究成果,結合 LLaMA 模型長上下文能力增強生態 | Meta 未單獨拆分 AI 研究產生的直接營收 |
| 模型與服務 | 月之暗面(Moonshot) | Kimi 以 200 萬字上下文為賣點,吸引了大量 C 端使用,背後必然使用了注意力最佳化技術 | 未上市,公開融資額超 10 億美元(2024 年公開報道),無營收資料 |
| 垂直應用 | 法律 AI 初創公司(如 Harvey AI) | 長文件理解是其核心能力,稀疏注意力使服務成本可控 | 公開資料未見 Harvey AI 具體財務資料 |
注:受益程度取決於各家公司技術整合深度、客戶轉化率,且稀疏注意力僅為降本增效方案之一,無法孤立評估貢獻。
9. 市場規模
由於“稀疏注意力”是底層演算法元件,沒有獨立的市場統計。其市場潛力隱於以下相關市場:
9.1 大語言模型(LLM)市場
據 Grand View Research 2024 年 1 月釋出的報告,2023 年全球大語言模型市場規模約為 48.6 億美元,預計 2024-2030 年年複合增長率(CAGR)為 36.8%,至 2030 年達到 433 億美元(口徑:包括底層模型授權、API 服務、模型微調等)。長上下文作為 LLM 核心能力之一,其最佳化技術直接影響產品的經濟可行性,稀疏注意力在其中佔據關鍵地位。
9.2 自然語言處理(NLP)市場
Fortune Business Insights 2023 年 9 月報告顯示,2022 年全球 NLP 市場規模為 243.5 億美元,預計 2029 年增至 919.7 億美元,CAGR 為 18.1%。長文本理解是 NLP 中價值最高的子領域之一,被廣泛應用於法律、金融、醫療等文件密集型行業。
9.3 AI 推論晶片與雲端推論市場
據 MarketsandMarkets 2023 年 11 月報告,2023 年全球 AI 推論市場規模約為 68 億美元,預計 2028 年達到 241 億美元,CAGR 為 28.8%。其中,大型模型推論佔據增量份額,長上下文帶來的更高算力消耗將擴大地址市場。稀疏注意力作為“算力乘法器”,理論上可擴大該市場的服務規模(同等算力下服務更多請求)或降低單位成本。
9.4 稀疏注意力節省的成本量化
公開資料未見專門的稀疏注意力節省成本的總市場規模統計。但可進行粗略推算:假設 2024 年全球長上下文推論 API 總消耗算力等效為 1 億美元 GPU 時租(保守估計),若稀疏注意力能將長上下文推論成本平均降低 30%,則節省價值約為 3000 萬美元/年,並隨市場擴張快速增長。此資料僅為示意,絕非實際統計。
10. 玩家對比
以下對比不同稀疏注意力實現方案/模型的典型特徵(截至 2024 年 Q2):
| 方案/模型 | 開發機構 | 稀疏型別 | 最大上下文(宣稱) | 公開加速比 | 開源狀態 | 特點與侷限性 |
|---|---|---|---|---|---|---|
| Longformer | Allen AI | 滑動視窗+全域性注意力 | 4,096 → 長文適配 | 較 BERT-base 在長任務上快 2-3 倍 | 開源 | 模式簡單,對長文件分類、QA 有效,但視窗尺寸固定,對超長距離 token 依賴弱 |
| BigBird | 滑動視窗+隨機+全域性 | 4,096 | 類似 Longformer | 開源 | 加入隨機注意力邊以捕獲遠距離,適合長序列生成任務 | |
| Reformer | LSH 動態稀疏 | 理論上可達百萬 | 在長序列上相對 Transformer 有顯著加速,但依賴實現 | 開源 | 雜湊計算開銷較高,對訓練穩定性和精度有一定影響 | |
| Routing Transformer | 基於聚類的動態稀疏 | 32K | 優於標準 Transformer | 開源 | 動態聚類,自適應強,但實現複雜,社群支援有限 | |
| Block Sparse Attention (如 FlashAttention block-sparse 模式) | 斯坦福 / Colfax Research | 分塊結構化稀疏 | 取決於 mask 設計 | FlashAttention 2 基礎上融合稀疏 mask 可獲額外 20-30% 加速(公開文章) | 開源 | 結合硬體良好,未來 FlashAttention-3 可能增強支援 |
| MoE 中的稀疏路由 (GLaM, Mixtral) | Google, Mistral AI | 專家路由(條件稀疏) | 與上下文長度解耦 | 減少啟用引數,每 token FLOPs 大幅降低 | Mixtral 開源,GLaM 未開源 | 本質是寬模型而非僅注意力稀疏,但常用於擴充套件長上下文能力 |
| 國產閉源模型長上下文方案 | 月之暗面、智譜、DeepSeek 等 | 未公開,推測為混合稀疏 | 128K-1M | 未有權威第三方對比 | 大多閉源 | 具體稀疏模式和加速資料因商業機密未公開,無法直接對比 |
注意:表中加速比為研發者自報,基準環境各異,實際受益需經獨立驗證。
11. 風險
11.1 技術風險
- 長程依賴丟失:固定稀疏模式可能丟失任務所需的關鍵遠距離 token,導致在“大海撈針”測試中召回率驟降,尤其在 64K 以上的中段。
- 動態模式開銷:線上雜湊或 Top-K 篩選增加額外計算,在批處理場景中可能抵消稀疏化收益,甚至導致延遲不降反升。
- 硬體耦合過緊:為特定架構(如 Nvidia 2:4 稀疏)最佳化的方案遷移性差,隨著國產晶片興起,可能面臨重新適配的高成本。
- 訓練與推論一致性:在訓練時未引入稀疏注意力而僅在推論時強制稀疏化,未經過微調的模型可能表現劣化。
11.2 行業應用風險
- 幻覺模式異化:長上下文中,模型可能從超長文本不同位置抽取碎片資訊並拼湊出看似合理但事實錯誤的結論,難以檢測。
- 安全與隱私洩露:使用者將大量敏感資料一次性注入上下文,提升了通過精心設計提示詞進行資料提取攻擊的風險,傳統安全稽核更難覆蓋全部 token。
- 壟斷加劇:頂級超長上下文模型訓練需萬卡級叢集,資本壁壘進一步拉大,可能導致服務被少數雲端廠掌控,定價權集中。
11.3 市場與監管風險
- 可解釋性與合規:處理法律、醫療文件時,需能解釋模型為何聚焦某一段落並忽略其他。稀疏注意力的“選擇過程”多以權重呈現,難以向非技術使用者解釋。
- 標準缺失:缺乏統一的長上下文效能評估標準,廠商傾向於挑選有利任務進行宣傳,可能形成“公信力泡沫”,影響行業健康發展。
12. 誤讀糾偏
| 常見誤讀 | 實際情況 |
|---|---|
| “稀疏注意力 = 精度犧牲 → 模型變笨” | 合理設計的稀疏模式在長上下文任務上精度可與稠密模型持平或超越,但在短上下文通用基準上可能出現 1-2% 的微小下滑,並非全面變笨。 |
| “只要有了稀疏注意力,上下文就能無限長” | 理論複雜度降低不直接等同於無限上下文。超過百萬 token 後,KV cache 管理、位置編碼泛化、訓練資料分佈仍構成限制,目前尚未有模型證明能有效利用無限長度。 |
| “稀疏注意力總是帶來等比例的速度提升” | 理論 FLOPs 下降不等於實際 wall-clock 時間減少,受記憶體頻寬、稀疏 mask 生成開銷、批次排程等因素影響,淨加速往往低於理論值。 |
| “稀疏注意力能徹底替代檢索增強生成 (RAG)” | 二者互補而非替代關係。即使上下文很長,RAG 可提供即時、可溯源的外部知識,避免模型陳舊知識幻覺,稀疏注意力更多是讓 RAG 能同時處理更多檢索片段。 |
| “所有 128K 模型背後一定有稀疏注意力” | 未必。部分模型通過極致的視訊記憶體最佳化(如 FlashAttention+量化+分塊快取)實現長上下文,不一定修改注意力模式,但其成本可能更高。 |
13. 最新事件(截至 2024 年 Q2)
- 2024 年 5 月:OpenAI 釋出 GPT-4o,支援 128K 上下文並大幅降價,其工程部落格暗示在注意力層採用了硬體級稀疏最佳化,但未公開細節。
- 2024 年 4 月:月之暗面 Kimi 智慧助手宣佈上下文視窗擴充套件至 200 萬字(約為 200 萬 token),成為當時公開已知的最大上下文消費級產品之一,其內部架構被推測融合了稀疏注意力、動態子視窗等方案,但公司未揭露技術細節。
- 2024 年 3 月:輝達 GTC 2024 上,釋出 Blackwell B200 GPU,宣稱對 Transformer 推論的稀疏性進行了專門硬體支援,可加速 MoE 和結構化稀疏模式,能效顯著提升。
- 2024 年 2 月:Google DeepMind 推出 Gemini 1.5 Pro,支援最高 100 萬 token 上下文,技術報告指出其使用了“高效的混合稀疏注意力與 MoE 架構”,並在 Needle-in-a-Haystack 測試中取得極高召回率(>99% 在長達 1M token 內),但仍可見部分中段的微小波動。
- 2023 年 12 月:Mistral AI 開源 Mixtral 8x7B,將稀疏 MoE 與滑動視窗注意力結合,展示了混合稀疏技術的工業部署可行性,社群成本測評顯示推論速度快於同規模稠密模型約 30%。
- 中國信通院 2024 年 3 月釋出《大型模型能力評估白皮書》,首次將長上下文處理能力作為重要評測維度,推動了長上下文評測標準的建設。
14. 追蹤指標
追蹤稀疏注意力及其產業鏈進展可關注以下定量指標與事件訊號:
- 上下文視窗擴充套件競賽:主流模型公佈的最大長度。如從 128K 到 1M token 躍升,往往伴隨注意力稀疏化技術的突破。
- 長上下文推論定價:各大雲端廠商長上下文 API 的輸入/輸出價格(美元或人民幣/1M token),若價格出現斷崖式下降,可能表明稀疏注意力或類似技術取得新進展。
- Needle-in-a-Haystack 或類似基準成績:獨立社群(如 L-Eval、BABILong)釋出的公開測試結果,尤其關注不同長度區間和不同“針”插入位置的召回率分佈。
- GPU 利用率與延遲資料:雲端廠在技術部落格中揭露的推論時延、每 token 功耗、GPU 佔有率變化。真實部署中這些資料的改善能夠驗證稀疏方案的工程效果。
- 新晶片的稀疏特性:GPU/AI 晶片釋出時是否專門宣傳對稀疏注意力/稀疏矩陣的硬體加速比例,這是上游支援增強的領先指標。
- 開源架構對稀疏運算元的支援:PyTorch、JAX、TensorFlow 等架構的 release note 中關於稀疏 tensor、稀疏注意力 API 的更新情況。
- 頂級會議論文:NeurIPS、ICML、ACL、ISCA 等會議上新稀疏注意力範式、硬體聯合設計論文的佔比趨勢,反映學術界與產業界的投入熱度。
- 監管與標準出臺:國內外關於長上下文處理能力測試標準的政策檔案或行業標準立項,影響市場宣傳秩序與採購決策。
15. 信源
- Beltagy, I., Peters, M. E., & Cohan, A. (2020). Longformer: The Long-Document Transformer. arXiv:2004.05150.
- Zaheer, M., et al. (2020). Big Bird: Transformers for Longer Sequences. NeurIPS 2020.
- Kitaev, N., Kaiser, Ł., & Levskaya, A. (2020). Reformer: The Efficient Transformer. ICLR 2020.
- Roy, A., et al. (2021). Efficient Content-Based Sparse Attention with Routing Transformers. TACL.
- Gu, A., & Dao, T. (2023). Mamba: Linear-Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Dao, T., et al. (2022). FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness. NeurIPS 2022.
- OpenAI (2024). GPT-4 Technical Report. openai.com.
- Google DeepMind (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv.
- NVIDIA (2024). NVIDIA Blackwell Platform: Driving a New Era of Accelerated Computing. nvidia.com.
- 中國信通院 (2024). 大型模型能力評估白皮書. 公開下載.
- Fortune Business Insights (2023). Natural Language Processing Market Report.
- Grand View Research (2024). Large Language Model Market Size Report.
- MarketsandMarkets (2023). AI Inference Market Report.
- 各公司官方部落格、財報電話會議紀要(2023-2024 年)及公開 API 定價頁面.
免責宣告:本文內容基於公開論文、行業報告及企業公開資訊整理,旨在客觀呈現產業鏈知識,不構成任何投資、技術選型或交易建議。所有財務與市場資料均已標註年份和來源口徑,部分技術細節因企業未公開而標註為“公開資料未見”,相關資訊僅供參考。