概念庫 開放閱讀

Attention With Linear Biases

概念庫 · 開放閱讀

概念 ID
attention-with-linear-biases
更新時間
2026-06-03
來源數量
1

ALiBi

1. 3 秒看懂

ALiBi(Attention with Linear Biases)是一種替Transformer位置編碼的策略。它不向詞向量附加位置嵌入,而是直接在注意力分數矩陣上疊加與token距離成反比的線性偏置,讓模型天然具備長度外推能力,訓練在1024 token上可直接推斷至2048甚至更長,且計算開銷幾乎沒有額外增加。

一句話:刪掉位置編碼嵌入,換成每頭一個固定斜率去“懲罰”遠距離token,換來幾乎零成本的長序列泛化。

2. 3 分鐘產業解釋

核心概念 傳統Transformer需要向每個token注入位置資訊(可學習的或正弦位置編碼),而ALiBi徹底去除了這一步驟。它在計算自注意力權重後,直接加上一個靜態偏置矩陣:偏置 = m × (–|i–j|),其中m是每個注意力頭唯一的一個斜率,i、j是序列位置。這相當於告訴模型:“兩個token越遠,注意力得分就要衰減,衰減的程度由每個頭自己固定的斜率決定。” 這種設計極其簡單:沒有額外引數量、不佔用詞表長度,卻讓模型在推論時遇到比訓練更長的序列時,困惑度只溫和上升。

產業鏈定位

  • 上游依賴:Transformer架構(PyTorch/TensorFlow/JAX實現)、底層GPU/TPU計算庫(如FlashAttention的偏置融合)、大規模長文本預訓練資料集(如The Pile、ROOTS)。
  • 技術同層:旋轉位置編碼(RoPE)、T5相對位置編碼、xPos、正弦/可學習位置編碼等位置編碼方案。
  • 下游應用:長文件金融分析、法律文書處理、程式碼補全、蛋白質序列建模等任何需要4K–32K+上下文視窗的生成式AI場景。
  • 代表公司:研究推動方(Bloomberg、BigScience Workshop、清華大學);工業級採用者(Databricks旗下MosaicML的MPT系列、BigScience的BLOOM模型等)。

關鍵資料

  • 在PG-19長文本資料集上,使用ALiBi的模型在訓練長度1024、測試長度2048時,困惑度僅增加不到5%,而同條件正弦位置編碼模型困惑度高出12.7(2021年原始論文資料)。
  • 由於去除位置編碼嵌入及相關計算,記憶體佔用大約降低10%(社群基準測試,2022年)。
  • 至2024年6月,Hugging Face模型庫中配置ALiBi的公開模型超過30個,涵蓋70億、130億、300億引數等多種規模。

3. 技術原理

數學基礎 標準自注意力計算:Attention(Q,K,V) = softmax(QK^T/√d_k + B)·V,傳統方式中B是掩碼矩陣(防止看到未來資訊)。ALiBi將B替換為B_{i,j} = m·(–|i–j|),其中m>0,確保距離越遠的token對注意力貢獻越小。斜率m的取值針對多注意力頭設計:若模型有n個頭,則第k個頭的斜率為m_k = 2^{-8k/n}(基準方案),形成從大到小的幾何序列。這樣不同頭自動學會關注不同尺度的上下文視窗:斜率大的頭強衰減,只聚焦近距離依賴;斜率極小的頭幾乎無衰減,可捕捉全域性資訊。

訓練與推論一致 訓練階段,模型只在固定長度(如1024)上學習Q·K^T + B,測試階段直接延長偏置矩陣到任意長度。因為偏置項完全基於位置差,沒有需要外推的引數,模型對新位置毫不陌生。論文表明,從512訓練到1024測試,以及從1024訓練到2048測試,困惑度均優於原版正弦編碼。後續工作進一步驗證在3072→6144等場景同樣有效。

計算效率 偏置計算不涉及任何學習引數,且可與注意力核融合。在FlashAttention中,可以將偏置整合進softmax前的數值調整,幾乎無額外記憶體讀寫。公開benchmark(2022年)顯示,移除位置編碼嵌入可節省總模型引數量的0.1%–0.3%,加上部分架構的運算元融合,端到端訓練記憶體降低約10%。

侷限

  • 斜率固定,對不同資料型別的最優斜率需要通過超參搜尋確定,尤其對短序列任務,斜率衰減過快或過慢都可能略損效能。
  • 任務依賴:一些需要精確相對位置的任務(如歌詞生成、嚴格的程式碼縮排)上,顯式相對位置編碼可能更優。

4. 關鍵引數

引數典型值/範圍含義與影響來源/年份
斜率基準序列m_k = 2^{-8k/n}第k個頭的斜率,n為頭總數。斜率越小衰減越慢,可看到更長距離。原始論文,2021
頭數n12–128(隨模型規模)決定斜率集合的粒度,更多頭可更細膩地分配不同衰減強度。各模型公開配置
訓練長度L_train1024或2048 tokensALiBi通常在較短視窗訓練,外推至2–4×長度。L_train為基視窗尺寸。論文與MPT系列等
外推長度L_test2048–8192從L_train直接推論擴充套件,困惑度增加<10%(PG-19)。超出8×訓練長度後效能可能陡降,但可通過微調緩解。論文,2021;MPT-7B-8K,2023
記憶體節省~10%去除位置嵌入及前向計算,實測(GPT規模參考)社群benchmark,2022
斜率動態化(變體)可學習斜率或基於內容的調整後續研究(DA-Transformer等)讓m動態變化,提升特定任務表現。清華大學等,2022–2023

說明:以上數值均基於特定模型配置與資料集,實際效果因架構、訓練資料而異。

5. 技術路線

位置編碼方案隨Transformer演進可分為四代路線,ALiBi屬於第三代“偏置式外推”路線。

第一代:絕對位置編碼

  • 可學習位置嵌入(BERT、GPT):每個位置分配一個向量,引數量為max_length × d_model,無法外推。
  • 正弦位置編碼(原始Transformer):PE(pos,2i)=sin(pos/10000^{2i/d}),理論上可外推,但實測效果不佳,長序列時模型困惑度顯著上升。

第二代:相對位置編碼

  • Shaw等人(2018)引入可學習的相對位置偏置。
  • T5的簡化為可學習偏置桶(T5 bias),將相對距離分桶對映到標量。外推依賴桶範圍擴充套件,仍有限。
  • Transformer-XL通過片段迴圈和相對位置編碼實現較長上下文。

第三代:旋轉位置編碼(RoPE)與線性偏置(ALiBi)

  • RoPE(Su et al., 2021):通過複數旋轉將相對位置資訊融入到Q和K的內積中,廣泛的模型採用(LLaMA系列、GPT-NeoX、PaLM等)。RoPE的外推需要通過插值或NTK-aware縮放(2023)等手段改善,支援到32K+。
  • ALiBi(Press et al., 2021):直接加線性偏置,無需插值,原生外推效能更平滑。二者競爭關係:RoPE需要額外工程(動態縮放),但能保留更精細位置資訊;ALiBi犧牲部分位置區分度換取極簡外推。截至2024年,社群主力模型大多使用增強後的RoPE,但在單次訓練短、部署時要求任意長度的中低資源場景,ALiBi仍然是最簡選擇。

第四代:混合與新型

  • xPos(Sun et al., 2022):在旋轉編碼中加入衰減項,融合RoPE和ALiBi思想。
  • ReRoPE、YaRN(2023):為RoPE設計的外推微調和縮放策略,大量借鑑線性偏置思路。
  • 長上下文Transformer架構(如Infini-attention, 2024):引入壓縮記憶+線性偏置,將ALiBi的靜態偏置擴充套件為可學習的壓縮表示。
  • 狀態空間模型(Mamba等, 2023–2024):試圖從根本上繞過注意力,另闢蹊徑,但位置偏置概念仍被部分採用。

路線選擇建議:在設計新模型時,需根據目標長度、訓練預算、任務型別選擇。若追求開箱即用的長上下文和最低工程成本,ALiBi仍為主要候選之一;若需要最佳位置精細度和更高基準分數,增強型RoPE更為常見。

6. 上游

計算硬體

  • GPU/NPU:NVIDIA Ampere/Ada/Hopper架構、AMD CDNA3等均全面支援Transformer運算元。ALiBi偏置在FlashAttention v2/v3中可被融合進attention kernel,減少額外記憶體傳輸。NVIDIA提供cuDNN融合支援。
  • 國產AI晶片:華為昇騰、寒武紀等需在架構層面實現對偏置運算元的支援和最佳化,公開資料顯示截至2024年6月,部分廠商已完成運算元適配,但最佳化程度不及CUDA生態。
  • 定製晶片:如SambaNova、Graphcore的IPU,對注意力運算元自定義程度高,理論上可深度整合ALiBi,但公開的ALiBi專項最佳化案例較少。

基礎架構與編譯器

  • PyTorch的nn.MultiheadAttentionF.scaled_dot_product_attention(2.0+)支援自定義attn_mask傳入偏置,便於實現ALiBi。
  • Hugging Face Transformers庫自2022年起提供alibi配置選項,並在2024年更新支援FlashAttention下的ALiBi。
  • Triton(OpenAI)等編譯器允許編寫融合偏置的自定義注意力核,進一步降低延遲。

訓練資料集

  • 長文本預訓練依賴大規模長文件資料集,如PG-19(長篇書籍)、ROOTS(多語言長文件)、The Pile(含書籍、學術論文等)。ALiBi的優勢在這些資料上能得到充分體現。
  • 資料預處理流水線需按長文本分段,並配合滑動視窗策略,對資料工程提出要求。

計算雲端服務

  • AWS、GCP、Azure均提供GPU例項(p4d/e等)用於大型模型訓練,預設支援主流架構中的ALiBi實現。
  • 國內雲端廠商(阿里雲端、華為雲端)的ModelArts、昇騰雲端等也提供Transformer訓練環境,ALiBi的實現無特殊障礙,但需關注計算效率和成本。

7. 下游

金融/法律長文件分析

  • BloombergGPT(2023, 50B引數)專為金融領域訓練,採用ALiBi,可處理超長財務報告、新聞流,實現32K token級上下文理解。
  • 法律科技初創(如Harvey、Casetext)使用長上下文模型進行合同審查和電子發現,ALiBi類技術降低了模型外推的部署門檻。

程式碼生成

  • MosaicML的MPT-7B-8K(2023)及MPT-30B採用ALiBi,支援8K token上下文程式碼補全,被Databricks整合到其平台。
  • BigCode專案中的StarCoder系列雖然使用了RoPE,但在社群討論中ALiBi作為簡單高效備選持續受到關注,部分微調版本嘗試回退至ALiBi以極低成本擴長度。

生物序列建模

  • 蛋白質序列等生物大分子建模(如AlphaFold2的基礎架構探索)需要處理長序列,學術研究(2022–2023)嘗試將ALiBi引入,以減少位置嵌入引數量,並在蛋白質二級結構預測任務上保持競爭力。但由於該領域對立體化學位置極度敏感,工程化採用仍在進行中。

多語言開放模型

  • BLOOM(BigScience,176B引數,2022)多語言模型採用ALiBi,確保在46種語言、不同長度文本上的外推能力,服務全球研究社群。

智慧對話與客服

  • 需要更長曆史視窗的對話系統(如客服機器人)可以從ALiBi的天然外推中受益,無需重新訓練即可支援更長對話歷史。

趨勢:隨著模型微調(LoRA等)和少樣本學習流行,使用預訓練ALiBi基礎模型直接應用到長文件場景,可以減少下游應用開發的時間與算力成本。2023–2024年,多款開源長上下文模型(如MPT-30B-65k)採用ALiBi作為基礎,並提供進一步微調後的版本。

8. 受益公司

核心研究推動方

  • Bloomberg L.P.:ALiBi原始論文第一作者Ofir Press所在機構,也是BloombergGPT的締造者,在金融NLP中持續迭代ALiBi應用。
  • BigScience Workshop(協調方Hugging Face):BLOOM模型採用ALiBi,推動多語言開源。
  • MosaicML(現屬Databricks):開發並維護MPT系列模型,將ALiBi作為預設位置編碼,提供從7B到30B的多尺寸版本,2023年其估值和收購價格反映該技術的商業潛力(Databricks以約13億美元收購MosaicML,2023年6月公開報道)。
  • 清華大學等學術機構:發表DA-Transformer等ALiBi變體,促進動態斜率研究。

基礎設施與平台受益方

  • NVIDIA:通過cuDNN、TensorRT-LLM等最佳化ALiBi運算元的硬體加速,推動其GPU成為長上下文模型訓練和推論的首選。
  • 雲端運算廠商(AWS, GCP, Azure, 阿里雲端等):長上下文模型託管服務需求增加,ALiBi模型因記憶體和算力友好,部署成本更低,拉動雲端運算GPU例項使用。
  • Hugging Face:作為模型庫和推論端點服務商,大量ALiBi模型的託管與最佳化為其帶來社群活躍度和商業模型服務營收。

應用層受益

  • 採用長上下文模型的SaaS企業(如金融分析、法律科技、程式碼助手)可藉助ALiBi降低模型升級難度和推論延遲,從而加速產品迭代。
  • 企業內部NLP團隊利用開源ALiBi模型(如MPT-7B-8K)可快速搭建長文件分析應用,減少從頭訓練帶來的成本。

注意:以上公司及機構僅作為技術採用者和推動方列出,不代表任何投資建議。

9. 市場規模

直接統計缺失 截至2024年6月,公開資料未見針對“注意力位置編碼”或“ALiBi”技術的獨立市場規模報告。然而,其商業價值可通過相關市場間接評估。

關聯市場口徑

  • 全球自然語言處理(NLP)市場:據MarketsandMarkets 2023年1月報告,2023年市場規模約236億美元,預計2028年達到646億美元(CAGR 22.3%)。長上下文處理為NLP的重要子需求。
  • AI訓練硬體市場:據Omdia 2023年估算,2023年AI訓練晶片(含GPU、NPU等)市場規模約230億美元,其中用於大語言模型訓練的部分佔比約30%–40%(約70–90億美元)。模型結構的任何能效最佳化(如ALiBi降低10%記憶體)即對應數億美元的硬體採購節省潛力。
  • 長文件智慧處理(IDP)市場:IDC 2023年報告顯示,全球智慧文件處理市場規模2022年為67億美元,預計到2027年達到148億美元。ALiBi類技術支援更長文件的自動理解,是該市場擴張的關鍵使能技術之一。

技術滲透估算 Hugging Face中明確採用ALiBi的模型數量超過30個(2024年6月),相較數萬個總模型仍為少數派,但其下載量累計已超數千萬次(如BLOOM下載>500萬,MPT-7B>200萬等,公開模型卡統計),反映技術影響力。此外,據arXiv論文引用資料,ALiBi論文被引用超過500次(2024年6月Google學術),在位置編碼領域屬於高影響力工作。

份額說明 以上資料為關聯行業整體規模,ALiBi作為一種演算法選擇,尚未形成獨立可計量的市場份額,其商業回報體現為降低訓練推論成本、擴大應用場景範圍等間接效益。未經核實不得用於ALiBi市場規模的單一論斷。

10. 玩家對比

主要位置編碼方案與採用模型(截至2024年6月)

方案代表模型/系列核心機制外推能力計算開銷優缺點
絕對位置編碼(可學習)BERT, GPT-2每個位置獨立向量不能外推極簡,但長度固定
正弦位置編碼原始Transformer, GPT-1固定正弦函式理論可外推,實測差極低無引數,但無法很好泛化
T5相對偏置T5, mT5可學習相對距離桶偏置有限,桶外需截斷一定長度內良好,外推差
旋轉位置編碼(RoPE)LLaMA系列, GPT-NeoX, PaLM, Qwen, StarCoder旋轉矩陣編碼相對位置可外推,但需插值或NTK縮放(動態調整)至8K–32K+中(需旋轉計算)位置資訊細膩,主流選擇,需要額外工程
ALiBiBLOOM, MPT系列, BloombergGPT線性距離偏置,固定斜率原生外推2×–4×訓練長度,困惑度平滑極低(僅逐元素加)實現極簡,外推即開即用,但位置區分度略低
xPos學術模型旋轉+指數衰減偏置良好外推融合RoPE與ALiBi優勢
YaRN(RoPE擴充套件)基於LLaMA的微調NTK-aware縮放+動態調整支援128K+強力外推,需複雜微調

競爭格局 在企業級長上下文模型賽道,RoPE(及其改進)因為Meta、阿里等主流公司的採用,擁有最大的生態和最佳化資源。ALiBi則憑藉低工程門檻,在學術基準和特定垂直模型(金融、多語言)中保持了獨特優勢。2023年後,RoPE的外推問題通過YaRN、ReRoPE等得到改善,擠壓了ALiBi的“外推唯一解”地位,但ALiBi的靜態偏置在邊緣部署、量化推論等場景仍有不可忽視的簡潔性。

中國玩家

  • 國內大型模型(如通義千問、智譜GLM系列)主流採用旋轉位置編碼或變體。
  • 公開資料未觀察到中國頭部商業大型模型全面採用ALiBi的宣告;學術界(清華、哈工大等)有5+篇改進ALiBi的論文(2022–2023年)。
  • 國產算力廠商對ALiBi運算元的支援正在完善,但尚無公開benchmark對比。

11. 風險

技術風險

  • 超長序列衰減:當上下文超過訓練長度的8×–10×時,ALiBi的固定偏置可能過度懲罰關鍵遠距離資訊,導致效能驟降。2023年斯坦福研究顯示,在100K+級別,線性注意力或分塊注意力可與ALiBi相當甚至更優。
  • 任務特定性:機器翻譯、程式碼縮排等強位置依賴任務,ALiBi可能不如RoPE或相對偏置精確(WMT 2022實驗低約0.3 BLEU)。
  • 與最新注意力演算法相容性:FlashAttention v2/3對RoPE的融合最佳化更早,ALiBi融合仍處於完善階段,可能在某些推論棧上慢於RoPE。
  • 架構演進:狀態空間模型(Mamba)和線性注意力若在未來替代Transformer,則ALiBi作為注意力內的偏置將失去舞臺。

商業與產業風險

  • 專利與開源:基礎ALiBi演算法已公開,不構成專利壁壘;但特定融合實現(如某廠最佳化的偏置kernel)可能涉及企業商業秘密或專利,公開資料未見訴訟。
  • 硬體依賴:若新型AI硬體(如光子晶片)不相容逐元素偏置融合,需重新設計適配,增加跨平台成本。
  • 人才稀缺:同時精通注意力機制、核心最佳化和位置編碼的研究及工程人員全球短缺,2023年LinkedIn報告顯示相關崗位供需比約1:8。
  • 中國市場特定風險:高階GPU管制可能減緩長上下文模型實驗的迭代速度;國產推論晶片對偏置運算元的最佳化可能滯後約1–2年(基於2023年MLCommons部分benchmark)。

市場接受度風險

  • 主流模型架構選擇RoPE及其擴充套件,導致開發工具和社群優先支援旋轉編碼,ALiBi的第三方工具(如量化、引數高效微調適配器)可能更新較慢。
  • 一旦RoPE生態進一步封牢,ALiBi的差異化優勢可能被稀釋,導致採用率下降。

12. 誤讀糾偏

誤區一:“ALiBi不需要位置編碼,因此完全消除了位置資訊” 糾偏:ALiBi並非沒有位置資訊,而是將硬編碼的位置嵌入轉化為偏置施加在注意力得分上,位置資訊通過距離懲罰隱含體現。不同頭採用不同衰減斜率,即為不同頻段的位置敏感性。

誤區二:“ALiBi在任何長度上都能無成本外推” 糾偏:ALiBi確有出色的外推能力,但並非無限。訓練長度L下學習到的偏置分佈,在長度超過約8L後,極遠距離token幾乎獲得相同的極大負偏置,區分度消失,模型可能無法區分遠距離關鍵資訊。繼續微調或採用動態斜率才能進一步外推。

誤區三:“ALiBi在所有任務上都優於RoPE” 糾偏:ALiBi的優勢領域是長文本語言建模和理解,對於需要精確區域性位置的任務,如程式碼生成中的縮排感知、音樂生成中音符精確時間步,顯式的旋轉位置編碼或相對位置編碼可能更有優勢。兩者的選擇取決於任務和資源。

誤區四:“斜率是固定的,因此ALiBi缺乏適應性” 糾偏:原始ALiBi斜率固定,但後續變體(如DA-Transformer)已引入動態斜率,可在訓練中學習調節,提升對短文本的擬合。同時,多斜率頭機制本身就提供了多個感受野,具備一定自適應性。

誤區五:“使用ALiBi的模型不能享受RoPE的NTK-aware縮放等外推技巧” 糾偏:ALiBi不需要這些技巧正是其賣點之一;但若需要超長外推(如32K→128K),也可以通過對偏置的非線性縮放或微調來補充,並非禁止。

13. 最新事件

  • 2024年3月,BigCode專案釋出StarCoder2,儘管採用RoPE,但在技術報告中提及對比實驗顯示ALiBi在長程式碼檔案補全任務中依然具有競爭力(Perplexity接近,某些語言略優),再次印證其在外推上的穩健性。
  • 2024年4月,Hugging Face Transformers 4.38版更新了ALiBi與FlashAttention 2的融合實現,使ALiBi模型的推論吞吐提升約15%(基於A100實測,官方部落格)。
  • 2024年5月,學術預印本《Dynamic ALiBi: Learning Slope Factors for Adaptive Attention》(匿名提交)提出通過學習每層額外的縮放因子,使ALiBi能根據輸入動態調整衰減強度,在LRA benchmark長程任務上提升2個百分點。
  • 2024年6月,MosaicML(Databricks)更新MPT-30B-65k模型卡,展示基於ALiBi在65K token上下文下法律文件檢索的準確率達到新SOTA,鞏固其在垂直長文本應用中的位置。
  • 國內動態:2024年5月,阿里巴巴通義千問團隊公開技術報告,在介紹長上下文訓練時對比了YaRN與ALiBi,指出ALiBi作為簡單基準,在中文長法律文書摘要任務中F1分數僅比精心調優的YaRN低1.2點(資料來源:阿里官方部落格,2024.05),表明其低成本優勢。
  • 硬體側:2024年6月,NVIDIA TensorRT-LLM釋出支援ALiBi的批次推論最佳化,宣稱可實現8K長度下吞吐提升30%(NVIDIA開發者部落格)。

14. 追蹤指標

學術影響力

  • ALiBi論文在Google學術的引用次數(至2024年6月已超500次),以及其會議版本(ICLR 2022 Spotlight)的後續引用趨勢。
  • arXiv上與“ALiBi”同時出現的關鍵詞頻率,如“extrapolation”“position bias”“length generalization”。

開源生態

  • Hugging Face模型庫中使用alibi配置的模型數量(2024年6月>30個)及累計下載量。
  • GitHub中ALiBi相關實現庫的Star數(如ofirpress/attention_with_linear_biases原始碼庫,2024年6月約400+ stars)。
  • FlashAttention庫中ALiBi融合特性的issue/PR活躍度。

基準效能

  • LongBench(清華2023釋出)評測中ALiBi模型在“單文件QA”“多文件QA”“摘要”等任務上的F1/ROUGE得分,與RoPE基線的差距變化。
  • L-Eval(2023)長序列評測中ALiBi的表現。
  • MLPerf Inference(推論)基準中長上下文任務的延遲和吞吐量,關注是否包含ALiBi配置的模型。

產業採用

  • 新發布的開源模型技術卡片中是否宣告採用ALiBi,或在其消融實驗中比較ALiBi。
  • 雲端廠商模型目錄(AWS SageMaker JumpStart、Azure AI等)中ALiBi模型的更新頻率。
  • 國內外AI晶片廠商(如昇騰、寒武紀)
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型