模型層 開放閱讀

位置編碼

Positional Encoding

概念 ID
positional-encoding
更新時間
2026-05-29
來源數量
待補

位置編碼

3 秒看懂

Transformer自注意力本身不區分詞的先後順序。位置編碼正是加入這種“順序”訊號的機制,讓模型明白“第一個詞”和“第二個詞”的位置關係。主流方案已從最早的“固定正弦波”發展到“旋轉位置編碼”(RoPE)和“注意偏置”(ALiBi)等相對編碼,它們帶來更強的長文本外推能力,是當前大語言模型能夠支援10萬以上token上下文的底層關鍵之一。

3 分鐘產業解釋

在大型模型競賽中,長上下文視窗已成為核心賣點(如100K、200K token)。位置編碼直接影響模型對長序列的建模能力及訓練/推論效率。早期的絕對位置編碼(可學習或正弦)在長度超過訓練上限時效能急劇下降,而旋轉位置編碼(RoPE)配合插值、NTK擴充套件等技術,能以較小代價將上下文視窗輕鬆擴大數倍。ALiBi則通過簡單的偏置項,甚至允許零外推訓練。Meta的LLaMA系列、智譜的ChatGLM系列(ChatGLM2及以後版本)採用RoPE;BLOOM等模型曾用ALiBi。位置編碼的選擇因此貫穿預訓練、微調到推論最佳化全流程,對晶片級計算(如FlashAttention相容性、KVCache複用)也有深刻影響。

15 分鐘專家深入

傳統Transformer在計算注意力之前,將位置資訊與詞嵌入相加:Embedding + Positional Encoding。絕對位置編碼為每個位置賦予唯一向量,常見兩類:

  • 正弦位置編碼:使用不同頻率的正餘弦函式生成固定編碼,無需學習。
  • 可學習位置編碼:將位置向量視為可訓練引數,如BERT、GPT-2早期版本,但受限於最大訓練長度。

相對位置編碼則不再依賴絕對位置向量,而是在注意力分數或注意力計算中注入相對位置偏差。典型方法:

  • Shaw et al. (2018) 的相對位置表徵:在注意力計算時加入可學習的相對位置嵌入,計算量與相對位置剪裁視窗相關。
  • Transformer-XL 的遞推式相對編碼:將自注意力分解為基於內容的偏置和基於相對位置的偏置。
  • T5 的相對位置偏置:將相對位置離散分組,每個桶共享一個標量偏置,直接加到注意力logits上。

RoPE(旋轉位置編碼)通過複平面旋轉變換,使向量內積天然攜帶位置相對資訊。其公式為:對每兩個維度一組進行旋轉,旋轉角度隨位置線性增長、隨維度指數遞減。注意力的計算變為 text(Attention)(Q, K) = text(softmax)\left( frac( (R_m Q_m) (R_n K_n)^\top ){sqrt(d)} \right) 其中 R_m 是位置 m 的旋轉矩陣,最終內積僅依賴於相對位置 m-n。RoPE 既保留了絕對位置的資訊,又具備相對編碼的長程衰減特性,且與線性注意力、FlashAttention等高效實現相容。

ALiBi(Attention with Linear Biases)則最為直接:在原注意分數上減去一個與距離成正比的靜態偏置 m \times |j-i|,其中 m 是頭相關的斜率。不需要額外引數,無需任何訓練即可外推至更長的序列,甚至能實現“長度越外推,某些指標越優”的反直覺現象。但這有賴於合適的斜率設定,通常每頭取幾何級數斜率。

技術原理

絕對位置編碼:正弦編碼細節

給定位置 pos 和維度 iPE_{(pos, 2i)} = \sin\left( frac(pos){10000^{2i/d_{text(model)}}} \right) PE_{(pos, 2i+1)} = \cos\left( frac(pos){10000^{2i/d_{text(model)}}} \right) 波長形成幾何級數,從 2\pi20000\pi。這種設計鼓勵模型學習相對位置關係,因為任意偏移量 k 下,PE_{pos+k} 可由 PE_{pos} 線性變換得到。但實際隨著序列變長,高頻分量消失,外推效能不佳。

可學習位置編碼的侷限

矩陣 P \in mathbb(R)^{L \times d} 尺寸固定,訓練時 L 即為最大長度。推論時無法輸入超過 L 的序列,儘管可以通過位置插值(如將位置索引線性縮放)緩解,但會帶來精度損失。

RoPE 的旋轉機理

d 維向量拆成 d/2 個子空間,每個子空間視為一個複數,位置 m 對兩個分量施加旋轉角度 m\theta_i,其中 \theta_i = 10000^{-2i/d}。注意力點積展開:

(R_m q)^\top (R_n k) = q^\top R_{n-m} k

即查詢與鍵的內積僅由相對位置 n-m 決定,完美嵌入相對性。實際實現時,旋轉矩陣對 QK 逐元素運算,不增加額外引數,計算開銷極低。

ASCII 示意(RoPE 對一個二維子空間旋轉):

  k_{2i+1}

      |     * R_n k
      |    /
      |   /  angle = n·θ_i
      |  /
      | /___________ ▶ k_{2i}
      O
 同樣 R_m q 旋轉後,兩者點積與 (n-m)·θ_i 相關

ALiBi 的偏置注入

對注意力分數矩陣的第 i 個元素施加偏置:

text(softmax) \left( frac(QK^\top){sqrt(d)} - m \cdot |j-i| \right)

不同注意力頭使用不同斜率,某些頭捕捉近程依賴(大斜率),某些捕捉遠端依賴(小斜率漸近平坦)。典型的斜率設定為幾何級數,例如對 n 個頭,可令斜率 m = 2^{-(i+1)}i=0,\dots,n-1)。這種方法在訓練時甚至不需要對位置建模,極大簡化了外推。

關鍵引數彙總(基於公開方法):

方法引數型別外推能力計算增量相容性
正弦絕對無引數弱,超過預訓練長度下降無額外計算完全相容
可學習絕對L×d 矩陣弱,受限於矩陣大小加性無額外計算完全相容
RoPE無額外引數好,配合插值可達數倍對QK施加旋轉,成本低需旋轉QK,與FlashAttention相容
ALiBi無額外引數極強,零額外訓練外推一個標量偏置偏置靜態,不影響注意力核心

技術演進史

  • 2017 原始Transformer提出固定正弦位置編碼,直覺來自“距離可線性表達”。
  • 2018 BERT及GPT採用可學習位置嵌入,適配MLM和自迴歸任務,但限制了文本長度。
  • 2018 Shaw等提出相對位置表徵,首次將相對位置資訊引入注意力。
  • 2019 Transformer-XL用遞推相對編碼突破固定上下文長度,首次實現段級別的長度繼承。
  • 2019 T5簡化相對位置偏置為離散桶標量,計算高效,引領後續研究。
  • 2021 RoPE提出(Su et al.),通過複數旋轉在絕對編碼中蘊含相對性,迅速被中文大型模型社群採用,後成主流。
  • 2021 ALiBi提出,證明只需線性偏置即可完成超強外推,訓練極簡。
  • 2022-2024 社群在RoPE基礎上發展出線性位置插值、NTK-aware縮放、YaRN、Dynamic NTK等方法,使Llama等模型從2K/4K輕鬆擴充套件至32K-128K。
  • 2024-2025 圍繞KV Cache壓縮、SkipClip、ln縮放等技術,讓RoPE上下文視窗推至百萬token級別。

技術路線對比

維度正弦絕對PE可學習絕對PERoPE (旋轉)ALiBi (線性偏置)
核心機制固定三角函式可訓練嵌入層Query/Key旋轉注意力分數減去距離相關偏置
相對位置建模隱含,需模型學習無,完全絕對顯式,內積由相對位置決定顯式,偏置直接懲罰遠距離
外推能力弱(頻率失配)極弱(維度不匹配)中等,配合插值提升至強極強,零額外訓練外推
長度上限依賴無硬限,但效果下降剛性上限等於訓練矩陣L理論上無限,配合縮放技術實用理論上無限
適配高效Attention極佳,僅加法極佳,僅加法良好,需旋轉Q/K,部分融合最佳化極佳,僅標量減法
代表模型/論文Vaswani et al., 2017BERT, GPT-2Llama, ChatGLM, Qwen, MistralBLOOM, MPNet變體, 部分小模型
多樣性頭均勻頻率網格無特殊設計頻率固定但可調每頭不同斜率,天然多尺度
社群生態基礎實現簡單易用長上下文主流方案輕量級強外推

上下游

  • 上游:資料準備階段需確定最大序列長度,進而決定位置編碼的配置(如RoPE的基頻、ALiBi斜率)。預訓練架構需高效實現自定義位置編碼模組,尤其與FlashAttention、張量並行結合(如Megatron中處理RoPE的旋轉分散)。
  • 下游:長上下文微調(SFT)依賴位置編碼的擴充套件方案(如位置插值、NTK),推論架構則需支援動態位置編碼計算,KV Cache管理也受編碼方式影響(例如ALiBi偏置可直接嵌入注意力掩碼,不影響快取)。應用層,超長文件問答、程式碼庫理解和“大海撈針”測試均直接檢驗編碼外推能力。

關鍵指標

  • 最大有效長度:模型在保持上下文一致性時的最長token數(如通過“大海撈針”測試的閾值)。RoPE系列經過最佳化可達到256K+。
  • 外推衰減係數:在超出訓練長度的序列上,困惑度(PPL)的上升斜率。ALiBi可保持PPL平坦甚至下降。
  • 位置編碼計算耗時佔比:在長序列推論中,RoPE旋轉操作佔總注意力的比例<1%(通常可融合),ALiBi的偏置計算幾乎可忽略。
  • 記憶體/儲存開銷:可學習絕對編碼為 L \times d 引數;RoPE和ALiBi無額外引數儲存,但對KVCache無影響。以上指標均為定性估計,具體值隨模型規模與架構最佳化變化。
  • 擴充套件靈活性:支援即插即用的策略數量(如RoPE有線性插值、動態縮放、YaRN等多種擴充套件,生態豐富)。

供需與市場資料

位置編碼本身是技術元件,不單獨形成市場。但其對長文本模型的支撐能力間接驅動了應用需求。例如,企業級知識庫對百萬級token上下文的需求極高,模型廠商(如Anthropic、OpenAI、國內千問、DeepSeek等)紛紛推出128K-1M token上下文模型,直接拉動了對RoPE插值最佳化和ALiBi等方案的研究投入。開源社群中,RoPE或其變種被眾多新發布大規模預訓練模型預設採用,表明該方向“供給”已經形成事實標準。然而,從投資角度看,長上下文算力需求(注意力計算為平方級)將成倍增長,間接推高推論晶片與雲端服務的需求。

代表公司與資本對映

  • Meta:LLaMA系列採用RoPE,是開源長上下文領頭羊,間接帶動RoPE生態建設。
  • 智譜AI:ChatGLM系列全面使用RoPE,並探索中英文長上下文理解。
  • Anthropic:Claude模型支援長上下文,但具體位置編碼方案未公開,早期社群推測可能涉及ALiBi等技巧,尚無官方確認。
  • 微軟/DeepSpeed/NF4:在生產最佳化中深度整合RoPE和FlashAttention,降低長文本訓練門檻。
  • 阿里千問(Qwen):使用RoPE並通過動態NTK實現32K~128K視窗,是雲端服務的核心賣點。
  • 投資視角:那些能夠掌握位置編碼外推技術並高效落地的團隊,能以更低成本躍進長上下文賽道,形成產品差異化。對算力硬體而言,支援高效位置編碼的運算單元(如張量核處理旋轉操作)成為AI晶片設計的競爭維度之一。

投資邏輯

  • 技術護城河:不同的位置編碼方案直接影響模型上限與推論成本。頂尖團隊會在此方向上積累大量微調經驗(如NTK引數除錯、KVCache最佳化),形成不易複製的工程優勢。
  • 成本敏感性:ALiBi幾乎不增加推論成本,但訓練收斂可能略慢;RoPE需額外的旋轉計算,但融合良好。部署經濟性決定了在邊緣/手機等場景的選擇傾向,可能影響端側AI晶片的設計取捨。
  • 生態鎖定風險:一旦模型生態大規模繫結RoPE,硬體廠商必須加法實現其高效計算,否則可能失去競爭力。而新出現的狀態空間模型(如Mamba)無需位置編碼,可能對現有範式產生衝擊,投資需關注該變數。

常見誤讀糾偏

  • 誤讀1:“位置編碼只是加在詞向量上的小把戲,不重要” 糾偏:對長序列而言,位置編碼方式直接決定了模型注意力是否能夠合理聚焦,錯誤編碼導致遠距離詞元被“淹沒”。許多長上下文能力的突破正是源於位置編碼的改進(如RoPE插值),而非模型架構本身。
  • 誤讀2:“ALiBi完全不需要訓練,隨便用就行” 糾偏:雖然零額外訓練外推表現驚豔,但在大規模預訓練下,帶有ALiBi從頭訓練的模型有時收斂速度比RoPE慢,且對特定短文本任務可能略遜。沒有任何一種編碼在所有任務上都絕對統治,需結合具體場景驗證。
  • 誤讀3:“正弦位置編碼天然可任意外推” 糾偏:理論上任意位置都有正餘弦值,但頻率網格未適配原訓練長度分佈時,超長序列的高頻分量極弱或發生混疊,導致注意力模糊,實際外推受限。

學習路徑

  1. 基礎篇:閱讀《Attention Is All You Need》中位置編碼章節,用numpy實現正弦編碼並可視化波長變化。
  2. 進階篇:詳讀RoPE論文(Su et al., 2021),推導旋轉前後內積的等價性;實現一個Mini RoPE層並與絕對編碼對比序列分類任務。
  3. 實踐篇:動手將HuggingFace GPT-2模型的位置編碼從可學習改為相對偏置(T5風格),觀察長度外推表現。
  4. 前沿篇:研究YaRN(Yet another RoPE extensioN)和NTK-aware縮放,理解波長分佈調整如何影響高頻資訊捕獲,調優Llama模型的上下文視窗。
  5. 拓寬篇:閱讀ALiBi論文,嘗試在對數長度外推中除錯斜率,同時關注Mamba等無注意力模型對位置編碼的依賴消解趨勢。

一句話總結

位置編碼賦予Transformer閱讀順序的靈魂,從絕對正弦到旋轉、線性偏置,技術演化直接解鎖了大型模型“讀萬卷書”的長文本能力,成為當代LLM的隱形支柱。

延伸閱讀與來源

  • Vaswani et al., “Attention Is All You Need”, NeurIPS 2017.(原始正弦位置編碼)
  • Shaw et al., “Self-Attention with Relative Position Representations”, NAACL 2018.
  • Dai et al., “Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context”, ACL 2019.
  • Su et al., “RoFormer: Enhanced Transformer with Rotary Position Embedding”, arXiv 2021.(RoPE)
  • Press et al., “Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation”, ICLR 2022.(ALiBi)
  • Peng et al., “YaRN: Efficient Context Window Extension of Large Language Models”, arXiv 2023.(YaRN擴充套件)
  • Meta AI, “LLaMA: Open and Efficient Foundation Language Models”, arXiv 2023.(RoPE工業應用)
  • 各開源實現:HuggingFace Transformers 中RoPE、ALiBi的具體程式碼註釋。 (以上為公開學術與工業資料,無額外檢索資料,具體效能數字請以原始論文量化結果為準。)
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型