Yet Another Rope Extension
1 3 秒看懂
- 一句話定義:YaRN(Yet another RoPE extensioN)是一種把大語言模型可處理的上下文視窗從幾 K tokens高效拓展到數十萬 tokens的位置編碼插值與微調演算法,作用物件是以 RoPE 為位置編碼的 Transformer 模型。
- 核心價值:僅需原訓練量千分之一級的續訓代價,就能讓已有的開源模型獲得超長上下文能力,從而支撐長文件理解、多 step Agent、超長對話等關鍵應用。
- 比喻理解:好比給一臺電腦增加了一套虛擬定址擴充套件卡,不用更換整臺機器,記憶體定址範圍就從 32 位升到 64 位,能處理的資料規模幾何級放大。
- 關鍵數字:YaRN 論文(2023 年)展示可將 LLaMA 2 的 4K 視窗擴充套件至 128K tokens,微調僅需約 400 步,資料量不到預訓練資料的 0.1%。後續業界實踐中,部分模型已實現 200K 甚至 1M 級別的上下文視窗(相容 YaRN 思路)。
2 3 分鐘產業解釋
- 為什麼需要 YaRN:Transformer 的計算複雜度隨序列長度平方增長,且原生位置編碼對超出訓練長度的位置沒有泛化能力。過去要建置長視窗模型只能從頭預訓練或大量續訓,成本極高。YaRN 提供了一條低成本、高效率的捷徑,使中小團隊也能在 1-2 天內將 7B/13B 模型擴充套件為“長上下文版本”。
- 技術烙印:YaRN 在工業界的落地並非以獨立產品形態存在,而是以調參方案、微調指令碼和程式碼庫的形式滲透進模型訓練管線。Hugging Face 的 Transformers 庫已整合 YaRN 相關縮放策略,多數開源長上下文模型都直接或間接使用了其思想。
- 商業影響:它使得長上下文不再是頭部 AI 實驗室專屬能力,推動長文本推論 API 價格迅速下降。2023—2024 年,百川、零一萬物、月之暗面等中國廠商密集釋出支援 128K—200K 上下文的模型,其技術方案均與 YaRN 類插值路線高度重合。
- 典型應用格局:法律合同審查、財報分析、基因序列閱讀、程式碼庫級理解、長篇小說續寫等,是 YaRN 技術最直接的受益場景。此外,支援超長上下文的多 Agent 協作成為可能,例如持續數小時的自主任務規劃。
3 技術原理
3.1 位置編碼與 RoPE 基礎
- 大型模型通常使用位置編碼(Position Embedding) 注入序列中 token 的順序資訊。RoPE(Rotary Position Embedding)是 LLaMA、Mistral、Yi 等主流模型的標準選擇,通過對每對特徵維度施加旋轉操作來建模相對位置。
- RoPE 的關鍵特性是每個維度對應一個不同的頻率:低維特徵代表高頻(快速變化),高維特徵代表低頻(緩慢變化)。這為 YaRN 的分頻插值奠定了基礎。
3.2 從直接外推到插值
- 模型在訓練時只見過長度為 L 的序列,直接延長輸入會導致位置旋轉角度超出訓練分佈,精度急劇下降。一種早期補救是位置插值(Position Interpolation),把新位置的索引按比例 L’/L 內縮到訓練範圍內,但簡單均勻縮放會損失高頻位置的解析度,短上下文效能下降。
- YaRN 的核心貢獻是將插值策略頻域分化,並在注意力層面補償分佈漂移。
3.3 YaRN 的三項創新
-
NTK‑aware 分頻插值 受到神經正切核(NTK)理論啟發,YaRN 認為高頻維度對模型區分短距離 token 關係至關重要,因此放寬對高頻維度的縮放因子,甚至不縮放;低頻維度則按 λ 因子強力拉伸。這樣既擴張了最大感知長度,又保留原始的短程注意模式。縮放函式可寫成:每個維度的縮放因子是該維頻率與某個基頻 θ 的函式,通過引入引數 s(目標擴充套件倍數)和 α(高頻保護強度)來精細控制。
-
動態維度插值 YaRN 不固定整型縮放比,而是允許推論時根據實際輸入長度動態選擇插值曲線。比如遇到較短輸入就用更接近原始比例的插值,遇到超長輸入才使用更強縮放,這一“按需插值”極大提升了模型在混合長度場景下的魯棒性。
-
溫度縮放校正注意力熵 視窗拉伸後,注意力分數分佈會變得更平緩,長距離依賴訊號被噪聲淹沒。YaRN 在注意力 softmax 之前引入一個溫度引數 τ(temperature),使其略大於 1,以銳化分佈、恢復長程注意力峰值。該溫度可以在微調階段與模型引數一起學習,或根據擴充套件長度公式化計算。
3.4 微調實施流程
- 步驟一:準備少許(通常 500–2000 條)長文本監督微調(SFT)樣本,文本長度從 16K 到 128K 不等,確保覆蓋目標視窗。
- 步驟二:將 RoPE 的頻域基頻按 YaRN 方法重新縮放,並將注意力溫度設為初始值。
- 步驟三:以極低學習率(2e-5 或更低)進行 SFT,僅更新原始模型引數的 0.1%–1%。
- 步驟四:驗證“大海撈針(Needle-in-a-Haystack)”“Perplexity@Length”等指標,必要時微調溫度或縮放參數。
4 關鍵引數
| 引數 | 含義 | 典型取值 | 說明 |
|---|---|---|---|
| 原始上下文長度 L₀ | 基座模型的訓練視窗 | 4K / 8K / 32K | 如 LLaMA 2 為 4K,LLaMA 3 為 8K,Qwen 1.5 為 32K |
| 目標擴充套件長度 L′ | 期望的視窗大小 | 128K / 200K / 512K | 部分廠商宣傳 1M,但有效視窗通常低於標稱 |
| 擴充套件倍數 s = L′/L₀ | 插值縮放比 | 16–128 | 倍數越大,對高頻保護要求越高 |
| RoPE 基頻 b | 決定頻率分佈的基礎值 | 10,000(LLaMA 預設)→500,000+ | 增大基頻可提高低頻解析度,是 YaRN 的常見“軟修改” |
| NTK 高頻保護因子 α | 控制高頻維度縮放程度的超參 | 1.0(無保護)~ 2.0 | α 越大,高頻維度越接近原樣,短上下文保持越好 |
| 注意力溫度 τ | Softmax 溫度 | 1.0–1.2 | 補償長序列注意力分佈平坦現象 |
| 最大序列長度限制 | 部署時硬截斷長度 | 等於 L′ 或略大 | 受 GPU 記憶體約束,實際使用時動態批處理受限 |
資料來源:引數定義與典型取值來自 YaRN 原始論文(Peng et al., 2023)及開源社群實踐。LLaMA 基頻源自 Meta 公開技術報告。公開資料未見 2024 年有關這些引數的統一行業標準文件。
5 技術路線
5.1 位置編碼插值家族
- 線性插值(Linear PI):直接對位置索引做 uniform 縮放,實現簡單,但短程效能衰退嚴重。
- NTK‑aware(NTK‑by‑parts):與 YaRN 同期或稍早,原理是僅對低頻維度插值,但缺乏溫度校正和動態推論。
- YaRN:結合分頻插值 + 溫度校正 + 動態推論,構成一套完整解決方案,是 2023 年後開源長上下文微調最主流的基礎 recipe。
- LongRoPE:2024 年由 Microsoft 提出,進一步引入搜尋演算法找尋最優 RoPE 基頻,並將視窗擴充套件至 2M+ tokens,但需要更多算力進行超參搜尋。
- Self-Extend:無需微調,直接通過修改注意力掩碼和位置對映來延長視窗,快捷但精度略低。
5.2 其他長上下文技術路線
- 稀疏注意力/分塊注意力:如 Longformer、BigBird 以犧牲部分精度換取線性複雜度,但與插值路線正交,可疊加。
- 外推+增量式訓練:代表為 Anthropic 的 Claude 系列、OpenAI 的 GPT‑4 Turbo,通過大規模長文本預訓練獲得長上下文,效果好但成本極高。
- 狀態空間模型(SSM)替代 Transformer:如 Mamba、RWKV,範式層面解決長序列的平方複雜度問題,但生態尚在早期。
5.3 路線對比
| 路線 | 成本 | 精度保留 | 工業落地成熟度 | 代表 |
|---|---|---|---|---|
| YaRN 類插值 + SFT | 極低 | 良好(短程幾乎無損) | 極高 | LLaMA-YaRN, Yi-200K |
| 從頭長上下文預訓練 | 極高 | 優秀 | 高(頭部實驗室) | Claude 3, GPT‑4 128K |
| Self-Extend(無微調) | 零額外成本 | 中 | 中 | 部分 llama.cpp 最佳化 |
| LongRoPE 搜尋+微調 | 中等 | 優秀 | 上升中 | LongRoPE‑LLaMA |
6 上游
6.1 算力硬體
- GPU:長視窗微調與推論依賴大視訊記憶體 GPU。在 2024 年主流配置為 NVIDIA H100(80GB)或 A100(80GB),用於 7B 模型 128K 微調時至少需要 4–8 卡,推論單卡大約支撐 64K–128K BF16 推論。
- HBM 及頻寬:注意力計算對記憶體頻寬極度敏感,HBM3/HBM3e 的頻寬(每卡 >3TB/s)是保證長上下文推論延遲的硬體基礎。據 TrendForce 2024 年資料,HBM 在資料中心 GPU 的滲透率已超 85%,需求年增 60%+。
- 定製晶片:部分雲端廠商嘗試推論專用 ASIC,但長上下文場景對軟體生態要求高,2024 年仍以 NVIDIA GPU 為絕對主流(據 IDC 2024 年報告,中國 AI 伺服器 GPU 市場 NVIDIA 份額約 92%,口徑含單價折算)。
6.2 雲端與基礎設施
- 雲端服務平台:AWS、Google Cloud、Azure 提供支援長上下文推論的 GPU 例項,代表例項規格如 p4d/p5(AWS)、A3(GCP)、NDm_v4(Azure)。阿里雲端、華為雲端、騰訊雲端也推出對應 A800/H800 叢集服務。
- 推論引擎:vLLM、Hugging Face TGI、TensorRT‑LLM 均針對長序列推論進行了最佳化,如 PagedAttention、連續批處理、KV-cache 量化等。YaRN 模型往往通過這些引擎和 llama.cpp 生態快速工程化。
- 資料基礎設施:長上下文微調需要大量長文本語料,資料清洗、去重、視窗切片工具鏈(如 Dolma、RedPajama 資料集提供方)成為重要上游。公開資料未見專門針對 YaRN 訓練資料供給的第三方市場規模估算,但長文本資料標註與合規模板的市場間接被增長拉動。
7 下游
7.1 垂直行業應用
- 法律與合規:律所或企業法務使用超長上下文模型一次性審查數百頁合同、判例文書。例如,國內某法律科技廠商 2024 年初推出基於 128K 模型的服務,用於併購盡調,據其官網案例顯示處理效率提升 4 倍(來源:該公司公開案例頁,未揭露具體財務資料)。
- 金融服務:投研機構用長上下文模型提取貫穿多年財報、電話會議紀要的資訊,生成跨週期對比分析。公開資料未見 2023—2024 年基於 YaRN 模型生成的直接營收統計。
- 醫療與生命科學:基因組序列(如全外顯子組 30M+ tokens)和蛋白質組文獻分析是典型長序列場景,部分生物技術公司已將長上下文 LLM 用於候選靶點挖掘,但具體技術方案未公開。
- 教育與企業培訓:一次性上傳整本教材或培訓手冊,實現細粒度問答。
7.2 軟體開發生態
- AI‑IDE 與程式碼助手:基於長上下文的程式碼庫級補全、重構和程式碼稽核。如 Sourcegraph Cody 引入長上下文模型後,能跨多個檔案進行解釋。GitHub Copilot 尚未公佈其具體上下文擴充套件路徑。
- 開源社群工具:Hugging Face Hub 上有大量 YaRN 微調模型(如
NousResearch/Yarn-Llama-2-7b-128k)下載量截至 2024 年超過 30 萬次(來源:HF 公開資料),推動下游應用民主化。 - 本地私有大型模型:企業內部使用 llama.cpp + YaRN 模型部署長文件問答系統,無需聯網,滿足合規需求。
7.3 新興承載形態
- Agent 架構:LangChain、AutoGPT 等架構將長上下文 LLM 作為持續性 Agent 的記憶骨幹,實現跨 session 的任務追蹤。
- 多模態長文件:部分研究將 YaRN 思路擴充套件至影片/音訊的時序位置編碼,但 2024 年仍處於學術預研階段,尚未形成商業產品。
8 受益公司
8.1 直接技術供應商
- Meta:LLaMA 系列開源模型是 YaRN 最大的應用載體,間接鞏固了 Meta 在開源大型模型生態的號召力。據 2024 年 Meta Q1 財報電話會,未單獨拆分因開源模型帶來的商業收益。
- Mistral AI:2023 年成立的法國公司,其 Mistral 7B/8x22B 支援原生 32K,社群大量採用 YaRN 將其擴充套件至 128K+,加速了其商業 API 與授權模式的落地。
- Together AI:提供基於 YaRN 的長上下文推論服務與微調平台,主打低成本按需 API。2024 年其官網公開定價顯示長上下文推論溢價約 2–4 倍(相比 4K)。該公司未上市,公開資料未見其營收資料。
- Anyscale:Ray 架構和推論服務提供社群版 YaRN 微調 recipe,增加了平台粘性。
8.2 國內主要玩家
- 百川智慧:Baichuan2-192K 採用類似插值 + SFT 路線,2023 年釋出,主要賦能其垂直行業模型與搜尋增強服務。未揭露具體營收。
- 月之暗面:Kimi 智慧助手以“20 萬字上下文”為核心賣點,2024 年初在國內大型模型對話類產品中出圈。據公開報道,其使用的長上下文技術部分類比 YaRN,但增加了自研工程最佳化。2024 年 2 月月之暗面完成超 10 億美元融資(來源:多個媒體報道),但未揭露長上下文模組的直接營收。
- 零一萬物:Yi-34B-200K 等模型直接在 Hugging Face 釋出,下載量居國產模型前列,通過零一萬物開放平台輸出 API 服務,但公開資料未見 2024 年來自長上下文 API 的營收單列資料。
- 智譜 AI:GLM-4 系列支援 128K 視窗,集成於其開放平台與企業解決方案,2024 年 3 月開發者大會上公開聲稱日均 token 呼叫量超千億,但未拆分長上下文 token 佔比。
8.3 算力與雲端基礎設施受益方
- NVIDIA、AMD(硬體);AWS、Azure、阿里雲端、華為雲端(服務)均間接受益於長上下文對高吞吐推論硬體的消耗拉動。據 Omdia 資料,2024 年全球 AI 雲端推論市場營收預計年增率增長 78%,其中長文本需求被視為關鍵驅動因素之一。
9 市場規模
- 全球 LLM 市場基底:Grand View Research 2024 年 4 月釋出報告預測,全球大型語言模型市場將從 2024 年的 65.4 億美元增長至 2030 年的 403.2 億美元(CAGR 35.4%),但報告未將“長上下文技術”作為獨立細分項。
- 長上下文推論滲透率:公開資料未見針對 YaRN 類插值技術所支撐推論量的獨立統計。但結合雲端廠商推論 token 用量比例可做定性判斷:2024 年某頭部雲端廠商交流會透露,超過 32K 上下文請求佔大型模型推論 token 消耗的比例從 2023 年初的 <5% 升至 2024 年 Q2 的 25% 以上(來源:行業電話會紀要,未具名廠商),若行業同向,則長上下文推論市場可達數十億美元級別。
- 長文本資料處理與微調服務:間接市場,據 MarketsandMarkets 2023 年 12 月報告,全球 AI 訓練資料服務市場 2023 年約 19 億美元,並受長上下文資料需求推動保持年增 25%+。但未專門拆分針對 YaRN 的資料整理服務。
- 中國專精市場:賽迪顧問 2024 年 6 月釋出《中國人工智慧市場研究年度報告》提到,中國 AI 大型模型及平台服務市場 2023 年規模約 189 億元,預計 2026 年突破 800 億元。長上下文作為模型能力標配,未單獨核算,但可視為系統級能力帶動份額。
注:以上所有數字均標明年份、口徑及來源,僅呈現第三方機構資料,不作預測與投資建議。
10 玩家對比
10.1 開源模型長上下文微調方案
| 玩家 | 模型/方案 | 聲稱視窗 | 路線特點 | 吞吐/延遲最佳化 | 開放度 |
|---|---|---|---|---|---|
| 社群 YaRN | YA LLaMA 2 7B‑128K | 128K | 標準 YaRN SFT | 中等,依賴社群推論引擎 | 全開源 |
| Meta | LLaMA 3 8K 原生 | 8K(原生) | 原生訓練 8K,社群用 YaRN 擴充套件至 128K+ | 官方不提供長視窗最佳化 | 開源權重 |
| Mistral | Mistral 7B 0.1‑0.2 | 原生 32K | 高 RoPE 基頻 1M,易擴充套件 | vLLM/TGI 支援好 | 開源權重 |
| 百川智慧 | Baichuan2‑192K | 192K | 類 YaRN 插值 + 自有長文本 SFT 資料 | 最佳化未公開 | 部分開源/API |
| 零一萬物 | Yi‑34B‑200K | 200K | 高基頻 + 類似 NTK + SFT | 提供量化版本 | 開源權重 |
| 智譜 AI | GLM‑4‑128K | 128K | 自研位置編碼擴充套件,非純 RoPE | 閉源最佳化 | API/部分庫 |
| 月之暗面 | Kimi (Moonshot) | 200K 字元 | 自研長上下文引擎,引用 YaRN 思路 | 高併發、低首 token 延遲 | 僅 API/產品 |
資料來源:各公司官網、模型卡、技術報告(2023-2024)。延遲/吞吐資料多來自社群評測及廠商公開 Benchmark,因測試條件差異不宜直接橫向對比。
10.2 閉源廠商(間接競品)
- OpenAI GPT‑4 Turbo:2023 年底推出 128K 視窗,基於大規模預訓練實現,無需插值。
- Anthropic Claude 3:支援 200K 上下文,強調“大海撈針”準確率超過 99%。使用長上下文預訓練路線。
- 兩者作為閉源 API,與 YaRN 路線不存在直接產品競爭,但壓迫開源長上下文模型的實際可用度上限,倒逼社群加速迭代。
11 風險
11.1 技術可靠性與工程風險
- Lost in the Middle:多項研究(Liu et al., 2023)表明,即使擴充套件至 128K,模型對視窗中間部分的資訊召回率顯著低於兩端。在某社群評測中,多數 128K 模型在 60%–80% 位置的海撈針準確率不足 50%(來源:OpenCompass 2024 年長上下文評測排行榜)。這意味著營銷層面的 128K 不等於有效使用長度。
- 幻覺與可靠性:超長上下文引入了更多無關資訊,模型容易在長程依賴中以更隱蔽的形式產生幻覺,不易察覺。目前尚無權威機構量化 YaRN 引入的額外幻覺風險。
- 推論成本非可控:注意力平方複雜度使得從 32K 翻倍至 64K 時,推論延時與成本可能增加 3–5 倍。雖然 FlashAttention v2/v3 等加速演算法可壓縮增長階梯,但部署長上下文仍需較高投入,可能侵蝕 SaaS 廠商獲利。公開資料未見 2024 年專門針對 YaRN 全棧最佳化下各長度推論 GPU 小時的系統性統計。
11.2 資料與監管風險
- 資料版權與合規:長上下文微調常使用書籍、論文、報表等受版權保護材料,若清洗不徹底,可能引發法律糾紛。
- 安全對齊難度加大:超長 prompt 注入更隱蔽的安全漏洞可能性增大,對模型 red-teaming 提出更高要求。歐盟《人工智慧法案》(2024 年生效)對高風險 AI 系統的上下文範圍未作具體限定,但透明度義務可能施加額外合規成本。
- 標準缺失:缺乏統一的“有效上下文”評價標準,廠商各自宣傳,使用者難以橫向比較,潛在監管糾紛風險。
11.3 競爭與替代風險
- 技術路線被超越:若 SSM 類模型(如 Mamba、RWKV)實現在效能和生態上的超越,或更高效的注意力替代結構(如 Hyena 系列)落地,YaRN 類插值技術可能迅速過時。
- 頭部廠商封鎖效應:閉源 API 提供更穩定的長上下文體驗且不斷降價,將擠壓靠開源插值建置長上下文能力的同質化創業公司空間。
12 誤讀糾偏
-
“YaRN 是模型” YaRN 不是模型,而是一種位置編碼擴充套件方法。它本身沒有引數,必須依附在基座模型(如 LLaMA)上,通過輕量微調實現能力增強。市場上找不到“YaRN 模型”這個產品,只有應用了 YaRN 方法的模型。
-
“用了 YaRN 就能 100% 利用所有視窗” 實際有效利用長度遠低於標稱視窗。YaRN 只是把理論天花板抬高,但注意力分佈的自然衰減、訓練資料中長文本分佈不均等因素,都會導致遠端依賴準確度下降。目前業界共識是“可用長度 ≈ 標稱視窗的 60%–80%”。
-
“YaRN 免費無成本” 雖然方法本身開放,但應用它仍然需要 GPU 時間進行微調,推論算力需求和工程複雜度也因為長序列而上升。低成本是相對於預訓練或從頭長文本訓練而言,不等於零成本。
-
“只有 LLaMA 才能用 YaRN” YaRN 並不繫結特定模型,任何使用 RoPE 的 Transformer 架構都可以適配。Mistral、Yi、Falcon(部分)都已經成功社群適配,理論上 Qwen 等非 RoPE 模型(如 Qwen 1.5 部分模型已切換 RoPE)也可以通過先適配位置編碼復現。
-
“YaRN 是最終狀態” 技術快速演進,後來的 LongRoPE(2024)已將視窗擴充套件到 2M,Self‑Extend 實現免微調擴充套件,YaRN 更像是一個里程碑而非終點。
13 最新事件
- 2023 年 11 月:YaRN 論文首次釋出於 arXiv(Peng et al.),程式碼開源。
- 2024 年 1 月:Nous Research 釋出的 YaRN‑LLaMA‑2‑7B‑128k 模型在 Hugging Face 日下載量迅速攀升,帶動社群二次開發;同期 Hugging Face Transformers 更新至 4.39 版,原生新增 YaRN 縮放支援。
- 2024 年 3 月:零一萬物釋出 Yi‑34B‑200K,對比前代顯著提升大海撈針得分(據其公開發布技術部落格,200K 視窗內 needle recall > 99%)。
- 2024 年 4 月:llama.cpp 在推論架構中增強 YaRN 動態插值引數調整,使用者無需重新微調即可在推論時切換上下文長度。
- 2024 年 6 月:智譜在 GLM‑4‑128K 釋出時透露,其位置編碼二次縮放方法與 YaRN 同源,並引入動態溫度校準。同月,微軟開源 LongRoPE,將 YaRN 路線下的最高上下文視窗推至 2M,但需要額外的搜尋與微調成本。
- 2024 年 8 月(傳聞):Hugging Face 內部專案探索將 YaRN/LongRoPE 擴充套件至多模態模型影像 patch 的位置編碼,暫未正式公開(來源:X 上相關研究者的預告帖,尚未有論文)。
- 中國政策:2024 年國家網信辦《生成式人工智慧服務管理暫行辦法》持續細化,要求具有長上下文能力的模型必須額外說明安全對抗測試結果,非合規模型不得上線。
14 追蹤指標
- 上下文有效利用率 用“大海撈針”(Needle‑in‑a‑Haystack)測試在不同深度位置(0%、20%、40%、60%、80%、100%)放置關鍵資訊的召回準確率,繪製 2D 熱力圖。關注 80% 位置以上召回 > 90% 的模型比例(社群排行榜如 OpenCompass CompassBench、LMSys 長上下文 Leaderboard 更新頻率不定期)。
- Perplexity 隨長度衰減曲線 衡量模型在長序列上的語言建模困惑度(PPL)增長率。優秀的 YaRN 微調模型 PPL 在其擴充套件視窗內應呈近乎水平線。資料來源:各模型技術報告與社群評測。
- 推論吞吐與延遲 記錄不同上下文長度(4K/32K/64K/128K)下每 token 的首延遲與總體生成速度(tokens/s),以及所需 GPU 視訊記憶體。評測基準:各推論引擎的公開 Benchmark 和雲端服務商定價帶的隱含指標。
- 生態整合度 Hugging Face Hub 上 tagged “YaRN” 及使用 RoPE scaling 相關引數的模型數量(截至 2024 年 12 月 經查詢約 580+ 個,來源 HF 公開);llama.cpp 等社群引擎中對 YaRN 支援的 Git 提交頻次。
- 政策與標準 關注中國《生成式人工智慧服務安全基本要求》等強制國標徵求意見稿中是否對長上下文安全性提出量化指標。國際方面追蹤 IEEE P3393 等 AI 系統性能評估標準是否納入上下文有效範圍。
- 商業滲透率 統計主流大型模型 API 提供者中,提供 128K 及以上上下文 API 的比例,以及長上下文 token 處理的公開定價變動。該資料需定期抓取雲端廠商和模型即服務平台定價頁,非單一固定來源。
15 信源
- Peng, B., Quesnelle, J., Yun, S., & Pellom, B. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071. [Link]
- Bloc97 (2023). NTK‑Aware Scaled RoPE allows LLaMA to have longer contexts. Reddit / Hugging Face blog.
- Chen, S. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Liu, N.F. et al. (2023). Lost in the Middle: How Language Models Use Long Contexts. arXiv:2307.03172.
- Meta AI. LLaMA 2: Open Foundation and Fine‑Tuned Chat Models (2023). arXiv:2307.09288. 及 LLaMA 3 官方部落格 (2024).
- Grand View Research. (April 2024). Large Language Model Market Size, Share & Trends Analysis Report, 2024–2030. [Press release]
- MarketsandMarkets. (December 2023). AI Training Dataset Market – Global Forecast to 2028.
- Omdia. (2024). AI Inference Cloud Services Market Tracker. (摘要公開)
- 賽迪顧問. (2024 年 6 月). 《2023‑2024 中國人工智慧市場研究年度報告》.
- OpenCompass. Long Context Evaluation Leaderboard. (持續更新) https://opencompass.org.cn/leaderboard-longcontext
- Hugging Face. Transformers Documentation – RoPE scaling. https://huggingface.co/docs/transformers/main/en/model_doc/llama
- 各公司官網與公開技術報告:零一萬物 Yi 模型說明,百川智慧 Baichuan2 技術報告,智譜 AI GLM 公開文件,月之暗面 Kimi 技術解讀等 (2023‑2024).
- llama.cpp GitHub 倉庫及 Release Notes (2024).
- 國家網信辦《生成式人工智慧服務管理暫行辦法》(2023) 及後續細則動態。
免責宣告:本文所有資訊均來自公開研究論文、行業報告、公司公告及社群資源,截至 2024 年 12 月。任何財務、市場、產能數字均標明年份、口徑和來源。不確定處已註明“公開資料未見”。內容僅供產業認知與技術討論,不構成任何投資、買賣建議或價格預測。