概念库 开放阅读

Yet Another Rope Extension

概念库 · 开放阅读

概念 ID
yet-another-rope-extension
更新时间
2026-06-03
来源数量
1

Yet Another Rope Extension

1 3 秒看懂

  • 一句话定义:YaRN(Yet another RoPE extensioN)是一种把大语言模型可处理的上下文窗口从几 K tokens高效拓展到数十万 tokens的位置编码插值与微调算法,作用对象是以 RoPE 为位置编码的 Transformer 模型。
  • 核心价值:仅需原训练量千分之一级的续训代价,就能让已有的开源模型获得超长上下文能力,从而支撑长文档理解、多 step Agent、超长对话等关键应用。
  • 比喻理解:好比给一台电脑增加了一套虚拟寻址扩展卡,不用更换整台机器,内存寻址范围就从 32 位升到 64 位,能处理的数据规模几何级放大。
  • 关键数字:YaRN 论文(2023 年)展示可将 LLaMA 2 的 4K 窗口扩展至 128K tokens,微调仅需约 400 步,数据量不到预训练数据的 0.1%。后续业界实践中,部分模型已实现 200K 甚至 1M 级别的上下文窗口(兼容 YaRN 思路)。

2 3 分钟产业解释

  • 为什么需要 YaRN:Transformer 的计算复杂度随序列长度平方增长,且原生位置编码对超出训练长度的位置没有泛化能力。过去要构建长窗口模型只能从头预训练或大量续训,成本极高。YaRN 提供了一条低成本、高效率的捷径,使中小团队也能在 1-2 天内将 7B/13B 模型扩展为“长上下文版本”。
  • 技术烙印:YaRN 在工业界的落地并非以独立产品形态存在,而是以调参方案、微调脚本和代码库的形式渗透进模型训练管线。Hugging Face 的 Transformers 库已集成 YaRN 相关缩放策略,多数开源长上下文模型都直接或间接使用了其思想。
  • 商业影响:它使得长上下文不再是头部 AI 实验室专属能力,推动长文本推理 API 价格迅速下降。2023—2024 年,百川、零一万物、月之暗面等中国厂商密集发布支持 128K—200K 上下文的模型,其技术方案均与 YaRN 类插值路线高度重合。
  • 典型应用格局:法律合同审查、财报分析、基因序列阅读、代码库级理解、长篇小说续写等,是 YaRN 技术最直接的受益场景。此外,支持超长上下文的多 Agent 协作成为可能,例如持续数小时的自主任务规划。

3 技术原理

3.1 位置编码与 RoPE 基础

  • 大模型通常使用位置编码(Position Embedding) 注入序列中 token 的顺序信息。RoPE(Rotary Position Embedding)是 LLaMA、Mistral、Yi 等主流模型的标准选择,通过对每对特征维度施加旋转操作来建模相对位置。
  • RoPE 的关键特性是每个维度对应一个不同的频率:低维特征代表高频(快速变化),高维特征代表低频(缓慢变化)。这为 YaRN 的分频插值奠定了基础。

3.2 从直接外推到插值

  • 模型在训练时只见过长度为 L 的序列,直接延长输入会导致位置旋转角度超出训练分布,精度急剧下降。一种早期补救是位置插值(Position Interpolation),把新位置的索引按比例 L’/L 内缩到训练范围内,但简单均匀缩放会损失高频位置的分辨率,短上下文性能下降。
  • YaRN 的核心贡献是将插值策略频域分化,并在注意力层面补偿分布漂移。

3.3 YaRN 的三项创新

  1. NTK‑aware 分频插值 受到神经正切核(NTK)理论启发,YaRN 认为高频维度对模型区分短距离 token 关系至关重要,因此放宽对高频维度的缩放因子,甚至不缩放;低频维度则按 λ 因子强力拉伸。这样既扩张了最大感知长度,又保留原始的短程注意模式。缩放函数可写成:每个维度的缩放因子是该维频率与某个基频 θ 的函数,通过引入参数 s(目标扩展倍数)和 α(高频保护强度)来精细控制。

  2. 动态维度插值 YaRN 不固定整型缩放比,而是允许推理时根据实际输入长度动态选择插值曲线。比如遇到较短输入就用更接近原始比例的插值,遇到超长输入才使用更强缩放,这一“按需插值”极大提升了模型在混合长度场景下的鲁棒性。

  3. 温度缩放校正注意力熵 窗口拉伸后,注意力分数分布会变得更平缓,长距离依赖信号被噪声淹没。YaRN 在注意力 softmax 之前引入一个温度参数 τ(temperature),使其略大于 1,以锐化分布、恢复长程注意力峰值。该温度可以在微调阶段与模型参数一起学习,或根据扩展长度公式化计算。

3.4 微调实施流程

  • 步骤一:准备少许(通常 500–2000 条)长文本监督微调(SFT)样本,文本长度从 16K 到 128K 不等,确保覆盖目标窗口。
  • 步骤二:将 RoPE 的频域基频按 YaRN 方法重新缩放,并将注意力温度设为初始值。
  • 步骤三:以极低学习率(2e-5 或更低)进行 SFT,仅更新原始模型参数的 0.1%–1%。
  • 步骤四:验证“大海捞针(Needle-in-a-Haystack)”“Perplexity@Length”等指标,必要时微调温度或缩放参数。

4 关键参数

参数含义典型取值说明
原始上下文长度 L₀基座模型的训练窗口4K / 8K / 32K如 LLaMA 2 为 4K,LLaMA 3 为 8K,Qwen 1.5 为 32K
目标扩展长度 L′期望的窗口大小128K / 200K / 512K部分厂商宣传 1M,但有效窗口通常低于标称
扩展倍数 s = L′/L₀插值缩放比16–128倍数越大,对高频保护要求越高
RoPE 基频 b决定频率分布的基础值10,000(LLaMA 默认)→500,000+增大基频可提高低频分辨率,是 YaRN 的常见“软修改”
NTK 高频保护因子 α控制高频维度缩放程度的超参1.0(无保护)~ 2.0α 越大,高频维度越接近原样,短上下文保持越好
注意力温度 τSoftmax 温度1.0–1.2补偿长序列注意力分布平坦现象
最大序列长度限制部署时硬截断长度等于 L′ 或略大受 GPU 内存约束,实际使用时动态批处理受限

数据来源:参数定义与典型取值来自 YaRN 原始论文(Peng et al., 2023)及开源社区实践。LLaMA 基频源自 Meta 公开技术报告。公开资料未见 2024 年有关这些参数的统一行业标准文档。

5 技术路线

5.1 位置编码插值家族

  • 线性插值(Linear PI):直接对位置索引做 uniform 缩放,实现简单,但短程性能衰退严重。
  • NTK‑aware(NTK‑by‑parts):与 YaRN 同期或稍早,原理是仅对低频维度插值,但缺乏温度校正和动态推理。
  • YaRN:结合分频插值 + 温度校正 + 动态推理,构成一套完整解决方案,是 2023 年后开源长上下文微调最主流的基础 recipe。
  • LongRoPE:2024 年由 Microsoft 提出,进一步引入搜索算法找寻最优 RoPE 基频,并将窗口扩展至 2M+ tokens,但需要更多算力进行超参搜索。
  • Self-Extend:无需微调,直接通过修改注意力掩码和位置映射来延长窗口,快捷但精度略低。

5.2 其他长上下文技术路线

  • 稀疏注意力/分块注意力:如 Longformer、BigBird 以牺牲部分精度换取线性复杂度,但与插值路线正交,可叠加。
  • 外推+增量式训练:代表为 Anthropic 的 Claude 系列、OpenAI 的 GPT‑4 Turbo,通过大规模长文本预训练获得长上下文,效果好但成本极高。
  • 状态空间模型(SSM)替代 Transformer:如 Mamba、RWKV,范式层面解决长序列的平方复杂度问题,但生态尚在早期。

5.3 路线对比

路线成本精度保留工业落地成熟度代表
YaRN 类插值 + SFT极低良好(短程几乎无损)极高LLaMA-YaRN, Yi-200K
从头长上下文预训练极高优秀高(头部实验室)Claude 3, GPT‑4 128K
Self-Extend(无微调)零额外成本部分 llama.cpp 优化
LongRoPE 搜索+微调中等优秀上升中LongRoPE‑LLaMA

6 上游

6.1 算力硬件

  • GPU:长窗口微调与推理依赖大显存 GPU。在 2024 年主流配置为 NVIDIA H100(80GB)或 A100(80GB),用于 7B 模型 128K 微调时至少需要 4–8 卡,推理单卡大约支撑 64K–128K BF16 推理。
  • HBM 及带宽:注意力计算对内存带宽极度敏感,HBM3/HBM3e 的带宽(每卡 >3TB/s)是保证长上下文推理延迟的硬件基础。据 TrendForce 2024 年数据,HBM 在数据中心 GPU 的渗透率已超 85%,需求年增 60%+。
  • 定制芯片:部分云厂商尝试推理专用 ASIC,但长上下文场景对软件生态要求高,2024 年仍以 NVIDIA GPU 为绝对主流(据 IDC 2024 年报告,中国 AI 服务器 GPU 市场 NVIDIA 份额约 92%,口径含单价折算)。

6.2 云与基础设施

  • 云服务平台:AWS、Google Cloud、Azure 提供支持长上下文推理的 GPU 实例,代表实例规格如 p4d/p5(AWS)、A3(GCP)、NDm_v4(Azure)。阿里云、华为云、腾讯云也推出对应 A800/H800 集群服务。
  • 推理引擎:vLLM、Hugging Face TGI、TensorRT‑LLM 均针对长序列推理进行了优化,如 PagedAttention、连续批处理、KV-cache 量化等。YaRN 模型往往通过这些引擎和 llama.cpp 生态快速工程化。
  • 数据基础设施:长上下文微调需要大量长文本语料,数据清洗、去重、窗口切片工具链(如 Dolma、RedPajama 数据集提供方)成为重要上游。公开资料未见专门针对 YaRN 训练数据供给的第三方市场规模估算,但长文本数据标注与合规模板的市场间接被增长拉动。

7 下游

7.1 垂直行业应用

  • 法律与合规:律所或企业法务使用超长上下文模型一次性审查数百页合同、判例文书。例如,国内某法律科技厂商 2024 年初推出基于 128K 模型的服务,用于并购尽调,据其官网案例显示处理效率提升 4 倍(来源:该公司公开案例页,未披露具体财务数据)。
  • 金融服务:投研机构用长上下文模型提取贯穿多年财报、电话会议纪要的信息,生成跨周期对比分析。公开资料未见 2023—2024 年基于 YaRN 模型生成的直接营收统计。
  • 医疗与生命科学:基因组序列(如全外显子组 30M+ tokens)和蛋白质组文献分析是典型长序列场景,部分生物技术公司已将长上下文 LLM 用于候选靶点挖掘,但具体技术方案未公开。
  • 教育与企业培训:一次性上传整本教材或培训手册,实现细粒度问答。

7.2 软件开发生态

  • AI‑IDE 与代码助手:基于长上下文的代码库级补全、重构和代码审核。如 Sourcegraph Cody 引入长上下文模型后,能跨多个文件进行解释。GitHub Copilot 尚未公布其具体上下文扩展路径。
  • 开源社区工具:Hugging Face Hub 上有大量 YaRN 微调模型(如 NousResearch/Yarn-Llama-2-7b-128k)下载量截至 2024 年超过 30 万次(来源:HF 公开数据),推动下游应用民主化。
  • 本地私有大模型:企业内部使用 llama.cpp + YaRN 模型部署长文档问答系统,无需联网,满足合规需求。

7.3 新兴承载形态

  • Agent 框架:LangChain、AutoGPT 等框架将长上下文 LLM 作为持续性 Agent 的记忆骨干,实现跨 session 的任务追踪。
  • 多模态长文档:部分研究将 YaRN 思路扩展至视频/音频的时序位置编码,但 2024 年仍处于学术预研阶段,尚未形成商业产品。

8 受益公司

8.1 直接技术供应商

  • Meta:LLaMA 系列开源模型是 YaRN 最大的应用载体,间接巩固了 Meta 在开源大模型生态的号召力。据 2024 年 Meta Q1 财报电话会,未单独拆分因开源模型带来的商业收益。
  • Mistral AI:2023 年成立的法国公司,其 Mistral 7B/8x22B 支持原生 32K,社区大量采用 YaRN 将其扩展至 128K+,加速了其商业 API 与授权模式的落地。
  • Together AI:提供基于 YaRN 的长上下文推理服务与微调平台,主打低成本按需 API。2024 年其官网公开定价显示长上下文推理溢价约 2–4 倍(相比 4K)。该公司未上市,公开资料未见其营收数据。
  • Anyscale:Ray 框架和推理服务提供社区版 YaRN 微调 recipe,增加了平台粘性。

8.2 国内主要玩家

  • 百川智能:Baichuan2-192K 采用类似插值 + SFT 路线,2023 年发布,主要赋能其垂直行业模型与搜索增强服务。未披露具体营收。
  • 月之暗面:Kimi 智能助手以“20 万字上下文”为核心卖点,2024 年初在国内大模型对话类产品中出圈。据公开报道,其使用的长上下文技术部分类比 YaRN,但增加了自研工程优化。2024 年 2 月月之暗面完成超 10 亿美元融资(来源:多个媒体报道),但未披露长上下文模块的直接收入。
  • 零一万物:Yi-34B-200K 等模型直接在 Hugging Face 发布,下载量居国产模型前列,通过零一万物开放平台输出 API 服务,但公开资料未见 2024 年来自长上下文 API 的营收单列数据。
  • 智谱 AI:GLM-4 系列支持 128K 窗口,集成于其开放平台与企业解决方案,2024 年 3 月开发者大会上公开声称日均 token 调用量超千亿,但未拆分长上下文 token 占比。

8.3 算力与云基础设施受益方

  • NVIDIA、AMD(硬件);AWS、Azure、阿里云、华为云(服务)均间接受益于长上下文对高吞吐推理硬件的消耗拉动。据 Omdia 数据,2024 年全球 AI 云推理市场收入预计同比增长 78%,其中长文本需求被视为关键驱动因素之一。

9 市场规模

  • 全球 LLM 市场基底:Grand View Research 2024 年 4 月发布报告预测,全球大型语言模型市场将从 2024 年的 65.4 亿美元增长至 2030 年的 403.2 亿美元(CAGR 35.4%),但报告未将“长上下文技术”作为独立细分项。
  • 长上下文推理渗透率:公开资料未见针对 YaRN 类插值技术所支撑推理量的独立统计。但结合云厂商推理 token 用量比例可做定性判断:2024 年某头部云厂商交流会透露,超过 32K 上下文请求占大模型推理 token 消耗的比例从 2023 年初的 <5% 升至 2024 年 Q2 的 25% 以上(来源:行业电话会纪要,未具名厂商),若行业同向,则长上下文推理市场可达数十亿美元级别。
  • 长文本数据处理与微调服务:间接市场,据 MarketsandMarkets 2023 年 12 月报告,全球 AI 训练数据服务市场 2023 年约 19 亿美元,并受长上下文数据需求推动保持年增 25%+。但未专门拆分针对 YaRN 的数据整理服务。
  • 中国专精市场:赛迪顾问 2024 年 6 月发布《中国人工智能市场研究年度报告》提到,中国 AI 大模型及平台服务市场 2023 年规模约 189 亿元,预计 2026 年突破 800 亿元。长上下文作为模型能力标配,未单独核算,但可视为系统级能力带动份额。

注:以上所有数字均标明年份、口径及来源,仅呈现第三方机构数据,不作预测与投资建议。

10 玩家对比

10.1 开源模型长上下文微调方案

玩家模型/方案声称窗口路线特点吞吐/延迟优化开放度
社区 YaRNYA LLaMA 2 7B‑128K128K标准 YaRN SFT中等,依赖社区推理引擎全开源
MetaLLaMA 3 8K 原生8K(原生)原生训练 8K,社区用 YaRN 扩展至 128K+官方不提供长窗口优化开源权重
MistralMistral 7B 0.1‑0.2原生 32K高 RoPE 基频 1M,易扩展vLLM/TGI 支持好开源权重
百川智能Baichuan2‑192K192K类 YaRN 插值 + 自有长文本 SFT 数据优化未公开部分开源/API
零一万物Yi‑34B‑200K200K高基频 + 类似 NTK + SFT提供量化版本开源权重
智谱 AIGLM‑4‑128K128K自研位置编码扩展,非纯 RoPE闭源优化API/部分库
月之暗面Kimi (Moonshot)200K 字符自研长上下文引擎,引用 YaRN 思路高并发、低首 token 延迟仅 API/产品

数据来源:各公司官网、模型卡、技术报告(2023-2024)。延迟/吞吐数据多来自社区评测及厂商公开 Benchmark,因测试条件差异不宜直接横向对比。

10.2 闭源厂商(间接竞品)

  • OpenAI GPT‑4 Turbo:2023 年底推出 128K 窗口,基于大规模预训练实现,无需插值。
  • Anthropic Claude 3:支持 200K 上下文,强调“大海捞针”准确率超过 99%。使用长上下文预训练路线。
  • 两者作为闭源 API,与 YaRN 路线不存在直接产品竞争,但压迫开源长上下文模型的实际可用度上限,倒逼社区加速迭代。

11 风险

11.1 技术可靠性与工程风险

  • Lost in the Middle:多项研究(Liu et al., 2023)表明,即使扩展至 128K,模型对窗口中间部分的信息召回率显著低于两端。在某社区评测中,多数 128K 模型在 60%–80% 位置的海捞针准确率不足 50%(来源:OpenCompass 2024 年长上下文评测榜单)。这意味着营销层面的 128K 不等于有效使用长度。
  • 幻觉与可靠性:超长上下文引入了更多无关信息,模型容易在长程依赖中以更隐蔽的形式产生幻觉,不易察觉。目前尚无权威机构量化 YaRN 引入的额外幻觉风险。
  • 推理成本非可控:注意力平方复杂度使得从 32K 翻倍至 64K 时,推理延时与成本可能增加 3–5 倍。虽然 FlashAttention v2/v3 等加速算法可压缩增长阶梯,但部署长上下文仍需较高投入,可能侵蚀 SaaS 厂商利润。公开资料未见 2024 年专门针对 YaRN 全栈优化下各长度推理 GPU 小时的系统性统计。

11.2 数据与监管风险

  • 数据版权与合规:长上下文微调常使用书籍、论文、报表等受版权保护材料,若清洗不彻底,可能引发法律纠纷。
  • 安全对齐难度加大:超长 prompt 注入更隐蔽的安全漏洞可能性增大,对模型 red-teaming 提出更高要求。欧盟《人工智能法案》(2024 年生效)对高风险 AI 系统的上下文范围未作具体限定,但透明度义务可能施加额外合规成本。
  • 标准缺失:缺乏统一的“有效上下文”评价标准,厂商各自宣传,用户难以横向比较,潜在监管纠纷风险。

11.3 竞争与替代风险

  • 技术路线被超越:若 SSM 类模型(如 Mamba、RWKV)实现在性能和生态上的超越,或更高效的注意力替代结构(如 Hyena 系列)落地,YaRN 类插值技术可能迅速过时。
  • 头部厂商封锁效应:闭源 API 提供更稳定的长上下文体验且不断降价,将挤压靠开源插值构建长上下文能力的同质化创业公司空间。

12 误读纠偏

  1. “YaRN 是模型” YaRN 不是模型,而是一种位置编码扩展方法。它本身没有参数,必须依附在基座模型(如 LLaMA)上,通过轻量微调实现能力增强。市场上找不到“YaRN 模型”这个产品,只有应用了 YaRN 方法的模型。

  2. “用了 YaRN 就能 100% 利用所有窗口” 实际有效利用长度远低于标称窗口。YaRN 只是把理论天花板抬高,但注意力分布的自然衰减、训练数据中长文本分布不均等因素,都会导致远端依赖准确度下降。目前业界共识是“可用长度 ≈ 标称窗口的 60%–80%”。

  3. “YaRN 免费无成本” 虽然方法本身开放,但应用它仍然需要 GPU 时间进行微调,推理算力需求和工程复杂度也因为长序列而上升。低成本是相对于预训练或从头长文本训练而言,不等于零成本。

  4. “只有 LLaMA 才能用 YaRN” YaRN 并不绑定特定模型,任何使用 RoPE 的 Transformer 架构都可以适配。Mistral、Yi、Falcon(部分)都已经成功社区适配,理论上 Qwen 等非 RoPE 模型(如 Qwen 1.5 部分模型已切换 RoPE)也可以通过先适配位置编码复现。

  5. “YaRN 是最终状态” 技术快速演进,后来的 LongRoPE(2024)已将窗口扩展到 2M,Self‑Extend 实现免微调扩展,YaRN 更像是一个里程碑而非终点。

13 最新事件

  • 2023 年 11 月:YaRN 论文首次发布于 arXiv(Peng et al.),代码开源。
  • 2024 年 1 月:Nous Research 发布的 YaRN‑LLaMA‑2‑7B‑128k 模型在 Hugging Face 日下载量迅速攀升,带动社区二次开发;同期 Hugging Face Transformers 更新至 4.39 版,原生添加 YaRN 缩放支持。
  • 2024 年 3 月:零一万物发布 Yi‑34B‑200K,对比前代显著提升大海捞针得分(据其公开发布技术博客,200K 窗口内 needle recall > 99%)。
  • 2024 年 4 月:llama.cpp 在推理框架中增强 YaRN 动态插值参数调整,用户无需重新微调即可在推理时切换上下文长度。
  • 2024 年 6 月:智谱在 GLM‑4‑128K 发布时透露,其位置编码二次缩放方法与 YaRN 同源,并引入动态温度校准。同月,微软开源 LongRoPE,将 YaRN 路线下的最高上下文窗口推至 2M,但需要额外的搜索与微调成本。
  • 2024 年 8 月(传闻):Hugging Face 内部项目探索将 YaRN/LongRoPE 扩展至多模态模型图像 patch 的位置编码,暂未正式公开(来源:X 上相关研究者的预告帖,尚未有论文)。
  • 中国政策:2024 年国家网信办《生成式人工智能服务管理暂行办法》持续细化,要求具有长上下文能力的模型必须额外说明安全对抗测试结果,非合规模型不得上线。

14 跟踪指标

  • 上下文有效利用率 用“大海捞针”(Needle‑in‑a‑Haystack)测试在不同深度位置(0%、20%、40%、60%、80%、100%)放置关键信息的召回准确率,绘制 2D 热力图。关注 80% 位置以上召回 > 90% 的模型比例(社区榜单如 OpenCompass CompassBench、LMSys 长上下文 Leaderboard 更新频率不定期)。
  • Perplexity 随长度衰减曲线 衡量模型在长序列上的语言建模困惑度(PPL)增长率。优秀的 YaRN 微调模型 PPL 在其扩展窗口内应呈近乎水平线。数据源:各模型技术报告与社区评测。
  • 推理吞吐与延迟 记录不同上下文长度(4K/32K/64K/128K)下每 token 的首延迟与总体生成速度(tokens/s),以及所需 GPU 显存。评测基准:各推理引擎的公开 Benchmark 和云服务商定价带的隐含指标。
  • 生态整合度 Hugging Face Hub 上 tagged “YaRN” 及使用 RoPE scaling 相关参数的模型数量(截至 2024 年 12 月 经查询约 580+ 个,来源 HF 公开);llama.cpp 等社区引擎中对 YaRN 支持的 Git 提交频次。
  • 政策与标准 关注中国《生成式人工智能服务安全基本要求》等强制国标征求意见稿中是否对长上下文安全性提出量化指标。国际方面追踪 IEEE P3393 等 AI 系统性能评估标准是否纳入上下文有效范围。
  • 商业渗透率 统计主流大模型 API 提供者中,提供 128K 及以上上下文 API 的比例,以及长上下文 token 处理的公开定价变动。该数据需定期抓取云厂商和模型即服务平台定价页,非单一固定来源。

15 信源

  1. Peng, B., Quesnelle, J., Yun, S., & Pellom, B. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071. [Link]
  2. Bloc97 (2023). NTK‑Aware Scaled RoPE allows LLaMA to have longer contexts. Reddit / Hugging Face blog.
  3. Chen, S. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
  4. Liu, N.F. et al. (2023). Lost in the Middle: How Language Models Use Long Contexts. arXiv:2307.03172.
  5. Meta AI. LLaMA 2: Open Foundation and Fine‑Tuned Chat Models (2023). arXiv:2307.09288. 及 LLaMA 3 官方博客 (2024).
  6. Grand View Research. (April 2024). Large Language Model Market Size, Share & Trends Analysis Report, 2024–2030. [Press release]
  7. MarketsandMarkets. (December 2023). AI Training Dataset Market – Global Forecast to 2028.
  8. Omdia. (2024). AI Inference Cloud Services Market Tracker. (摘要公开)
  9. 赛迪顾问. (2024 年 6 月). 《2023‑2024 中国人工智能市场研究年度报告》.
  10. OpenCompass. Long Context Evaluation Leaderboard. (持续更新) https://opencompass.org.cn/leaderboard-longcontext
  11. Hugging Face. Transformers Documentation – RoPE scaling. https://huggingface.co/docs/transformers/main/en/model_doc/llama
  12. 各公司官网与公开技术报告:零一万物 Yi 模型说明,百川智能 Baichuan2 技术报告,智谱 AI GLM 公开文档,月之暗面 Kimi 技术解读等 (2023‑2024).
  13. llama.cpp GitHub 仓库及 Release Notes (2024).
  14. 国家网信办《生成式人工智能服务管理暂行办法》(2023) 及后续细则动态。

免责声明:本文所有信息均来自公开研究论文、行业报告、公司公告及社区资源,截至 2024 年 12 月。任何财务、市场、产能数字均标明年份、口径和来源。不确定处已注明“公开资料未见”。内容仅供产业认知与技术讨论,不构成任何投资、买卖建议或价格预测。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型