模型层 开放阅读

输入 token

Input Tokens

概念 ID
input-tokens
更新时间
2026-05-29
来源数量
待补

输入 token

3 秒看懂

输入 token 是大语言模型(LLM)接收并理解的最小语义单元——可以把它们想象成模型“阅读”时的基本单词或子词。你给模型多少输入 token,就直接决定它一次能“看见”多少上下文,也直接影响每次调用的计算开销与延迟。

一句话辅助记忆:输入 token 是大模型与物理世界交互的“计量量子”——既是模型目光所及的单位,也是计算成本与产品体验必须精密平衡的支点。

3 分钟产业解释

在大模型 API(如 GPT‑4、Claude、Gemini)的商业化中,“输入 token”是定价和性能的核心维度。

计费模型的底层逻辑

API 通常按“每百万输入 token”收费,输入价格一般远低于输出价格(约为输出的 1/5 到 1/10)。这一价差根源于推理中预填充阶段的高并行度带来的计算效率优势。然而,实际应用中长文档、多轮对话场景往往导致输入 token 总量远超输出,成为成本主体。以客户支持类 Agent 为例,每次请求可能携带完整产品手册(数万 token)作为上下文,而输出仅为数十字的简短回答,此时输入成本可占总 API 费用的 85% 以上。

上下文窗口的竞争地位

模型训练和推理时能容纳的最大输入 token 数(如 128K、1M tokens)已成为产品竞争力的硬指标。截至 2025 年初,主流旗舰模型的窗口参数如下(数据来源:各公司官方技术文档与公开定价页):

模型/系列上下文窗口输入价格($ / 1M tokens)发布/更新时间
GPT‑4 Turbo128K10.002024 年
Claude 3.5 Sonnet200K3.002024 年 Q3
Gemini 1.5 Pro1M(正式) / 2M(实验)1.25(≤128K tokens 部分)2024 年
LLaMA 3.1 (70B)128K开源,推理价格视部署方案2024 年 7 月
Qwen 2.5128K开源2024 年 9 月

注:具体价格可能随促销与套餐调整,以上为各平台官网公布的标准费率。

系统层面的连锁反应

输入 token 数量上升会引发 Transformer 注意力机制的二次方复杂度问题,推高推理延迟、GPU 显存(尤其 KV cache)和能耗,倒逼硬件(HBM 容量、高带宽互联)与算法(稀疏注意力、长上下文外推)协同进化。

15 分钟专家深入:技术原理

从技术链路看,输入 token 连接了“文本 → 嵌入 → 计算”三步。以下按数据处理流展开,并逐层揭示关键设计取舍。

阶段一:分词——由文本到 Token ID

分词器将原始文本切分为 token ID 序列。这一步骤是所有后续计算的入口,其质量直接影响模型对语言的理解效率与单次请求的经济性。

核心算法族

  • BPE(Byte Pair Encoding):自 Sennrich 等(2016)引入神经机器翻译后,被 GPT 系列广泛采用。训练时从字符开始,反复合并最高频的相邻符号对,最终形成合并规则集。编码时贪婪应用规则,将文本拆分为子词单元。现代变体多为 byte‑level BPE,确保任何 Unicode 输入均可编码,彻底消除“集外词(OOV)”问题。
  • WordPiece:Google 用于 BERT,基于似然最大化选择合并对——每次合并选择能最大提升训练语料语言模型概率的符号对。计算成本高于 BPE,但理论上在相同词表大小下信息密度更优。
  • Unigram LM / SentencePiece:先训练一个较大的种子词表,再通过概率化删除字符逐步剪枝,保留最可能的分词方案。T5、XLNet、LLaMA 等模型采用。SentencePiece 直接处理原始文本(不依赖预分词),对多语言尤其友好。

分词示例(以 GPT‑4 风格 BPE 为例,英文):

原始文本:"The transformer revolutionized NLP"
可能切分:"The" | " transform" | "er" | " revolutionized" | " NLP"
Token IDs: [576, 43264, 298, 78532, 4633]

同一单词“transformer”被拆为“transform”和“er”,说明 token 并非字面意义上的“单词”。

阶段二:嵌入与位置编码

分词器输出的 [1, n] 维 token ID 序列,经过嵌入层(Embedding)映射为 [n, d_model] 的稠密向量矩阵。嵌入层本质是一个可训练的查找表,参数规模为 V × d_model(V 为词表大小),通常在数十亿到数百亿量级。

位置编码随后注入序列顺序信息。主流方案:

  • RoPE(Rotary Position Embedding):在注意力计算中对 Q、K 施加旋转变换,使内积仅依赖相对位置差。LLaMA 系列、Qwen 等采用。天然支持通过插值等方式扩展上下文。
  • ALiBi(Attention with Linear Biases):不学习位置嵌入,直接在注意力分数上叠加线性偏置(距离越远偏置越负),赋予模型天然的长度外推能力。
  • 绝对位置编码:原始 Transformer 使用 sine/cosine 固定编码,GPT‑3 使用可学习位置嵌入。随着上下文窗口扩张,这些方案逐渐在被 RoPE 及其变体替代。

嵌入与位置编码的输出矩阵 X ∈ R^{n×d} 构成后续所有 Transformer 层的输入。

阶段三:Transformer 计算

给定 n 个输入 token,每层自注意力的核心运算:

Q = X·W_Q, K = X·W_K, V = X·W_V          # X: [n, d_model]
Attention(Q, K, V) = softmax(Q·K^T / √d_k)·V

计算复杂度Q·K^T 产生 [n, n] 注意力矩阵,FLOPs ≈ 2·n²·d_k·num_heads(不含 softmax 和 V 的乘法)。前馈网络(FFN)对每个 token 独立计算,复杂度为 O(n·d_model·d_ff)。因此,当输入 token 数 n 较大时,注意力部分迅速成为主导——这是经典的“二次方瓶颈”。

KV Cache 与显存压力:在自回归解码中,每次仅输入新 token,但需访问历史上所有 token 的 K、V 以避免重算。缓存大小:

KV_cache_bytes = 2 · batch_size · n · num_layers · d_head · num_heads · precision_bytes

以 FP16 精度、n=128Kbatch_size=1、典型 70B 参数模型(如 LLaMA 3 70B,80 层、64 头、d_head=128)为例:

KV_cache ≈ 2 × 1 × 128000 × 80 × 128 × 64 × 2 bytes
         = 2 × 128000 × 80 × 16384 bytes
         ≈ 335 GB

这一数字已远超单张 H100(80GB HBM3)的显存容量,实际部署中需依赖多卡张量并行或减少可用上下文。

阶段四:预填充与解码的工程分离

推理过程在工程上分为两个性质迥异的阶段:

  • 预填充(Prefill):一次性摄入全部输入 token,并行计算所有层的注意力,生成首 token 并缓存每层 K/V 状态。计算是 GPU 高度友好的矩阵乘法,但 O(n²) 特性使延迟随输入长度非线性增长。以 128K 输入为例,预填充延迟可达数十秒(未优化时)。
  • 解码(Decode):每次仅输入新生成的一个 token,利用缓存 KV 计算当前 token 的注意力与 FFN。此时计算量变为 O(n·d),但需反复读取完整 KV cache,瓶颈由算力变为显存带宽。输入 token 越多→KV cache 越大→解码速度越慢(token/s 下降)。

性能数据示例(基于 vLLM v0.4.0 推断,H100,LLaMA 3 70B FP16):

输入长度预填充延迟(s)解码吞吐(tokens/s)KV Cache 占用(GB)
4K~0.02~45~10.5
32K~0.8~38~84
128K~12~25~335

注:以上为基于公开系统参数的理论推估值,具体值取决于框架优化程度与并行策略,仅供参考量级。实际 Benchmark 数据建议查阅 vLLM 与 TensorRT‑LLM 官方技术报告。

计算图简化示意

输入文本(Unicode 字符串)
  │
  ▼
分词器 ──► token IDs [1, n]
  │
  ▼
嵌入层 + 位置编码 ──► X [n, d]
  │
  ▼
┌─────────────────────────────────┐
│  Layer 1..L                     │
│  ┌─ Multi-Head Self-Attention ─┐│
│  │ Q·K^T [n,n] → Softmax → ·V ││  ←  O(n²·d)
│  └────────────────────────────┘│
│  ┌─ Feed Forward (per token) ─┐│  ←  O(n·d²)
│  └────────────────────────────┘│
└─────────────────────────────────┘
  │
  ▼
语言模型头 ──► 预测下一个 token 概率([V] 分布)

关键参数

评估输入 token 相关的模型性能与部署成本时,以下参数构成核心决策框架:

参数名称定义典型值/范围重要性说明
上下文窗口(Max Context Length)模型单次可接收的最大输入 token 数8K ~ 1M+(2025 年初)直接决定可用输入长度上限,是产品选型首要指标
分词效率(Chars per Token)平均每个 token 编码的字符数英语:3.55.0;中文:1.22.0相同字符数下,该值越高 token 消耗越少、成本越低
词表大小(Vocabulary Size)分词器可识别的唯一 token 数量32K ~ 256K越大则平均每个 token 编码字符越多,但嵌入层参数随之膨胀
预填充吞吐(Prefill Throughput)每秒可处理的输入 token 数H100 上约 1K~10K tokens/s(依赖长度和目标模型)影响首 token 延迟,长输入场景的关键体验指标
KV Cache 内存占用每增加 1K 输入 token 所需额外显存典型 70B 模型约 2.6 GB/1K tokens(FP16)直接制约并发数与最大序列长度
首 token 延迟(Time to First Token, TTFT)从请求发送到第一个生成 token 返回的时间4K 输入 <1s,128K 输入可达 10~30s用户体验的直接感知维度,长输入下为核心痛点
有效上下文利用率模型对长文本不同位置信息的实际关注度中段位置通常衰减 20%~50%(Lost in the Middle 效应)仅窗口“够大”不等于模型能“读全”,需辅助评测
输入价格API 调用中每百万输入 token 的收费$0.15 ~ $10 / 1M tokens(2025Q1)直接影响总成本,应结合预计请求长度与频次计算

其中 KV Cache 内存占用 = 2 × n × num_layers × d_head × num_heads × precision_bytes,具体推导见“技术原理”章节。建议用户在选型时根据目标最大序列长度预估算显存需求。


技术路线与对比

输入 token 的处理方案可从“分词算法”与“长上下文扩展”两个维度展开对比。

路线一:分词算法对比

维度BPE(GPT 风格)WordPiece(BERT 风格)Unigram(T5/LLaMA 等)
核心原理贪心合并最高频字节对似然最大化选择合并对概率化词表剪枝
常见词表大小32K~100K(LLaMA2 32K, GPT‑4 ~100K)28K~32K(BERT 30K)32K~256K
平均字符/Token 比(英)约 4.0约 4.5约 3.5~4.0
OOV 处理字节级回退,彻底无 OOV拆为字符,基本无 OOV支持字符回退
训练速度快(贪心合并)较慢(需多轮似然评估)慢(需训练 LM 并剪枝)
多语言友好度byte‑level BPE 较好需特殊预处理SentencePiece 原生支持多语言
代表模型GPT‑2/3/4、Claude 系列BERT、ALBERTT5、XLNet、LLaMA、Gemma

趋势研判:BPE 系因训练简便、OOV 处理鲁棒,已成为当前大模型(尤其 GPT/Claude 系)的主流选择。Unigram/SentencePiece 在开源社区有广泛应用(LLaMA 系列),二者在分词效率上的差距正逐渐缩小。字符/Token 比受语种影响显著——中文用户在选择模型时应特别关注自身应用的主要语言,可比对同文本在不同分词器下的 token 消耗实测数据。

路线二:长上下文扩展技术对比

技术原理优点缺点代表工作/模型
RoPE 线性插值将位置索引等比缩放至原训练范围实现简洁,零额外训练高频信息丢失,远距离分辨力下降早期 LLaMA 扩展方案
NTK‑aware 插值低维高频区少缩放,高维低频区多缩放保留更多局部信息,扩展效果更好实现略复杂LLaMA‑2‑7B‑32K 等
YaRNNTK‑aware + 温度系数控制注意力熵进一步稳定超长上下文注意力需微调适配温度参数LLaMA 2 128K 微调
ALiBi不学习位置嵌入,在线性衰减偏置天然外推,不依赖位置嵌入训练固定偏置形式牺牲部分灵活性BLOOM、早期 Anthropic 模型
稀疏注意力限制 token 仅关注局部或特定模式的远距离 token降低 O(n²) 复杂度至 O(n log n)O(n√n)信息丢失风险,工程实现复杂Longformer、BigBird
状态空间模型(SSM)用线性时不变系统替代注意力(如 Mamba)复杂度降为 O(n),理论上无限长度在部分密集检索任务上精度落后于注意力Mamba、Mamba‑2、Jamba

趋势研判:2024~2025 年,RoPE + NTK‑aware 插值/YaRN 已成为开源社区扩展上下文的主流范式,让 8K 基础模型通过轻度微调就具备 128K 甚至 1M 窗口。状态空间模型作为“注意力替代”的方案正在快速追赶,但在需要精确长程依赖的复杂推理任务上仍有差距。混合架构(如 Jamba 交错注意力层和 Mamba 层)可能是中期方向。


上下游产业链分析

输入 token 的技术生态可以沿“上游数据与算法 → 中游模型与引擎 → 下游应用与硬件”展开,以下按链条逐层梳理:

上游:数据、分词器与训练基础设施

  • 多语言语料库建设:分词器训练需要大规模、多领域、高质量语料,覆盖目标应用涉及的主要语种。数据清洗(去重、去噪、格式规范化、敏感信息过滤)是生产级分词器的关键前置工序。公开未见统一的语料质量标准,主流模型公司通常自建数据集且不对外开放。
  • 分词器训练工具链:以 Hugging Face tokenizers 库(Rust 实现)为代表,支持 BPE、WordPiece、Unigram 等多种算法的高效训练。部分团队使用 Google 开源的 SentencePiece 独立训练。训练速度:在典型服务器上,从数十 GB 语料训练一个 100K 词表的 BPE 分词器通常在数小时内完成。
  • 位置编码设计:RoPE 及其扩展方案正成为事实标准。理论上,位置编码的选择直接决定后续能否以轻量方式扩展上下文,是上游基础研究的重要课题。
  • 长序列数据处理管线:针对超长文档的切分、语义分段、overlap 窗口设计、元数据注入等,是让模型有效理解长输入的“预处理软工程”。

中游:模型架构与推理引擎

  • 模型架构:自注意力机制仍是主流,但稀疏注意力、SSM、混合模型正在分流。模型架构选择直接决定了输入 token 数量的边际成本曲线——是 O(n²) 还是 O(n log n)O(n)
  • 训练框架优化:长序列训练依赖序列并行(如 Megatron‑LM 的序列并行)、激活检查点与重计算策略,以在有限显存内完成数千 token 长序列的反向传播。ZeRO 系列优化(DeepSpeed)被广泛使用。
  • 推理引擎:vLLM(PagedAttention 技术,将 KV Cache 以非连续页式管理,提升显存利用率)、TensorRT‑LLM(支持 FP8、多头注意力融合)、llama.cpp(追求在消费级硬件上运行长上下文模型,支持 mmap 加载)构成了当前三大主流推理框架。各框架对长上下文的支持程度成为差异化竞争要点。

下游:API 服务、产品形态与硬件需求

  • API 服务定价:按输入/输出 token 分别计费已成行业惯例。部分厂商(如 Anthropic)对超长输入给予特定折扣或采用阶梯定价(前 128K 一个价,超量部分优惠)。缓存命中(相同前缀多次请求仅计费一次)是重要成本优化手段,截至 2025 年初,OpenAI 与 Anthropic 均支持自动/手动缓存。
  • 产品功能:超长文档 QA、法律文书分析、全量代码库理解、Agent 长会话记忆等场景直接受益于大窗口。部分企业将“上下文窗口大小”作为市场宣传的核心卖点,向非技术客户沟通“一次能处理的文件页数”。
  • 硬件需求牵引:长序列推理对显存需求显著提升。HBM 容量(H100 80GB、H200 141GB)和显存带宽(HBM3/HBM3e)成为推理卡选型的硬约束。B200(预计 2025 年量产,搭载 192GB HBM3e)正是对这一需求的回应。ADVANCED PACKAGING(CoWoS)产能直接制约高端 GPU 供给,截至 2024 年底,台积电 CoWoS 产能仍偏紧但正在扩张中。

受益公司与市场格局

以下从模型厂商、硬件供应商、工具链平台三个层次梳理主要受益方。所有信息基于公开财报、官方公告及产业报告,截至 2025 年初。

模型厂商

公司核心模型/系列最大上下文窗口输入 Token 定价策略竞争优势
OpenAIGPT‑4 Turbo / GPT‑4o128K$10/1M tokens(GPT‑4 Turbo)率先量产 128K,生态完整,市场份额领先
AnthropicClaude 3.5 系列200K$3/1M tokens(Sonnet)上下文更长,价格更低,企业文档场景渗透快
Google DeepMindGemini 1.5 Pro1M(正式)/2M(实验)$1.25/1M tokens(≤128K)最大标称窗口,MoE 降本,与 GCP 生态深度集成
MetaLLaMA 3.1 (8B/70B/405B)128K开源,按部署成本社区生态活跃,开源模型中标杆位置
阿里云Qwen 2.5 系列128K开源 + 云 API中国市场份额突出,多语言适配
Mistral AIMistral Large / Small128K / 32K$4~8/1M tokens(2024Q4)欧洲合规需求独特定位,多语种覆盖
xAIGrok 系列公开资料未见明确上限随 X Premium 捆绑与社交平台深度整合,差异化分发渠道

定价为公开标准费率,实际企业采购可能存在定制合约价。

硬件供应商

  • 英伟达(NVIDIA):其 GPU(H100/H200/B200)占据长上下文推理训练市场的主导份额。HBM 容量是推理卡 ASP 提升的关键驱动力。2024 财年(截至 2024 年 1 月)数据中心收入超 475 亿美元(来源:NVIDIA FY2024 财报)。
  • AMD:Instinct MI300X 搭载 192GB HBM3,容量超过 H100,正试图在推理负载中替代英伟达。出货量数据公开资料未见细分到长上下文推理场景。
  • SK 海力士 / 三星 / 美光:HBM 的三大供应商。SK 海力士为 HBM3/HBM3e 主要供应商,三星与美光积极扩产。2025 年 HBM 产能仍被视为高端 AI 芯片供给的瓶颈环节。

推理服务与工具链

  • Anyscale / Modal / Together AI:提供基于 vLLM 等框架的 LLM 推理即服务,间接受益于企业自部署长上下文模型的需求增长。具体收入与份额数据公开资料未见。
  • Hugging Face:tokenizers 库、transformers 生态系统为全球最大比例的模型提供了分词与推理基础设施,间接设定行业部分标准。
  • vLLM(UC Berkeley 开源):PagedAttention 技术成为长上下文推理的事实标准内存管理方案之一,被多家商业推理服务采用。

市场规模与增长趋势

输入 token 本身不构成独立市场,但作为 LLM API 调用量与推理硬件开销的核心计量单位,其规模可从 API 市场、推理芯片市场、以及长序列专用需求三个口径侧面度量。以下数据基于公开研究机构报告与企业财报中的关联披露。

API 推理市场

  • 全球 LLM API 推理市场规模:据 Grand View Research 与 Statista 数据交叉参考,2024 年约在 6090 亿美元区间,预计 2030 年达 400600 亿美元水平(CAGR 约 35%~40%)。该市场规模直接由 token 处理量(输入+输出)驱动。
  • 输入 token 占比:据多家推理服务商非正式披露(Semianalysis、Anthropic 技术博客),企业级应用中输入 token 占总 token 量的比例通常在 70%~85%,在 RAG(检索增强生成)、长文档分析、Agent 长会话等场景占比更高。因此,可以粗略推断输入 token 相关收入占 API 推理市场的 70% 以上。

推理硬件市场

  • AI 加速器市场:据 IDC 与 Mercury Research 估计,2024 年全球 AI 芯片销售额约 900~1100 亿美元(含训练与推理)。其中推理所占份额持续上升,预计到 2027 年推理占比将超过训练。
  • HBM 市场:据 TrendForce,2024 年全球 HBM 市场规模约 180220 亿美元,预计 2025 年达 280350 亿美元。大窗口推理对 HBM 容量需求是增量驱动之一,具体精细化测算公开资料未见。

长上下文专项需求(定性)

  • RAG 系统:尽管 RAG 理论上可降低对模型原生长上下文的依赖,但实践中企业越来越倾向于“RAG + 大窗口”组合——用大窗口容纳检索结果和对话历史,避免频繁裁剪上下文导致的连贯性损失。这一趋势扩张了对 128K+ 窗口的需求。
  • 代码与文档场景:GitHub Copilot、Cursor 等产品已将全仓库上下文作为高端功能测试。法律(合同全文逐条审查)、生物医药(全基因组序列)、金融(多年财报对比)等垂直领域的需求正将窗口需求从“数万 token”推向“百万 token”量级。

玩家竞争分析

从商业模式与技术路线两个轴,可将主要玩家划分为以下竞争群组:

封闭旗舰模型阵营

OpenAI vs Anthropic vs Google DeepMind

  • 窗口竞赛:Google 以 1M 标称窗口领先,但有效利用率(“大海捞针”测试成绩)的差异是真实竞争维度。Anthropic 在 200K 窗口下的实际检索准确率宣传优于早期 GPT‑4 128K,但缺乏独立第三方大规模 Benchmark。
  • 价格战:输入 token 价格呈持续下行趋势。Gemini 1.5 Pro 定价仅为 GPT‑4 Turbo 的约 1/8,反映了 MoE 架构的降本效果与 Google 自研 TPU 的成本优势。Anthropic 在同等性能档位定价低于 OpenAI。
  • 生态绑定:各自与云平台深度绑定(OpenAI+Azure,Anthropic+AWS,Gemini+GCP),企业客户常基于已有云服务商选择模型,形成间接壁垒。

开源模型阵营

Meta(LLaMA) vs 阿里(Qwen) vs Mistral

  • 窗口指标趋同:128K 已成为开源旗舰模型的“标配”,2024 年底至 2025 年初主要开源模型均达该水平。
  • 差异化方向
    • LLaMA 凭借庞大的社区生态(微调变体、量化版本、部署方案)占据开发者心智份额。
    • Qwen 在多语言(尤其东亚语言)和部分中文 Benchmark 上领先,国内企业用户覆盖度最高。
    • Mistral 在欧洲市场因合规与语言优势有独特卡位。
  • 商业模式:开源模型不直接按 token 收费,而是争夺部署生态(如 llama.cpp、Ollama、vLLM 适配优化)和企业支持服务收入。

硬件与推理基础设施层竞争

  • 英伟达 vs AMD:长上下文推理对显存的高需求打破了传统“单卡推理”的边界,多卡并行推理成为刚需。英伟达凭借 NVLink + NVSwitch 互联方案在双卡/四卡推理场景性能领先,AMD MI300X 在显存容量上(192GB vs H100 的 80GB)有单卡成本优势,但互联生态仍待追赶。
  • 推理引擎分化:商业引擎(TensorRT‑LLM)在极致性能上领先,开源引擎(vLLM、llama.cpp)在社区迭代速度与部署灵活性上占优,二者非零和竞争。

风险与制约因素

从技术、市场与供应链三个维度梳理关键风险:

技术风险

  1. 长上下文的“迷失在中段”效应:多项研究(Liu et al. 2023 “Lost in the Middle”)显示,模型对长文档中部信息的关注度显著衰减,即便上下文扩展至 128K 甚至 1M,有效利用率未必同步提升。这导致纯“窗口数字竞赛”可能无法直接转化为用户体验提升,存在技术路线误导性竞争风险。
  2. KV Cache 的内存瓶颈:如前述测算,128K 输入在 70B 模型下 KV Cache 可达数百 GB,对显存和带宽提出苛刻要求。硬件升级速度(HBM 容量年化增长约 30%50%)可能落后于窗口扩展需求(年化 410 倍),形成技术进步的物理天花板。
  3. 预填充延迟的“长尾”问题:长输入首 token 延迟与输入长度的二次方关系难以根本消除,可能导致使用体验在超长输入场景下恶化(用户等待数十秒),即使模型质量过关。
  4. 状态空间模型的成熟度不足:Mamba 等 O(n) 复杂度方案是理论希望所在,但在需要远距离精确信息检索的任务上,实际性能仍落后于优化后的 Transformer(公开资料未见 >128K 长序列上的系统对比 Benchmark)。

市场风险

  1. 价格下行侵蚀利润:输入 token 价格在 2023-2025 年间下降超过一个量级,且竞争加剧可能进一步压缩利润空间。以硅谷投资机构 a16z 的估算,推理服务的毛利率在价格战趋势下可能从 >70% 向 40%-50% 区间收敛。
  2. 开源模型的替代压力:128K 开源模型的成熟减少了企业对高价闭源 API 的依赖,尤其对价格敏感的中小企业和开发者群体。
  3. 定价模式的不确定性:按 token 计费的模式在 Agent 长时间运行任务中可能不再适用,行业可能出现向“会话时长/任务”定价的迁移,影响收入模型预期。

供应链风险

  1. HBM 产能集中:台积电 CoWoS 先进封装产能是 HBM 供给的卡口,截至 2024 年底产能仍集中在少数供应商,地缘政治与产能扩张周期均构成不确定性。
  2. 高端 GPU 供应的地缘因素:美国出口管制对高端 AI 芯片的限制,影响中国市场的 H100/H200 可及性,国内推理服务商被迫依赖国产替代或降级芯片,可能拉大技术差距。

常见误读纠偏

误读 1:“一个 token 就是一个单词”

事实:Token 经常是单词的子部分。例如“transformer”常被拆为“transform”和“er”,中文词“人工智能”可能被切分为“人工”和“智能”或更细粒度。不同分词器对同一文本的切分结果不同,token 数量也可能差异 10%~30%。用户在估算成本时,建议使用目标 API 提供的 tokenizer 工具做实测,而非简单按“1 词 ≈ 1 token”或“1 字符 ≈ X token”推算。

误读 2:“上下文窗口长就等于模型能有效利用所有输入”

事实:多项研究证实,模型注意力在长文档中呈 U 型分布——开头和结尾信息被高度关注,中部信息容易“迷失”。即使在 128K 窗口内输入,模型对第 60K~100K 位置的信息提取准确率可能仅为窗口前部的 50%~70%。因此,产品设计时不应假设“全量输入必有用”,应搭配分段摘要、检索增强等策略弥补中部信息衰减。

误读 3:“增加输入 token 数量,算力成本成比例线性增长”

事实:由于自注意力复杂度为 O(n²),输入 token 翻倍时,注意力计算量接近 4 倍(短序列时线性项仍有影响,但长序列下二次项主导)。同时 KV cache 线性膨胀进一步压制并发。总推理成本在长序列场景下呈超线性增长,简单按 token 单价乘以数量推算总成本会显著低估。企业做财务测算时,应根据目标序列长度做定制 Benchmark 而非线性外推。

误读 4:“长上下文可以完全替代 RAG”

事实:长上下文和 RAG 是互补技术,当前最优实践往往是二者结合:用 RAG 检索相关片段并提供上下文结构,用长窗口容纳检索结果和对话历史,避免频繁裁剪。长上下文窗口减少了检索分块与重构的工程复杂度,但在成本、延迟和检索可靠性上暂未完全替代 RAG。


最新事件与动态

以下梳理截至 2025 年初的产业关键更新(按时间线,来源为公司官方公告、技术报告与可验证的行业信息来源):

  • 2024 年 12 月:OpenAI 在 12 Days of OpenAI 活动中发布 o3 系列推理模型,其上下文管理与输入 token 消纳方式与标准 GPT‑4 系列存在差异,具体技术细节待进一步公开。
  • 2024 年 11 月:Anthropic 发布 Claude 3.5 Haiku 并全面降价,输入价格进一步下探;同期推出提示缓存功能,对相同前缀的重复输入仅计费一次。
  • 2024 年 10 月:Mamba‑2 正式论文公布,混合 SSM‑注意力架构(Jamba 模型)在部分长序列 Benchmark 上展示出接近纯注意力的精度与更低的推理延迟。
  • 2024 年 9 月:阿里云发布 Qwen 2.5 全系开源,旗舰模型上下文窗口稳定在 128K,并在中文多模态长文档任务上刷新多项公开 Benchmark 最高分。
  • 2024 年 7 月:Meta 发布 LLaMA 3.1,首次将开源模型上下文窗口提至 128K(全系),并在技术报告中详细公开长上下文微调方案(RoPE 插值策略)。
  • 2024 年 Q3~Q4:多款推理引擎(vLLM v0.6+, TensorRT‑LLM)针对 128K+ 序列的预填充与 KV 缓存调度进行架构优化,部分方案宣称长序列吞吐提升 2~4×。
  • 2024 年 Q4:台积电 CoWoS 产能扩充进度超预期(据 DigiTimes 供应链报道),但 HBM 供给至 2025 年上半年仍可能偏紧。

跟踪指标与观察框架

为持续跟踪输入 token 相关的技术与市场变化,建议关注以下高信号价值指标:

技术与产品指标

指标观察方式信号含义
主流模型最大上下文窗口更新各公司模型卡片 / 官方文档窗口扩展→新一轮竞争或产品升级
长上下文大海捞针(Needle in a Haystack)准确率独立 Benchmarks(如 Anthropic、Greg Kamradt 测试)评估有效利用率,避免被“数字窗口”误导
首 token 延迟(TTFT)随输入长度的变化曲线推理引擎发布的技术报告反映预填充优化水平,用户可接受上限约 10s
KV Cache 压缩率(新算法/量化)论文与框架 changelog压缩率每提升 2×,等效窗口可扩展一倍
输入 token 定价变动各公司定价页面价格趋势反映竞争烈度与成本结构变化

市场与供应链指标

指标来源关注点
HBM 季度出货量与 ASPTrendForce、SK 海力士/三星季报供给是否匹配长序列推理需求
CoWoS 产能利用率与扩充计划台积电季度法说会高端 GPU 供给的前置信号
公有云推理 API 收入增速AWS/ Azure/ GCP 季报中 AI 相关披露输入 token 间接市场规模
开源模型 HuggingFace 月度下载量HuggingFace 开源统计LLaMA、Qwen 等窗口扩展后的社区采用速度

信号监控节奏建议

  • 周频:API 定价变动、推理引擎版本更新 changelog、重要模型发布消息。
  • 月频:HBM/GPU 供应链报道、独立 Benchmark 测试报告(如有)。
  • 季频:芯片/云厂商财报、台积电法说会(CoWoS 产能方向)。

信源索引

以下列出本文参考的主要公开信息来源,按类型分类。读者可通过对应渠道检索全文或数据。

学术论文

  1. Vaswani et al. “Attention Is All You Need” (NeurIPS 2017) —— Transformer 原论文。
  2. Sennrich et al. “Neural Machine Translation of Rare Words with Subword Units” (ACL 2016) —— BPE 子词分词。
  3. Su et al. “RoFormer: Enhanced Transformer with Rotary Position Embedding” (2021) —— RoPE。
  4. Peng et al. “YaRN: Efficient Context Window Extension of Large Language Models” (2023) —— YaRN 长上下文扩展。
  5. Liu et al. “Lost in the Middle: How Language Models Use Long Contexts” (2023) —— 长上下文有效利用率研究。
  6. Dao et al. “FlashAttention: Fast and Memory-Efficient Exact Attention” (2022) —— 注意力计算优化。
  7. Gu et al. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces” (2023) —— 状态空间模型。

官方文档与定价页

  1. OpenAI Platform —— Pricing & Models 文档 [platform.openai.com](截至 2025Q1 参考)。
  2. Anthropic —— Models & Pricing 文档 [docs.anthropic.com](截至 2025Q1 参考)。
  3. Google AI Studio —— Gemini 定价与模型说明 [aistudio.google.com](截至 2025Q1 参考)。
  4. Hugging Face Tokenizers —— 技术文档 [huggingface.co/docs/tokenizers]。
  5. vLLM —— 技术文档与 GitHub 仓库 [github.com/vllm-project/vllm]。

行业分析与产业报道

  1. SemiAnalysis —— 多篇关于长上下文推理成本与硬件需求的分析。
  2. TrendForce —— HBM 市场季度追踪(2024 年各期)。
  3. IDC / Grand View Research —— 全球 AI 芯片与 API 市场预测(2024 年引用)。
  4. NVIDIA Corporation —— FY2024 年度财报与投资者演示材料。
  5. 台积电 —— 季度法说会纪要(2024 年 Q3/Q4,CoWoS 产能相关披露)。
  6. DigiTimes —— 先进封装与 HBM 供应链追踪(2024 年 Q4 报道)。

开源项目与社区

  1. HuggingFace model cards —— LLaMA 3.1、Qwen 2.5 等模型技术规格。
  2. llama.cpp GitHub —— 消费级硬件长上下文推理实现参考资料。

声明:本文所有市场数据、竞争动态与公司动向均基于截至 2025 年初的公开资料整理,不做主观预测。部分数字因统计口径差异可能与其他来源存在偏差,建议读者以原始出处数据为准。本文不构成任何投资建议,不推荐买卖任何证券,不使用“值得买”“买入类”等投资建议性措辞。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型