输入 token
3 秒看懂
输入 token 是大语言模型(LLM)接收并理解的最小语义单元——可以把它们想象成模型“阅读”时的基本单词或子词。你给模型多少输入 token,就直接决定它一次能“看见”多少上下文,也直接影响每次调用的计算开销与延迟。
一句话辅助记忆:输入 token 是大模型与物理世界交互的“计量量子”——既是模型目光所及的单位,也是计算成本与产品体验必须精密平衡的支点。
3 分钟产业解释
在大模型 API(如 GPT‑4、Claude、Gemini)的商业化中,“输入 token”是定价和性能的核心维度。
计费模型的底层逻辑
API 通常按“每百万输入 token”收费,输入价格一般远低于输出价格(约为输出的 1/5 到 1/10)。这一价差根源于推理中预填充阶段的高并行度带来的计算效率优势。然而,实际应用中长文档、多轮对话场景往往导致输入 token 总量远超输出,成为成本主体。以客户支持类 Agent 为例,每次请求可能携带完整产品手册(数万 token)作为上下文,而输出仅为数十字的简短回答,此时输入成本可占总 API 费用的 85% 以上。
上下文窗口的竞争地位
模型训练和推理时能容纳的最大输入 token 数(如 128K、1M tokens)已成为产品竞争力的硬指标。截至 2025 年初,主流旗舰模型的窗口参数如下(数据来源:各公司官方技术文档与公开定价页):
| 模型/系列 | 上下文窗口 | 输入价格($ / 1M tokens) | 发布/更新时间 |
|---|---|---|---|
| GPT‑4 Turbo | 128K | 10.00 | 2024 年 |
| Claude 3.5 Sonnet | 200K | 3.00 | 2024 年 Q3 |
| Gemini 1.5 Pro | 1M(正式) / 2M(实验) | 1.25(≤128K tokens 部分) | 2024 年 |
| LLaMA 3.1 (70B) | 128K | 开源,推理价格视部署方案 | 2024 年 7 月 |
| Qwen 2.5 | 128K | 开源 | 2024 年 9 月 |
注:具体价格可能随促销与套餐调整,以上为各平台官网公布的标准费率。
系统层面的连锁反应
输入 token 数量上升会引发 Transformer 注意力机制的二次方复杂度问题,推高推理延迟、GPU 显存(尤其 KV cache)和能耗,倒逼硬件(HBM 容量、高带宽互联)与算法(稀疏注意力、长上下文外推)协同进化。
15 分钟专家深入:技术原理
从技术链路看,输入 token 连接了“文本 → 嵌入 → 计算”三步。以下按数据处理流展开,并逐层揭示关键设计取舍。
阶段一:分词——由文本到 Token ID
分词器将原始文本切分为 token ID 序列。这一步骤是所有后续计算的入口,其质量直接影响模型对语言的理解效率与单次请求的经济性。
核心算法族:
- BPE(Byte Pair Encoding):自 Sennrich 等(2016)引入神经机器翻译后,被 GPT 系列广泛采用。训练时从字符开始,反复合并最高频的相邻符号对,最终形成合并规则集。编码时贪婪应用规则,将文本拆分为子词单元。现代变体多为 byte‑level BPE,确保任何 Unicode 输入均可编码,彻底消除“集外词(OOV)”问题。
- WordPiece:Google 用于 BERT,基于似然最大化选择合并对——每次合并选择能最大提升训练语料语言模型概率的符号对。计算成本高于 BPE,但理论上在相同词表大小下信息密度更优。
- Unigram LM / SentencePiece:先训练一个较大的种子词表,再通过概率化删除字符逐步剪枝,保留最可能的分词方案。T5、XLNet、LLaMA 等模型采用。SentencePiece 直接处理原始文本(不依赖预分词),对多语言尤其友好。
分词示例(以 GPT‑4 风格 BPE 为例,英文):
原始文本:"The transformer revolutionized NLP"
可能切分:"The" | " transform" | "er" | " revolutionized" | " NLP"
Token IDs: [576, 43264, 298, 78532, 4633]
同一单词“transformer”被拆为“transform”和“er”,说明 token 并非字面意义上的“单词”。
阶段二:嵌入与位置编码
分词器输出的 [1, n] 维 token ID 序列,经过嵌入层(Embedding)映射为 [n, d_model] 的稠密向量矩阵。嵌入层本质是一个可训练的查找表,参数规模为 V × d_model(V 为词表大小),通常在数十亿到数百亿量级。
位置编码随后注入序列顺序信息。主流方案:
- RoPE(Rotary Position Embedding):在注意力计算中对 Q、K 施加旋转变换,使内积仅依赖相对位置差。LLaMA 系列、Qwen 等采用。天然支持通过插值等方式扩展上下文。
- ALiBi(Attention with Linear Biases):不学习位置嵌入,直接在注意力分数上叠加线性偏置(距离越远偏置越负),赋予模型天然的长度外推能力。
- 绝对位置编码:原始 Transformer 使用 sine/cosine 固定编码,GPT‑3 使用可学习位置嵌入。随着上下文窗口扩张,这些方案逐渐在被 RoPE 及其变体替代。
嵌入与位置编码的输出矩阵 X ∈ R^{n×d} 构成后续所有 Transformer 层的输入。
阶段三:Transformer 计算
给定 n 个输入 token,每层自注意力的核心运算:
Q = X·W_Q, K = X·W_K, V = X·W_V # X: [n, d_model]
Attention(Q, K, V) = softmax(Q·K^T / √d_k)·V
计算复杂度:Q·K^T 产生 [n, n] 注意力矩阵,FLOPs ≈ 2·n²·d_k·num_heads(不含 softmax 和 V 的乘法)。前馈网络(FFN)对每个 token 独立计算,复杂度为 O(n·d_model·d_ff)。因此,当输入 token 数 n 较大时,注意力部分迅速成为主导——这是经典的“二次方瓶颈”。
KV Cache 与显存压力:在自回归解码中,每次仅输入新 token,但需访问历史上所有 token 的 K、V 以避免重算。缓存大小:
KV_cache_bytes = 2 · batch_size · n · num_layers · d_head · num_heads · precision_bytes
以 FP16 精度、n=128K、batch_size=1、典型 70B 参数模型(如 LLaMA 3 70B,80 层、64 头、d_head=128)为例:
KV_cache ≈ 2 × 1 × 128000 × 80 × 128 × 64 × 2 bytes
= 2 × 128000 × 80 × 16384 bytes
≈ 335 GB
这一数字已远超单张 H100(80GB HBM3)的显存容量,实际部署中需依赖多卡张量并行或减少可用上下文。
阶段四:预填充与解码的工程分离
推理过程在工程上分为两个性质迥异的阶段:
- 预填充(Prefill):一次性摄入全部输入 token,并行计算所有层的注意力,生成首 token 并缓存每层 K/V 状态。计算是 GPU 高度友好的矩阵乘法,但
O(n²)特性使延迟随输入长度非线性增长。以 128K 输入为例,预填充延迟可达数十秒(未优化时)。 - 解码(Decode):每次仅输入新生成的一个 token,利用缓存 KV 计算当前 token 的注意力与 FFN。此时计算量变为
O(n·d),但需反复读取完整 KV cache,瓶颈由算力变为显存带宽。输入 token 越多→KV cache 越大→解码速度越慢(token/s 下降)。
性能数据示例(基于 vLLM v0.4.0 推断,H100,LLaMA 3 70B FP16):
| 输入长度 | 预填充延迟(s) | 解码吞吐(tokens/s) | KV Cache 占用(GB) |
|---|---|---|---|
| 4K | ~0.02 | ~45 | ~10.5 |
| 32K | ~0.8 | ~38 | ~84 |
| 128K | ~12 | ~25 | ~335 |
注:以上为基于公开系统参数的理论推估值,具体值取决于框架优化程度与并行策略,仅供参考量级。实际 Benchmark 数据建议查阅 vLLM 与 TensorRT‑LLM 官方技术报告。
计算图简化示意
输入文本(Unicode 字符串)
│
▼
分词器 ──► token IDs [1, n]
│
▼
嵌入层 + 位置编码 ──► X [n, d]
│
▼
┌─────────────────────────────────┐
│ Layer 1..L │
│ ┌─ Multi-Head Self-Attention ─┐│
│ │ Q·K^T [n,n] → Softmax → ·V ││ ← O(n²·d)
│ └────────────────────────────┘│
│ ┌─ Feed Forward (per token) ─┐│ ← O(n·d²)
│ └────────────────────────────┘│
└─────────────────────────────────┘
│
▼
语言模型头 ──► 预测下一个 token 概率([V] 分布)
关键参数
评估输入 token 相关的模型性能与部署成本时,以下参数构成核心决策框架:
| 参数名称 | 定义 | 典型值/范围 | 重要性说明 |
|---|---|---|---|
| 上下文窗口(Max Context Length) | 模型单次可接收的最大输入 token 数 | 8K ~ 1M+(2025 年初) | 直接决定可用输入长度上限,是产品选型首要指标 |
| 分词效率(Chars per Token) | 平均每个 token 编码的字符数 | 英语:3.5 | 相同字符数下,该值越高 token 消耗越少、成本越低 |
| 词表大小(Vocabulary Size) | 分词器可识别的唯一 token 数量 | 32K ~ 256K | 越大则平均每个 token 编码字符越多,但嵌入层参数随之膨胀 |
| 预填充吞吐(Prefill Throughput) | 每秒可处理的输入 token 数 | H100 上约 1K~10K tokens/s(依赖长度和目标模型) | 影响首 token 延迟,长输入场景的关键体验指标 |
| KV Cache 内存占用 | 每增加 1K 输入 token 所需额外显存 | 典型 70B 模型约 2.6 GB/1K tokens(FP16) | 直接制约并发数与最大序列长度 |
| 首 token 延迟(Time to First Token, TTFT) | 从请求发送到第一个生成 token 返回的时间 | 4K 输入 <1s,128K 输入可达 10~30s | 用户体验的直接感知维度,长输入下为核心痛点 |
| 有效上下文利用率 | 模型对长文本不同位置信息的实际关注度 | 中段位置通常衰减 20%~50%(Lost in the Middle 效应) | 仅窗口“够大”不等于模型能“读全”,需辅助评测 |
| 输入价格 | API 调用中每百万输入 token 的收费 | $0.15 ~ $10 / 1M tokens(2025Q1) | 直接影响总成本,应结合预计请求长度与频次计算 |
其中 KV Cache 内存占用 =
2 × n × num_layers × d_head × num_heads × precision_bytes,具体推导见“技术原理”章节。建议用户在选型时根据目标最大序列长度预估算显存需求。
技术路线与对比
输入 token 的处理方案可从“分词算法”与“长上下文扩展”两个维度展开对比。
路线一:分词算法对比
| 维度 | BPE(GPT 风格) | WordPiece(BERT 风格) | Unigram(T5/LLaMA 等) |
|---|---|---|---|
| 核心原理 | 贪心合并最高频字节对 | 似然最大化选择合并对 | 概率化词表剪枝 |
| 常见词表大小 | 32K~100K(LLaMA2 32K, GPT‑4 ~100K) | 28K~32K(BERT 30K) | 32K~256K |
| 平均字符/Token 比(英) | 约 4.0 | 约 4.5 | 约 3.5~4.0 |
| OOV 处理 | 字节级回退,彻底无 OOV | 拆为字符,基本无 OOV | 支持字符回退 |
| 训练速度 | 快(贪心合并) | 较慢(需多轮似然评估) | 慢(需训练 LM 并剪枝) |
| 多语言友好度 | byte‑level BPE 较好 | 需特殊预处理 | SentencePiece 原生支持多语言 |
| 代表模型 | GPT‑2/3/4、Claude 系列 | BERT、ALBERT | T5、XLNet、LLaMA、Gemma |
趋势研判:BPE 系因训练简便、OOV 处理鲁棒,已成为当前大模型(尤其 GPT/Claude 系)的主流选择。Unigram/SentencePiece 在开源社区有广泛应用(LLaMA 系列),二者在分词效率上的差距正逐渐缩小。字符/Token 比受语种影响显著——中文用户在选择模型时应特别关注自身应用的主要语言,可比对同文本在不同分词器下的 token 消耗实测数据。
路线二:长上下文扩展技术对比
| 技术 | 原理 | 优点 | 缺点 | 代表工作/模型 |
|---|---|---|---|---|
| RoPE 线性插值 | 将位置索引等比缩放至原训练范围 | 实现简洁,零额外训练 | 高频信息丢失,远距离分辨力下降 | 早期 LLaMA 扩展方案 |
| NTK‑aware 插值 | 低维高频区少缩放,高维低频区多缩放 | 保留更多局部信息,扩展效果更好 | 实现略复杂 | LLaMA‑2‑7B‑32K 等 |
| YaRN | NTK‑aware + 温度系数控制注意力熵 | 进一步稳定超长上下文注意力 | 需微调适配温度参数 | LLaMA 2 128K 微调 |
| ALiBi | 不学习位置嵌入,在线性衰减偏置 | 天然外推,不依赖位置嵌入训练 | 固定偏置形式牺牲部分灵活性 | BLOOM、早期 Anthropic 模型 |
| 稀疏注意力 | 限制 token 仅关注局部或特定模式的远距离 token | 降低 O(n²) 复杂度至 O(n log n) 或 O(n√n) | 信息丢失风险,工程实现复杂 | Longformer、BigBird |
| 状态空间模型(SSM) | 用线性时不变系统替代注意力(如 Mamba) | 复杂度降为 O(n),理论上无限长度 | 在部分密集检索任务上精度落后于注意力 | Mamba、Mamba‑2、Jamba |
趋势研判:2024~2025 年,RoPE + NTK‑aware 插值/YaRN 已成为开源社区扩展上下文的主流范式,让 8K 基础模型通过轻度微调就具备 128K 甚至 1M 窗口。状态空间模型作为“注意力替代”的方案正在快速追赶,但在需要精确长程依赖的复杂推理任务上仍有差距。混合架构(如 Jamba 交错注意力层和 Mamba 层)可能是中期方向。
上下游产业链分析
输入 token 的技术生态可以沿“上游数据与算法 → 中游模型与引擎 → 下游应用与硬件”展开,以下按链条逐层梳理:
上游:数据、分词器与训练基础设施
- 多语言语料库建设:分词器训练需要大规模、多领域、高质量语料,覆盖目标应用涉及的主要语种。数据清洗(去重、去噪、格式规范化、敏感信息过滤)是生产级分词器的关键前置工序。公开未见统一的语料质量标准,主流模型公司通常自建数据集且不对外开放。
- 分词器训练工具链:以 Hugging Face
tokenizers库(Rust 实现)为代表,支持 BPE、WordPiece、Unigram 等多种算法的高效训练。部分团队使用 Google 开源的 SentencePiece 独立训练。训练速度:在典型服务器上,从数十 GB 语料训练一个 100K 词表的 BPE 分词器通常在数小时内完成。 - 位置编码设计:RoPE 及其扩展方案正成为事实标准。理论上,位置编码的选择直接决定后续能否以轻量方式扩展上下文,是上游基础研究的重要课题。
- 长序列数据处理管线:针对超长文档的切分、语义分段、overlap 窗口设计、元数据注入等,是让模型有效理解长输入的“预处理软工程”。
中游:模型架构与推理引擎
- 模型架构:自注意力机制仍是主流,但稀疏注意力、SSM、混合模型正在分流。模型架构选择直接决定了输入 token 数量的边际成本曲线——是
O(n²)还是O(n log n)或O(n)。 - 训练框架优化:长序列训练依赖序列并行(如 Megatron‑LM 的序列并行)、激活检查点与重计算策略,以在有限显存内完成数千 token 长序列的反向传播。ZeRO 系列优化(DeepSpeed)被广泛使用。
- 推理引擎:vLLM(PagedAttention 技术,将 KV Cache 以非连续页式管理,提升显存利用率)、TensorRT‑LLM(支持 FP8、多头注意力融合)、llama.cpp(追求在消费级硬件上运行长上下文模型,支持 mmap 加载)构成了当前三大主流推理框架。各框架对长上下文的支持程度成为差异化竞争要点。
下游:API 服务、产品形态与硬件需求
- API 服务定价:按输入/输出 token 分别计费已成行业惯例。部分厂商(如 Anthropic)对超长输入给予特定折扣或采用阶梯定价(前 128K 一个价,超量部分优惠)。缓存命中(相同前缀多次请求仅计费一次)是重要成本优化手段,截至 2025 年初,OpenAI 与 Anthropic 均支持自动/手动缓存。
- 产品功能:超长文档 QA、法律文书分析、全量代码库理解、Agent 长会话记忆等场景直接受益于大窗口。部分企业将“上下文窗口大小”作为市场宣传的核心卖点,向非技术客户沟通“一次能处理的文件页数”。
- 硬件需求牵引:长序列推理对显存需求显著提升。HBM 容量(H100 80GB、H200 141GB)和显存带宽(HBM3/HBM3e)成为推理卡选型的硬约束。B200(预计 2025 年量产,搭载 192GB HBM3e)正是对这一需求的回应。ADVANCED PACKAGING(CoWoS)产能直接制约高端 GPU 供给,截至 2024 年底,台积电 CoWoS 产能仍偏紧但正在扩张中。
受益公司与市场格局
以下从模型厂商、硬件供应商、工具链平台三个层次梳理主要受益方。所有信息基于公开财报、官方公告及产业报告,截至 2025 年初。
模型厂商
| 公司 | 核心模型/系列 | 最大上下文窗口 | 输入 Token 定价策略 | 竞争优势 |
|---|---|---|---|---|
| OpenAI | GPT‑4 Turbo / GPT‑4o | 128K | $10/1M tokens(GPT‑4 Turbo) | 率先量产 128K,生态完整,市场份额领先 |
| Anthropic | Claude 3.5 系列 | 200K | $3/1M tokens(Sonnet) | 上下文更长,价格更低,企业文档场景渗透快 |
| Google DeepMind | Gemini 1.5 Pro | 1M(正式)/2M(实验) | $1.25/1M tokens(≤128K) | 最大标称窗口,MoE 降本,与 GCP 生态深度集成 |
| Meta | LLaMA 3.1 (8B/70B/405B) | 128K | 开源,按部署成本 | 社区生态活跃,开源模型中标杆位置 |
| 阿里云 | Qwen 2.5 系列 | 128K | 开源 + 云 API | 中国市场份额突出,多语言适配 |
| Mistral AI | Mistral Large / Small | 128K / 32K | $4~8/1M tokens(2024Q4) | 欧洲合规需求独特定位,多语种覆盖 |
| xAI | Grok 系列 | 公开资料未见明确上限 | 随 X Premium 捆绑 | 与社交平台深度整合,差异化分发渠道 |
定价为公开标准费率,实际企业采购可能存在定制合约价。
硬件供应商
- 英伟达(NVIDIA):其 GPU(H100/H200/B200)占据长上下文推理训练市场的主导份额。HBM 容量是推理卡 ASP 提升的关键驱动力。2024 财年(截至 2024 年 1 月)数据中心收入超 475 亿美元(来源:NVIDIA FY2024 财报)。
- AMD:Instinct MI300X 搭载 192GB HBM3,容量超过 H100,正试图在推理负载中替代英伟达。出货量数据公开资料未见细分到长上下文推理场景。
- SK 海力士 / 三星 / 美光:HBM 的三大供应商。SK 海力士为 HBM3/HBM3e 主要供应商,三星与美光积极扩产。2025 年 HBM 产能仍被视为高端 AI 芯片供给的瓶颈环节。
推理服务与工具链
- Anyscale / Modal / Together AI:提供基于 vLLM 等框架的 LLM 推理即服务,间接受益于企业自部署长上下文模型的需求增长。具体收入与份额数据公开资料未见。
- Hugging Face:tokenizers 库、transformers 生态系统为全球最大比例的模型提供了分词与推理基础设施,间接设定行业部分标准。
- vLLM(UC Berkeley 开源):PagedAttention 技术成为长上下文推理的事实标准内存管理方案之一,被多家商业推理服务采用。
市场规模与增长趋势
输入 token 本身不构成独立市场,但作为 LLM API 调用量与推理硬件开销的核心计量单位,其规模可从 API 市场、推理芯片市场、以及长序列专用需求三个口径侧面度量。以下数据基于公开研究机构报告与企业财报中的关联披露。
API 推理市场
- 全球 LLM API 推理市场规模:据 Grand View Research 与 Statista 数据交叉参考,2024 年约在 60
90 亿美元区间,预计 2030 年达 400600 亿美元水平(CAGR 约 35%~40%)。该市场规模直接由 token 处理量(输入+输出)驱动。 - 输入 token 占比:据多家推理服务商非正式披露(Semianalysis、Anthropic 技术博客),企业级应用中输入 token 占总 token 量的比例通常在 70%~85%,在 RAG(检索增强生成)、长文档分析、Agent 长会话等场景占比更高。因此,可以粗略推断输入 token 相关收入占 API 推理市场的 70% 以上。
推理硬件市场
- AI 加速器市场:据 IDC 与 Mercury Research 估计,2024 年全球 AI 芯片销售额约 900~1100 亿美元(含训练与推理)。其中推理所占份额持续上升,预计到 2027 年推理占比将超过训练。
- HBM 市场:据 TrendForce,2024 年全球 HBM 市场规模约 180
220 亿美元,预计 2025 年达 280350 亿美元。大窗口推理对 HBM 容量需求是增量驱动之一,具体精细化测算公开资料未见。
长上下文专项需求(定性)
- RAG 系统:尽管 RAG 理论上可降低对模型原生长上下文的依赖,但实践中企业越来越倾向于“RAG + 大窗口”组合——用大窗口容纳检索结果和对话历史,避免频繁裁剪上下文导致的连贯性损失。这一趋势扩张了对 128K+ 窗口的需求。
- 代码与文档场景:GitHub Copilot、Cursor 等产品已将全仓库上下文作为高端功能测试。法律(合同全文逐条审查)、生物医药(全基因组序列)、金融(多年财报对比)等垂直领域的需求正将窗口需求从“数万 token”推向“百万 token”量级。
玩家竞争分析
从商业模式与技术路线两个轴,可将主要玩家划分为以下竞争群组:
封闭旗舰模型阵营
OpenAI vs Anthropic vs Google DeepMind
- 窗口竞赛:Google 以 1M 标称窗口领先,但有效利用率(“大海捞针”测试成绩)的差异是真实竞争维度。Anthropic 在 200K 窗口下的实际检索准确率宣传优于早期 GPT‑4 128K,但缺乏独立第三方大规模 Benchmark。
- 价格战:输入 token 价格呈持续下行趋势。Gemini 1.5 Pro 定价仅为 GPT‑4 Turbo 的约 1/8,反映了 MoE 架构的降本效果与 Google 自研 TPU 的成本优势。Anthropic 在同等性能档位定价低于 OpenAI。
- 生态绑定:各自与云平台深度绑定(OpenAI+Azure,Anthropic+AWS,Gemini+GCP),企业客户常基于已有云服务商选择模型,形成间接壁垒。
开源模型阵营
Meta(LLaMA) vs 阿里(Qwen) vs Mistral
- 窗口指标趋同:128K 已成为开源旗舰模型的“标配”,2024 年底至 2025 年初主要开源模型均达该水平。
- 差异化方向:
- LLaMA 凭借庞大的社区生态(微调变体、量化版本、部署方案)占据开发者心智份额。
- Qwen 在多语言(尤其东亚语言)和部分中文 Benchmark 上领先,国内企业用户覆盖度最高。
- Mistral 在欧洲市场因合规与语言优势有独特卡位。
- 商业模式:开源模型不直接按 token 收费,而是争夺部署生态(如 llama.cpp、Ollama、vLLM 适配优化)和企业支持服务收入。
硬件与推理基础设施层竞争
- 英伟达 vs AMD:长上下文推理对显存的高需求打破了传统“单卡推理”的边界,多卡并行推理成为刚需。英伟达凭借 NVLink + NVSwitch 互联方案在双卡/四卡推理场景性能领先,AMD MI300X 在显存容量上(192GB vs H100 的 80GB)有单卡成本优势,但互联生态仍待追赶。
- 推理引擎分化:商业引擎(TensorRT‑LLM)在极致性能上领先,开源引擎(vLLM、llama.cpp)在社区迭代速度与部署灵活性上占优,二者非零和竞争。
风险与制约因素
从技术、市场与供应链三个维度梳理关键风险:
技术风险
- 长上下文的“迷失在中段”效应:多项研究(Liu et al. 2023 “Lost in the Middle”)显示,模型对长文档中部信息的关注度显著衰减,即便上下文扩展至 128K 甚至 1M,有效利用率未必同步提升。这导致纯“窗口数字竞赛”可能无法直接转化为用户体验提升,存在技术路线误导性竞争风险。
- KV Cache 的内存瓶颈:如前述测算,128K 输入在 70B 模型下 KV Cache 可达数百 GB,对显存和带宽提出苛刻要求。硬件升级速度(HBM 容量年化增长约 30%
50%)可能落后于窗口扩展需求(年化 410 倍),形成技术进步的物理天花板。 - 预填充延迟的“长尾”问题:长输入首 token 延迟与输入长度的二次方关系难以根本消除,可能导致使用体验在超长输入场景下恶化(用户等待数十秒),即使模型质量过关。
- 状态空间模型的成熟度不足:Mamba 等 O(n) 复杂度方案是理论希望所在,但在需要远距离精确信息检索的任务上,实际性能仍落后于优化后的 Transformer(公开资料未见 >128K 长序列上的系统对比 Benchmark)。
市场风险
- 价格下行侵蚀利润:输入 token 价格在 2023-2025 年间下降超过一个量级,且竞争加剧可能进一步压缩利润空间。以硅谷投资机构 a16z 的估算,推理服务的毛利率在价格战趋势下可能从 >70% 向 40%-50% 区间收敛。
- 开源模型的替代压力:128K 开源模型的成熟减少了企业对高价闭源 API 的依赖,尤其对价格敏感的中小企业和开发者群体。
- 定价模式的不确定性:按 token 计费的模式在 Agent 长时间运行任务中可能不再适用,行业可能出现向“会话时长/任务”定价的迁移,影响收入模型预期。
供应链风险
- HBM 产能集中:台积电 CoWoS 先进封装产能是 HBM 供给的卡口,截至 2024 年底产能仍集中在少数供应商,地缘政治与产能扩张周期均构成不确定性。
- 高端 GPU 供应的地缘因素:美国出口管制对高端 AI 芯片的限制,影响中国市场的 H100/H200 可及性,国内推理服务商被迫依赖国产替代或降级芯片,可能拉大技术差距。
常见误读纠偏
误读 1:“一个 token 就是一个单词”
事实:Token 经常是单词的子部分。例如“transformer”常被拆为“transform”和“er”,中文词“人工智能”可能被切分为“人工”和“智能”或更细粒度。不同分词器对同一文本的切分结果不同,token 数量也可能差异 10%~30%。用户在估算成本时,建议使用目标 API 提供的 tokenizer 工具做实测,而非简单按“1 词 ≈ 1 token”或“1 字符 ≈ X token”推算。
误读 2:“上下文窗口长就等于模型能有效利用所有输入”
事实:多项研究证实,模型注意力在长文档中呈 U 型分布——开头和结尾信息被高度关注,中部信息容易“迷失”。即使在 128K 窗口内输入,模型对第 60K~100K 位置的信息提取准确率可能仅为窗口前部的 50%~70%。因此,产品设计时不应假设“全量输入必有用”,应搭配分段摘要、检索增强等策略弥补中部信息衰减。
误读 3:“增加输入 token 数量,算力成本成比例线性增长”
事实:由于自注意力复杂度为 O(n²),输入 token 翻倍时,注意力计算量接近 4 倍(短序列时线性项仍有影响,但长序列下二次项主导)。同时 KV cache 线性膨胀进一步压制并发。总推理成本在长序列场景下呈超线性增长,简单按 token 单价乘以数量推算总成本会显著低估。企业做财务测算时,应根据目标序列长度做定制 Benchmark 而非线性外推。
误读 4:“长上下文可以完全替代 RAG”
事实:长上下文和 RAG 是互补技术,当前最优实践往往是二者结合:用 RAG 检索相关片段并提供上下文结构,用长窗口容纳检索结果和对话历史,避免频繁裁剪。长上下文窗口减少了检索分块与重构的工程复杂度,但在成本、延迟和检索可靠性上暂未完全替代 RAG。
最新事件与动态
以下梳理截至 2025 年初的产业关键更新(按时间线,来源为公司官方公告、技术报告与可验证的行业信息来源):
- 2024 年 12 月:OpenAI 在 12 Days of OpenAI 活动中发布 o3 系列推理模型,其上下文管理与输入 token 消纳方式与标准 GPT‑4 系列存在差异,具体技术细节待进一步公开。
- 2024 年 11 月:Anthropic 发布 Claude 3.5 Haiku 并全面降价,输入价格进一步下探;同期推出提示缓存功能,对相同前缀的重复输入仅计费一次。
- 2024 年 10 月:Mamba‑2 正式论文公布,混合 SSM‑注意力架构(Jamba 模型)在部分长序列 Benchmark 上展示出接近纯注意力的精度与更低的推理延迟。
- 2024 年 9 月:阿里云发布 Qwen 2.5 全系开源,旗舰模型上下文窗口稳定在 128K,并在中文多模态长文档任务上刷新多项公开 Benchmark 最高分。
- 2024 年 7 月:Meta 发布 LLaMA 3.1,首次将开源模型上下文窗口提至 128K(全系),并在技术报告中详细公开长上下文微调方案(RoPE 插值策略)。
- 2024 年 Q3~Q4:多款推理引擎(vLLM v0.6+, TensorRT‑LLM)针对 128K+ 序列的预填充与 KV 缓存调度进行架构优化,部分方案宣称长序列吞吐提升 2~4×。
- 2024 年 Q4:台积电 CoWoS 产能扩充进度超预期(据 DigiTimes 供应链报道),但 HBM 供给至 2025 年上半年仍可能偏紧。
跟踪指标与观察框架
为持续跟踪输入 token 相关的技术与市场变化,建议关注以下高信号价值指标:
技术与产品指标
| 指标 | 观察方式 | 信号含义 |
|---|---|---|
| 主流模型最大上下文窗口更新 | 各公司模型卡片 / 官方文档 | 窗口扩展→新一轮竞争或产品升级 |
| 长上下文大海捞针(Needle in a Haystack)准确率 | 独立 Benchmarks(如 Anthropic、Greg Kamradt 测试) | 评估有效利用率,避免被“数字窗口”误导 |
| 首 token 延迟(TTFT)随输入长度的变化曲线 | 推理引擎发布的技术报告 | 反映预填充优化水平,用户可接受上限约 10s |
| KV Cache 压缩率(新算法/量化) | 论文与框架 changelog | 压缩率每提升 2×,等效窗口可扩展一倍 |
| 输入 token 定价变动 | 各公司定价页面 | 价格趋势反映竞争烈度与成本结构变化 |
市场与供应链指标
| 指标 | 来源 | 关注点 |
|---|---|---|
| HBM 季度出货量与 ASP | TrendForce、SK 海力士/三星季报 | 供给是否匹配长序列推理需求 |
| CoWoS 产能利用率与扩充计划 | 台积电季度法说会 | 高端 GPU 供给的前置信号 |
| 公有云推理 API 收入增速 | AWS/ Azure/ GCP 季报中 AI 相关披露 | 输入 token 间接市场规模 |
| 开源模型 HuggingFace 月度下载量 | HuggingFace 开源统计 | LLaMA、Qwen 等窗口扩展后的社区采用速度 |
信号监控节奏建议
- 周频:API 定价变动、推理引擎版本更新 changelog、重要模型发布消息。
- 月频:HBM/GPU 供应链报道、独立 Benchmark 测试报告(如有)。
- 季频:芯片/云厂商财报、台积电法说会(CoWoS 产能方向)。
信源索引
以下列出本文参考的主要公开信息来源,按类型分类。读者可通过对应渠道检索全文或数据。
学术论文
- Vaswani et al. “Attention Is All You Need” (NeurIPS 2017) —— Transformer 原论文。
- Sennrich et al. “Neural Machine Translation of Rare Words with Subword Units” (ACL 2016) —— BPE 子词分词。
- Su et al. “RoFormer: Enhanced Transformer with Rotary Position Embedding” (2021) —— RoPE。
- Peng et al. “YaRN: Efficient Context Window Extension of Large Language Models” (2023) —— YaRN 长上下文扩展。
- Liu et al. “Lost in the Middle: How Language Models Use Long Contexts” (2023) —— 长上下文有效利用率研究。
- Dao et al. “FlashAttention: Fast and Memory-Efficient Exact Attention” (2022) —— 注意力计算优化。
- Gu et al. “Mamba: Linear-Time Sequence Modeling with Selective State Spaces” (2023) —— 状态空间模型。
官方文档与定价页
- OpenAI Platform —— Pricing & Models 文档 [platform.openai.com](截至 2025Q1 参考)。
- Anthropic —— Models & Pricing 文档 [docs.anthropic.com](截至 2025Q1 参考)。
- Google AI Studio —— Gemini 定价与模型说明 [aistudio.google.com](截至 2025Q1 参考)。
- Hugging Face Tokenizers —— 技术文档 [huggingface.co/docs/tokenizers]。
- vLLM —— 技术文档与 GitHub 仓库 [github.com/vllm-project/vllm]。
行业分析与产业报道
- SemiAnalysis —— 多篇关于长上下文推理成本与硬件需求的分析。
- TrendForce —— HBM 市场季度追踪(2024 年各期)。
- IDC / Grand View Research —— 全球 AI 芯片与 API 市场预测(2024 年引用)。
- NVIDIA Corporation —— FY2024 年度财报与投资者演示材料。
- 台积电 —— 季度法说会纪要(2024 年 Q3/Q4,CoWoS 产能相关披露)。
- DigiTimes —— 先进封装与 HBM 供应链追踪(2024 年 Q4 报道)。
开源项目与社区
- HuggingFace model cards —— LLaMA 3.1、Qwen 2.5 等模型技术规格。
- llama.cpp GitHub —— 消费级硬件长上下文推理实现参考资料。
声明:本文所有市场数据、竞争动态与公司动向均基于截至 2025 年初的公开资料整理,不做主观预测。部分数字因统计口径差异可能与其他来源存在偏差,建议读者以原始出处数据为准。本文不构成任何投资建议,不推荐买卖任何证券,不使用“值得买”“买入类”等投资建议性措辞。