模型层 开放阅读

Token

Token

概念 ID
token
更新时间
2026-05-29
来源数量
待补

Token

3 秒看懂

Token(词元)是深度学习模型处理文本、语音、图像等数据时的最小语义单元。它把原始输入(一句话、一张图)切分成模型能“读懂”的离散符号,模型再将每个符号转化为向量进行计算。一个中文词语可能被拆成多个 token,一段图像可能被切分成多个“图像 token”。Token 不仅是模型推理的载体,也是大模型 API 计费的基准,是连接人类语言与机器智能的原子接口。

3 分钟产业解释

在大型语言模型(LLM)和多模态模型的产业链中,token 处于数据与计算之间承上启下的关键位置。产业视角下,token 的决定性影响体现在三个层面:

  1. 模型能力与训练成本:词汇表的大小和 token 化方式直接决定了模型对多语言、专业术语、代码的理解能力。更大的词汇表可以降低序列长度,但会增加嵌入矩阵的参数量和训练开销。训练数据首先要经过 tokenize 变成 token 序列,这一步的质量左右最终模型的天花板。

  2. 推理经济与计费逻辑:OpenAI 等厂商按每千(或百万)token 收费,token 成为 AI 算力的“货币”。上下文窗口(模型一次能容纳的 token 数)从 4K 扩展至 128K 乃至 1M,直接推高了单次请求的 token 消耗和推理成本,也催生了长上下文压缩、KV-cache 优化等产业需求。

  3. 产品体验与安全:token 边界的划分会影响下游应用的表现——比如分句、拼写纠错、代码补全。不合理的 token 化可能导致敏感词绕过安全护栏,或产生不符合预期的输出。因此,各大基础模型厂商都为自家 tokenizer 投入大量研发,其设计也常被视为核心技术的组成部分。

简言之,token 是整个大模型价值链中“无声的螺丝钉”,它决定了模型的输入表示效率、经济模型和上层应用的体验边界。

15 分钟专家深入

作为 AI 工程师或研究员,你需要从以下几个维度透彻理解 token:

  • 离散化与连续表示的桥梁 原始文本是符号序列,模型内部只接受实数向量。Token 将无限可能的人类语言映射到有限集合 {0,1,…,V-1},再通过嵌入层将整数索引映射为稠密向量。这个映射必须是可逆的吗?不需要,但分词器需要保证编码—解码(encode-decode)过程是可逆且无损的(即输入文本经 tokenize 再 detokenize 应恢复原文本),除非有特殊设计(如某些模型故意丢弃空格信息)。

  • 分词算法的数学本质 从统计角度,分词是一个组合优化问题:给定语料,寻找词表 W 使得某种目标函数最优(如最大化语料似然)。常用算法(BPE、WordPiece、Unigram)都不是最优解,而是基于贪心或概率的启发式方法。它们都有超参数:词汇表大小 V、字符覆盖率、是否加入特殊 token(如 [UNK]、[BOS]、[EOS]、[PAD])。这些超参数在训练前确定,且不可在模型训练中调整。

  • 预训练与下游任务的权衡 分词器的设计必须兼顾预训练阶段的海量无监督数据和下游微调/推理的新数据。若词表过小,频繁的词会被拆成过多的子词,导致序列变长,增加计算负担和语义碎片化;若词表过大,每个 token 训练样本变少,嵌入矩阵过稀疏,且容易过拟合。业界大型语言模型常将词表规模选定在几万到十几万之间,根据语言数量、代码是否纳入、多模态对齐需求进行调优。

  • 上下文长度(context length)与位置编码 模型一次能看到的 token 个数,即上下文窗口,由架构和位置编码共同决定。Transformer 的自注意力计算复杂度与 token 数量的平方正相关,因此长 token 序列的训练和推理对显存、带宽提出巨大挑战。基于此派生出线性注意力、稀疏注意力、状态空间模型等技术路线,其本质都在缓解 token 序列长度带来的计算压力。

  • 跨模态的“token 化” ViT 将图像切分为固定大小的 patch,每个 patch 线性投影为一个向量,视为“图像 token”(有时加上分类 token)。扩散模型中的 U-Net 也可以将特征图视为 token 集合。音频领域的频谱切片、点云的空间分组,都在做类似的离散化编码。不同模态的 token 可以在同一序列中交错排列,从而实现统一的多模态基础模型。

掌握这些层级的认知,你就能理解为什么“改个 tokenizer”有时能带来逼近甚至超过模型架构改进的收益。

技术原理

Token 技术原理的核心包含两个部分:分词算法(从原始文本到 token ID 的映射)和 Token 在模型中的流动(从 token ID 到嵌入,再到上下文表示)。以下以最主流的 BPE(Byte Pair Encoding)为例深入剖析,并给出令牌在模型中的完整生命周期 ASCII 示意图。

1. BPE 分词算法细节

BPE 是一种自底向上的数据压缩算法,被迁移到自然语言处理中。它基于字符序列,迭代地将最高频的相邻符号对合并成一个新的符号,直到达到预定的词汇表大小。

训练阶段(词表构建):

  1. 准备大规模语料,将所有词语按字符拆分,末尾附加一个特殊的词尾标识符(如 </w>),以便还原词语边界。
  2. 统计所有相邻符号对的频次。
  3. 选择频次最高的符号对 (A, B),合并为一个新符号 AB,并将语料中所有连续出现的 A B 替换为 AB。
  4. 重新统计符号对频次(此时 AB 参与计算)。
  5. 重复步骤 3-4,直到词汇表大小达到预设值 V(包括基础字符)。

编码阶段(文本转为 token ID):

  • 先将待编码词拆分为字符,再按照训练阶段得到的合并规则顺序(优先级队列)依次替换,将最长的子词匹配为 token ID。通常采用贪婪算法:从开始位置,尽可能匹配词表中最长的子词(maximum matching),不匹配时回退到更短子词,原则上不会产生真正 [UNK](除非字符覆盖率不足)。
  • 实际实现中往往结合优先队列和缓存,以达成高速编码。

解码阶段(token ID 还原为文本):

  • 将 token ID 对应的字符串串联,再将词尾标识符复原为空格或其他分隔符,即可得到原始文本的无损还原。

2. Token 在模型中的流动

(代码块内为 ASCII 示意图)

原始文本: "深度学习"
        |
        v
    字符序列 + 词尾标识符: '深', '度', '学', '习',
        |
        v
    BPE 合并规则(训练得到):
       ('学','习') → '学习'
       ('深','度') → '深度'
        |
        v
    Token 序列: ['深度', '学习', ]   (每个token对应词表中的一个索引,如 [1542, 1983, 2])
        |
        v
    嵌入层 (Embedding, 矩阵 W_e ∈ R^{V×d_model}):
        |
        v
    初始向量序列: [e_1542, e_1983, e_2]   (每个 token 变为 d_model 维的实数向量)
        |
        v
    加入位置编码 (Positional Encoding):
        |
        v
    输入 Transformer 的自注意力和前馈网络,最终输出上下文表示

关键参数机制:

  • 词汇表大小 V:嵌入矩阵的参数量 = V × d_model。通常 V 和 d_model 解耦设计;V 增加会提高模型容量,但也增加计算开销,需要更多数据才能充分训练。
  • 特殊 token:通常包括 [CLS] (聚集序列表示,用于分类)、[SEP] (句子分隔)、[MASK] (遮蔽语言模型)、[PAD] (批处理填充)、[UNK] (未知字符,现代子词分词器基本消除) 等,它们都有固定的 ID,在训练时被赋予可学习的嵌入向量。
  • 位置编码与序列长度 L:模型的最大 token 序列长度受到位置编码表大小和计算显存的限制。若输入序列超过最大长度,必须截断;不足则用 [PAD] 填充,并在注意力计算时通过掩码屏蔽。

3. 子词分词的数学优势

从信息论角度,BPE 类方法以贪心方式在给定词汇表容量下实现对语料的有效压缩(减少序列长度),虽然不能保证压缩率最大化,但能保持对未登录词(OOV)的鲁棒性:任意新词都可以分解为已知的子词单元,避免完全未知的 [UNK] 情况。这为跨语言迁移和代码理解提供了便利。

(注:具体模型的分词器归属、词表具体数字等缺乏本次联网检索确证,故以定性机制阐述,避免编造。)


技术演进史

Token 的概念随 NLP 技术路线不断演变,主要经历了以下阶段:

  • One-hot 时代(~2013 前):文本被切分为词(word),每个词映射为高维稀疏 one-hot 向量,词汇表规模受限于预定义词典,OOV 词直接丢弃或归为统一未知词标记。无法捕捉词间语义关系,且特征维度爆炸。

  • 词向量时代(2013-2017):Word2Vec、GloVe 等方法将单词映射为低维稠密向量,但词表依然是固定词典,OOV 问题仍未解决。同时,基于词的 token 化导致序列长度等于词数,长文本会超出 RNN/LSTM 的处理极限。

  • 子词分词诞生(2015-2018):BPE(Sennrich 等)被引入神经机器翻译,解决了罕见词和 OOV 的问题,使得模型可以用有限的词汇表覆盖几乎无限的词语。WordPiece(Schuster & Nakajima)被 BERT 采用,通过语言模型似然而非频率选择合并单元。Unigram LM tokenization(Kudo)采用反向操作:从大词表开始,逐步移除对似然贡献最小的 token,具有概率化建模优势。SentencePiece(Kudo & Richardson)统一了 BPE 和 Unigram 的框架,处理空格语言,成为多语言模型的首选。

  • Transformer 与统一 token 设计(2018-今):Transformer 架构使长序列建模成为可能,token 化开始与模型架构深度融合。GPT 系列使用的 BPE 变种(字节级 BPE)将任何 Unicode 字符都纳入字符表,彻底消除 [UNK]。T5 使用了 SentencePiece。Llama 等新一代模型进一步优化词表平衡,提升编码效率。此时 token 已不是简单的数据预处理步骤,而是影响训练稳定性、多语言能力、甚至推理快慢的关键设计。

  • 多模态 token 化(2020-今):ViT 开创图像 patch 作为 token 的先河,CLIP 通过对比学习对齐图像与文本的整体表示,DALL·E 将图片离散化成图像 token 再通过自回归生成。多模态统一 token 序列(图文交错排列)成为通向通用人工智能的技术路径。

技术脉络清晰显示:Token 从离线词典进化到动态数据驱动,从语言特化走向跨模态统一,其每一次重构都重塑了下游模型的潜能边界。


技术路线对比

以下表格对比当前主流 token 化技术路线(定性描述,具体归属见备注)。

维度 / 方法BPE(字节对编码)WordPieceUnigram LMSentencePiece(框架)字节级 BPE(如某些 LLM)
核心思想基于频次的字符对合并基于似然增益的合并基于整体概率模型删除低概率token集成了多种算法,统一接口BPE 扩展到全 Unicode 字节
训练方式自底向上逐步合并自底向上,贪心似然选择自顶向下,EM 或优化删除可选择 BPE / Unigram与 BPE 相同,但粒度为字节
OOV 处理若字符覆盖率100%,无OOV若字符覆盖充分,无OOV概率化,稀有词可被子词替代由底层算法决定完全消除 OOV,任何字节可编码
编码效率(序列长度)中~高取决于算法中等(经常更长)
多语言支持需注意空格和字符覆盖需预处理分词天然适合空格语言原生支持空格和字符归一化强,因为基于字节
可逆性是(连同词尾标记)是,但需额外边界标记概率化,需规定贪婪解码保证无损是,但需字节解码
典型使用场景翻译、通用文本生成预训练BERT类模型多语言模型、T5等多语言大规模模型需要完美字符鲁棒性的 LLM
超参数敏感度对词表大小和词频阈值敏感对词表大小敏感对初始词表和删除步数敏感由各算法决定对合并次数敏感

:由于本次联网检索未获取具体模型(如 GPT-4、BERT 等)与算法确凿绑定关系,表中“典型使用场景”为基于学术共识的定性概括,不指向具体产品版本。企业实际部署常有定制改进。


上下游

Token 作为深度学习数据管道的“中间件”,其上下游生态清晰:

  • 上游 – 数据预处理与语料工程

    • 原始数据采集:网页文本、代码库、书籍、语音、图像等。
    • 文本清洗与规范化:字符标准化(如全角半角转换、Unicode 规范化)、特殊符号处理、去重。
    • 分词器训练:基于领域语料训练 tokenizer,产生词汇表和合并规则文件。
    • 序列化存储:将 tokenize 后的 ID 序列以二进制格式保存,提高训练时数据加载效率。 上游的关键是表示保真度压缩效率——减少无效 token 占用、保留语义信息。
  • 下游 – 模型训练与推理

    • 嵌入矩阵的初始化与学习。
    • 作为自注意力层的序列输入,参与整个 Transformer 计算图。
    • 在生成任务中,自回归解码器根据已生成的 token 序列预测下一个 token 的概率分布。
    • 在检索、安全过滤等应用中,token 可用于构建白名单/黑名单。 下游的核心是计算负载上下文吞吐能力,无数长序列优化技术直接建立在 token 流上。
  • 更广产业关联

    • 云厂商与 API 按 token 计费;企业需监控 token 消耗以控制成本。
    • RLHF 中的人类偏好数据,也需要 tokenize 对齐,影响奖励模型的训练。
    • Agent 框架中,函数调用(function call)往往以特殊 token 或特定格式 token 序列呈现,衔接工具。

Token 决定了从原始世界信号到模型可计算形式的“压缩接口”,其质量波及全栈。


关键指标

评测 token 方案和实现的核心指标包括:

  • 词汇表大小 (V):直接影响嵌入参数量和计算开销。
  • 编码效率:平均每个词语所需的 token 数量(越低表示压缩越好),间接影响序列长度和计算量。
  • 字符覆盖率:训练语料中出现的 Unicode 字符能否被妥善处理。字节级方案 100% 覆盖。
  • OOV 率 (Out-of-Vocabulary Rate):测试集中出现未登录词([UNK])的比例,现代分词器通常为 0。
  • 可逆性 (Round-trip Accuracy):文本经过 encode → decode 能否 100% 还原原始字符串(忽略空格差异)。对语音/代码数据尤其重要。
  • 分词一致性:同一词在不同上下文下是否被切分为相同 token 序列,低一致性可能损害模型学习。
  • 编码/解码延迟:对推理吞吐影响显著,尤其在流式生成场景中要求极低延迟。
  • 跨语言迁移能力:在多语种语料上,单一 tokenizer 是否能合理分配子词单元,平衡各语言效率。

这些指标并非独立最优,需要根据业务场景(代码、多语言、嵌入式、超长文本)做权衡配置。


供需与市场数据

(基于行业趋势定性描述,未引用本次联网失败的确切数字。)

需求端趋势:

  • 大模型上下文窗口的不断扩张(从 4K → 128K → 1M+ token)推动单次推理 token 吞吐量指数增长,对高效 tokenizer 和 KV-cache 压缩的需求急剧上升。
  • 多模态模型要求统一的 token 表示,图像、音频、视频 token 化成为新的“硬需求”,带动相应 tokenizer 设计和硬件适配的机会。
  • 基于 token 的定价模式使得企业用户极度敏感于 token 效率,催生了对低冗余、高语义密度 token 化的探索。
  • 私人化、垂直领域的模型微调需要定制 tokenizer(例如医疗法律),催生了 tokenizer 训练工具链和服务市场。

供给端趋势:

  • 开源社区(如 Hugging Face tokenizers)提供了高效、并行的实现,大幅降低了更换 tokenizer 的门槛。
  • 云厂商推出 token 计数、配额管理、成本分析工具,作为 PaaS 的基础设施。
  • 少数初创公司专注于新一代 token-free 模型(如字节级状态空间模型),试图颠覆 token 范式,但尚未成主流。

市场结构定性: Token 本身不是独立交易的市场单元,但其内在设计已深度嵌入大模型竞争壁垒中。头部模型厂商的 tokenizer 被视为闭源资产,而开源社区则推动标准化与复用。未来,随着通用人工智能场景复杂化,token 化方案很可能从纯统计方法向语义感知、动态自适应演进,这可能重塑模型构架的竞争格局。


代表公司与资本映射

Token 相关的能力分散在模型开发商、AI 基础设施及工具链公司中,列举典型代表(未检索到最新资本数据,仅作范式说明):

  • 模型开发商

    • OpenAI:GPT 系列的 tokenizer 的核心实现和词表通过 tiktoken 等库公开,但训练源码等细节可能未完全开放。其字节级 BPE 设计确保了字符全覆盖,API 定价直接基于 token 消耗。
    • Google:通过 SentencePiece 工具(Kudo & Richardson)影响深远,T5、PaLM 等模型皆用其 tokenizer,体现该公司在多语言能力上的布局。
    • Meta:LLaMA 开源模型使用了定制化的 BPE tokenizer,并公开了详细配置,推动社区复用,强化其开源生态策略。
  • 工具链与平台

    • Hugging Face:提供了 tokenizers 库(Rust 实现),支持 BPE、WordPiece、Unigram 等算法的极速训练和推断,成为事实上的工业标准。其生态粘性在于“tokenizer 即模型组件”的理念。
    • 云厂商(如 AWS、Azure、GCP):AI 推理服务中集成了 token 计数和成本管理功能,帮助用户控制大模型调用开销。
  • 新兴势力

    • 一些研究性项目和初创尝试彻底抛弃显式 token 化,用字节级模型(如 MegaByte、RWKV 的某些配置)将 token 概念内化到网络结构中,若成功可能降低进入壁垒,挑战现有“token 护城河”。 资本市场对 token 的直接投资较少,更多落在提高 token 处理效率的硬件(高带宽内存、GPU)、压缩算法、以及长上下文模型架构上。

产业判断逻辑

从产业链视角,可围绕 token 进行以下维度的价值判断:

  1. 长上下文基础设施相关环节:Token 窗口扩大 → 推理时 KV-cache 显存需求激增 → 增加对高带宽内存(HBM)、计算存储一体化方案,以及高吞吐推理芯片的需求。此外,低 bit 量化、稀疏注意力等技术公司也会获得更多产业验证场景。

  2. token 效率即成本竞争力:能够用更少 token 表达同样语义(例如使用更优的词表或动态 tokenizer)的模型,可在同等定价下提升利润率,或降低客户单价获得市场。关注那些在 token 化上有技术创新、且证明编码效率优势的团队。

  3. 多模态统一 Token 方案的先行者:能够将图文、视频、语音统一为同一 token 流的框架,将大幅简化多模态模型的训练和部署,可能引发下一代应用爆发。此类基础模型团队或专利壁垒可能形成长期产业价值。

  4. token 安全与合规:随着监管趋严,能够检测和控制 token 级输出内容(如防越狱)的工具将成为刚需。提供安全 token 序列修剪、敏感信息过滤的解决方案存在商业机会。

  5. 风险提示:token 化方向的彻底颠覆风险——如果无 token 架构(如直接处理字节的状态空间模型)成熟,当前基于显式 token 的技术壁垒可能被绕开。产业观察需跟踪这一颠覆性技术路线的进展,以及传统模型厂商的应对策略。


常见误读纠偏

  • 误读 1:“一个 token 就是一个单词” 实际上,token 远小于单词。英文中一个 word 可能由多个 token 组成,例如 “unhappiness” 可能被分为 “un”, “happiness” 或者更细。中文词语“清华大学”可能被切分为“清华”、“大学”两个 token。Token 是子词单元,不是自然语言层面的词语。API 按 token 计费时,1 个 token 约等于 0.75 个英文单词或 1 个中文字符,这是普遍的大致换算,不可等同。

  • 误读 2:“token 就是嵌入向量” token 是离散的整数索引,进入模型后通过嵌入矩阵才转换成向量。很多人以为传进模型的就是词向量,实则先要有 token ID,随后在模型的第一层完成查表。在推理 API 中,我们通常只看到 token 计数和生成的文本,内部嵌入对用户透明。混淆两者会导致理解模型架构时产生偏差。

  • 误读 3:“词汇表大小越大越好” 大词汇表能减少序列长度,但需要更多的训练数据才能使嵌入得到充分训练,否则大量 token 嵌入会欠拟合。同时,如果推理时出现罕见 token,其嵌入可能噪声较大,反而损害质量。合适的词汇表规模是数据和计算资源的平衡点,而非单一追求大。

  • 误读 4:“上下文窗口内的所有 token 都平等参与注意力” 在实现上,为了约束计算复杂度,许多模型使用了局部注意力、稀疏注意力或缓存剪枝,实际某些 token 会因掩码或裁剪而无法参与长距离交互。因此上下文长度上限并非保证所有 token 被无差别关注。同时,不同位置编码方案(如 ALiBi、RoPE)对远距 token 的敏感度也不相同。


学习路径

入门级:

  • 阅读《Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow》中关于文本预处理和嵌入的部分。
  • 使用 Hugging Face 的 tokenizers 库,体验训练一个简单的 BPE tokenizer,查看分词结果。
  • 理解 BPE 原论文的思想,可阅读 Sennrich 等《Neural Machine Translation of Rare Words with Subword Units》(2016)。

进阶级:

  • 研读 WordPiece 原始文献(Schuster & Nakajima, 2012)和 SentencePiece 论文(Kudo & Richardson, 2018),对比算法差异。
  • 深入 Hugging Face Tokenizers 库源码(Rust 部分),明白训练过程中的高效实现。
  • 在 Colab 中实践对中文、代码、混合语言的 tokenizer 训练,并评测编码效率。

专家级:

  • 研究如何将 tokenization 与模型结构结合:分析 T5、GPT、Llama 等不同模型 tokenizer 的选择原因及对下游性能的影响。
  • 阅读关于 token-free 模型的论文,如《ByT5: Towards a token-free future with pre-trained byte-to-byte models》,探讨去 token 化的可能性。
  • 了解多模态 token 化(如 ViT、DALL·E 的 VQ-VAE tokenizer),掌握离散表示在生成中的应用。

实践建议: 始终从“编码+解码”的可逆性和一致性验证开始,然后分析序列长度分布,迭代调整词表大小、特殊 token。


一句话总结

Token 是深度学习模型的“基本字母表”,它以最小的、可逆的离散单元重构人类语言与世界信号,决定了模型的输入效率、表达能力和经济生态。


延伸阅读与来源

本文基于深度学习领域公开通用知识撰写。关键算法论文参考:

  • Sennrich, R., Haddow, B., & Birch, A. (2016). Neural Machine Translation of Rare Words with Subword Units. ACL.
  • Schuster, M., & Nakajima, K. (2012). Japanese and Korean voice search. ICASSP.
  • Kudo, T., & Richardson, J. (2018). SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing. EMNLP.
  • Hugging Face Tokenizers 官方文档及开源实现 (https://github.com/huggingface/tokenizers).

本次联网检索因连接错误未能获取最新产业数据与具体产品版本归属,故文中有关大模型分词器具体规格、公司产品细节等均未写入确切数字,仅作方向性描述。读者可查阅上述原始文献及各大模型技术报告获取实时参数。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型