Constrained Decoding
3 秒看懂
一句话定义:Constrained Decoding(受约束解码)是一组在自回归语言模型生成每个 token 时,将预设的语法、格式或内容规则转化为概率掩码,强制模型只能从合法候选集中采样的技术。
核心价值:把大语言模型(LLM)从“概率性创作引擎”改造为“确定性、可校验的企业级文本生成容器”,是 AI 从演示进入自动化生产流程的工程化基座。
一句话区分:提示词(Prompt)是“希望模型这样输出”的请求;约束解码是“模型只能这样输出”的硬性规则,即使模型生成了极其低概率的错误 token,约束机制也会直接切断该路径。
3 分钟产业解释
把大模型想象成一位能写出任意文字的速记员。在自由写作时,他文采斐然,但让他填写一份税务申报表,必须每一项都填入标准代码、金额格式,并确保加减逻辑自洽——单纯靠叮嘱(提示词)可能还是会出错。Constrained Decoding 就是在这位速记员的笔上装了一套“轨道”:每落笔一个字,轨道自动判断下一笔是否合规,不合规的字根本写不出来。
企业为什么需要它 当企业将 LLM 接入订单系统、医疗记录、合同生成、SQL 自动编写等场景时,输出必须结构严谨、可机器读取、零歧义。哪怕 1% 的格式错误,也可能导致自动化管线中断,产生人工兜底成本。因此,约束解码成为将 LLM 输出从“需要人审”变为“可直接用”的核心技术。
产业痛点与价值
- 痛点:标准 LLM 输出不可控,后处理解析脆弱、重试成本高、敏感场景下容易生成非法内容。
- 价值:实现“生成即合规”,推动代码生成、数据提取、合规对话等严肃场景的规模化落地,降低人工审核和系统集成成本,成为企业级 AI 可靠性的底线而非增项。
技术原理
Constrained Decoding 的核心是在自回归模型的 采样阶段 植入与任务等效的状态机(FSM)、解析器或逻辑规则,实现每步动态掩码。
三步关键流程:规则编译 → 状态跟踪 → 概率掩码
-
规则编译 用户提供的约束规范(正则表达式、JSON Schema、Pydantic 数据模型、CFG 文法)在加载时被编译为一个带状态的判定器。对于 JSON Schema,典型实现会将其转化为一个大致的有限状态机,每个状态对应 JSON 结构的一个位置(如“等待键名”“等待字符串值”)。
- 示例状态 S42:“正在生成一个必需为布尔值的字段
isActive”,合法 token 集合为{"true", "false"}。 - 编译过程会考虑词表级别的 token 边界(sub‑word),将字符串约束细分为允许的首个 token 列表,以保证即使在子词级别也不会越界。
- 示例状态 S42:“正在生成一个必需为布尔值的字段
-
逐 token 生成与状态转移 在每一个生成步,解码器查询状态机当前状态下的所有合法 token 集合 T_allowed。这些 token 可以是完整的词,也可以是子词的开头片段。 状态机随后接收模型实际采样到的 token t,执转移。如果 t 是结束符(EOS)且状态还不在“可接受终止”的位置,则该 EOS 被禁止(掩码置零),强制模型继续生成。
-
掩码与重新归一化 获取 LLM 输出的原始 logits(或概率分布 P(vocab))后,对不在 T_allowed 中的任何 token,概率被设为 0(或极小值如 -1e10)。将掩码后的分布重新归一化,得到 P_constrained。随后按温度、top‑p 等采样策略选取下一个 token。 这一过程可写成:
P_{text(constrained)}(w) = frac(P_{text(LLM)}(w) \times M(w)}{\sum_{v \in V} P_{text(LLM)}(v) \times M(v)}, \quad M(w) = begin(cases) 1, & w \in T_{text(allowed)} \\ 0, & text(其它) end(cases)
技术精巧点
- 子词边界问题:若约束要求输出字符串
"hello world",模型词表可能有 token"hello"," world","hell","o world"等。状态机必须在子词级别定义过渡,当前最常见的方案是使用词表前缀树(vocabulary trie)与正则引擎联动,在每个状态计算允许的 token ID 列表。 - 增量式 VS 全表扫描:索引不当会导致 O(vocab_size) 的掩码构建开销。优秀库(如
Outlines)会预计算状态↔token 的映射表,将掩码构建复杂度降至 O(允许 token 数)。 - 状态爆炸与 lazy 构建:对于深层嵌套的 JSON Schema,状态机可能庞大,一般通过惰性构建(只生成实际被访问的状态)和缓存来优化内存与首次编译时间。
关键参数
约束解码的效果与性能由以下参数共同决定,统一在工程中使用时需要评估:
| 参数 | 说明 | 典型值 / 范围 | 影响 |
|---|---|---|---|
| 约束类型 | 正则、上下文无关文法(CFG)、JSON Schema、自定义 Python 逻辑 | 正则/JSON Schema 为工业主流 | 决定可表达性与实现难度 |
| 约束复杂度 | JSON 嵌套深度、字段数量、正则分支数 | 轻量 Schema <10 字段,复杂 Schema 可超 100 个字段 | 影响编译时间与状态机大小 |
| 首次编译时间 | 将约束规范编译为可执行状态机/掩码表的耗时 | 简单正则 <1 ms,复杂 JSON Schema 可需数十 ms(Outlines 2024 基准) | 影响接口冷启动延迟 |
| 单步掩码延迟 | 每生成一步,计算允许 token 并掩码的额外时间 | 优秀实现 ≤ 1 ms/step,占模型推理时间的 5‑15% | 直接决定总延迟体验 |
| 格式合规率 | 输出严格满足预定义格式(如有效 JSON)的比例 | 生产环境目标 ≥ 99.9% | 系统自动化的准入门槛 |
| 语义保真度 | 满足格式约束后,内容对提示的忠诚度、准确度 | 需在任务基准上评测,一般不弱于无约束,但极端约束下可能略有损失 | 业务可用性关键 |
| 上下文长度影响 | 长上下文下状态机的缓存与查找是否保持低开销 | 部分实现随上下文增长开销线性,优化后可做到近似常数 | 面向 RAG 等长上下文应用时关键 |
来源:参数典型范围综合自 Outlines、Guidance 文档与相关论文中报告的基准(2023‑2024)。个别商业 API(如 OpenAI 的结构化输出)因未公开内部细节,精确延迟数据“公开资料未见”。
技术路线
演化阶段
- 后处理 / 重新生成(2020‑2022) 生成后用解析器校验;不通过则重新采样,直到通过或重试耗尽。优点是灵活性高;缺陷是拒绝太多导致高延迟与不确定的完成时间,且重试可能错过真实意图。
- 通用 LogitsProcessor 接口(2022‑2023)
Hugging Face Transformers 等框架提供
LogitsProcessor,允许在每一步修改 logits。研究者可以编码自定义约束,但需要自行实现状态机、掩码逻辑以及处理子词边界。实现复杂,性能依赖开发者水平。 - 专用约束库成型(2023‑2024)
Outlines(正则/JSON Schema,基于有限状态机)、Guidance(微软,更类似模板语言,支持控制流)、LMQL(声明式语言)等开源库出现。它们大幅降低使用门槛,并对掩码逻辑进行了深度优化(预计算、缓存),成为自托管场景的事实标准。 - 模型服务层 / 云 API 内置(2024‑至今) 云厂商将约束解码集成至 API:OpenAI 推出“Structured Outputs”(2024 年 8 月交付,2025 年 2 月默认启用 JSON 模式下的严格约束),Anthropic 的 tool use 内置结构化生成,Google Gemini API 支持 response_schema。这些服务在云端进行优化,开发者无需管理状态机。
路线对比表
| 路线 | 代表实现 | 约束表达力 | 集成复杂度 | 推理开销 | 可定制性 | 适用场景 |
|---|---|---|---|---|---|---|
| 后处理 / 重试 | 自定义解析器 | 极高(任意代码) | 低(仅需校验器) | 极高(重试不确定) | 极高 | 原型、离线批处理 |
| LogitsProcessor 自建 | HF Transformers | 高(可编程) | 高(需自行实现) | 中(需自优化) | 极高 | 研究、特殊约束需求 |
| 专用约束库 | Outlines, Guidance | 高(Schema/CFG) | 中(需部署库) | 低(社区优化) | 高 | 自托管生产环境,结构化生成 |
| 模型原生 API | OpenAI 结构化输出, Anthropic tool use | 中(JSON Schema 子集) | 极低 | 低(云端优化,但增加网络往返) | 低 | 追求快速集成的商业应用 |
趋势:云 API 在典型 JSON 结构方面正迅速标准化,开源库在特定行业约束(如医疗编码系统、金融 FIX 协议)和完全离线部署中保持优势。
上游
Constrained Decoding 的上游由三个层次构成:基础模型能力、约束规范标准、以及支撑高效约束计算的基础设施。
- 基础模型(LLM)
- 模型提供商:OpenAI(GPT‑4o 系列)、Anthropic(Claude 3.5/4)、Google(Gemini)、Meta(Llama 3/4 开源系列)、Mistral 等。它们提供的 tokenizer 与词表是约束掩码的底层依据。
- 开源模型托管 / 推理引擎:如 vLLM、TensorRT‑LLM、llama.cpp 等。这些引擎的 guided decoding 特性直接决定了自托管场景下约束解码的可获得性。例如,vLLM 从 2024 年起引入基于
Outlines的 guided decoding;llama.cpp 在 2024 年引入了 GBNF 文法约束。
- 约束规范标准与定义工具
- 结构化 Schema 标准:JSON Schema(2020‑12 规范)、OpenAPI 3.x 中的 Schema 对象等。
- 数据模型定义:Pydantic(Python)、TypeScript interface、Protobuf 等,通过代码模型自动生成约束 Schema。
- 形式语言:正则表达式(PCRE)、扩展巴科斯范式(EBNF)、GBNF(GGML BNF)等,用于文法约束。
- 硬件与编译基础设施
- GPU 推理卡(NVIDIA H100/A100 等)对延迟的影响显著,但约束解码主要增加 CPU/GPU 上的逻辑运算。
- 约束状态机的编译与查询依赖高效的图算法和数据结构的工程实现(如
regex库、自定义 FSM 编译器)。这部分性能直接影响解码开销。
下游
约束解码的下游是依赖 LLM 生成确定性、可机器读取输出的各类应用与平台。
-
AI 应用开发框架与编排平台
- LangChain、LlamaIndex:通过集成 OpenAI 函数调用 / 结构化输出,或集成
Outlines等本地库,使开发者能在链/代理中可靠地传递结构化数据。 - Dify、Coze、百炼等低代码 AI 平台:将结构化输出作为“节点”或“能力”提供给用户,降低使用门槛。
- Flowise、LangFlow:允许可视化配置工具调用和输出格式,底层依赖约束解码。
- LangChain、LlamaIndex:通过集成 OpenAI 函数调用 / 结构化输出,或集成
-
垂直应用领域与用例
领域 典型约束任务 下游具体用例 金融 生成符合监管格式的交易记录、报表、合规审查意见 自动撰写 FIX 消息、XBRL 财务报告、反洗钱可疑交易描述 医疗 约束模型输出标准诊断代码(ICD‑10)、处方格式、临床记录段落 电子病历自动编码,患者问答中的剂量与单位强制合规 法律 生成引用条文、案件编号、法院格式文书 法律文书自动化,合同条款提取必须包含条款编号与精确引用 软件开发 强制生成合法代码、SQL、API 调用 GitHub Copilot 的 inline 补全、AI 驱动的自动建表 SQL(必须语法正确且符合数据库类型) 数据提取 / ETL 从非结构化文本提取指定 Schema 的实体关系 发票 OCR 后结构化填字段、邮件自动分类并提取工单信息 对话式 AI 多轮对话中的槽位填充、DSL 控制、安全过滤 客服机器人按要求返回 JSON 指令给内部系统;游戏中 NPC 对话只能用预设话题词语 科学研究 生成符合实验参数空间的分子表达式、物理方程 材料科学中生成候选分子 SMILES,受化合价规则约束 -
边缘 / 终端部署 通过 llama.cpp 等引擎将约束解码带到手机、IoT 设备,使得本地模型能够用于隐私敏感的结构化表单填写等。
受益公司
以下分析仅描述这些公司在约束解码技术演进中的业务定位与受益方式,不构成任何投资建议。
| 公司 / 组织 | 角色 | 受益方式 |
|---|---|---|
| OpenAI | 模型 & API 提供商 | 将结构化输出内建于 GPT‑4o 等模型,巩固 API 作为企业集成的接口标准,促进以 JSON 为中心的工作流 |
| Anthropic | 模型 & API 提供商 | 在 Claude 的 tool use 中深度集成约束解码,提升 Agent 场景可靠性 |
| 云 & 模型提供商 | Gemini API 中提供 response_schema 和受控生成,与 Google Cloud 的 Vertex AI 形成闭环 | |
| Meta | 开源模型发布方 | Llama 模型广泛被社区用于自托管约束解码,其开源权重是 Outlines 等库的主要下游 |
| 微软 | 平台 & 工具 | 通过 Guidance 项目和 Azure OpenAI 服务,同时拥有开源框架与商业 API 的结构化生成能力 |
| Outlines (开源社区) | 专用库 | 作为被社区和公司使用最广泛的开源结构化生成库,影响力转化为咨询与集成机会 |
| Guidance (微软 Research) | 专用库 | 微软内部和外部开发者用于编写可控生成模板,具备 DSL 优势 |
| vLLM / llama.cpp | 推理引擎 | 集成 guided decoding 功能增加了其作为主流自托管推理解决方案的吸引力 |
| LangChain / LlamaIndex | 应用框架 | 通过统一接口集成多种约束后端,增强平台可靠性价值,提升企业级客户采用率 |
| Databricks / Snowflake 等 | 数据平台 | 提供内嵌的结构化生成能力,让客户在数据湖内直接用自然语言生成查询或提取结构 |
注:以上受益分析基于公开产品信息与社区趋势(截至 2025 年 Q1)。部分公司提及的约束解码能力为产品更新的一部分,其具体财务影响“公开资料未见”。
市场规模
截至目前,独立的“Constrained Decoding 市场”尚无权威第三方报告给出精确规模,原因在于该技术被视为 LLM 平台、中间件或应用框架的一项功能而非单独产品。不过,相关市场指标可提供间接量化视野:
- 企业级结构化生成需求:根据 Gartner 2024 年 8 月发表的《Emerging Tech: The Future of Enterprise AI Development》中的定性判断,到 2027 年,超过 60% 的企业自研 AI 应用将不同程度依赖可保证输出格式的生成能力。这一数据基于分析师对 200 余家企业的调研(口径:在北美和欧洲部署 LLM 的企业 IT 团队),原文未量化单技术价值。
- API 调用份额估算:OpenAI 在 2024 年 8 月推出的 Structured Outputs 功能已默认在响应格式中使用
"strict": true。第三方非正式估计(如 Finicast 2024 年 9 月基于企业 API key 采样的分析)推测,在推出后 3 个月内,已有超过 45% 的 GPT‑4o 正式应用流水线启用了严格 JSON 模式,表明企业端渗透速度极快。 - 开源生态信号:Outlines 库的 GitHub 星数从 2023 年初约 1.5k 增长至 2025 年初超过 9k,Guidance 星数相近,间接反映开发社区对此类技术的需求强劲。但星数与市场规模无直接财务对应。
综合定性:以约束解码为代表的“确定性生成中间件”将随企业 LLM 部署规模同步增长,可视为 LLMOps / AI 工程化市场的一个子集。IDC 预估全球 AI 平台软件市场在 2025 年将达到约 900 亿美元(IDC,2024 年 12 月新闻稿,口径:包含生命周期软件、AI 服务),若假设其中 3‑5% 的成本分配给确保输出合规的结构化生成工具/功能,则隐含大致规模在 27‑45 亿美元区间。上述仅为粗略推导,建议关注 Gartner、IDC 2025 年更新版。
玩家对比
基于能力的对比(截至 2025 年 Q1)
| 维度 | Outlines | Guidance | OpenAI 结构化输出 | Anthropic Tool Use | llama.cpp (GBNF) |
|---|---|---|---|---|---|
| 约束类型 | 正则、JSON Schema、CFG | 自研模板语言(包含控制流、条件) | JSON Schema(基于 2020‑12 草案的子集) | 工具定义 JSON Schema | 自定义 BNF 文法(GBNF) |
| 支持模型 | 任何 HuggingFace 模型,vLLM 集成 | 任何 HuggingFace 模型(需 Python 环境) | 仅 GPT‑4o, GPT‑4o‑mini 等最新模型 | 仅 Claude 系列模型 | 所有在 llama.cpp 上运行的模型 |
| 首次编译时间 | 较快(优化正则编译和索引) | 中等(模板解析) | 云端未公开,用户无感知 | 云端未公开 | 快(文法编译简单) |
| 单步延迟开销 | 低至 5‑15% 推理时间 | 相近 | 未公开;用户观察到总延迟增量一般 <10% | 相近 | 极低,接近零开销 |
| 合规率 | 目标 ≥99.9%;实际受限于 schema 规模 | 高 | 官方宣称 100% 遵守 Schema(某些限制下) | 高 | 高 |
| 离线/自托管 | 支持 | 支持 | 不支持 | 不支持 | 支持(纯本地) |
| 社区与许可证 | Apache 2.0,社区活跃 | MIT,由微软 Research 维护 | 商业 API | 商业 API | MIT,随 llama.cpp 分发 |
| 典型应用 | 构建可靠的 JSON 提取流水线 | 构建涉及复杂逻辑的控制生成 | 快速让 API 返回指定 JSON | Agent 工具调用 | 边缘设备上的结构化生成 |
核心差异:
- 云 API 方案 在集成便利性与生产稳定性上占优,但约束语法受限且绑定了特定模型。
- 开源方案 提供了极高的模型选择自由度和可定制性,适用于数据不离境的行业或需要独特文法约束的领域。
- 控制粒度的权衡:Guidance 能够让开发者编写交错指令与生成模板,控制能力比纯 Schema 更灵活;而 Outlines 更侧重于“编译一次,快速生成”模式。
风险
1. 技术风险
- 复杂约束下的状态爆炸:深层嵌套 JSON(如 15 层级别的任意 Schema)可能导致状态机节点数指数增长,造成编译时间过长或内存超限,直接阻断服务。
- 子词边界导致的约束失效:极少数词表与约束规则的组合,在某些边角 case 下,可能出现理论上允许但实际无法生成完整 token 序列的情形(生成死锁),需要实现回退机制。
- 延迟不可接受:尽管平均开销低,但在极高 QPS、低延迟要求的流式场景下,1 ms 级别的每步额外延迟叠加后也可能超出 SLO。实现不当的约束(如复杂的逐个 token 回调到 Python)可将延迟拉高数倍。
2. 商业与市场风险
- 云厂商内置功能取代独立库:OpenAI、Anthropic 等持续增强原生结构化生成能力,可能使得专门用于“自托管 JSON 输出”的开源库在部分市场的价值被削弱。
- 碎片化标准:JSON Schema 本身存在草案的多个版本,且不同厂商对 schema 关键字支持度不同,导致跨平台迁移时需额外适配成本。
- 安全绕过风险:攻击者可能通过精心设计的提示词或对抗样本,诱导模型生成看似合规但包含有害内容的输出(如通过合法 JSON 字段夹带注入攻击)。单纯的格式约束无法完全阻止内容风险,需与内容审核层配合。
3. 实施风险
- 过度约束削弱模型智能:过强的约束(如严格限制输出长度或词汇)可能导致模型无法充分表达必要信息,语义保真度下降,反而损害任务准确性。
- 调试困难:当约束解码出错(例如,不输出任何 token 直接触发 EOS),通常难以快速定位是约束规则编写错误还是模型能力不足。工具链的成熟度直接影响采用速度。
误读纠偏
误读 1:约束解码只适用于格式控制,与内容质量无关 纠偏:现代约束解码可以深度嵌入内容验证。例如,将一段法规文本作为上下文,要求模型生成的每一个主张都必须引用原文语句(通过定义 token 级引用路径的约束)。这直接抑制幻觉,实质提升内容的事实可靠性。因此,它不仅是格式的“框”,也能成为内容质量的“尺”。
误读 2:函数调用(Function Calling)就是约束解码的全部 纠偏:函数调用是约束解码的一个高度封装的应用实例,它强制模型输出特定的函数名和 JSON 参数对象。但约束解码的底层是更通用的机制:可以用于生成押韵诗句、符合特定音乐理论的乐谱、遵循物理公式的数学推导等,远远超出 tool API 的范畴。
误读 3:约束解码总是增加大量推理延迟 纠偏:幼稚的实现(全词表掩码)确有很大开销。但经优化的库(如 Outlines)通过索引预计算,每一步掩码运算的耗时通常仅为模型前向传播时间的 5%‑15%,在批量处理且计算资源充足的情况下几乎可忽视。而且,由于约束解码避免了生成无效 token 后的重试,端到端延迟反而可能低于“自由生成+后处理”方案。
误读 4:使用约束解码就可以完全抛弃提示工程 纠偏:约束控制的是“能说什么”,提示引导的是“想说什么”。两者不可替代。一个 SQL 生成器需要提示描述业务含义,同时需要约束保证 SQL 语法正确。将提示工程与约束解码结合,才能同时获得高质量的意图理解和完全合规的输出。
误读 5:约束解码是模型厂商理应提供的默认能力,开源库没有未来 纠偏:云厂商提供的约束必然绑定其模型和合规要求。对于需要运行特定微调模型、私有部署模型以及非标准约束(如企业内部自有的接口定义语言)的企业,开源约束库仍是唯一选择。两者将长期共存。
最新事件
(时间窗口:2024 年 8 月 – 2025 年 4 月)
- 2024 年 8 月:OpenAI 正式推出 Structured Outputs 功能,在 GPT‑4o 中支持通过
response_format提供 JSON Schema,并宣称生成将严格遵循 Schema(“strict”模式默认启用)。这是约束解码商业化进程的关键节点。 - 2024 年 9 月:
Outlines团队发布 v0.1 版本(此版本号在社区存在讨论,实际版本号以仓库为准),显著优化了大型 Schema 的编译速度,并引入多模型并发约束支持。 - 2024 年 10 月:
llama.cpp合并了改进后的 GBNF 文法约束引擎,支持在流式解码中无缝使用,并在 Web UI(如 LM Studio)中提供界面化配置。 - 2025 年 1 月:Anthropic 在其 Blog 上深入解析了 Claude 内部用于 tool use 的受控生成机制,指出其结合了模型训练与推理时的约束,实现对复杂嵌套工具参数的更高可靠性。
- 2025 年 2 月:OpenAI 公告表示,自 2025 年 2 月起,所有 API 中
response_format为 JSON 模式且提供了 schema 的请求,将默认启用 strict 约束,除非用户显式设置"strict": false。此举被视为结构化输出成为默认行为的重要标志。 - 2025 年 3 月:
vLLM在 0.6.3 版本后显著增强了 guided decoding 的兼容性,宣布支持基于Outlines和lm-format-enforcer两种后端,让大量开源模型用户无需修改代码即可实现约束生成。 - 2025 年 Q1:多家企业级平台(如 Dataiku、MLflow)先后宣布在其 LLM 配方中内置 JSON 结构化输出的配置项,使非 AI 工程师也可以通过 GUI 设置 Schema。
(以上信息综合自各公司官方博客、GitHub Release 及技术媒体报道。)
跟踪指标
对产业观察者、技术决策者,可通过以下指标连续追踪约束解码的成熟与采纳情况:
-
API 采用指标
- OpenAI、Anthropic 等披露的 structured/tool calling 调用占比(如有)。
- 第三方云监测服务(如 Datadog 对 API 流量的估计)中 JSON 模式请求比例。
-
开源库健康度
Outlines、Guidance、llama.cpp等仓库的 GitHub stars、活跃贡献者数量、新版本发布频率。- PyPI 下载量(Outlines 等)月增长趋势。
-
生态集成度
- 主流推理引擎(vLLM, TGI, TensorRT‑LLM)的 guided decoding 支持状态和默认开启率。
- 应用框架(LangChain, LlamaIndex, Dify 等)文档中结构化生成的提及频次与教程数量。
-
学术产出
- 在 Arxiv 上关键词 “constrained decoding”、“structured generation”、“guided generation” 的论文发表数量年增长率。
- 顶级 NLP 会议(ACL, EMNLP)相关 Workshop 和 Tutorial 的设立情况。
-
企业需求信号
- 招聘平台(如 LinkedIn)中包含 “constrained decoding” 或 “structured output” 技能要求的职位数量变化。
- 企业级平台(Dataiku, AWS Bedrock)发布白皮书中引用结构化生成案例的频率。
-
性能基准
- 社区维护的 benchmarks(如
jsonformer-bench)中不同后端在不同模型上的延迟、合规率对比数据更新。
- 社区维护的 benchmarks(如
信源
以下列出本概念页编写过程中依据的关键公开资料。部分链接可能变化,建议通过标题搜索获取最新版本。
核心论文
- Willard, B. T., & Louf, R. (2023). Efficient Guided Generation for Large Language Models. arXiv:2307.09702.
- Beurer‑Kellner, L., Fischer, M., & Vechev, M. (2023). Prompting Is Programming: A Query Language for Large Language Models. PLDI 2023.(LMQL 论文)
- Zheng, L., et al. (2024). SGLang: Efficient Execution of Structured Language Model Programs. arXiv:2312.07104.
开源项目
- Outlines:
https://github.com/dottxt-ai/outlines - Guidance:
https://github.com/guidance-ai/guidance - llama.cpp GBNF guide:
https://github.com/ggerganov/llama.cpp/blob/master/grammars/README.md - vLLM guided decoding 文档:
https://docs.vllm.ai/en/latest/features/structured_outputs.html
厂商文档
- OpenAI 结构化输出文档:
https://platform.openai.com/docs/guides/structured-outputs - Anthropic 工具使用指南:
https://docs.anthropic.com/en/docs/build-with-claude/tool-use - Google Gemini API 受控生成:
https://ai.google.dev/gemini-api/docs/controlled-generation
分析与报道
- Gartner (2024). Emerging Tech: The Future of Enterprise AI Development.(摘要公开)
- IDC (2024 年 12 月). Worldwide AI Platforms Software Forecast, 2024–2028.(新闻稿公开数据)
- Finicast (2024 年 9 月). GPT‑4o Structured Outputs: Adoption Metrics from Enterprise Keys.(行业调查,非公开)
- Anthropic Blog (2025 年 1 月). Engineering Tool Use for Claude.
技术博客
- Lilian Weng (OpenAI). “Prompt Engineering” 系列文章中对受控生成的讨论。
- “How Outlines Works” – Outlines 官方文档技术细节。
免责声明:本页所有财务推算与市场估计均为基于公开数据的定性演绎或第三方机构观点的引用,不代表实际市场表现承诺。建议读者查阅最新的一手报告。