Tokens per Dollar
3 秒看懂
核心公式:
Tokens per Dollar (T/$) = 推理吞吐量 (Tokens/s) / 推理成本 ($/s)
等价于:生成的 Token 总数 / 为此支付的总费用
一句话定义:
它是衡量大语言模型(LLM)服务性价比的终极指标,直接回答“花一块钱,AI 能帮我生成多少有用的文字、代码或数据”。在 AI 应用从 demo 走向大规模落地的阶段,T/$ 已取代纯模型能力指标,成为判断一项 AI 服务是否具备商业可持续性的第一性原理指标。
3 分钟产业解释
Tokens per Dollar 突然成为产业焦点,标志着 AI 产业从“技术军备竞赛期”正式进入“成本与效率竞赛期”,核心逻辑正在发生底层切换。
- 过去(2023 年以前): 产业的北极星指标是“模型能力”——谁能刷新 MMLU、HumanEval 等榜单,谁就掌握话语权。推理成本虽然高昂,但开发者与投资人的容忍度较高,大家争夺的是“谁更聪明”。
- 现在(2024 年起): 随着 Agent、检索增强生成(RAG)、长文本总结、代码助手等复杂任务大规模上线,“有智能”已不够用,“用得起智能”成为硬约束。一个模型如果在处理百万文档时需要花费数万美元,其实际价值将归零。T/$ 被推至前台,成为连接 AI 技术能力与商业可行性的桥梁。
- 产业逻辑: 更高的 T/$ 对产业链各环节意味着完全不同的杠杆:
- 对模型服务商: 在相似质量下,T/$ 更高的 API 能迅速侵蚀竞争对手的市场份额;也可以选择维持较高毛利,同时用低价策略挤压中小对手。
- 对应用开发者/企业: 单位功能(如单次客服对话、单次代码补全、单次合同审查)的 Token 成本更低,使得产品化、C 端放量和复杂业务场景(如全库语义检索)具备财务上的可行性。
- 对技术与硬件: 它倒逼整个产业栈——从芯片架构、模型设计、推理引擎到数据中心基础设施——进行极致的优化。产业的最终愿景是实现 “智能的商品化”,让 AI 像水电一样按需、弹性、低成本调用。
技术原理
T/$ 表面上是一个除法,但其背后是模型能力、系统效率和硬件成本三股力量在特定调度策略下的综合博弈。理解其本质,需要将分子(推理吞吐量)和分母(推理成本)拆解至工程细节。
1. 提升分子:推理吞吐量(Tokens/s)
推理吞吐量衡量的是系统在单位时间内能稳定输出的总 Token 数量,它不是首 Token 延迟(TTFT),而是与并发请求数量、批处理效率、单请求生成长度密切相关的高负载指标。提升吞吐量的关键技术包括:
(a)内存带宽与注意力机制突破
自回归模型推理是“内存墙”受限的计算模式。注意力矩阵的内存占用、Key-Value 历史向量的反复读写,导致大量时间消耗在数据搬运而非计算上。
- FlashAttention 系列(v1/v2/v3): 通过分块(tiling)和重计算(recomputation),将注意力计算对 GPU 高带宽显存(HBM)的访问量从 O(N²) 降至 O(N),使长序列任务的批处理规模(batch size)能数倍增长,直接拉抬吞吐。
- KV Cache 优化: 对历史 Token 的 Key-Value 向量进行量化压缩(如 INT8/INT4 KV Cache)、跨请求共享或基于滑动窗口的淘汰,减少显存占用和重复计算,在请求并发量和生成长度之间取得更大自由度。
(b)计算效率提升
在有限的显存与算力预算下,提高每个比特产出的 Token 数量:
- 模型量化: 将权重、激活、甚至 KV Cache 从 FP16 进一步压缩至 FP8、INT8、INT4。如采用 AWQ、GPTQ 等精度感知量化方案,常可在无明显基准评测下降的情况下,将显存占用减半,允许同卡容纳更大的 batch size,从而提升吞吐 1.5–2 倍。
- 投机采样: 使用轻量级“草稿模型”快速预测数步 Token 序列,再由大模型一次性验证。在生成任务中,可将多次串行解码压缩为一次并行验证,在保证输出质量的前提下,将生成阶段的吞吐提升 1.5–3 倍(效果取决于草稿模型与主模型匹配度以及任务结构)。
(c)系统级调度与并行策略
- 持续批处理: 传统批量推理需等待一批请求全部生成结束才能释放资源。持续批处理可动态地在已有批次中插入新请求的 Token,使得 GPU 计算单元利用率接近 100%,相比静态批处理,吞吐量可提升 10–20 倍(据 vLLM 团队公开基准)。
- 模型并行: 对于无法放入单卡的超大模型,通过张量并行、流水线并行或专家并行(MoE 天然优势),将计算分布在多卡上。虽然引入通信开销,但可通过高速互联(NVLink、InfiniBand)控制,从而扩展总吞吐上限。
2. 优化分母:推理成本($/s)
成本是硬约束,它由硬件采购/租赁、软件栈、电力与运维等刚性支出构成。一个典型云端推理实例的成本结构大致为(公开资料综合估算,口径为 2024 年主流云厂商 Nvidia H100 实例场景):
- GPU/加速卡成本:约 60–75%
受芯片型号、采购方式(自持折旧 vs 云按需/预留实例)、租赁时长影响。 - 配套系统及软件:约 10–20%
包括高性能存储、网络互联、推理框架许可或内部开发分摊、系统运维人员成本。 - 数据中心与能源:约 10–20%
场地租金、电力消耗(GPU 满载时功耗极大)、冷却与保障。
因此,提升 T/$ 的本质 是:用更高效的软件栈(最大化吞吐量),在性价比最优的硬件平台上(控制单位算力成本),借助智能并发调度策略(让分母投入发挥最大效益),服务更多的并发请求,从而压低单位 Token 平均成本。
关键参数
除了核心指标 Tokens per Dollar,评价一个推理系统或 API 的整体表现还需要关注以下维度,它们共同决定 T/$ 的适用场景与用户体验。
- 首 Token 延迟:从请求发出到收到第一个生成 Token 的时间。决定了交互式应用(如对话 AI)的“响应感”。低延迟可能以牺牲部分吞吐为代价。
- Token 间延迟:流式输出中,相邻 Token 之间的平均时间间隔。影响用户的阅读体验和感知速度。
- 最大并发请求数(并发容量):系统在维持既定延迟 SLO(服务水平目标)下能同时处理的请求上限。高并发对应高吞吐潜力。
- 模型质量校准: T/$ 绝非纯粹的速度竞赛。必须结合模型在某项任务上的质量指标(如 MMLU、HumanEval、MT-Bench、Chatbot Arena ELO 分数)来构建“有效 T/$”,否则会被低质模型刷高指标。
- 总拥有成本(TCO): 针对自建推理集群的企业,TCO 覆盖 GPU 服务器折旧、电力、制冷、运维、网络、软件许可等全生命周期成本。它是自建方案与调用 API 之间做决策的真实分母。
- 每瓦特 Tokens: 在数据中心整体功耗约束越来越严的背景下,能效比直接影响长期运营成本和碳排边界,也是专用推理芯片的价值主张。
技术路线
当前产业在提升 T/$ 上已形成多条并行技术路线,不同路线之间存在取舍,且往往组合使用才能取得指数级效果。下表以 2024–2025 年行业公开信息为基础,梳理主要路线及其对 T/$ 的数量级影响。
| 优化方向 | 典型技术 / 方案 | 对 T/$ 的影响(量级估算) | 主要权衡与约束 | 参考来源 |
|---|---|---|---|---|
| 模型架构 | Dense 模型 → MoE 稀疏模型 | 同等质量下 T/$ 可提升 3–5 倍 | 需要更复杂的路由机制、跨专家通信开销;推广尚受工程与硬件生态限制 | 行业估算,综合 Mistral Mixtral 8x7B、DeepSeek-V2 等公开技术报告 |
| 推理精度 | FP16 → FP8 → INT4/INT8 量化 | 吞吐提升约 1.5–2.5 倍,成本下降同比例 | 需要量化感知训练或校准;超低精度可能影响某些任务的准确率;依赖硬件对目标格式的原生支持 | NVIDIA H100 FP8、开源 AWQ/GPTQ 项目实测 |
| 批处理与调度 | 持续批处理;分页注意力 | 吞吐量对比静态批处理可提升 10–20 倍 | 大幅增加调度复杂度,需要精密的显存管理;延迟可能小幅波动 | vLLM 等开源框架在 A100/H100 上的官方基准 |
| 注意力优化 | FlashAttention-2/3 | 长序列场景下内存效率提升、允许更大 batch,T/$ 有阶跃提升 | 需要针对特定 GPU 架构进行算子融合适配;并非所有框架均已集成 | FlashAttention 团队论文及英伟达技术博客 |
| 投机解码 | 投机采样(Speculative Decoding) | 生成阶段吞吐提升 1.5–3 倍 | 需要额外的草稿模型;提升上限取决于任务本身的熵与可预测性 | Google、META 等团队研究论文及 Together AI 实践 |
| 硬件定制 | 通用 GPU(A100/H100)vs 推理专用芯片(如 Groq LPU、d-Matrix) | 专用芯片在延迟与每瓦特性能上优势显著,总吞吐 / 成本比需具体场景验证 | 存在生态锁定风险;软件栈成熟度、模型迁移成本是推广瓶颈 | Groq LPU 公开 demo 与第三方评测 |
注:表中倍数均为典型场景下的估算范围,实际效果高度依赖具体模型结构、任务类型、硬件平台和工程实现水平。
上游
T/$ 的“上游”是指为模型的训练与推理提供基础算力、互连、存储和能源供给的产业环节。这些环节的成本和效率,最终构成了 T/$ 分母的基础。
-
芯片设计与制造
- 通用 GPU/AI 加速器: 英伟达(H100、B200 等)、AMD(Instinct MI300X 系列)、Intel(Gaudi 3)构成 2024–2025 年推理市场的主力供给。其中英伟达凭借 CUDA 生态与高浮点性能占据主导,其供给节奏与定价直接左右全球 T/$ 基线。
- 专用推理芯片: Groq(LPU 架构)、d-Matrix、Cerebras(晶圆级引擎)、SambaNova 等初创公司,围绕降低延迟、提升能效和简化 KV Cache 处理等路径设计芯片,试图在特定场景替代通用 GPU。
- “造芯”消费端: Google(TPU v5p/v5e)、AWS(Trainium/Inferentia)、微软(Maia)等云巨头自研加速器,优先用于内部推理服务,以降低对外部供应链的依赖并优化 T/$。
-
先进封装与存储
高带宽内存(HBM)是当前大模型推理的关键瓶颈。HBM3e 等的供应能力、价格,以及 CoWoS 先进封装产能,直接影响 GPU 的出货量和成本曲线。 -
网络与互连
NVIDIA NVLink、InfiniBand,以及博通等相关芯片供应商,决定了多 GPU 分布式推理的通信带宽与延迟。这部分成本在大型自建集群中不可忽视。 -
云基础设施
以 AWS、Azure、GCP 为代表的超大规模云服务商,通过规模化采购电力、数据中心与网络,设定着 API 调用和裸金属实例的租用价格,是整个产业链的定价锚点。
下游
“下游”是 T/$ 红利的直接获取方和应用落地方,他们对 T/$ 的敏感度与需求强度决定了产业链的放量速度。
- AI 应用开发者与 ISV:包括 SaaS 厂商、企业 IT 部门、独立开发者。他们使用模型 API 构建面向终端的功能——如代码助手(GitHub Copilot)、文档总结、客服机器人、营销文案生成等。T/$ 每翻一番,其产品毛利和可扩展市场空间就可能翻倍。
- 企业级部署: 金融、法律、医疗等讲究数据合规的大型组织,倾向自建推理集群。他们追求的是自建算力 T/$ 与商业 API T/$ 的交叉点,当自建 T/$ 高于市场 API 时,内部部署更具经济理性。
- 终端用户: C 端消费者和企业员工,是 AI 能力的最终消费者。他们不直接感知 T/$,但感知响应速度、使用成本和功能丰富度——所有这些都是由 T/$ 支撑的。
- 模型评估与中介平台: 诸如 Artificial Analysis、OpenRouter 等聚合和测评平台,将不同模型的 T/$ 进行透明化对比,帮助下游买方做出最优选型,加速高 T/$ 服务的采纳。
受益公司
以下分类梳理在 T/$ 持续提升趋势中,产业链各环节主要受益逻辑的公司与项目(仅作产业逻辑梳理,不构成任何投资建议)。
(1)高 T/$ 模型 API 供应商
- DeepSeek: 凭借 DeepSeek-V2 等 MoE 模型,以显著低于同行的 API 定价(如 2024 年中发布的百万 Token 输入/输出价格降至 1 元人民币级别),迅速打开市场,成为高 T/$ 现象级代表。
- Together AI、Fireworks AI、Anyscale: 专注于高效推理引擎和开源模型托管,通过软件优化压低价格,提供极具竞争力的 T/$。
- OpenAI、Anthropic、Google: 尽管绝对价格常高于上述参与者,但在前沿模型质量领先的前提下,持续推进降价(如 GPT-4o 多次降价、Gemini Flash 的低价方案),维持“有效 T/$”的吸引力。
(2)推理引擎与系统软件
- vLLM(社区开源,Anyscale 背后支持): 以持续批处理和 PagedAttention 等技术,成为开源文本生成推理的事实标准之一,是许多高 T/$ 服务的技术底座。
- NVIDIA TensorRT-LLM: 深度整合硬件优势,为 H100/B200 等提供最佳推理效率,是企业方案和闭源服务的重要选择。
- SGLang、llama.cpp 等社区项目: 分别在结构化生成和消费级硬件推理上提供差异化 T/$ 优化。
(3)推理硬件与芯片平台
- Groq: 以 LPU 架构实现极低延迟的实时推理,其公开演示的高速 Token 输出刷新了业界对 T/$ 即时感知的认知。
- Cerebras、d-Matrix: 借助晶圆级集成或存内计算等新型架构,瞄准高吞吐、低功耗推理市场。
- 英伟达、AMD: 作为通用算力底座,几乎每一次硬件代际更新(H100→B200)都会为整个市场带来一次 T/$ 的跨越。
(4)基础设施与运维
- 云厂商(AWS、Azure、GCP)和裸金属提供商(CoreWeave 等),通过优化资源池和采用最新 GPU,持续降低单位 Token 的硬件摊销成本,是隐性的 T/$ 受益者。
市场规模
关于 AI 推理市场及 T/$ 提升带来的经济影响,目前缺乏单一权威统计,但可以从多个口径拼凑出增长潜力(数据主要引用 2024 年市场报告与行业分析)。
- 大模型推理市场: 据 Fortune Business Insights 2024 年 Q2 报告,全球生成式 AI 市场(含训练和推理)预计将从 2024 年的约 672 亿美元增长至 2032 年的约 1.3 万亿美元。其中,推理在进入规模化部署阶段后占比将显著增加。另一份来自 SemiAnalysis 的分析指出,到 2025 年,大模型推理将占据 AI 算力消耗约 60% 以上份额,成为主要成本项。
- API 经济规模: 以 OpenAI 为例,媒体估算其 2024 年化收入中 API 部分占比持续上升;而像 Groq、Together AI 等初创企业也在 2024 年获得数亿美元融资,间接反映了市场对未来推理服务体量的预期。
- “降本换量”效应: 根据部分 LLM 服务商公开发布,2023 年至 2024 年间,同等能力的模型 API 价格下降了 50%–90%,同时调用量增长了 5–20 倍不等,显现出强价格弹性。T/$ 每大幅提升,通常会推动下游对 Token 消耗量出现指数级增长(来源:各公司官方博客公开的降价公告与使用量统计)。
- 中国市场规模: 公开资料中缺少对中国独立推理市场规模的权威统计,但从各云厂商(阿里云、华为云、腾讯云)密集下调模型 API 价格以及百模大战的态势来看,2024 年中国市场的推理 Token 消耗量同比增长很可能超过一个数量级(公开报道综合判断)。
注:上述数字中,全球市场预测引用自立信会计师事务所、Fortune Business Insights 等商业机构报告,请以原报告为准;基于价格下降推测的市场增长为定性判断,并非精确收入模型。
玩家对比
以下基于公开的 API 定价、社区基准与行业测评,对比 2024 年底至 2025 年初主要模型提供商的 T/$ 特征(价格以每百万 Token 为单位,截取自各公司官网定价页及 Artificial Analysis 2024 年 12 月快照)。
| 提供商 / 模型 | 输入价格 | 输出价格 | T/$ 典型范围(输出)* | 模型质量参考 | 关键特征 |
|---|---|---|---|---|---|
| DeepSeek (V2/V3) | ¥1.00 | ¥2.00 | 极高(同价格下输出 Token 数量约为 GPT-4o 的 5–10 倍) | 中文知识、数学、代码接近 GPT-4 级别 | MoE 架构 + 极致工程优化,国内定价颠覆者 |
| OpenAI GPT-4o | $2.50 / 百万输入 | $10.00 / 百万输出 | 中等偏高 | 多模态、多语言综合能力领先 | 价格较 2023 年已降低 90%,生态最成熟 |
| Anthropic Claude 3.5 Sonnet | $3.00 / 百万输入 | $15.00 / 百万输出 | 中等 | 长上下文、安全性、写作风格突出 | 企业级功能(合规、审计)加持 |
| Google Gemini 1.5 Flash | $0.075 / 百万输入 | $0.30 / 百万输出 | 极高 | 在低算力成本下提供接近前沿的质量 | 超低价 + 长上下文窗口(1M Token),极致 T/$ |
| Mistral Large 2 | $2.00 / 百万输入 | $6.00 / 百万输出 | 中高 | 多语言、英文优异 | 欧洲旗舰,通过 Azure 等平台分发 |
| Groq LPU 上的 Llama 3.1 70B/405B | 按请求速率计费 | 取决于并发 | 极高(吞吐为主) | 开源模型标准质量 | 延迟极低(数百 Token/s),适合实时交互 |
注:T/$ 为“输出 Token 数/费用”,考虑模型质量后的“有效 T/$”排名会进一步变化;价格数据来自各官网 2024 年末公布,可能存在区域差异;表格仅为说明性对比,不构成任何服务推荐。
对比显示,产业格局正在分化为两条路径:
- 前沿智能溢价路线: OpenAI、Anthropic 靠最强模型质量和工具链维持较高价格,但因持续降价和模型蒸馏,其 T/$ 也在快速改善。
- 极致性价比路线: DeepSeek、Gemini Flash、以及基于开源模型的低价托管服务(Together、Fireworks 等),通过低价或开源将 T/$ 作为主要竞争武器,迅速获取大批价格敏感型用户。
风险
Tokens per Dollar 作为产业指挥棒的同时,也潜藏着多层面风险,需在产业分析中予以警惕。
- 质量稀释风险: 一味追求高 T/$ 可能催生“低价低智”模型。部分服务商用量化或蒸馏大幅压成本,但模型在某些复杂任务上的准确率、稳定性大幅下降。若产业缺乏统一的质量加权标准,劣币可能驱逐良币。
- 供应链与地缘政治风险: 英伟达 GPU 在推理市场近乎垄断的份额,使全球 T/$ 受制于其产能分配、出口管制政策。2023–2024 年美国对华出口限制已迫使中国部分厂商转向降级版本(如 H20),导致其 T/$ 提升路径额外受限。
- 技术迭代过快的沉没成本: 今天看似先进的优化方案(如某款量化算法、某一代专用芯片)可能在 6–12 个月内被新架构替代。自建集群若不能快速折旧与更新,可能面临 T/$ 远落后于 API 服务的困境。
- 收入与利润脱节: 头部企业为抢占市场份额进行补贴式定价,导致部分高 T/$ 服务的长期盈利能力存疑。当资本退潮或企业回归利润本位时,可能面临涨价或服务质量下降,影响下游应用稳定性。
- 安全与合规风险: 极高的 T/$(尤其推理速度)可能被恶意用于大规模生成虚假信息、诈骗内容或自动漏洞挖掘。监管趋严将增加模型合规成本,反过来推高分母,降低有效 T/$。
- 指标单一化误区: 仅以 T/$ 衡量服务价值,可能忽略 SLA 保障、数据隐私、微调能力、插件生态等企业级要素。过度关注 T/$ 可能导致产业忽视长尾的企业需求。
误读纠偏
产业中最常见的三个认知误区,需反复澄清。
误读 1:“模型参数越小,T/$ 就越高。”
纠偏: 完全错误。MoE 模型总参数量可以极大(甚至万亿级),但处理每个 Token 时仅激活一小部分参数,由此在保持高质量的同时,T/$ 显著优于采用 Dense 结构的中等参数模型。T/$ 的核心是**“有效算力的性价比”**,而非“参数量”的性价比。软件与算法优化(量化、投机采样、KV Cache 压缩)对 T/$ 的提升往往远大于简单地切换更小的模型。
误读 2:“T/$ 就是 API 的公开标价(每千 Token 多少钱)。”
纠偏: 不完全等同。API 标价是商业决策的结果,包含了品牌、服务水平协议(SLA)、利润和生态投入等非技术因素。而 T/$ 侧重于技术层面的效率评估。一个极便宜的 API,若智力水平只有同行的 1/3,花同样钱获得的“有效智能”可能反而更低。必须将模型质量(通过权威基准或实际任务评测)引入,构建质量加权的有效 T/$,才能真正指导采购决策。
误读 3:“提升 T/$ 只是算法工程师的事。”
纠偏: 提升 T/$ 是一项横跨算法、系统、硬件、网络、数据中心的全栈系统工程。量化算法需要工程团队无缝集成到推理框架;芯片架构直接决定优化的理论天花板;网络团队决定了分布式推理的通信效率;甚至数据中心选址(电力成本与冷却方案)也会影响自建集群的 T/$。试图把责任归为单一职能,注定无法获得最优解。
最新事件
T/$ 领域的演进速度极快,以下截取 2024–2025 年初对产业格局产生显著影响的事件。
- 中国市场的“价格血战”(2024 年 5 月起): DeepSeek-V2 开源并公布极低 API 价格后,字节跳动、阿里巴巴、百度、腾讯等中国云厂商纷纷宣布大幅下调大模型服务价格,部分模型降至百万 Token 输入价格几毛钱至 1 元的水平,T/$ 在中文市场出现跳跃式提升。
- OpenAI 持续降价与效率提升(2024 全年): GPT-4o 发布后历经多次降价,到 2024 年底输出价格相较于 2023 年的 GPT-4 降低了约 90%。Sam Altman 等人在公开采访中多次强调“降低 Token 成本是公司的最高优先级之一”。
- Google Gemini Flash 的 T/$ 破局(2024 年 12 月): Gemini 1.5 Flash 以每百万输出词元不到 0.3 美元的价格,且支持 100 万 Token 上下文窗口,被社区视为“高 T/$ 基准线”的定义者之一,迫使竞品进一步下调价格。
- Groq 商用服务上线与实时 T/$ 演示(2024 年 Q3): Groq 通过 LPU 推理引擎向开发者提供 API 访问,极低的延迟与高吞吐的演示在社交媒体掀起“极速 Token 生成”热潮,使得市场开始区分“批量处理 T/$”与“实时交互 T/$”两种需求。
- 英伟达 Blackwell 发布与推理性能飞跃(2024 年 GTC): B200 GPU 首次将 FP4 精度引入数据中心推理,宣称相比 H100 在 LLM 推理上可实现 2–3 倍的每美元性能提升,为下一阶段 T/$ 的基数跃升埋下硬件伏笔。
跟踪指标
要持续监测 T/$ 的产业动态,建议关注以下公开指标与信息源:
- 各厂商 API 定价页与更新公告 – 观察输入/输出单价、缓存、批处理折扣等变化,可最直接地感知 T/$ 走势。
- Artificial Analysis 基准平台 – 提供跨模型、跨服务商的延迟、吞吐和价格/性能的综合对比,包含基于价格的标准化指标。
- LLM 排行榜与 Elo 分数 – Chatbot Arena、Open LLM Leaderboard 等,用于判断“有效 T/$”变化是否伴随质量折损。
- 硬件与云服务 SKU 变化 – 关注云厂商 GPU 实例(如 AWS p5、GCP Cloud TPU v5e、Azure ND MI300X v5)的可用性和定价,这是自建集群 T/$ 的底层变量。
- 科技巨头财报电话会与 Capital Markets Day – 可了解推理业务在收入结构中的占比、毛利率趋势、资本开支方向(如自研芯片进展)。
- 开源社区与新研究 – 跟踪 vLLM、SGLang、llama.cpp 的 Star 数与 Release Notes,以及 FlashAttention、投机解码等论文的后续进展,是判断下一轮 T/$ 跃升的前兆。
信源
本文参考和推荐的可信信源如下(按类型和名称排序):
行业基准与数据分析
- Artificial Analysis(https://artificialanalysis.ai/) – 模型性能与价格实时对比
- OpenRouter(https://openrouter.ai/) – 跨模型 API 聚合与成本对比
技术论文与官方技术博客
- FlashAttention 系列(Tri Dao et al.)
- vLLM: Easy, Fast, and Cheap LLM Serving with PagedAttention(Kwon et al.)
- 投机解码原始论文(Leviathan et al.,Google;Chen et al.,Meta)
- NVIDIA Developer Blog、Anyscale Blog、Together AI Blog
公司定价页与官方消息
- OpenAI、Anthropic、Google Gemini、DeepSeek、Mistral AI、Groq、Together AI 等官方网站
市场研究报告
- Fortune Business Insights,Generative AI Market Report(2024)
- SemiAnalysis、Omdia 等半导体与基础设施研究机构报告
开源项目与社区
- GitHub: vllm-project/vllm, NVIDIA/TensorRT-LLM, huggingface/text-generation-inference, sgl-project/sglang
所有价格、性能数据均来自上述公开信源在 2024–2025 年初某个时点的快照,后续更新请以各来源最新发布为准。