OCR-free VLM
① 3 秒看懂
- 一句话概念:一种不依赖传统 OCR 文字识别,直接对文档图像进行“视觉理解+语言推理”的端到端视觉语言大模型。
- 核心价值:保留版面布局、表格结构与视觉上下文,避免 OCR 文字识别环节的信息损失与错误累积,在处理复杂排版、手写体、特殊字体、图表等场景时准确性通常更高,并可同时输出结构化数据、摘要或代码。
- 典型形态:输入“文档截图/扫描件 + 自然语言指令”,直接返回答案、JSON、Markdown 表格或总结段落,中间无独立 OCR 文本生成步骤。
② 3 分钟产业解释
传统方案的痛点
过去,文档智能的标准流水线是:图像预处理 → OCR(文字识别) → 版面解析 → NLP(自然语言处理)分析。该组合链路存在两个系统性问题:
- 信息损失:OCR 把页面转化为纯文本序列时,会丢弃表格的二维关系、字体大小、颜色、图像与文字的关联、印章位置等视觉线索,后续 NLP 组件难以恢复这些信息;
- 错误累积:OCR 识别错误(例如将“O”误认为“0”、手写体识别不准、倾斜文字丢失)直接进入下游任务,且无法被下游模块纠正,最终导致报表数字误读、合同条款错漏等严重后果。
OCR-free VLM 的解法和市场定位
OCR-free VLM 的范式是:将文档图像像素和人类查询指令同时输入一个多模态大模型,模型内部并行完成“看见”“读字”“理解版面”“语义推理”,然后直接生成最终答案。这相当于一位既懂排版设计、又能通读全文、还擅长逻辑分析的专家,一次性审阅文件并回答问题,省去了“抄写员”(OCR)易出错的中间环节。
技术流程简图
输入:文档图像(JPG/PNG/PDF 渲染) + 指令(“提取发票中的金额和税号,用 JSON 输出”)
↓
视觉编码器:将图像切分成 patch,生成保留空间位置关系的视觉 token
跨模态投影 + 与大语言模型自回归生成
↓
输出:符合格式要求的文本 / 结构化数据 / 可执行代码
相对于传统 OCR 管线,OCR-free VLM 天然具备多页关联、跨段落推理、图形与文字协同理解的能力,正在金融票据、医疗报告、合同审查、保单核验等对准确率和结构保留要求极高的领域快速渗透。
③ 技术原理
OCR-free VLM 不是单一算法,而是一套端到端多模态架构,核心围绕“怎样让 LLM 直接读懂像素级的文档”展开。
3.1 视觉编码(Visual Encoding)
通常采用 Vision Transformer(ViT)或其变体(如 SigLIP、ViT-22B 等),将输入图像划分为固定大小的 patch(如 16×16 像素),并通过自注意力机制把每个 patch 映射为高维视觉 token 序列。这些 token 既包含局部纹理(字符形状、线条)也包含全局布局信息(分栏、表头、段落块)。部分模型使用更高分辨率的“动态分块”(如将所有图像缩放到统一基准后切出多个子图)来保证小字、密集表格不被压缩损失。
3.2 跨模态对齐与连接
视觉 token 的数量通常远大于文本 token 数量(一张高分辨率文档图可能产生数千个 patch),直接输入 LLM 会导致注意力复杂度爆炸。因此需要一个连接器模块进行降维和空间聚合。常见方案包括:
- 线性投影/MLP:简单地将每个 patch token 映射到 LLM 隐藏维度,但不减少 token 数量;
- 可学习查询压缩(Q-Former / perceiver):用固定数量的可学习查询向量与所有视觉 token 进行交叉注意力,压缩成固定长度序列,再送入 LLM;
- 视觉语言连接器(类似 BLIP-2、LLaVA 的架构):先经过轻量级 Q-Former 或 MLP,输出对齐后的表示;
- 像素到文本的直接生成(如 Pix2Struct):将图像 patch 坐标直接编码为位置信息,让 LLM 以序列生成的方式“读取”页面。
3.3 大语言模型主干
接收融合了视觉信息的指令隐状态,以自回归方式逐 token 生成答案。常用的主干包括 LLaMA 系列、Gemini 原生架构、Qwen、InternLM 等。训练分为预训练(图文配对,重建屏蔽的文本/图像块)和指令微调(大量“文档图像-问题-答案”三元组,结合多任务数据,如布局检测、表格识别、抽取式问答、摘要等)。
3.4 关键创新与训练策略
- 面向文档的二维位置编码:除了一维文本顺序位置,额外引入二维坐标位置编码(如 Pix2Struct 的屏幕坐标编码、UDOP 的统一布局编码),让模型感知“横纵排列”;
- 多尺度与高分辨率训练:通过高分辨率 ViT、分图训练策略,确保小字号文字和密集表格可被准确识别;
- 合成数据与数据增强:利用 LaTeX、HTML、Word 文档渲染、传统 OCR 输出等,生成海量图文-指令对,弥补真实标注数据不足。
④ 关键参数
由于 OCR-free VLM 领域模型和版本众多,下面列出的指标均为基于公开论文与官方技术报告中提取的代表性参考值,具体以各厂商最新版本为准。
| 参数指标 | 典型值 / 范围 | 说明 | 年份/来源 |
|---|---|---|---|
| 模型总参数量 | 7B – 1T+ | 涵盖轻量端侧部署的 7B-13B 到云端超大模型(如 Gemini Ultra 未公开参数)。 | 2024 各公司白皮书 |
| 视觉编码器参数 | 300M – 4B | 通常使用 ViT-G/14(约 1B)或 SigLIP 等,部分自研。 | Google、OpenAI 技术报告 2024 |
| 最大输入图像分辨率 | 1344×1344 至 4K+ | GPT-4V 最高支持 2048×2048;Gemini 1.5 Pro 可处理原始分辨率的整页文档和 1000 页 PDF。 | OpenAI Blog 2024, Google I/O 2024 |
| 视觉 token 数量上限 | 256 – 4096 个 token | Q-Former 压缩常用 64-256 个可学习查询;直接投影则可达 4096 tokens 以保留细节。 | 学术论文 2023-2024 |
| 上下文窗口(含多页) | 128K – 10M tokens | Gemini 1.5 Pro 支持 10M token 窗口,可一次性阅读整本书籍或数千页文档。 | Google 2024 |
| 推理延迟(单页) | 1 – 10 秒(云端) | 受分辨率、答案长度、并发影响;轻量模型可在 <2 秒完成。 | 公开技术评测 2024 |
| 文档 VQA 准确率 (DocVQA) | 93.0% – 95.5% (ANLS) | GPT-4V 和 Gemini 1.5 Pro 达到领先;开源 Qwen-VL-Max 亦接近 93%。 | DocVQA 排行榜 2024 |
| 图表问答准确率 (ChartQA) | 85% – 90%+ | 专有模型领先;开源 InternVL2 约 84%。 | ChartQA leaderboard 2024 |
| 训练数据类型与规模 | 数亿至数十亿图文对 + 数百万指令样本 | 包含真实扫描件、PDF、HTML 渲染,以及合成数据。 | 公开资料未见各厂商精确披露规模 |
注:部分开源模型性能数据参考 OpenCompass 等第三方评测平台 2024 年评测。
⑤ 技术路线
OCR-free VLM 目前存在多条并行演进的技术路线,主要差异在于视觉 token 的表示方式、多模态融合的层级以及是否保留传统 OCR 的后路。
5.1 纯像素生成路线(Pixel-to-Text)
代表:Google 的 Pix2Struct 系列及衍生。核心思想是把输入图像的像素坐标编码为“虚拟文本”,即 (x,y) 坐标映射为特殊 token,使 LLM 把 2D 页面当作一维序列来读取。优点是简单,可直接复用纯文本预训练成果;缺点是高分辨率下坐标 token 数量暴增,对长上下文要求高。
5.2 视觉编码器 + 连接器 + LLM 管线
这是目前最主流的技术栈,典型案例包括 LLaVA-NeXT、Qwen-VL、InternVL2、mPLUG-Owl 等。视觉编码器独立,通过连接器压缩 token,LLM 不直接感知原始像素坐标,而是依赖连接器保留的空间关系。优势是视觉编码器和 LLM 可以分别缩放和升级,生态繁荣;不足是连接器可能成为瓶颈,丢失精细几何信息。
5.3 原生多模态骨干(Fully Native)
如 Gemini 系列,从一开始就设计为多模态混合模型,视觉与文本 token 在模型底层深度交错,不需要单独的视觉编码器与连接器。理论上能得到最丰富的跨模态交互,细节保留最好,但训练成本极高,闭源。
5.4 混合式(OCR + VLM 双保险)
部分厂商锚定“OCR-free”目标,但不完全放弃传统 OCR 输出,而是用 VLM 兼顾 OCR 文本和图像,进行融合推理。例如 Microsoft 的 UDOP 模型,同时支持 OCR 文本、图像和布局信息的统一编码。这类方案在实际工程中可提供更高的鲁棒性,尤其适合超长文档或极端手写场景,但系统复杂度更高。
5.5 开源生态路线
以 Meta、阿里、智谱、书生·浦语 等为代表的开源模型家族,通过公开权重和数据清洗策略,推动 OCR-free VLM 在学术和中小企业中的低成本部署。开源模型在 DocVQA、ChartQA 等基准上的得分正快速追赶闭源模型。
⑥ 上游
6.1 算力与芯片
训练与推理主要依赖大规模 GPU/TPU 集群。英伟达 A100/H100 仍然是主流,AMD MI300X 等逐步渗透。云端推理占用大量 FLOPS。对 OCR-free VLM 来说,高分辨率输入带来的是计算量二次方增长,因此上游算力供应商(如英伟达、台积电、三星存储、光模块厂商)和云服务商(AWS、Azure、Google Cloud、阿里云、华为云)是直接受益方。
成本参考:根据公开信息,训练一个千亿级参数的多模态模型需数千张 H100 运行数周,总成本可达数千万到数亿美元(口径:仅考虑算力租赁成本,不含数据集采集标注与人员成本,来源:公开行业估算 2024)。单次文档推理成本约为 $0.001–$0.05/页,视模型规模和分辨率而定(来源:各云厂商 API 定价 2024 公告,估算)。
6.2 数据标注与合成
高质量“文档图像-指令-答案”三元数据是 OCR-free VLM 性能的天花板。上游包含:
- 文档图像采集:扫描亿级公开书籍、笔记、发票、合同样本(需处理版权和隐私);
- 合成数据引擎:利用 LaTeX、HTML、CSS 将结构化内容排版渲染为图文混合页面,自动生成问答对;
- 人工精细标注:针对特定行业(如医疗化验单、物流运单)需要专业标注团队,单张复杂文档的人工标注成本可超过 5 美元(口径:中国、印度通用标注市场报价,2024)。
公开资料未见到该细分领域统一的市场规模统计,按行业估算全球文档 AI 数据服务市场 2024 年约为 3–5 亿美元。
6.3 传统 OCR 引擎
在部分混合架构中,仍依赖传统 OCR 引擎提供初始文本作为辅助输入。因此,遗留 OCR 引擎仍然是上游环节。代表包括 ABBYY、Tesseract(开源)、百度 OCR、合合信息 OCR 等。
⑦ 下游
下游场景已从单纯的“表格提取”扩展为全流程智能文档处理,覆盖大量垂直行业。
- 金融与保险:银行对账单识别、保单核验、理赔单自动审阅、贷前调查报告生成。2024 年某大型银行年报披露其文档智能平台日均处理 100 万页票据,准确率比 OCR+规则方案提升 5 个百分点(来源:银行科技年度报告 2024)。
- 医疗:检验报告关键指标提取、电子病历结构化、影像报告与文本对照。由于医疗数据高度敏感,多采用私有化部署,OCR-free VLM 能减少多环节造成的出错。
- 法律与合规:合同条款差异比对、侵权证据图片分析、政府公文自动归档与摘要。
- 制造业与供应链:质检报告自动录入、设备铭牌识别、物料清单多语言转换。
- 政务与档案馆:历史档案数字化、手写公文识别、跨页关联归档。
- 零售与物流:运单/面单信息提取、发票 OCR-free 校验、商品图片与描述智能匹配。
下游以行业解决方案商和系统集成商为主,采购中游 API 或私有化部署模型。
⑧ 受益公司
以下仅基于公开信息梳理相关业务布局,不构成任何投资或选型建议,所有数据截至 2025 年 4 月。
算力及基础设施:英伟达(GPU 份额占主导,Hopper 架构 H100/H200 出货量高增长,2024 财年数据中心营收 475 亿美元,来源:英伟达 FY2024 年报)、AMD(MI300X 加速渗透)、台积电(先进制程)、光模块等。
国际模型与平台:
- 谷歌:Gemini 1.5 Pro/Flash 内置超长上下文和多模态理解,在文档 VLM 基准领先,同时通过 Google Cloud 提供 Document AI 商业服务。
- 微软/OpenAI:Azure 推广 GPT-4V/GPT-4o,通过与 Word、Teams、Power Automate 集成渗透企业文档流程。
- Meta:开源 LLaMA 3 Vision 模型,降低 OCR-free 落地门槛。
中国主要厂商:
- 阿里巴巴:通义千问-VL 系列,Qwen2-VL 开源多尺寸模型,支持发票、表格等场景;阿里云提供百炼平台。
- 腾讯:混元大模型多模态版本,整合企点、腾讯文档等 SaaS 产品。
- 百度:文心一言多模态,结合 OCR 生态赋能百度智能云文档处理。
- 合合信息:从传统商业 OCR 向“OCR-free 增强”转型,推出 TextIn 文档解析 API,支持表格、图片混合解析,公开招股书(2023)提及在智能文字识别市场份额领先。
- 科大讯飞:星火大模型多模态能力应用于教育、司法卷宗等文档理解。
- 智谱 AI:CogVLM/CogView 系列,开源多模态模型在文档基准上表现积极。
- 上海人工智能实验室:书生·浦语(InternVL)系列开源,性能强劲。
- 深眸科技、竹间智能等初创也在聚焦文档智能和 RPA 结合的 OCR-free 场景。
云服务商:阿里云、华为云、腾讯云、百度云、AWS、Azure 均提供打包了 OCR-free VLM 的智能文档服务 API,受益于渗透率提升。
⑨ 市场规模
由于 OCR-free VLM 是 2023 年后才成形的细分技术范畴,目前尚无独立的权威市场规模统计。行业通常合并到更广泛的 文档人工智能(Document AI) 或 智能文档处理(IDP) 市场中。据公开数据:
- 全球光学字符识别(OCR)市场:Grand View Research 2024 年报告显示,2023 年全球 OCR 市场规模约 148.7 亿美元,预计 2024-2030 年 CAGR 约 15%。传统 OCR 仍占大部分,但多模态和 AI 驱动部分增速更快。
- 全球智能文档处理(IDP)市场:Research and Markets 2024 年预测,2024 年全球 IDP 市场约 28 亿美元,2030 年有望突破 80 亿美元,CAGR 超过 20%(口径:包含 AI 信息提取、分类、流程自动化,来源:Research and Markets 2024 年报告摘要)。
- 中国市场:根据 IDC 2024 年发布的《中国智能文档处理市场追踪》,2023 年中国智能文档处理(含 OCR、NLP、RPA)市场规模约 12.4 亿美元(折算),预计到 2027 年将达到 35 亿美元以上,年复合增长率约 30%(来源:IDC 2024,口径:软件+服务)。票据、金融、政务是前三大应用领域。
在 OCR-free VLM 的带动下,文档 AI 市场正从“工具”向“决策支持”升级,规模增量主要来自替换现有 OCR 规则系统以及拓展原本无法自动化处理的高价值文档场景(复杂合同、多语言混合报告等)。
⑩ 玩家对比
下表选取具有代表性的 OCR-free VLM 模型/服务进行维度对比,数据截至 2025 年 3 月,基于公开文档或第三方评测。
| 玩家/模型 | 模型规格 | 输入分辨率 | 最大上下文 | 开源 | 文档 VQA 性能 (DocVQA) | 定价/成本参考 | 特色能力 |
|---|---|---|---|---|---|---|---|
| Google Gemini 1.5 Pro | 未公开(估计 >100B) | 最高 4K | 10M tokens | 否 | 约 95.5% (ANLS) | 每百万输入 tokens $3.5 / 输出 $10.5 | 极长上下文,支持视频、音频,多页联合分析 |
| OpenAI GPT-4o | 未公开多模态 | 2048×2048 | 128K tokens | 否 | 约 94% | 每百万输入 tokens $5 / 输出 $15 | 速度比 GPT-4V 快 2 倍,图像理解深度好 |
| Qwen2-VL-72B (阿里) | 72B (ViT+LLM) | 动态分辨率最高 1600×1600 | 128K tokens | 开源 | 约 93% | 开源权重;API 约 $2/百万 tokens | 支持中文专优,复杂表格精度高 |
| InternVL2 (书生) | 76B | 动态分块,可达 4K | 128K tokens | 开源 | 约 92.5% | 开源权重 | 多尺度裁剪,视频理解扩展 |
| CogVLM2 (智谱) | 19B | 1344×1344 | 8K tokens | 开源 | 约 91% | 开源权重 | 轻量,端侧推理友好 |
| 合合信息 TextIn | 未公开 | 支持高分辨率扫描 | API 按需 | 否 | 未公开规范测试 | 按页计价,量大折扣(公开资料未见统一定价) | 专注商业文档,版本迭代快,整合传统 OCR |
注:基准数据来自 DocVQA 和 ChartQA 官方排行榜或各厂商公布的最佳成绩(2024 下半年至 2025 年初),不同版本和配置可能略有差异。
中国玩家在中文复杂表格、手写体、印章识别等本土场景普遍有针对性优化,开源模型加速生态构建;国际巨头则在长上下文、多语言、跨模态推理和规模化部署上更为成熟。
⑪ 风险
- 幻觉与误读风险:模型可能根据图像片段生成看似合理但错误的信息,在医疗、法律等零容错场景可能导致严重后果。2024 年某研究显示顶尖模型在医疗报告提取任务仍有 3-5% 的关键数值错误率。
- 数据隐私与合规:文档含大量个人隐私和商业机密,云端推理需确保数据合规、本地化存储,金融业、政府等客户多要求私有化部署,增加 IT 成本。
- 高成本与投资回报不确定:API 单价虽下降,但处理海量文档的年度账单仍高昂;自建部署需持续投入算力和优化人员,投资回报测算依赖客户场景实际效率提升。
- 对传统 OCR 产业链的破坏性影响:传统 OCR 厂商核心业务模式受到挑战,迫使转型或价格战,行业可能出现集中度提升。
- 技术栈锁定与碎片化:不同 API 的指令格式、输出结构不统一,集成企业可能产生较高切换成本,开源模型碎片化也增加运维复杂度。
- 长尾场景鲁棒性不足:极端模糊、畸变、古文书、非主流语言仍可能导致大幅性能下降,且缺乏公开 benchmark,风险隐蔽。
- 环境与能源影响:大模型推理的高能耗引发可持续性争议,在 ESG 评审严格的地区可能影响采购决定。
⑫ 误读纠偏
-
误读 1:“OCR-free 意味着不再需要任何 OCR” 纠正:OCR-free 主要指模型主推理链路不依赖显式 OCR 文本生成,但在高可靠场景中,许多系统仍保留 OCR 输出作为双路校验或辅助输入。并不意味着 OCR 技术立刻被淘汰。
-
误读 2:“端到端模型一定比 OCR+规则更准” 纠正:在大规模标准测试中,OCR-free VLM 综合准确率通常更高,但在个别极端难例或固定模板场景下,经过精细规则调优的传统 OCR 管线仍可能更稳定。准确率取决于训练数据覆盖度和后处理。
-
误读 3:“所有 PDF 都可以直接丢进去,模型全能看懂” 纠正:多数模型要求将 PDF 渲染为图像,对加密、矢量图形嵌套、超长页面跨页等仍有处理限制;部分模型对扫描件与原生电子文档的性能存在差异。用户需进行预处理和分页。
-
误读 4:“开源模型免费,部署无成本” 纠正:开源权重固然免费,但推理所需 GPU 算力、集成开发、持续更新、安全加固等构成隐性总拥有成本(TCO),需纳入整体计算。
-
误读 5:“OCR-free VLM 已成熟到可无人值守” 纠正:当前技术仍处于快速迭代期,在高风险场景下建议保持人机协同,设置置信度阈值和人工审核兜底。
⑬ 最新事件
以下为 2024 年末至 2025 年 4 月 OCR-free VLM 领域的重要事件,体现技术演进和产业化进展。
- 2024 年 12 月:Google 发布 Gemini 2.0 Flash 实验版,支持多模态实时交互,成本降低,文档理解延迟显著缩小,同时提供缓存以优化反复解析同一文档的成本。
- 2025 年 1 月:OpenAI 推出 GPT-4o 更新,提升复杂图表与表格的推理准确度,并在 API 中新增更灵活的结构化输出约束(JSON Schema 严格模式),更适合下游自动化。
- 2025 年 2 月:阿里通义千问 Qwen2.5-VL 系列开源,提升动态分辨率至 4K,文档解析能力在多基准上超越部分闭源模型,引发中国开发者大量集成。
- 2025 年 3 月:上海人工智能实验室联合多家机构发布 InternVL2.5,在多模态长文档理解 benchmark 上刷新记录,并首次加入“多页跨页推理”专项测试。
- 2025 年 3 月:合合信息更新 TextIn 文档解析能力,增加对印章遮挡文本的专项优化,支持表格还原为可编辑 Excel,API 调用量单月增长 40%(来源:公司官方微信公众号)。
- 2025 年 4 月:微软在 Build 2025 预热中透露将把多模态文档理解深度整合进 Microsoft 365 Copilot,实现“截图即分析”,推动 OCR-free 进入亿级办公用户视野。
- 生态动态:OpenCoDe 联盟(开放文档理解倡议)成立,多家开源模型厂商和学术机构共同制定统一的文档理解评测标准和数据格式,推动互操作性。
⑭ 跟踪指标
要持续追踪 OCR-free VLM 的技术成熟度和产业渗透,可以关注以下量化指标和事件:
- 技术指标:DocVQA、ChartQA、InfoVQA、FUNSD、SROIE 等基准排行榜得分变化,各模型 ANLS/F1 提升幅度;单页推理延迟(P50/P99)、首 token 生成时间。
- API 与产品数据:主流云厂商智能文档 API 调用量、月活客户数(公开披露);价格变动($/页、$/千 tokens);支持语种、垂直行业模板数量。
- 开源动态:GitHub 星数趋势,Hugging Face 下载量变化;新开源模型的参数、许可协议(Apache 2.0 等)与评测报告。
- 行业落地:大型金融机构、医院、政务平台公开招标中的“多模态文档理解”或“OCR-free”技术要求频次;专业服务公司(如四大会计师事务所)发布的文档 AI 采纳率调查。
- 融资与并购:文档智能赛道初创公司(国内与海外)的融资额、轮次;传统 OCR 企业转型动作(新产品发布、合作伙伴)。
- 政策与标准:数据安全法、个人信息保护法、医疗/金融行业数据合规细则对文档 AI 推理的要求;信通院相关评测和标准发布。
- 突发事件:重大模型事故或隐私泄露事件;模型幻觉导致严重后果的合规案例;开源模型被用于敏感场景引发的监管讨论。
⑮ 信源
- Google DeepMind. “Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.” 2024.
- OpenAI. “GPT-4V(ision) System Card.” 2023; GPT-4o 技术报告及 Blog 2024-2025.
- Alibaba Cloud. “Qwen2-VL: Generalized Vision-Language Model.” 2024-2025.
- Shanghai AI Laboratory. “InternVL 2.0: Scaling Vision Foundation Models for Multimodal Understanding.” 2024.
- Google Research. “Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding.” ICLR 2023.
- Microsoft. “UDOP: Unified Document Processing for Vision, Text, and Layout.” CVPR 2023.
- OpenAI, Meta, Mistral 等各大模型官方博客与 Hugging Face 模型卡.
- DocVQA 官方排行榜 (rrc.cvc.uab.es), ChartQA leaderboard, OpenCompass 评测平台.
- Grand View Research. “Optical Character Recognition Market Size, Share & Trends Analysis Report, 2024–2030.”
- Research and Markets. “Intelligent Document Processing Market – Global Forecast to 2030.” 2024.
- IDC. “中国智能文档处理市场追踪报告.” 2024.
- 合合信息首次公开发行股票并在科创板上市招股说明书. 2023.
- 各公司财报、公开技术白皮书、官方微信公众号发布(英伟达、合合信息等).
- 中国信息通信研究院相关评测报告与标准(如“可信 AI”文档智能评测).
声明:本文基于公开资料整理,内容仅供产业研究参考,不构成任何投资、技术选型或采购建议。文中涉及的公司、产品及数据均为截止 2025 年 4 月的公开信息,可能存在滞后或口径差异,具体以相关机构最新披露为准。