OCR-free VLM
① 3 秒看懂
- 一句話概念:一種不依賴傳統 OCR 文字識別,直接對文件影像進行“視覺理解+語言推論”的端到端視覺語言大型模型。
- 核心價值:保留版面版面配置、表格結構與視覺上下文,避免 OCR 文字識別環節的資訊損失與錯誤累積,在處理複雜排版、手寫體、特殊字型、圖表等場景時準確性通常更高,並可同時輸出結構化資料、摘要或程式碼。
- 典型形態:輸入“文件截圖/掃描件 + 自然語言指令”,直接返回答案、JSON、Markdown 表格或總結段落,中間無獨立 OCR 文本生成步驟。
② 3 分鐘產業解釋
傳統方案的痛點
過去,文件智慧的標準流水線是:影像預處理 → OCR(文字識別) → 版面解析 → NLP(自然語言處理)分析。該組合鏈路存在兩個系統性問題:
- 資訊損失:OCR 把頁面轉化為純文本序列時,會丟棄表格的二維關係、字型大小、顏色、影像與文字的關聯、印章位置等視覺線索,後續 NLP 元件難以恢復這些資訊;
- 錯誤累積:OCR 識別錯誤(例如將“O”誤認為“0”、手寫體識別不準、傾斜文字丟失)直接進入下游任務,且無法被下游模組糾正,最終導致報表數字誤讀、合同條款錯漏等嚴重後果。
OCR-free VLM 的解法和市場定位
OCR-free VLM 的範式是:將文件影像畫素和人類查詢指令同時輸入一個多模態大型模型,模型內部並行完成“看見”“讀字”“理解版面”“語義推論”,然後直接生成最終答案。這相當於一位既懂排版設計、又能通讀全文、還擅長邏輯分析的專家,一次性審閱檔案並回答問題,省去了“抄寫員”(OCR)易出錯的中間環節。
技術流程簡圖
輸入:文件影像(JPG/PNG/PDF 渲染) + 指令(“提取發票中的金額和稅號,用 JSON 輸出”)
↓
視覺編碼器:將影像切分成 patch,生成保留空間位置關係的視覺 token
跨模態投影 + 與大語言模型自迴歸生成
↓
輸出:符合格式要求的文本 / 結構化資料 / 可執行程式碼
相對於傳統 OCR 管線,OCR-free VLM 天然具備多頁關聯、跨段落推論、圖形與文字協同理解的能力,正在金融票據、醫療報告、合同審查、保單核驗等對準確率和結構保留要求極高的領域快速滲透。
③ 技術原理
OCR-free VLM 不是單一演算法,而是一套端到端多模態架構,核心圍繞“怎樣讓 LLM 直接讀懂畫素級的文件”展開。
3.1 視覺編碼(Visual Encoding)
通常採用 Vision Transformer(ViT)或其變體(如 SigLIP、ViT-22B 等),將輸入影像劃分為固定大小的 patch(如 16×16 畫素),並通過自注意力機制把每個 patch 對映為高維視覺 token 序列。這些 token 既包含區域性紋理(字元形狀、線條)也包含全域性版面配置資訊(分欄、表頭、段落塊)。部分模型使用更高解析度的“動態分塊”(如將所有影像縮放到統一基準後切出多個子圖)來保證小字、密集表格不被壓縮損失。
3.2 跨模態對齊與連線
視覺 token 的數量通常遠大於文本 token 數量(一張高解析度文件圖可能產生數千個 patch),直接輸入 LLM 會導致注意力複雜度爆炸。因此需要一個聯結器模組進行降維和空間聚合。常見方案包括:
- 線性投影/MLP:簡單地將每個 patch token 對映到 LLM 隱藏維度,但不減少 token 數量;
- 可學習查詢壓縮(Q-Former / perceiver):用固定數量的可學習查詢向量與所有視覺 token 進行交叉注意力,壓縮成固定長度序列,再送入 LLM;
- 視覺語言聯結器(類似 BLIP-2、LLaVA 的架構):先經過輕量級 Q-Former 或 MLP,輸出對齊後的表示;
- 畫素到文本的直接生成(如 Pix2Struct):將影像 patch 座標直接編碼為位置資訊,讓 LLM 以序列生成的方式“讀取”頁面。
3.3 大語言模型主幹
接收融合了視覺資訊的指令隱狀態,以自迴歸方式逐 token 生成答案。常用的主幹包括 LLaMA 系列、Gemini 原生架構、Qwen、InternLM 等。訓練分為預訓練(圖文配對,重建遮蔽的文本/影像塊)和指令微調(大量“文件影像-問題-答案”三元組,結合多工資料,如版面配置檢測、表格識別、抽取式問答、摘要等)。
3.4 關鍵創新與訓練策略
- 面向文件的二維位置編碼:除了一維文本順序位置,額外引入二維座標位置編碼(如 Pix2Struct 的螢幕座標編碼、UDOP 的統一版面配置編碼),讓模型感知“橫縱排列”;
- 多尺度與高解析度訓練:通過高解析度 ViT、分圖訓練策略,確保小字號文字和密集表格可被準確識別;
- 合成數據與資料增強:利用 LaTeX、HTML、Word 文件渲染、傳統 OCR 輸出等,生成海量圖文-指令對,彌補真實標註資料不足。
④ 關鍵引數
由於 OCR-free VLM 領域模型和版本眾多,下面列出的指標均為基於公開論文與官方技術報告中提取的代表性參考值,具體以各廠商最新版本為準。
| 引數指標 | 典型值 / 範圍 | 說明 | 年份/來源 |
|---|---|---|---|
| 模型總引數量 | 7B – 1T+ | 涵蓋輕量端側部署的 7B-13B 到雲端端超大型模型(如 Gemini Ultra 未公開引數)。 | 2024 各公司白皮書 |
| 視覺編碼器引數 | 300M – 4B | 通常使用 ViT-G/14(約 1B)或 SigLIP 等,部分自研。 | Google、OpenAI 技術報告 2024 |
| 最大輸入影像解析度 | 1344×1344 至 4K+ | GPT-4V 最高支援 2048×2048;Gemini 1.5 Pro 可處理原始解析度的整頁文件和 1000 頁 PDF。 | OpenAI Blog 2024, Google I/O 2024 |
| 視覺 token 數量上限 | 256 – 4096 個 token | Q-Former 壓縮常用 64-256 個可學習查詢;直接投影則可達 4096 tokens 以保留細節。 | 學術論文 2023-2024 |
| 上下文視窗(含多頁) | 128K – 10M tokens | Gemini 1.5 Pro 支援 10M token 視窗,可一次性閱讀整本書籍或數千頁文件。 | Google 2024 |
| 推論延遲(單頁) | 1 – 10 秒(雲端端) | 受解析度、答案長度、併發影響;輕量模型可在 <2 秒完成。 | 公開技術評測 2024 |
| 文件 VQA 準確率 (DocVQA) | 93.0% – 95.5% (ANLS) | GPT-4V 和 Gemini 1.5 Pro 達到領先;開源 Qwen-VL-Max 亦接近 93%。 | DocVQA 排行榜 2024 |
| 圖表問答準確率 (ChartQA) | 85% – 90%+ | 專有模型領先;開源 InternVL2 約 84%。 | ChartQA leaderboard 2024 |
| 訓練資料型別與規模 | 數億至數十億圖文對 + 數百萬指令樣本 | 包含真實掃描件、PDF、HTML 渲染,以及合成數據。 | 公開資料未見各廠商精確揭露規模 |
注:部分開源模型效能資料參考 OpenCompass 等第三方評測平台 2024 年評測。
⑤ 技術路線
OCR-free VLM 目前存在多條並行演進的技術路線,主要差異在於視覺 token 的表示方式、多模態融合的層級以及是否保留傳統 OCR 的後路。
5.1 純畫素生成路線(Pixel-to-Text)
代表:Google 的 Pix2Struct 系列及衍生。核心思想是把輸入影像的畫素座標編碼為“虛擬文本”,即 (x,y) 座標對映為特殊 token,使 LLM 把 2D 頁面當作一維序列來讀取。優點是簡單,可直接複用純文本預訓練成果;缺點是高解析度下座標 token 數量暴增,對長上下文要求高。
5.2 視覺編碼器 + 聯結器 + LLM 管線
這是目前最主流的技術棧,典型案例包括 LLaVA-NeXT、Qwen-VL、InternVL2、mPLUG-Owl 等。視覺編碼器獨立,通過聯結器壓縮 token,LLM 不直接感知原始畫素座標,而是依賴聯結器保留的空間關係。優勢是視覺編碼器和 LLM 可以分別縮放和升級,生態繁榮;不足是聯結器可能成為瓶頸,丟失精細幾何資訊。
5.3 原生多模態骨幹(Fully Native)
如 Gemini 系列,從一開始就設計為多模態混合模型,視覺與文本 token 在模型底層深度交錯,不需要單獨的視覺編碼器與聯結器。理論上能得到最豐富的跨模態互動,細節保留最好,但訓練成本極高,閉源。
5.4 混合式(OCR + VLM 雙保險)
部分廠商錨定“OCR-free”目標,但不完全放棄傳統 OCR 輸出,而是用 VLM 兼顧 OCR 文本和影像,進行融合推論。例如 Microsoft 的 UDOP 模型,同時支援 OCR 文本、影像和版面配置資訊的統一編碼。這類方案在實際工程中可提供更高的魯棒性,尤其適合超長文件或極端手寫場景,但系統複雜度更高。
5.5 開源生態路線
以 Meta、阿里、智譜、書生·浦語 等為代表的開源模型家族,通過公開權重和資料清洗策略,推動 OCR-free VLM 在學術和中小企業中的低成本部署。開源模型在 DocVQA、ChartQA 等基準上的得分正快速追趕閉源模型。
⑥ 上游
6.1 算力與晶片
訓練與推論主要依賴大規模 GPU/TPU 叢集。輝達 A100/H100 仍然是主流,AMD MI300X 等逐步滲透。雲端端推論佔用大量 FLOPS。對 OCR-free VLM 來說,高解析度輸入帶來的是計算量二次方增長,因此上游算力供應商(如輝達、台積電、三星儲存、光模組廠商)和雲端服務商(AWS、Azure、Google Cloud、阿里雲端、華為雲端)是直接受益方。
成本參考:根據公開資訊,訓練一個千億級引數的多模態模型需數千張 H100 執行數週,總成本可達數千萬到數億美元(口徑:僅考慮算力租賃成本,不含資料集採集標註與人員成本,來源:公開行業估算 2024)。單次文件推論成本約為 $0.001–$0.05/頁,視模型規模和解析度而定(來源:各雲端廠商 API 定價 2024 公告,估算)。
6.2 資料標註與合成
高質量“文件影像-指令-答案”三後設資料是 OCR-free VLM 效能的天花板。上游包含:
- 文件影像採集:掃描億級公開書籍、筆記、發票、合同樣本(需處理版權和隱私);
- 合成數據引擎:利用 LaTeX、HTML、CSS 將結構化內容排版渲染為圖文混合頁面,自動生成問答對;
- 人工精細標註:針對特定行業(如醫療化驗單、物流運單)需要專業標註團隊,單張複雜文件的人工標註成本可超過 5 美元(口徑:中國、印度通用標註市場報價,2024)。
公開資料未見到該細分領域統一的市場規模統計,按行業估算全球文件 AI 資料服務市場 2024 年約為 3–5 億美元。
6.3 傳統 OCR 引擎
在部分混合架構中,仍依賴傳統 OCR 引擎提供初始文本作為輔助輸入。因此,遺留 OCR 引擎仍然是上游環節。代表包括 ABBYY、Tesseract(開源)、百度 OCR、合合資訊 OCR 等。
⑦ 下游
下游場景已從單純的“表格提取”擴充套件為全流程智慧文件處理,覆蓋大量垂直行業。
- 金融與保險:銀行對賬單識別、保單核驗、理賠單自動審閱、貸前調查報告生成。2024 年某大型銀行年報揭露其文件智慧平台日均處理 100 萬頁票據,準確率比 OCR+規則方案提升 5 個百分點(來源:銀行科技年度報告 2024)。
- 醫療:檢驗報告關鍵指標提取、電子病歷結構化、影像報告與文本對照。由於醫療資料高度敏感,多采用私有化部署,OCR-free VLM 能減少多環節造成的出錯。
- 法律與合規:合同條款差異比對、侵權證據圖片分析、政府公文自動歸檔與摘要。
- 製造業與供應鏈:質檢報告自動錄入、裝置銘牌識別、物料清單多語言轉換。
- 政務與檔案館:歷史檔案數字化、手寫公文識別、跨頁關聯歸檔。
- 零售與物流:運單/面單資訊提取、發票 OCR-free 校驗、商品圖片與描述智慧匹配。
下游以行業解決方案商和系統整合商為主,採購中游 API 或私有化部署模型。
⑧ 受益公司
以下僅基於公開資訊梳理相關業務版面配置,不構成任何投資或選型建議,所有資料截至 2025 年 4 月。
算力及基礎設施:輝達(GPU 份額佔主導,Hopper 架構 H100/H200 出貨量高增長,2024 財年資料中心營收 475 億美元,來源:輝達 FY2024 年報)、AMD(MI300X 加速滲透)、台積電(先進製程)、光模組等。
國際模型與平台:
- Google:Gemini 1.5 Pro/Flash 內建超長上下文和多模態理解,在文件 VLM 基準領先,同時通過 Google Cloud 提供 Document AI 商業服務。
- 微軟/OpenAI:Azure 推廣 GPT-4V/GPT-4o,通過與 Word、Teams、Power Automate 整合滲透企業文件流程。
- Meta:開源 LLaMA 3 Vision 模型,降低 OCR-free 落地門檻。
中國主要廠商:
- 阿里巴巴:通義千問-VL 系列,Qwen2-VL 開源多尺寸模型,支援發票、表格等場景;阿里雲端提供百鍊平台。
- 騰訊:混元大型模型多模態版本,整合企點、騰訊文件等 SaaS 產品。
- 百度:文心一言多模態,結合 OCR 生態賦能百度智慧雲端文件處理。
- 合合資訊:從傳統商業 OCR 向“OCR-free 增強”轉型,推出 TextIn 文件解析 API,支援表格、圖片混合解析,公開招股書(2023)提及在智慧文字識別市場份額領先。
- 科大訊飛:星火大型模型多模態能力應用於教育、司法卷宗等文件理解。
- 智譜 AI:CogVLM/CogView 系列,開源多模態模型在文件基準上表現積極。
- 上海人工智慧實驗室:書生·浦語(InternVL)系列開源,效能強勁。
- 深眸科技、竹間智慧等初創也在聚焦文件智慧和 RPA 結合的 OCR-free 場景。
雲端服務商:阿里雲端、華為雲端、騰訊雲端、百度雲端、AWS、Azure 均提供打包了 OCR-free VLM 的智慧文件服務 API,受益於滲透率提升。
⑨ 市場規模
由於 OCR-free VLM 是 2023 年後才成形的細分技術範疇,目前尚無獨立的權威市場規模統計。行業通常合併到更廣泛的 文件人工智慧(Document AI) 或 智慧文件處理(IDP) 市場中。據公開資料:
- 全球光學字元識別(OCR)市場:Grand View Research 2024 年報告顯示,2023 年全球 OCR 市場規模約 148.7 億美元,預計 2024-2030 年 CAGR 約 15%。傳統 OCR 仍佔大部分,但多模態和 AI 驅動部分增速更快。
- 全球智慧文件處理(IDP)市場:Research and Markets 2024 年預測,2024 年全球 IDP 市場約 28 億美元,2030 年有望突破 80 億美元,CAGR 超過 20%(口徑:包含 AI 資訊提取、分類、流程自動化,來源:Research and Markets 2024 年報告摘要)。
- 中國市場:根據 IDC 2024 年釋出的《中國智慧文件處理市場追蹤》,2023 年中國智慧文件處理(含 OCR、NLP、RPA)市場規模約 12.4 億美元(折算),預計到 2027 年將達到 35 億美元以上,年複合增長率約 30%(來源:IDC 2024,口徑:軟體+服務)。票據、金融、政務是前三大應用領域。
在 OCR-free VLM 的帶動下,文件 AI 市場正從“工具”向“決策支援”升級,規模增量主要來自替換現有 OCR 規則系統以及拓展原本無法自動化處理的高價值文件場景(複雜合同、多語言混合報告等)。
⑩ 玩家對比
下表選取具有代表性的 OCR-free VLM 模型/服務進行維度對比,資料截至 2025 年 3 月,基於公開文件或第三方評測。
| 玩家/模型 | 模型規格 | 輸入解析度 | 最大上下文 | 開源 | 文件 VQA 效能 (DocVQA) | 定價/成本參考 | 特色能力 |
|---|---|---|---|---|---|---|---|
| Google Gemini 1.5 Pro | 未公開(估計 >100B) | 最高 4K | 10M tokens | 否 | 約 95.5% (ANLS) | 每百萬輸入 tokens $3.5 / 輸出 $10.5 | 極長上下文,支援影片、音訊,多頁聯合分析 |
| OpenAI GPT-4o | 未公開多模態 | 2048×2048 | 128K tokens | 否 | 約 94% | 每百萬輸入 tokens $5 / 輸出 $15 | 速度比 GPT-4V 快 2 倍,影像理解深度好 |
| Qwen2-VL-72B (阿里) | 72B (ViT+LLM) | 動態解析度最高 1600×1600 | 128K tokens | 開源 | 約 93% | 開源權重;API 約 $2/百萬 tokens | 支援中文專優,複雜表格精度高 |
| InternVL2 (書生) | 76B | 動態分塊,可達 4K | 128K tokens | 開源 | 約 92.5% | 開源權重 | 多尺度裁剪,影片理解擴充套件 |
| CogVLM2 (智譜) | 19B | 1344×1344 | 8K tokens | 開源 | 約 91% | 開源權重 | 輕量,端側推論友好 |
| 合合資訊 TextIn | 未公開 | 支援高解析度掃描 | API 按需 | 否 | 未公開規範測試 | 按頁計價,量大折扣(公開資料未見統一定價) | 專注商業文件,版本迭代快,整合傳統 OCR |
注:基準資料來自 DocVQA 和 ChartQA 官方排行榜或各廠商公佈的最佳成績(2024 下半年至 2025 年初),不同版本和配置可能略有差異。
中國玩家在中文複雜表格、手寫體、印章識別等本土場景普遍有針對性最佳化,開源模型加速生態建置;國際巨頭則在長上下文、多語言、跨模態推論和規模化部署上更為成熟。
⑪ 風險
- 幻覺與誤讀風險:模型可能根據影像片段生成看似合理但錯誤的資訊,在醫療、法律等零容錯場景可能導致嚴重後果。2024 年某研究顯示頂尖模型在醫療報告提取任務仍有 3-5% 的關鍵數值錯誤率。
- 資料隱私與合規:文件含大量個人隱私和商業機密,雲端端推論需確保資料合規、本地化儲存,金融業、政府等客戶多要求私有化部署,增加 IT 成本。
- 高成本與投資回報不確定:API 單價雖下降,但處理海量文件的年度賬單仍高昂;自建部署需持續投入算力和最佳化人員,投資回報測算依賴客戶場景實際效率提升。
- 對傳統 OCR 產業鏈的破壞性影響:傳統 OCR 廠商核心業務模式受到挑戰,迫使轉型或價格戰,行業可能出現集中度提升。
- 技術棧鎖定與碎片化:不同 API 的指令格式、輸出結構不統一,整合企業可能產生較高切換成本,開源模型碎片化也增加運維複雜度。
- 長尾場景魯棒性不足:極端模糊、畸變、古文書、非主流語言仍可能導致大幅效能下降,且缺乏公開 benchmark,風險隱蔽。
- 環境與能源影響:大型模型推論的高能耗引發可持續性爭議,在 ESG 評審嚴格的地區可能影響採購決定。
⑫ 誤讀糾偏
-
誤讀 1:“OCR-free 意味著不再需要任何 OCR” 糾正:OCR-free 主要指模型主推論鏈路不依賴顯式 OCR 文本生成,但在高可靠場景中,許多系統仍保留 OCR 輸出作為雙路校驗或輔助輸入。並不意味著 OCR 技術立刻被淘汰。
-
誤讀 2:“端到端模型一定比 OCR+規則更準” 糾正:在大規模標準測試中,OCR-free VLM 綜合準確率通常更高,但在個別極端難例或固定模板場景下,經過精細規則調優的傳統 OCR 管線仍可能更穩定。準確率取決於訓練資料覆蓋度和後處理。
-
誤讀 3:“所有 PDF 都可以直接丟進去,模型全能看懂” 糾正:多數模型要求將 PDF 渲染為影像,對加密、向量圖形巢狀、超長頁面跨頁等仍有處理限制;部分模型對掃描件與原生電子文件的效能存在差異。使用者需進行預處理和分頁。
-
誤讀 4:“開源模型免費,部署無成本” 糾正:開源權重固然免費,但推論所需 GPU 算力、整合開發、持續更新、安全加固等構成隱性總擁有成本(TCO),需納入整體計算。
-
誤讀 5:“OCR-free VLM 已成熟到可無人值守” 糾正:當前技術仍處於快速迭代期,在高風險場景下建議保持人機協同,設定置信度閾值和人工稽核兜底。
⑬ 最新事件
以下為 2024 年末至 2025 年 4 月 OCR-free VLM 領域的重要事件,體現技術演進和產業化進展。
- 2024 年 12 月:Google 釋出 Gemini 2.0 Flash 實驗版,支援多模態即時互動,成本降低,文件理解延遲顯著縮小,同時提供快取以最佳化反覆解析同一文件的成本。
- 2025 年 1 月:OpenAI 推出 GPT-4o 更新,提升複雜圖表與表格的推論準確度,並在 API 中新增更靈活的結構化輸出約束(JSON Schema 嚴格模式),更適合下游自動化。
- 2025 年 2 月:阿里通義千問 Qwen2.5-VL 系列開源,提升動態解析度至 4K,文件解析能力在多基準上超越部分閉源模型,引發中國開發者大量整合。
- 2025 年 3 月:上海人工智慧實驗室聯合多家機構釋出 InternVL2.5,在多模態長文件理解 benchmark 上重新整理記錄,並首次加入“多頁跨頁推論”專項測試。
- 2025 年 3 月:合合資訊更新 TextIn 文件解析能力,增加對印章遮擋文本的專項最佳化,支援表格還原為可編輯 Excel,API 呼叫量單月增長 40%(來源:公司官方微信公眾號)。
- 2025 年 4 月:微軟在 Build 2025 預熱中透露將把多模態文件理解深度整合進 Microsoft 365 Copilot,實現“截圖即分析”,推動 OCR-free 進入億級辦公使用者視野。
- 生態動態:OpenCoDe 聯盟(開放文件理解倡議)成立,多家開源模型廠商和學術機構共同制定統一的文件理解評測標準和資料格式,推動互操作性。
⑭ 追蹤指標
要持續追蹤 OCR-free VLM 的技術成熟度和產業滲透,可以關注以下量化指標和事件:
- 技術指標:DocVQA、ChartQA、InfoVQA、FUNSD、SROIE 等基準排行榜得分變化,各模型 ANLS/F1 提升幅度;單頁推論延遲(P50/P99)、首 token 生成時間。
- API 與產品資料:主流雲端廠商智慧文件 API 呼叫量、月活客戶數(公開揭露);價格變動($/頁、$/千 tokens);支援語種、垂直行業模板數量。
- 開源動態:GitHub 星數趨勢,Hugging Face 下載量變化;新開源模型的引數、許可協議(Apache 2.0 等)與評測報告。
- 行業落地:大型金融機構、醫院、政務平台公開招標中的“多模態文件理解”或“OCR-free”技術要求頻次;專業服務公司(如四大會計師事務所)釋出的文件 AI 採納率調查。
- 融資與併購:文件智慧賽道初創公司(國內與海外)的融資額、輪次;傳統 OCR 企業轉型動作(新產品釋出、合作伙伴)。
- 政策與標準:資料安全法、個人資訊保護法、醫療/金融行業資料合規細則對文件 AI 推論的要求;信通院相關評測和標準釋出。
- 突發事件:重大型模型事故或隱私洩露事件;模型幻覺導致嚴重後果的合規案例;開源模型被用於敏感場景引發的監管討論。
⑮ 信源
- Google DeepMind. “Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.” 2024.
- OpenAI. “GPT-4V(ision) System Card.” 2023; GPT-4o 技術報告及 Blog 2024-2025.
- Alibaba Cloud. “Qwen2-VL: Generalized Vision-Language Model.” 2024-2025.
- Shanghai AI Laboratory. “InternVL 2.0: Scaling Vision Foundation Models for Multimodal Understanding.” 2024.
- Google Research. “Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding.” ICLR 2023.
- Microsoft. “UDOP: Unified Document Processing for Vision, Text, and Layout.” CVPR 2023.
- OpenAI, Meta, Mistral 等各大型模型官方部落格與 Hugging Face 模型卡.
- DocVQA 官方排行榜 (rrc.cvc.uab.es), ChartQA leaderboard, OpenCompass 評測平台.
- Grand View Research. “Optical Character Recognition Market Size, Share & Trends Analysis Report, 2024–2030.”
- Research and Markets. “Intelligent Document Processing Market – Global Forecast to 2030.” 2024.
- IDC. “中國智慧文件處理市場追蹤報告.” 2024.
- 合合資訊首次公開發行股票並在科創板上市招股說明書. 2023.
- 各公司財報、公開技術白皮書、官方微信公眾號釋出(輝達、合合資訊等).
- 中國資訊通訊研究院相關評測報告與標準(如“可信 AI”文件智慧評測).
宣告:本文基於公開資料整理,內容僅供產業研究參考,不構成任何投資、技術選型或採購建議。文中涉及的公司、產品及資料均為截止 2025 年 4 月的公開資訊,可能存在滯後或口徑差異,具體以相關機構最新揭露為準。