模型層 開放閱讀

GPT-4o 類原生多模態

Native Multimodal Model

概念 ID
native-multimodal-model
更新時間
2026-05-29
來源數量
待補

GPT-4o 類原生多模態

3 秒看懂

GPT-4o 類原生多模態模型是一個端到端 Transformer 架構,能同時接收文本、語音、影像輸入,並以文本和語音為主要輸出(部分生成影像能力原生支援)。所有感官通道對映到同一個離散 token 空間,不再依賴“語音轉文本 + 文本模型 + 文本轉語音”的級聯管道,端到端語音互動延遲壓至約 320ms,逼近人類對話反應時間。

3 分鐘產業解釋

GPT-4o(Omni)代表了大型模型架構從“組合式多模態”向“原生多模態”的跨越。此前主流多模態方案(如 GPT-4 + Whisper + 影像編碼器)將語音先轉寫成文字、影像獨立編碼,再拼接到純文本大型模型,模組間獨立訓練或微調,資訊在模態轉換中損耗,端到端延遲通常 2–5 秒。GPT-4o 將語音、影像與文本的 token 化與特徵提取全部吸納進一個聯合預訓練的 Transformer,在同一個引數空間內完成早期融合和下一 token 預測,消除了序列瓶頸。

這一變革對產業的影響可概括為三步:① 人機互動從鍵入、觸屏與限定喚醒詞的語音助手,邁向全感官即時對話——模型能感知語氣、情緒、環境音,並以自然韻律和情感反饋回應;② 模型“原生理解”語音中的諷刺、興奮等副語言特徵,影像中的文字與視覺元素可一起推論,不再需要 OCR 後再理解;③ 生成能力(文本→影像、語音→影像)逐漸整合進同一個端到端系統。上游的算力需求由此跳升:原生多模態訓練需要超大規模混合語料、更長的 token 序列和高頻寬互連,迫使模型並行策略從純文本轉向跨模態序列並行。下游則催生出硬體助手、即時同傳、AI 口語教師、全感官心理諮詢等應用,推動 AI 從工具屬性走向“夥伴”屬性。

技術原理

1. 統一多模態 token 化 GPT-4o 的核心設計理念是將多感官感知與生成統一為“多模態下一 token 預測”問題。令模型引數為 θ,接收多模態序列 x = (x⁽¹⁾, x⁽²⁾, …, x⁽ᵀ⁾),每個元素可以是文本子詞、影像 patch 或音訊幀。所有模態通過各自的 tokenizer 對映到同一個離散詞彙表 V,訓練目標為最大化條件機率:

mathcal(L) = \sum_{t=1}^{T} \log P_\theta(x^{(t)} \mid x^{(<t)})

這與純文本 GPT 的訓練目標一致,差異僅在於詞彙表中嵌入了視覺和音訊 token。影像 token 化可基於 VQ-VAE 或 ViT 加量化器,音訊 token 化則可能採用神經音訊編解碼器(如 EnCodec、SoundStream),將原始波形壓縮為離散 token 流。

2. 早期融合與統一主幹 架構示意(ASCII):

[語音波形]──> 音訊Tokenizer ──> [A1, A2, A3, ...] ─┐
[影像]   ──> 視覺Tokenizer ──> [I1, I2, ...]    ─┤
[文本]   ──> 文本Tokenizer ──> [T1, T2, ...]    ─┤

              聯合序列拼接 & 位置編碼

              統一 Transformer 主幹

         輸出機率分佈 ──> 生成文本/音訊/影像 token 序列

語音輸入不必等待自動語音識別(ASR)轉寫,模型直接從音訊 token 推斷語義和聲學特徵;生成時,輸出 token 流的一部分可路由至音訊解碼器合成波形,另一部分直接解碼為文本。影像 token 的生成同樣通過自迴歸預測,再由影像解碼器還原為畫素。這種全自迴歸風格使模型能夠端到端完成語音→文本、文本→語音、影像→文本、語音→影像等任意跨模態轉換,極大降低資訊損耗。

3. 預訓練與對齊 預訓練階段極大機率採用了跨模態自迴歸預訓練,將音訊幀(如 20ms 一幀)、影像 patch(如 16×16)和文本 token 交錯混合成單條序列,迫使模型學習跨模態聯合分佈。這一“早期融合”策略催生了許多湧現能力,例如結合語音語調和文字語義捕捉諷刺。在對齊階段,則通過 RLHF/DPO 等方法校準人類偏好,並專門加入語音自然度、情感適宜度等獎勵訊號,使輸出在內容正確之餘也具備擬人韻律。

4. 推論與即時流式 去掉了 ASR 等待,GPT-4o 可將首 token 延遲壓縮至平均 320ms(OpenAI 官方資料),語音生成端則以流匹配或自迴歸解碼即時合成音訊,維持說話人特徵和情感連貫。該架構可共享相同 KV 快取,減少切換開銷,從而在語音、文字交替的多輪對話中保持瞬時響應。

關鍵引數

  • 模型總引數量:公開資料未見確切數字;多位分析師猜測在萬億級別以上,但採用 MoE(混合專家)結構尚無官方證實(來源:SemiAnalysis 2024 年分析)。
  • 上下文視窗:128k tokens,與 GPT-4 Turbo 持平,支援長達數小時的多模態對話(來源:OpenAI 釋出說明,2024 年 5 月)。
  • 端到端語音延遲:平均 320ms(語音輸入 → 首個音訊 token 輸出),約為 GPT-3.5 的 1/8(來源:OpenAI 官方部落格)。
  • 音訊 token 速率:公開資料未見具體數值;根據演示推測約 50–100 token/秒,滿足即時流式需求。
  • 視覺理解基準:在 MMMU(多模態大規模多學科理解)等基準上,OpenAI 宣稱效能與 GPT-4 Turbo 相當並略有提升,但未公佈精確分項得分(來源:OpenAI 技術摘要)。
  • 訓練資料規模:未揭露;估計需數十億圖文對、數百萬小時語音及數萬億文本 token,具體配比未知。
  • 訓練算力:未獲官方確認。SemiAnalysis(2024)估算 GPT-4 訓練成本約 6300 萬美元,GPT-4o 因多模態資料量和早期融合更復雜,單次訓練成本可能上浮 2–3 倍,但無確切資料。

技術路線

業界主要存在三條技術路線,它們在模態融合深度、延遲和複雜度上差異顯著。

維度組合式多模態(GPT-4V、LLaVA)原生多模態(GPT-4o)純語音 LLM(Moshi、SpeechGPT)
融合方式影像/語音編碼器將模態對映到文本空間,再送入 LLM 主幹所有模態 token 共享統一詞典,單 Transformer 早期融合僅處理語音 token,自迴歸或非自迴歸混合
語音互動延遲依賴 ASR+LLM+TTS 管道,通常 2–5s平均 320ms,支援流式打斷可低至 200ms 以內,但無視覺理解
資訊保真度ASR 丟失韻律、情緒,影像編碼壓縮細粒度資訊端到端保留完整聲學線索,影像 patch 保留細節語音完整,但無法融合文本、影像推論
訓練複雜度各模組可獨立訓練,組合快速跨模態資料混合訓練,對算力和資料配比要求極高中等,語音 token 化技術較為成熟
多模態生成文本出圖需外部模型(DALL·E)原生支援文本/語音→影像等生成不支援視覺生成
安全與可解釋性各模組可分離審查聯合分佈更難解釋,跨模態有害內容過濾難度疊加語音專屬安全挑戰

除 GPT-4o 外,Google 的 Gemini 模型在宣傳上強調原生多模態設計,但早期版本未實現即時語音生成,部分能力類似“組合式”。2024 年末至 2025 年,各廠商明顯向早期融合架構靠攏,以縮短互動延遲、豐富感知維度為主攻方向。

上游

算力硬體 原生多模態訓練的算力需求較純文本模型高出數倍,原因在於影像/音訊 token 序列極長(單張影像可產生數百個 token),且跨模態早期融合要求 Transformer 主幹同時處理異構 token,記憶體佔用劇增。關鍵硬體包括:

  • 高頻寬 AI 加速器,如輝達 H100、H200、B200,需配合 HBM3e 記憶體(產能資料:據 Omdia 2024 年統計,輝達 H100 2024 年出貨量預計超過 200 萬塊,具體用於多模態訓練份額未公開)。
  • 高速互聯:節點內 NVLink 和節點間 InfiniBand / RoCE 網路,跨節點 AllReduce 通訊成為瓶頸,推動 800G 光模組和交換器升級。
  • 先進封裝:台積電 CoWoS-L 等封裝產能決定了 GPU 供應節奏,據台積電 2024Q2 法說會,CoWoS 產能至 2025 年將擴產翻倍,但仍可能吃緊。

多模態資料集 合法、高質量的對齊資料是瓶頸。需求包括長篇影片–語音–文字對齊、多語種多口音語音–文本對、跨模態指令跟隨資料。資料服務商(如 Scale AI、Appen)正從靜態圖片標註轉向動態時空標註,人力成本和安全稽核壓力上升。語音、影片版權爭議(如音樂、短影片素材)導致可用訓練資料供給趨緊,部分廠商採用合成數據補充。

訓練與推論工具鏈 需同時支援長序列多模態 token 化和並行策略的訓練架構,如 NVIDIA NeMo、JAX 訓練棧。推論引擎需處理流式音訊 token 的解碼和低延遲合成,常用方案是結合 vLLM 或 TensorRT-LLM 並定製音訊外掛。

下游

介面層 低延遲多模態互動可直接嵌入可穿戴裝置、智慧眼鏡(如 Meta Ray-Ban 接入 GPT-4o 類模型)、車載語音助手,實現擴音即時問答、環境感知。邊緣推論晶片(如 Qualcomm 的 AI Engine)開始整合音訊、視覺輸入管道,以降低雲端端往返延遲。

應用場景

  • 即時同傳與會議紀要:直接處理語音流,保留說話人語氣,產出結構化紀要。
  • 智慧教育:AI 口語教師能聽音糾錯,同步展示影像輔助教學。
  • 心理陪伴與醫療導診:融合語音情緒識別、視覺表情分析和文本推論,提供更具共情能力的互動;醫療場景下可結合醫學影像和語音問診。
  • 內容創作:使用者通過語音指令即可生成圖文並茂的多媒體內容,降低創作門檻。

產業生態 雲端平台將原生多模態能力封裝為 API,吸引開發者建置應用。截至 2025 年初,微軟 Azure AI、AWS Bedrock 等已提供 GPT-4o、Gemini 等模型的低延遲端點,部分企業開始將即時語音助理推向消費市場。

受益公司

以下分析僅從產業鏈受益邏輯出發,不構成任何投資建議。

基礎模型廠商 OpenAI 率先落地徹底的原生多模態,憑藉 GPT-4o 和後續迭代鞏固了技術品牌溢價。Google DeepMind 的 Gemini 系列逐步補齊即時語音能力,生態內嵌於 Android 和 Google Cloud 將顯優勢。Anthropic 雖尚缺原生音訊,但其對齊研究有助於提升多模態安全性,可能在合規場景受益。Meta 通過開源 LLaMA 系列整合多模態能力,降低應用開發門檻,有望在開源生態中吸收長尾需求。

雲端基礎設施廠商 微軟 Azure 作為 OpenAI 獨家雲端合作伙伴,直接受益於 GPT-4o API 呼叫的爆發式增長;Google雲端、AWS 亦通過自研或第三方模型搶奪推論負載。邊緣 AI 推論正推動混合雲端方案,雲端廠商的底層網路、CDN 和安全稽核服務也將隨之增長。

硬體與半導體廠商 輝達是訓練和推論晶片的最大供應方,B200/GB200 Superchip 預計進一步拉大算力差距。AMD 的 MI300X 系列爭取雲端大客戶的推論份額。台積電 CoWoS 產能擴張、SK 海力士和三星的 HBM 出貨量增長是算力上限的硬約束,相關企業訂單飽滿。

應用開發商 已有語言學習平台(如 Duolingo 與 OpenAI 合作展示語音角色扮演)、視訊會議軟體整合即時翻譯等場景,先行接入原生多模態 API 的應用可能獲得使用者時長紅利,但需承擔模型快速迭代導致功能被系統層覆蓋的風險。

市場規模

多模態 AI 市場整體處於爆發前夜。據 MarketsandMarkets 2024 年報告,全球多模態 AI 市場(含軟體、服務)在 2023 年估值約 12 億美元,預計 2028 年達到 85 億美元,2023–2028 年複合年增長率約 48%。該口徑涵蓋所有使用兩種及以上模態的 AI 系統,原生多模態屬於其中高階分支,佔比尚無精確統計。

就大型模型訓練成本而言,單次原生多模態訓練耗資達數千萬至數億美元級,推論服務成本因即時流式需求而數倍於純文本。據 SemiAnalysis 2024 年測算,GPT-4o 單次訓練成本或超 1 億美元(未確認)。推論端,若維持 320ms 延遲,所需 GPU 數量隨併發飆升,帶動資料中心基礎設施投資。整體推論市場:IDC 2024 年預估全球生成式 AI 基礎設施支出在 2024 年達 456 億美元,其中模型推論佔比快速攀升。

資料供給方面,合規多模態資料的稀缺性推高了採集和標註成本,Voicebox 等合成數據工具雖可緩解,但法律風險尚未釐清。版權方和 AI 公司之間的訴訟結果將直接影響資料供給格局。

玩家對比

玩家/模型原生多模態能力支援模態即時語音對話延遲原生視覺生成公開引數關鍵備註
OpenAI GPT-4o✅ 原生融合文本、語音、影像輸入;文本、語音輸出~320ms影像生成有限開放未揭露2024.5 釋出,後續推出 GPT-4o mini
Google Gemini宣揚原生多模態文本、影像、音訊、影片、程式碼未公佈即時語音對話延遲(早期無流式語音輸出)文→圖有限未揭露2024.12 釋出 Gemini 2.0 Flash,增加語音流式能力
Anthropic Claude組合式文本、影像輸入(無語音輸入輸出)無即時語音不支援未揭露對齊安全性突出,原生多模態規劃未公開
Meta LLaMA 3開源組合式文本為主,多模態變體(視覺)無原生語音無原生生成部分開放開源生態有望整合第三方語音模組
字節跳動/火山引擎多模態大型模型依次釋出文本、影像、語音~秒級級聯部分模型支援未揭露主要面向國內應用場景,商業化程序較快
Apple未釋出通用多模態基座模型通過平台智慧整合多個模型依賴本地/雲端端協同無公開資訊注重端側隱私,多模態需求由不同模型分別滿足

(注:延遲、引數等資訊均來源於官方公開或知名科技媒體,未揭露即註明。)

風險

技術風險 早期融合可能導致模態間負遷移,一個模態的噪聲可能干擾另一個;訓練不穩定、損失尖峰風險上升,需精巧的課程學習和混合比例控制。此外,全模態序列極長,推論記憶體佔用高,降低成本曲線平緩。

算力與成本風險 原生多模態的算力需求呈指數級增長,高階 GPU 供應緊張(據台積電展望,先進封裝產能瓶頸持續至 2025 年底),訓練與推論成本可能制約中小參與者入場,加速市場集中。

安全與倫理風險 跨模態聯合分佈難以用傳統分類器完全審計,有害內容可能被編碼在語調、背景音或影像後設資料中繞過文本過濾器。深度偽造門檻降低,生成虛假音影片風險劇增。OpenAI 的 GPT-4o 系統卡揭露了紅隊測試,但仍難以覆蓋所有跨模態攻擊向量。

監管風險 歐盟《AI 法案》將通用 AI 模型納入監管架構,要求風險緩解、透明度和訓練資料摘要;美國聯邦和州層面資料隱私法案加嚴。全球範圍內,即時語音監聽和生物特徵保護可能對 API 開放施加限制。

商業模式風險 基礎模型公司可通過 API 呼叫量壟斷營收流,應用層初創企業面臨模型能力下放被“系統化”的風險,例如作業系統整合原生 AI 助手可能使第三方應用淡出。自動駕駛般的漸進式智慧落差也可能導致使用者期望與體驗錯位,延緩付費意願。

誤讀糾偏

誤讀 1:“GPT-4o 就是加了語音功能的 GPT-4。” GPT-4o 是全新架構,端到端原生處理語音,不串聯 ASR 和 TTS 模組。模型直接理解聲學特徵,而非將語音轉為文本再理解,因此能捕捉語調、情緒和環境音,且延遲大幅降低。

誤讀 2:“原生多模態模型的引數量一定比組合式大得多。” 非必然。跨模態共享引數空間可帶來效率增益,原生多模態模型引數量可能與各獨立模組的總和相當甚至更少。目前 OpenAI 未公佈 GPT-4o 引數量,外界估計仍超萬億,但組合式方案(GPT-4+Whisper+TTS)的總引數量也處於同一量級。

誤讀 3:“原生多模態模型可完美實現任意模態的互轉。” GPT-4o 雖原生支援部分影像生成,但並非所有跨模態任務都同等成熟。文本→影像能力在質量與可控性上可能與專用模型(DALL·E 3, Midjourney)存在差異,且受安全策略限制漸進開放。語音→語音的流式翻譯在部分語種上仍不如級聯方案穩健。

誤讀 4:“320ms 延遲意味著所有場景都達到人類反應水平。” 320ms 是平均首 token 延遲,但在長語音輸出、影像密集描述等場景下,感知延遲可能更高。網路往返、服務端佇列和裝置解碼也會增加端到端時間。實際體驗受網路條件和併發負載影響。

最新事件

  • 2024.5.13:OpenAI 釋出 GPT-4o,展示即時語音、影片對話和跨模態生成能力,宣佈免費開放文本互動,付費使用者享有更高限額(來源:OpenAI 官方釋出會)。
  • 2024.6:OpenAI 推遲高階語音模式上線,以完善安全稽核和基礎設施(來源:OpenAI 推文)。
  • 2024.7:GPT-4o mini 釋出,低成本輕量版支援文本和影像,部分場景替代 GPT-3.5 成為預設模型(來源:OpenAI 官方部落格)。
  • 2024.9:高階語音模式面向 Plus 與 Team 使用者逐步推送,提供自定義聲音和情感感知,限制部分合成語音功能以防止誤用(來源:OpenAI 更新公告)。
  • 2024.12:GPT-4o 的影片和螢幕共享功能開始內測,支援即時手勢、表情和介面推論;同日,Google 推出 Gemini 2.0 Flash,宣稱具備原生多模態和流式語音輸出能力,競爭升級(來源:The Verge 等科技媒體報道)。
  • 2025.1:OpenAI 推出 ChatGPT 任務功能,暗示持續多模態 Agent 方向;Anthropic 暗示正在進行原生多模態研究,但無具體時間表(來源:各方官方部落格及訪談)。

追蹤指標

  • 模型效能基準:MMMU、AudioBench、VoxBench 等跨模態評測得分,關注語音理解、視覺問答的細分指標。
  • API 延遲與成本:GPT-4o 及其他原生多模態 API 的 p50/p95 延遲變化,以及每百萬 token 定價走勢,反映工程最佳化與競爭烈度。
  • 功能覆蓋度:OpenAI 語音模式的地理區域擴充套件情況、可自定義聲音數量;競爭對手同類功能上線時間。
  • 雲端基礎設施投資:四大雲端廠商資本支出展望中與 AI 加速器相關的部分,GPU 租賃價格(如 Lambda Labs 報價)及現貨供應情況。
  • 監管與政策:歐盟 AI 法案二級立法對通用 AI 的合規要求細則;美國及中國關於即時語音監聽、深度偽造法規的進展。
  • 資料版權訴訟:主要音樂廠牌、相簿公司與 AI 廠商的和解或判決結果,影響資料授權成本和可用性。
  • 生態應用資料:接入 GPT-4o 類 API 的知名應用數量,第三方評測使用者留存和會話時長,觀察語音優先場景的滲透率。
  • 開源社群進度:類似 Unified-IO 2、LLaMA 多模態分支的開源模型能否復現流式語音能力,加速應用創新。

信源

  • OpenAI (2024) “Hello GPT-4o”, https://openai.com/index/hello-gpt-4o/
  • OpenAI (2024) GPT-4o System Card (選段公開);延遲資料引用官方部落格
  • SemiAnalysis (2024) “GPT-4o Architecture & Infrastructure Breakdown”
  • Google DeepMind (2024) “Gemini 2.0 Flash: Our Most Capable AI Model”
  • MarketsandMarkets (2024) “Multimodal AI Market – Global Forecast to 2028”
  • IDC (2024) “Worldwide Generative AI Infrastructure Forecast”
  • Omdia (2024) AI Accelerator Market Tracker, 對 H100 出貨量估計
  • 台積電 2024Q2 法說會簡報,CoWoS 產能展望
  • The Verge, TechCrunch 等對 GPT-4o、Gemini 進展的報道
  • 其他公開行業報告及訪談(如 Fortune Business Insights、MIT Technology Review)

(注:以上所有財務、份額、產能數字均已標註年份、口徑與來源;未獲官方確認的均寫明“公開資料未見”或“估算,未經證實”。)

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型