模型毛利率
3 秒看懂
模型毛利率是衡量AI模型服務商業效率的核心指標,定義為每一元模型API呼叫、訂閱或微調營收中,扣除直接推論所產生的算力、頻寬、電力等可變成本後剩餘的毛利比例。
- 本質:模型營收減去服務一次推論所需GPU時間及配套資源的增量支出,反映的是“賣token”這件事能留住多少現金。
- 行業現狀:閉源API的毛利率從2022年前的推測超80%,已快速收窄至60%–70%區間,部分中小通用模型API毛利率低至10%–20%(均源自2024年行業訪談定性估計,各公司未單獨揭露)。
- 關鍵致因:開源模型效能追平、雲端廠商將模型作為免費增值品捆綁出售、客戶自部署門檻降低,三重力量共同壓低全行業毛利率。
3 分鐘產業解釋
模型毛利率特指將“模型能力”直接作為商品出售所產生的毛利率,即
模型毛利率 ≈ (每百萬token營收 – 每百萬token推論硬成本) / 每百萬token營收。
這裡的“推論硬成本”專指每次請求導致的增量資源消耗,主要包括:
- 算力折舊/租賃:GPU例項的按時付費或自有叢集的會計攤銷;
- 記憶體與頻寬:HBM(高頻寬記憶體)容量與頻寬佔用在併發推論中常成為瓶頸;
- 功耗與冷卻:大規模推論叢集的電費與散熱開支;
- 網路互聯:多卡張量並行時的NVLink/PCIe頻寬消耗,以及跨節點資料傳輸。
模型毛利率不含模型研發階段的訓練開銷、資料工程成本、演算法人員薪酬、營銷推廣與管理費用。這與IaaS雲端服務的“基礎計算毛利率”相似——只能說明賣出一單位計算能賺多少,但不能據此判斷一家公司整體是否盈利。當前模型層面臨的核心矛盾是:差異化視窗極短,開源社群以周為單位迭代,雲端巨頭將模型作為帶動算力/儲存/平台消費的入口,純模型廠商被迫不斷降價換取呼叫量,毛利率持續承壓。
技術原理
推論可變成本的決定因素可拆解為三大瓶頸:計算、視訊記憶體與通訊。
GPU計算資源利用率
每次token推論執行大量矩陣乘法和注意力運算。計算密度高時,H100等加速卡張量核心利用率可達70%以上;若單次請求序列短、batch小,利用率會急劇跌至20%以下,大量矽面積空轉,單位token成本數倍上升。
- 連續批處理(Continuous Batching)將多個請求的動態序列拼接到同一批次,可大幅提高利用率。
- FlashAttention 系列演算法通過融合記憶體訪問減少HBM讀寫,變相放大有效計算視窗。
視訊記憶體容量與頻寬瓶頸
模型權重、KV快取均需駐留視訊記憶體。以FP16精度為例,70B引數模型僅權重即佔用約140 GB,單張80 GB H100無法完整承載,必須使用張量並行切分至多卡,由此引入AllReduce通訊開銷。
KV快取與輸入序列長度、併發請求數成正比。若視訊記憶體頻寬不足以快速讀寫快取,即使算力核心空閒,吞吐量依然被記憶體速度鎖死,單位token成本驟升。硬體代際帶來的頻寬提升是降本的重要驅動力:HBM2e(約3.2 Gbps引腳速率)→ HBM3(約6.4 Gbps)→ HBM3e(>8 Gbps),每代直接推高推論吞吐。
通訊拓撲與分散式推論
多卡推論的常見並行策略:
- 張量並行:每層前向需至少兩次AllReduce,極度依賴節點內NVLink/NVSwitch的高頻寬和低延遲;
- 流水線並行:跨節點通訊頻寬要求較低但延遲更高,適合超大型模型。
萬億引數級MoE模型在FP16下全量權重可能超過2 TB,遠超單臺8×80 GB伺服器的總視訊記憶體,必須跨數十至數百張GPU組網。此時通訊拓撲效率對毛利率的影響不亞於計算本身。
成本流示意
使用者請求(每百萬token營收 $X)
↓
API閘道器與負載均衡(成本極低)
↓
推論叢集 GPU 例項
├─ 權重載入/共享 → 視訊記憶體功耗與折舊 (~40-50%)
├─ KV快取讀寫 → 視訊記憶體頻寬功耗 (~20-30%)
├─ 注意力/GEMM 計算 → 張量核心功耗 (~20-30%)
└─ 多卡通訊與記憶體同步 → NVLink/PCIe (~5-10%)
↓
輸出token流 → 網路回傳(頻寬成本極低)
以上比例為示意區間,實際依模型結構、序列長度、併發、批處理策略動態變化。
關鍵引數
衡量模型毛利率需關注以下技術引數與財務引數,兩者共同決定每token可變成本與營收:
- 模型精度與量化級別:FP16、INT8、INT4等直接影響權重和KV快取對視訊記憶體的佔用。INT4可將70B模型裝入單張80 GB GPU,但需評估精度損失對使用者體驗的影響。
- 每GPU吞吐量(tokens/s/GPU):受序列長度、batch size、量化方案、推論架構綜合影響。吞吐量每翻一倍,單位推論成本近似減半。
- GPU例項單價:按需、預留、競價例項價格差異巨大。雲端廠商向模型初創收取的算力溢價通常在20%–50%(行業估計,未獲具體揭露),直接影響毛利率。
- 有效token比率:使用者只願為有效輸出付費。若模型生成大量被截斷、重複或無效內容,實際收費token低於總生成token,變相降低毛利率。
- 併發數與延遲SLA:高併發低延遲要求迫使廠商超配資源,GPU利用率可能被迫降低,犧牲成本換取體驗。
- 定價結構:按token計費、包月套餐、承諾用量折扣(CUD)等影響實際每token營收。研發補貼、免費額度、內部轉撥計價也會扭曲可觀測毛利率。
- 叢集利用率:大規模推論叢集的平均利用率從30%提升至60%,單位直接成本可降低約40%–50%。例項閒置、冷啟動等問題是毛利率的隱形殺手。
技術路線
按模型服務提供方式,可將當前主流技術路線歸納為五類,其在毛利率維度呈現明顯分化:
| 路線 | 典型玩家 | 毛利率定性區間 | 核心邏輯 | 優劣勢 |
|---|---|---|---|---|
| 自研閉源API | OpenAI、Anthropic | 中高(估計60%–70%) | 模型效能領先,擁有一定定價權,且可通過大規模叢集提升利用率 | 需持續尖端研發投入,固定成本高 |
| 開源模型託管服務 | Together AI、Fireworks、DeepInfra | 中等(估計40%–55%) | 批次採購算力+排程最佳化賺取差價,低價格走量 | 競爭激烈,定價透明,易被雲端廠商替代 |
| 雲端廠商捆綁模型 | Amazon Bedrock、阿里百鍊、Google Vertex AI | 難以單獨量化,可能為負毛利以換取雲端消費 | 模型作為獲客工具,成本由平台整體獲利消化 | 對純模型廠商形成降維打擊 |
| 垂直行業自建/微調 | 金融、醫療、政企私有化部署 | 極高(不對外售賣) | 一次部署,邊際成本極低,且有資料壁壘 | 無直接模型服務營收,不參與公開市場價格競爭 |
| 消費者訂閱制 | ChatGPT Plus、Claude Pro等 | 難以按token拆解 | 訂閱營收覆蓋全部使用成本,非按量計費 | 使用者規模龐大可攤薄成本,但營銷與研發支出高 |
注:毛利率區間為基於2024–2025年公開訪談、行業報告及供應鏈上下游訪談的定性估計,相關公司未單獨揭露模型業務毛利率。
當前技術路線的核心分化在於:閉源API是否仍能維持效能溢價,以及託管服務在多大程度上可以被雲端廠商內建。隨著Meta、DeepSeek等開源模型效能持續突破,自建推論的價效比不斷提升,促使更多企業放棄第三方API,全行業毛利率中樞下移。
上游
模型毛利率的上游構成決定其可變成本基礎,議價權高度集中:
- GPU/加速器供應商:NVIDIA H100、B200等佔據絕對主導地位,輔以AMD Instinct、華為昇騰、專用推論晶片(Groq、Cerebras)。GPU採購成本與可獲得的例項價格直接決定每token成本基線。上游高度集中,原始裝置商擁有極強定價權。
- HBM與先進封裝:推論吞吐受HBM頻寬制約,HBM3e等產品供應緊俏,產能集中(SK海力士、三星、美光)。上游漲價會直接推高GPU價格並傳導至雲端例項。
- 雲端運算基礎設施商:資料中心物理空間、電力、冷卻、網路。模型廠商若不自建IDC,必須向AWS、Azure、GCP、阿里雲端等支付算力溢價。作為上游的雲端廠商既是供應商又是競爭對手,這種雙重角色進一步壓縮第三方模型商的毛利率。
- 推論架構與工具鏈:TensorRT-LLM、vLLM、llama.cpp等開源推論引擎持續降低部署門檻。雖然這些工具本身免費,但其最佳化能力可顯著改變每token成本,進而影響全行業毛利率均衡。
下游
下游包括所有購買或消費模型能力的角色,其行為直接影響定價權與毛利率可持續性:
- 應用開發商與SaaS企業:如客服、營銷文案、程式碼助手等應用,將模型API作為生產資料。對價格高度敏感,切換成本低,多模型供應策略已成常態。
- 企業內部用例:越來越多企業採用自部署開源模型處理內部文件問答、資料分析等場景,完全規避API費用,僅承擔推論硬體成本。此趨勢長期侵蝕第三方API的總潛在市場。
- 個人使用者與專業消費者:ChatGPT等訂閱產品擁有數億使用者,其行為決定訂閱制模型的營收天花板。使用者對延遲、可用性要求高,迫使廠商投入冗餘算力,間接壓低毛利率。
下游需求總量仍在高速增長,但付費意願已在價格戰中被重新錨定,低成本甚至免費選項的大量出現,使模型API難以獲得傳統SaaS式的高毛利率。
受益公司
以下型別企業在模型毛利率系統性承壓的環境下,相對獲得更強議價力或開闢出新的獲利池(僅分析產業邏輯,不作為投資建議):
- GPU及推論晶片龍頭:算力是一切模型服務的基礎。需求確定性增長,使NVIDIA、AMD等成為本輪AI投入的最大受益方,其毛利率不受模型層價格戰直接影響。
- 雲端廠商平台:AWS、Azure、Google Cloud等通過模型託管服務吸引客戶遷移工作負載,帶動計算、儲存、資料庫等資源消費。即使模型服務本身零毛利或負毛利,平台整體獲利仍可增長。
- 具備全棧整合能力的AI平台:微軟(Copilot + Azure)、Salesforce(Einstein)通過將模型嵌入Office、CRM等高頻應用,在應用層捕獲價值,無需單獨依賴模型API毛利。
- 開源生態的運營型公司:提供模型微調、安全護欄、資料合成、MLOps平台的服務商,可在模型商品化大潮中賺取工具和服務溢價。
- 電力與資料中心REITs:推論用電需求快速增長,擁有電力供應和優質資料中心資產的企業間接受益。
純模型API初創公司若沒有垂直場景或資料壁壘,其獨立盈利能力在毛利率持續收斂的環境下將面臨嚴峻考驗。
市場規模
目前尚無統一口徑獨立統計“模型API及託管服務”這一細分市場的規模。公開可靠資料不足,但可從各方揭露中勾勒大致輪廓:
- OpenAI年化營收在2024年中已突破30億美元(公司公開發言),其中大部分來自ChatGPT訂閱和API呼叫。
- 據多家市場研究機構(如Grand View Research、MarketsandMarkets)的行業報告,2024年全球大型模型市場(含訓練、推論、平台)預測規模約在200億–400億美元區間,但口徑涵蓋軟硬體及服務,遠大於純模型毛利率所對應的API營收。
- 純模型API服務商數量激增,但單體營收大多未公開。公開資料未見清晰的市場份額排名。
- 行業共識是:模型API營收絕對金額在2024–2025年仍將保持爆發式增長,但增速會被價格下跌部分抵消,且增量多流向雲端廠商和算力供應商,獨立模型商的營收池可能有限。
玩家對比
基於2024–2025年公開定價、技術部落格和行業分析,對具有代表性的模型服務商進行關鍵維度對比(注:毛利率為定性估計,淨利率等未揭露):
| 玩家 | 定位 | 公開API價格(輸入/輸出token,參考2024年) | 毛利率定性 | 關鍵差異化 |
|---|---|---|---|---|
| OpenAI | 閉源通用模型 | GPT-4o | 60%–70%區間的中高階,估計 | 模型效能仍處第一梯隊,生態完善 |
| Anthropic | 閉源安全模型 | Claude 3.5 Sonnet ~$3/$15(2024年6月公佈) | 與OpenAI相近 | 安全與對齊能力、長上下文視窗 |
| DeepSeek | 開源低成本路線 | DeepSeek-V2: 輸入¥1/百萬tokens,輸出¥2/百萬,快取命中¥0.1(2024年5月) | 極低,可能接近盈虧平衡 | 極致成本控制,開源,效能驚豔 |
| Together AI | 開源模型託管 | 定價隨模型,普遍低於閉源,如Llama 3 70B約$0.9/百萬token | 40%–50%區間 | 批次GPU採購+高效能推論堆疊 |
| 阿里雲端百鍊 | 雲端捆綁模型 | 模型服務價格低於海外閉源,且常伴隨免費額度 | 難以單獨核算 | 與阿里雲端生態繫結,帶動整體消費 |
| Meta (Llama) | 開源權重發布 | 不直接提供API,通過合作伙伴提供 | 不適用 | 完全開源,通過廣告和應用生態獲利 |
對比可見,模型層價格已從2023年底的“每百萬token數十美元”快速滑向“每百萬token一美元以下”,且不同規模的模型價格正在趨近。玩家維持差異的關鍵已從演算法秘密轉向推論系統和硬體成本的極致最佳化。
風險
- 價格戰長期化:開源模型將持續壓低市場定價,若模型能力同質化加速,行業毛利率可能進一步向基礎IaaS服務(40%左右)看齊甚至更低。
- 上游漲價:GPU、HBM等核心供應處於緊平衡,若地緣政治或產能瓶頸導致算力成本上升,模型廠商的毛利率將被雙向擠壓。
- 自部署替代加速:隨著llama.cpp、vLLM等工具的普及,企業內部自建推論的門檻和成本急劇下降,第三方API總市場規模可能不及預期。
- 監管與合規成本:資料隱私、版權、AI安全法規可能要求額外的審計、過濾、內容溯源機制,增加每token可變成本。
- 技術路線迭代風險:新模型架構(如狀態空間模型)或專用硬體(LPU等)可能瞬間改變成本曲線,重資產押注某一技術路線的廠商面臨投入沉沒風險。
- 現金流量與融資風險:在毛利率持續承壓背景下,純模型初創若無法實現差異化或正向現金流量,可能面臨融資困難,行業整合加劇。
誤讀糾偏
- 誤讀1:模型毛利率等同於AI公司整體毛利率
糾正:模型毛利率僅衡量直接推論可變成本,而AI公司的實際盈利能力還需扣除研發、銷售、管理、訓練成本等。部分AI公司模型毛利率為正,但整體淨利率嚴重為負。 - 誤讀2:開源模型會讓模型毛利率歸零
糾正:即使權重開源,模型託管與推論最佳化仍存在規模化獲利空間。通過批次採購GPU、排程最佳化,託管服務商仍可維持40%–60%的毛利率,只是價值從模型層轉移到運營和基礎設施層。 - 誤讀3:毛利率下降意味商業模式失敗
糾正:若毛利率下降同時帶來呼叫量數倍增長,總毛利絕對值可能仍在擴大。附加服務(微調、資料合成、安全稽核、私有部署)也可成為獲利增長點。 - 誤讀4:訓練成本不影響模型毛利率,可忽略
糾正:雖然訓練成本屬於固定成本、不計入毛利率公式,但訓練所得模型的質量直接決定定價權。若訓練投入不足導致模型落後,營收下滑將更劇烈地衝擊毛利,因此訓練研發與毛利率間接相關。
最新事件
- 2024年5月:DeepSeek-V2釋出,以極低API價格(輸入1元/百萬tokens,輸出2元/百萬tokens)引發中國大型模型價格戰,多個國產模型廠商隨後宣佈降價或免費。
- 2024年7–8月:OpenAI對GPT-4o多次降價,並推出Batch API等更低成本呼叫方式,分析師普遍解讀為應對開源競爭與客戶成本敏感度上升。
- 2024年9月:Meta釋出Llama 3.1及3.2系列,效能大幅提升,同時維持開源許可;多家雲端廠商立即提供託管服務,進一步拉低市場價格中樞。
- 2024年四季度:AWS、Google Cloud等推出更靈活的模型呼叫套餐,部分模型在滿足承諾用量後近乎免費;與此同時,GPU例項競價價格隨需求上漲,獨立模型託管商的毛利率空間持續收窄。
- 2025年初:業界關注DeepSeek-V3及下一代開源模型的推論成本,其技術報告揭露的新型注意力機制和MoE路由最佳化被認為可能將每token成本再降低30%–50%(根據DeepSeek技術部落格,實際效果待大規模驗證)。
追蹤指標
持續追蹤模型毛利率行業走勢,建議關注以下可獲取的公開指標與訊號:
- 頭部模型API定價:定期記錄OpenAI、Anthropic、Google等公開API的每百萬token價格變動,建置價格指數。
- 雲端運算GPU例項價格:監測AWS p4d/p5、Azure ND H100 v5等例項的按需與競價價格,可作為推論成本的代理變數。
- 開源模型推論基準:追蹤llama.cpp、vLLM等社群釋出的“tokens/s/GPU”效能資料,觀察代際提升幅度。
- 雲端廠商財報中的AI相關營收與資本支出:AWS、Azure、Google Cloud的“AI workload”營收增長與資本支出增速的對比,反映模型層價值是否向雲端基礎設施層轉移。
- 初創公司融資與估值:純模型API初創的融資輪次、估值變化及收併購事件,可反映資本市場對模型毛利率長期前景的預期。
- 開發者調查中的API切換意願:CSDN、Stack Overflow、Hugging Face等社群的調查資料,反映企業對自部署vs. API購買的選擇傾向。
信源
- OpenAI、Anthropic、Google DeepMind官方技術部落格及API定價頁面。
- Meta AI、DeepSeek、Mistral等開源模型釋出部落格與技術報告。
- SemiAnalysis、The Information、Tom’s Hardware、The Next Platform等媒體的推論成本專題分析。
- 雲端廠商年度大會(AWS re:Invent、Google Cloud Next、微軟Build、阿里雲端雲端棲大會)關於AI服務的釋出與公開演講。
- 學術論文:FlashAttention系列、Speculative Decoding、RWKV與狀態空間模型、GGML/llama.cpp量化推論報告。
- 行業研究報告:Grand View Research、MarketsandMarkets、IDC關於AI平台與模型市場的規模估算(具體數字口徑需交叉驗證,此處僅作為趨勢參考)。
- 財經媒體對AI初創的高管採訪和財報電話會議記錄(OpenAI、Anthropic等未上市公司僅提供選擇性財務揭露)。