Flow Matching(流匹配)
鏈 chain-cloud · 生成式 AI 基礎架構
1 三秒看懂
Flow Matching 是生成式 AI 領域的一種模型訓練方法,核心理念是讓神經網路學會將純噪聲“搬運”成有意義的資料(如影像、影片)。與主流的擴散模型(Diffusion Models)不同,擴散模型通過“逐步去噪”還原資料,Flow Matching 則通過“規劃一條從噪聲到資料的連續路徑”,訓練目標更直接,理論取樣步驟更少。該技術由 Meta 研究員 Yaron Lipman 等人在 2022 年正式提出(ICLR 2023 接收),2024 年因 Stable Diffusion 3 公開採用而進入產業視野。
2 三分鐘產業解釋
2.1 一句話定位
Flow Matching 是生成模型領域的一種新興訓練範式,與擴散模型同為“從噪聲生成資料”的技術路線,核心競爭點在於訓練穩定性與取樣效率。
2.2 為什麼在此時出現
擴散模型(DDPM,2020)的成功建立了“去噪生成”範式,但其訓練過程依賴多步馬爾可夫鏈,存在訓練不穩定、推論步數多的問題。學界持續探索替代方案,Flow Matching 在此背景下誕生,試圖用更優雅的數學架構統一“機率路徑學習”這一目標。
2.3 與此前技術路線的邏輯關係
| 技術路線 | 核心機制 | 代表性模型 | 時間視窗 |
|---|---|---|---|
| GAN(生成對抗網路) | 生成器與判別器對抗博弈 | StyleGAN 系列 | 2014-2021 主流 |
| VAE(變分自編碼器) | 編碼-解碼 + 隱變數建模 | VQ-VAE 系列 | 2013 至今廣泛使用 |
| Diffusion(擴散模型) | 馬爾可夫鏈逐步去噪 | SDXL, DALL-E 3 | 2021-至今主流 |
| Flow Matching(流匹配) | 連續向量場 ODE 迴歸 | SD3, 部分 Meta 研究 | 2023 入局,2024 產品化 |
2.4 產業訊號
- Stability AI 於 2024 年 6 月釋出 Stable Diffusion 3 (Medium),明確採用 Flow Matching + DiT (Diffusion Transformer) 架構,官宣題為 “MMDiT” 的多模態擴散 Transformer,取樣過程從 Flow Matching 範式推導。這是該技術路線迄今最大規模的公開產品化案例。
- Meta FAIR 關於 Flow Matching 的原始論文作者 Lipman 已轉投產業界,Meta 內部持續釋出 Flow/CNF 相關研究,顯示該方向在頭部 AI 實驗室中受重視。
- OpenAI 的 Sora 影片模型技術報告(2024)中提及“擴散 Transformer”,雖未直接宣告採用 Flow Matching,但學術社群廣泛討論其視覺編碼器與取樣策略與 Flow 範式的關聯,公開資料未見官方確認。
2.5 簡化類比
擴散模型的思路類似於“將一碗渾濁的水層層過濾雜質直到清澈”,需精心設計每一步過濾的強度;Flow Matching 的思維類似於“觀察水從渾濁變清澈的整個連續過程,然後學習把這個顛倒過來”——它不關注每一步,而是關注整體流向,以此規劃出一條從“清”到“濁”(或反之)的平滑路徑。
3 技術原理
3.1 數學根基:連續歸一化流
Flow Matching 的核心數學工具是連續歸一化流。其工作原理為:
- 定義機率路徑
p_t(x),t \in [0,1]。當 $t=0$ 時,p_0為簡單先驗分佈(如標準高斯噪聲);當 $t=1$ 時,p_1為目標資料分佈(如實拍影像)。 - 學習時間相關向量場
v_t(x;\theta),該向量場由神經網路引數化,定義了每個時間點噪聲“粒子”應向哪個方向移動、以多大速度移動。 - ODE 積分取樣:沿習得的向量場取極小步長積分,可逐步將噪聲轉化為資料:
x_{t+\Delta t} = x_t + v_t(x_t;\theta) \cdot \Delta t。
3.2 核心訓練目標
與傳統擴散模型的顯著差異在於損失函式設計。Flow Matching 直接回歸的是條件向量場:
mathcal(L)_{text(FM)} = mathbb(E)_{t, x_0, x_1} \left\| v_t(x_t;\theta) - u_t(x_t \mid x_1) \right\|^2
其中 u_t(x_t \mid x_1) 是給定最終目標樣本 x_1 時,“最優搬運路線”在點 x_t 的瞬時速度向量。模型可由此學會將任意噪聲點,沿著直線或最優傳輸路徑“驅趕”向資料分佈。
3.3 四種關鍵機率路徑設計
Flow Matching 的靈活性體現在允許使用者顯式選擇噪聲到資料的演化路徑:
- 高斯條件路徑:
x_t = \alpha_t x_0 + \sigma_t x_1形式的線性插值。數學最為簡潔,但可能導致大量粒子軌跡交叉,增加取樣難度。 - 最優傳輸(Optimal Transport, OT)路徑:通過求解蒙日問題最小化路徑交叉與彎曲,使噪聲到資料的對映在地球-移動器距離意義下最優。Tong 等(2024)的工作驗證了 OT 路徑在提高取樣效率和生成質量上的系統性增益,當前主流架構多預設採用。
- Rectified Flow(直線化流):由 Liu 等(2023)提出,訓練分多輪:先學一個初始 Flow,再對 Flow 路徑“拉直”,使得 ODE 軌跡儘可能為直線,從而在 1-2 步取樣內即可獲得可用結果。數學上與 Flow Matching 高度關聯,某些論文中可視為其特例與強化。
- Stochastic Interpolants:Albergo(2023)等人建立的更一般性架構,統一了擴散、FM、Rectified Flow 等多個範式,為後續理論分析提供了語言。
3.4 與擴散模型的五項本質差異
| 對比維度 | 擴散模型 | Flow Matching |
|---|---|---|
| 隨機性 | 隨機微分方程 (SDE),取樣含隨機噪聲 | 常微分方程 (ODE),取樣過程確定性 |
| 學習目標 | 預測噪聲 \epsilon 或得分函式 \nabla_x \log p_t(x) | 預測速度場 v_t(x) |
| 排程設計 | 噪聲排程 \beta_t 必須精心設計,對效能敏感 | 機率路徑 p_t 需設計,但可選確定性 OT 路徑 |
| 推論特化 | 通常需 20-1000 步取樣;蒸餾後可達 1-4 步 | 原生支援少步取樣;Rectified Flow 可在 1 步生成 |
| 訓練穩定性 | 對架構、學習率、排程耦合度敏感 | 理論分析顯示訓練更穩定(原論文消融實驗支援) |
3.5 當前技術侷限
- 高維計算開銷:ODE 積分器在高解析度 (1024×1024+) 場景下的視訊記憶體與計算成本仍顯著,輝達技術報告中 2024 年仍有最佳化空間。
- 離散資料處理:對文本、分子圖、基因組序列等離散結構資料的適配需要設計額外嵌入和 token 化方案,當前尚無統一的 SOTA 流程。
- 全面基準測試缺乏:截至 2024 年底,社群中僅 SD3 一份大型產品化報告,在 ImageNet、PartiPrompts 等多模態基準上的全面對比資料仍然有限;學術界多使用 CIFAR-10、CelebA 等小規模基準,產業級對比尚不充分。
4 關鍵引數
以下引數為理解 Flow Matching 模型選型與工程部署的核心指標。所有資料均標註來源與年份,未確定處標註“公開資料未見”,不編造。
| 引數項 | 典型值 / 範圍 | 口徑說明與來源 | 年份 |
|---|---|---|---|
| 取樣步數(NFE) | 原始 CNF 取樣 100-1000;Rectified Flow 訓練多輪後可降至 1-4 步 | NFE = Number of Function Evaluations,即 ODE 求解過程中呼叫向量場網路的次數。原始 Lipman et al. 論文使用 dopri5 積分器,SD3 報告使用 28-50 步 | 2023-2024 |
| 機率路徑型別 | OT 路徑為當前主流,線性化路徑在學術研究中常見 | Tong et al. 和 Esser et al. 均推薦 OT 路徑 | 2024 |
| 模型引數量 | SD3 Large 版本公開資料未見精確引數量 | Stability AI 未公開引數量;社群估算約 8B 級別,但無法確認 | 2024 |
| 訓練資料規模 | SD3 訓練於數十億圖文對上 | 口徑:私人與授權資料 + 公開資料集混合;公司未揭露確切規模 | 2024 |
| 損失函式收斂指標 | 通常監測驗證集 FM Loss;無行業統一閾值 | 適用性取決於下游生成任務,暫無可比對的標準基準 | 2023-2024 |
| 推論時延 | 與擴散模型相近 | SD3 技術報告顯示在 A100 上單張 1024×1024 生成時間與 SDXL 類似區間;具體數值受取樣步數與模型架構影響,公開資料未見精確對比 | 2024 |
5 技術路線對比
5.1 路線格局
下面基於 2024 年底主流架構繪製技術路線分佈。該分佈來自於公開論文、產品白皮書與社群共識。
| 路線標識 | 基礎機制 | 代表架構 | 2024 狀態 |
|---|---|---|---|
| SDE 擴散 | 隨機微分方程,馬爾可夫鏈 | Imagen (Google), DALL-E 2/3 早期 | 成熟,速度慢於蒸餾版本 |
| ODE 擴散 (得分匹配) | 擴散 SDE 的 ODE 等價形式,去噪得分匹配 | DDIM, EDM (Karras et al.) | 廣泛使用,為蒸餾前體 |
| 一致性模型 | 直接學習 ODE 軌跡的一致性函式 | LCM, SDXL-Turbo | 2023-2024 爆發,蒸餾主流方法 |
| Flow Matching (原始) | OT 路徑 ODE 迴歸 | Stable Diffusion 3 Base | 產品化元年(2024) |
| Rectified Flow | 多輪訓練拉直路徑 | 少步取樣研究,Stability AI 部分採用 | 嵌入式出現於 SD3 技術棧 |
| 自迴歸 Transformer | 逐 token 生成影像 | LlamaGen, Parti | 並行路徑,2024 獲突破 |
5.2 路線選擇要點
- 若追求訓練穩定性和結構清晰度,Flow Matching 提供乾淨的向量場迴歸目標,無複雜噪聲排程。
- 若追求極致推論速度,一致性蒸餾(LCM)或 Rectified Flow(1 步)可能是更優路徑,但訓練成本通常較高。
- 若需跨模態統一架構(如文本與影像同時作為 token),自迴歸 Transformer 近來表現強勁,可繞過擴散/流設計的複雜性。
6 上游環節
6.1 算力資源
訓練 Flow Matching 模型與同級擴散模型算力需求相近:
- GPU 需求:SD3 訓練(Large 版)據推測使用數千塊 H100/A100 GPU 訓練數週;Stability AI 未公佈精確 GPU 小時數,公開資料未見確切數值。作為參考,同規模擴散模型(如 DeepFloyd-IF)訓練消耗約 1×10²² FLOPs 級別。
- 雲端服務與算力供應商:AWS (Trainium/Inferentia)、GCP (TPU v5e)、CoreWeave、Lambda Labs 為主要 AI 訓練算力提供商;SD3 訓練推測部分藉助 AWS 算力(未確認)。
- 推論部署:單卡 A100 (80GB) 可執行 SD3 Large 半精度推論;8GB 視訊記憶體消費卡需經過蒸餾或量化(2024 年中生態尚未成熟)。
6.2 訓練資料供給
高質量訓練資料是決定生成模型效能的上游瓶頸:
- 公開影像-文本資料集:LAION-5B (2022)、DataComp (2023)、COYO (2022) 等可用於研究與開源模型訓練。
- 商業授權資料:Stability AI、Midjourney 等公司與相簿平台簽訂授權協議;具體合同金額與規模均未公開。
- 資料標註與清洗:Scale AI (美國)、CloudFactory (英國/非洲)、以及中國廠商提供預標註、安全過濾等勞務;但 Flow Matching 要求的標註與擴散模型無異,無專屬產業鏈形成。
6.3 開發工具與架構
- 訓練架構:PyTorch (主流)、JAX + Flax (Google 系研究常用)。Flow Matching 訓練程式碼已在多個開源庫中釋出(如
torchcfm),尚未出現特定專有架構。 - 模型 Hub:Hugging Face (HF) 在 SD3 釋出後迅速整合,提供 Diffusers 介面;CivitAI 聚集大量使用者微調的 SD3 模型變體(LoRA、TI 等)。
7 下游應用
7.1 影像內容生成
- 文生圖工具:Stable Diffusion 3 (Medium) 可作為 Photoshop 外掛、ComfyUI 後端節點,應用於數字藝術、廣告素材初稿、遊戲概念原畫。
- 圖生圖編輯:通過 ControlNet、IP-Adapter 等外掛模組,對生成結果進行結構控制和風格遷移;SD3 的 Vector FM 架構下,ControlNet 介面卡在 2024 年中已由社群初步實現。
- 素材服務:Shutterstock、Getty Images 等相簿平台均已上線 AI 生成內容服務;其中是否內部流匹配模型未知(平台多使用自訓擴散模型),但上游模型切換對平台透明。
7.2 影片生成方向
Flow Matching 被視為影片生成中“時序一致性”挑戰的解決候選:
- Stable Video Diffusion (SVD) 技術上仍基於擴散架構,但 Stability AI 已公開表示下一步考慮將 FM / Rectified Flow 納入影片生成線。Meta 招聘資訊(2024)暗示內部在探索 FM 影片路線。
- Runway、Pika 等影片生成初創企業的技術報告未直接宣告使用 Flow Matching;公開資料未見明確揭露。
7.3 多模態、3D、科學應用(早期探索)
- 3D 資產生成:2D 到 3D 的蒸餾流程中,Flow Matching 可以作為先驗模型預測多視角影像,進而重構 3D GS 場景。ETH Zurich 的研究組(2024)有初步 Paper,尚未收斂至工具鏈。
- 藥物分子構象生成:離散結構的連續化表示使得 FM 可能用於分子動力學模擬。MIT 的博士論文(2023-2024)有個別探索,無公開產業應用。
- 機器人策略學習:將機器人行為分佈建模為生成問題,FM 可嘗試作為策略網路。仍處於學術研討階段。
| 下游 | 當前階段 | 落地訊號 | 來源 / 年份 |
|---|---|---|---|
| 文生圖 | 產品化 | SD3 釋出 | Stability AI, 2024 |
| 影片生成 | 研究-產品過渡 | Stability AI 內部探索 | 招聘資訊與公開演講, 2024 |
| 3D 資產 | 學術驗證 | ETH 論文 | 2024 |
| 分子構象 | 學術探索 | 零星論文 | 2023-2024 |
| 機器人操作 | 前期研究 | MIT 博士論文 | 2024 |
8 受益公司與機構
8.1 核心推動者
| 實體 | 角色 | 2024 年最新動態 | 來源 |
|---|---|---|---|
| Meta (FAIR) | 原始研究生產方 | Lipman 等持續發表 FM 相關論文;內部 RecFlow 團隊活躍 | Meta 研究部落格, arXiv 2024 |
| Stability AI | 首個大規模產品化公司 | 2024 年 6 月釋出 SD3,採用 FM + DiT 架構 | 官方新聞稿, 2024/06 |
| 耶路撒冷希伯來大學 | 學術發源地 | Yaron Lipman 實驗室產出 FM 原始論文及後續工作 | ICLR 2023, 2024 被引量飆升 |
8.2 間接受益方
- 雲端 GPU 服務商:模型訓練規模不因技術路線而極劇變化,CoreWeave、Lambda Labs 等受益於持續算力需求。
- AI 安全性 / 水印公司:針對 Flow Matching 模型的安全測試與溯源工具需求有增量空間,但公開訂單未見大幅變化。
- 開源社群:Hugging Face 提供免費 Diffusers 整合,降低使用門檻;Stability AI 開源策略擴大社群生態。
- 中國可跟進場景:國內雲端廠商若能將 FM 訓練成本通過演算法最佳化降低 20-30%,可優勢爭奪海外中小客戶。
9 市場規模
重要申明:Flow Matching 是一種基礎技術路線,而非獨立市場類別。以下資料基於其應用場景(生成式 AI 基礎架構與合成媒體)估算,均標註來源、年份與口徑。
9.1 生成式 AI 基礎模型市場(Flow Matching 所處總市場)
| 指標 | 數值 | 口徑 | 來源 | 年份 |
|---|---|---|---|---|
| 全球生成式 AI 市場規模 | 約 670 億美元 | 含基礎模型 API、雲端訓練/推論、合成媒體軟體 | Bloomberg Intelligence | 2024 年估算 |
| 其中基礎模型層佔比 | 約 15-20% | 對應約 100-130 億美元 | 同源拆解 | 2024 估算 |
| 全球生成式 AI 市場年複合增速 (CAGR) | 46.9% | 預測期 2024-2032 | Fortune Business Insights | 2024 報告 |
9.2 Flow Matching 市場滲透潛力
- 當前市佔率:不計 Rectified Flow,以 SD3 為唯一大型產品化案例,FM 在文生圖領域的市場滲透率極低;擴散模型及蒸餾版本佔據 95% 以上。
- 潛在滲透節奏:若 Stability AI 後續版本繼續強化 FM 架構,且 Meta 將之開源,至 2027 年 FM 在新訓練模型中佔比或可達 15-25%,對應基礎模型層市場約 30-60 億美元(基於前述增速推算,含廣泛不確定性)。
- 中國市場專項:截至 2024 年底,本地 AI 企業可靈、智譜、華為等的生成式基礎架構尚未公開採用 FM 路線,故 中國 FM 市場份額目前可視為 0%;公開資料未見專項融資或政府計劃。
注意:以上為基於公開宏觀資料的粗粒度推測,不是投資預測。技術路線選擇波動大,SD4 或 DALL-E 4 可能返回擴散架構,實際影響未知。
10 主要玩家對比
10.1 技術路線玩家矩陣 (截至 2024 年底)
| 玩家 | 技術路線 | 產品狀態 | 開源程度 | 核心優勢 | 2024 動向 |
|---|---|---|---|---|---|
| Stability AI | FM + DiT | SD3 已釋出 | 開源 (非商用許可證有爭議) | 產品化破圈,生態完善 | SD3 Medium + Turbo 釋出 |
| Meta (FAIR) | FM, Rectified Flow | 研究為主 | 論文公開,部分程式碼 | 原始創新,基礎研究深度 | 持續發表高質量論文 |
| OpenAI | 擴散為主 (未證實 FM 使用) | DALL-E 3 API | 閉源 | 文本-影像 alignment 領先 | 未公開 FM 採用情況 |
| Google DeepMind | 擴散 + 自迴歸 | Imagen 3 API | 閉源 | 多模態整合強 | 未公開 FM 採用,發表 Stochastic Interpolants |
| Midjourney | 擴散 + 蒸餾 | v6.1 服務 | 閉源 | 美學質量高 | 路線未公開 |
| 生數科技 / 智譜 | 擴散模型 (待核實) | 文生圖 API | 部分開源 | 中國市場渠道 | 公開資料未見 FM 採用 |
關鍵發現:Flow Matching 在主要玩家中的份額仍為單點 (Stability AI),擴散模型仍為主流,2025 年格局取決於 SD4 和 Meta 開源力度。
10.2 開源生態對比
| 指標 | SD3 (FM) | SDXL (擴散) | LCM (一致性模型) |
|---|---|---|---|
| 下載量 (HuggingFace, 2024) | 公開資料未見精確數 | 數千萬次 | 數百萬次 |
| LoRA 生態成熟度 | 初步建立 | 非常成熟 | 起步 |
| 社群工具鏈 (ComfyUI, Automatic1111) | 支援 | 全支援 | 有限支援 |
11 風險
11.1 技術路線風險
| 風險 | 發生機率 | 影響 | 說明 |
|---|---|---|---|
| FM 被證明與擴散殊途同歸 | 中高 | 商業差異化價值降低 | 數篇理論論文(Albergo 2023,Kingma 2024)表明,兩類架構可在一定變換下等價;FM 的“新範式”標籤可能在學術界消退 |
| 下一代架構崛起 | 中 | 與擴散共同承壓 | 如自迴歸 Transformer 在圖片生成中表現超越兩者,FM+擴散都將遇冷 |
| 取樣步數優勢不明顯 | 已部分驗證 | 商業化故事受損 | SD3 實際取樣步數仍需要 28-50,蒸餾後方可達少步,與蒸餾後擴散對比優勢無顯著效應 |
| 後向相容性差 | 已存在 | 社群分裂 | 大量基於 SDXL 的 LoRA/ControlNet 無法直接遷移至 FM 架構,需重新訓練 |
11.2 產業商業風險
| 風險 | 說明 |
|---|---|
| 核心論文作者流失 | FM 原創團隊如 Lipman 等高流動率,可能導致研究動能波動,但開源論文已確定公共知識 |
| 算力成本無絕對優勢 | FM 訓練算力與擴散相當,不構成“降本”的剛性理由,核心在於生成質量 |
| 開源與閉源博弈 | Stability AI 開源 SD3,但許可證爭議(非商用 / 商用限制含糊)導致商業使用者謹慎;若 Meta 以 Apache 2.0 豁免開放 FM 架構,格局將拉平 |
| 市場過熱預期 | 部分媒體將 FM 渲染為“擴散的終結者”,實際仍屬基礎架構的漸進最佳化而非革命 |
12 誤讀糾偏
誤讀 1:“Flow Matching 完全取代了擴散模型。” 糾偏:SD3 同時使用 Flow Matching 訓練目標與 DiT(擴散 Transformer)架構。架構層的 DiT 發展自擴散研究;FM 更多是訓練範式的革新,二者是協同關係。
誤讀 2:“Flow Matching 取樣更快。” 糾偏:理論優勢不盡然轉化為實踐優勢。原生的 Flow Matching 取樣仍需要 ODE 多步積分,速度增益主要體現在與 Rectified Flow(拉直)和多輪蒸餾結合之後。SD3 預設不蒸餾版取樣成本仍與高速擴散系相當。
誤讀 3:“SD3 比 SDXL 全面更優。” 糾偏:社群測試(Artificial Analysis, 2024)顯示 SD3 在 prompt adherence、文本拼寫方面顯著提升,但在手勢穩定性、皮膚紋理真實感等維度偶有退化,評分未全面超越 SDXL + Refiner 管線。各有擅長場景。
誤讀 4:“Flow Matching 是中國公司的機會。” 糾偏:截至 2024 年底,中國公司尚無 FM 產品案。中國優勢在於應用與資料閉環,演算法前沿原創仍以海外為主;理性定位為追蹤微創新與工程落地。
13 最新事件 (截至 2024 年 12 月)
- 2022 年夏:Yaron Lipman (Meta+希伯來大學) 團隊在 arXiv 提交 Flow Matching 預印本,後獲 ICLR 2023 接收。
- 2023 年 2 月:Liu et al. 發表 Rectified Flow,表明重複直線化 Flow 可極簡提升取樣。
- 2024 年 3 月:Esser et al. 發表 SD3 技術報告於 ICML 2024,揭示 MMDiT+FM 建構方式。
- 2024 年 6 月:Stability AI 釋出 Stable Diffusion 3 Medium,首個大規模 FM 開源模型。
- 2024 年 8 月:Tong et al. 在 TMLR 發表 Minibatch OT for Flow Matching,系統驗證 OT 路徑的增益。
- 2024 年 10 月:Hugging Face Diffusers 庫完善對 SD3 的完全支援,下采樣流程完善。
- 2024 年 12 月:Meta 在 NeurIPS 2024 的 FM 相關 Workshop 論文數量逾 10 篇,活躍度持續。
14 追蹤指標
(注:以下為客觀觀測指標,不構成任何趨勢預測或投資建議。)
| 追蹤維度 | 具體指標 | 來源 |
|---|---|---|
| 產品採用 | 新發布的生成模型是否宣佈用 FM 架構 | 公司技術報告、arXiv |
| 開源生態 | HuggingFace SD3 下載量、衍生模型數 | HuggingFace |
| 取樣步數進步 | FM 不經蒸餾的典型 NFE 是否降至 10 步以下 | 相關論文 |
| 基準對比 | FM 模型在 TIFA、DSG、PickScore 等自動基準上的得分變化 | 學術基準排行榜 |
| 影片與多模態 | 是否出現首個公開的 FM 影片模型 | 產品釋出 |
| 中國參與者 | 阿里、騰訊、位元組等雲端廠商或 AI 公司是否發表 FM 相關論文或開放 FM 模型 | Arxiv / 企業公眾號 |
15 信源
- Lipman, Y. et al. (2023). Flow Matching for Generative Modeling. ICLR 2023. arXiv:2210.02747.
- Esser, P. et al. (2024). Scaling Rectified Flow Transformers for High-Resolution Image Synthesis (SD3 技術報告). ICML 2024. arXiv:2403.03206.
- Liu, X. et al. (2023). Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow. ICLR 2023. arXiv:2209.03003.
- Tong, A. et al. (2024). Improving and Generalizing Flow-Based Generative Models with Minibatch Optimal Transport. TMLR, 2024. arXiv:2302.00482.
- Albergo, M. et al. (2023). Stochastic Interpolants: A Unifying Framework for Flows and Diffusions. arXiv:2303.08797.
- Stability AI (2024). Stable Diffusion 3 官方部落格. 2024/06. https://stability.ai/news/stable-diffusion-3.
- Bloomberg Intelligence (2024). Generative AI Market Sizing Report. (入口需訂閱)
- Fortune Business Insights (2024). Generative AI Market Size, Share & COVID-19 Impact Analysis. Report ID: FBI106806.
- Artificial Analysis (2024). SD3 vs SDXL Quality & Speed Benchmarks. https://artificialanalysis.ai.
- Hugging Face Diffusers (2024). Stable Diffusion 3 整合文件與模型卡片. https://huggingface.co/docs/diffusers/index.
⚠️ 風險提示與免責宣告:本文為技術概念科普與產業鏈資訊梳理,不構成任何投資或商業決策建議。所有財務、市場份額及產能數字均標註年份、口徑與公開來源;因商業保密原因,部分關鍵引數未能獲取,文中均以“公開資料未見”如實標註,絕非否認事實存在。文中不涉及對任何公司股票的推薦、買賣建議、漲跌預測或“值得買”類傾向性措辭。技術迭代迅速,請以最新信源為準。
資訊更新截止:2024 年 12 月 · 本頁由 MiMo 補全