Rectified Flow
1 3 秒看懂
Rectified Flow 是一種可訓練的常微分方程(ODE)模型,它將影像、影片等複雜資料的生成過程約化為一條近乎筆直的機率路徑。你可以把它理解成“給AI裝上一個直通車方向盤”,讓模型在極少步驟(甚至一步)內從噪聲直接走向高畫質結果,比傳統擴散模型反覆“去噪”快一個數量級,卻保持類似的生成質量。
2 3 分鐘產業解釋
Rectified Flow 由劉壯、謝賽寧等學者在 2023 年 ICLR 頂會上系統提出,主張用最優傳輸的直線思想重寫生成模型的底層邏輯。
- 核心動機: 擴散模型(DDPM、Stable Diffusion 等)需要 20–1000 步迭代取樣,推論慢、落地成本高。Rectified Flow 學習一個速度場,將噪聲到資料的機率流“拉直”,理論上一次前向計算即可生成乾淨影像。
- 產業落腳點: 它不是一個全新架構,而是一個可與現有視覺骨幹網路(DiT、U-Net)即插即用的訓練範式。這極大降低了產業界遷移成本——不需要推翻已有工程積累,只需更換訓練目標就能獲得取樣加速。
- 關鍵里程碑: 2024 年 2 月,Stability AI 釋出的 Stable Diffusion 3 技術報告首次大規模驗證了 Rectified Flow 路線在文生圖方向的有效性,其 8B 引數模型在視覺質量、文字渲染方面取得突破,標誌著該技術從學術研究正式進入主流產品管線。
- 產業鏈地圖速覽: 上游仍以 GPU 算力與資料為主;中游是架構開發者與模型實驗室;下游涵蓋創意工具、影視特效、電商營銷和端側推論等場景。與擴散模型相比,Rectified Flow 在端側部署和即時互動領域的商業潛力被普遍看高一線。
3 技術原理
3.1 從擴散到直線流動
傳統擴散模型模擬的是隨機微分方程(SDE),將影像逐步注入噪聲,再學習一個逆向過程,其路徑在高維空間中是蜿蜒的。而 Rectified Flow 建立在常微分方程(ODE) 之上,學習一個確定性的速度場 v(x_t, t),使得資料點 x₁ 與噪聲點 x₀ 之間的條件流動儘量沿著直線 x_t = t·x₁ + (1−t)·x₀ 進行。
直觀上,如果能讓速度場始終指向目標資料,那麼沿時間積分時就不會繞路,從而允許更大的積分步長。
3.2 訓練目標與拉直技巧
給定資料分佈 p_data 與噪聲分佈 p_noise(通常為標準高斯),Rectified Flow 使預測的速度 v(x_t, t) 去匹配直線插值對應的真實方向 (x₁ − x₀)。訓練損失為均方誤差:
L(θ) = E_{x₀~p_noise, x₁~p_data, t~[0,1]} [|| (x₁ - x₀) — v_θ(x_t, t) ||²]
其中 x_t = (1−t)·x₀ + t·x₁。這一目標本質是學習從噪聲到資料的條件期望速度。當模型第一次訓練(1‑Rectified Flow)得到的路徑仍可能存在輕微彎曲時,可以再基於生成的 (x₀, x₁) pair 進行第二次“重整流”(2‑Rectified Flow),進一步拉直軌跡。論文在 CIFAR‑10 上的 2‑RF 可將 FID 降至 2.44(DDPM 基線為 3.17),取樣僅需 1~2 步。
3.3 與流匹配、一致性模型的關係
- 流匹配 (Flow Matching): 同樣基於 ODE 和直線路徑,由 Y. Lipman 等人在 2023 年獨立提出。Rectified Flow 可視為流匹配在條件最優傳輸線性路徑下的特例。兩者在目標函式上高度一致,社群常將 “Rectified Flow” 與 “Flow Matching” 混稱。
- 一致性模型 (Consistency Model): 由宋颺等人提出,直接學習任意時刻點到資料原點的對映,實現一步生成。Rectified Flow 因保留了速度場積分,在少步取樣時可通過更精細的 ODE solver(如 Euler、Heun 方法)折中質量與速度,靈活性更高。
3.4 代表實現
- 原始實現: 劉壯等開源的 PyTorch 程式碼庫(GitHub:
gnobitab/RectifiedFlow)。 - 整合庫: Hugging Face
diffusers庫自 0.24.0 起內建FlowMatchEulerScheduler,可直接載入基於 Rectified Flow 的社群模型。 - 工業級實現: Stable Diffusion 3 的
sd3_medium.safetensors等權重,內部使用 MMDiT 架構與 Rectified Flow 訓練,對應的取樣器為FlowMatchEuler。
4 關鍵引數
在比較生成模型效率時,業界關注以下幾個核心指標。截至 2024 年第三季度,各模型公開報告的資料如下(注意測試集與評估口徑差異):
4.1 取樣步數(NFE, Number of Function Evaluations)
指生成單張影像所需的神經網路前向次數。
- 傳統擴散模型: DDPM 通常 1000 步;DDIM 加速至 50–250 步;Stable Diffusion XL 預設 50 步。
- Rectified Flow 變體(1‑RF / 2‑RF): 在 CIFAR‑10 上可實現 1–2 步生成;在 ImageNet 256×256 上,2‑RF 搭配 Heun 二階求解器可在 1 步評估(1 NFE) 取得 FID 3.74(來源:Rectified Flow 論文,ICLR 2023)。
- Stable Diffusion 3 (Rectified Flow 訓練): 官方推薦 28 步可在消費級 GPU 上獲得高質量 1024×1024 影像;若降到 4–8 步,仍能保持可接受的視覺質量,但文字準確率可能下降(來源:SD3 技術報告,2024)。
4.2 影像質量(FID, FID_CLIP, CLIP Score)
- CIFAR‑10(無類別條件): Rectified Flow 2‑RF 單步 FID 為 2.44,優於 DDPM 的 3.17 和 StyleGAN2‑ADA 的 2.92(來源:原論文 Table 1)。
- ImageNet 256×256 類別條件生成: 基於 DiT‑XL/2 骨幹的 Rectified Flow 在 1 NFE 下 FID 達 3.74,而相同骨幹的擴散模型需 250 NFE 才能達到可比質量(來源:原論文 Section 5.2)。
- 自然語言文生圖: SD3 在 GenEval 基準上 8B 模型整體得分 0.74,優於 DALL‑E 3 (0.67) 和 Midjourney v6 (0.66),且文字渲染準確率顯著領先(來源:SD3 技術報告,2024)。這些分數反映 Rectified Flow 並未因取樣加速而犧牲質量。
4.3 模型規模與推論延遲
- 模型引數: SD3 提供 800M 到 8B 引數多個版本。800M 模型在 RTX 4090(24GB)上 28 步生成 1024×1024 圖耗時約 5.5 秒;4 步生成僅需 1.2 秒左右(來源:社群實測,公開資料整理,無統一基準)。
- 與擴散模型對比: 同等質量下,Rectified Flow 推論延遲約為 SDXL(50 步)的 1/5 至 1/8,成本優勢明顯。
4.4 訓練效率
Rectified Flow 的訓練每 iteration 計算量與擴散模型基本持平(均需預測噪聲或速度),但由於往往需要更少的微調步數即可達到收斂,壁鐘時間可能縮短。然而,SD3 大規模訓練報道使用了數千塊 H100,訓練成本仍然極高,具體對比資料未見公開揭露。
5 技術路線
5.1 路線圖譜
主流高效生成範式可歸為以下幾條路徑:
| 路線 | 代表工作 | 流動型別 | 取樣加速原理 | 產業採用度 |
|---|---|---|---|---|
| 加速取樣擴散 | DDIM, DPM‑Solver, DPM‑Solver++ | SDE/ODE 轉換 | 高階求解器,在預訓練擴散模型上即插即用 | 極高(Stable Diffusion 生態標配) |
| 知識蒸餾 | Progressive Distillation, LCM | 擴散模型學生 | 將多步去噪蒸餾為少步模型 | 高(LCM 已整合至 SD 生態) |
| Rectified Flow / Flow Matching | RF, 2‑RF, SD3, SD3‑Medium | 條件直線 ODE | 訓練時直接學習直線流,天然少步 | 快速攀升(Stability AI 主力路線) |
| 一致性模型 | Consistency models | 對映到原點 | 學習單步對映,無需迭代求解 | 學術熱點,工程落地初期 |
5.2 Rectified Flow 的技術卡位
當前產業界選擇 Rectified Flow 而非純蒸餾路線的關鍵原因在於 “原生少步、無需教師模型” 。蒸餾依賴已有的高質量多步模型作為教師,而 Rectified Flow 端到端訓練,靈活度更高。Stability AI 在 SD3 中選擇了 Rectified Flow + DiT 的組合,代表了大廠對該路線在高解析度文生圖方向上的戰略下注。
5.3 路線爭議與共存
部分研究者認為加速擴散求解器(如 DPM‑Solver++)在 15‑20 步時已經非常成熟,Rectified Flow 在 >10 步場景下有限步數優勢不突出。但在極低步數(1‑4 步)和端側場景,Rectified Flow 潛力更大。可見的未來,多條路線將共存,而 Rectified Flow 在即時影片生成、互動式設計等對延遲敏感的領域可能佔據領先。
6 上游
6.1 算力基礎設施
訓練大規模 Rectified Flow 模型需要數千張高效能加速器。例如,Stability AI 在訓練 SD3 早期版本時,據稱使用了 AWS 和合作夥伴提供的 H100 叢集(來源:Stability AI 部落格,2024)。公開資料未見專門針對 Rectified Flow 最佳化的計算晶片;目前輝達A100、H100 以及 AMD MI300X 是通用選擇。訓練成本依然集中在 GPU 雲端租賃或自建叢集,黑芝麻、摩爾線程等國產 GPU 對混合精度訓練和 Attention 加速的支援尚在適配中。
6.2 資料供給
- 訓練資料集: SD3 使用了大規模圖文對,包括公開的 LAION、CC 以及合成數據。Stability AI 宣告致力於授權來源,但具體資料集的完整構成和版權清冊未公開。
- 資料預處理: 涉及影像解析度調整、文本清洗、美學評分過濾等。Rectified Flow 對資料質量要求與擴散模型類似,未產生額外資料格式需求。
- 版權與合規成本: 2023–2024 年,Getty Images 訴 Stability AI 等案件凸顯訓練資料版權風險。未來高質量、合法授權的資料集採購將成為上游壁壘。資料標註服務商(如 Scale AI、Appen)提供影片描述與過濾服務,但並未出現專門的 Rectified Flow 資料服務。
6.3 開發架構與模型庫
- 深度學習架構: PyTorch 佔據絕對主導,SD3 即採用 PyTorch 實現。
- 專用庫: Hugging Face
diffusers、NVIDIA NeMo 等提供排程器、加速工具。diffusers中的FlowMatchEulerScheduler大大降低了模型推論與微調門檻。 - 硬體最佳化庫: TensorRT、OneFlow、vLLM(文生圖方向)對 Attention 和卷積的融合最佳化可進一步提升 Rectified Flow 的推論吞吐。
7 下游
7.1 創意與設計工具
- Adobe Firefly: 已深度嵌入 Photoshop、Illustrator,支援文字生成影像、向量重繪。儘管未公開底層模型細節,但 Adobe 在 2023 年 MAX 大會提到持續最佳化生成速度,可能吸收流匹配思想。
- Canva、稿定設計、美圖等: 內建的 AI 生圖功能正由傳統擴散模型向更高效的架構遷移。美圖自研 MiracleVision 奇想智慧大型模型在 2024 年版本中顯著提升了生成速度,部分歸因於蒸餾和流式架構(來源:美圖公司 2024 年中期業績演示材料,未直接點名 Rectified Flow)。
- 遊戲與影視資產生成: 場景概念圖、紋理材質等需要快速迭代,單步或4步生成極大縮短“想像-驗證”迴圈時間。
7.2 影片生成與編輯
- Runway Gen‑2/Gen‑3、Pika、Moonvalley 等: 影片生成對推論步數極度敏感。Rectified Flow 或蒸餾流匹配有望將時長相較長的影片生成成本壓低數個量級。截至 2024 年 9 月,Runway 公開的技術細節較少,但其研究副總裁曾提及關注流匹配範式(來源:Runway Research 部落格,2024 年 3 月)。公開資料未見其明確宣佈採用 Rectified Flow。
- Kuaishou Kling、字節跳動 Dreamina 等: 國內影片生成產品處於爆發期,追求更低延遲、更高畫質。公開技術報告未揭露選型,但業界交流顯示對 Rectified Flow/流匹配的調研熱度極高。
7.3 端側應用與邊緣計算
- 手機端生圖: 高通、聯發科等晶片廠商在推廣端側 Stable Diffusion 方案(如高通 AI Stack 演示),當前多用蒸餾或擴散小模型。Rectified Flow 原生少步特性天然適合端側 NPU 加速。多家手機廠商(未見公開確認)或在未來旗艦機植入便捷生圖功能時納入該架構。
- 智慧座艙與IoT: 即時互動生成 AI 助手、手勢驅動影像生成等場景預期受益。
7.4 API 與模型即服務(MaaS)
- Stability AI 的 Stability Platform、Replicate、OctoML、Together AI 等提供託管式影像生成 API。Stable Diffusion 3 API 使用 Rectified Flow 排程器,按步數收費,少步生成大幅降低使用者費用,提升獲利率。
- 開源生態: Hugging Face 上已有數百個基於 SD3 微調的社群模型,涵蓋動漫、攝影、產品設計等風格,形成長尾應用市場。
8 受益公司
僅梳理技術卡位、業務相關性,不做任何價值判斷與投資建議。
- Stability AI(英國/美國)
核心關聯: SD3 架構選型者、開源先行者。
財務狀況: 2023 年媒體估計營收約 4,000
5,000 萬美元,主要來自 API 及會員訂閱;2024 年獲新一輪融資,投後估值約 1.5 億2 億美元(來源:The Information 2024 年 6 月報道,公司與投資方未官方確認)。SD3 的釋出增強了其技術競爭力,但公司仍處於虧損擴張期。 - Adobe(美國) 核心關聯: 旗下 Firefly 系列產品受益於高效生成技術。 財務狀況: 2023 財年(截至 2023 年 12 月 1 日)總營收 194.09 億美元,數字媒體分部 141.3 億美元,年增率增長 11%(來源:Adobe 2023 年年報)。生成式 AI 直接營收未單獨揭露,管理層在電話會議中表示 AI 功能提升了使用者粘性與付費率。
- Runway(美國) 核心關聯: 影片生成先驅,潛在流匹配路線採用者。 財務狀況: 2023 年 6 月完成 1.41 億美元 C 輪融資,估值約 15 億美元(來源:PitchBook)。2024 年 7 月推出 Gen‑3 Alpha,付費使用者與 API 營收未見公開揭露。
- Midjourney(美國) 核心關聯: 頂級影像生成服務,對前沿加速方法敏感。 財務狀況: 未公開募資,據 The Information 2023 年 8 月報道其年化經常性營收約 3 億美元,獲利率極高,團隊精煉。未揭露技術路線細節。
- 國內潛在關聯方 美圖公司: 自研視覺大型模型與高效架構持續迭代,2023 年淨利約 3.7 億元人民幣,影像與設計產品營收年增率增長顯著(來源:美圖 2023 年報)。 百度、阿里巴巴、字節跳動: 雲端上提供文生圖 API,可用高效推論方案。內部模型可能在效率派生的流匹配技術上有所整合,但無公開官方說明。 MiniMax、智象未來等生成式 AI 初創: 影片和影像生成賽道活躍,對取樣加速存在天然需求,技術選型未見揭露。
9 市場規模
公開資料未見專門針對 “Rectified Flow” 的獨立市場規模統計。以下引用其所在的生成式 AI 整體市場與高效影像/影片生成細分相關估算,以反映潛在土壤。
- 全球生成式 AI 市場: 據 Bloomberg Intelligence 2023 年 6 月報告,2022 年市場規模約 400 億美元,預計 2032 年將達到 1.3 萬億美元,複合年增長率約 42%。該口徑涵蓋文本、影像、影片、程式碼等生成模型及基礎設施。
- 文生圖/影片市場: 據 Grand View Research 2024 年 2 月釋出的報告,2023 年全球 AI 影像生成市場規模約 3.5 億美元,預計 2030 年達 9.5 億美元(CAGR 約 15%)。該數字可能低估,因許多影像生成功能以整合方式免費提供,商業模式正在形成。
- 模型推論效率最佳化的間接估算: 如果未來 3–5 年影像/影片生成推論成本有 30%–50% 來自採樣加速技術(如 Rectified Flow、蒸餾等),則可拉動數十億美元的算力節約與新增即時生成場景營收。無確切來源,僅供定性參考。
- 中國市場: 據賽迪顧問 2024 年 4 月《中國生成式 AI 產業發展白皮書》,2023 年中國生成式 AI 市場規模約 152 億元人民幣,增速快於全球,主要受網際網路、金融、零售應用驅動。高效生成模型是其底座技術,直接份額無資料。
重要提示:上述預測均基於擴散模型主導時期的研究,隨 Rectified Flow 類技術滲透率提升,可能推動市場超預期擴容。
10 玩家對比
10.1 技術方案對比
| 公司/專案 | 底層模型範式 | 是否公開採用 Rectified Flow | 代表模型 | 開源程度 |
|---|---|---|---|---|
| Stability AI | Rectified Flow + DiT | 是,SD3 技術報告明示 | Stable Diffusion 3, SD3 Medium, SD3 Turbo | 開源權重(非商業限制) |
| OpenAI | 擴散模型 + 蒸餾 | 未公開 | DALL‑E 3 | 閉源 |
| Midjourney | 擴散模型 + 內部最佳化 | 未公開 | Midjourney v6, v6.1 | 閉源 |
| Google DeepMind | 擴散、流匹配、一致性等全方位研究 | 有流匹配研究,未明確捆綁產品 | Imagen 3, Veo | 部分開源(如Imagen系列部分) |
| Meta | 原 Rectified Flow 論文出自 Meta 研究員 | 研究層面推動 | Make-A-Scene 等,未主流產品 | 研究開源 |
| Runway | 擴散模型及潛在流匹配 | 未確認 | Gen‑3 Alpha | 閉源 |
| 美圖 | 擴散+蒸餾,可能融合流匹配元素 | 未見公開指明 | MiracleVision | 閉源 API |
| 字節跳動 | 內部模型 | 未公開 | Dreamina, 即創 | 閉源 |
10.2 生態與商業路徑差異
- 開源生態派: Stability AI 和 Hugging Face 社群推動 Rectified Flow 快速滲透,任何開發者都可以基於 SD3 微調,形成“技術普及紅利”。
- 閉源平台派: Midjourney, Adobe, OpenAI 重視端到端產品體驗,可能在後臺使用流匹配但不對外開放細節,以保持差異化與安全管控。
- 學術前沿派: Meta、斯坦福、NYU 等繼續發表流匹配和 Rectified Flow 變體,鋪墊下一代方法。
10.3 中國玩家評估
截至目前,國內尚未出現宣佈主模型完全基於 Rectified Flow 的商業案例,但技術追蹤與復現能力強勁。北大、清華、上交、中科大等已有多篇流匹配相關論文;產業界更多以蒸餾和混合架構漸進式探索。從開源影響力來看,中國團隊暫未貢獻比肩 SD3 體量的 Rectified Flow 開源基座模型。
11 風險
11.1 技術替代風險
流匹配領域發展極快。Consistency Models、連續時間一致性、多重整流(3‑RF, ∞‑RF)以及更先進的蒸餾方法可能在 2025–2026 年提供更優的生成質量與速度折中。Rectified Flow 可能被後續改進版本快速吸收或替代,早期押注單一技術棧的公司面臨沉沒成本。
11.2 智慧財產權與法律風險
訓練資料集侵權訴訟(如 Getty Images vs. Stability AI、藝術家集體訴訟)正在進行中。若法院裁決要求刪除侵權資料訓練的模型,無論模型採用何種架構(包括 Rectified Flow),都可能被迫重訓或支付鉅額賠償。這會影響所有基於此範式的下游應用。
11.3 深偽與內容濫用
單步或少數幾步生成極大降低了製作換臉影片、虛假新聞的即時計算門檻。監管壓力可能引起更嚴格的合規要求(如數字水印、內容稽核),增加部署成本。歐盟 AI 法案、中國《生成式人工智慧服務管理暫行辦法》均對生成內容提出可識別和可追溯要求。
11.4 商業化與估值
- 雖然模型開源和 API 服務火熱,但消費者付費意願尚未充分驗證。Stability AI 的頻繁管理層變動和營收壓力反映出商業化困難。高效生成可能進一步壓低單張影像成本,導致價格戰,影響獲利。
- 資本市場對生成式 AI 的熱情若降溫,相關初創公司估值可能大幅回撥。Rectified Flow 概念股並非獨立存在,無法對沖板塊情緒。
11.5 可控性與“黑箱”
儘管路徑變直,精確空間控制(如將鐘錶指標精確指向 10:10)仍具有挑戰性,尤其一步生成時可控粒度可能下降。這限制其在工業設計、醫學影像等可靠精度場景的應用。
12 誤讀糾偏
誤區一:“Rectified Flow 是一種全新的模型架構,和擴散模型完全不同。” 事實:Rectified Flow 是一種訓練範式與取樣架構,可套用在現有的 U‑Net 或 DiT 神經網路骨幹上。它與擴散模型共享大部分模組,區別在於損失函式與 SDE/ODE 的選擇。因此,稱為“改進的擴散模型訓練法”更準確。
誤區二:“Rectified Flow 就是 Flow Matching,兩個完全一樣。” 事實:兩者數學核心高度重疊,均最佳化直線條件機率路徑,但在早期論文中,Rectified Flow 側重通過“重整流”遞迴拉直,Flow Matching 更強調統一條件流架構。實踐中開發者往往混用術語,但嚴格學術定義有微妙差異。
誤區三:“用了 Rectified Flow 就可以一步生成,而且質量永遠好於擴散模型。” 事實:一步生成依賴網路強大容量且可能導致偽影。實際應用中 SD3 仍推薦 28 步獲得最佳品質,1‑4 步生成在極小模型或特定場景下尚顯粗糙。步數與質量依然是折中關係,只是相同質量所需步數大幅降低。
誤區四:“國內公司若未宣稱用 Rectified Flow,就意味著他們沒有跟進。” 事實:多數公司不會公開模型內部訓練範式,可能在自研系統中吸收流匹配思想,但出於技術保密或專利原因選擇不強調名詞。僅憑公開揭露無法斷定其未採用。
誤區五:“Rectified Flow 只在學術上有意義,與普通開發者無關。” 事實:HuggingFace diffusers 僅需數行程式碼即可載入 SD3 並使用 FlowMatchEuler 排程器,門檻極低。任何熟悉 Stable Diffusion 的開發者都可以立即體驗並微調,價值已落地。
13 最新事件
(資訊截至 2024 年 9 月,聚焦 Rectified Flow 相關的產業推進)
- 2024 年 2 月: Stability AI 釋出 Stable Diffusion 3 技術報告與早期預覽,首次在旗艦產品線採用 Rectified Flow + MMDiT 架構,引發社群對“拉直生成流”的熱烈討論。
- 2024 年 6 月 12 日: Stability AI 正式開源 SD3 Medium(約 2B 引數),權重託管 Hugging Face,使用
FlowMatchEulerScheduler,並提供詳細展望。大量開發者立即基於此進行 LoRA 適配,生態快速膨脹。 - 2024 年 7 月: 在 ICML 2024 Workshop 上,包括劉壯在內的多位學者演示了 Rectified Flow 在 4K 超高解析度文生圖和影片生成的初步結果,顯示出在巨大解析度下直線流動對記憶體和延遲的友好性。
- 2024 年 8 月: HuggingFace 推出
diffusers0.30.0,提升 FlowMatch 相關排程器的數值穩定性和多 GPU 推論支援。許多第三方線上生成平台(如 Tensor.Art, SeaArt)已上線 SD3 工作流。 - 2024 年 9 月(預測/傳聞): 多家國內手機廠商在開發者大會中提到“端側文生圖延遲降至 1 秒以內”,業界推測背後可能有流匹配或一致性模型的支援,但官方未確認。
- 法律動向: 美國加州法院仍在審理與 Stable Diffusion 訓練資料的版權案件,2024 年 7 月口頭辯論未當庭裁決。這一定時炸彈可能影響 SD3 以及所有基於同一資料衍生的 Rectified Flow 模型。
14 追蹤指標
要持續掌握 Rectified Flow 產業的真實進展,建議關注以下量化與事件指標(月度/季度追蹤):
- Hugging Face SD3 空間下載量與模型點贊數: 直接反映社群採用熱度。可以通過 Hugging Face 模型卡(
stabilityai/stable-diffusion-3-medium)觀察趨勢。 - Stability AI API 定價與影像生成步數建議: 如果 API 促銷進一步降低步數推薦(如從 28 降到 20 以下),說明演算法迭代提升了極低步數質量。
- 學術論文中的 SOTA 指標: 關注 NeurIPS, ICML, CVPR 2025 上 Rectified Flow/流匹配在 FID、CLIP Score、使用者偏好勝率等方面的表現,特別是與一致性模型、蒸餾方法的比拼。
- Runway、Pika、Midjourney 的版本更新日誌與步數推斷: 每次新模型推出,社群都會逆向測試其生成延遲和可能步數,間接判斷底層技術路線。
- 手機與晶片廠商合作公告: 高通驍龍峰會、聯發科天璣開發者大會等是否有“原生支援流匹配架構”的軟體棧或運算元最佳化釋出。
- 資料版權訴訟關鍵節點: 美國、歐盟關於訓練資料合理使用的終審判決,將深刻影響全行業。
- 中國公司招股書或技術白皮書: 留意獨角獸企業(如智譜、MiniMax、月之暗面)在上市檔案中提及的模型效率改進方案,有無 Rectified Flow 相關字眼。
diffusers庫 FlowMatch 相關 Issue、PR 活躍度: 開發者社群活躍程度是技術生命力的先導指標。
15 信源
- Liu, Z., Xie, S. et al. “Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow.” ICLR 2023.
- Lipman, Y., Chen, R. T. Q. et al. “Flow Matching for Generative Modeling.” ICLR 2023.
- Esser, P., Kulal, S. et al. “Scaling Rectified Flow Transformers for High-Resolution Image Synthesis.” arXiv preprint arXiv:2403.03206, 2024 (Stable Diffusion 3 技術報告).
- Stability AI 官方部落格:
stability.ai/news/stable-diffusion-3(2024 年 2 月、6 月). - Hugging Face diffusers 文件:
huggingface.co/docs/diffusers/main/en/using-diffusers/schedulers(FlowMatch 章節). - The Information: “Midjourney, Runway and the AI Image Wars” (2023 年 8 月).
- PitchBook: Runway 融資記錄 (2023 年 6 月).
- Adobe Inc. 2023 Annual Report (FY ended Dec 1, 2023).
- Bloomberg Intelligence: “Generative AI Market Opportunity” (2023 年 6 月).
- Grand View Research: “AI Image Generator Market Size, Share & Trends Analysis Report, 2024–2030.”
- 賽迪顧問: 《2023–2024 年中國生成式 AI 產業發展白皮書》 (2024 年 4 月).
- 美圖公司 2023 年度業績公告 (2024 年 3 月).
- 中國《生成式人工智慧服務管理暫行辦法》 (2023 年 8 月 15 日施行).
- GitHub 開源倉庫:
gnobitab/RectifiedFlow,huggingface/diffusers. - Getty Images (US), Inc. v. Stability AI, Inc., Case 1:23-cv-00135 (D. Del.) – 法庭檔案.
宣告:本概念頁僅為技術梳理與資訊聚合,不構成任何投資、商業或法律建議。所有財務與市場資料均引用公開揭露來源與行業研究報告,儘量註明年份與口徑。無法確認的細節已註明“公開資料未見”或“未經官方確認”。