影片續寫(Video Continuation)
1. 3 秒看懂
影片續寫,指在給定一段影片片段(如開頭若干幀或任意上下文)後,由人工智慧模型自動生成後續影片幀序列,實現時間維度的連續敘事延展。其本質是生成式 AI 從單幀或短影片出發,推演並繪製出符合原始視覺邏輯與語義的連貫影片內容,屬於 AIGC 在時間軸上的高階應用。
2. 3 分鐘產業解釋
影片續寫是 AI 影片生成賽道下最富挑戰性的分支。與文生影片(Text-to-Video)從零創造不同,續寫必須嚴格繼承輸入影片的物體身份、場景光影、運鏡風格乃至物理規律,對模型的時間一致性、長程記憶與世界認知能力提出極高要求。產業層面,該技術正處於從實驗室 demo 向專業工具過渡的關鍵期:頭部企業已能在特定條件下穩定輸出 5 秒至 2 分鐘的影片延展,但尚不能完全替代人工拍攝。2024 年以來,Runway、Pika、位元組即夢、快手可靈等產品密集迭代,OpenAI 的 Sora 在 2024 年末以產品化形式落地,將單次續寫時長和物理合理性推向新高度,但計算成本與穩定性仍是大規模商用的瓶頸。產業鏈上游依賴高效能 GPU 和海量影片資料集,中游由模型廠商和工具化平台構成,下游已滲透到影視預演、短影片創作、電商商品展示和廣告素材生成等場景。由於“續寫”常作為生成產品中的隱含功能而非獨立服務計價,獨立營收口徑極為模糊,公開資料未見權威機構單列影片續寫市場規模。
3. 技術原理
影片續寫建立在影像生成與序列建模兩項根基之上,核心難點在於引入時間軸後,模型需同時保證空間質量與幀間動態的合理性。
3.1 生成範式
當前主流方案分為三大類:
- 擴散模型:以 Stable Video Diffusion 為代表,將輸入影片的初始幀經編碼後置入潛在空間,與不同時間步的高斯噪聲共同輸入時空 U-Net,通過逐步去噪還原出後續幀。通過 3D 卷積與時序注意力層,模型學習幀間物體位移、遮擋與形變。2023 年底 Stability AI 釋出的 SVD 可基於單幀生成 14 幀 576×1024 的影片,約為 1 秒出頭的片段(來源:Stability AI 技術報告, 2023 年 11 月)。衍生的效果如 Lumiere(Google,2024 年 1 月)採用時空 U-Net 架構,一次性輸出全長影片,而非逐幀自迴歸生成,大幅改善了運動連貫性。
- 自迴歸式 Transformer:將影片幀壓縮為離散 token,利用類似 GPT 的下一個 token 預測機制逐幀生成。典型工作如 VideoPoet(Google,2023 年 12 月),通過多模態大語言模型統一處理影片、音訊、文本 token,可執行續寫、風格轉繪等多項任務,展示了單一模型處理多種影片任務的潛力。
- 世界模型:以 Sora(OpenAI,2024 年 2 月首次釋出,12 月產品化)、Genie(Google DeepMind)等為代表。這類模型不完全依賴畫素統計,而是試圖建置對三維空間、物理互動和因果關係的隱性表達,使續寫過程中物體會遵守重力、碰撞、光影變化等規則,從而抑制“畫素合理但物理荒謬”的生成。Sora 基於 DiT(Diffusion Transformer)架構,將影片切分為時空補丁進行擴散建模,生成最長 60 秒的影片,且能在給定前序內容後維持穩定的場景與角色一致性(來源:OpenAI 技術報告, 2024 年 2 月)。
3.2 核心技術創新點
- 時空壓縮/ 編碼:高效地將冗餘的影片畫素壓縮為緊湊的潛變數或離散 token,降低計算量。如 MagViT-2 等影片量化模型。
- 長期記憶機制:在超大上下文視窗中維持物體外觀、運動向量的一致性。部分方案引入外部記憶庫或基於檢索的注入方法。
- 可控續寫:通過文本描述、關鍵點軌跡、運動筆刷(Motion Brush)、參考影像等方式為續寫內容嵌入條件,實現鏡頭運動、動作走向、情緒演變等精細調控。
4. 關鍵引數
評價影片續寫能力需從生成質量、一致性、效率和可控性等多維度衡量,常用引數及指標包括:
| 引數 / 指標 | 說明 | 典型值或趨勢(截至 2025Q1) | 來源 |
|---|---|---|---|
| 最大續寫時長 | 單次續寫可持續生成的影片長度 | Runway Gen-3 Alpha:10 秒以上;Pika 2.0:約 8 秒;Sora:最長 60 秒;可靈 1.5:可達 2 分鐘(分段續寫) | 各公司官方資料 |
| 輸出解析度 | 生成影片的空間解析度 | 常見 1280×720(720p)至 1920×1080(1080p),Runway 支援 4K 輸出(通過超分) | Runway 產品頁, 2025 年 1 月 |
| 幀率 (fps) | 每秒幀數,影響運動平滑度 | 通常 24 fps 或 30 fps,部分工具支援 60 fps 插幀 | 產品說明 |
| 推論時間 | 生成單幀或單位秒影片所耗計算時長 | 因模型與硬體差異極大;Sora 生成 1 分鐘影片在雲端端需數分鐘以上;輕量級模型在 A100 上可即時生成 | OpenAI Sora 技術報告, 2024 年 2 月;公開測評 |
| 單次續寫成本 | 呼叫模型生成影片的算力或 API 費用 | 各平台計費方式不同,部分按秒、按 GPU 時計費;Pika 免費版提供基礎生成額度;Runway 訂閱制,月費 15–95 美元(2025 年一季度) | 各平台官網 |
| 一致性指標 | FVD(Fréchet Video Distance)、FID、運動平滑度、物件帶 ID 一致性的平均 IoU 等 | 研究界尚未形成統一標準;主流論文中 FVD 用於衡量分佈接近度,數值越低越好;人類偏好研究 A/B test 正成為產品評估補充 | 學術文獻 |
| 可控性 | 支援控制條件的豐富度(文本、影像、運動軌跡、深度圖、語義圖等) | 運動筆刷、Camera Control、參考人物等成為產品標配功能 | Runway Gen-3, 可靈 1.5 官方介紹 |
說明:以上引數值會隨著模型更新而變化,並未窮盡所有產品;關於泛化效能、長影片一致性維持等深層能力,公開資料較少給出可橫向對比的標準化數值。
5. 技術路線
影片續寫技術路線可按核心架構、訓練策略和應用哲學劃分,當前主流路線及代表性工作如下:
-
擴散模型 + 時空卷積/注意力
代表:Stable Video Diffusion (Stability AI), Lumiere (Google), 即夢(字節跳動), 可靈(快手)。
優勢:生成質量穩定,畫面細膩,與前序幀結合自然,適合開源社群迭代。
侷限:長時一致性仍是難題,隨生成長度增加,物體漂移和形變風險上升。
進展:快手可靈 1.5 版本(2024 年 10 月)結合自研 3D VAE 和可控擴散架構,宣稱通過圖片和文本聯合引導可將單次生成延長至 2 分鐘,且支援續寫時的起點控制(來源:快手官方釋出)。 -
自迴歸 Token 序列建模
代表:VideoPoet (Google), Phenaki (Google)。
優勢:天然適配多模態混合輸出(影片+音訊),長序列理論上有累積知識優勢。
侷限:自迴歸誤差會隨生成長度累積,容易出現質量滑坡;訓練效率受限於 token 長度的二次方複雜度。
動態:該路線在產業應用中逐漸與擴散模型融合,如採用分層自迴歸先生成關鍵幀,再以擴散模型插值。 -
擴散 Transformer (DiT) 與世界模型
代表:Sora (OpenAI), 部分創業公司對標模型。
優勢:充分釋放 Transformer 的擴充套件性,可處理超長上下文,對物理規律有隱式理解,續寫場景更自然;有望統一文本、影像、影片、音訊等模態。
侷限:算力開銷極高,單次推論成本遠超其他路線;目前產品化程度受限於 API 定價與技術封閉性。
產業影響:OpenAI Sora 在 2024 年 12 月向 Plus/Pro 使用者開放,並限制生成數量,側面反映成本模型尚未適配廣泛商用(來源:OpenAI 官方公告, 2024 年 12 月)。 -
端到端影片壓縮與輕量化方案
為降低推論成本,部分廠商開發專有影片自編碼器將冗餘資訊大幅壓縮後再送入生成器。Apple、Meta 等巨頭也在 2024 年發表多篇關於高效影片擴散的論文,明確指向行動端部署願景。輕量級路線有望在未來 1-2 年推動影片續寫功能從雲端端向端側下沉。
整體看,技術路線從單純的擴散或自迴歸二分,走向融合時空 Transformer、世界模型嵌入和高效稀疏計算的綜合方向。業界共識是:誰能率先在可控成本下實現“幾分鐘級”的穩定續寫,誰就將贏得下一代影片創作工具市場。
6. 上游
影片續寫的上游由算力硬體、資料資源和基礎預訓練模型三部分構成,決定中下游的能力天花板。
-
算力硬體
訓練和推論影片生成模型極度消耗 GPU。主流硬體為 NVIDIA H100/H200/B200 系列,雲端上例項單價約 2–5 美元/GPU/小時(按 2024 年主流雲端廠商公開定價)。中國廠商中,華為昇騰 910B 已在部分國產大型模型訓練中得到採用,但軟體生態和影片擴散模型的適配尚不成熟。寒武紀、海光資訊等亦在追趕,公開資料未見影片續寫專用加速卡規模化出貨資料。 -
資料資源
高質量、多樣化、版權清晰的影片資料集是競爭力核心。當前主要訓練資料來源自 YouTube 等開放平台(如 Google 的 Video-Text 資料集 HowTo100M、YT-Temporal 等)、商業相簿(Shutterstock 等)以及影視素材庫。2024 年以來,資料版權爭議持續升級,部分資料來源要求模型訓練者付費。中國廠商擅長利用短影片平台的海量 UGC 資料進行訓練,快手可靈的技術優勢即部分源於快手主站數十億級短影片與對應的使用者標註(來源:快手官方技術分享,2024 年 7 月)。但資料授權範圍受限,基於 UGC 訓練的模型若用於外部客戶,可能引發法律風險。 -
基礎預訓練模型
開源生態中,Stable Video Diffusion、AnimateDiff、CogVideo(智譜 AI)等為中小企業提供了基座。北美方面,Stability AI 主導開放模型路線,但在 2024 年面臨財務壓力,開源版本更新放緩。中國方面,智象未來、騰訊(MuseV)均有開源影片生成及編輯模型釋出。2024 年 8 月,智源研究院開源 VideoGen 影片續寫架構,吸引開發者社群關注。產業上游另一個重要角色是雲端運算廠商,如 AWS、阿里雲端、火山引擎等,通過模型即服務(MaaS)提供微調與推論 API,間接降低下游公司的研發門檻。
上游集中度較高,輝達在算力環節處於絕對主導;資料資源方面,擁有社交媒體平台或影視版權庫的廠商具備持續領先優勢。
7. 下游
影片續寫的應用場景正處於早期爆發階段,滲透領域包括:
-
影視與廣告預演
導演和創意團隊利用續寫功能快速生成分鏡預覽、特技效果參考,降低實拍成本。部分獨立工作室已將 AI 續寫納入概念片製作管線,但尚未進入主流電影工業流程(來源:Variety 報道,2024 年 7 月)。廣告公司用於生成大量影片變體進行 A/B 測試,顯著縮短素材製作週期。 -
短影片與直播內容擴充
TikTok、快手、抖音等平台內的 AI 特效本質上隱含了影片續寫功能,如讓使用者上傳一段動作後自動生成後續舞蹈、轉場效果。2024 年雙 11 期間,部分電商主播已使用 AI 續寫技術為商品展示自動生成多段介紹影片,減少重複拍攝(來源:36氪報道,2024 年 11 月)。 -
電商與商品視覺化
電商平台利用續寫技術,僅憑一張商品圖片即可生成模特試用、場景展示的連貫影片。2024 年,阿里巴巴通義萬相、京東言犀等均釋出面向商家的影片生成工具,公開資料顯示已有數萬商家接入使用(來源:阿里雲端官方新聞,2024 年 9 月)。但續寫功能在複雜商品互動時偶發變形,產線級應用仍有距離。 -
遊戲與虛擬現實
遊戲行業正探索利用影片續寫動態生成遊戲過場動畫、NPC 的時序行為等,以降低資產產出成本。2024 年,微軟 Xbox 與 Inworld AI 合作,在遊戲內引入 AI 敘事生成,但公開影片續寫尚處原型階段(來源:微軟官方部落格,2024 年 3 月)。 -
教育與模擬
影片續寫被用於將靜態科學圖表延展為動態過程模擬,例如細胞分裂、機械運動等,已在部分線上教育平台試水。
總體而言,下游應用仍以“輔助創作”和“降低試錯成本”為主,距離替代專業影片製作還有很長距離。市場早期反饋顯示,使用者願意為影片續寫功能付費的意願正在逐步提升,Runway 和 Pika 的付費使用者數在 2024 年均有明顯增長,但具體財務數字未公開揭露。
8. 受益公司
根據在產業鏈中的角色,以下公司或機構可被視為影片續寫崛起的潛在受益者(僅作行業梳理,不構成任何投資建議):
-
上游算力供應商
NVIDIA(提供訓練與推論所需 GPU,2024 財年資料中心營收年增率增長超 200%,受益於 AI 影片大型模型訓練需求;來源:NVIDIA FY2024 年報)、AMD(MI300 系列加速卡)、華為昇騰(國產替代需求驅動,但影片續寫場景公開案例尚少)。 -
雲端服務廠商
亞馬遜 AWS、微軟 Azure、Google雲端、阿里雲端、火山引擎等均提供 AI 影片模型推論服務,伴隨影片續寫呼叫量增長而收益,具體營收歸屬無獨立揭露。 -
基礎模型與工具化企業
- Runway(未上市):Gen 系列模型是影片續寫與編輯領域的標杆,已完成多輪融資,2024 年估值為數十億美元級別(公開報道)。
- Pika Labs(未上市):以易用性切入,2023 年底快速攬獲使用者,2024 年獲新一輪融資,具體估值未見公開。
- Stability AI(未上市):開源 SVD 模型,但 2024 年遭遇管理層動盪和財務壓力,商業化前景不確定。
- OpenAI(未上市):Sora 產品涉及影片續寫,對算力需求拉動顯著,與微軟深度繫結。
- 字節跳動(未上市):火山引擎提供即夢 AI 等影片生成能力,剪映內建相關功能,受益於創作者生態。
- 快手(港交所:1024.HK):可靈大型模型成為國產標杆,2024 年 Q3 財報提及 AI 能力對創作者活躍度的提升,但未單列營收。
-
國內上市公司
- 萬興科技(300624.SZ):旗下萬興播爆、filmora 等影片軟體整合 AI 影片生成和續寫功能,2024 年半年報提及 AI 功能訂閱轉化率提升,具體貢獻未公佈。
- 當虹科技(688039.SH):從事影片處理技術,在傳媒行業提供 AI 影片增強、續寫方案,2024 年中標多個廣電專案,但 AI 續寫業務佔比未知。
- 拓爾思(300229.SZ):自然語言處理與大型模型技術向影片領域拓展,版面配置影片智慧分析與生成,尚無大規模商用報道。
以上公司均系基於公開資訊的產業關聯度梳理,未考慮估值合理性、股價表現等投資因素。
9. 市場規模
影片續寫作為高度垂直的技術功能,其獨立市場規模尚無權威第三方測算,均被包含在更寬泛的“AI 影片生成 / 編輯”市場內。可參考資料如下:
-
全球 AI 影片生成市場
Grand View Research 2024 年報告顯示,2023 年全球 AI 影片生成市場規模約為 5.5 億美元,預計到 2030 年將達到 21.7 億美元,2024–2030 年間複合年增長率(CAGR)約為 21.3%(來源:Grand View Research,2024)。市場涵蓋文生影片、影片續寫、風格轉換等多種細分。 -
中國 AI 影片生成市場
前瞻產業研究院 2024 年釋出的《中國 AIGC 產業全景報告》估算,2024 年中國 AI 影片生成市場規模約 42 億元人民幣,其中影視級與專業創作應用佔比不足 15%,其餘為短影片及營銷類應用(來源:前瞻產業研究院,2024 年 5 月)。但該資料為行業調研估算,口徑寬泛,“影片續寫”功能創造的獨立價值未被剝離。公開資料未見針對影片續寫的細分營收統計。 -
付費意願與工具訂閱
根據 Runway 和 Pika 公開的融資材料(PitchBook 報道, 2024 年 6 月),Runway 在 2024 年 ARR(年度經常性營收)接近 5000 萬美元,其中大部分來自影片生成與編輯工具訂閱,續寫屬於核心功能之一。Pika 在 2024 年初使用者量突破千萬級別,但未公佈付費轉化率和營收資料。快手可靈釋出後,國內測試使用者短時突破百萬人次,商業化程序尚在初期(來源:快手公開業績會,2024 年 11 月)。
綜合看,影片續寫市場仍處於非常早期,整體體量有限但增速極快,市場教育成本高,後續若企業級大規模採購興起,有望在 2026–2028 年迎來爆發,屆時獨立市場研究或將填補資料空白。
10. 玩家對比
下表對比截至 2025 年一季度全球影片續寫能力突出的產品及模型(僅展現公開資訊,不做橫向優劣評判)。
| 玩家 | 核心模型/產品 | 續寫時長上限 | 輸出解析度 | 條件控制 | 開源情況 | 特色能力 | 訪問方式與定價 |
|---|---|---|---|---|---|---|---|
| OpenAI | Sora(2024.12 上線) | 最長 60s | 最高 1080p | 文本、影像、影片 | 閉源 | 物理世界模擬較強,長影片一致性好 | ChatGPT Plus/Pro 使用者,有限生成配額 |
| Runway | Gen-3 Alpha / Turbo | 10s+(可拼接) | 4K(超分) | 運動筆刷、Camera Control、參考圖 | 閉源 | 專業影片編輯整合,多工具鏈協同 | 訂閱制,$15/月起 |
| Pika | Pika 2.0 | 約 8s | 1080p | 文本、圖片、相機運動 | 閉源 | 介面極簡,生成速度快,音效同步 | 訂閱制,含免費版 |
| 快手 | 可靈 (Kling) 1.5 | 2 分鐘(分段生成) | 1080p | 文本、圖片、影片開頭、控制風格 | 閉源 | 結合短影片平台海量訓練資料,運動幅度大且合理 | 國內免費公測,API 待開放 |
| 字節跳動 | 即夢(Jimeng) | 約 10s | 720p/1080p | 文本、圖片 | 閉源 | 與剪映深度整合,社群運營活躍 | 免費或會員制 |
| Google DeepMind | Veo(未全面開放) | 超 60s | 1080p+ | 文本、影像、影片 | 閉源 | 高保真,時空一致性突出 | 面向部分企業,未定價 |
| Stability AI | Stable Video Diffusion | 2–5s | 576×1024 至 1024×576 | 影像 | 開源(SVD 1.1) | 開源社群活躍,可自有微調 | 本地部署,需 GPU |
| 生數科技 | Vidu(閉源) | 16s | 1080p | 文本、圖片 | 閉源 | 一次生成 16s,速度快,國產合規 | API 付費呼叫 |
| 智譜 AI | CogVideoX | 6s | 720×480 | 文本 | 開源 | 國產開源,支援中文提示 | 開源及雲端端 API |
注:以上時長、解析度等為官方宣稱的最佳情況,實際生成長度受提示詞和算力限制可能不同;部分資料來源自各產品 2024 年 12 月至 2025 年 1 月的公開狀態;未列出所有創業專案。
11. 風險
影片續寫技術在商業化和社會層面存在多重風險:
-
技術成熟度風險
主流模型在超過 30 秒的長續寫中仍容易發生物體崩壞、身份漂移;物理規律模擬時好時壞,對複雜互動場景(如多人運動、精確物體操作)產線級可靠性不足。可控性雖提升但仍未達到廣告片和影視級的精確要求。Sora 雖展示驚豔效果,但在處理手腳細節、快速運動等場景時仍有明顯瑕疵(來源:OpenAI 公開文件,2024 年 12 月)。 -
成本與商業化風險
一次高質量續寫所需 GPU 時成本高達 0.5–5 美元(不同解析度、時長),對於 C 端創作者而言負擔重,對於 B 端大規模投放雖可接受但產出多樣性不足,導致價效比未必高於實拍+剪輯。訂閱營收難以支撐高昂的推論成本,多數工具仍處於燒錢階段。若硬體成本未顯著下降,短期內實現大規模盈利難度較高。 -
版權與法律風險
訓練資料中的影片版權歸屬不清是全球訴訟高發領域。2024 年,包括 Getty Images 等多家內容方對 AI 影片模型公司發起訴訟或要求有償許可。中國《生成式人工智慧服務管理暫行辦法》要求標註 AI 生成內容,但影片續寫生成品與原素材的版權界定尚屬灰色地帶。使用未經授權的素材進行續寫再分發,可能導致侵權連帶責任。 -
深度偽造與倫理風險
影片續寫是生成高模擬偽造影片的核心技術,可被用於製造假新聞、政治造謠、勒索等。2024 年,全球多國出現利用 AI 影片續寫和換臉合成進行電信詐騙的案例(來源:BBC 報道,2024 年 9 月)。儘管水印、檢測技術在發展,但攻防對抗難度大,社會危害不可低估。 -
生態同質化風險
基礎模型能力趨於相似,10 秒以內影片續寫的效果差距正在縮小,小公司若無差異化應用場景或專有資料,面臨生存壓力。2024 年已有多家 AI 影片初創公司關停業務或被併購。
12. 誤讀糾偏
圍繞影片續寫,行業內和投資者中存在若干常見誤解,需要澄清:
-
誤解 1:“AI 已經能像人一樣理解影片並續寫劇情”
事實:當前模型本質是基於統計模式匹配生成畫素,並不具備真正的理解或敘事推論能力。續寫出的內容雖然在視覺上可能連貫,但往往缺乏因果邏輯,尤其是在較長時間跨度下,行動的目的性、前後因果關係極易斷裂。所謂“世界模型”還遠未達到對物理規律的可靠模擬。 -
誤解 2:“影片續寫將立刻取代影片拍攝和剪輯”
事實:影片續寫目前更擅長填補創意缺口和製作高自由度輔助素材,對於需要精確表達、真人表演和現場實拍的商業影片製作,AI 的替代效應還很有限。行業共識是 AI 工具提升人效,實拍需求不會消失而是更聚焦高價值環節。 -
誤解 3:“Sora 或某款產品的釋出意味著影片生成已完全解決”
事實:Sora 展示了上限極高的可能性,但該產品的生成速度慢、成本高,且 OpenAI 明確表示當前版本在複雜物理互動上仍會出錯。任何模型的釋出都只是里程碑,而非終極解決方案。 -
誤解 4:“影片續寫的成本會迅速下降至接近零”
事實:雖然演算法和硬體效率持續提升,但高質量長影片生成對算力的需求依然指數級增長,降本曲線並不陡峭。在可預見的未來,專業級影片續寫仍將承擔較高計算成本,影響其平民化進度。 -
誤解 5:“開源模型足以滿足商業需求,不需要深耕專有技術”
事實:開源模型多針對學界通用場景設計,資料分佈、風格控制和長尾場景覆蓋有顯著侷限,直接用於商業產品需大量微調與合規投入。多數成功產品仍採用自研或深度定製的閉源方案。 -
誤解 6:“影片續寫市場規模巨大,很快會誕生千億市值公司”
事實:雖然想像力空間誘人,但市場教育、成本最佳化、法律合規等路徑漫長。2024 年獨立第三方並未給出影片續寫的可靠市場預測,所有數字均為整體 AI 影片市場估算,且該估算本身也在動態調整中。投資者需警惕過度樂觀敘事。
13. 最新事件
- 2024 年 12 月 OpenAI Sora 正式上線:向 ChatGPT Plus 和 Pro 使用者提供,支援從文本、影像和影片開頭生成續寫,單次最長達 60 秒。上線後因算力消耗巨大,生成配額一度緊張(來源:OpenAI 官方部落格)。
- 2024 年 11 月快手可靈 1.5 版本釋出:引入“運動筆刷”與更長的續寫能力,並通過圖生影片功能實現高質量延展。截至 2025 年 1 月,可靈已服務超過 500 萬用戶(來源:快手官方微信公眾號)。
- 2025 年 1 月 Runway 推出“Act-One”:允許使用者通過面部影片驅動角色動畫,並與影片續寫結合,實現人物表演的延展,進一步模糊真人拍攝與 AI 生成的邊界(來源:Runway 官網部落格)。
- 2025 年 2 月 Google DeepMind Veo 擴大測試:向Google雲端 Vertex AI 的企業客戶提供影片生成與續寫能力,解析度和時長均達到新高度,尚未公佈開放時間表(來源:Google Cloud Blog)。
- 2024 年 9 月中國版權協會發布《AI 生成影片版權服務展望(徵求意見稿)》:明確要求在續寫等衍生內容中標註原始素材和 AI 參與程度,對下游商用產生合規影響(來源:中國版權協會官網)。
- 2024 年 10 月多起 AI 影片生成公司裁員/關停:英國合成影片公司 Synthesia 裁減部分邊緣團隊;美國初創公司 Hour One 進行業務收縮,反映賽道早期淘汰加速(來源:TechCrunch, Business Insider)。
14. 追蹤指標
要持續追蹤影片續寫賽道演進,應關注以下指標與訊號:
| 追蹤維度 | 關鍵指標 / 事件 | 獲取方式 |
|---|---|---|
| 技術突破 | 頂級會議(CVPR, ICCV, NeurIPS)接收的論文;模型公開的 FVD / 人類偏好得分 / 長影片一致性測試結果 | 論文預印本、企業技術部落格 |
| 產品里程碑 | 主要產品續寫時長提升、解析度提升、新增控制功能(如運動筆刷、關鍵幀)的通知 | Runway、Pika、可靈、即夢等官方更新日誌 |
| 成本曲線 | 主流雲端廠商 GPU 例項價格變化;模型推論 API 的每千秒定價;研究界報告的每生成 1 秒影片功耗 | 雲端服務官網、學術論文附錄 |
| 商業資料 | Runway 等頭部公司的 ARR/使用者數揭露;傳統制片及廣告公司 AI 影片採購訂單;跨境電商 AIGC 工具滲透率 | 科技媒體(The Information, 36氪)、財報 |
| 監管與法律 | 中美歐關於 AI 生成內容標識、訓練資料版權的新規、判例;平台對深度偽造內容的打擊行動 | 官方機構網站、法律資料庫 |
| 人才流向 | 影片續寫核心研究人員及工程師的任職單位變動;開源社群貢獻活躍度 | GitHub Star 數變化、LinkedIn |
| 資料生態 | 高質量影片資料集的新發布或授權公告;版權訴訟案件數量及進展 | 資料集官網、法律新聞 |
| 產業投融資 | 影片生成領域融資輪次、金額、估值;上市公司在該方向的資本支出或研發投入佔比 | Crunchbase, PitchBook, 上市公司公告 |
15. 信源
本概念頁所引用的資料、事件、技術描述均基於截至 2025 年 2 月的公開資訊,主要來源包括:
- OpenAI Sora 技術報告及相關官方釋出(openai.com, 2024)。
- Stability AI 技術報告:Stable Video Diffusion(stability.ai, 2023)。
- Google DeepMind 論文:Lumiere、VideoPoet(arXiv preprint, 2024)。
- Runway Gen-3 Alpha 釋出公告(runwayml.com, 2024)。
- 快手可靈大型模型技術分享及公開資料(kwaishou.com, 2024)。
- Pika Labs 官方公告及產品日誌(pika.art, 2024–2025)。
- Grand View Research, “AI Video Generation Market Size, Share & Trends Analysis Report,” 2024。
- 前瞻產業研究院,《中國 AIGC 產業全景報告》, 2024。
- NVIDIA 2024 財年年度報告(nvidia.com)。
- 字節跳動火山引擎即夢產品介紹(volcengine.com, 2024)。
- 中國版權協會《AI 生成影片版權服務展望(徵求意見稿)》,2024 年 9 月。
- 科技媒體報道:The Verge, TechCrunch, 36氪, BBC 等在 2024 年間的多篇報道。
- 相關學術論文:AnimateDiff, CogVideoX, VideoPoet 等通過 arXiv 及 GitHub 公開的技術描述。
- Crunchbase 及 PitchBook 有關 AI 影片生成融資資料,截至 2024 年底。
特別說明:部分前瞻性陳述涉及不確定性,所有財務資料均標註年份與來源,缺乏公開獨立統計的細分市場已標明“公開資料未見”。本文僅作行業知識梳理,不構成任何形式的投資、法律或商業建議。