端雲端協同
3 秒看懂
端雲端協同不是把雲端上的大型模型直接塞進手機,而是讓終端和雲端端按照任務特性與即時條件動態分工——誰推論更快、更省電、更保護隱私,就讓誰多幹。本質是一套在時延、成本、精度、隱私的連續約束面上,做最優決策的分散式AI系統。
3 分鐘產業解釋
在智慧手機助手喚醒詞、汽車智慧座艙視線追蹤、工廠質檢相機這些場景裡,純雲端端推論意味著百毫秒級時延和頻寬成本,純終端推論又受限於算力,跑不動大型模型。端雲端協同的解法是把 AI 工作負載沿著終端、邊緣閘道器、中心雲端切分:輕量級特徵提取和即時響應留在端側,複雜語義理解或跨使用者知識聚合上雲端,彼此通過模型分割、知識蒸餾、聯邦學習等機制協作。
產業層面已形成金字塔式架構——底部是 MCU/SoC 上的小模型(<10M 引數),中部是邊緣伺服器上的中等模型,頂部是雲端上大型模型(數百億引數)。協同策略從最初的“雲端訓練+端推論”演進到“端雲端聯合訓練”“動態模型選擇”“任意時間退出(early exit)”,並由 TensorFlow Lite、PyTorch Mobile、ONNX Runtime、MindSpore 等架構提供工程支撐。巨頭關心的是:在保障隱私合規(GDPR/個人資訊保護法)的前提下,如何用端側資料持續最佳化全域性模型,同時把雲端上的推論成本攤薄。
15 分鐘專家深入
端雲端協同不是簡單把模型一分為二,它涉及三個層的聯合最佳化:
- 工作負載切分:決定模型哪幾層在端側執行,哪幾層上傳雲端。切分點受限於模型架構(如 Transformer 的 attention 層通訊量大,需謹慎)、網路頻寬/抖動和端側可用記憶體。業界主流方案包括基於 DNN 層級的先驗切分和基於神經架構搜尋的自動切分。
- 通訊與同步機制:端雲端間的互動可能是原始資料(隱私差)、中間層啟用(feature map)、梯度或模型引數。通訊協議從 REST/gRPC 演進到針對張量傳輸最佳化的 MQTT/QUIC。在弱網下,有失真壓縮、差分更新、稀疏化梯度等技術會介入。
- 協同學習範式:當允許多端資料參與訓練時,聯邦學習(FedAvg 及其變體)讓終端在本地更新模型,只上傳加密梯度;雲端側聚合後下發新全域性模型。若標記資料稀少,則通過雲端上大型模型生成軟標籤指導小模型(知識蒸餾),或者端雲端互相提供難例進行主動學習。
需要警惕一個陷阱:端側“小模型”不等於省事。為了在1W功耗以下跑即時目標檢測,需要量化為 INT8 甚至 INT4,結合硬體加速器(NPU/APU)的專用指令集。端雲端協同同時對軟體棧提出高要求:需要一套統一的推論引擎既能解析雲端上匯出的模型結構,又能針對端側數十種異構晶片做運算元融合和記憶體分配最佳化。
技術原理(最深層次)
端雲端協同的數學本質是一個帶約束的分散式推論最佳化問題。設總模型為函式 f,將其在層 k 處切分為 f = f_{cloud}^{(k+1:N)} \circ f_{edge}^{(1:k)}。最佳化目標為:
\min_k \; \big( \alpha \cdot \text{Latency}(x,k) + \beta \cdot \text{Energy}_{edge}(x,k) + \gamma \cdot \text{CommCost}(z_k) + \delta \cdot \text{AccuracyLoss}(x,k) \big)
其中 z_k 為第 k 層輸出的中間張量,\alpha,\beta,\gamma,\delta 為權重超參,x 為輸入樣本。不同場景這四個維度權重完全不同:智慧手錶健康預警看重延遲和功耗,幾乎不計通訊成本;工業缺陷檢測看重精度,可容忍一定延遲;輸入隱私敏感場景則要把 x 儘量留在端側,甚至對中間表徵施加差分隱私噪聲。
模型切分與動態推論圖 以典型的卷積網路或 ViT 為例,有兩種協同模式:
- 按層切分:端側執行前幾層卷積/embedding,雲端側執行全連線/自注意力層。例如,端側輸出低維特徵圖,經 JPEG 壓縮或特徵編碼後通過 5G/LTE 傳送。
- 多分支早期退出(Early Exit):端側除主幹網路外還有多個分類頭,當中間層置信度超過閾值時直接輸出,無需等雲端側響應。這樣簡單樣本(如區分貓狗)在端側 10ms 內完成,困難樣本(如醫療影像)上雲端處理。
[輸入]
|
┌─────────┐
│ 端側前處理 │ (歸一化/縮放)
└─────────┘
|
┌─ 卷積層1-3 ──> 分類頭1 (置信度>th1? → 早期退出1)
│ |
│ ┌────▼─────┐
│ │ 特徵壓縮 │ (量化/稀疏編碼)
│ └────┬─────┘
│ | 上行鏈路 (中間張量z)
│ ┌────▼─────┐
│ │ 雲端側主幹 │ (大型模型剩餘層)
│ └────┬─────┘
│ |
│ ┌────▼─────┐
│ │ 分類頭2 │
│ └────┬─────┘
└────> 融合決策 <─── 最終輸出
聯邦學習下的端雲端引數同步
雲端側全域性模型權重 w_g,每輪選擇 K 個終端,終端 i 經本地 SGD 得 w_i^{(t)},上傳 \Delta w_i。雲端側聚合:w_g^{(t+1)} = w_g^{(t)} + \frac{1}{K} \sum_{i=1}^K \Delta w_i。為克服統計異質性,可採用 FedProx(近端項)或個性化聯邦學習,允許終端模型部分層私有化不與雲端共享。
關鍵引數
- 端側模型規模:常為幾 KB 到幾百 MB,典型量化後模型執行記憶體佔用 < 500 MB [行業通用估算]。
- 通訊資料量:中間層張量經輕量壓縮後單次推論上行為 10-100 KB 量級,訓練梯度壓縮後單輪通訊量視模型大小可達 MB 級 [行業通用估算]。
- 端側推論延遲:理想狀態下 < 50 ms(對於即時影片應用),弱網/上雲端總延遲期望 < 300 ms [行業參考值]。
隱私與安全機制 中間表徵易受逆向攻擊,因此引入差分隱私(對梯度裁剪加噪)、安全多方計算(兩個非共謀伺服器協同聚合)或同態加密(端側加密梯度,雲端側在密文上聚合)。實際落地中,加密開銷沉重,更多采用本地差分隱私與安全聚合協議。
技術演進史
- 2015‑2017 · 萌芽期:以“模型壓縮”和“雲端推論”為主,TensorFlow Lite 和 Core ML 出世,主要解決模型能在手機跑起來的問題,協同思想初步體現為“訓練在雲端,推論在端”。
- 2018‑2020 · 協同推論成型:Google 提出神經網路架構搜尋(NAS)生成端側專用模型 MobileNet/EfficientNet,同時“模型分割”概念被學術圈深挖,DDNN (Dynamic Deep Neural Network) 等早期退出方案出現。聯邦學習因 Google 在 Gboard 上的應用而產業落地。
- 2021‑2023 · 系統化與平台化:華為推出端雲端協同計算架構(如 MindSpore 的端雲端協同學習),Apple Core ML 引入聯合訓練,微軟 Azure Percept 打通裝置到雲端的 AI 服務。聯邦學習從橫向擴充套件至縱向和遷移聯邦。通訊最佳化(梯度量化、稀疏化)與隱私聚合成為標準組件。
- 2024 至今 · 基礎模型驅動端雲端新範式:大語言模型、多模態模型讓端側部署變得極其吃力,催生了“雲端端生成候選,端側重排序”“提示詞蒸餾”等新協同形態。端側推論引擎開始支援 4 位量化、推測解碼(speculative decoding)用端側小模型預測大型模型輸出。
技術路線對比(量化表)
| 維度 | 純端側推論 | 純雲端端推論 | 端雲端協同(靜態切分) | 端雲端協同(動態退出) | 聯邦學習式端雲端協同 |
|---|---|---|---|---|---|
| 延遲 | 極低(1-50 ms) | 中高(100-1000+ ms) | 中等(10-300 ms) | 低-中(10-200 ms) | 訓練階段不敏感,推論與純端側一致 |
| 功耗 | 受限(1-5 W) | 無終端功耗(僅傳輸) | 取決於切分層,可調控 | 動態可調 | 訓練非同步進行,功耗分佈 |
| 隱私保護 | 高(資料不出裝置) | 低(原始資料上雲端) | 中(中間表徵可能洩露資訊) | 中(表徵出端) | 高(原始資料不出,梯度可加噪) |
| 模型精度 | 受限(小模型容量有限) | 最高(可執行大型模型) | 高(雲端側大型模型補償端側) | 高,且簡單樣本延遲更低 | 全域性模型精度接近集中訓練 |
| 模型更新 | 困難,需 OTA 升級 | 雲端端隨時更新 | 端側更新慢,雲端側即時 | 端側固定,雲端側即時 | 持續、增量更新 |
| 網路依賴 | 無 | 必須穩定低延遲 | 依賴上行鏈路,弱網容忍度差 | 弱網時可本地退出 | 非即時,可非同步上傳 |
| 主要架構/技術 | TFLite, ONNX, Core ML, DSP 加速 | TF Serving, TensorRT, Triton | PyTorch Mobile + 自定義 gRPC | BranchyNet, SDN | TensorFlow Federated, FATE, FedML |
注:延遲與功耗為典型智慧手機/嵌入式裝置估算值,具體數值取決於晶片製程、模型大小和網路條件 [行業通用估算]。
上下游
- 上游基礎設施:
- 端側晶片:智慧手機 SoC(高通 Hexagon NPU、Apple Neural Engine、華為 Ascend NPU)、汽車智駕晶片、IoT MCU(Arm Cortex-M 帶 Ethos-U NPU)——提供低功耗矩陣運算單元。
- 雲端側 AI 算力:GPU/TPU 叢集、AI 加速卡(需支援模型分割和流式推論)。
- 通訊設施:5G 蜂窩網路、Wi-Fi 6/7、邊緣閘道器(MEC)——提供低時延、確定性網路切片。
- 中介軟體與資料基礎:訊息佇列(如 MQTT broker)、邊緣 Kubernetes 平台、聯邦學習聚合伺服器。
- 中間平台與工具:
- 推論引擎:TensorFlow Lite, ONNX Runtime Mobile, NCNN, MNN, MindSpore Lite(需支援異構運算元相容、動態圖切分)。
- 聯邦學習架構:TensorFlow Federated (Google), FATE (微眾銀行), PySyft (OpenMined), FedML。
- 端雲端協同管理平台:如華為 ModelArts 端雲端協同,微軟 Azure IoT Edge,AWS IoT Greengrass 內建機器學習推論。
- 模型壓縮工具:量化、剪枝、蒸餾套件(TensorFlow Model Optimization Toolkit, Intel Neural Compressor)。
- 下游應用場景:
- 消費電子:語音助手(熱詞檢測→雲端端NLU)、手機攝影(預覽流端側增強,拍照後雲端端超分)、AR 導航。
- 汽車與自動駕駛:駕艙內 DMS/OMS 面部識別端側處理,V2X 場景與雲端端協同軌跡規劃。
- 工業網際網路:缺陷檢測(高速產線端側即時判定,疑難樣本上傳雲端端復判)、預測性維護(端側感測,雲端端模型訓練)。
- 醫療健康:可穿戴裝置心律監測本地異常檢測,長程資料雲端端分析及模型個性化。
關鍵指標
- 端到端延遲(End-to-End Latency):從感測器輸入到應用層獲得最終推論結果的時間,含端側推論、網路 RTT、雲端側推論。典型要求<300 ms(互動式應用)[行業通用參考]。
- 精度損失率:相較純雲端端大型模型推論的 top-1 精度,端雲端協同因壓縮/切分帶來的相對下降,通常要求在 1% 以內方可接受。
- 通訊開銷:單次推論上傳/下載位元組數;對於聯邦學習,每輪通訊的總梯度位元組數。
- 端側功耗增量:執行協同推論模組帶來的額外功耗(mW 或 mA),受 NPU 利用率和 DDR 傳輸主導。
- 隱私預算(ε):若採用差分隱私,其隱私損失引數 ε (常設為 1-10) 用於量化保護強度。
- 聯邦學習參與率與收斂速度:每輪實際參與終端比例、達到目標精度所需通訊輪數。
供需與市場資料
- 端側 AI 晶片出貨量:智慧手機 SoC、車載晶片與 IoT 控制器持續整合專用 NPU,使端側推論從旗艦裝置擴散到更廣泛的終端品類。本文不保留未鎖定來源的出貨量、增速或市場規模精確值。
- 端雲端協同平台採納:主要雲端廠商持續強化邊緣 AI 服務與裝置管理能力,公開材料更多體現產品迭代和客戶案例,尚不適合在此給出統一客戶增速口徑。
- 隱私法規驅動:GDPR 及《個人資訊保護法》使得使用者資料不能隨意傳至公有雲端,直接推動端雲端協同和聯邦學習需求。企業採用邊緣智慧時通常會把“資料不出域”和審計可控作為重要評估項。
- 供給端格局:推論引擎和聯邦學習架構目前由少數科技巨頭主導,但半導體廠商(如高通、輝達)正積極提供端到端軟硬體協同方案以鎖定開發者生態。
代表公司與資本對映
- 綜合雲端平台+端側作業系統廠商:Google (Android + TFLite + TF Federated + Edge TPU)、Apple (iOS Core ML + Neural Engine + Private Federated Learning)、微軟 (Azure 邊緣+ ONNX Runtime)、華為 (鴻蒙 + MindSpore + Ascend)。這類公司擁有從晶片到應用的全棧能力,協同最佳化空間最大。
- 獨立端側晶片及 IP 供應商:高通 (Hexagon NPU, AIMET 壓縮工具)、Arm (Ethos NPU IP)、聯發科 (APU)、恩智浦 (i.MX 系列帶 NPU)、地平線 (征程晶片+開發平台)。它們通過提供易用的模型部署工具鏈和端雲端協同中介軟體,擴充套件生態位。
- 聯邦學習與隱私計算平台:微眾銀行 FATE、OpenMined、FedML、同濟大學 FATE 社群等。致力於解決跨組織資料孤島的模型訓練,通常面向金融、醫療等強監管行業。
- 工業/汽車垂直方案商:特斯拉(影子模式 + 車載端推論 + 資料中心訓練,典型的端雲端協同自動駕駛)、西門子 (Industrial Edge)、博世 (AI 攝像頭 + 雲端端裝置管理)。它們將端雲端協同封裝進整體解決方案,轉化為客戶可直接部署的盒子。
- 一級市場觀察點:端雲端協同碎片化難題使自動切分編譯器、垂直領域聯邦學習平台、低功耗端側推論加速器等方向更容易被納入產業調研。
產業觀察邏輯
- 由硬到軟的傳導:端側 AI 算力(NPU TOPS)每兩年翻一番的成本曲線,直接擴張了端側可承載的模型容量,使得更多工能被切分到端。端側晶片 IP、相關 EDA 工具與端雲端協同滲透率存在產業相關性。
- 混合推論降本邏輯:對於擁有億級裝置的廠商(如短影片平台),將特效推論從雲端端移至端側,可節省數十%的 GPU 雲端成本。高效推論引擎與模型量化技術的商業價值取決於遷移規模、相容成本和端側體驗。
- 資料合規硬需求:在汽車、醫療、金融行業,資料駐留法規推動端雲端協同或聯邦學習,具備合規交付能力的“聯邦學習即服務”公司可能形成訂閱型營收模型。
- 碎片化風險:端側晶片種類上千,工具鏈相容成本極高。因此,跨平台中間層能力(如 ONNX Runtime 社群)是重要產業變數,單一繫結硬體的方案可能面臨天花板。
- 大型模型時代的新變數:正在崛起的“端側小語言模型 + 雲端端大語言模型”協同架構,可能催生新一代 AI 應用。端側模型廠商和高效模型分發平台需要從使用者體驗、成本結構和生態相容性三方面觀察。
常見誤讀糾偏
-
“端雲端協同就是簡單的模型減半,前幾層放端側,後面的上雲端。” 事實遠比此精細。切分點優選是一個帶約束的聯合最佳化問題,往往不是對半切。有些模型在第一個卷積層後輸出訊號已經高度抽象,適合上傳;有些 Transformer 的早期層注意力啟用稀疏,端側跑得動就多跑些。另外還有動態退出、跨層直連等架構,並非線性一刀切。具體切分層由 NAS 或效能模型在執行時依據裝置能力、網路狀況動態決策。
-
“聯邦學習可以完全保護隱私,梯度不洩露原始資料。” 即使不傳輸原始影像,梯度本身通過梯度反轉攻擊或對抗生成網路可重構出部分訓練資料(尤其對小批次)。所以真正的隱私保護需要結合差分隱私、安全聚合或同態加密。單純樸素的 FedAvg 在強隱私場景下遠不夠安全,且差分隱私加噪會降低模型精度,這是一對需要權衡的矛盾。商業宣傳中常被過度簡化。
學習路徑
- 入門:閱讀 Google AI Blog 上關於聯邦學習(2017)和 TensorFlow Lite 的原始介紹;理解邊緣計算基本概念。
- 核心原理:研讀論文《JointDNN: An Efficient Training and Inference Engine for Intelligent Mobile Cloud Computing Services》(2017)以理解切分最佳化;《BranchyNet: Fast Inference via Early Exit from Deep Networks》(ICLR 2017)理解早期退出。
- 聯邦學習:精讀《Communication-Efficient Learning of Deep Networks from Decentralized Data》(FedAvg) 及 FedProx 論文。
- 工程實踐:從 TensorFlow Lite Model Maker 和 Android NN API 開始建置端側推論 Demo,再用 PyTorch Mobile 或 TensorFlow Federated 模擬器跑通聯邦學習教程。
- 進階前沿:關注 NSDI、MobiSys、MLSys 會議上關於分散式推論系統和行動端大型模型部署的最新工作,以及《System for Federated Learning》綜述。
一句話總結
端雲端協同是破解智慧終端“弱而常線上”與雲端端“強但高延遲”二元對立的系統級解法,它以模型切分、動態推論和隱私安全為三根支柱,正在成為所有 AI 規模化落地的預設架構。
延伸閱讀與來源
- 《Edge Intelligence: The Confluence of Edge Computing and Artificial Intelligence》綜述論文,提供了端雲端協同的體系化分類。
- TensorFlow Federated 官方論文(Google, 2019)描述生產級聯邦學習系統設計。
- 微軟亞洲研究院《SPINN: synergistic progressive inference of neural networks over device and cloud》論文,展現了動態切分思想。
- 華為 MindSpore 端雲端協同學習白皮書(通過官方網站獲取)。
- 行業研究機構 Gartner 的《Edge AI 技術成熟度曲線》相關報告(摘要公開版),以及 IDC 的全球邊緣 AI 晶片預測。市場資料因口徑多樣,本文僅採用定性趨勢描述,具體數字請以最新購買的專業報告為準。