應用層 開放閱讀

端雲端協同

Edge-Cloud Collaboration

概念 ID
edge-cloud-collaboration
更新時間
2026-05-29
來源數量
待補

端雲端協同

3 秒看懂

端雲端協同不是把雲端上的大型模型直接塞進手機,而是讓終端和雲端端按照任務特性與即時條件動態分工——誰推論更快、更省電、更保護隱私,就讓誰多幹。本質是一套在時延、成本、精度、隱私的連續約束面上,做最優決策的分散式AI系統。

3 分鐘產業解釋

在智慧手機助手喚醒詞、汽車智慧座艙視線追蹤、工廠質檢相機這些場景裡,純雲端端推論意味著百毫秒級時延和頻寬成本,純終端推論又受限於算力,跑不動大型模型。端雲端協同的解法是把 AI 工作負載沿著終端、邊緣閘道器、中心雲端切分:輕量級特徵提取和即時響應留在端側,複雜語義理解或跨使用者知識聚合上雲端,彼此通過模型分割、知識蒸餾、聯邦學習等機制協作。

產業層面已形成金字塔式架構——底部是 MCU/SoC 上的小模型(<10M 引數),中部是邊緣伺服器上的中等模型,頂部是雲端上大型模型(數百億引數)。協同策略從最初的“雲端訓練+端推論”演進到“端雲端聯合訓練”“動態模型選擇”“任意時間退出(early exit)”,並由 TensorFlow Lite、PyTorch Mobile、ONNX Runtime、MindSpore 等架構提供工程支撐。巨頭關心的是:在保障隱私合規(GDPR/個人資訊保護法)的前提下,如何用端側資料持續最佳化全域性模型,同時把雲端上的推論成本攤薄。

15 分鐘專家深入

端雲端協同不是簡單把模型一分為二,它涉及三個層的聯合最佳化:

  1. 工作負載切分:決定模型哪幾層在端側執行,哪幾層上傳雲端。切分點受限於模型架構(如 Transformer 的 attention 層通訊量大,需謹慎)、網路頻寬/抖動和端側可用記憶體。業界主流方案包括基於 DNN 層級的先驗切分和基於神經架構搜尋的自動切分。
  2. 通訊與同步機制:端雲端間的互動可能是原始資料(隱私差)、中間層啟用(feature map)、梯度或模型引數。通訊協議從 REST/gRPC 演進到針對張量傳輸最佳化的 MQTT/QUIC。在弱網下,有失真壓縮、差分更新、稀疏化梯度等技術會介入。
  3. 協同學習範式:當允許多端資料參與訓練時,聯邦學習(FedAvg 及其變體)讓終端在本地更新模型,只上傳加密梯度;雲端側聚合後下發新全域性模型。若標記資料稀少,則通過雲端上大型模型生成軟標籤指導小模型(知識蒸餾),或者端雲端互相提供難例進行主動學習。

需要警惕一個陷阱:端側“小模型”不等於省事。為了在1W功耗以下跑即時目標檢測,需要量化為 INT8 甚至 INT4,結合硬體加速器(NPU/APU)的專用指令集。端雲端協同同時對軟體棧提出高要求:需要一套統一的推論引擎既能解析雲端上匯出的模型結構,又能針對端側數十種異構晶片做運算元融合和記憶體分配最佳化。

技術原理(最深層次)

端雲端協同的數學本質是一個帶約束的分散式推論最佳化問題。設總模型為函式 f,將其在層 k 處切分為 f = f_&#123;cloud&#125;^&#123;(k+1:N)&#125; \circ f_&#123;edge&#125;^&#123;(1:k)&#125;。最佳化目標為:

\min_k \; \big( \alpha \cdot \text&#123;Latency&#125;(x,k) + \beta \cdot \text&#123;Energy&#125;_&#123;edge&#125;(x,k) + \gamma \cdot \text&#123;CommCost&#125;(z_k) + \delta \cdot \text&#123;AccuracyLoss&#125;(x,k) \big)

其中 z_k 為第 k 層輸出的中間張量,\alpha,\beta,\gamma,\delta 為權重超參,x 為輸入樣本。不同場景這四個維度權重完全不同:智慧手錶健康預警看重延遲和功耗,幾乎不計通訊成本;工業缺陷檢測看重精度,可容忍一定延遲;輸入隱私敏感場景則要把 x 儘量留在端側,甚至對中間表徵施加差分隱私噪聲。

模型切分與動態推論圖 以典型的卷積網路或 ViT 為例,有兩種協同模式:

  • 按層切分:端側執行前幾層卷積/embedding,雲端側執行全連線/自注意力層。例如,端側輸出低維特徵圖,經 JPEG 壓縮或特徵編碼後通過 5G/LTE 傳送。
  • 多分支早期退出(Early Exit):端側除主幹網路外還有多個分類頭,當中間層置信度超過閾值時直接輸出,無需等雲端側響應。這樣簡單樣本(如區分貓狗)在端側 10ms 內完成,困難樣本(如醫療影像)上雲端處理。
        [輸入] 
          |
      ┌─────────┐
      │ 端側前處理 │ (歸一化/縮放)
      └─────────┘
          |
 ┌─ 卷積層1-3 ──> 分類頭1 (置信度>th1? → 早期退出1)
 │         |
 │    ┌────▼─────┐
 │    │ 特徵壓縮  │ (量化/稀疏編碼)
 │    └────┬─────┘
 │         |  上行鏈路 (中間張量z)
 │    ┌────▼─────┐
 │    │ 雲端側主幹  │ (大型模型剩餘層)
 │    └────┬─────┘
 │         |
 │    ┌────▼─────┐
 │    │ 分類頭2  │
 │    └────┬─────┘
 └────> 融合決策 <─── 最終輸出

聯邦學習下的端雲端引數同步 雲端側全域性模型權重 w_g,每輪選擇 K 個終端,終端 i 經本地 SGD 得 w_i^&#123;(t)&#125;,上傳 \Delta w_i。雲端側聚合:w_g^&#123;(t+1)&#125; = w_g^&#123;(t)&#125; + \frac&#123;1&#125;&#123;K&#125; \sum_&#123;i=1&#125;^K \Delta w_i。為克服統計異質性,可採用 FedProx(近端項)或個性化聯邦學習,允許終端模型部分層私有化不與雲端共享。

關鍵引數

  • 端側模型規模:常為幾 KB 到幾百 MB,典型量化後模型執行記憶體佔用 < 500 MB [行業通用估算]。
  • 通訊資料量:中間層張量經輕量壓縮後單次推論上行為 10-100 KB 量級,訓練梯度壓縮後單輪通訊量視模型大小可達 MB 級 [行業通用估算]。
  • 端側推論延遲:理想狀態下 < 50 ms(對於即時影片應用),弱網/上雲端總延遲期望 < 300 ms [行業參考值]。

隱私與安全機制 中間表徵易受逆向攻擊,因此引入差分隱私(對梯度裁剪加噪)、安全多方計算(兩個非共謀伺服器協同聚合)或同態加密(端側加密梯度,雲端側在密文上聚合)。實際落地中,加密開銷沉重,更多采用本地差分隱私與安全聚合協議。

技術演進史

  • 2015‑2017 · 萌芽期:以“模型壓縮”和“雲端推論”為主,TensorFlow Lite 和 Core ML 出世,主要解決模型能在手機跑起來的問題,協同思想初步體現為“訓練在雲端,推論在端”。
  • 2018‑2020 · 協同推論成型:Google 提出神經網路架構搜尋(NAS)生成端側專用模型 MobileNet/EfficientNet,同時“模型分割”概念被學術圈深挖,DDNN (Dynamic Deep Neural Network) 等早期退出方案出現。聯邦學習因 Google 在 Gboard 上的應用而產業落地。
  • 2021‑2023 · 系統化與平台化:華為推出端雲端協同計算架構(如 MindSpore 的端雲端協同學習),Apple Core ML 引入聯合訓練,微軟 Azure Percept 打通裝置到雲端的 AI 服務。聯邦學習從橫向擴充套件至縱向和遷移聯邦。通訊最佳化(梯度量化、稀疏化)與隱私聚合成為標準組件。
  • 2024 至今 · 基礎模型驅動端雲端新範式:大語言模型、多模態模型讓端側部署變得極其吃力,催生了“雲端端生成候選,端側重排序”“提示詞蒸餾”等新協同形態。端側推論引擎開始支援 4 位量化、推測解碼(speculative decoding)用端側小模型預測大型模型輸出。

技術路線對比(量化表)

維度純端側推論純雲端端推論端雲端協同(靜態切分)端雲端協同(動態退出)聯邦學習式端雲端協同
延遲極低(1-50 ms)中高(100-1000+ ms)中等(10-300 ms)低-中(10-200 ms)訓練階段不敏感,推論與純端側一致
功耗受限(1-5 W)無終端功耗(僅傳輸)取決於切分層,可調控動態可調訓練非同步進行,功耗分佈
隱私保護高(資料不出裝置)低(原始資料上雲端)中(中間表徵可能洩露資訊)中(表徵出端)高(原始資料不出,梯度可加噪)
模型精度受限(小模型容量有限)最高(可執行大型模型)高(雲端側大型模型補償端側)高,且簡單樣本延遲更低全域性模型精度接近集中訓練
模型更新困難,需 OTA 升級雲端端隨時更新端側更新慢,雲端側即時端側固定,雲端側即時持續、增量更新
網路依賴必須穩定低延遲依賴上行鏈路,弱網容忍度差弱網時可本地退出非即時,可非同步上傳
主要架構/技術TFLite, ONNX, Core ML, DSP 加速TF Serving, TensorRT, TritonPyTorch Mobile + 自定義 gRPCBranchyNet, SDNTensorFlow Federated, FATE, FedML

注:延遲與功耗為典型智慧手機/嵌入式裝置估算值,具體數值取決於晶片製程、模型大小和網路條件 [行業通用估算]。

上下游

  • 上游基礎設施
    • 端側晶片:智慧手機 SoC(高通 Hexagon NPU、Apple Neural Engine、華為 Ascend NPU)、汽車智駕晶片、IoT MCU(Arm Cortex-M 帶 Ethos-U NPU)——提供低功耗矩陣運算單元。
    • 雲端側 AI 算力:GPU/TPU 叢集、AI 加速卡(需支援模型分割和流式推論)。
    • 通訊設施:5G 蜂窩網路、Wi-Fi 6/7、邊緣閘道器(MEC)——提供低時延、確定性網路切片。
    • 中介軟體與資料基礎:訊息佇列(如 MQTT broker)、邊緣 Kubernetes 平台、聯邦學習聚合伺服器。
  • 中間平台與工具
    • 推論引擎:TensorFlow Lite, ONNX Runtime Mobile, NCNN, MNN, MindSpore Lite(需支援異構運算元相容、動態圖切分)。
    • 聯邦學習架構:TensorFlow Federated (Google), FATE (微眾銀行), PySyft (OpenMined), FedML。
    • 端雲端協同管理平台:如華為 ModelArts 端雲端協同,微軟 Azure IoT Edge,AWS IoT Greengrass 內建機器學習推論。
    • 模型壓縮工具:量化、剪枝、蒸餾套件(TensorFlow Model Optimization Toolkit, Intel Neural Compressor)。
  • 下游應用場景
    • 消費電子:語音助手(熱詞檢測→雲端端NLU)、手機攝影(預覽流端側增強,拍照後雲端端超分)、AR 導航。
    • 汽車與自動駕駛:駕艙內 DMS/OMS 面部識別端側處理,V2X 場景與雲端端協同軌跡規劃。
    • 工業網際網路:缺陷檢測(高速產線端側即時判定,疑難樣本上傳雲端端復判)、預測性維護(端側感測,雲端端模型訓練)。
    • 醫療健康:可穿戴裝置心律監測本地異常檢測,長程資料雲端端分析及模型個性化。

關鍵指標

  • 端到端延遲(End-to-End Latency):從感測器輸入到應用層獲得最終推論結果的時間,含端側推論、網路 RTT、雲端側推論。典型要求<300 ms(互動式應用)[行業通用參考]。
  • 精度損失率:相較純雲端端大型模型推論的 top-1 精度,端雲端協同因壓縮/切分帶來的相對下降,通常要求在 1% 以內方可接受。
  • 通訊開銷:單次推論上傳/下載位元組數;對於聯邦學習,每輪通訊的總梯度位元組數。
  • 端側功耗增量:執行協同推論模組帶來的額外功耗(mW 或 mA),受 NPU 利用率和 DDR 傳輸主導。
  • 隱私預算(ε):若採用差分隱私,其隱私損失引數 ε (常設為 1-10) 用於量化保護強度。
  • 聯邦學習參與率與收斂速度:每輪實際參與終端比例、達到目標精度所需通訊輪數。

供需與市場資料

  • 端側 AI 晶片出貨量:智慧手機 SoC、車載晶片與 IoT 控制器持續整合專用 NPU,使端側推論從旗艦裝置擴散到更廣泛的終端品類。本文不保留未鎖定來源的出貨量、增速或市場規模精確值。
  • 端雲端協同平台採納:主要雲端廠商持續強化邊緣 AI 服務與裝置管理能力,公開材料更多體現產品迭代和客戶案例,尚不適合在此給出統一客戶增速口徑。
  • 隱私法規驅動:GDPR 及《個人資訊保護法》使得使用者資料不能隨意傳至公有雲端,直接推動端雲端協同和聯邦學習需求。企業採用邊緣智慧時通常會把“資料不出域”和審計可控作為重要評估項。
  • 供給端格局:推論引擎和聯邦學習架構目前由少數科技巨頭主導,但半導體廠商(如高通、輝達)正積極提供端到端軟硬體協同方案以鎖定開發者生態。

代表公司與資本對映

  • 綜合雲端平台+端側作業系統廠商:Google (Android + TFLite + TF Federated + Edge TPU)、Apple (iOS Core ML + Neural Engine + Private Federated Learning)、微軟 (Azure 邊緣+ ONNX Runtime)、華為 (鴻蒙 + MindSpore + Ascend)。這類公司擁有從晶片到應用的全棧能力,協同最佳化空間最大。
  • 獨立端側晶片及 IP 供應商:高通 (Hexagon NPU, AIMET 壓縮工具)、Arm (Ethos NPU IP)、聯發科 (APU)、恩智浦 (i.MX 系列帶 NPU)、地平線 (征程晶片+開發平台)。它們通過提供易用的模型部署工具鏈和端雲端協同中介軟體,擴充套件生態位。
  • 聯邦學習與隱私計算平台:微眾銀行 FATE、OpenMined、FedML、同濟大學 FATE 社群等。致力於解決跨組織資料孤島的模型訓練,通常面向金融、醫療等強監管行業。
  • 工業/汽車垂直方案商:特斯拉(影子模式 + 車載端推論 + 資料中心訓練,典型的端雲端協同自動駕駛)、西門子 (Industrial Edge)、博世 (AI 攝像頭 + 雲端端裝置管理)。它們將端雲端協同封裝進整體解決方案,轉化為客戶可直接部署的盒子。
  • 一級市場觀察點:端雲端協同碎片化難題使自動切分編譯器、垂直領域聯邦學習平台、低功耗端側推論加速器等方向更容易被納入產業調研。

產業觀察邏輯

  1. 由硬到軟的傳導:端側 AI 算力(NPU TOPS)每兩年翻一番的成本曲線,直接擴張了端側可承載的模型容量,使得更多工能被切分到端。端側晶片 IP、相關 EDA 工具與端雲端協同滲透率存在產業相關性。
  2. 混合推論降本邏輯:對於擁有億級裝置的廠商(如短影片平台),將特效推論從雲端端移至端側,可節省數十%的 GPU 雲端成本。高效推論引擎與模型量化技術的商業價值取決於遷移規模、相容成本和端側體驗。
  3. 資料合規硬需求:在汽車、醫療、金融行業,資料駐留法規推動端雲端協同或聯邦學習,具備合規交付能力的“聯邦學習即服務”公司可能形成訂閱型營收模型。
  4. 碎片化風險:端側晶片種類上千,工具鏈相容成本極高。因此,跨平台中間層能力(如 ONNX Runtime 社群)是重要產業變數,單一繫結硬體的方案可能面臨天花板。
  5. 大型模型時代的新變數:正在崛起的“端側小語言模型 + 雲端端大語言模型”協同架構,可能催生新一代 AI 應用。端側模型廠商和高效模型分發平台需要從使用者體驗、成本結構和生態相容性三方面觀察。

常見誤讀糾偏

  1. “端雲端協同就是簡單的模型減半,前幾層放端側,後面的上雲端。” 事實遠比此精細。切分點優選是一個帶約束的聯合最佳化問題,往往不是對半切。有些模型在第一個卷積層後輸出訊號已經高度抽象,適合上傳;有些 Transformer 的早期層注意力啟用稀疏,端側跑得動就多跑些。另外還有動態退出、跨層直連等架構,並非線性一刀切。具體切分層由 NAS 或效能模型在執行時依據裝置能力、網路狀況動態決策。

  2. “聯邦學習可以完全保護隱私,梯度不洩露原始資料。” 即使不傳輸原始影像,梯度本身通過梯度反轉攻擊或對抗生成網路可重構出部分訓練資料(尤其對小批次)。所以真正的隱私保護需要結合差分隱私、安全聚合或同態加密。單純樸素的 FedAvg 在強隱私場景下遠不夠安全,且差分隱私加噪會降低模型精度,這是一對需要權衡的矛盾。商業宣傳中常被過度簡化。

學習路徑

  • 入門:閱讀 Google AI Blog 上關於聯邦學習(2017)和 TensorFlow Lite 的原始介紹;理解邊緣計算基本概念。
  • 核心原理:研讀論文《JointDNN: An Efficient Training and Inference Engine for Intelligent Mobile Cloud Computing Services》(2017)以理解切分最佳化;《BranchyNet: Fast Inference via Early Exit from Deep Networks》(ICLR 2017)理解早期退出。
  • 聯邦學習:精讀《Communication-Efficient Learning of Deep Networks from Decentralized Data》(FedAvg) 及 FedProx 論文。
  • 工程實踐:從 TensorFlow Lite Model Maker 和 Android NN API 開始建置端側推論 Demo,再用 PyTorch Mobile 或 TensorFlow Federated 模擬器跑通聯邦學習教程。
  • 進階前沿:關注 NSDI、MobiSys、MLSys 會議上關於分散式推論系統和行動端大型模型部署的最新工作,以及《System for Federated Learning》綜述。

一句話總結

端雲端協同是破解智慧終端“弱而常線上”與雲端端“強但高延遲”二元對立的系統級解法,它以模型切分、動態推論和隱私安全為三根支柱,正在成為所有 AI 規模化落地的預設架構。

延伸閱讀與來源

  • 《Edge Intelligence: The Confluence of Edge Computing and Artificial Intelligence》綜述論文,提供了端雲端協同的體系化分類。
  • TensorFlow Federated 官方論文(Google, 2019)描述生產級聯邦學習系統設計。
  • 微軟亞洲研究院《SPINN: synergistic progressive inference of neural networks over device and cloud》論文,展現了動態切分思想。
  • 華為 MindSpore 端雲端協同學習白皮書(通過官方網站獲取)。
  • 行業研究機構 Gartner 的《Edge AI 技術成熟度曲線》相關報告(摘要公開版),以及 IDC 的全球邊緣 AI 晶片預測。市場資料因口徑多樣,本文僅採用定性趨勢描述,具體數字請以最新購買的專業報告為準。
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型