Retentive Network(retentive-network,鏈式雲端鏈架構)
1. 3 秒看懂
Retentive Network(簡稱 RetNet,鏈式雲端鏈架構)是一套面向大型模型推論的系統級分散式協同方案,通過將推論任務按複雜度動態拆解為多個子任務,在“雲端端—邊緣節點—終端裝置”構成的層次化鏈路上接力執行,從而在成本、時延、隱私保護與資源效率之間尋求更優平衡。其本質不是單一硬體或模型,而是智慧排程驅動的鏈式推論網路。
2. 3 分鐘產業解釋
當生成式 AI 模型引數從數十億邁向數千億,完全依賴雲端端中心執行全量推論會面臨三座大山:推論成本急劇攀升、網路延遲難以滿足即時互動需求,以及敏感資料長距離傳輸帶來的隱私風險。Retentive Network 的思路是將一次複雜的 AI 推論請求(如長影片理解、高保真影像生成、即時多輪對話)切割成一個有向無環的任務圖,按照各子任務的計算量、延遲容忍度和資料依賴性,分配給不同層級算力。
- 高複雜度、大引數量的主幹計算仍由雲端端 GPU/加速器叢集完成。
- 中等複雜度、低延遲要求的特徵提取或中間層計算下沉到 5G 基站、區域資料中心、工業閘道器等邊緣節點執行。
- 隱私相關預處理、輕量推論或最終輸出渲染直接在使用者終端(手機、汽車、機器人)上的 NPU/CPU 執行。
這種“鏈式接力”不同於傳統的端上請求、雲端端響應模式,也不同於簡單的邊緣快取,其核心在於任務動態分割與跨層傳遞。從商業視角看,Retentive Network 可能催生新的推論服務商業模式——例如“按鏈服務”計價,而非單純按雲端端算力小時或 API 呼叫次數收費。它也是雲端邊端協同理念在超大型模型推論場景下的具體演進形態,與東數西算的算力網路、5G-A 的高可靠低延遲通訊等技術形成共振。
3. 技術原理
3.1 模型分割與任務圖生成
要實現鏈式推論,首先需要將大型模型的計算圖(Computation Graph)進行智慧分割。常見策略包括:
- 按層分割:將緊耦合的注意力層或全連線層部署於一個節點,適合 Transformer 類模型。
- 張量並行與流水線並行:將單層切分到多個節點,或讓不同層以流水線方式流轉,要求節點間具備高頻寬互聯,通常用於雲端端內部或高階邊緣叢集。
- 混合專家(MoE)路由拆分:將不同專家子網路部署在不同層級的節點上,由門控網路動態路由。
分割後生成的子任務構成一個有向無環圖(DAG),每個節點代表一個計算子任務,邊代表資料依賴和所需的中間張量傳輸。分割策略需同時最小化通訊總量並遵守各層級的算力與延遲約束。
3.2 鏈式排程引擎
排程引擎是整個架構的“大腦”,常用方法包括:
- 基於強化學習的動態排程:將即時網路狀態、節點負載、任務圖作為狀態,以最小化端到端延遲或總能耗為目標,訓練深度 Q 網路(DQN)或近端策略最佳化(PPO)模型,做出排程決策。
- 混合整數規劃(MIP):在中小規模部署場景中,利用求解器求全域性最優,但擴充套件性受限。
- 啟發式規則+線上學習:工業級實現常結合專家規則(如延遲敏感任務優先邊緣)與線上學習自適應調整。
排程引擎需要綜合考慮:各節點的當前 GPU/NPU 利用率、網路 RTT(往返時延)、可用頻寬、資料隱私標籤(某些中間層資料絕不可離開終端)等因素,決定子任務“在何處跑、跑多大精度”。
3.3 異構執行環境
- 雲端中心:採用 NVIDIA H100/B200 等旗艦加速器叢集或國產昇騰 910 系列,執行高精度核心推論(如生成式解碼、多模態融合)。
- 邊緣節點:部署中低功耗 AI 加速卡或邊緣伺服器,如 NVIDIA L40S、Jetson AGX Orin、華為 Atlas 500、寒武紀 MLU370 邊緣版等,執行 INT8/FP16 量化後的大部分隱藏層。
- 終端裝置:利用手機 NPU(如Apple A/M 系列、高通 Hexagon)、車載征程/Orin 晶片執行輕量級模型(通常經蒸餾或量化後壓縮至數 GB 以內)。
3.4 通訊與資料一致性
鏈上節點間的通訊直接決定整體延遲上限。技術手段包括:
- 張量壓縮與稀疏傳輸:通過高斯量化、剪枝、差分編碼等手段將中間啟用壓縮 5×–20×,減少頻寬佔用。
- 高速序列化協議:如 FlatBuffers、gRPC 流式傳輸,避免 JSON/XML 帶來的解析開銷。
- 非同步流水線與重計算最佳化:在通訊時允許後續節點提前啟動不依賴該資料的分支計算,或通過冗餘重計算避免傳輸中間結果。
- 安全與一致性:採用 TLS/加密通道,並結合區塊鏈或可信執行環境(TEE),保障鏈上傳遞的中間狀態不被篡改或洩露。
4. 關鍵引數
業界尚未形成統一的 Retentive Network 引數標準,但在各類技術方案與學術實驗中,以下引數對鏈路效能起決定性作用(部分資料來自公開白皮書與論文,口徑為實驗環境或設計目標):
| 引數 | 描述/目標範圍 | 備註/來源 |
|---|---|---|
| 模型分割粒度 | 運算元級/層級/塊級 | 粒度越細排程越靈活,但通訊開銷上升。目前實驗以層級為主流(公開文獻) |
| 端到端延遲增量(相比全雲端) | 目標降低 20%~50% | 對即時互動類應用,將延遲從雲端單程 80–200ms 壓至 10–50ms。例如邊緣節點協同可使畫質增強推論延遲降至 15ms(參考 ETSI MEC 用例白皮書 2022) |
| 節點間 RTT 要求 | 雲端↔邊 <10ms(理想) | |
| 邊↔端 <5ms | 5G URLLC 理論值 ≤1ms,實際部署視網路負載波動 | |
| 通訊壓縮比 | 5×–20× | 基於量化與稀疏編碼,部分精度損失可控(業界領先方案如輝達 TensorRT 的分散式推論演示) |
| 邊緣節點算力 | 10 TFLOPS(INT8)起 | 如 NVIDIA Jetson AGX Orin 達 275 TOPS(INT8),華為 Atlas 500 約 100 TOPS(INT8) |
| 系統能耗效率提升 | 較純雲端方案邊緣分擔後整體能耗可下降 15%~30% | 來源:華為《邊緣計算白皮書》及部分雲端廠商測試案例(實驗環境,非商用承諾) |
| 可支援模型規模 | 千億級引數 | 當模型過大而端側存不下全量,分割後邊緣可承擔部分引數,公開資料未見統一上限 |
注:凡未註明具體年份和獨立第三方審計的資料均來自廠商宣傳或學術實驗,可作為趨勢參考,不代表商用交付承諾。
5. 技術路線
目前產業鏈上實現分散式智慧推論存在多條技術路徑,Retentive Network 屬於其中系統性最強、排程最複雜的一類。
| 技術路線 | 代表架構/方法 | 特點與侷限 |
|---|---|---|
| 集中式雲端端推論 | 純 GPU 叢集,API 呼叫 | 模型完整性高,但延遲大、成本高、隱私風險集中 |
| 端側獨立推論 | 輕量化模型(如 MobileLLM) | 延遲極低、隱私好,但模型能力受限,無法執行重度生成任務 |
| 端雲端簡單協同 | 終端預處理後上傳雲端端推論 | 部分降低雲端端負擔,但無中間邊緣,延遲仍受雲端往返制約 |
| 聯邦學習/拆分學習 | 模型分割但非動態排程,梯度和中間結果僅在訓練期使用 | 重在隱私保護訓練,推論場景下靈活性不足 |
| 邊緣智慧閘道器 | 資料先過邊緣再上傳 | 減輕雲端端,但多是資料過濾而非模型級任務分割 |
| 鏈式雲端鏈(Retentive Network) | 動態 DAG 分割 + 雲端 邊 端三級排程 | 可平衡靈活性與效率,但系統複雜度最高,需強大的編排平台和全棧適配 |
當前技術發展呈現出“從兩層協同走向多層自適應鏈”的趨勢。國內外的算力網路試驗場(如中國移動“算力網路”試驗、華為“微秒級”算力排程架構)均在嘗試將模型推論任務跨地域遷移,Retentive Network 可看作其上層軟體架構的一種實現範式。
6. 上游:核心使能技術與元件
上游指為建置 Retentive Network 提供硬體、基礎軟體和連線能力的供應商,他們在產業鏈中奠定基礎設施。
6.1 AI 加速晶片
- 雲端端訓練與推論晶片:NVIDIA (A100/H100/H200/B200)、AMD MI300X、Intel Gaudi 系列、華為昇騰 910 系列。晶圓代工及 HBM 記憶體產能直接影響晶片供給,2024 年臺積電 CoWoS 先進封裝產能約 3.5 萬片/月(來源:臺灣經濟日報 2024 年 3 月),仍處緊缺狀態。
- 邊緣推論晶片/模組:NVIDIA Jetson Orin、Intel Movidius & Arc、高通 Cloud AI 100、華為昇騰 310/510、寒武紀 MLU370-S4、地平線征程 5/6、瑞芯微 RK3588 等。公開資料未見鏈式架構專用的邊緣晶片,主流產品均可被整合。
- 終端 NPU:Apple Neural Engine、高通 Hexagon、三星 Exynos NPU、華為達芬奇架構,以 TOPS/W 為競爭焦點。
6.2 通訊基礎設施
- 5G/5G-A 網路:高頻寬、低時延、網路切片能力是跨層傳遞中間張量的關鍵。截至 2024 年 6 月,中國 5G 基站總數達 391.7 萬個(工信部),為邊緣推論節點廣泛接入提供了物理基礎。
- 光網路與 SD-WAN:跨資料中心或雲端到邊緣的光承載網需提供 <1ms 時延抖動,SD-WAN 可動態選擇最優傳輸路徑。
- 時間敏感網路(TSN):在工業整合場景中保障確定性低延遲。
6.3 基礎軟體與虛擬化
- 邊緣原生編排:KubeEdge、OpenYurt(阿里雲端開源的邊緣 K8s)、SuperEdge、華為 KubeEdge 等,使容器化推論任務可被排程到邊緣節點。
- 輕量執行時:WebAssembly、unikerne,適合資源受限的終端或邊緣微服務。
- 位置與上下文感知排程:需擴充套件 Kubernetes 排程器,支援基於延遲和算力的親和性策略。
7. 下游:核心應用場景與牽引力
7.1 智慧駕駛與車路協同
L4 級自動駕駛要求端到端決策延遲 <20ms(部分場景需 10ms 以內)。單車算力無法完全承載全量感知規劃,鏈式雲端鏈將全域性規劃置於雲端端,區域性推論與車輛控制交由邊緣 RSU(路側單元)和車端晶片協同。2024 年,國內多個智慧網聯示範區已部署百餘臺路側邊緣計算單元(來源:各地政府公開報道)。
7.2 工業視覺與物聯網
工廠產線日均產生 TB 級影像資料,百萬級缺陷樣本需毫秒級響應。鏈式架構下,粗篩與簡單分類由產線邊緣伺服器完成,極具複雜的復判上傳雲端端高精度模型,減少 80% 以上的資料上行頻寬佔用,同時滿足資料不出園區的安全要求。
7.3 即時互動與 AIGC 消費級應用
雲端遊戲、AR 導航、即時字幕/翻譯等場景要求推論延遲 <15ms。終端 NPU 執行部分渲染/後處理,邊緣節點完成核心生成推論,雲端端作為輔助進行更復雜的 AIGC 生成。2024 年部分手機廠商的端雲端協同大型模型助手(如榮耀、小米揭露的模式)已顯其端倪。
7.4 醫療影像與隱私敏感場景
醫院要求患者資料不離開本院。可將敏感預處理和分割模型放在院內部署的邊緣推論一體機上,僅匿名化特徵向量上傳至雲端進行群體分析,滿足 GDPR/《個人資訊保護法》等合規要求。
8. 受益公司
以下基於公開資料梳理可能受益於鏈式分散式推論趨勢的公司,不構成任何投資建議,不意味著這些公司實際推出名為 RetNet 的產品。
| 層級 | 代表公司(部分) | 受益邏輯簡述 |
|---|---|---|
| AI 晶片設計 | NVIDIA、Intel、AMD、華為海思、寒武紀、地平線 | 下游邊緣推論節點建設直接拉動邊緣 AI 晶片和加速卡需求 |
| 通訊裝置/運營商 | 華為、中興通訊、中國移動、中國電信、中國聯通 | 提供 5G/5G-A 網路、MEC 節點、算力網路,是鏈路傳輸與邊緣節點的實際運營方 |
| 雲端運算與平台 | 阿里雲端、華為雲端、騰訊雲端、百度智慧雲端、AWS、Microsoft Azure、Google Cloud | 提供模型訓練、推論容器、編排排程平台和全棧分散式推論服務,是該架構生態核心 |
| 邊緣計算解決方案 | 研華科技、凌華科技、浪潮資訊、中科曙光、聯想 | 生產邊緣伺服器、工控機、AI 推論一體機,整合邊緣側硬體 |
| 中介軟體與開源生態 | 阿里(OpenYurt)、華為(KubeEdge)、LF Edge 等 | 提供邊緣編排與協同排程基礎軟體,降低整合門檻 |
| 行業數字化服務商 | 海康威視、大華股份、西門子、Siemens Industrial Edge | 在安防、工業等領域推動雲端邊端協同 AI 落地,實現應用場景價值閉環 |
注:公開資料未發現以“Retentive Network”為註冊商標或獨立產品品牌進行運營的上市公司,相關業務多以“邊緣AI”“分散式推論”“算力網路”命名。
9. 市場規模
目前尚無任何權威機構直接統計“Retentive Network/鏈式雲端鏈架構”的獨立市場規模,但以下幾個高度相關的市場預測可定量說明其潛在空間。
- 全球邊緣AI市場(硬體、軟體、服務):根據 SNS Insider 2024 年 6 月釋出的報告,2023 年全球邊緣 AI 市場規模約為 185 億美元,預計到 2032 年將達到 1436 億美元,複合年增長率(CAGR)約 25.9%。該口徑包含用於邊緣推論的晶片、推論軟體與相關服務。
- 全球邊緣計算支出:IDC《全球邊緣計算支出指南》(2023 年 7 月版)顯示,2023 年全球邊緣計算支出預計為 2080 億美元,2026 年將增至 3170 億美元,其中“人工智慧與分析”是增長最快的用例之一。(注:該資料含硬體、軟體、服務及連線支出,部分支出用於非推論場景)
- AI 推論即服務市場:Allied Market Research 2023 年報告指出,2022 年全球 AI 推論即服務市場規模約 52 億美元,預計 2031 年可達 682 億美元,CAGR 33.1%。Retentive Network 有望成為該服務的一種高階實現形式。
- 中國邊緣計算市場:中國信通院《邊緣計算發展白皮書(2023 年)》引述資料稱,2022 年中國邊緣計算市場規模約 1100 億元,2025 年預計達到 1600 億元。其中,與 AI 推論相關的雲端邊協同軟體及服務佔比逐年提升。
- 產能與上游供應:台積電先進封裝產能、HBM(高頻寬儲存器)在 2024 年仍為緊俏資源,限制高階雲端端和邊緣 AI 晶片出貨量;中國大陸成熟製程的邊緣推論晶片(如 28 nm/12 nm)產能相對寬鬆,公開資料未見具體產能瓶頸資料。
10. 玩家對比(代表性雲端邊協同 AI 推論平台)
以下對比基於 2024 年 Q3 各廠商公開產品文件與官方釋出,不代表功能完全可比,實際能力以商業交付為準。
| 廠商/平台 | 核心推論平台與服務 | 模型分割與鏈式協同支援度 | 邊緣節點硬體生態 | 開源編排架構 | 備註 |
|---|---|---|---|---|---|
| 華為雲端 ModelArts | ModelArts + 邊緣節點(Atlas/IEF) | 支援模型壓縮、量化後在邊緣部署,公開報道中有多級協同演示;落地案例以視覺為主 | Atlas 500/900、昇騰 310 等 | KubeEdge(發起者) | 強調“端-邊-雲端”協同,公開資料未見通用的 DAG 動態排程產品化 |
| 阿里雲端 | PAI + Link IoT Edge + 雲端邊協同架構 | 提供面向特定場景的端雲端協同(如通義聽悟),模型自適應切分在學術界有合作論文;商業化落地為規則配置為主 | 無自有邊緣晶片,相容輝達、Intel 等;邊緣閘道器產品 | OpenYurt | 以雲端原生方式管理百萬邊緣節點,動態鏈式推論待標準化 |
| 騰訊雲端 | TI-EMS + 邊緣計算平台 ECM | 能力集中在邊緣推論模型下放,動態分割與鏈式傳遞未見大規模商用,有端雲端協同語音/視覺方案 | 支援 NVIDIA Jetson 等,邊緣一體機 | SuperEdge(與騰訊相關) | 側重遊戲、媒體場景的即時渲染聯動 |
| 百度智慧雲端 | 百度 AI 中臺 + 邊緣推論引擎 | 以 EasyDL 邊緣部署和飛槳 Paddle Lite 為主,公開資料顯示有初步分層推論探索,未有專門 “鏈式” 方案 | 相容鯤鵬/昇騰等,邊緣伺服器 | Baetyl | 優勢在工業質檢等場景的端雲端一體,推論鏈待豐富 |
| AWS | Amazon SageMaker Edge Manager + AWS Wavelength + AWS Outposts | 可將模型部分層部署於本地 Outposts 或 Wavelength 邊緣,部署層級可達 3 級(Region/邊緣/本地),但任務分割需使用者手動設計 | NVIDIA/Intel/自研 Inferentia | - | 全託管體驗好,動態細粒度排程目前更多依賴客戶自行實現 |
| Microsoft Azure | Azure AI + Azure Stack Edge + Azure Arc | 提供 Azure AI 容器並可部署至 Azure Stack Edge Pro,支援 FPGA 加速;Azure Arc 可管多雲端邊緣,但推論鏈粒度較粗 | Intel VPU, NVIDIA GPU | 部分開源 | 重點在混合雲端一致性管理,完整 DAG 排程公開資料未見 |
| NVIDIA | Fleet Command + Triton Inference Server + CUDA | Triton 支援多節點模型推論和模型流水線,結合 Fleet Command 可管理邊緣部署,提供底層工具但排程平台由夥伴建置 | Jetson、A2、DGX 等自身全系列 | - | 生態強大,“拆解+排程”多由第三方或雲端廠商完成 |
結論:在 2024 年的時間點上,大部分廠商尚處於“邊緣部署 + 規則排程”階段,全自動、細粒度的動態鏈式雲端鏈排程大多停留在實驗室或小範圍試點。
11. 風險
11.1 系統複雜性與運維成本
引入多級動態排程會使監控、日誌、故障定位的難度指數級上升。一個節點的網路抖動或算力爭搶可能導致整個推論鏈超時。運維團隊需要同時理解模型結構、網路拓撲和排程演算法,人才稀缺。
11.2 標準化不足與生態碎片化
當不同雲端廠商和晶片商採用私有的任務表示、排程協議和介面,異構節點間難以互通。若企業後續希望跨平台排程,可能被鎖定在單一供應商生態內,阻礙技術擴散。
11.3 安全與信任邊界擴大
模型中間結果在鏈路中傳遞,增加了中間人攻擊、模型竊取和梯度反推隱私的可能性。即使在加密通道內,邊緣節點被物理入侵也會導致中間資料洩露。法律層面,推論結果錯誤後的責任歸屬(排程引擎、算力供應商還是應用方)仍無明文規定。
11.4 成本效益的不確定性
實現 Retentive Network 要求企業同時投資邊緣 AI 硬體、高速專線、專用排程軟體和專業人員,其總擁有成本(TCO)是否明顯優於集中式雲端端或多地分散式雲端推論,需要逐用例核算。在推論負載相對穩定且網路質量高的場景中,鏈式架構可能無法體現優勢。
11.5 供應鏈依賴
高階雲端端推論晶片和部分邊緣加速晶片供貨週期長,若特定節點晶片停供或斷貨,可能影響整個架構的交付。
12. 誤讀糾偏
誤區一:“Retentive Network” 就是微軟 RetNet 保留網路 微軟研究院 2023 年提出名為 “Retentive Network (RetNet)” 的新型神經網路架構,旨在替代 Transformer 以支援大語言模型訓練。這與本文所述的 鏈式雲端鏈分散式推論架構 Retentive Network 完全是兩個維度——前者是模型層面的運算元創新,後者是系統層面的部署與排程架構。二者名稱恰巧一致,但在產業討論中需明確區分。
誤區二:這就是雲端邊端協同的另一個稱呼 雖然雲端邊端協同是基礎,但