通用機器人
3 秒看懂
通用機器人(General-Purpose Robot)是一類具備多工執行能力、可跨場景自主適應的具身智慧代理。其核心目標不是完成單一預設工序,而是通過“通用大腦+標準化本體”實現一機多能、任務可切換、新技能可學習。
區別於傳統工業機器人的固定程式設計模式,通用機器人的本質是軟硬體解耦、能力可泛化:硬體本體提供通用的運動與操作平台,軟體定義機器人的技能邊界。使用者通過自然語言下達指令,機器人依賴多模態基礎模型理解意圖、分解任務並生成連續動作,無需人工示教或逐行程式設計。
當前產業處於功能驗證與小批次試產的早期階段。人形機器人是當前最受關注的形態路線,但通用性並不等同於人形——具備多模態感知、靈巧操作和自主移動能力的輪式雙臂平台,同樣是通用機器人的重要技術路徑。
核心驅動力來自三股力量:基礎模型(視覺-語言-動作大型模型)賦予機器人語義理解與泛化能力;模仿學習與強化學習讓機器人通過人類演示和試錯掌握精細操作;高效能驅動與感測硬體成本下探使本體從實驗室原型走向可量產的成本區間。
3 分鐘產業解釋
產業定位:從“第三隻手”到“第三個人”
傳統工業機器人是工廠的“第三隻手”,每臺專精一道工序——焊接、噴塗、碼垛,換一個任務就意味著重新程式設計甚至更換末端工具。通用機器人要成為“第三個人”:能聽懂自然語言指令、能看懂未結構化環境、能學會操作陌生物體、能在不同場景間遷移技能。
技術架構:三層遞進
技術實現上,通用機器人不再依賴精確座標程式設計,而是通過具身基礎模型將感知直接對映為運動控制。主流架構分為三層:
- 雲端端大型模型層:負責任務理解與規劃。收到“把桌上的Apple放進藍色托盤”後,大型模型將指令分解為導航至餐桌、識別Apple、抓取Apple、識別藍色托盤、放置等子任務序列。
- 邊緣多模態模型層:處理即時環境感知——3D目標檢測、6-DoF位姿估計、自由空間分割,為運動控制提供語義化目標座標。
- 本體控制層:完成亞毫米級關節執行,通常執行在MCU/即時SoC上,以1-10kHz頻率閉環控制力矩和位置。
商業進展與時間線
商業層面,特斯拉(Optimus)、Figure AI、1X Technologies是國際領跑者;中國陣營包括宇樹科技、傅利葉智慧、智元機器人、星動紀元等,普遍處於小批次試產與工廠/倉儲場景驗證階段。
產業共識的時間線判斷(據高盛2024年2月報告[1]及摩根士丹利2024年6月報告[2]):
- 2025-2027年:功能收斂與供應鏈打磨期,出貨量以千至萬臺計,主要落地汽車總裝、物流分揀等半結構化場景。
- 2028-2030年:硬體BOM下降至$2-3萬美元區間,進入商業零售、輕工業輔助等場景。
- 2030年後:若資料飛輪和可靠性問題得到解決,有望滲透家庭服務等高複雜度場景。
技術原理
感知-規劃-控制棧(經典分層架構)
經典機器人學採用模組化分層架構,每層職責分明:
┌──────────────────────────────────────┐
│ 雲端端大型模型(任務規劃層) │
│ 輸入:“把桌上Apple放進藍色托盤” │
│ 輸出:任務樹(導航→識別→抓取→放置) │
└──────────────┬───────────────────────┘
│ 子任務序列(非即時)
┌──────────────▼───────────────────────┐
│ 邊緣多模態模型(語義感知層) │
│ 3D目標檢測·位姿估計·場景分割 │
│ 輸出:Apple座標(x,y,z)、托盤位置 │
└──────────────┬───────────────────────┘
│ 目標位姿+力控模式指令
┌──────────────▼───────────────────────┐
│ 運動控制策略(即時執行層,MCU/SoC) │
│ 全身運動規劃·阻抗/導納控制·觸覺伺服 │
│ 輸出:關節力矩/位置指令 │
└──────────────┬───────────────────────┘
│ 力矩/位置指令 1-10kHz
┌─────▼─────┐
│ 關節執行器 │ 電機+FOC+力矩感測器閉環
└───────────┘
此架構的優點是可解釋、可嵌入安全約束,缺點是模組間存在資訊瓶頸,高層語義到低層控制的對映高度依賴人工設計的中間表示(如物體位姿、抓取點)。
端到端模仿學習(現代資料驅動架構)
近年來興起的端到端學習範式試圖打破模組隔離,直接從感知資料生成動作序列。代表性演算法包括:
- Action Chunking Transformer(ACT)[3]:將影像序列編碼後,用Transformer自迴歸地生成未來N個時間步的關節目標位置,形成“動作塊”,減少累積誤差。
- Diffusion Policy[4]:將動作生成建模為擴散過程,從噪聲逐步去噪為精確動作軌跡,在精細操作任務(掛衣架、拉鏈、插插頭)中展現超越傳統方法的穩定性和多模態表達能力。
訓練資料來自遙操作演示:操作員通過主手/外骨骼操控機器人完成指定任務,系統同步採集{多視角RGB影像, 關節位置/力矩, 末端力資料}作為訓練樣本。推論時,僅憑視覺輸入生成連續動作流。
端到端方法的核心優勢是不需要顯式3D幾何建模、無需物體CAD模型,能處理柔體、透明物體等高難度操作物件。核心短板是泛化高度依賴訓練資料的多樣性和規模,且輸出為“黑箱”動作序列,難以嵌入硬性安全約束。
混合架構(當前落地主流)
產業界現階段普遍採用混合路線:
- 上層任務規劃:呼叫雲端端多模態大型模型(GPT-4o、Gemini等)做語義理解和任務分解。
- 中層操作策略:用端到端模仿學習處理高維靈巧操作(如五指抓取、工具使用),因為傳統運動學在這類任務中建模困難。
- 底層全身控制:用模型預測控制或全身控制保證平衡、避障、接觸安全,將上層策略輸出約束在物理可行域內。
推論時延要求
各層級對即時性的要求有數量級差異(據公開技術文件[5]及行業實踐中揭露的典型數值):
- 雲端端大型模型任務規劃:>500ms,可接受非同步。
- 邊緣感知模型推論:30-100ms(視覺幀率同步)。
- 底層運動控制迴路:<10ms,典型1-5ms,以保證動態穩定和接觸安全。
關鍵引數
人形機器人典型規格(2024-2025年已公開產品)
以下引數基於公開產品手冊及技術演示中揭露的資料,涵蓋特斯拉Optimus Gen2、宇樹H1/G1、Figure 02、1X NEO等代表性平台。由於多數產品處於原型/小批次階段,資料仍在持續迭代,標註為“廠商標稱典型值”:
| 引數項 | 典型範圍 | 備註 |
|---|---|---|
| 身高/自重 | 160-180cm / 50-80kg | 人形仿生設計;1X NEO為170cm/75kg,宇樹H1約180cm/47kg |
| 全身自由度 | 40-60個 | 含雙靈巧手;單手3-6個主動自由度不等 |
| 移動速度 | 1.2-3.3 m/s | 宇樹H1標稱可達3.3m/s(奔跑),常規步行約1.2m/s |
| 單次續航 | 1-2.5小時(廠商標稱) | 電池容量約1-2.5kWh,實際續航高度依賴負載和動作強度 |
| 單臂負載 | 3-20kg | 雙臂協同可舉更重物體;Optimus Gen2標稱單臂約20磅(約9kg) |
| 末端重複定位精度 | ±0.1-0.5mm(估算) | 工業機械臂可達±0.02mm;通用機器人因柔性關節和輕量化設計犧牲了精度換取安全性和自由度 |
| 本體感知取樣率 | 關節力矩/位置 1-10kHz,視覺 30-90Hz,觸覺 100-1000Hz | 典型工業配置;觸覺感測器取樣率因方案而異(陣列式MEMS vs 逐點式) |
硬體BOM成本演進
BOM(物料清單,Bill of Materials)成本是決定通用機器人能否開啟市場的最核心變數。
- 2024年原型階段:單臺人形機器人BOM約$80,000-150,000(據產業鏈調研[2],不同構型和供應商差異大)。主要成本項依次為:關節執行器(電機+減速器+編碼器+驅動板)、力/觸覺感測器、計算平台(Jetson Orin/Thor級模組)、電池系統、精密結構件。
- 2025年行業目標:通過設計簡化和國產替代,將BOM降至$30,000-50,000。
- 量產目標(2028-2030年):特斯拉、Figure AI等均提出遠期BOM <$20,000的目標,前提是年產超10萬臺,核心零部件(行星滾柱絲槓、六維力感測器)成本較2024年下降超過50%。
訓練資料量級
“資料飢餓”是當前通用機器人能力提升的最大瓶頸。一個在特定環境(如某款冰箱前)完成泛化物體抓取和放置任務的端到端策略,大約需要以下資料投入:
- 單任務、單場景達到80%+成功率:約100-500小時遙運算元據(如Stanford ALOHA論文所展示規模[6])。
- 跨場景、跨物體達到穩健泛化:需數千至萬小時資料,且要求物體材質、幾何、光照有足夠覆蓋。
- 視覺-語言-動作(VLA)基礎模型預訓練:Google的RT-2和OpenVLA專案所用軌跡資料量級已經達到百萬至千萬級片段(Open X-Embodiment資料集當前公開約160萬條軌跡[7]),但這離覆蓋人類日常操作所需的多樣性仍有數量級差距。
技術路線
三種主流通用機器人技術範式
| 維度 | 端到端學習 (Figure AI, 1X, Physical Intelligence) | 分層模型+傳統控制 (多數工業派公司) | 模擬訓練+Sim2Real遷移 |
|---|---|---|---|
| 資料需求 | 海量真實人類演示資料,依賴遙操作工廠 | 中等規模真實資料+結構化場景知識 | 大規模模擬資料(成本低,可達億級步數),少量真實精調 |
| 感知-動作對映 | 單一神經網路(畫素/點雲端→關節力矩) | 感知→規劃→控制模組化,各層可獨立最佳化 | 模擬環境RL訓練策略→域隨機化遷移至實物 |
| 泛化能力 | 理論潛力最高,可處理非典型物體和複雜幾何 | 泛化受限於感知模組精度和規劃演算法假設 | 泛化受限於模擬-現實差距(觸覺、摩擦力、光照) |
| 安全性保障 | 黑箱系統,難以給出硬性安全邊界證明 | 可在規劃和控制層嵌入約束,驗證相對充分 | 需額外實物安全層,模擬中無法完全模擬接觸異常 |
| 代表方案 | Figure 02 + OpenAI VLM;1X NEO + 世界模型;Physical Intelligence的π0通用策略 | Tesla Optimus(部分視覺複用FSD,控制層自研);傳統機器人廠商轉型產品 | 宇樹H1/G1運動策略(Isaac Gym強化學習);ETH Zurich等學術方案 |
| 2025年成熟度判斷 | 實驗室操作成功率可達85-95%(抓取類任務);真實工廠非結構化操作<70% | 半結構化場景(如固定工位上下料)基本可用;依賴環境改造 | 運動控制(行走、奔跑)Sim2Real已成熟;靈巧操作仍有差距 |
路線判斷
2025年行業的主流選擇並非單純的“端到端”與“分層”之爭,而是在不同子系統採用不同範式:
- 運動控制(足式平衡+全身協調):基於強化學習在模擬中訓練的策略,通過域隨機化遷移至實物,已成為普遍做法。宇樹H1的人形行走能力主要依賴這一路線,其運動流暢性已接近真人。
- 導航與粗粒度物體搬運:傳統SLAM+路徑規劃+視覺伺服仍為主力,可靠性和可預測性滿足工廠要求。
- 靈巧操作(手指級精細動作):端到端模仿學習是目前唯一在複雜操作任務(繫鞋帶、疊衣物、插插頭)中展現可行性的路線,傳統抓取規劃在此類任務中長期停滯。
這意味著**“模擬預訓練泛性運動能力 + 遙運算元據驅動操作技能”的混合路線**,在可預見的未來最具工程可行性。
上游
核心零部件供應鏈全景
通用機器人的上游可拆分為執行、感知、計算、能源四大板塊。2024-2025年的供應鏈特徵是:部分核心零部件高度依賴海外供應商,國產替代正在加速但技術差距仍存。
執行器——關節的動力來源
- 無框力矩電機:瑞士Maxon、德國Faulhaber長期主導高階市場,其轉矩密度和可靠性被廣泛驗證。中國供應商鳴志電器、鼎智科技(江蘇雷利子公司)已推出對標產品,轉矩密度差距縮小至10-20%,但在數千小時連續執行壽命驗證資料上仍需積累。
- 空心杯電機:用於靈巧手微型關節驅動。Maxon和Faulhaber仍為第一梯隊;中國兆威機電、深圳拓邦等積極版面配置,2024年部分廠商進入送樣階段,客戶認證週期約6-12個月。
- 減速器:人形機器人主要採用諧波減速器(關節處,結構緊湊)和精密行星減速器(部分負載更大的關節),RV減速器因體積和重量較大,在移動人形機器人中應用少於工業機械臂。諧波減速器領域,日本哈默納科在精度保持性上領先,中國綠的諧波、來福諧波已經實現大規模國產替代,市佔率快速提升;行星減速器領域競爭充分,國產份額較高。
- 行星滾柱絲槓:用於將旋轉運動轉換為直線運動,是直線關節(如Optimus膝關節)的關鍵零件。技術壁壘極高,瑞士Rollvis、瑞典SKF/Ewellix長期壟斷。中國恆工精密、秦川機床、雙環傳動等已啟動研發和送樣,但截至2025年Q1尚未有被主流人形機器人廠商大規模採用的訊息(公開資料未見批次供貨公告)。此為產業鏈當前最受資本市場關注的彈性環節,因為一旦突破,單臺機器人可能用10-20根。
感測——賦予機器人觸覺與力覺
- 六維力/力矩感測器:安裝於手腕、腳踝,用於感知接觸力和力矩實現柔順控制和觸覺反饋。美國ATI Industrial Automation為高階標杆;中國宇立儀器(SRI)、坤維科技、海伯森等已在諧波減速器廠商和機器人本體廠中送樣並獲得部分批次訂單。2024年中國六維力感測器市場國產份額已達50%以上(據高工機器人2024年度報告),但高階醫療和航空航天級仍有差距。
- 觸覺感測器(電子皮膚):方案未收斂,MEMS壓阻式、電容式、光學式各有擁躉。美國Gelsight、日本XELA等有成熟產品;中國帕西尼感知科技(深圳)、他山科技(北京)等創新企業走在前列。目前電子皮膚的成本、耐久性和訊號一致性仍未達到量產要求,屬於早期版面配置象限。
- IMU(慣導單元):用於姿態估計與平衡控制。博世、TDK/InvenSense主導,國產深迪半導體等可替代,技術門檻相對較低。
計算與通訊
- 邊緣AI SoC:NVIDIA Jetson Orin/Thor系列為當前主流選擇(Thor算力可達2000TOPS,面向2025-2026年量產車型和機器人);高通Robotics RB5/RB6平台亦在爭奪設計份額;中國地平線征程系列正在向機器人領域拓展,征程6已官宣機器人應用規劃。計算平台的算力、功耗和即時性三者平衡是核心考量。
- MCU與即時控制:STMicroelectronics(STM32系列)、Texas Instruments(C2000系列)的即時MCU在關節控制器中仍佔據絕對主導,NXP、英飛凌亦參與競爭。國產MCU(兆易創新GD32等)在部分非安全關鍵關節中開始小批次測試。
- 通訊匯流排:CAN/CAN FD和EtherCAT為兩大主流。EtherCAT在即時性要求高的全身控制中優勢明顯,倍福(Beckhoff)主導協議生態;CAN在單關節組網中成本更低。
能源
高能量密度鋰電池(典型為21700或4680圓柱電芯陣列)是當前主流。電池Pack設計需兼顧容量、重量、散熱和安全。部分公司探索換電方案以延長線上時長,但未見行業統一標準。固態電池若在2027-2028年進入商業化,有望顯著改善續航痛點,但此為前瞻性判斷,具體時間表存在不確定性。
下游
短期落地場景(2025-2028):結構化與半結構化
1. 汽車與新能源製造 整車總裝線是公認的“第一戰場”。相比焊接、噴塗等已被專用裝置高度覆蓋的環節,總裝線上仍然存在大量依賴人工的柔性操作:線束插接、密封條安裝、內飾件裝配、螺栓擰緊與對齊。這些任務需要靈巧操作和一定的力控感知,但又不像家電維修那樣高度非標,環境相對可控。特斯拉Optimus率先進入自身工廠驗證即基於這一邏輯。寶馬與Figure AI的合作、賓士與Apptronik的試點也圍繞總裝線展開。
2. 物流倉儲 分揀、拆垛、卸貨是當前自動化滲透率尚低的環節。傳統自動化分揀依賴固定形狀和尺寸規則,面對混雜SKU、軟包裝、不規則物體時效率急劇下降。通用機器人“看什麼就能抓什麼”的能力在此場景有直接變現路徑。Amazon(Digit/Sparrow)、GXO Logistics(與Apptronik、Agility合作)已開始小規模試點。中國順豐、京東物流亦在關注該領域。
3. 資料中心與基礎設施運維 伺服器巡檢、硬碟更換、線纜插拔——這些任務在資料中心內是標準化且重複性高的操作,且對灰塵、震動敏感度低,適合機器人替代。1X Technologies的NEO即定位資料中心運維為早期商業化場景之一。公開資料顯示,部分頭部雲端服務商已啟動相關概念驗證專案。
中長期場景(2028+):服務與家庭
商品零售、酒店遞送、醫院陪護等服務業場景對機器人的社交互動、安全避障、長續航有更高要求,目前滲透接近零。家庭場景則被普遍視為“終極市場”,但當前面臨可靠性、成本、安全和使用者信任的多重屏障。摩根士丹利2024年6月報告[2]估計,家庭服務機器人大規模採用(超百萬臺年出貨)可能要到2035年之後。
需求驅動力
下游需求的根本動力並非“勞動力總量短缺”,而是製造業和物流業中重複性、體力要求高、勞動體驗差的崗位招工日益困難。日本、韓國、德國已進入深度老齡化,中國製造業工人平均年齡超過41歲(據第七次人口普查資料),年輕一代不願從事單調體力勞動的趨勢不可逆轉。通用機器人本質上是對“枯燥體力勞動”的替代方案,不是“取代人”,而是填補人已不願做的崗位缺口。
受益公司
按產業鏈層次及2025年公開進展梳理
注:以下公司為行業公開資訊的客觀呈現,不構成任何形式的投資建議或推薦。公司提及只反映其業務與通用機器人產業鏈的相關性,不代表未來業績或股價預測。
零部件層(“賣鏟子”)
- 綠的諧波(688017.SH):諧波減速器國內龍頭,2024年諧波減速器出貨量超20萬臺(據公司2024年業績快報),人形機器人專用型號已送樣多家頭部客戶。2025年擴產專案持續推進,規劃年產能提升至60萬臺。
- 鳴志電器(603728.SH):無框力矩電機和空心杯電機均進入人形機器人供應鏈驗證階段,已獲得部分客戶小批次訂單(據公司2024年半年報及券商調研紀要)。
- 恆工精密(301261.SZ):精密行星滾柱絲槓是其在通用機器人領域被市場關注的核心產品,截至2025年Q1處於研發和客戶送樣階段,尚未揭露批次供貨。公開資料未見明確量產時間表。
- 雙環傳動(002472.SZ):精密齒輪和RV減速器製造商,同時版面配置行星滾柱絲槓,2024年已公告與多個機器人廠商的技術合作架構。
- 柯力感測(603662.SH):六維力感測器已推出面向協作機器人的產品,人形機器人用型號在開發中。2024年年報揭露力感測器業務營收約2.3億元人民幣。
- NVIDIA(NVDA.US):Jetson和Thor計算平台作為通用機器人的核心“大腦”硬體,幾乎出現在每一款主流人形機器人公告中。2025年CES上宣佈推出Project GR00T人形機器人基礎模型和對應的Jetson Thor計算平台。
本體整合與作業系統層
- 特斯拉(TSLA.US):Optimus專案2022年AI Day首次展示粗糙原型,2023年底Gen2在靈巧手、行走能力和自重控制上進步顯著。2024年Q2業績電話會中,馬斯克重申千臺量產於2025年內的目標(內部工廠使用),遠期成本目標$20,000/臺。市場高度關注Optimus的實際交付節奏和成本控制進展。
- Figure AI(未上市):2023年以來累計融資超$7.5億,OpenAI、Microsoft、NVIDIA、Jeff Bezos等參投,估值$26億(據PitchBook資料)。2024年Figure 02與寶馬的工廠試點受到行業廣泛關注。Figure專注於端到端學習架構,OpenAI提供的視覺語言模型是其核心差異化。
- 1X Technologies(未上市):挪威公司,2024年獲EQT Ventures等領投的$1億B輪融資(據Crunchbase)。主打產品NEO為輪式人形機器人,強調柔和接觸、居家安全,採用無齒輪直接驅動方案和自研世界模型。與OpenAI亦有關聯(後者為早期投資方之一)。
- Apptronik(未上市):美國奧斯汀公司,Apollo機器人已與賓士、GXO Logistics達成試點協議。創始團隊來自UT Austin人本機器人實驗室,技術路線偏務實,關注工業物流場景。
- Agility Robotics(未上市):Digit機器人是專門為物流場景設計的雙腿機器人(非嚴格人形,無靈巧手),已與Amazon合作試點。2023年開設美國首個人形機器人工廠(RoboFab),年產能目標上首位。
中國本體公司(含未上市獨角獸)
- 宇樹科技:從四足機器人(Go2/B2)成功切入人形,H1和G1兩款產品以運動效能和價效比引起關注。H1的奔跑能力和動態平衡在中國人形產品中處於第一梯隊。2024年B輪融資數億人民幣(據36氪等媒體公開報道)。宇樹強調“價效比先”路線,G1售價申報低至$16,000。
- 傅利葉智慧:從康復外骨骼機器人轉型通用人形,GR系列先期瞄準康復輔助和工業輕量化操作場景。公司有多年力控和運動控制經驗積累,是中國康復機器人領域頭部企業。2024年完成D輪融資(據企查查/公司官網)。
- 智元機器人:稚暉君(彭志輝)創立,產品從靈巧手到雙足本體覆蓋完整,強調“本體+大腦”全套自研。已釋出遠征A1人形機器人。2024年完成A++輪融資,累計融資額超10億人民幣(據公開媒體報道)。
市場規模
行業口徑與預測分歧
免責宣告:以下所有市場規模預測資料來自投資銀行和行業研究機構公開發布的遠期估計,存在高度不確定性,實際市場規模可能與此處引用的預測有實質性差異。本段僅供讀者瞭解行業認知現狀,絕非確定性判斷。
通用機器人市場規模的定義尚未行業統一,部分報告以“人形機器人出貨量×均價”測算,部分以“軟體+硬體+服務”整體TAM(總可及市場,Total Addressable Market)測算。口徑差異導致各機構預測值之間不可直接比較。
- 高盛(2024年2月報告[1]):預計全球人形機器人市場規模在2030年達$60億,2035年進一步擴張至$240億;出貨量從2025年的數千臺增長至2035年的超100萬臺。高盛強調這項預測高度依賴”BOM成本降至$20,000以下”和”可靠性達到工業部署標準”兩個前提條件。
- 摩根士丹利(2024年6月報告[2]):對中國市場2030年人形機器人市場規模給出約$30-50億的預測,2035年有望擴張至$150億以上。報告指出,中國市場可能的加速器是政策支援(工信部、科技部相關政策已在制定中)以及製造業勞動力成本持續上升。
- MarketsandMarkets(第三方市場研究,2024):全球通用人形機器人市場2030年約$30億,CAGR超過50%。該機構口徑相對保守。
- 公開資料未見:IDC、Gartner等主流科技產業分析機構截至2025年Q1尚未釋出獨立的通用機器人市場預測報告,僅將其作為“智慧自動化”大市場的一部分進行定性討論。
市場規模驅動力與制約
驅動因素:全球製造業崗位空缺率上升(據美國勞工統計局資料,2024年美國製造業仍有超過60萬個空缺崗位);人口老齡化加深(日本65歲以上人口占比超29%);人形機器人政策支援升溫(中國工信部2023年釋出《人形機器人創新發展指導意見》)。
制約因素:當前BOM成本仍高於替代人力成本的回收週期(按$15萬/BOM和三年回收期計算,時薪需超過$25才有經濟性);可靠性(MTBF)離工業可接受標準差距巨大;通用操作成功率在真實環境下仍偏低;社會倫理和法規監管架構尚未建立。
玩家對比
2025年Q1主要人形機器人玩家核心指標對比
下表綜合企業公開揭露、第三方產品評估及行業報告資訊,力求客觀呈現各家相對位置。標註“公開資料未見”之處為截至2025年初未找到經核實的具體資料。
| 維度 | Tesla Optimus | Figure AI | 1X NEO | 宇樹 H1/G1 | 智元 遠征A1 | Agility Digit |
|---|---|---|---|---|---|---|
| 形態 | 全人形(雙足+雙手) | 全人形 | 輪式+雙臂 | 全人形 | 全人形 | 雙腿(鴕鳥腿)+無靈巧手 |
| 自由度(全身) | 公開資料未見詳細揭露,推測40+ | 公開資料未見 | 公開資料未見 | H1約27(不含手) | 49(含靈巧手) | 約20(無靈巧手) |
| 單臂負載 | Gen2標稱約9kg | 約10-15kg(公司演示) | 公開資料未見 | G1約3kg | 約5kg(A1標稱) | 約16kg |
| 行走速度 | 約1.2m/s(公開演示估算) | 公開資料未見 | 輪式不適用(室內約1.5m/s移動) | H1最高3.3m/s奔跑 | 約1.5m/s | 約1.5m/s |
| 靈巧手 | Gen2有11個自由度,觸覺感測器覆蓋 | 有靈巧手配置 | 五指靈巧手 | G1可選配靈巧手 | 自研靈巧手 | 無靈巧手(夾爪式) |
| AI架構 | 複用FSD視覺骨幹,其餘自研,計劃自研VLA | OpenAI VLM+自研端到端策略 | 自研世界模型+端到端 | 公開資料未見詳細AI方案 | 自研具身基礎模型 | 模組化感知+規劃 |
| 主要目標場景 | 汽車總裝,遠期家居 | 汽車/物流製造 | 資料中心運維/家庭 | 科研/輕工業輔助 | 工業輔助 | 物流搬運 |
| 進度(2025Q1) | 內部工廠驗證,千臺量產起步 | 寶馬試點,未揭露出貨量 | 資料運維試點 | 已對外出貨(數量未揭露) | 小批次交付 | Amazon倉庫試點 |
| 標稱售價 | 非賣品(內部使用),遠期目標<$20K | 未定價 | 未定價 | G1約$16K起 | 未公開 | 未公開 |
對比要點解讀
- 形態差異反映場景定位不同:1X選擇輪式(放棄雙足行走),因為其目標場景(資料中心、家庭)地面平坦,輪式移動效率遠高於雙足;Agility Digit放棄靈巧手而用簡單夾爪,因為物流搬運任務不需要精細手指操作。這驗證了一個核心判斷——通用性不等於人性,形態應該服務於場景而非為了仿生而仿生。
- AI架構透明度差異巨大:特斯拉和Figure在AI路線上揭露較多,而中國廠商在技術大會上更多強調硬體運動和結構創新,AI演算法方案公開細節有限。
- “先出貨”不等於“先有營收”:宇樹以科研市場為切入點向高校/實驗室出貨H1/G1,這一策略可以快速獲得使用反饋和訓練資料,但與工業領域的大規模商業部署有本質區別。
- 特斯拉的規模優勢假設只在量產後成立:特斯拉的成本優勢敘事建立在複用汽車供應鏈和Gigafactory經驗的基礎上,但這一優勢要到年產萬級時才可能顯現,在千臺級別並無成本優勢。
風險
技術風險
-
路線未收斂:端到端學習、分層控制、模擬遷移三條路線仍在競爭,沒有哪條已被證明可以同時兼顧泛化性、可靠性、安全性和成本。過早押注單一路線的公司可能面臨技術迭代帶來的研發沉沒成本。
-
資料飛輪能否轉起來的驗證空窗:通用機器人當前最核心的商業敘事是“資料飛輪”——先部署機器人收集運算元據、再訓練更強策略、再部署更多機器人形成正反饋。但截至2025年初,全球沒有任何一家公司展示了確實飛起來了的資料飛輪。這一邏輯在自動駕駛行業曾被廣泛信奉,但自動駕駛公司至今仍在努力實現真正閉合的飛輪。通用機器人的物理互動資料成本遠高於自動駕駛(需要遙操作而非僅駕駛記錄),飛輪邏輯的可行性是最大的單項不確定性。
-
安全性證明缺失:以神經網路生成末端連續力控動作的系統,難以用傳統軟體驗證方法證明其在所有可能場景下的安全行為邊界。在家用或人機緊耦合場景中,這一問題會顯著放大。
量產與供應鏈風險
-
行星滾柱絲槓等關鍵零件的產能瓶頸:行星滾柱絲槓目前全球有效產能有限,瑞士Rollvis、瑞典SKF/Ewellix擴產節奏慢,中國企業尚未進入大規模批次供貨。一臺人形機器人若用10-20根此類絲槓,當年需求達百萬根時(如出貨5-10萬臺),供應鏈瓶頸將顯著暴露。
-
BOM成本下降低於預期的風險:若核心感測器和執行器成本下降速度不及預期,整機價格停留在$5萬以上區間,則市場規模將遠低於當前樂觀預測。這依賴於國產替代進展和規模效應釋放,兩者都有不確定性。
市場與倫理風險
-
技術熱潮與實際需求錯配:2024-2025年的風險投資熱潮可能推高估值和預期,但下游應用場景的驗證仍然稀疏。如果2026-2027年工業驗證效果低於預期,行業可能經歷“幻滅低谷”。
-
監管與公眾接受度:勞動力替代可能引發社會抵制和政策干預,家庭場景中的隱私、資料安全、法律責任歸屬(機器人傷人的責任歸屬製造商?演算法方?操作者?)尚未在任何司法管轄區建立明確定義的法律架構。
誤讀糾偏
1. “通用機器人就是人形機器人”
這是最普遍的誤讀。通用性的定義是任務範圍的可擴充套件性和跨場景遷移能力,而形態是實現通用性的手段之一,不是目的。輪式雙臂平台(如1X NEO)、移動操作臂(如Boston Dynamics Stretch)、甚至一個可更換末端工具的AMR,都可以在特定場景集合中實現廣義的通用性。人形之所以受追捧,邏輯是人類世界設施為人類形態設計,仿人形遷移成本最低。但花大量成本讓機器人用雙腿在平地行走(而輪子效率高、可靠性高幾個數量級),是否真的是最優工程選擇,還遠遠沒有被證明。
2. “有了大型模型,機器人馬上就能做家務了”
這混淆了“語言層面的世界知識”和“物理世界中的操作能力”。大語言模型可以描述如何疊一件襯衫的步驟,但不代表它能控制機械臂的26個關節協同完成這一任務。將語言指令對映為對物理世界的即時力控動作,需要海量的遙運算元據訓練,而這一資料在大多數家務任務上幾乎為零。目前最前沿的VLA模型在已知家庭環境中抓取常見物體的成功率在85-95%,但“操作不熟悉的衣物”“開啟各種結構的櫃門”“應對地面上異形的玩具”等任務的成功率仍在實驗室級別(<70%甚至更低)。從“能用語言溝通”到“可靠物理執行”之間的鴻溝,是目前行業重大誤讀所在。
3. “模仿學習就是看影片學會的”
這是一個被部分媒體報道簡化後造成的誤解。目前模仿學習(Imitation Learning)指的核心手段是遙操作演示:操作員佩戴外骨骼或操縱主手,真實地控制每一個關節完成物理任務。系統採集的資料是{視覺+本體感覺+關節軌跡}的三元組,而非單純的影片。讓機器人僅憑觀看人類YouTube影片就學會操作,這在學術上被稱為“從人類影片中進行機器人學習”(Learning from Human Videos),目前仍處於非常早期的研究階段,距離實際應用存在巨大差距——主要瓶頸是缺少與視覺同步的精細關節動作標籤和接觸力資訊。
4. “通用機器人會大量消滅工作”
這一敘事的誤導在於把“自動化某些任務”等同於“消滅就業崗位”。歷史資料表明,生產力的進步通常消滅了特定崗位但創造了新的工作類別,且當下製造業、物流業、養老護理業面臨的尖銳問題是大量崗位招不到人而非“人太多”。把通用機器人定位為勞動力替代工具是對公眾焦慮的不必要觸發,更準確的定位是緩解勞動力結構失衡、在“人不願做”的領域提供輔助。
最新事件
2025年Q1(截至2025年2月):
- Figure AI宣佈終止與OpenAI的獨家合作(2025年2月,據Figure AI官方部落格):Figure創始人Brett Adcock宣稱內部端到端AI已取得重大突破,將於30天內展示“前所未有”的具身智慧水平。這一合作變數引發行業對其自主AI路線的廣泛討論。
- 1X釋出Neo Gamma(2025年2月,據1X官方新聞室):新一代輪式操作機器人在世界模型驅動的操作策略上實現了顯著進步,公開演示中展示了多種精細家務操作(疊衣服、使用吸塵器等),引發社群對“純資料驅動”路線的進一步關注。
- 輝達2025年CES重點展示機器人戰略:Project GR00T作為人形機器人基礎模型被置於核心位置,Jetson Thor宣佈2025年上半年量產。輝達CEO黃仁勳將“實體AI”(Physical AI)定位為繼大語言模型後的下一個AI浪潮。
- 宇樹H1春晚登臺表演(2025年1月):宇樹H1人形機器人在中國春晚節目中完成編隊舞蹈表演,成為首個登上春晚舞臺的通用人形機器人產品,極大地提升了公眾對該品類的認知度。
2024年H2:
- Tesla Optimus Gen2“自主分類”演示(2024年10月,特斯拉We Robot釋出會):Optimus在釋出活動中進行物品自主分類和簡單對話互動,但後續被部分媒體揭露現場有遠端遙操作輔助,真實的端到端自主完成比例存在爭議。這一事件也暴露了通用機器人在“無輔助真自主”水平的公開透明驗證上缺乏行業標準。
追蹤指標
對於關注通用機器人產業進展的讀者,以下指標比媒體報道和融資新聞更具實質性的訊號意義:
| 指標 | 當前基準(2025Q1) | 關鍵里程碑 | 觀測來源 |
|---|---|---|---|
| 基礎模型釋出節奏 | RT-2、Octo、OpenVLA、π0已公開 | 哪家率先發布真正面向工業可靠性的VLA開源/商用模型 | arXiv、公司技術部落格、頂會(CoRL/ICRA/RSS) |
| 行星滾柱絲槓國內量產節點 | 恆工精密等處於送樣階段 | 首份批次供貨合同的公告(若客戶為Tesla/宇樹/智元等頭部本體廠,訊號更強) | 上市公司公告(年度報告/重大合同公告) |
| 人形機器人實際出貨量 | 全行業2024年出貨估計1,000臺 | 10,000臺/年為行業真正起步閾值 | 公司財報、海關出口資料(如果單獨列類) |
| BOM成本下降速度 | 原型機$80-150K;宇樹G1標價$16K | 可靠工業等級整機<$30K,標誌著規模應用拐點臨近 | 供應鏈調研、零部件供應商報價趨勢 |
| 遙運算元據工廠規模 | 各家估計在數十至數百臺級別 | 單公司執行超1,000臺遙操作採集裝置,年採集百萬小時級資料 | 公司招聘資訊(遙操作員崗位數量)、工廠實地報道 |
| 工業驗證里程碑 | 汽車總裝試點(Tesla/BMW/Mercedes) | 主機廠公開宣佈擴大至第3條以上產線、或擴充套件至第2個廠區 | 汽車OEM數字製造/工業4.0釋出會 |
| 安全標準或法規草案出臺 | 無專用標準,引用工業機器人ISO 10218 | 首個針對性的人機協作安全規範或產品認證 | 各國標準組織(ISO/ANSI/國標委)公告 |
| 故障間隔時間(MTBF)公開資料 | 實驗室數百小時 | 廠商公佈可靠第三方測試>5,000小時的資料 | 公司技術大會/學術論文 |
信源
產業與投資報告
[1] 高盛(Goldman Sachs).《The Rise of Humanoid Robots: A Multi-Decade $6 Billion+ Market by 2030?》. 2024年2月.
[2] 摩根士丹利(Morgan Stanley).《Humanoid Robots: The Next Frontier — China’s Role in the Global Race》. 2024年6月.
[3] 高工機器人(GGII).《2024年中國力感測器行業發展藍皮書》. 2024年.
核心技術論文
[4] Zhao, Tony Z. et al. “ALOHA: A Low-cost Open-source Hardware System for Bimanual Teleoperation.” arXiv preprint, 2023. (提出了ACT演算法和ALOHA遙操作架構)
[5] Chi, Cheng et al. “Diffusion Policy: Visuomotor Policy Learning via Action Diffusion.” Proceedings of Robotics: Science and Systems (RSS), 2023.
[6] Brohan, Anthony et al. “RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control.” arXiv preprint, 2023. (Google DeepMind的VLA基礎模型里程碑)
[7] Open X-Embodiment Collaboration. “Open X-Embodiment: Robotic Learning Datasets and RT-X Models.” Proceedings of IEEE ICRA, 2024. (學術界最大的機器人操作軌跡開放資料集)
[8] Black, Kevin et al. “π0: A Vision-Language-Action Flow Model for General Robot Control.” Physical Intelligence Technical Report, 2024.
公司官方來源
- Tesla AI Day 202