作者:公爵互聯社 牛金鵬
這個夏天,人形機器人行業的新聞是一條比一條炸。
天驕隊在機器人運動會上百米跑了8秒64,比博爾特的世界紀錄還快將近一秒;天卓隊1500米2分21秒64,人類3分26秒的紀錄被直接甩在身後。智元機器人第1.5萬台通用具身機器人6月正式下線,距離第1萬台下線還不到三個月。小鵬機器人首輪孖展超9億美元,投後估值63億美元。軟銀更狠,被曝出擬60億美元收購1X Technologies多數股權。
身體越來越強,價格越來越低,產量卻越拉越大。但你要是跟做機器人算法的工程師聊一聊,他們多半會嘆口氣:硬件現在真不缺了,缺的是數據。
這話聽着反直覺——都萬台量產了,還缺數據?缺。而且缺得厲害。
大語言模型能從GPT‑1迭代到GPT‑5.6,靠的是互聯網上免費的文本數據,網頁、書籍、論文、代碼,爬下來就能用。但機器人要的不是文字,是物理世界的真實交互——伸手抓一個杯子該用多大力,踩到一灘水的重心怎麼調,一個沒見過的工具怎麼上手。這些數據,互聯網上一條都沒有。
每一條都得讓機器人在真實世界裏親手做一遍。貴,慢,還容易壞。
行業現在集體撞上一堵牆:身體已經進量產時代了,大腦還在等米下鍋。
【大模型喝自來水,機器人喝瓶裝水】
機器人的數據饑荒,不是「數據不夠多」那麼簡單,是它從根上就和大模型不是一回事。
訓練大語言模型,數據從哪來?全網爬。Common Crawl一個公開數據集就有超過2500億個token的網頁文本,維基百科、GitHub、百萬冊圖書,全部免費下載。大廠之間拼的不是數據有沒有,是誰清洗得更乾淨、優質數據比例更高。數據是自來水,擰開龍頭就有。
機器人完全是另一套邏輯。
你想讓它學會抓杯子,給它看一萬張杯子的照片沒用。照片只告訴它杯子長什麼樣,不告訴它抓的時候手指怎麼彎、用多大勁、杯子滑了怎麼補。這些信息,只有讓機械手真的伸出去、碰到杯子、感受到阻力、完成抓取,才能產生一條有效數據。
一條數據,等於一次真實的物理操作。
操作一次多久?簡單抓取從感知到執行大概幾秒鐘。但要覆蓋不同形狀、不同材質、不同位置、不同光照下的抓取,學術界的估計是百萬級到千萬級的真實交互。
一千萬次抓取是什麼概念?一台機器人24小時不停,一次10秒,一天8640次,抓滿一千萬次要將近1200天,三年多。這還只是抓杯子一個動作。
而且機器人不是手機,它會壞。關節電機有壽命,減速器會磨損,機械臂高頻操作容易出故障。一台機器高強度跑數據,幾個月可能就得修一次,修的時候就是零產出。
大模型的數據是數字拷貝,邊際成本幾乎為零;機器人的數據是物理消耗,每一條都要花錢花時間。一個自來水,一個瓶裝水還得自己灌裝——這就是為什麼大模型兩年迭代三代,機器人的通用操作能力十年了還在實驗室打轉。
有個對比很說明問題。2023年10月,谷歌DeepMind聯合全球21家機構、34個學術實驗室,攢出了目前全球最大的開源真實機器人數據集Open X‑Embodiment,總共100多萬條軌跡,覆蓋22種機器人、500多種技能。聽着很多對吧?但分散到500多種技能上,平均每種技能不到2000條軌跡。而大模型那邊,光是一個Common Crawl就是2500億級別的token。兩個量級差了不止一百萬倍。
WRC 2026同期舉辦的具身智能專題論壇上,好幾位技術負責人在公開討論裏說了類似的話:現在算力不缺,算法框架也不缺,缺的是足夠多、足夠好、足夠多樣的真實物理交互數據。
【仿真救不了場】
真機採集又貴又慢,那用模擬器行不行?在電腦裏建個虛擬世界,機器人在裏面練,練好了搬到真實世界——行業管這個叫sim2real。
想法挺好,現實卻很骨感。
模擬器裏的世界是程序員寫出來的。一個杯子多重、摩擦力多少、表面粗糙度,全靠人工設。你設200克,真實杯子可能180克也可能250克;你設摩擦係數0.4,杯子沾了油可能就變成0.2。差一點,結果就差了很多。
最難的是接觸。機械手碰到物體那一瞬間,形變、摩擦、滑動、反作用力,這些在模擬器裏很難算準。學術界有個詞叫「接觸豐富操作」,意思就是只要涉及接觸,仿真就容易翻車。
結果就是:模擬器裏練一千萬次,成功率99%,搬到真機上一上手,成功率可能直接掉到30%。模擬器裏的杯子和真實的杯子,根本不是同一個東西。
其實行業裏不是沒有努力。英偉達的Isaac Sim、微軟的Mujoco、谷歌的DeepMind Control Suite,都是頂級仿真的平台。各家也在做「域隨機化」——模擬器裏把物體顏色、形狀、重量、摩擦係數隨機變,讓機器人見過各種杯子,指望到真實世界能泛化。
但域隨機化解決的是「見過很多種」,解決不了「真實世界有一種你沒見過的」。真實世界的多樣性是無限的,模擬器再怎麼隨機也是有限的。這個鴻溝,目前沒有哪家公司能填上。
WRC上有個細節很說明問題。不少展台的機器人演示分揀、疊衣服、操作工具,看着行雲流水。但你湊近了看,物品位置是固定的,光照是調好的,連物品本身都是挑過的標準件。你把東西挪個位置、換個牌子,或者讓觀衆隨便放一個上去,成功率就有可能立刻斷崖式的掉。
不是工程師不想做隨機測試,是隨機測試一上就翻車。翻來翻去,原因還是數據不夠——沒在足夠多變化的真實場景裏練過,遇到沒見過的就懵。
仿真能用來預訓練、能驗證算法,但替代不了真實數據。就像你在駕校模擬器裏開了一萬小時,真上路該緊張還是緊張,模擬器裏沒有真實的馬路殺手。
【一個死循環】
數據饑荒最讓人頭疼的地方,不是難,是它繞成了一個圈。
想讓機器人變聰明,需要大量真實場景的數據。想拿到真實場景的數據,得讓機器人先進到真實場景裏跑。想讓它進真實場景,它得先足夠聰明、能穩定幹活、不闖禍。但它不夠聰明,是因為還沒有足夠的數據。
要數據,要場景,要智能,要數據。轉一圈回來了。
大模型從來沒有遇到過這個問題。它爬數據的時候不需要先證明自己能寫文章,互聯網數據是開放的、免費的、誰都能拿。
機器人卻不行。工廠不會讓一台還不穩定的機器人上產線的,萬一撞壞設備、傷了人、耽誤生產,誰擔這個責任?家庭更不會買一台經常犯錯的機器人,打碎個陶瓷有可能比機器本身還貴重。
真實場景是有門檻的。你不夠好就進不去,進不去就拿不到數據,拿不到數據就永遠不夠好。
所以現在大部分公司的數據還停留在實驗室採集中,自己實驗室搭幾個標準場景,機器人反覆操作攢數據。但實驗室場景是有限的、標準化的,跟真實世界的多樣性比就是九牛一毛。
也有人試過遙控操作:人戴VR設備遠程操控機器人,人怎麼做機器跟着做,同時記錄數據。這樣採集速度比機器人自主學習快,質量也高,畢竟是人類專家在操作。
但遙控操作也有一個問題。貴,熟練操作員時薪不低還得培訓;慢,一個人一次只能操控一台;數據多樣性還是受限,操作員的動作就那麼多,真實場景的變化是無限的。更關鍵的是,遙控操作採的是「人怎麼操作」,不是「機器人怎麼自主操作」。機器人最終得學會自己決策自己執行,不能永遠跟着人類學。遙控操作能做冷啓動,解決不了規模化。
至少在公開信息裏,還沒有哪一家公司宣佈跑通了「低成本、規模化、高質量獲取真實物理數據」的閉環。大家都在圈裏打轉,誰先跳出來,誰就拿到下一個時代的入場券。
【幾條路,都還沒跑通】
死循環擺在這,行業不可能幹等着。目前能看到幾條思路,但每一條都還早。
最直接的是重資產堆量——要麼把機器人鋪到真實場景裏邊幹活邊攢,要麼自己建個「數據工廠」,幾百台機器24小時專門採集數據。前者受限於場景門檻,客戶不讓不穩定的機器進場,通常只能先從倉儲分揀這種半標準化場景切入;後者成本極高,而且「人造的真實」和「真實的真實」永遠有差距,你在工廠裏練了一萬種抓杯子,客戶廠裏那個杯子可能還是第一萬零一種。一萬台機器人聽起來很多,分散到無數場景和任務裏,每個場景分到的還是不夠。
另一條路是跨機構共享數據,谷歌的Open X‑Embodiment就是這個思路——三十多個學術實驗室把各自的數據湊在一起,100多萬條軌跡開源給全行業用。但問題也很明顯:貢獻者主要是高校和研究所,商業公司很少願意把核心數據拿出來共享;而且22種機器人硬件不同、傳感器不同、接口不同,數據格式不統一,用起來要做大量的適配。開源數據集能降低入門門檻,但解決不了商業公司的核心數據需求。
還有人想用大模型生成合成數據,真實數據不夠,讓大模型根據文字描述生成一段機器人操作的視頻軌跡拿來訓練。聽着有想象力,但目前還很早期。大模型生成的虛擬操作和真實物理操作之間同樣有鴻溝,而且大模型本身就沒怎麼見過真實物理交互,它腦補出來的東西可能從根上就不對。
幾條路,沒有一條被驗證跑通。所有人都知道數據是瓶頸,但沒有人找到低成本規模化解決的辦法。
【身體在軍備競賽,大腦在鬧饑荒】
回到開頭那個熱鬧的今天。
百米8秒64、1.5萬台下線、9億美元孖展、60億美元收購,這些新聞讀着讓人覺得人形機器人馬上就要爆發了。但你把視線從身體移到大腦,會發現另一個更安靜也更嚴峻的現實:運動能力一年一個台階,通用智能的進步速度遠沒有看起來那麼快。
原因不在算法,在數據。
VLA模型、世界模型、強化學習,這些框架這兩年進步確實大。但算法是菜譜,數據是食材,菜譜再精美沒有食材也做不出菜。現在菜譜更新到第三版了,食材還在等米下鍋。
這就造成一個很擰巴的局面:行業都在卷身體——關節數量、運動速度、負載能力、量產規模,因為這些看得見摸得着、好量化好宣傳。數據這種看不見摸不着、短期出不了成績的,反而投入不足。
但決定機器人能不能真正上班的,不是它跑多快,是它能不能在一個沒見過的場景裏自己想辦法把活幹了。這個能力,主要靠數據喂出來。
所以評估一家機器人公司,別隻看本體參數和量產計劃,該問的是:你們現在有多少小時真實交互的數據?採集成本和速度是多少?數據閉環跑通了嗎?這三個問題的答案,比自由度和百米速度更能決定這家公司三年後值不值錢。
不是頭部玩家就別卷身體了,供應鏈已經非常成熟,卷不過宇樹,也卷不過那些有大廠背書、能砸錢鋪量的玩家。找個垂直場景扎進去,把這個場景的數據喫幹榨淨,可能更聰明。通用數據大家都缺,但垂直場景的數據是可以靠深耕攢出來的。一個只做電力巡檢的機器人,在電力場景的數據量可能比所有通用機器人公司加起來都多,這就是壁壘。
往大了說,數據饑荒不是某一家的事,是基礎設施的問題。大模型時代有開源數據集、有數據標註的產業,機器人時代也需要一套物理數據基礎設施——標準化的格式、共享平台、低成本採集方案。誰能把這套建起來,誰就不只是一家機器人公司,而是整個行業的水電煤供應商。
【結束語】
2026年,人形機器人的身體已經足夠強壯了。
能跑贏博爾特,能跳過高台,能後空翻,能擰螺絲能端茶倒水。但你把它放到一個沒見過的房間裏,給它一個沒見過的工具,讓它做一件沒練過的事——它大概率還是會愣住,或者犯錯。
因為它的大腦,還沒見過足夠多的世界。
造身體的問題,供應鏈解決了。造大腦的問題,算法框架也基本清晰了。現在卡脖子的是最樸素也最難的一件事:讓機器人在真實世界裏,親手做足夠多的事,見足夠多的場面。
這是成本問題、規模問題、商業邏輯問題,也是接下來三到五年行業最需要啃的硬骨頭。
身體的軍備競賽大家都看得見,大腦的糧食危機才啱啱開始。
誰先解決數據問題,誰才真正擁有了機器人的大腦。在那之前,所有號稱「通用」的人形機器人,都還只是身體強壯、但沒怎麼見過世面的孩子。