專題:2026世界機器人博覽會(WRC)AI大模型賦能機器人與具身智能產業新範式交流活動

2026世界機器人博覽會(WRC)於8月19-23日在北京亦創國際會展中心舉行。「AI大模型賦能機器人與具身智能產業新範式專題活動」在博覽會同期舉辦。貝塔無限聯合創始人兼CTO陶帥出席並演講。
以下為演講實錄:
陶帥:大家好!我是來自貝塔無限的陶帥,很高興能有這個機會來分享一下我們在具身技術方面的一些思考。
我今天的主題是「以人為中心-面向人機共融場景的具身技術新範式」。
我們知道AI和大模型下一階段的繁榮肯定會走出手機、走出螢幕,然後進入到我們真正的物理世界,AI+機器人可能是我們這個時代最大的Beta的增長紅利。
2026年,今年大家定義成是具身場景的元年,其實對於具身的落地場景,在千行百業是有非常多的應用場景,包括文娛的表演、進廠的生產力的提升,當然對於貝塔無限來講的話,我們自己聚焦的場景是在泛消費級場景,我們核心的定位是服務於人的生活而不是替代人,最終想做人有用的機器人夥伴。所以這裏面核心兩個點,一個點是有用,就是要能做事,第二個就是機器人夥伴,就是你要理解這個場景、理解人。
稍微解釋一下,後半句是我們覺得具身整體的場景,它整體呈現的形態還是群山並立的一個形態,它不是一個單方往上攀登的一個階梯。這個怎麼理解呢?我們覺得整個具身不同的場景,其實它的每一個場景都足夠複雜,它底層場景的差異性和邏輯對上層技術棧全棧能力的需求也是不一樣的,尤其對於泛消費級場景,它是需要一套原生的技術範式,而不是說之前有的時候聽到某些場景是另外一個場景的前置訓練場,不是說我們攀登到一座高峯之後,另外一座高峯我們就自然達到峯頂了。
對於具身整體的場景,我這邊會劃分為兩大部分:
第一部分,我們整體是圍繞「任務」來展開的,是以任務為中心的具身技術的這套範式。在這套範式之下,整體的環境相對來講還是標準化的,面向的SKU可能也就是幾十個,可能多的也就幾百個,整體的任務我們是單點,目標就是把任務的準確率、節拍還有可靠性給做上去。
第二部分,是以「人」為中心,也就是說你整個環境是有人生活的,人生活的這種環境它是沒有劇本的,沒有辦法預設,所以你面向的是一個開放型的場景,你真正要在人生活的這個場景裏面發揮出機器人的長期價值,你要做的也是這種長程的複雜任務,它不是這種單點的重複。
這裏面場景的差異性其實對於具身從上層到底層整個技術棧的要求,也是一套完全不一樣需求,它是一套全新的技術棧的重構,舉個例子,對於大腦來講的話,我們任務的這種場景驅動它要求的是強確定性,它可能對泛化能力的要求沒有那麼高,而且指令的話基本是一些確定性的幾套工序的指令。
對於這種以人為中心場景,這種泛消費級場景,我們要求機器人的大腦一定對這個場景、對人有很好的記憶能力,你才能發揮出你整體的作用。比如說你需要適應動態變化的環境,你這個模型需要有強泛化,包括你要考慮到人機交互。人的指令是模糊指令,它不是相當於非常精準的能描述到你中間的每一步,包括長程複雜任務的編排。從大腦到小腦、到操作系統、到數據,也就是說到本體本身,可能都要考慮這種人機的交互、人機的這種友好,以及我們這種開放編排的生態。
對於貝塔無限來講的話,我們從第一天開始,我們自己的定位就是聚焦在有人生活的泛消費級場景,所以我們整個的技術範式從底層到上層也是圈套原生適配在消費級的這套技術範式,這套技術範式核心有三個關鍵詞:
1、千人千面,我們覺得我們具身的大腦在這個場景裏面一定有很好的記憶和世界觀。記憶就是說我們需要有全時空多模態的空間記憶、時序記憶以及對人的記憶,世界觀就是說我們要對這套動態環境的變化有很好的適應性。
2、自主演進,我們一直在期待具身智能技術ChatGPT的時刻,我們覺得大家靠這種前置的數採或者我們建一些數據的採集場,即便是我們現在分發一些無本體的異構數採,它也僅僅是第一步,它未來如果要達到類似於現在大模型的這種智能能力,整個物理世界所需要的數據量一定是非常非常大的,它可能是幾個數量級的提升。這套技術能力我們認為它未來唯一的一條路徑一定是來自於部署狀態的數據飛輪的自閉環,然後能把整個數據的範式持續地累加起來。另外一方面,我們需要模型在這套數據範式下面能有持續演進的能力、持續學習的能力。所以自主演進是我們從上層技術棧裏面非常關注的另外一個核心的體系。
3、人機友好性,我們覺得這套技術體系裏面它一定要考慮人機友好性,從你的操作系統、從你底層的本體設計上來講的話,你一定要考慮到人生活的這個環境,你要去主動的感知、主動的做任務的編排,你的本體設計要考慮人機交互的安全、人機的友好,以及對於消費者極具的性價比。
這三套體系基本上在我們整個技術棧裏面,我們覺得要交付一個完整的解決方案,或者說讓消費者比較滿意一套機器人產品的話,這三者是缺一不可的,它沒有辦法說獨立一個產品我們能夠把這個事情給做好。
首先,我們覺得在我們這套技術棧裏面,第一個核心的關鍵基座是記憶,我們覺得記憶是機器人真正的從單一工具能夠走向生活、邁向智能夥伴不可或缺的一個關鍵技術能力。具身的記憶其實跟我們現在常講的Agent這種記憶還有非常不一樣的地方,首先第一點,具身機器人在這個環境裏面它是多模態的感知,它整個傳感器的維度是非常豐富的,它有自己的視覺、有聽覺,當然底層也有你的動作經驗、歷史的記憶能力,所以它整體的記憶是比較立體,時空關係比較綜合,動態變化的一套記憶體系。
從框架上來講的話,它核心是要解決幾個問題,第一個就是你存什麼?第二個就是你存下來的這套記憶系統怎麼跟你的大腦去做融合?跟你的大腦是做松耦合還是緊耦合?怎麼做記憶的演進?第三個就是說這個記憶怎麼去評估?你需要有一套反饋系統來調教你的記憶和你的整個網絡參數,我們就構造了一套基於真實世界物理反饋的個性化Reward系統,基於強化學習的技術來閉環、來調整我們整體的記憶存儲和演進,以及說跟大腦之間的耦合。
這套系統我們之前在真實的環境裏面也測試了一些典型的任務,從用戶的體驗角度來講的話,它相當於說跟一個精於記憶的機器人增加了海馬體。這套記憶加持之下的用戶體驗是有非常大的提升的,我們有些家庭裏面常用的一些任務,包括找東西,包括一些空間記憶的找可樂,包括精細物品的尋找(找鑰匙),它能自主通過它獲取的記憶能編排到你這個空間裏面的位置關係,然後來編排你具身整個任務的盤擬。
這裏面(見PPD)第三個我可以解釋一下,這裏面它也通過視覺的方式,可能完全沒有見過這個物品,它結合它的記憶、結合它對這個環境裏面過去的認知做實時的(39:02英),然後也能大概推斷出來,比如說我看到這個攝像頭,我過去沒有見過這個攝像頭,但是我能大概推斷說在這個工作環境之下,你大部分的物料是可能堆放在什麼位置,然後它調用它整個導航的技能、調用它整個感知跟抓取的技能,到那個地方跟人一樣把你這個事情閉環的完成。
記憶這個事情,對於分鐘級或者是小時級的記憶,其實這種任務難度並不高,但核心問題在於我們把這個記憶如果拉長到一個周級、月級、年級的維度,怎麼能做精細化的管理?這是一個非常有挑戰的工作。我們貝塔這邊,目前整體這套記憶管理系統是從周級往月級在推進,我們希望到年底能做到一個年級的維度。
啱啱提到我們想做的是有用的機器夥伴,所以操作對我們來講是非常關鍵的一個命題,對於操作智能我們的看法是兩點,尤其是面對我們泛消費級場景來講的話,它的泛化性和長程任務是我們核心關注的兩個重要的特點。對於模型的範式來講,VLA也好或者世界模型也好,其實在未來具身的基座模型裏面,我們認為它一定會走向融合,它不是兩套獨立分離的技術範式,就像過去Transformer集大成的這種模型結構,在此之前其實(40:39英)這種架構,其實已經有很多的研究了。我們相信在未來具身操作智能基模的模型架構裏面,語言的這種能力、視覺的理解和預測的能力,一定也是裏面非常關鍵的基座會吸納進來。
在此之外,我們更加關注的是,這套技術的模型怎麼能在這個環境裏面適應動態的變化,你怎麼能做這種,我們叫測試式的學習或者叫持續演進,所以我們在這種模型裏面增加了測試式學習的能力,比如我們更加關注上層這套數據飛輪,這兩種能力的疊加,才能真正達到你整體的操作技能對於你沒有見過的一些物品,或者是你在預訓練和前置階段沒有見過的數據,能做到一個比較好的適應。這種也是真正未來機器能夠進入千家萬戶的一個必備路徑,因為北京的家庭跟新疆的家庭,可能大家家庭裏面物品的紋理、顏色、形狀是完全不一樣的,大家靠前置的數採是肯定沒有辦法覆蓋到這麼長尾的分佈。
我們前段時間啱啱也發了我們0.1版本的模型,我們在一個真實的家庭環境裏面做了一個任務的測試,這裏面我們單模型可以全自主的完成10分鐘以上的長程複雜的移動操作任務,我們知道移動操作任務相對固定台的操作它的難度是成倍增加的,整個模型體現出比較好的精細操作包括泛化以及對空間的理解能力,包括一些失敗的自主恢復、動態智腦下的記憶推理跟操作,就是它在收拾地面物品的過程中,可能有人用一個繪本把其中一個樂高塊給擋住之後,它結合過去的畫面之後,推理到下面還有一個遺漏的樂高塊,動態的把它移開,然後完成整個主線任務。包括這種全身空間位置的精細調整,這裏面都是我們單一模型端到端完成的。
對於未來來講,我們覺得在操作系統層面,我們未來比拼的一定不是一個單一模型或者單一一套神經網絡,如果大家真的做過複雜系統的交互或者場景落地的話,未來一定比拼的是複雜的系統架構跟集成能力。具身,尤其是面向跟人生活的具身場景的落地,它需要的一定是一套開放式的AgenticOS,所以我們在系統框架的構建上面,其實構建的就是一套面向開放世界的物理的Agent,從底層機器人硬件的分裝到中間層(43:49英)。這套系統的話,我們首先會在自己的產品上面做出比較好的體驗,當然,我們覺得這套系統一定是套開放的系統,未來也會開放出來,跟大家一起來建設這個比較繁榮的生態。
好,我的分享大概就到這裏,謝謝大家!