智象發布具身世界模型:專門訓練機器人應對各種意外

鳳凰網科技
09/07

鳳凰網科技訊 9月7日,智象未來(HiDream.ai)正式發布具身世界模型HiDream-O1-Embodied。據官方介紹,該模型基於其原生全模態技術路線,面向機器人在真實環境中的物理感知、動態預判和任務執行,並進一步將圖像、視頻、3D及動作等模態納入統一技術體系。

與模型發布同期,HiDream-O1-Embodied首次參加具身智能模型評測平台RoboColiseum測試,在Robustness(擾動適應)子排行榜中取得0.692的平均分,位列榜首。該項評測主要通過改變背景、光照、材質、機器人初始狀態、相機位置、圖像質量以及指令表達方式等條件,測試模型面對環境變化時的穩定性和泛化能力。

據介紹,RoboColiseum基於高保真仿真環境搭建,目前設定指令跟隨、空間理解、擾動適應和通用操作四類能力子榜,共包含78個高保真仿真評測任務,面向高校、科研機構、模型企業及研究者開放。

針對機器人進入真實環境後容易遇到的視覺干擾和指令變化,HiDream-O1-Embodied主要從語言理解、多視角視覺感知和容錯機制三個方向進行強化。在語言理解方面,模型覆蓋不同動詞、句式及表達方式的等價指令,以降低對固定關鍵詞和句式的依賴;視覺感知方面,則綜合多個視角的信息,當部分視覺輸入受到遮擋、相機位置變化或出現偏差時,可利用其他視角繼續判斷場景和任務。

在訓練環節,智象未來表示,HiDream-O1-Embodied主動引入光照變化、畫面污損、視野遮擋等非理想條件,使模型學習在信息不完整或不穩定的情況下完成判斷和執行。這也是此次Robustness評測重點考察的能力之一。

數據方面,智象未來採用「真實基座+生成增強」的方式擴充具身訓練數據。以其與諾亦騰的合作為例,公司以高精度真人動作捕捉數據作為基礎,再利用模型進行百倍級數據擴增。根據素材披露,在保持動作物理約束的基礎上,模型可以改變背景、光照和物體形態等變量,由單段真實動作樣本生成更多訓練樣本。

智象未來CTO姚霆表示,公司希望圍繞真實世界的表達、理解和生成,建立具備全模態表達、因果推演與物理世界構建能力的世界模型基座。HiDream-O1-Embodied的推出意味着其原生全模態技術路線進一步延伸至機器人動作和物理世界執行環節。

不到一個月前,智象未來還發布了交互式世界模型HiDream-O1-World。據公司披露,該模型在交互式視頻世界模型評測基準WBench的Navi分榜中取得80.9平均分並位列榜首。與側重數字環境理解和推演的HiDream-O1-World相比,此次發布的HiDream-O1-Embodied進一步面向物理世界中的操作與執行。

目前,智象未來已經形成包括HiDream-O1-Image、HiDream-O1-World和HiDream-O1-Embodied在內的模型序列,技術覆蓋從視覺生成、交互式世界模型到具身世界模型。按照其技術規劃,公司試圖進一步打通圖像、視頻、3D和動作等不同模態,建立統一的原生全模態世界模型體系。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10