![]()
新智元報(bào)道
![]()
過(guò)去一年,具身智能賽道正經(jīng)歷著前所未有的「冰火兩重天」。
一方面,一級(jí)市場(chǎng)熱錢(qián)持續(xù)涌入,單筆融資金額屢創(chuàng)新高。
但另一方面,也有企業(yè)陸續(xù)啟動(dòng) IPO 進(jìn)程、尋求二級(jí)市場(chǎng)融資。
而放眼全球,具身智能行業(yè)的頭部玩家們,早已敏銳捕捉到風(fēng)向的轉(zhuǎn)變。
特斯拉、Figure這些公司在做什么?他們幾乎不約而同地把競(jìng)爭(zhēng)推向了另一個(gè)層面——Physical AI。
特斯拉直接將自動(dòng)駕駛FSD的底層架構(gòu)復(fù)用至Optimus機(jī)器人,試圖通過(guò)「端到端」神經(jīng)網(wǎng)絡(luò),實(shí)現(xiàn)從視覺(jué)輸入到動(dòng)作控制的映射,如今已經(jīng)在工廠執(zhí)行電池分揀。
![]()
Figure AI則通過(guò)深度綁定OpenAI,將頂尖VLM注入鋼鐵軀殼,讓Figure 01/02機(jī)器人具備自主推理、語(yǔ)義理解能力,進(jìn)駐寶馬的汽車(chē)生產(chǎn)線。
他們的Helix VLA模型,走的是快慢腦雙系統(tǒng)架構(gòu),目標(biāo)不是賣(mài)機(jī)器人,是賣(mài)勞動(dòng)力。
這些企業(yè)路徑不同,但都指向同一個(gè)判斷:機(jī)器人未來(lái)的核心,是AI能不能通過(guò)這副身體理解現(xiàn)實(shí)世界、適應(yīng)現(xiàn)實(shí)世界,并最終改變現(xiàn)實(shí)世界。
這種現(xiàn)象的邏輯,其實(shí)都藏在資本的周期里。大多數(shù)私募基金的投資年限是「3+2」模式(三年投資,兩年退出),如今已經(jīng)到了GPLP們迫切需要變現(xiàn)的節(jié)點(diǎn)。
資本的倒逼,讓行業(yè)面臨一個(gè)現(xiàn)實(shí)的分水嶺:過(guò)去那個(gè)靠電機(jī)扭矩有多大、后空翻有多穩(wěn)來(lái)證明「機(jī)器能動(dòng)」的故事,已經(jīng)講到頭了。
企業(yè)必須講出下一個(gè)更宏大也更切實(shí)的故事——「機(jī)器能干活」。
如果只是在一個(gè)無(wú)干擾臺(tái)面上,按部就班地執(zhí)行機(jī)械化工作,根本用不著大模型。
具身智能真正的未來(lái),是走向AGI,是在開(kāi)放、未知、充滿長(zhǎng)尾變數(shù)的真實(shí)世界中執(zhí)行高度泛化的任務(wù)。
而開(kāi)啟這個(gè)時(shí)代的鑰匙——是具備系統(tǒng)提升機(jī)器人工作能力的技術(shù)體系。
為什么走向AGI
必須是「體系化躍遷」?
什么是真正的體系?
近期行業(yè)內(nèi)有一次動(dòng)作極具代表性。
高德正式宣布其全棧具身技術(shù)體系A(chǔ)Bot 完成升級(jí),一次性發(fā)布了五款新模型(N1、M0.5、ER、AgentOS、C0),并在17項(xiàng)權(quán)威基準(zhǔn)中拿下SOTA。
![]()
它提供了一個(gè)極佳的產(chǎn)業(yè)切片,向外界展示了全球首個(gè)全棧具身技術(shù)體系是如何將世界模型、基座模型與具身Agent架構(gòu)耦合為一個(gè)「有機(jī)生命體」,并實(shí)現(xiàn)落地的。
ABot最早發(fā)布于今年4月,彼時(shí)高德自研的機(jī)器導(dǎo)盲犬高德途途首次登上機(jī)器人半馬的舞臺(tái),并展示了其出色的開(kāi)放環(huán)境全自主導(dǎo)航能力。
途途背后的技術(shù)支撐就是高德ABot全棧具身技術(shù)體系。相比于單個(gè)模型能力研究,高德從一開(kāi)始就搭建了一個(gè)為機(jī)器人實(shí)現(xiàn)高階智能的底層平臺(tái)。
其中的每一款模型都有其對(duì)應(yīng)的功能和角色。這是一個(gè)具備完整分工且能「自己長(zhǎng)本事」的閉環(huán)飛輪。
![]()
在開(kāi)放環(huán)境中,任意一個(gè)通用任務(wù),都需要機(jī)器人同時(shí)調(diào)配多個(gè)能力進(jìn)行編排和協(xié)同,最后落地執(zhí)行。
以最常見(jiàn)的家庭場(chǎng)景為例,RoboCasa-365等權(quán)威基準(zhǔn)需要將日常任務(wù)拆解為數(shù)百個(gè)涉及語(yǔ)義理解、長(zhǎng)程規(guī)劃和位移操作的任務(wù),然后進(jìn)行對(duì)應(yīng)的能力評(píng)估。本質(zhì)是因?yàn)椋朐诩彝?chǎng)景完成作業(yè),單一的手或者腳足夠靈活,還遠(yuǎn)不足以支撐。
用戶需要的是完整的智能,而非只具備手臂或者下肢局部能力的「瘸腿」智能。
而ABot這類(lèi)架構(gòu),正是針對(duì)這個(gè)痛點(diǎn)而打造。
![]()
三層架構(gòu),一個(gè)飛輪
高德ABot體系的核心,是一個(gè)精密咬合、可自進(jìn)化的三層結(jié)構(gòu)。
最上層是「具身大腦」,由通用具身大腦ER和機(jī)器人Agent操作系統(tǒng)AgentOS構(gòu)成,負(fù)責(zé)環(huán)境感知、任務(wù)推理、高層決策調(diào)度與記憶沉淀。
中間層是「運(yùn)動(dòng)雙核」,由N1和M0.5組成,分工管「腳怎么走」和「手怎么干」。
最底層是「訓(xùn)練與仿真環(huán)境」,以世界模型ABot-World和3D世界模型ABot-Earth持續(xù)提供仿真和訓(xùn)練。
這三層架構(gòu)決定了ABot的每一次迭代,都不是孤立地點(diǎn)亮某個(gè)新技能,而是像生物進(jìn)化一樣,隨著任務(wù)和部署的增多進(jìn)行整體演進(jìn)。
這樣的進(jìn)化能力更類(lèi)似于人類(lèi)成長(zhǎng)的節(jié)奏,在一個(gè)人中學(xué)階段學(xué)習(xí)的是一元二次方程,大學(xué)階段掌握的則是微積分。每一步的成長(zhǎng),都是完整且高度統(tǒng)一的。
而在這套架構(gòu)之外,高德途途和它自帶的ABot-C0則扮演端到端能力驗(yàn)證的外化本體。讓ABot每一個(gè)能力的提升都能在本體上有完整呈現(xiàn)。
為什么一定要做這么完整的架構(gòu)?
因?yàn)橹挥畜w系跑起來(lái),仿真訓(xùn)練、物理交互與記憶調(diào)度才能彼此反哺。
在單點(diǎn)研究的機(jī)構(gòu)里,研究大腦的和死磕靈巧手的彼此割裂。
但在完整的體系內(nèi),手和腳的能力,能夠被一體調(diào)用;它們沉淀的知識(shí)和經(jīng)驗(yàn),會(huì)反向轉(zhuǎn)化為記憶回饋給大腦,大腦再將記憶用于模型的專(zhuān)項(xiàng)訓(xùn)練,從而訓(xùn)練更好的模型和更聰明大腦。
![]()
飛輪每轉(zhuǎn)一圈,整體智能水平就抬高一層。 手和腳的能力提升是同步的——腳走得好,手也不會(huì)差。整個(gè)系統(tǒng)是一個(gè)內(nèi)循環(huán),逐步向AGI靠近。
從高德此次全新發(fā)布的五款模型背后,我們能夠完整看到這套體系究竟是如何應(yīng)用于機(jī)器人,并實(shí)現(xiàn)它們質(zhì)變升級(jí)的。
這五款模型類(lèi)似于高德為機(jī)器人打造的「數(shù)字靈魂」,它們完整地映射在機(jī)器人的五大仿生單元。
雙腳(ABot-N1):通用導(dǎo)航基座模型,負(fù)責(zé)空間感知與移動(dòng)。
雙手(ABot-M0.5):通用操作基座模型,負(fù)責(zé)精細(xì)化物理交互。
大腦(ABot-ER):具身大腦,負(fù)責(zé)統(tǒng)一的邏輯推理與環(huán)境認(rèn)知。
中樞(ABot-AgentOS):執(zhí)行中樞,負(fù)責(zé)記憶調(diào)度與任務(wù)下發(fā)。
運(yùn)動(dòng)神經(jīng)(ABot-C0):運(yùn)控系統(tǒng),將ABot體系的決策穩(wěn)穩(wěn)傳導(dǎo)至機(jī)器人的軀體動(dòng)作上。
體系化帶來(lái)的三大「表征」
當(dāng)這五大「數(shù)字靈魂」在三層架構(gòu)的驅(qū)動(dòng)下精密咬合、協(xié)同運(yùn)轉(zhuǎn)時(shí),便不再是冷冰冰的代碼與模型,而是化身為對(duì)復(fù)雜物理世界有強(qiáng)大適應(yīng)力的物理智能體。
這種從底層架構(gòu)向物理世界的全面映射,超越了傳統(tǒng)單點(diǎn)突破的機(jī)器人研發(fā)模式,并最終外化為傳統(tǒng)機(jī)器人整體性的物理表征。
表征一:「身隨眼動(dòng)」
相比于讓機(jī)器人實(shí)現(xiàn)一些高難度的動(dòng)作,高德的ABot-N1更聚焦于讓機(jī)器人合規(guī)安全的走進(jìn)人類(lèi)生活當(dāng)中。
![]()
ABot-N1在R2R-CE等5項(xiàng)權(quán)威基準(zhǔn)取得SOTA
讓機(jī)器人真正走向開(kāi)放世界,最大的攔路虎就是機(jī)器人無(wú)法直接使用常規(guī)的導(dǎo)航地圖。常規(guī)導(dǎo)航用于人類(lèi)出行,地圖精度有限。
但是由于人類(lèi)具備空間常識(shí)和安全意識(shí),即便出現(xiàn)地圖偏差和定位漂移,也不影響正常使用,而機(jī)器人如果進(jìn)入開(kāi)放環(huán)境遇到這種問(wèn)題,將對(duì)安全性造成巨大風(fēng)險(xiǎn)。
高德的解法是,為N1導(dǎo)航基座設(shè)計(jì)了「快慢雙系統(tǒng)」架構(gòu)。慢思考負(fù)責(zé)長(zhǎng)程路線規(guī)劃,快思考負(fù)責(zé)實(shí)時(shí)控制。
![]()
ABot-N1開(kāi)放環(huán)境全自主導(dǎo)航克服定位偏差
一旦判定導(dǎo)航路徑或定位有誤差,「慢系統(tǒng)」會(huì)立刻通過(guò)本體系下的視覺(jué)感知,讓機(jī)器人靠像素-語(yǔ)言雙思維鏈來(lái)實(shí)時(shí)行駛在合規(guī)路面。
在實(shí)際導(dǎo)航任務(wù)中,快慢雙系統(tǒng)異步協(xié)同,讓機(jī)器人在僅有低精度SD地圖時(shí),既能準(zhǔn)確抵達(dá)指定坐標(biāo)目標(biāo),又能沿人行道、斑馬線安全通行,而不是像純度量式策略那樣為了到點(diǎn)而抄近道橫穿車(chē)道、踩踏綠化帶。
更關(guān)鍵的是,N1首創(chuàng)了「Think-and-Point」,不僅消除了部署黑箱,還讓機(jī)器人在每一次自主導(dǎo)航中收集交互數(shù)據(jù),并結(jié)合空間幾何知識(shí),在ABot體系中內(nèi)化出屬于自己的「空間直覺(jué)」。
依靠這種直覺(jué),它在開(kāi)放環(huán)境自主導(dǎo)航任務(wù)中創(chuàng)下92.9%的成功率,做到了城市級(jí)的長(zhǎng)程自主導(dǎo)航。
值得一提的是,ABot-N系列工作已經(jīng)入選了CVPR年度最佳論文的候選。在此基礎(chǔ)上,ABot-N1不僅延續(xù)了一套權(quán)重對(duì)出行導(dǎo)航全場(chǎng)景任務(wù)集的完整覆蓋,還在R2R-CE等5項(xiàng)權(quán)威基準(zhǔn)均刷新了SOTA。
表征二:「手腳并用」
一個(gè)合格的具身智能體不僅要能「走出去」,還要能「能干活」,移動(dòng)操作是通用機(jī)器人邁向真實(shí)物理世界的關(guān)鍵能力。
在真實(shí)的移動(dòng)操作任務(wù)中,傳統(tǒng)機(jī)器人往往是單線程結(jié)構(gòu),左手、右手、底盤(pán)線性串聯(lián),如果一步卡住就會(huì)直接死機(jī)。
體系化的最大亮點(diǎn)之一,就在于「解耦」。
ABot-M0.5將運(yùn)動(dòng)與操作拆分為互不干擾的雙動(dòng)作流,并引入「幀級(jí)隱式動(dòng)作」,讓機(jī)器人在極細(xì)的時(shí)間顆粒度上實(shí)現(xiàn)眼、手、腳的實(shí)時(shí)對(duì)齊。
![]()
ABot-M0.5全自主進(jìn)行移動(dòng)操作
這既解決了單一動(dòng)作空間中移動(dòng)與操作相互干擾的問(wèn)題,還保證了模型能捕捉一些微觀且高頻的物理交互,從而保證任務(wù)的執(zhí)行質(zhì)量。
面對(duì)訓(xùn)練和推理環(huán)境不同,造成的長(zhǎng)程任務(wù)執(zhí)行過(guò)程中的誤差累積問(wèn)題,ABot-M0.5通過(guò)ABot體系激活了「數(shù)據(jù)回流」機(jī)制進(jìn)行了解決。
ABot-M0.5具備獨(dú)特的「夢(mèng)境自愈(Dream-Forcing)」能力,這個(gè)機(jī)制強(qiáng)迫模型在預(yù)測(cè)的含噪畫(huà)面中繼續(xù)生成動(dòng)作,避免細(xì)小偏差導(dǎo)致任務(wù)失敗。
這些數(shù)據(jù)源自模型自造,它們會(huì)通過(guò)ABot的數(shù)據(jù)回流機(jī)制,沉淀為整體記憶和共享經(jīng)驗(yàn),持續(xù)強(qiáng)化模型訓(xùn)練。數(shù)據(jù)顯示,ABot-M0.5在RoboCasa-365復(fù)雜任務(wù)測(cè)試中大幅領(lǐng)先前代SOTA達(dá)20.4%。
![]()
ABot-M0.5在LIBERO、Robo-Twin等4項(xiàng)權(quán)威基準(zhǔn)中均取得SOTA
表征三:「過(guò)目不忘」
在具備了優(yōu)秀的四肢能力后,機(jī)器人在真實(shí)且復(fù)雜環(huán)境中,還需要一個(gè)完整的機(jī)器人操作系統(tǒng),來(lái)統(tǒng)一進(jìn)行決策和能力調(diào)配。
依靠頂層的ABot-ER與AgentOS,機(jī)器人擁有了從「想明白」到「做得到」的完整閉環(huán),以及終身記憶的能力。
其中,ABot-ER是面向真實(shí)環(huán)境的通用具身大腦,統(tǒng)一支撐機(jī)器人從感知到?jīng)Q策全流程。它讓機(jī)器人不只是識(shí)別畫(huà)面中的物體,而是能夠「想明白」物體、空間與任務(wù)之間的關(guān)系,并做出合理判斷。
![]()
ABot-ER取得3項(xiàng)SOTA,并登頂數(shù)十家機(jī)構(gòu)聯(lián)合發(fā)布的Embodied Arena 2D-EQA
AgentOS則將規(guī)劃與執(zhí)行從本體中解耦,通過(guò)插件式Skill接入,讓同一套系統(tǒng)能適配各種異構(gòu)機(jī)器人。
同時(shí),它自帶跨任務(wù)、跨時(shí)間的多模態(tài)記憶,能在失敗中定向優(yōu)化記憶存儲(chǔ),并將沉淀的數(shù)據(jù)轉(zhuǎn)化為整個(gè)ABot體系的共享資產(chǎn)。
![]()
ABot-AgentOS多模態(tài)終身記憶 過(guò)目不忘
憑借系統(tǒng)級(jí)的經(jīng)驗(yàn)反哺,機(jī)器人真正能夠跨本體和跨任務(wù)做到舉一反三、過(guò)目不忘。
![]()
ABot-AgentOS在Locomo等五大權(quán)威基準(zhǔn)上均取得SOTA
所有的物理表征,都將在具身機(jī)器人進(jìn)行能力外化的呈現(xiàn),這個(gè)部分高德選擇了其自研的高德途途和運(yùn)控系統(tǒng)ABot-C0。這也是支持機(jī)器人行動(dòng)的運(yùn)動(dòng)神經(jīng)。該模型通過(guò)構(gòu)建四足機(jī)器人統(tǒng)一的行為基座,實(shí)現(xiàn)了ABot能力的端到端驗(yàn)證。
![]()
ABot體系支持異構(gòu)機(jī)器人協(xié)作
以上這三大表征絕非孤立技能,而是ABot三層架構(gòu)「飛輪」高速運(yùn)轉(zhuǎn)的必然結(jié)果。
它們完美印證了這套體系的進(jìn)化邏輯:手、腳與大腦在真實(shí)物理交互中獲取經(jīng)驗(yàn),在仿真環(huán)境里持續(xù)訓(xùn)練,最后通過(guò)統(tǒng)一的記憶調(diào)度完成閉環(huán)反哺。
高德途途在現(xiàn)實(shí)世界中的端到端成功外化,正是最強(qiáng)有力的證明。
ABot不是在機(jī)械地堆砌機(jī)器人功能,而是在按照生命的進(jìn)化節(jié)奏,孕育一個(gè)能自主生長(zhǎng)、不斷逼近AGI的完整物理智能體。
把二十年時(shí)空數(shù)據(jù)
變成具身智能的基座
一個(gè)做地圖導(dǎo)航的公司,為什么能殺入具身智能的核心圈?
如果把「體系化」的三道門(mén)檻拆開(kāi),答案很明顯。
在數(shù)據(jù)端,相比純模型驅(qū)動(dòng)的廠商在實(shí)驗(yàn)室里死磕合成數(shù)據(jù),高德背后是積累了二十年的龐大時(shí)空基座。
機(jī)器人本質(zhì)上是物理空間的Agent,高德對(duì)空間的理解、環(huán)境的拓?fù)浣Y(jié)構(gòu)、語(yǔ)義信息的豐富維度,是其他廠商難以企及的天然養(yǎng)料。
在架構(gòu)端,高德從一開(kāi)始切入具身智能,就不是為了造某一臺(tái)特定的機(jī)器人。它的ABot是一套完整的、解耦的全棧架構(gòu),各司其職,又通過(guò)總線互通。
這意味著,今天在四足狗上驗(yàn)證的經(jīng)驗(yàn),明天可以直接遷移到雙足人形上,而不需要推倒重來(lái)。
在工程化上, 從掃街榜再到具身智能,高德在轉(zhuǎn)型空間智能公司的過(guò)程中,積累了極度深厚的AI工程化經(jīng)驗(yàn)。
在場(chǎng)景端,無(wú)論是高德途途的場(chǎng)景驗(yàn)證,還是城市級(jí)長(zhǎng)程任務(wù)導(dǎo)航的實(shí)際案例,高德的體系是在真實(shí)泥濘的路上跑出來(lái)的。
把這些維度串起來(lái),會(huì)看到一個(gè)完整的增強(qiáng)回路。
四者彼此咬合,才能構(gòu)成一個(gè)「越跑越強(qiáng)」的體系——而這,恰恰是單點(diǎn)突破玩家很難復(fù)制的。
![]()
中場(chǎng)戰(zhàn)事,剛剛拉開(kāi)帷幕
回到開(kāi)篇的問(wèn)題:為什么具身智能的下半場(chǎng),從體系開(kāi)始?
因?yàn)槲锢硎澜鐝牟话磳?shí)驗(yàn)室的套路出牌。用單點(diǎn)參數(shù)的領(lǐng)先去擊穿物理世界的復(fù)雜性,本身就存在風(fēng)險(xiǎn)。
放眼當(dāng)前的具身智能賽道,行業(yè)共識(shí)正在發(fā)生劇變。
資本催熟的「純硬件故事」已經(jīng)講完,全球最聰明的頭腦都在向同一個(gè)方向聚焦:?jiǎn)未颡?dú)斗的時(shí)代結(jié)束了,體系化作戰(zhàn)才是破局的關(guān)鍵。
高德ABot架構(gòu)的誕生,正是在這一行業(yè)敘事下應(yīng)運(yùn)而生,它與全球頂尖玩家的探索不謀而合。
它向外界證明了,可以不用再去迷信孤立的「超級(jí)大腦」或單個(gè)「靈巧手」,而是回歸生命進(jìn)化的本質(zhì),去構(gòu)建一個(gè)精密咬合的閉環(huán)生態(tài),才是打破莫拉維克悖論的最佳解法。
通往AGI之路上,比拼的不再是誰(shuí)的長(zhǎng)板更長(zhǎng),而是誰(shuí)的系統(tǒng)能轉(zhuǎn)得更穩(wěn)、迭代得更快。
誰(shuí)能率先構(gòu)建出靠「閉環(huán)飛輪」自我進(jìn)化的生態(tài)體系,讓機(jī)器人在物理交互不斷升級(jí),誰(shuí)就真正拿到了具身智能下半場(chǎng)的入場(chǎng)券。
泡沫退去,真正的洗牌,才剛剛開(kāi)始。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.