![]()
7 月 15 日,逐際動(dòng)力發(fā)布了人形大腦系統(tǒng) LimX COSA 0.5 版本最新 Demo。
在這個(gè)長(zhǎng)視頻里,逐際動(dòng)力的 Oli,無(wú)遙操,無(wú)剪輯,一鏡到底,連續(xù)完成了一長(zhǎng)串家務(wù):晾衣、收納、搬箱摞箱、深彎腰拾物、清理垃圾和遞送物品等
相較于今年 1 月份發(fā)布的 COSA,逐際動(dòng)力這次的重點(diǎn)放在了人形 VLA 能力上,展示了大腦系統(tǒng)如何調(diào)度技能與全身運(yùn)控,讓機(jī)器人在移動(dòng)過(guò)程中連續(xù)、穩(wěn)定、精準(zhǔn)地完成操作任務(wù)。
如果只看結(jié)果,這似乎又是一段人形機(jī)器人學(xué)會(huì)了更多技能的演示。但真正值得關(guān)注的是,這些不同任務(wù)如何被理解、組織和執(zhí)行,其背后指向的是當(dāng)前具身智能行業(yè)的一場(chǎng)技術(shù)路線(xiàn)之爭(zhēng):機(jī)器人的“大腦”,究竟是一個(gè)不斷變大的模型,還是一套能夠理解世界、調(diào)度技能并完成運(yùn)動(dòng)的系統(tǒng)?
“模型是技能,系統(tǒng)才是大腦”
當(dāng)前,參數(shù)規(guī)模、訓(xùn)練數(shù)據(jù)和任務(wù)成功率經(jīng)常被用來(lái)衡量機(jī)器人的智能水平。一個(gè)模型能夠識(shí)別更多物體、理解更多指令、完成更多操作,也往往被描述為擁有了更強(qiáng)的“大腦”。
但逐際動(dòng)力的創(chuàng)始人張巍并不認(rèn)同這一判斷。“模型不是大腦,”他直言,“大腦是一個(gè)操作系統(tǒng)。它不光要管理記憶、存儲(chǔ)和思考,它還是一個(gè) Agent,要調(diào)用 VLM、LLM、VLA 等各種模型和工具,才能完成一個(gè)任務(wù)。”
在真實(shí)物理世界中,一項(xiàng)任務(wù)通常由一連串相互關(guān)聯(lián)的行動(dòng)組成。機(jī)器人需要理解目標(biāo)、觀察環(huán)境、拆解任務(wù),根據(jù)實(shí)際情況調(diào)用導(dǎo)航、抓取或全身移動(dòng)操作等不同技能;在執(zhí)行過(guò)程中,還要持續(xù)判斷任務(wù)進(jìn)度,并協(xié)調(diào)身體平衡與動(dòng)作精度。
模型可以提供其中某一項(xiàng)或某一類(lèi)能力,卻很難單獨(dú)承擔(dān)記憶管理、任務(wù)調(diào)度、技能組合和狀態(tài)判斷等工作。即使一個(gè)模型學(xué)會(huì)的技能越來(lái)越多,也不意味著這些技能會(huì)自動(dòng)組成一個(gè)能夠持續(xù)思考、判斷和行動(dòng)的機(jī)器人大腦。
相較于試圖用一個(gè)模型包攬認(rèn)知和動(dòng)作,逐際動(dòng)力選擇用系統(tǒng)組織不同模型和技能。它不僅關(guān)注機(jī)器人會(huì)不會(huì)做,還要解決機(jī)器人做什么、調(diào)用什么能力,以及如何把動(dòng)作穩(wěn)定地執(zhí)行出來(lái)。對(duì)于需要在動(dòng)態(tài)環(huán)境中連續(xù)完成復(fù)雜任務(wù)的人形機(jī)器人而言,這種系統(tǒng)化架構(gòu)具有更明確的落地優(yōu)勢(shì)。
COSA 作為逐際動(dòng)力原創(chuàng)的人形大腦系統(tǒng),展示的正是對(duì)這一路線(xiàn)的一次集中呈現(xiàn)。而支撐這條路徑落地的,是其由 S2 認(rèn)知層、S1 技能層和 S0 運(yùn)控執(zhí)行層組成的三層技術(shù)架構(gòu):從認(rèn)知和任務(wù)調(diào)度,到技能調(diào)用與動(dòng)作指令生成,再到全身運(yùn)控與精準(zhǔn)執(zhí)行,機(jī)器人由此形成一條從思考到行動(dòng)的完整鏈路。
三層技術(shù)架構(gòu)如何協(xié)同工作
在人形大腦系統(tǒng) COSA 這套三層技術(shù)架構(gòu)中,S2,負(fù)責(zé)認(rèn)知、理解和任務(wù)調(diào)度;S1 是技能層,負(fù)責(zé)將任務(wù)意圖轉(zhuǎn)化為動(dòng)作策略;S0 則負(fù)責(zé)全身動(dòng)作跟蹤和精準(zhǔn)執(zhí)行。
![]()
(來(lái)源:逐際動(dòng)力)
要理解三層之間的關(guān)系,可以沿著一條任務(wù)指令向下看。
當(dāng)用戶(hù)要求 Oli“把椅子上衣服撿起來(lái),把衣架上的衣服取走,都扔到臟衣簍”時(shí),首先工作的是 S2 大腦系統(tǒng)。S2 是一套以 LLM/VLM 為核心的認(rèn)知智能體,運(yùn)行頻率約為 1 Hz,它負(fù)責(zé)理解目標(biāo)、觀察場(chǎng)景、結(jié)合記憶判斷任務(wù)進(jìn)度,并決定下一步需要調(diào)度什么技能。
當(dāng) S2 作出判斷后,任務(wù)便進(jìn)入 S1 技能層。張巍將 S1 比作連接大腦與身體的“肌肉記憶”。廣義上的 VLA 和世界動(dòng)作模型都屬于這一層,負(fù)責(zé)把上層意圖轉(zhuǎn)化為指導(dǎo)機(jī)器人行動(dòng)的策略。不同任務(wù)對(duì)數(shù)據(jù)的要求并不相同,行走等技能可以更多依靠仿真訓(xùn)練,而柔性物體操作和精細(xì)抓取則需要補(bǔ)充更多真機(jī)數(shù)據(jù)。
在收拾衣服并扔進(jìn)臟衣簍的任務(wù)中,COSA 調(diào)用 S1 層的 VLA 技能 需要生成接近目標(biāo)、調(diào)整站位、彎腰、抓取、起身和移動(dòng)至衣架前等一系列動(dòng)作,而不是一條孤立的機(jī)械臂軌跡。
![]()
(來(lái)源:逐際動(dòng)力)
但生成動(dòng)作方案,并不意味著機(jī)器人已經(jīng)能夠穩(wěn)定地做出動(dòng)作。全尺寸人形機(jī)器人在彎腰、轉(zhuǎn)身、行走和搬運(yùn)時(shí),身體重心不斷變化,需要 S0 在執(zhí)行過(guò)程中實(shí)時(shí)維持平衡。
S0 對(duì)應(yīng) LimX WBT 全身運(yùn)動(dòng)基礎(chǔ)模型,是一個(gè)約千萬(wàn)參數(shù)的 Transformer 控制策略,完全運(yùn)行在機(jī)器人本體上,控制頻率達(dá)到 1000 Hz。它接收 S1 生成的全身運(yùn)動(dòng)指令,持續(xù)調(diào)整關(guān)節(jié)狀態(tài),使機(jī)器人準(zhǔn)確跟隨全身移動(dòng)與操作動(dòng)作。
LimX WBT 與預(yù)先編排好、接到指令后按固定流程播放的動(dòng)作不同。它不需要提前知道機(jī)器人下一步一定要怎樣運(yùn)動(dòng),而是根據(jù)上層實(shí)時(shí)給出的目標(biāo)調(diào)整全身動(dòng)作,并在執(zhí)行過(guò)程中保持平衡。
根據(jù)逐際動(dòng)力公布的測(cè)試結(jié)果,LimX WBT 的平均關(guān)節(jié)位置誤差(MPJPE)為 12.85 毫米,SONIC(行業(yè)公開(kāi)最強(qiáng)全身跟蹤模型)為 13.75 毫米;其平均關(guān)節(jié)角誤差為 1.5 度,對(duì)照結(jié)果為 3.3 度。在兩項(xiàng)動(dòng)作平滑度指標(biāo)上,LimX WBT 的測(cè)試結(jié)果也較對(duì)照數(shù)據(jù)低約 11% 和 20%,這些測(cè)試數(shù)據(jù),越低代表效果越好。
由此,COSA 0.5 Demo 背后的鏈路變得清晰:S2 大腦系統(tǒng)理解任務(wù)并調(diào)度技能,S1-VLA 生成全身動(dòng)作,S0-WBT 則把動(dòng)作穩(wěn)定、準(zhǔn)確地執(zhí)行出來(lái)。
從任務(wù)理解、技能生成到全身動(dòng)作執(zhí)行,三層技術(shù)架構(gòu)把機(jī)器人的認(rèn)知、技能和身體連接起來(lái),也讓“大腦是系統(tǒng)”從一個(gè)概念落到了真實(shí)任務(wù)之中。
從模型到系統(tǒng),人形機(jī)器人進(jìn)入全棧能力競(jìng)爭(zhēng)
放到全球范圍看,如何將認(rèn)知、動(dòng)作生成與全身運(yùn)控連接起來(lái),正在成為人形機(jī)器人競(jìng)爭(zhēng)的核心課題。但能夠在長(zhǎng)程任務(wù)中同時(shí)處理環(huán)境理解、移動(dòng)操作、雙臂協(xié)同和身體平衡的公司,目前仍然不多。
Figure 是其中最受關(guān)注的代表。2025 年 9 月,F(xiàn)igure 完成超過(guò) 10 億美元融資,投后估值達(dá)到 390 億美元。此后,該公司連續(xù)展示機(jī)器人整理廚房、客廳和臥室等長(zhǎng)程任務(wù)。
2026 年 1 月,F(xiàn)igure 發(fā)布 Helix 02,在此前 System 2 和 System 1 的基礎(chǔ)上加入以 1 kHz 運(yùn)行的 System 0。三層分別處理語(yǔ)義理解與任務(wù)規(guī)劃、全身動(dòng)作生成,以及平衡和運(yùn)動(dòng)控制。其廚房 Demo 持續(xù)約 4 分鐘,包含數(shù)十個(gè)連續(xù)動(dòng)作,展示了較強(qiáng)的長(zhǎng)程任務(wù)能力。
從公開(kāi)演示看,F(xiàn)igure 和逐際動(dòng)力都已經(jīng)不再停留于單次抓取,而是要求機(jī)器人在較長(zhǎng)時(shí)間內(nèi)保持任務(wù)狀態(tài),連續(xù)處理移動(dòng)、操作和全身平衡。兩家公司也因此成為目前少數(shù)實(shí)現(xiàn)人形機(jī)器人長(zhǎng)程移動(dòng)操作能力的企業(yè)。
但兩者對(duì)機(jī)器人大腦的理解并不相同。Figure 更強(qiáng)調(diào)統(tǒng)一神經(jīng)系統(tǒng)的端到端能力,通過(guò)模型連接視覺(jué)輸入、語(yǔ)義理解和全身動(dòng)作;逐際動(dòng)力則認(rèn)為,模型無(wú)論覆蓋多少層級(jí),首先仍然是一種能力。真正的大腦應(yīng)當(dāng)是一套位于模型和技能之上的操作系統(tǒng),負(fù)責(zé)記憶管理、任務(wù)判斷和技能調(diào)度。
因此,逐際動(dòng)力的重點(diǎn)不是將所有能力裝入一個(gè)更大的模型,而是在不同模型和技能之上建立一套大腦系統(tǒng)。具體的模型和技能可以更新、替換和擴(kuò)展,COSA 作為人形大腦系統(tǒng),則負(fù)責(zé)統(tǒng)一理解目標(biāo)、管理任務(wù)并調(diào)度這些能力。
Flexion 專(zhuān)注于為人形機(jī)器人構(gòu)建智能系統(tǒng),被業(yè)內(nèi)視為“人形機(jī)器人軟件大腦”賽道的重要玩家之一。2026 年 6 月,該公司發(fā)布 Reflect v1.0,同樣采用分層技術(shù)架構(gòu):頂層 VLM 負(fù)責(zé)任務(wù)理解和重新規(guī)劃,中間運(yùn)動(dòng)層結(jié)合 VLA 與強(qiáng)化學(xué)習(xí)技能生成動(dòng)作,底層控制器則負(fù)責(zé)全身平衡。其 Command、Motion 和 Control 架構(gòu),與 COSA 所強(qiáng)調(diào)的認(rèn)知、技能和運(yùn)控分層頗為相似。
不過(guò),其公開(kāi) Demo 使用的并非自研本體。與這種在第三方硬件上構(gòu)建軟件能力的路徑不同,逐際動(dòng)力同時(shí)自研人形機(jī)器人本體、Agent 智能體系統(tǒng)、VLA 技能和 LimX WBT 全身運(yùn)控模型,能夠圍繞同一套硬件進(jìn)行聯(lián)合設(shè)計(jì)和優(yōu)化。這種從本體到軟硬一體的全棧自研與深度協(xié)同,構(gòu)成了其區(qū)別于單一模型或軟件公司的核心技術(shù)壁壘。
COSA 0.5 Demo 中,Oli 完成的不只是物體抓取,還包括深彎腰、負(fù)載搬運(yùn)、轉(zhuǎn)身移動(dòng)、雙臂協(xié)同和邊走邊操作。這些動(dòng)作同時(shí)考驗(yàn)上層任務(wù)調(diào)度、中間層全身移動(dòng)操作技能和底層運(yùn)控能力。
![]()
(來(lái)源:逐際動(dòng)力)
由此,逐際動(dòng)力形成了一套完整的技術(shù)體系:向上,以 COSA 構(gòu)建負(fù)責(zé)認(rèn)知、記憶和任務(wù)調(diào)度的人形大腦系統(tǒng);中間,以 VLA 等模型提供可以調(diào)用和擴(kuò)展的技能;向下,以自研機(jī)器人本體和 LimX WBT 建立全身運(yùn)控基礎(chǔ),再通過(guò)軟硬件協(xié)同將這些能力連接起來(lái)。
在全棧自研之外,逐際動(dòng)力還將人形大腦系統(tǒng)中的 VLA 能力面向行業(yè)開(kāi)源。通過(guò) FluxVLA Engine,數(shù)據(jù)處理、模型訓(xùn)練、仿真評(píng)測(cè)、推理和真機(jī)部署被納入統(tǒng)一的工程框架,開(kāi)發(fā)者可以基于這套底座研究、復(fù)用和迭代新的 VLA 技能,并探索其在人形機(jī)器人全身移動(dòng)操作中的應(yīng)用。
當(dāng)然,一段 Demo 還不能回答人形機(jī)器人商業(yè)化的全部問(wèn)題。長(zhǎng)期任務(wù)成功率、異常恢復(fù)能力和大規(guī)模部署表現(xiàn),仍需要更多數(shù)據(jù)驗(yàn)證。但 COSA 0.5 提供了一種清晰的技術(shù)判斷:人形機(jī)器人的競(jìng)爭(zhēng)正在從模型參數(shù)和技能數(shù)量,走向大腦系統(tǒng)、硬件本體、全身運(yùn)控和開(kāi)放生態(tài)之間的綜合競(jìng)爭(zhēng)。
運(yùn)營(yíng)/排版:何晨龍
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶(hù)上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.