編輯|山輝
如果要讓機械臂把咖啡機旁的杯子移到桌上,需要經(jīng)歷哪幾個步驟?
在模型驅(qū)動規(guī)劃中,它需要先生成多條候選動作,再交給世界模型預(yù)演,根據(jù)預(yù)演結(jié)果決定如何執(zhí)行動作。
其中,視頻世界模型通常會接收當(dāng)前畫面,以及關(guān)節(jié)角、末端位姿、夾爪狀態(tài)等數(shù)值動作,生成執(zhí)行動作后的未來視頻。
可問題在于,對視覺模型來說,要建立某組數(shù)字和畫面動作之間的對應(yīng)關(guān)系,需要額外的學(xué)習(xí)。
并且這種學(xué)習(xí)依賴特定機器人產(chǎn)生的訓(xùn)練數(shù)據(jù),換一臺機器人,這些數(shù)據(jù)的結(jié)構(gòu)還會全部改變。
既然視覺模型更熟悉畫面,為什么不干脆把動作也「畫」給它看?
近日,斯坦福大學(xué)、馬里蘭大學(xué)帕克分校和哈佛大學(xué)的研究團隊發(fā)布論文《Masked Visual Actions for Unified World Modeling》。第一作者為 Hadi Alzayer,李飛飛、吳佳俊、張呂敏等研究者參與。
研究團隊提出 Masked Visual Actions,將機器人的候選動作渲染成像素級運動軌跡,再讓視頻模型補全環(huán)境的響應(yīng),改變輸入的實體后,同一個模型還能在兩個方向上工作:
- 給出機器人怎么動,預(yù)測環(huán)境會如何變化;
- 給出目標(biāo)物體怎么動,生成機器人可能采取的行為。
![]()
模型微調(diào)用了約 15 小時的機器人交互數(shù)據(jù),同一個模型可以支持正向預(yù)測、逆向生成、多種機器人本體、策略評估和模型規(guī)劃。在 RoboCasa 任務(wù)中,視頻模型輔助規(guī)劃帶來了 7 至 26 個百分點的成功率提升;模型預(yù)測的策略表現(xiàn)與真實仿真結(jié)果達到 0.982 的相關(guān)系數(shù);逆向動作提取管線在 CoffeeServeMug 任務(wù)上取得 90% 的成功率。
![]()
- 論文標(biāo)題:Masked Visual Actions for Unified World Modeling
- 項目主頁:https://masked-visual-actions.github.io/
- 論文鏈接:https://arxiv.org/abs/2607.19343v1
翻譯成視頻就容易看懂了
視頻世界模型直接預(yù)測未來圖像或視頻,常見工作方式可以概括為:當(dāng)前圖像+數(shù)值動作序列 → 未來視頻。
數(shù)值動作能夠精確控制機器人,卻與視頻模型熟悉的像素信息存在表示差異。
從一串動作數(shù)據(jù)到最終畫面,中間還隔著多層轉(zhuǎn)換:動作數(shù)據(jù) → 機器人姿態(tài) → 相機投影 → 畫面運動 → 環(huán)境響應(yīng)。
Masked Visual Actions 提前完成了這層轉(zhuǎn)換。
訓(xùn)練數(shù)據(jù)通過兩種方式構(gòu)造。一種是直接從真實視頻中分割機械臂,另一種是根據(jù)機器人狀態(tài)、URDF 模型和相機參數(shù)渲染其運動。前者保留真實視覺信息,后者方便在推理時自由輸入新的動作軌跡。
視頻模型接收初始畫面和這段機器人軌跡,再補全物體與環(huán)境的變化。
![]()
相比末端執(zhí)行器點或機器人骨架,完整掩碼還包含機器人的形狀、占用空間、遮擋關(guān)系和潛在接觸邊界,模型能夠直接「看」到動作過程。
![]()
這種表示也帶來了更好的跨機器人本體泛化能力。
在 DROID 訓(xùn)練分布內(nèi),完整掩碼、末端執(zhí)行器位置和機器人骨架都能較好地控制視頻生成,差距并不明顯。
![]()
在訓(xùn)練分布內(nèi)三種視覺條件表現(xiàn)接近
但當(dāng)測試對象換成訓(xùn)練中未見過的自定義夾爪,或直接換成 BEHAVIOR 中的雙臂機器人后,差距迅速拉開。
![]()
換成雙臂機器人后,完整像素掩碼對機器人形態(tài)的保持明顯更穩(wěn)定。
末端點和骨架只提供稀疏的運動信息,模型容易將新機器人改寫成訓(xùn)練時見過的形態(tài),甚至憑空生成另一臺機器人;直接接收原始動作狀態(tài)的 Ctrl-World,在雙臂機器人上也容易生成靜止或損壞的畫面。
Masked Visual Actions 則直接給出新本體的完整輪廓與運動,因此能夠較穩(wěn)定地保留機器人形態(tài),并繼續(xù)預(yù)測它與環(huán)境的交互。
換句話說,不同機器人的關(guān)節(jié)數(shù)量、動作維度和控制方式可以完全不同,但進入視頻模型后,都被轉(zhuǎn)換成了同一種信息,這讓跨機器人本體泛化成為可能。
兩種填空方式,零樣本切換逆向建模
在此之前,已經(jīng)有一些嘗試證明了「把 URDF 機器人渲染成掩碼并用作視頻模型條件」這一思路的可行性,
例如,BridgeV2W 將機器人動作渲染成像素對齊的本體掩碼,再注入預(yù)訓(xùn)練視頻模型。這種表示能縮小動作坐標(biāo)空間與視頻像素空間之間的差距,并支持不同機器人本體。
與之相比,Masked Visual Actions 把問題進一步抽象為:一段交互視頻中,可以提供任意一部分實體的運動參考,再讓模型補全其余實體。
用填空題類比,BridgeV2W 的題目基本固定為:已知機器人動作,填寫環(huán)境部分。
Masked Visual Actions 則把它概括成:已知交互中的部分實體,填寫剩余部分。
于是,模型獲得了一種逆向使用方式:希望物體這樣運動,機器人應(yīng)該怎么動?
![]()
實際上,論文中的模型主要使用機器人掩碼進行正向訓(xùn)練,推理時卻能直接接收目標(biāo)物體軌跡,零樣本轉(zhuǎn)向逆向建模。作者認(rèn)為,這種能力來自視覺條件與視頻模型內(nèi)部表征之間的對齊。
在更完整的機器人系統(tǒng)中,這兩種推理也許可以連續(xù)配合。
機器人接到 “把杯子放到桌上” 的任務(wù)后,逆向推理先提出可能的動作方案,正向模型再預(yù)演這些方案的結(jié)果,系統(tǒng)選擇可靠軌跡并執(zhí)行。完成一小段動作后,攝像頭重新觀察場景,再進入下一輪規(guī)劃。
更少的數(shù)據(jù),更徹底的接口統(tǒng)一
研究團隊基于 Wan-Fun-Control 2.2 14B 進行 LoRA 微調(diào),數(shù)據(jù)來自 DROID 真實機器人視頻和 RoboCasa 仿真環(huán)境,包含成功與失敗軌跡。
其中失敗樣本十分關(guān)鍵。世界模型需要學(xué)會錯誤動作會產(chǎn)生什么結(jié)果,否則它可能對每一條候選軌跡都生成一個看似成功的未來。
論文中還提到,模型微調(diào)使用了約 15 小時的機器人交互數(shù)據(jù)。
附錄顯示,訓(xùn)練數(shù)據(jù)約包括 1000 條 DROID 演示和 4000 條 RoboCasa 樣本。模型使用 8 張 H200 訓(xùn)練約 10000 步,耗時 4 天。
這套系統(tǒng)依賴 14B 基礎(chǔ)模型和較強硬件,整體并不輕量。
它的數(shù)據(jù)效率主要體現(xiàn)在不需要從頭訓(xùn)練機器人世界模型,而是通過少量機器人樣本激活視頻模型已有的運動、接觸與物體交互知識,并覆蓋了多種能力:
- 預(yù)測機器人動作產(chǎn)生的環(huán)境變化;
- 根據(jù)目標(biāo)物體運動生成機器人行為;
- 適應(yīng)訓(xùn)練中未出現(xiàn)的機器人本體;
- 以及從生成視頻中提取可執(zhí)行行為等。
實驗結(jié)果
實驗中先由 Diffusion Policy 為同一場景采樣多條候選動作后,視頻模型生成對應(yīng)未來,Gemini 3.1 Pro 再從任務(wù)進度、物理真實性和接觸情況等方面評價每段視頻,最后選擇最優(yōu)動作執(zhí)行。
模型規(guī)劃
在關(guān)閉微波爐、打開抽屜、打開洗碗機、關(guān)閉冰箱等任務(wù)中,加入視頻模型規(guī)劃后,成功率獲得了7 至 26 個百分點的提升。候選數(shù)量增加時,整體表現(xiàn)也隨之提高。
![]()
這相當(dāng)于為機器人增加推理時計算:原有策略負(fù)責(zé)提出方案,視頻模型負(fù)責(zé)預(yù)演,視覺語言模型負(fù)責(zé)篩選。策略參數(shù)保持不變,系統(tǒng)通過比較更多未來提高決策質(zhì)量。
策略評估
作者將同一套機器人策略分別放進 RoboCasa 仿真環(huán)境和視頻世界模型中執(zhí)行。模型生成視頻中的成功率,與真實仿真結(jié)果達到0.982的相關(guān)系數(shù)。
![]()
在真實機器人實驗中,生成視頻所體現(xiàn)的任務(wù)進度與實際演示也較為接近。模型仍然存在明顯的樂觀傾向,常常想象出比現(xiàn)實更多的任務(wù)進展。因此,它更適合作為策略開發(fā)早期的低成本篩查工具,距離替代仿真器和實機測試還有較大距離。
逆向動作提取
在 CoffeeServeMug 任務(wù)中,系統(tǒng)輸入杯子的目標(biāo)運動,視頻模型生成機械臂完成操作的過程,逆動力學(xué)模型再提取可執(zhí)行動作。完整管線取得 90% 的成功率,高于論文中對比的 Diffusion Policy、ACT 和 SmolVLA。
![]()
這里的 90% 來自 “視頻模型+逆動力學(xué)模型” 的組合。視頻模型提供行為過程,逆動力學(xué)模型負(fù)責(zé)把過程還原為控制數(shù)據(jù)。
總結(jié)
Masked Visual Actions 將機器人動作、環(huán)境響應(yīng)和結(jié)果評價放入同一個視覺空間,并將正向預(yù)測與逆向生成統(tǒng)一為條件視頻補全。
它也清楚地展示了視頻模型在機器人系統(tǒng)中的一種分工方式:策略提出動作,視頻模型預(yù)演未來,視覺語言模型評價結(jié)果,控制器完成實際執(zhí)行。
現(xiàn)階段,這套方法仍受到基礎(chǔ)視頻模型能力的限制。
模型學(xué)習(xí)的是交互相關(guān)性,缺少嚴(yán)格的因果與物理約束,仍會出現(xiàn)無接觸運動、物體瞬移和任務(wù)結(jié)果憑空完成等現(xiàn)象。視頻生成的速度和成本也限制了實時閉環(huán)控制。逆向流程還需要額外的逆動力學(xué)模型,最終執(zhí)行始終依賴數(shù)值動作和底層控制器。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.