![]()
問題背景:2D 視頻世界模型的表征局限
近兩年,視頻生成模型在具身智能領(lǐng)域受到持續(xù)關(guān)注。從 UniPi、SuSIE 到各類 action-conditioned video generation 變體,其核心思路一致:先由模型生成一段未來視頻,再從中提取動作信號供機(jī)器人執(zhí)行。
這一范式存在一個長期未被解決的問題 ——2D像素預(yù)測與 3D 物理世界之間存在本質(zhì)性的表征鴻溝。該鴻溝主要體現(xiàn)在三個方面。
其一,2D視頻不包含深度信息。機(jī)器人需要判斷目標(biāo)物體與末端執(zhí)行器的確切距離(例如 30 厘米或 50 厘米),而純像素預(yù)測只能給出物體在畫面中的大致方位,不足以支撐精確操控。
其二,2D 模型缺乏顯式的運(yùn)動場。像素預(yù)測可反映物體發(fā)生了位移,卻無法給出每個像素在三維空間中的位移方向與幅度,而末端執(zhí)行器的關(guān)節(jié)角需從這類三維運(yùn)動中推導(dǎo)。
其三,缺乏幾何約束的視頻生成容易產(chǎn)生 “物理幻覺”。同一物體在相鄰幀間出現(xiàn)尺度變化或形狀形變,本應(yīng)發(fā)生碰撞的物體互相穿模。這類瑕疵對人眼影響有限,但對依賴精確控制的機(jī)器人構(gòu)成顯著的信號噪聲。
阿里巴巴達(dá)摩院最新工作 RynnWorld-4D 正是針對這一問題:世界模型在生成視頻的同時生成深度與光流,直接輸出帶有幾何結(jié)構(gòu)與運(yùn)動軌跡的 4D 預(yù)測。
![]()
- 論文標(biāo)題:RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
- 項(xiàng)目主頁:https://alibaba-damo-academy.github.io/RynnWorld-4D.github.io
- 論文鏈接:https://arxiv.org/abs/2607.06559
- 代碼鏈接:https://github.com/alibaba-damo-academy/RynnWorld-4D
表征設(shè)計(jì):RGB-DF 構(gòu)成物理錨定的 4D 表征
![]()
圖 1:RynnWorld-4D 整體流程。給定單張 RGB-D 圖像與一條語言指令,模型在同一擴(kuò)散過程內(nèi)同步生成未來的 RGB 視頻、深度圖序列與光流場。
RynnWorld-4D 的首要設(shè)計(jì)選擇,是采用 RGB-DF(RGB + Depth + Flow)表征,而非 RGB-DN(RGB + Depth + Normal)或 3D Gaussian / NeRF。
表面法線(Normal)描述的是靜態(tài)幾何屬性,即某一表面的朝向,適用于靜態(tài)重建;而操作任務(wù)更關(guān)注物體上某一點(diǎn)的運(yùn)動方向與位移幅度。光流提供了每個像素在相鄰幀之間的 2D 位移;在已知深度圖的前提下,該 2D 位移可反投影回 3D 空間,得到三維場景流(3D Scene Flow)。
深度圖給出每個點(diǎn)在三維空間中的位置,光流給出其在下一幀的去向,兩者結(jié)合構(gòu)成完整的 per-point 三維運(yùn)動矢量。該表征與機(jī)器人的動作空間天然對齊 —— 末端執(zhí)行器的位移本質(zhì)上是三維空間中的軌跡。相比讓策略網(wǎng)絡(luò)從純像素變化中隱式推斷三維運(yùn)動,顯式提供運(yùn)動場更為高效。
不采用 NeRF 或 3DGS 的原因在于:這類方法幾何精度雖高,但需要多視角輸入,且難以繼承大規(guī)模視頻擴(kuò)散模型的生成先驗(yàn)。RGB-DF 保持了 2D 對齊形態(tài),可直接在 Wan 2.2 等強(qiáng)視頻模型基礎(chǔ)上擴(kuò)展,從而復(fù)用已有的紋理生成能力。
架構(gòu)設(shè)計(jì):三分支協(xié)同與跨模態(tài)對齊
![]()
圖 2:RynnWorld-4D 架構(gòu)總覽。三分支 Transformer 分別建模視覺紋理、空間幾何與運(yùn)動軌跡,并通過聯(lián)合跨模態(tài)注意力(JA)與幀級 3D RoPE 實(shí)現(xiàn)跨模態(tài)對齊。
RynnWorld-4D 的架構(gòu)核心是:三種模態(tài)各自保留獨(dú)立的特征空間,并在關(guān)鍵節(jié)點(diǎn)強(qiáng)制對齊。
具體實(shí)現(xiàn)為三分支 Transformer,基于 Wan 2.2-TI2V-5B(30 層 DiT,hidden dim 3072)擴(kuò)展。每個分支擁有獨(dú)立的 self-attention 與 FFN,分別處理 RGB 紋理、深度幾何與光流運(yùn)動。消融實(shí)驗(yàn)表明,若三種模態(tài)共享 FFN,性能顯著下降,原因在于紋理、幾何與運(yùn)動的 latent space 本質(zhì)異質(zhì),共用同一非線性變換會造成表示干擾。
為保證三條分支相互對齊,模型引入聯(lián)合跨模態(tài)注意力(Joint Cross-Modal Attention, JA):每隔 3 個 Transformer block 插入一個 JA 模塊(共 10 個),每個分支的 query 會 attend 到另外兩個分支的 key/value。
- RGB 分支在生成紋理時,參考深度提供的幾何邊界與光流提供的運(yùn)動方向;
- 深度分支在生成幾何時,從 RGB 紋理中獲取物體邊緣等線索;
- 光流分支在預(yù)測運(yùn)動時,結(jié)合深度變化與紋理位移校準(zhǔn)方向。
JA 中的 cross-attention 會為 query 與 key 施加幀級的 3D 旋轉(zhuǎn)位置編碼(3D RoPE),使跨模態(tài)注意力僅在同一時間幀的空間對應(yīng)位置生效,而非進(jìn)行全局語義平均。消融實(shí)驗(yàn)顯示,去掉 3D RoPE 后深度精度(δ1)由 0.610 降至 0.450、光流誤差(AEPE)由 0.170 升至 0.210,表明空間級對齊是必要的。
分階段訓(xùn)練:模態(tài)適配與聯(lián)合對齊
三個分支無法直接從頭聯(lián)合訓(xùn)練:RGB 分支繼承了預(yù)訓(xùn)練視頻模型的強(qiáng)先驗(yàn),而深度與光流分支需重新適配不同的數(shù)據(jù)分布。為此,RynnWorld-4D 采用三階段策略。
Stage 1(模態(tài)適配):關(guān)閉 JA 模塊,三個分支獨(dú)立訓(xùn)練。深度與光流分支從 RGB 預(yù)訓(xùn)練權(quán)重出發(fā),適配至各自的目標(biāo)分布。
Stage 2(凍結(jié)主干 + 訓(xùn)練 JA):凍結(jié)三個分支的 backbone,僅訓(xùn)練新插入的 JA 模塊,用于建立跨模態(tài)對齊路徑,同時不破壞已學(xué)到的模態(tài)內(nèi)表示。
Stage 3(全參數(shù)聯(lián)合微調(diào)):解凍全部參數(shù),在完整數(shù)據(jù)集上進(jìn)行聯(lián)合 SFT,進(jìn)一步精化三模態(tài)協(xié)同。
此外,訓(xùn)練中采用 Branch Dropout 機(jī)制:隨機(jī)丟棄深度或光流分支的輸入(Stage 2 概率 0.2,Stage 3 概率 0.1),迫使 JA 從可見模態(tài)重建缺失模態(tài)。該機(jī)制使推理階段在部分幀深度估計(jì)存在噪聲時,模型仍可通過 RGB 與光流相互補(bǔ)償。
數(shù)據(jù)構(gòu)建:2.54 億幀 4D 數(shù)據(jù)的標(biāo)注管線
![]()
圖 3:Rynn4DDataset 1.0 的數(shù)據(jù)構(gòu)成。
4D 世界模型的核心瓶頸之一是:同時具備 RGB、深度與光流標(biāo)注的大規(guī)模視頻數(shù)據(jù)幾乎不存在。RynnWorld-4D 的解決方案是自建 Rynn4DDataset 1.0—— 融合人類第一人稱活動視頻(Epic-Kitchens、EgoVid)與多源機(jī)器人操作數(shù)據(jù)(RoboMIND、RDT-1B、Galaxea、RoboCoin、AgiBot),總規(guī)模超過 2.54 億幀。
在數(shù)據(jù)規(guī)模之外,標(biāo)注質(zhì)量是關(guān)鍵。每一幀均經(jīng)過三重標(biāo)注:由 Qwen3-VL 生成細(xì)粒度語言描述,由 Depth Anything 3 估計(jì)深度圖(統(tǒng)一歸一化至 0–5 米),由 DPFlow 計(jì)算稠密光流。該標(biāo)注流水線使任意一段普通視頻都能轉(zhuǎn)化為帶 4D 標(biāo)簽的訓(xùn)練樣本,從而緩解真實(shí) 4D 標(biāo)注數(shù)據(jù)稀缺的問題。
消融實(shí)驗(yàn)驗(yàn)證了數(shù)據(jù)規(guī)模的作用:去掉大規(guī)模預(yù)訓(xùn)練后,光流誤差(AEPE)由 0.170 升至 0.729,惡化超過 4 倍。這表明僅依賴少量任務(wù)數(shù)據(jù)不足以學(xué)到復(fù)雜的時空動態(tài)先驗(yàn),數(shù)據(jù)規(guī)模對 4D 世界模型具有決定性影響。
策略學(xué)習(xí):單次前向推理生成動作
世界模型用于策略學(xué)習(xí)的常見方式是:先完整執(zhí)行去噪過程生成未來視頻,再由 inverse dynamics model 從視頻中提取動作。該流程的主要問題是延遲高 —— 多步去噪、視頻解碼與逆動力學(xué)疊加,使高頻閉環(huán)控制難以實(shí)現(xiàn)。
RynnWorld-4D-Policy 不要求世界模型完成完整生成過程,而是直接從 RynnWorld-4D 的中間層特征中提取 4D 信息,具體為第 15 層 Transformer block 在 diffusion timestep t=500 時的 hidden state。此時的中間 latent 已編碼未來的幾何演化與運(yùn)動趨勢,尚未被解碼為可視化視頻幀。
隨后,一個 Flow Former 將高維特征壓縮為固定大小的 token,一個輕量的 flow matching head 通過 4 步 ODE 采樣輸出 10 步動作(54 維)。整個推理僅需一次前向傳播,無需迭代去噪。
在單張 RTX 5090(FP8 量化 + FlashAttention 3)上,完整推理周期約 1.1 秒。由于每次輸出 10 步動作并行執(zhí)行(action chunking),實(shí)際有效控制頻率約為 9 Hz,可覆蓋大多數(shù)人類尺度的操作任務(wù)。
實(shí)驗(yàn)結(jié)果:4D 預(yù)測能力的量化驗(yàn)證
生成質(zhì)量:幾何精度與視覺保真度
![]()
表 1:4D 生成質(zhì)量定量評測與結(jié)構(gòu)消融。指標(biāo)涵蓋視覺保真度(RGB)、幾何結(jié)構(gòu)(Depth)與運(yùn)動(Flow);N/A 表示該基線不具備生成對應(yīng)模態(tài)的能力。
在 50 段測試視頻上,RynnWorld-4D 的生成質(zhì)量可從三個維度評估。
視覺保真度:與純視頻生成模型 Wan-14B 持平或更優(yōu)(SSIM 0.754 vs. 0.536),表明引入深度與光流分支未降低 RGB 質(zhì)量,反而通過互約束提升了結(jié)構(gòu)一致性。
幾何精度:深度 δ1 為 0.610,是 TesserAct(0.279)的 2.2 倍、4DNeX(0.327)的 1.9 倍,驗(yàn)證了聯(lián)合跨模態(tài)注意力的有效性。
運(yùn)動精度:AEPE 為 0.170,是當(dāng)前唯一能同時輸出稠密光流場的 4D 世界模型;其他方法或不生成光流(TesserAct、Free4D),或不具備運(yùn)動場輸出能力。
![]()
圖 4:生成效果展示。RynnWorld-4D 同步生成時間連貫的 RGB、深度與光流序列,幾何結(jié)構(gòu)清晰、跨模態(tài)邊界精確對齊。
定性結(jié)果呈現(xiàn)三個特征。其一為跨模態(tài)一致性:深度圖中的幾何邊界與光流中的運(yùn)動邊界均與 RGB 紋理變化精確對齊,模態(tài)之間不存在割裂;例如機(jī)械臂拾取蘋果時,深度圖中蘋果輪廓的變化與光流中蘋果的運(yùn)動向量保持同步。其二為物理真實(shí)性:無論人手操作還是機(jī)械臂軌跡,模型均能準(zhǔn)確刻畫物體位移與多接觸點(diǎn)交互等復(fù)雜 4D 動態(tài)。其三為時序穩(wěn)定性:生成序列在時間維度上結(jié)構(gòu)穩(wěn)定,未出現(xiàn)傳統(tǒng)視頻模型常見的物體閃爍或形狀突變;即使在多物體近距離交互場景下,深度與光流分支的互約束也有效抑制了尺度抖動與形變。上述結(jié)果表明,在同一擴(kuò)散去噪過程中聯(lián)合建模 RGB、深度與光流,三者之間形成了較強(qiáng)的物理互約束。
策略表現(xiàn):雙臂靈巧操作任務(wù)對比
![]()
圖 5:六項(xiàng)真實(shí)世界雙臂靈巧操作任務(wù)示意及成功率對比。
策略評估在六項(xiàng)真實(shí)世界雙臂靈巧操作任務(wù)上進(jìn)行(每項(xiàng) 35 次試驗(yàn))。硬件平臺為天機(jī) M6 雙臂機(jī)器人,配備 WUJI HAND 靈巧手,通過 RealSense D435i 獲取第一人稱視角圖像作為觀測輸入。對比基線包括 Diffusion Policy、π0 與 π0.5。值得關(guān)注的對比結(jié)果包括:
- 雙手物體傳遞(Hand-over):RynnWorld-4D-Policy 成功率為 28.57%,π0 為 2.86%,π0.5 為 0%。該任務(wù)需要推理兩個高自由度末端執(zhí)行器之間的相對三維距離與潛在自遮擋,2D 策略難以完成,而 RynnWorld-4D 的 4D latent 本身包含此類幾何信息。
- 蓋子放置(Lid Placement)與碗具堆疊(Bowl Stacking):均達(dá)到 65.71%,較次優(yōu)方法高出 8.5%。兩項(xiàng)任務(wù)對空間精度要求高(蓋子需對準(zhǔn)盒口、碗需平穩(wěn)疊放),深度與光流提供的顯式幾何信號在此發(fā)揮關(guān)鍵作用。
- 關(guān)于 π0 / π0.5 在上述任務(wù)上表現(xiàn)不佳的原因,論文給出兩點(diǎn)分析:其一,其預(yù)訓(xùn)練數(shù)據(jù)以平行夾爪為主,缺乏靈巧手先驗(yàn);其二,在雙手協(xié)作場景中,純 2D 表征無法有效推理兩個末端執(zhí)行器之間的空間關(guān)系。這屬于表征空間的根本限制,而非單純的數(shù)據(jù)量不足。
論文進(jìn)一步進(jìn)行了模態(tài)貢獻(xiàn)的消融。僅使用 RGB latent 時,多數(shù)任務(wù)成功率較完整模型低 10–20 個百分點(diǎn);加入深度后,空間精度要求高的任務(wù)(如 Hand-over、Bimanual Lifting)明顯受益;加入光流后,運(yùn)動敏感任務(wù)(如 Block Pushing)表現(xiàn)提升;三者聯(lián)合時達(dá)到最佳。該結(jié)果驗(yàn)證了 RGB-DF 表征的協(xié)同價(jià)值:紋理提供外觀語境,深度提供空間錨定,光流提供運(yùn)動線索。
展望:4D 世界模型的下一步
回望這條路線,具身世界模型正從二維視頻想象走向四維物理推演。RynnWorld-4D 第一次在單一擴(kuò)散框架內(nèi)實(shí)現(xiàn)了 RGB - 深度 - 光流的協(xié)同生成,并證明這種 4D 預(yù)測能力可以直接轉(zhuǎn)化為真機(jī)閉環(huán)控制的增益。當(dāng)然,約 9 Hz 的頻率對超高頻精密任務(wù)仍是瓶頸,單一第一人稱視角也尚未覆蓋多機(jī)協(xié)作 —— 這些正是推理加速與多視角拓展的方向。而隨著操作任務(wù)對精準(zhǔn)三維理解的需求不斷加深,能同時預(yù)測幾何與運(yùn)動的 4D 世界模型,或許會成為連接感知與決策越來越關(guān)鍵的一環(huán)。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.