![]()
人類(lèi)不只是用眼睛操控這個(gè)世界。
把一張薄卡片插進(jìn)卡槽、擰開(kāi)一把鎖、從一疊紙杯中分出一個(gè),這些動(dòng)作之所以對(duì)人類(lèi)毫不費(fèi)力,靠的不是視覺(jué),而是指尖傳回大腦的那一點(diǎn)點(diǎn)壓力與滑動(dòng)信號(hào)。然而在機(jī)器人領(lǐng)域,觸覺(jué)長(zhǎng)期被當(dāng)作"錦上添花"的附屬模態(tài),真正決定動(dòng)作的始終是視覺(jué)。
過(guò)去兩年,隨著具身智能和 VLA 模型快速發(fā)展,機(jī)器人的任務(wù)開(kāi)始從"看得見(jiàn)、拿得起"邁向"摸得準(zhǔn)、做得細(xì)"。從 Physical Intelligence 的 π0,到 NVIDIA 的 GR00T,再到 UC Berkeley 的 EgoScale,越來(lái)越多研究開(kāi)始挑戰(zhàn)翻書(shū)、插卡、擰燈泡、分紙杯等接觸密集型任務(wù)。
在一次次的任務(wù)中,研究者們開(kāi)始發(fā)現(xiàn),雖然視覺(jué)負(fù)責(zé)找到物體,但真正決定操作成敗的,往往是接觸發(fā)生后的那幾十毫秒。于是,觸覺(jué)開(kāi)始重新進(jìn)入它們的視野,并被嘗試引入 Transformer 和 VLA 框架,希望讓機(jī)器人擁有類(lèi)似人類(lèi)指尖的反饋能力。
但當(dāng)研究者們嘗試把觸覺(jué)傳感器接入系統(tǒng)時(shí),一個(gè)尷尬的結(jié)果發(fā)生了:模型不僅沒(méi)能學(xué)會(huì)更好的操作,反而更容易出現(xiàn)抓取失誤、動(dòng)作猶豫甚至任務(wù)失敗。很多時(shí)候,觸覺(jué)不如不加。
這個(gè)奇怪的現(xiàn)象引起了一支超級(jí)團(tuán)隊(duì)的注意。最近,來(lái)自 UC Berkeley、NVIDIA、斯坦福、松下等機(jī)構(gòu)的研究者,其中包括斯坦福教授李飛飛、英偉達(dá)具身智能負(fù)責(zé)人 Jim Fan、佐治亞理工學(xué)院助理教授徐丹飛、Pieter Abbeel、Jitendra Malik、Ken Goldberg、Trevor Darrell 等多位知名學(xué)者,聯(lián)合發(fā)表了一篇題為“T-Rex: Tactile-Reactive Dexterous Manipulation”的論文,分析當(dāng)前觸覺(jué)融合方案的根本缺陷,并提出了一套全新的架構(gòu)——T-Rex 來(lái)解決這個(gè)問(wèn)題。
![]()
(來(lái)源:T-Rex)
加了觸覺(jué),反而更差了?
目前最強(qiáng)的機(jī)器人操作策略大多基于視覺(jué)-語(yǔ)言-動(dòng)作模型(VLA),其核心是一個(gè)大型 Transformer 骨干網(wǎng)絡(luò)。當(dāng)研究者引入觸覺(jué)時(shí),最自然的做法就是把觸覺(jué)信號(hào)編碼成 token,和視覺(jué)、語(yǔ)言 token 一起喂進(jìn)同一個(gè) Transformer。這也是大多數(shù)現(xiàn)有工作采用的路線。
增加一種新的感知模態(tài),按理說(shuō)應(yīng)該讓機(jī)器人擁有更精準(zhǔn)的操作能力。然而,論文中的實(shí)驗(yàn)卻得出了相反的結(jié)果:在相同的實(shí)驗(yàn)平臺(tái)和任務(wù)設(shè)置下,將觸覺(jué)力信號(hào)直接拼接到預(yù)訓(xùn)練好的 π0.5 模型中,任務(wù)成功率從 17% 驟降至 6%。也就是說(shuō),加入觸覺(jué)后,模型不僅沒(méi)有表現(xiàn)得更好,反而更容易失敗。
為什么會(huì)這樣?論文指出,核心矛盾在于頻率不匹配。視覺(jué)信號(hào)的更新頻率通常在 5Hz 左右,而觸覺(jué)反饋天然需要在 20Hz 甚至更高的頻率下才能發(fā)揮作用。人在捏一個(gè)雞蛋時(shí),手指對(duì)力度的微調(diào)是毫秒級(jí)的。把這兩種時(shí)間尺度完全不同的信號(hào)塞進(jìn)同一個(gè)以低頻運(yùn)行的 Transformer,不僅無(wú)法發(fā)揮觸覺(jué)的優(yōu)勢(shì),反而會(huì)干擾視覺(jué)模態(tài)已經(jīng)學(xué)好的表征,造成性能退化。
換句話說(shuō),過(guò)去的做法不是"加了觸覺(jué)沒(méi)用",而是"加的方式不對(duì)"。
T-Rex 的核心創(chuàng)新,就是改變觸覺(jué)輸入的方式。把觸覺(jué)從"另一種輸入模態(tài)"重新定義為"另一條獨(dú)立的控制通路"。
它采用了一種混合 Transformer 專(zhuān)家架構(gòu)(Mixture-of-Transformer-Experts,MoT),將整個(gè)系統(tǒng)拆分為三個(gè)專(zhuān)家模塊,各司其職:
![]()
(來(lái)源:T-Rex)
第一個(gè)是潛在專(zhuān)家(Latent Expert),負(fù)責(zé)處理視覺(jué)和語(yǔ)言觀測(cè),預(yù)測(cè)未來(lái)的視覺(jué)表征,為后續(xù)動(dòng)作提供語(yǔ)義上下文。可以把它理解為"看清楚當(dāng)前場(chǎng)景并預(yù)判接下來(lái)會(huì)發(fā)生什么"的模塊。
第二個(gè)是動(dòng)作專(zhuān)家(Action Expert),以大約 5Hz 的低頻運(yùn)行,負(fù)責(zé)粗粒度的動(dòng)作規(guī)劃。它采用條件流匹配(Flow Matching)的方式,從純?cè)肼暢霭l(fā)逐步去噪,生成一個(gè)中間狀態(tài)的動(dòng)作方案——相當(dāng)于先畫(huà)一個(gè)草圖。
第三個(gè)也是最關(guān)鍵的,是觸覺(jué)專(zhuān)家(Tactile Expert)。它以大約 20Hz 的高頻運(yùn)行,接收實(shí)時(shí)觸覺(jué)信號(hào),在動(dòng)作專(zhuān)家產(chǎn)出的"草圖"基礎(chǔ)上進(jìn)行快速修正。它不需要重新處理視覺(jué)和語(yǔ)言信息,而是直接復(fù)用前兩個(gè)專(zhuān)家緩存的上下文,只關(guān)注觸覺(jué)帶來(lái)的即時(shí)反饋。
這種設(shè)計(jì)的精妙之處在于:視覺(jué)和觸覺(jué)不再爭(zhēng)搶同一個(gè) Transformer 的注意力資源,而是在各自最合適的頻率上獨(dú)立運(yùn)作,再通過(guò)級(jí)聯(lián)去噪的方式協(xié)同配合。動(dòng)作專(zhuān)家完成 10 步去噪中的前 6 步,輸出一個(gè)部分去噪的動(dòng)作;觸覺(jué)專(zhuān)家接過(guò)來(lái),用最新的觸覺(jué)數(shù)據(jù)完成剩下的 4 步,輸出最終可執(zhí)行的動(dòng)作。
一套新的觸覺(jué)編碼方式
除了架構(gòu)創(chuàng)新,T-Rex 在觸覺(jué)信號(hào)的編碼和數(shù)據(jù)上也下了功夫。
論文提出了一種時(shí)空觸覺(jué)編碼器(Spatial-Temporal Tactile Encoder),同時(shí)捕捉兩種互補(bǔ)的觸覺(jué)信息:一是力的時(shí)間動(dòng)態(tài)——通過(guò)一個(gè) VQ-VAE(向量量化變分自編碼器)將每根手指過(guò)去 16 幀的六維力向量壓縮為一個(gè)緊湊的離散 token,既能捕捉力的變化趨勢(shì),又能有效抵抗傳感器漂移;二是形變的空間分布——通過(guò)一個(gè)輕量級(jí)卷積網(wǎng)絡(luò)提取指尖形變圖的特征,捕捉接觸面的邊緣、滑移和剪切模式。
兩種信號(hào)拼接后,構(gòu)成觸覺(jué)專(zhuān)家的完整輸入。這種編碼方式既保留了觸覺(jué)的豐富信息,又將其壓縮到了 Transformer 能高效處理的規(guī)模。
數(shù)據(jù)方面,團(tuán)隊(duì)構(gòu)建了 T-Rex 數(shù)據(jù)集。其中包含 100 小時(shí)的雙臂靈巧手遙操作數(shù)據(jù),覆蓋超過(guò) 200 種日常物品和 22 種運(yùn)動(dòng)基元(如抓取、擠壓、插入、擦拭、折疊等),包含 7,700 余條軌跡。每條軌跡都同步記錄了 RGB 圖像、機(jī)器人狀態(tài)、動(dòng)作指令、觸覺(jué)力信號(hào)和形變圖。
![]()
圖|T-Rex 數(shù)據(jù)集圍繞“動(dòng)作 × 物體”組合構(gòu)建(來(lái)源:T-Rex)
與以往針對(duì)特定任務(wù)錄制數(shù)據(jù)不同,T-Rex 數(shù)據(jù)集的設(shè)計(jì)思路是圍繞"動(dòng)詞-名詞"組合來(lái)組織。用 22 個(gè)動(dòng)作原語(yǔ)搭配 200 多種物品,通過(guò)組合覆蓋盡可能多樣的接觸行為。這種方式使得模型能夠?qū)W到通用的觸覺(jué)-動(dòng)作對(duì)應(yīng)關(guān)系,而非記憶特定任務(wù)的模式。
訓(xùn)練采用三階段策略。第一階段是大規(guī)模人類(lèi)視頻預(yù)訓(xùn)練:基于 EgoScale 的方案,在 22,889 小時(shí)的第一人稱(chēng)人類(lèi)視頻上預(yù)訓(xùn)練潛在專(zhuān)家和動(dòng)作專(zhuān)家,獲取廣泛的視覺(jué)運(yùn)動(dòng)先驗(yàn)。第二階段是觸覺(jué)中間訓(xùn)練(mid-training):在 100 小時(shí)的 T-Rex 數(shù)據(jù)集上,將動(dòng)作專(zhuān)家適配到機(jī)器人平臺(tái),同時(shí)訓(xùn)練觸覺(jué)專(zhuān)家。第三階段是技能微調(diào)(post-training):對(duì)特定任務(wù)使用約 100 條示范進(jìn)行微調(diào)。
這種漸進(jìn)式訓(xùn)練的好處在于:觸覺(jué)能力不需要從頭學(xué),而是在視覺(jué)運(yùn)動(dòng)先驗(yàn)已經(jīng)建立之后,以相對(duì)較少的數(shù)據(jù)"嫁接"進(jìn)來(lái)。
12 項(xiàng)任務(wù),平均領(lǐng)先 30 個(gè)百分點(diǎn)
對(duì)于 T-Rex 的最終效果,論文在 12 項(xiàng)需要精細(xì)力控和接觸感知的真實(shí)世界任務(wù)上進(jìn)行了評(píng)估。這些任務(wù)包括翻書(shū)頁(yè)、轉(zhuǎn)移雞蛋、擦盤(pán)子、擠牙膏、分紙杯、分揀麻將、開(kāi)鎖、填藥盒、酸堿中和滴定、抽卡片、發(fā)撲克牌和擰燈泡。每一個(gè)都需要機(jī)器人對(duì)接觸力進(jìn)行動(dòng)態(tài)調(diào)節(jié)。
結(jié)果顯示,T-Rex 在所有任務(wù)上均取得了最高的成功率,平均達(dá)到 65%,比最強(qiáng)基線 EgoScale 的 35% 高出了 30 個(gè)百分點(diǎn)。在翻書(shū)頁(yè)、轉(zhuǎn)移雞蛋、分紙杯等任務(wù)上,T-Rex 分別達(dá)到了 96%、75%、78% 的成功率。
![]()
圖|12 項(xiàng)真實(shí)世界靈巧操作任務(wù)評(píng)測(cè)結(jié)果(來(lái)源:T-Rex)
消融實(shí)驗(yàn)進(jìn)一步證實(shí)了幾個(gè)關(guān)鍵結(jié)論。去掉所有觸覺(jué)輸入后,平均成功率從 65% 降至 42%,下降了 23 個(gè)百分點(diǎn),說(shuō)明觸覺(jué)信號(hào)確實(shí)至關(guān)重要。去掉異步執(zhí)行機(jī)制(讓觸覺(jué)專(zhuān)家和動(dòng)作專(zhuān)家以相同頻率同步運(yùn)行),性能下降 5 個(gè)百分點(diǎn),驗(yàn)證了頻率解耦的必要性。而在數(shù)據(jù)效率方面,經(jīng)過(guò)觸覺(jué)中間訓(xùn)練的模型在僅使用 10 條任務(wù)示范時(shí)就能達(dá)到可用水平,遠(yuǎn)優(yōu)于未經(jīng)中間訓(xùn)練的版本。
回過(guò)頭看,T-Rex 的成功主要來(lái)自幾個(gè)相互配合的設(shè)計(jì)。
首先是頻率解耦。視覺(jué)以約 5 Hz 的頻率運(yùn)行,負(fù)責(zé)理解場(chǎng)景;觸覺(jué)則以約 20 Hz 的頻率持續(xù)更新,負(fù)責(zé)感知接觸后的細(xì)微變化,兩者互不干擾。這不僅更符合人類(lèi)處理視覺(jué)和觸覺(jué)的方式,也避免了高頻觸覺(jué)信號(hào)被低頻模型“淹沒(méi)”,難以發(fā)揮作用。
其次是分工明確。動(dòng)作專(zhuān)家先規(guī)劃整體動(dòng)作,相當(dāng)于先確定“大方向”;觸覺(jué)專(zhuān)家再根據(jù)實(shí)時(shí)觸覺(jué)反饋,對(duì)動(dòng)作進(jìn)行快速微調(diào)。這樣一來(lái),視覺(jué)負(fù)責(zé)“決定做什么”,觸覺(jué)負(fù)責(zé)“決定怎么做得更準(zhǔn)”,兩者各自發(fā)揮優(yōu)勢(shì)。
第三是計(jì)算上的優(yōu)化。觸覺(jué)專(zhuān)家不需要每次都重新處理視覺(jué)和語(yǔ)言信息,而是直接利用動(dòng)作專(zhuān)家已經(jīng)計(jì)算好的結(jié)果,只專(zhuān)注于處理最新的觸覺(jué)反饋。這既減少了計(jì)算量,也讓觸覺(jué)能夠以 20 Hz 的頻率實(shí)時(shí)運(yùn)行,真正跟上機(jī)器人操作時(shí)的節(jié)奏。
局限與未來(lái)方向
不過(guò),在結(jié)尾部分論文也坦承了當(dāng)前的局限。對(duì)于需要更長(zhǎng)時(shí)間、更高精度協(xié)調(diào)的任務(wù),比如那些遙操作本身就很困難的場(chǎng)景。純粹的行為克隆仍然受限于示范數(shù)據(jù)的分布,未來(lái)可能需要引入強(qiáng)化學(xué)習(xí)或在線交互來(lái)突破瓶頸。
硬件層面,觸覺(jué)傳感器本身的局限也是瓶頸:傳感器漂移、設(shè)備間的標(biāo)定差異、以及目前僅限于指尖而非全手掌的感知覆蓋,都限制了系統(tǒng)的上限。論文建議未來(lái)探索跨異構(gòu)傳感器的統(tǒng)一表征,以及覆蓋整個(gè)手掌的更密集觸覺(jué)硬件。
T-Rex 這篇工作給出的核心啟示或許可以用一句話概括:觸覺(jué)不應(yīng)該被當(dāng)作視覺(jué)的附庸,而應(yīng)該被當(dāng)作一個(gè)獨(dú)立的控制回路。
過(guò)去幾年,機(jī)器人學(xué)習(xí)領(lǐng)域習(xí)慣了"萬(wàn)物皆 token"的思路——把所有模態(tài)統(tǒng)一編碼、扔進(jìn)同一個(gè)大模型。這個(gè)范式在視覺(jué)和語(yǔ)言上取得了巨大成功,但當(dāng)觸覺(jué)這種天然高頻、需要即時(shí)響應(yīng)的信號(hào)加入時(shí),統(tǒng)一架構(gòu)的弊端就暴露了出來(lái)。T-Rex 的 MoT 架構(gòu)提供了一種更尊重信號(hào)物理特性的融合方式,也為未來(lái)多模態(tài)機(jī)器人系統(tǒng)的設(shè)計(jì)提供了新的思路。
論文鏈接:https://arxiv.org/abs/2606.17055
項(xiàng)目主頁(yè):https://tactile-rex.github.io/
運(yùn)營(yíng)/排版:何晨龍
注:封面/首圖由 AI 輔助生成
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.