新智具身聯合復旦大學發布N?系列技術報告:用 3 萬小時觸覺數據補齊具身智能 “手感”。
先來看一段現場實景錄制的視頻:
![]()
https://mp.weixin.qq.com/s/dJlmI9wromZWL-c8T9d7Mw
視頻里機器人能干的活兒特別多:煮雞蛋面、調檸檬水這些居家料理,還有收納整理,它樣樣拿手;就連工廠流水線裝配、精細零件組裝、線材纏繞梳理這些精細活也全都不在話下。這正是 N?系列模型展現出的強大實操能力。
不知道大家有沒有見過機器人實操翻車的名場面:插頭邊緣反復摩擦卻難以插入、抓取塑料瓶時力道失控導致瓶身癟陷、疊好的毛巾在松手瞬間散落…… 在具身智能的落地進程中,這類 “視覺系統判定無誤,但物理交互瞬間翻車” 的現象屢見不鮮。
這些失敗指向了一個行業共識:決定機器人能否在真實物理世界中生存的關鍵,往往不只在于視覺感知的精度,而更在于接觸瞬間的觸覺反饋。攝像頭能確認空間位置,卻無法感知 “是否接觸”、“頂到邊緣”、“夾力過載” 或 “發生滑移” 等,缺失這層反饋,正是阻礙機器人跨越 “最后一厘米” 的核心痛點。
近日,上海新智具身智能科技有限公司(NeoteAI)聯合復旦大學可信具身智能研究院,正式發布了N?系列三份技術報告,把觸覺從 “輔助模態” 躍升為 “核心基建”。 三份報告合起來看,恰好拼出一張藍圖 —— 一套觸覺數據底座,搭配兩條不同側重的技術路線。
更具行業價值的是,項目的數據和模型會進行開源,可以直接查看項目的完整鏈接:
https://research.neoteai.com
N?-Foundation:統一觸覺 “方言”,構建 3 萬小時交互語料庫
觸覺數據的規模化應用長期受制于各類觸覺設備輸出的數據格式互不兼容。不同傳感器輸出的凝膠形變圖、電容矩陣或六維力向量,猶如缺乏統一語法的方言,難以在同一模型中融合。
為此,NeoteAI 搭建的 NeoData 數據集旨在打破這一壁壘:
- 包含超 3 萬小時視覺 - 觸覺交互視頻;
- 約 140 萬條操作片段,33 億個時間步;
- 對應 80 億幀 RGB 畫面與 100 億幀觸覺圖像;
- 動用 Franka、Piper、UR5e 等 6 種機器人本體;
- 覆蓋 450 項真實長程任務(如疊衣、插拔接頭、倒液體等),由 90 位操作員采集;
- 已開源 5 千小時視覺-觸覺交互視頻。
![]()
另外,團隊還提出了 NeoForce 統一表征模型。無論底層傳感器硬件如何,都能夠學習到具備遷移能力、時序結構化的觸覺表征,以供下游具身智能策略使用:哪里被按?按多大力?有沒有橫向拉扯?這種 “觸覺普通話” 有效解決了跨設備數據融合難題。
為了更直觀地理解,下面的視頻完整介紹了 N?-Foundation 的各項核心功能,包含硬件、數據樣例、全面評測等。
![]()
https://mp.weixin.qq.com/s/dJlmI9wromZWL-c8T9d7Mw
N?-VTLA:以 “觸覺預判” 賦能輕量級 VLA
數據底座夯實后,團隊接下來思考的是如何將觸覺真正融入到 VLA 技術路線之中。
在現有的多模態融合實踐中,直接將觸覺圖像與 RGB 視覺信號進行簡單拼接往往面臨挑戰:由于觸覺信號僅在物理接觸瞬間產生高頻響應,大部分時間處于 “靜默” 狀態,極易被海量視覺 Token 淹沒。更為關鍵的是,即便模型成功提取了當前觸覺特征,其本質上仍是對已發生動作的滯后反饋 —— 這種 “后視鏡” 式的感知機制,使得在動態交互中始終慢半拍。
![]()
N?-VTLA 提出了一種全新的方案:不依賴滯后的當前觸覺,而是預測未來 50 步內的觸覺演變。該模型將當前觸覺編碼為緊湊的潛在 Token,結合視覺上下文預判滑移、受力等趨勢,從而指導動作模塊提前調整。不同任務上顯示:N?-VTLA 在插插頭任務中成功率達 85%,而同類視覺方案僅 60%;在拔鑰匙的任務成功率達 99%,而視覺方案為 35%。
此外,N?-VTLA 還突破了傳統模仿學習僅依賴專家成功軌跡的局限,讓機器人從失敗數據中實現自主進化。模型結合觸覺信息利用部署后數據以及 human in the loop 的數據訓練了一個進度評估模型,使其能夠識別任務執行階段,甚至識別出 “退步” 與 “救場” 等復雜行為。通過結合離線強化學習,機器人在毛巾折疊、書包收納、紙箱折疊等長程任務上的成功率,分別從 50%、35%、20% 大幅躍升至 95%、80%、75%,真正實現了從失敗經驗中汲取教訓的持續進化。
![]()
下面的視頻直觀的展示了 N?-VTLA 在精細化操作方面的強大能力。
![]()
https://mp.weixin.qq.com/s/dJlmI9wromZWL-c8T9d7Mw
N?-TWAM:在世界模型中重構 “觸覺想象”
如果說N? -VTLA 是加裝預判雷達,N?-TWAM 則是對機器人 “認知中樞” 的重構:它把觸覺放進世界模型,讓機器人在動手之前,先在自己的 “想象” 里完整的推演一遍操作視角和手感。
現有世界模型大多局限于未來視覺圖像的生成,在驅動真實機器人時面臨嚴峻的物理對齊挑戰:畫面里杯子被抓住了,但手指夾沒夾穩?畫面里插頭對齊了,但下一秒會不會卡住?這些觸感信息完全缺失。
N?-TWAM 要做的是同時預測未來的視頻、觸覺和動作這三個相互耦合的序列。N?-TWAM 采用混合專家架構,內置視頻、觸覺、動作三個異步專家網絡,視頻專家從預訓練模型熱啟動,觸覺和動作專家用更窄的結構,最終總參數量 72 億,僅相當于全寬方案的一半。
![]()
在仿真與真機測試中,N?-TWAM 展現出顯著優勢:仿真平均成功率達 84.5%(而世界模型最強基線為 36%);真機 8 項任務平均成功率 46.3%(LingBot-VA 為 21.9%)。消融實驗進一步證實,去除 “未來觸覺預測” 或 “當前觸覺條件” 均會導致性能顯著下降,確立了觸覺在世界模型中的不可或缺性。
![]()
以下視頻展示了 N?-TWAM 的模型實際操作能力。
![]()
https://mp.weixin.qq.com/s/dJlmI9wromZWL-c8T9d7Mw
觸覺:具身智能的下一個 Scaling Law?
縱觀N?系列三份報告,NeoteAI 釋放了明確的行業信號:N?-Foundation 驗證了觸覺模態具備類似視覺的 Scaling 潛力;N?-VTLA 證明了觸覺可以自然的接入現有 VLA 架構;N?-TWAM 確立了觸覺在世界模型頂層設計中的核心地位,使其與視覺模態真正平起平坐。
這意味著,機器人的認知范式正從單一的 “視覺驅動” 向 “視觸融合” 演進。它們不再僅僅通過 “看” 來理解世界,而是開始像嬰兒一樣,通過主動的觸覺探索來驗證假設并規劃下一步動作。“看得見杯子不等于拿得穩,認得出插座不等于插得進”—— 這一物理世界的常識,終于被寫入了機器人的底層邏輯。
盡管距離 “隨手一摸即知輕重” 的通用具身智能仍有長路要走,真實場景下的數據采集成本、跨本體泛化能力以及推理實時性仍是亟待攻克的工程難題,但 NeoteAI 的這組工作已實質性地推動觸覺從 “小眾研究方向” 躍升為 “具身智能核心基建”。
![]()
具身智能的下一篇章,或許不再僅僅是 “讓機器人看懂世界”,而是真正 “讓機器人摸透世界”。
- 項目鏈接:https://research.neoteai.com
- 公司官網:https://www.neoteai.com
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.