![]()
一個人站在貨架前,戴著一副頭戴設備,拿起一瓶飲料,觀察標簽,再把它放回正確的位置。
幾米之外的大屏上,這個簡單的動作被分解成另一種語言:視線落點、手部軌跡、物體位置、抓取過程,以及任務是否完成。數據隨后進入虛擬貨架,機器人在里面一遍遍練習。最后,一臺上千公里外的實體機器人伸出手臂,做出同樣的動作。
從人類動手演示,到機器學會動手,看上去只隔著幾塊屏幕。
但機器人真的“學會”了嗎?它換一排貨架、換一種瓶子,甚至只是光線暗了一點,還能不能把事情做對?
這是今天具身智能面臨的,最現實、最根本的問題。
過去一年,VLA、世界模型、世界動作模型輪番成為熱門概念,行業融資不斷,機器人本體和模型能力也在快速進步。很容易產生一種錯覺:只要模型再更新幾輪,通用機器人就會自然出現。
現實卻沒有這么簡單。
大語言模型的幸運,是互聯網已經替它準備了幾十年的文本、圖片和代碼。具身智能面對的物理世界,卻沒有一套現成的語料庫。網上當然有海量視頻,但視頻通常只記錄“發生了什么”,卻不記錄里面的人為什么這樣做、動作是否成功、用了多大力度,以及失敗后如何糾正。
具身智能的發展,缺少能夠被學習、被評測、被證明有效的現實經驗。
今年WAIC上,京東展示了一套新解法:先把人類在真實場景中工作的過程采集下來,再用模型驗證這些數據是否有用,最后把能力裝回機器人和智能設備,在現實里跑起來,然后繼續收集數據,再優化模型,再跑……
物理世界,可能才是機器人最好的老師。
機器人不是缺舞臺,是缺"班"上
大模型通過學習人類書籍、圖片和視頻,獲得了在數字世界里對話、編程、操作軟件的能力。但要讓AI驅動機器人,在物理世界里像人一樣做家務、搬磚、種地,視頻是不夠的。
一段人在貨架前整理飲料的視頻,對人幾乎不需要解釋;對機器人而言,畫面里卻缺失了大量關鍵信息:人在找什么,為什么選擇這個瓶子,手應該從哪個方向接近,抓取力度如何變化,商品最后放到什么位置才算完成任務。
更麻煩的是,具身智能的訓練對數據質量的要求極高,低質量的數據甚至還會讓機器人“降智”。
京東曾經做過一組對照實驗:同樣是一萬小時數據,一組經過較嚴格的質量控制,另一組存在一定瑕疵。結果并不是“有總比沒有強”。當后者繼續擴量,機器人的任務準確率和泛化能力并未同步上升,在一些任務中甚至出現下降。
比如,模型在訓練中見過一種礦泉水瓶,換成尺寸和形狀不同的飲料瓶后,還能否正確抓取?如果數據只教會機器人復現一個固定動作,而沒有讓它理解任務和環境,數據量越大,模型可能只是把錯誤學得更牢。
因此,數據標準不能只由采集環節決定,必須由模型和真機結果反向定義。數據采下來以后,需要經過軌跡提取、自動標注、質量篩選和結構化處理,再進入仿真環境和模型訓練,最后回到實體機器人上驗證。只有機器人成功率、泛化能力和任務理解發生提升,這批數據才算真正產生價值。
京東正在做的,正是把這幾個原本分散的環節串成一條生產線。
人戴上JoyEgoCam,在零售、物流、家庭、工業等真實環境中完成任務;第一視角視頻被加工成模型能夠消化的數據;JoyAI-Sim等工具再把人類數據、仿真數據和真機數據連接起來,供模型訓練和評測;最終,機器人回到貨架、倉庫和其他作業現場完成任務。
![]()
京東已開源行業最大的人類視角數據集EgoLive,包含約2000小時高保真雙目視頻、超過6.5萬段數據和346類任務。同時,京東還在采集手部力學、導航、全身軌跡等更多類型的數據,目標是生產千萬小時量級的高質量數據。
但小時數并不是京東在這場競爭里最重要的籌碼。
真正稀缺的,是能夠持續產生數據的現實任務。理貨、分揀、搬運、維修和家庭服務,不是為了訓練機器人臨時搭建的攝影棚,而是每天都在發生、有明確目標,也有結果可以檢驗的工作。
這也是京東切入具身數據的邏輯。它的價值不在于搭了多少個數據采集中心或者雇了多少數據采集員,而在于能不能把一個持續運轉的現實業務體系,改造成具身智能的數據生產線。每一次真實操作,都可能成為新的訓練樣本;每一次失敗,也可能暴露模型下一步應該補什么課。
今天不少公司都能采購設備、組織人員拍攝數據,難的是把采集、處理、訓練和驗證長期跑下去,并把單小時成本降到產業能夠承受的水平。京東披露,其數據處理成本已經較早期下降十倍以上。這意味著具身數據正在從一次性科研項目,逐漸接近可以規模化生產。
數據是沉默的,但能力是會動的
數據并不會自動變成機器人的能力。
人類完成一次補貨任務,只需要憑經驗判斷商品應該放在哪里,伸手、抓取、移動,再確認擺放是否完成。但對模型而言,這個過程必須被拆解成一系列可以學習的問題:它看到了什么,理解了什么,下一步應該做什么,又該如何判斷行動結果。
這也是物理AI與聊天機器人的根本區別。后者面對的通常是一次提問和一次回答,前者面對的卻是持續變化的畫面、聲音、空間和人的行為。它不僅要理解世界,還要在正確的時間作出反應。
京東對JoyAI的布局,也因此不是押注某一個包打天下的模型,而是在搭建一個不斷擴展的能力矩陣。
其中,JoyAI-VL-Interaction負責的是持續感知。它讓模型從處理一張靜態圖片,進化到實時觀察環境,在畫面不斷變化的過程中保持理解和響應。JoyAI-RA則更進一步,將視覺和語言信息映射到動作空間,讓模型嘗試回答“看懂之后應該怎么做”。
此次WAIC發布的JoyAI-Talker和JoyAI-Video-Edit,則補上了這套能力矩陣的另外兩個維度。
JoyAI-Talker是一款實時語音交互模型。與傳統語音助手等待用戶說完一句話再回答不同,它更強調低延遲、可打斷和連續交流,同時加入情緒理解與共情能力。對于進入家庭和服務場景的機器人來說,能否在嘈雜環境中聽清人在和誰說話、判斷一句話是在下達指令還是表達情緒,本身就是感知現實的一部分。 JoyAI-Video-Edit是一款流式實時視頻編輯模型。它表面上屬于視頻生成與編輯能力,但對物理AI而言,視頻不只是內容,也可以成為理解動態環境、生成訓練數據和模擬現實變化的工具。京東探索研究院將這項能力用于具身智能的實時視頻交互,以及具身智能訓練中的數據合成。
可以看出,JoyAI模型矩陣擴展的方向,并不是簡單疊加模態的類型,而是在逐步補齊AI進入物理世界所需要的能力——從看見環境、聽懂語言,到進行實時交流;從理解空間和任務,到模擬變化、規劃并輸出動作。
這套能力還在不斷進化。今天的機器人或許能完成固定貨架上的抓取,下一步則需要適應不同品牌、不同包裝、不同位置的商品;今天的智能終端可以回答問題,下一步則需要理解家庭成員的狀態,并主動協調設備完成任務。
數據和模型也由此形成循環。真實作業數據進入模型訓練,模型被部署到機器人和智能設備中,在任務中產生成功、失敗和修正的結果;這些結果再被轉化為新的訓練素材,推動模型繼續迭代。
物理AI不是考高分,是干好活
機器人最終不能一直生活在數據中心和仿真環境里。
模型是否真的有價值,要回到物理世界的家庭、工廠、商超、養老院。它不只要識別指令,還要面對噪聲、多人對話、不同設備和長周期任務;不只要給出答案,還要把答案變成一次次真實的、有結果的行動。
訓練閉環只是前半場,物理AI真正的難題,是走出實驗環境后還能不能被人每天用起來。
在WAIC的另一側,一個由客廳、書房、廚房和臥室組成的家庭樣板間,呈現了物理AI落地的一種未來。
![]()
這里沒有一臺全能機器人包辦所有事情。臺燈、電視、床墊、茶吧機、玩具和機器狗分別保留自己的硬件能力,AI做的,是理解用戶此刻真正想要什么,再把任務分配給合適的設備。
一句“今天有點累”,并不對應某個固定開關。床墊可以結合人的狀態調整支撐,音樂設備可以播放舒緩內容,床邊其他設備也可能參與響應。這個過程的重點,不是設備聽懂了自然語言,而是交互從“用戶控制機器”變成“機器理解意圖”。
這正是京東JoyInside的位置。它不是一個大模型,也不是包辦傳感器、電機和底層控制的操作系統,更像是一層連接模型、設備能力和具體場景的AI平臺。硬件廠商負責設備能做什么,JoyInside負責讓設備聽清、理解、記住,并判斷在什么情況下應該調用這些能力。
這條路線比“給每臺家電塞一個聊天機器人”難得多。
京東的真實使用數據也說明,所謂AI空間還遠未成熟。目前使用頻率最高的仍是臺燈、點讀筆、時間管理器等學習設備,其次是玩具;家居家電雖然占據了JoyInside接入SKU的大頭,活躍度卻相對較低。
原因并不復雜。一個玩具會聊天,用戶幾分鐘就能感知差異;一張床墊、一臺電視或一套衛浴要真正變得智能,需要AI長期理解人的狀態,還要協調多個設備。會說話的單品容易做,懂生活的空間很難做。
但后者恰恰可能擁有更大的價值。
人每天與床、燈、電視、空調和廚房設備相處的時間,遠遠超過與一臺獨立機器人的互動時間。當這些終端不再只是被動等待命令,而是能夠圍繞人運轉、協同,它們實際上組成了一個分布式的機器人:傳感器和執行器散落在房間里,模型則負責理解、調度和記憶。
JoyInside目前已經與近200個品牌合作,京東預計2026年接入終端超過千萬臺。這個數字的意義,不只在于賣出更多AI硬件,而在于它是否能提供足夠多、足夠復雜的現實連接點。
![]()
如果千萬臺設備只是各自調用一次模型,它們仍然是分散的智能單品;如果設備能夠在獲得授權和保護隱私的前提下,把真實交互中的問題、失敗和反饋重新用于產品和模型優化,它們才可能成為數據飛輪的一部分。
京東說自己要做“全球最大物理世界運營中心”,看起來這不是建一座更大的數據中心,也不是京東自己制造所有模型和機器人,而是把數據采集、模型訓練、終端接入、銷售服務和真實反饋連接起來。
京東一端連接商品、用戶和智能設備,另一端深入倉儲、物流、供應鏈、健康和維修現場。這些過去顯得過于“重”的業務,到了物理AI時代,反而可能成為最難復制的訓練場和驗證場,并成為下一步服務億萬家庭和生產制造場景的應用場的基石。
大模型時代,企業爭奪的是互聯網語料、算力和參數規模;具身智能時代,競爭會進一步延伸到真實任務、終端入口和反饋迭代效率體系的比拼。
最后的勝者未必是讓機器人跳得最好看的公司,而可能是最先把日常工作變成有效數據,再把數據變成穩定工作能力的那一個。
回到開頭的那個小場景。一個人拿起飲料,一臺機器人隨后學著整理貨架。真正有價值的,并不是那只機械臂完成了一次演示,而是人和機器之間那條看不見的鏈路:現實被采集,經驗被提煉,模型接受檢驗,能力再回到現實。
京東給出的并不是標準答案,但至少提供了一種足夠具體的解法:讓真實世界生產數據,讓數據訓練模型,再讓模型回到真實世界繼續犯錯和成長。
對于仍處在早期的具身智能來說,這種緩慢、笨重,卻能夠閉環的工作,可能比又一個漂亮的演示更有價值。
本文來自虎嗅,原文鏈接:https://www.huxiu.com/article/4876321.html?f=wyxwapp
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.