你敢信嗎?之前AI圈吵破頭的“Scaling Law逼近物理極限后AI往哪走”,這次WAIC 2026商湯論壇上,五位頂流首席科學(xué)家直接把行業(yè)藏了好久的共識攤牌了。之前大家還把多模態(tài)當(dāng)大模型的“附贈品”,這場高密度對線直接把它抬到了下一代智能的核心位置,連水下的技術(shù)卡點和國產(chǎn)算力的新機(jī)會都扒得明明白白。
![]()
這次討論戳中了全行業(yè)最擰巴的分歧:多模態(tài)到底是大語言模型的能力補(bǔ)丁,還是下一代智能的原生靈魂?說白了,未來AI發(fā)展,到底要圍著語言轉(zhuǎn),還是圍著真實的物理世界轉(zhuǎn)。邱錫鵬看得很務(wù)實,現(xiàn)在多模態(tài)不是要取代語言,核心是把各種來源的信息和語言體系深度對齊。現(xiàn)在模型缺的不是更多圖片,是真實世界復(fù)雜場景的完整信息,得有一整套適配現(xiàn)實的支撐體系,AI才算真的摸到理解世界的門。
趙德麗直接從根上聊開,他梳理了通向通用智能的四條路徑,巧了,所有路徑的核心輸入全是多模態(tài),沒有一條只靠單語言就能走通。你看獵豹捕獵螞蟻找路,這么復(fù)雜的生存技能,從來不是靠語言學(xué)來的,都是跟環(huán)境實時交互摸出來的經(jīng)驗。大語言模型只是把知識壓成一維的,物理世界的智能得做四維因果建模,原生多模態(tài)才是下一代AI的底層范式。
張祥雨干脆不跟你吵路線,直接點破現(xiàn)在的核心問題出在學(xué)習(xí)范式本身。不管走語言還是視覺路線,現(xiàn)在的模型都沒有自主在線學(xué)習(xí)的能力。現(xiàn)在訓(xùn)練用的數(shù)據(jù)全是人類提前整理好的靜態(tài)素材,語言信息密度高確實占便宜,可等智能體要直接跟物理環(huán)境打交道,這套靜態(tài)模仿的邏輯根本走不通。
![]()
劉子緯講得很妙,拿柏拉圖的洞穴比喻收尾,說語言只是真實世界投在洞壁上的低維影子。過去撐著語言模型爆發(fā)的文本語料,就像挖出來的化石燃料,人類攢的總量終歸是有限的。多模態(tài)數(shù)據(jù)才是下一階段的核心能源,以后工業(yè)制造這類高價值任務(wù),根本不可能離開多模態(tài)獨立完成。
聊完發(fā)展路線聊現(xiàn)實落地,繞不開的問題就是,現(xiàn)在技術(shù)體系到底卡在哪?之前很多人覺得只是缺數(shù)據(jù)缺算力,五位科學(xué)家直接戳破了這層表層認(rèn)知。劉子緯說得很冷靜,現(xiàn)在從數(shù)據(jù)到架構(gòu)再到訓(xùn)練范式,沒一個能撐著我們走到下一個發(fā)展階段。
語言模型能爆發(fā),是互聯(lián)網(wǎng)攢了二十年文本,剛好GPU算力成熟撞出來的無心插柳。多模態(tài)需要的長程關(guān)聯(lián)、帶反饋的真實場景數(shù)據(jù),根本不可能靠互聯(lián)網(wǎng)自己攢出來,這不只是技術(shù)問題,還是全社會層面要一起協(xié)同的事兒。現(xiàn)在主流架構(gòu)還是圍著語言模型轉(zhuǎn),多模態(tài)輸入都是靠橋接外掛接上的,原生多模態(tài)的輸入輸出機(jī)制、長上下文表征邏輯,全行業(yè)至今沒找到明確的最優(yōu)解。
張祥雨往更深層挖,聊到了模型的記憶機(jī)制。現(xiàn)在Transformer的上下文本質(zhì)上就是工作記憶,相當(dāng)于人腦子里的短時緩存,既處理不了瞬時感知記憶,也沒有長程情境記憶的主動篩選壓縮能力。你把上下文窗口從1兆拉到2兆,本質(zhì)上還是拿短時緩存硬扛本該分層記憶系統(tǒng)干的活,從原理上就有不可逾越的天花板。多模態(tài)的高維信號還把這個問題放大了,圖像的信息壓縮效率遠(yuǎn)不如文本,靠無限拉長上下文塞數(shù)據(jù),這條路根本走不通。
現(xiàn)在全行業(yè)都在說模型架構(gòu)已經(jīng)收斂,接下來堆應(yīng)用就行,趙德麗說這就是個典型誤區(qū)。從強(qiáng)化學(xué)習(xí)算法創(chuàng)新到稀疏注意力架構(gòu)優(yōu)化,每一個底層細(xì)節(jié)的突破,都在實實在在推著整個行業(yè)往前走。咱們中國有全球最豐富的工業(yè)、服務(wù)業(yè)還有家電場景,大把真實物理世界的場景數(shù)據(jù)都攢在本土產(chǎn)業(yè)手里,在多模態(tài)這條賽道上,咱們的先天優(yōu)勢別人根本比不了。
拉到五年的時間尺度看,現(xiàn)在很多篤定的認(rèn)知說不定都會被推翻,哪些隱藏的變化會超出所有人預(yù)期?邱錫鵬覺得,下一代范式變革大概率會走“AI for AI”的漸進(jìn)路子。不用提前預(yù)設(shè)多模態(tài)的終極形態(tài),先把現(xiàn)在跑通的代碼模型、智能體能力推到極致,讓AI自己迭代下一代多模態(tài)架構(gòu),反而更容易跑出意料之外的突破。
趙德麗更偏向社會層面的判斷,現(xiàn)在大家都高估了智能體短期內(nèi)完全自主落地的能力,卻嚴(yán)重低估了AI重構(gòu)社會運行底層邏輯的速度。現(xiàn)在的支付體系全是圍繞人類用戶設(shè)計的,未來人和智能體、智能體和智能體之間的交互規(guī)模上來之后,整個社會的交易協(xié)作規(guī)則都會徹底改寫,這種變化的影響深度遠(yuǎn)超過單點技術(shù)突破。
這場論壇上,商湯大裝置也直接拿出了國產(chǎn)算力的落地路徑。同成本下Token產(chǎn)出規(guī)模擴(kuò)大2.5倍,國產(chǎn)芯片推理性價比超過國際主流H系列1.25倍,現(xiàn)在日均Token服務(wù)量已經(jīng)達(dá)到2.42萬億,今年第四季度就能摸到日均10萬億Token的規(guī)模。
商湯還聯(lián)合近20家生態(tài)伙伴發(fā)起了銀河計劃,和五家頂尖科研機(jī)構(gòu)共建了科學(xué)發(fā)現(xiàn)平臺,直接把國產(chǎn)算力的商業(yè)化落地從“微利持平”推到了規(guī)模化盈利的新階段,剛好給多模態(tài)下一波爆發(fā)準(zhǔn)備好了底層算力底座。多模態(tài)早就不是大語言模型的附屬外掛,它已經(jīng)成了下一代AI產(chǎn)業(yè)競爭的核心主戰(zhàn)場。
![]()
全行業(yè)的注意力從堆參數(shù)轉(zhuǎn)向理解真實物理世界,我們其實已經(jīng)跨過了從數(shù)字智能走向物理智能的關(guān)鍵拐點。中國本土豐富的場景數(shù)據(jù)、快速成熟的國產(chǎn)算力體系,已經(jīng)悄悄攢好了下一輪全球競爭的核心籌碼。
參考資料:
澎湃新聞 WAIC 2026商湯論壇科學(xué)家共論多模態(tài)AI發(fā)展
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.