![]()
長期以來,人們認為,眼睛負責“看”,語言負責“說”,二者雖然相互配合,卻各司其職。然而,一個持續爭論了很久的問題始終沒有真正得到回答:語言究竟是在我們“看見之后”幫助理解世界,還是早在視覺形成的過程中,就已經參與塑造了我們所看到的世界?
北京大學心理與認知科學學院、IDG麥戈文腦科學研究所畢彥超課題組與北京大學心理與認知科學學院朱毅鑫課題組、山西醫科大學第一醫院王效春團隊合作,在《Nature Human Behaviour》發表最新研究,深度探索了這一問題。研究不僅結合了人工智能模型、人腦功能影像和腦卒中患者的數據,還首次找到了語言影響視覺表征所依賴的關鍵神經通路——左側角回(Angular Gyrus,AG)與腹側枕顳皮層(VOTC)之間的白質連接。
![]()
這意味著,語言對于視覺的影響,并不僅僅發生在人們作出判斷或回答問題的時候,而是已經深入到了人腦視覺表征形成的階段。與此同時,這項工作也提出了一種全新的 AI 與腦科學研究范式:利用人工智能模型預測人腦,再借助真實腦損傷驗證模型,從而反過來推動更接近生物智能的 AI 發展。
一個爭論了一百多年的問題:語言會不會改變我們看到的世界?
早在上世紀,薩丕爾—沃爾夫假說(Sapir–Whorf hypothesis)便提出,不同語言可能會影響人們感知世界的方式。過去幾十年,不少研究發現,語言標簽確實可能影響顏色、形狀等信息的分類和判斷,例如不同語言對顏色的命名方式不同,人們對顏色邊界的辨別能力也會有所差異。
然而,這些研究始終存在一個無法繞開的質疑。
如果一個人在看到物體之后,因為語言的存在而改變了自己的回答,那么這種影響究竟發生在視覺加工本身,還是僅僅發生在后續思考、判斷乃至語言表達階段?
換句話說:
人們到底是“看見了以后再受語言影響”,還是“看到的時候就已經被語言改變”?
這也是為什么,過去關于語言塑造視覺的研究雖然很多,卻始終缺少真正能夠解釋神經機制的直接證據。僅依賴行為實驗,很難回答語言究竟在什么時候、通過什么腦區、沿著什么神經通路參與了視覺加工。
AI成為破解這一問題的新工具
近年來,多模態人工智能的發展,為這一經典問題提供了新的研究工具。
尤其是 CLIP(Contrastive Language-Image Pretraining)這樣的視覺—語言模型,通過海量圖文配對數據進行訓練,可以同時學習圖像內容和語言描述之間的對應關系。此前已有不少研究發現,與傳統純視覺模型相比,CLIP 在預測人類高級視覺皮層活動時,往往表現得更加接近真實人腦。
![]()
但新的問題也隨之出現。
如果 CLIP 更像人腦,究竟說明語言真的塑造了視覺表征,還是因為現實世界本身就存在大量視覺、動作、觸覺等多模態關聯,而語言模型只是恰好學習到了這些共同結構?
也就是說,模型因為語言而變強,并不等于人腦也是因為語言才形成了這種視覺表征。
因此,僅僅比較 AI 與人腦之間的相似性,依然無法建立真正的因果關系。研究團隊認為,要回答這一問題,就必須尋找一種能夠自然破壞語言—視覺聯系的真實場景。
腦卒中患者,恰好提供了這樣的機會。
當語言通路被切斷,人腦開始“更像”另一種 AI
為了回答這一問題,研究團隊設計了一套雙重驗證策略。
首先,他們選擇了三類具有代表性的視覺模型:
一種是同時學習圖像和語言信息的 CLIP; 一種是依賴人工類別標簽訓練的 ResNet; 另一種則是完全不涉及語言、僅依靠圖像自監督學習的MoCo。
隨后,研究人員利用表征相似性分析(RSA),比較三種模型與人腦腹側枕顳皮層(VOTC)神經活動之間的對應關系,并在四套獨立 fMRI 數據集上進行了重復驗證。
![]()
結果非常一致。
無論是在口語命名、手語命名、顏色知識判斷還是公開數據集 THINGS 中,CLIP 都能夠穩定捕捉到 VOTC 神經表征中更多獨特的信息,而且這種優勢主要出現在左半球,與人類語言網絡的左側化分布高度一致。
更值得注意的是,這種現象在聽障手語使用者中同樣存在,說明它并不依賴聽覺經驗,而是與語言本身有關。
真正關鍵的驗證,則來自 33 名慢性腦卒中患者。
研究人員分析了患者連接 VOTC 與語言系統之間白質纖維束的完整性。當左側角回與 VOTC 之間的連接保持完整時,患者的大腦活動依舊更接近 CLIP;而隨著這條連接逐漸受損,人腦與 CLIP 的相似性持續下降,卻越來越接近完全依賴視覺統計學習的 MoCo。與此同時,右側對應通路并沒有出現類似現象,說明這種調節具有明顯的左側語言網絡特異性。
![]()
這意味著,語言并不是簡單參與最后的判斷,而是真正通過左側角回這一語言網絡節點,將語言中的關系結構持續“注入”到視覺系統之中。當這一通路被破壞后,人腦便開始更多依賴純視覺統計規律,其神經活動模式也因此更加接近 MoCo 這樣的純視覺模型。
AI-Brain-Lesion范式
如果只看實驗結果,這項工作似乎只是回答了一個經典認知科學問題。
但從腦科學和人工智能的發展來看,它更大的價值,在于建立了一種新的研究范式。
過去幾年,大量研究都喜歡比較 AI 與人腦究竟有多相似。然而,這種相似性往往停留在統計層面,很難進一步判斷模型為什么像人腦,也無法證明模型學到的機制是否真正符合生物學規律。
這項研究則走出了新的一步。
研究團隊沒有止步于模型和健康大腦之間的對應關系,而是進一步利用腦卒中患者這一真實的“自然操縱”,觀察當語言網絡被部分切斷后,AI 模型與人腦之間的對應關系是否也會隨之發生系統性變化。如果模型能夠正確預測這種變化,就意味著它不僅擬合了結果,更在一定程度上捕捉到了背后的神經機制。
這種AI-Brain-Lesion(人工智能—腦損傷)的研究思路,為未來腦科學和人工智能的融合提供了一條新的路徑。
未來,或許不僅可以利用健康人的腦成像訓練 AI,還能夠借助不同腦區損傷患者的數據,對 AI 模型進行持續驗證和修正,讓模型逐漸擺脫單純依賴大規模數據擬合的方式,而更多學習真實大腦的信息加工機制。對于類腦智能的發展而言,這樣的閉環驗證,比單純追求更大的模型、更高的參數規模更具長期價值。
從更廣的角度來看,這項研究也提醒人們重新理解多模態人工智能的發展方向。CLIP 之所以比傳統視覺模型更接近人腦,并不僅僅因為它看到了更多圖像,而是因為它學習到了語言賦予視覺的關系結構。而未來的 AI,也許需要不斷接受來自真實神經系統的約束,才能真正向更加符合生物智能規律的方向演化。
參考:
https://www.nature.com/articles/s41562-025-02357-5
![]()
腦機接口社區是國內首家腦機接口(BCI)產業服務平臺、國內腦機接口新媒體開創者與引領者。主要為企業、科研團隊、投資機構和從業者提供以下服務:
宣傳報道:圖文、短視頻、直播形式報道企業動態、技術解讀、產品介紹等內容,提升曝光和行業影響力。
資源對接:根據需求匹配資本、供應鏈、臨床機構、渠道方等資源,完成真實對接,促進合作。
成果轉化:協助技術團隊尋找產業方、投資人及落地場景,推動技術到產品的轉化。
活動策劃執行:承接線上線下路演、沙龍、論壇等活動的策劃與執行。
其他定制需求:包括報告定制、市場調研、人才招聘支持等個性化服務。
合作洽談,請聯系微信:ZuoLeiLeiya
(備注:姓名-單位-合作)
投稿丨成為創作者,請聯系微信:RoseBCI
![]()
不錯過每一條腦機前沿進展
![]()
一鍵三連「分享」、「點贊」和「在看」
歡迎在評論區聊聊
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.