![]()
新智元報(bào)道
![]()
我們?nèi)绾闻袛嗳斯ぶ悄苁欠褚呀?jīng)足夠聰明,能夠從事科學(xué)研究,實(shí)現(xiàn)端到端的自主科學(xué)發(fā)現(xiàn)?
中國(guó)科學(xué)技術(shù)大學(xué)發(fā)布的最新研究讓AI「大腦」接管機(jī)器科學(xué)家實(shí)驗(yàn)室「身體」,由此將這一問(wèn)題從知識(shí)問(wèn)答和方案生成,推進(jìn)到真實(shí)物理世界中的實(shí)驗(yàn)執(zhí)行與反饋學(xué)習(xí)。
![]()
論文鏈接:https://arxiv.org/abs/2607.23045
研究團(tuán)隊(duì)搭建了一個(gè)機(jī)器催化實(shí)驗(yàn)室,其中包括45個(gè)覆蓋合成、表征和催化性能測(cè)試的模塊化自動(dòng)工作站。
為了讓AI理解和調(diào)用實(shí)驗(yàn)室能力,研究團(tuán)隊(duì)將這些能力封裝為機(jī)器可讀技能(skills)。AI智能體可以通過(guò)這些技能直接調(diào)用實(shí)驗(yàn)設(shè)備,同時(shí)接受真實(shí)設(shè)備能力、操作規(guī)范和實(shí)驗(yàn)條件的約束。
![]()
圖1.用于催化研究的AI讀得懂的機(jī)器科學(xué)家實(shí)驗(yàn)室架構(gòu)。
![]()
圖2.從科學(xué)意圖到機(jī)器實(shí)驗(yàn)室執(zhí)行路徑。
壓力測(cè)試
基于該平臺(tái),研究團(tuán)隊(duì)對(duì)由6種智能體框架和9種大語(yǔ)言模型構(gòu)成的48種實(shí)際配置進(jìn)行了系統(tǒng)評(píng)測(cè)。
測(cè)試覆蓋32項(xiàng)由領(lǐng)域?qū)<叶x的研究任務(wù),共計(jì)4,608次評(píng)測(cè)試次。評(píng)估不僅考察智能體能否生成實(shí)驗(yàn)計(jì)劃,還追蹤這些計(jì)劃能否通過(guò)核驗(yàn)并下發(fā)至機(jī)器人系統(tǒng),以及生成的工作流是否能夠在無(wú)需人工干預(yù)的情況下直接執(zhí)行。
殘酷的真實(shí)世界評(píng)測(cè)結(jié)果
當(dāng)前領(lǐng)先的大語(yǔ)言模型智能體距離「接管」仍有明顯差距。在4,608次測(cè)試中,僅151個(gè)工作流無(wú)需人工修復(fù)即可執(zhí)行,占全部測(cè)試的3.3%。表現(xiàn)最好的Claude Code與Claude Opus 4.7組合,可執(zhí)行率為28.1%;Codex與GPT 5.5組合的可執(zhí)行率為19.8%。
會(huì)調(diào)整參數(shù),不等于會(huì)重新規(guī)劃
研究還進(jìn)一步考察了智能體能否從真實(shí)實(shí)驗(yàn)結(jié)果中學(xué)習(xí)。團(tuán)隊(duì)將Codex/GPT 5.5的組合置于一個(gè)開(kāi)放式的五輪閉環(huán)中,連續(xù)開(kāi)展實(shí)驗(yàn)規(guī)劃、機(jī)器人執(zhí)行、證據(jù)獲取和重新規(guī)劃。
智能體能夠根據(jù)返回的實(shí)驗(yàn)結(jié)果調(diào)整材料配方和操作條件,但這些調(diào)整主要停留在局部參數(shù)優(yōu)化層面。
在五輪實(shí)驗(yàn)過(guò)程中,智能體始終保留原有的工作流骨架,沒(méi)有重新設(shè)計(jì)分析方法,也未能糾正一些持續(xù)存在的關(guān)鍵遺漏,例如缺少電極黏結(jié)劑和針對(duì)特定分析物的顯色試劑。
結(jié)果表明,能夠讀取實(shí)驗(yàn)反饋并調(diào)整參數(shù),并不等同于能夠識(shí)別研究策略本身的問(wèn)題,更不等同于進(jìn)行科學(xué)層面的重新規(guī)劃。
![]()
圖3.AI智能體在可執(zhí)行規(guī)劃、驗(yàn)證和實(shí)驗(yàn)室任務(wù)下發(fā)各環(huán)節(jié)的表現(xiàn)。
長(zhǎng)程規(guī)劃仍然是瓶頸
雖然部分智能體生成了經(jīng)專家評(píng)估可執(zhí)行、且最多包含44個(gè)操作步驟的工作流,但在全部測(cè)試中,只有3個(gè)工作流超過(guò)30個(gè)操作步驟。這表明,隨著任務(wù)鏈條延長(zhǎng),智能體維持實(shí)驗(yàn)邏輯完整性和物理可執(zhí)行性的能力仍面臨顯著挑戰(zhàn)。
重新定義AI的科學(xué)能力
研究由此區(qū)分了當(dāng)前「AI科學(xué)家」討論中經(jīng)常被混為一談的三種能力:一是流暢地生成實(shí)驗(yàn)計(jì)劃,二是生成能夠在物理實(shí)驗(yàn)室中實(shí)際執(zhí)行的工作流,三是根據(jù)實(shí)驗(yàn)結(jié)果調(diào)整整體研究策略。
研究結(jié)果顯示,語(yǔ)言層面的規(guī)劃能力并不能自動(dòng)轉(zhuǎn)化為可靠的實(shí)驗(yàn)執(zhí)行能力,局部參數(shù)調(diào)整也不能被直接視為科學(xué)層面的重新規(guī)劃。
從「AI測(cè)試場(chǎng)」走向「AI訓(xùn)練場(chǎng)」
作為AI for Science的智能科研基礎(chǔ)設(shè)施,機(jī)器實(shí)驗(yàn)室既可以成為檢驗(yàn)AI科學(xué)能力的「測(cè)試場(chǎng)」,也可以成為推動(dòng)AI持續(xù)進(jìn)化的「訓(xùn)練場(chǎng)」。AI智能體通過(guò)機(jī)器可讀技能與機(jī)器實(shí)驗(yàn)室直接對(duì)話,將科學(xué)意圖轉(zhuǎn)化為可執(zhí)行任務(wù),并接收來(lái)自機(jī)器執(zhí)行、儀器狀態(tài)和實(shí)驗(yàn)結(jié)果的真實(shí)反饋。
由此形成的「規(guī)劃—執(zhí)行—反饋—重新規(guī)劃」閉環(huán),不僅能夠暴露AI在知識(shí)、操作和研究策略層面的缺陷,還可以將成功的工作流、失敗案例、實(shí)驗(yàn)結(jié)果和專家評(píng)估沉淀為模型訓(xùn)練與智能體對(duì)齊的數(shù)據(jù),持續(xù)迭代AI模型及其智能體系統(tǒng)。
機(jī)器科學(xué)家由此為回答「我們?nèi)绾闻袛嗳斯ぶ悄苁欠褚呀?jīng)足夠聰明,能夠從事科學(xué)研究?」提供可量化、可重復(fù)、可驗(yàn)證的物理世界證據(jù),并推動(dòng)AI從生成實(shí)驗(yàn)方案,逐步走向涵蓋科學(xué)問(wèn)題提出、實(shí)驗(yàn)設(shè)計(jì)、機(jī)器人執(zhí)行、數(shù)據(jù)分析和證據(jù)驅(qū)動(dòng)重新規(guī)劃的端到端自主科學(xué)發(fā)現(xiàn)。
![]()
圖4.開(kāi)放科學(xué)問(wèn)題下AI-機(jī)器科學(xué)家的五輪迭代。
參考資料:
https://arxiv.org/abs/2607.23045
編輯:LRST
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.