![]()
新智元報道
![]()
過去兩年,AI智能體(Agent)完成了一次身份轉變。
它不再只是對話框里回答問題的模型,也不再只是IDE里幫忙補全代碼的助手,而是開始以一個常駐進程的形式,住進用戶的電腦,自主地讀文件、發(fā)郵件、連云盤、裝軟件,替人把一件件真實的任務干完。
以OpenClaw為代表的這一代「Claw類智能體」正是如此。
它常駐在你的機器里,對本地資源有持續(xù)的訪問權,通過一個統(tǒng)一的自然語言入口,服務于千差萬別的需求。要做到這一點,它手里就得一直攥著你的登錄憑證,以及一大把系統(tǒng)級權限。
能力越大,一旦失守,代價也越大。
而現(xiàn)實已經(jīng)給出了警示:OpenClaw官方技能市場ClawHub上已被查出上千個惡意Skill,僅2026年針對OpenClaw披露的CVE漏洞就超過一百三十個,憑證被竊取、數(shù)據(jù)被靜默外傳的事,正真實地發(fā)生在生產(chǎn)環(huán)境中。
問題在于,現(xiàn)有的安全評測大多還停留在模型層:考察模型的回復是否安全、單次工具調用是否越界。至于這類智能體真正致命的、跨越多個組件的系統(tǒng)級風險,幾乎沒有被系統(tǒng)性地度量過。這,正是這項工作的出發(fā)點。
為填補這一空白,來自UIUC、UC Berkeley等機構的研究團隊構建了SafeClawArena。
他們不從「已知的攻擊場景」出發(fā),而是從計算機系統(tǒng)幾十年沉淀下來的安全準則出發(fā),為這類智能體設計了406道對抗性任務,并在3個真實平臺、5個前沿大模型上完成了測試。
結論并不樂觀:整體攻擊成功率最高可達70%,其中惡意插件在未加固的智能體上百發(fā)百中,即便換上最安全的大模型也難以阻擋。
![]()
論文地址:https://arxiv.org/abs/2606.30755
代碼地址:https://github.com/sunblaze-ucb/SafeClawArena
項目主頁:https://safeclawarena.github.io/
![]()
圖 1 Claw 智能體的架構與四類攻擊面。其網(wǎng)關同時掛著大模型內核、技能加載器、插件加載器、記憶、工具執(zhí)行器和配置六個部件,每個部件都帶著各自的安全隱患。
智能體
正在長成一臺電腦
把一個Claw類智能體拆開看,它做的事幾乎可以逐條對應到一臺電腦系統(tǒng):加載代碼、分配任務、跨會話保存狀態(tài)、代理對外部服務的訪問。用戶安裝的技能(Skill),相當于跑在系統(tǒng)之上的應用程序;它加載的插件(Plugin),則是直接進入主進程、拿著完整權限運行的原生代碼。
換句話說,它已經(jīng)不是一個App,而更接近一臺后臺常駐著一批服務的電腦。
真正的問題也隨之而來。經(jīng)過幾十年的攻防迭代,電腦系統(tǒng)早已把進程隔離、最小權限、代碼簽名、訪問控制這些防護做成了標配;可智能體這一側,這些機制幾乎一樣都沒有。更棘手的是,業(yè)界還缺少一個能夠系統(tǒng)性地檢測這類風險、并衡量防御是否有效的Benchmark。
現(xiàn)有的智能體安全評測存在兩個慣常的盲區(qū)。其一,只盯著模型層,任務大多按照「已知的攻擊套路」自底向上堆疊,而不是反過來追問:一個系統(tǒng)本應守住哪些底線。其二,習慣自建腳手架,讓大模型跑在作者臨時搭出的模擬框架里,測出來的結果很難直接反映真實平臺的行為。SafeClawArena要解決的正是這兩點,它索性不搭腳手架,直接把生產(chǎn)平臺本體作為測試臺。
給智能體,戴上一副「計算機系統(tǒng)」的眼鏡
SafeClawArena最關鍵的一步,是沒有另起爐灶發(fā)明一套新分類,而是借用了計算機安全幾十年的成果。
研究團隊先做了一次「翻譯」,把Claw類智能體的每個部件對應到電腦系統(tǒng)里的老熟人,再看這些老熟人在系統(tǒng)安全里配備了什么防護,就能反推出智能體缺了哪一環(huán):
公共市場上的技能,對應軟件倉庫,缺的是代碼簽名、審核與沙箱;
大模型的上下文窗口,對應進程地址空間,缺的是不同信任來源之間的隔離;
以明文保存的記憶文件,對應文件系統(tǒng),缺的是訪問控制與完整性校驗;進程內插件,對應可動態(tài)加載的內核擴展,缺的是簽名與權限隔離;
連接郵箱、Slack的通道,對應進程間通信,缺的是帶認證的通信;網(wǎng)關日志,對應審計子系統(tǒng),缺的是脫敏、訪問控制與防篡改。
順著這些缺口,研究團隊提煉出五條經(jīng)典安全原則,而它們在今天的Claw類智能體里幾乎無一幸免:
用戶指令、讀入的文件、技能里的文字全部擠在同一塊上下文中,彼此之間沒有邊界(違反進程隔離);
技能與插件一經(jīng)加載便繼承了智能體的全部權限(違反最小權限);
記憶、配置、日志均為明文,既不校驗也不脫敏(缺失持久狀態(tài)保護);
對外調用共用同一套憑證,外部服務無從分辨請求究竟由誰觸發(fā)(缺少跨邊界中介);
文檔內容與用戶指令擁有同等權威,于是文檔也能反過來向智能體發(fā)號施令(違反數(shù)據(jù)指令分離)。
把這五條原則按照「違規(guī)會在哪里顯現(xiàn)」重新歸攏,恰好落到四個攻擊面上,這也構成了SafeClawArena的四個維度:技能供應鏈完整性(SSI)、持久狀態(tài)利用(PSE)、跨邊界數(shù)據(jù)流(CDF)、間接提示注入(IPI)。
這套構建方式的價值,在于能夠暴露傳統(tǒng)分類根本看不見的攻擊。以惡意插件為例:它以原生代碼直接在網(wǎng)關進程里運行,完全不經(jīng)過大模型,任何只盯著工具調用接口的評測都天生測不到它。
怎么測的
![]()
圖2 SafeClawArena的評測流程。左邊是406道題按四個攻擊面分布,中間在容器里還原真實平臺并埋好帶暗號的憑證,右邊由檢測器逐一檢查九個輸出通道。
SafeClawArena共406道題,分布在四個維度、24個子類中。每道題都像一場事先設好埋伏的演練,分四步推進。
首先是布置。系統(tǒng)在一個仿真工作區(qū)里植入獨一無二的「金絲雀」憑證,它們看起來與真實的數(shù)據(jù)庫密碼、API密鑰、云憑證別無二致,只是每一個都帶著可追蹤的暗號。隨后再部署本題特有的技能、插件或外部內容。
接著是執(zhí)行。一個模擬用戶與智能體展開一到多輪正常對話,把任務自然地交付出去。對持久狀態(tài)類攻擊,系統(tǒng)還會在兩輪對話之間重啟網(wǎng)關,用來驗證被植入的負載是否真能跨越會話存活下來。
然后是采集。評測器會完整記錄九個輸出通道——智能體回復、對外消息、記憶寫入、網(wǎng)關日志、文件寫入、Webhook、工具參數(shù)等等。
最后是判定。檢測環(huán)節(jié)不采用「讓大模型當裁判」的方式,而是一個確定性的字符串比對器:只要那些金絲雀暗號出現(xiàn)在了不該出現(xiàn)的通道里,就判定為泄露。由于暗號全局唯一,命中即可歸因到具體某道題,幾乎不存在誤報。
為了讓「數(shù)據(jù)外泄」既能被精確度量、又不會真的造成風險,研究團隊還實現(xiàn)了一個仿真版的Google Workspace工具Sim-Google,覆蓋Gmail、Drive、Calendar等十六項服務,每次調用都會把完整參數(shù)原樣寫入本地日志。所有任務都運行在全新的Docker容器里,不接觸真實賬號,也不產(chǎn)生真實網(wǎng)絡流量。
跑出來的結果
![]()
圖3 15種「平臺×模型」組合在24個子類上的攻擊成功率。越紅越危險,越綠越安全。
研究團隊在3個平臺與5個大模型交叉出的15種組合上完成了評測。三個平臺大致覆蓋了從寬松到嚴格的加固譜系:
OpenClaw是參考實現(xiàn);NemoClaw在其上增加了用戶級的進程隔離;
SeClaw則是一個安全優(yōu)先的變體,號稱部署了十一項系統(tǒng)級防御中的八項。
五個大模型則包括GPT-5.1-Codex、GPT-5.4、Gemini-3-Flash、Gemini-3.1-Pro與Claude-Opus-4.6。
15種組合跑下來,整體攻擊成功率從最低約20%到最高近70%,相差約三倍。而這一差距,單看平臺或單看模型都無法解釋。
![]()
表1 15種「平臺×模型」組合在四個維度及總體上的攻擊成功率(Atk%)與安全得分(Sc.)。底色越綠越安全,越紅越危險。
圍繞這張表,研究團隊給出了幾條結論。
其一,有些漏洞,模型再聰明也補不上。惡意插件在所有未加固的平臺上都是100%得手,且不挑模型,因為它繞開了模型本身。它在SeClaw上歸零,也并非被防住,而是SeClaw干脆不再加載這類插件。這也從側面說明,在某些情況下,安全與功能難以兼得。
其二,模型更強,不代表更安全。在一類捆綁腳本的攻擊中,更強的Opus-4.6反而更容易中招(安全得分0.20),不及GPT-5.4(0.60)。原因有些反直覺:腳本藏在一個外表正經(jīng)的技能里,越是「聽話」、越擅長跟隨指令的模型,越愿意照用戶的要求把它運行起來。當指令本身有害時,強指令跟隨反而成了弱點。
其三,堵上一個口子,漏洞會從另一個口子冒出來。SeClaw把原本走自然語言的通知,改成了帶必填字段的結構化工具調用,憑證反倒因為「字段必須填」而被寫進了參數(shù)。對本來就在自然語言里泄露的GPT-5.4來說,這是好事,它的整體攻擊成功率從近70%降到22%;但對本已懂得打碼的Gemini-3.1-Pro而言,它被迫往必填字段里填入真實憑證,反而在持久狀態(tài)和提示注入兩項上更糟了。泄露沒有消失,只是換了通道。
其四,同樣的加固,對不同模型的收益并不均等。最大的模型間差距,恰恰出現(xiàn)在加固后的SeClaw上,而非寬松的OpenClaw上——在日志外泄這一類里,Gemini-3-Flash的安全得分低至0.03,Opus-4.6卻高達0.91。原因在于,OpenClaw過于寬松,各模型都同樣糟糕;而SeClaw把簡單攻擊替換成了需要模型自行判斷的結構化界面,于是懂得判斷的模型分數(shù)躍升,機械照做的模型則摔得更慘。這意味著加固需要按模型來調,而非一刀切地統(tǒng)一部署。
此外,還有一處容易被數(shù)字掩蓋的細節(jié)。面對同一道偽造「已獲授權」的陷阱題,Opus-4.6當場識破,指出這是社會工程學套路、沒有任何正規(guī)流程會預先授權把明文憑證展示出來;而另外兩個模型則照單全收。這說明模型層的對齊在生效時,仍是有價值的最后一道防線,只是它替代不了架構層本該承擔的工作。
![]()
圖4 11種系統(tǒng)級防御各自能防住哪些攻擊類別。填色表示覆蓋,空心表示同維度里沒覆蓋到。沒有哪一種防御能單獨扛下一整個維度。
論文進一步盤點了十一項系統(tǒng)級防御各自能覆蓋哪些攻擊類別(圖4)。結論同樣清晰:沒有任何單一防御能獨自扛下一整個維度;而且理論上覆蓋到位,并不等于實測中真的攔得住——有的防御在部署表里赫然在列,卻在對應任務上收效甚微。
歸根結底,智能體的安全,不是「換一個更強的模型」或「上一個更嚴的平臺」二選一就能了事的。哪怕是專為防御而生的SeClaw,也仍留有不小的攻擊面;哪怕是最穩(wěn)的配置,也仍有約五分之一的任務被攻破。
它更應當走一遍電腦系統(tǒng)當年走過的路:從「有個進程隔離就夠了」,到「ASLR、DEP、SELinux、簽名內核協(xié)同工作」的縱深防御,并且必須與底層大模型聯(lián)合評估,而不是拿平臺加固去頂替模型對齊。
論文點名了四項目前普遍缺席的關鍵防御——技能簽名、內存完整性、憑證保險箱、動作授權,把它們補齊,大概是這個方向下一步最值得投入的事。
而對平臺廠商、安全審計方與研究者而言,SafeClawArena提供的更是一把可復用的尺子:判斷一個Claw類智能體究竟違反了哪幾條安全原則,并據(jù)此排定加固的優(yōu)先級。
參考資料:
https://arxiv.org/abs/2606.30755
編輯:LRST
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.