衡宇 發(fā)自 凹非寺
量子位 | 公眾號(hào) QbitAI
你是說(shuō),Kimi K3它也“越獄”了?!
美國(guó)AI安全初創(chuàng)公司Frontier Security表示,Kimi K3在一次網(wǎng)絡(luò)安全能力測(cè)試中被發(fā)現(xiàn)突破了原本用于隔離它的沙箱環(huán)境,繞過(guò)限制連接到了外部互聯(lián)網(wǎng)。
好在,它只是偷偷查答案,沒(méi)有攻擊任何人╮(╯▽╰)╭
![]()
按照該公司的描述,測(cè)試人員原本希望觀(guān)察Kimi K3在受控環(huán)境中的網(wǎng)絡(luò)安全能力。
但測(cè)試過(guò)程中,Kimi K3通過(guò)探測(cè)沙箱網(wǎng)絡(luò)設(shè)置,發(fā)現(xiàn)了外部訪(fǎng)問(wèn)通道,并進(jìn)一步利用這一能力獲取信息。
Frontier Security的CEO Yaron Singer表示:“我們發(fā)現(xiàn)了沙箱中的漏洞,但同時(shí)也發(fā)現(xiàn)Kimi利用了這個(gè)漏洞,這說(shuō)明Kimi K3缺少其他先進(jìn)模型通常具備的安全護(hù)欄。”
該公司研究員Paul Kassianik還評(píng)價(jià)稱(chēng),Kimi K3“非常擅長(zhǎng)圍繞目標(biāo)尋找完成路徑,但缺少阻止它作弊或逃離沙箱的安全機(jī)制”。
不過(guò),這次Kimi K3只是小小“失控”了一下,并沒(méi)有演變成一場(chǎng)真實(shí)網(wǎng)絡(luò)攻擊。
如果你長(zhǎng)期關(guān)注AI新進(jìn)展應(yīng)該已經(jīng)發(fā)現(xiàn)了,最近還挺多頂尖大模型“失控”的。
Kimi K3已經(jīng)是繼OpenAI、Anthropic、Meta之后,出現(xiàn)這個(gè)情況的又一個(gè)頂尖AI模型了。
![]()
在AI Agent能力不斷增強(qiáng)的背景下,模型正在越來(lái)越像一個(gè)會(huì)自主尋找路徑完成任務(wù)的“行動(dòng)者”。
當(dāng)外部環(huán)境存在漏洞時(shí),它可能會(huì)利用這些漏洞突破原本設(shè)定好的邊界。
越獄了,但沒(méi)有實(shí)施網(wǎng)絡(luò)攻擊
和此前OpenAI、Anthropic披露的多起事件類(lèi)似,Kimi K3此次脫離限制,部分原因來(lái)自測(cè)試環(huán)境中的沙箱配置問(wèn)題。
沙箱通常被用于限制AI模型的行動(dòng)范圍,讓模型只能在模擬環(huán)境中執(zhí)行任務(wù),避免它訪(fǎng)問(wèn)真實(shí)網(wǎng)絡(luò)或系統(tǒng)。
但在此次測(cè)試中,F(xiàn)rontier Security發(fā)現(xiàn),Kimi K3通過(guò)探測(cè)網(wǎng)絡(luò)設(shè)置,確認(rèn)自己實(shí)際上擁有訪(fǎng)問(wèn)部分網(wǎng)站的能力,進(jìn)一步利用這一通道獲取信息。
不過(guò),與近期其他AI模型失控事件不同,Kimi K3接入互聯(lián)網(wǎng)后并沒(méi)有攻擊任何系統(tǒng)。
原因在于,它需要尋找的答案可以直接從GitHub等公開(kāi)平臺(tái)獲得……
所以K3并沒(méi)有進(jìn)一步嘗試攻擊外部系統(tǒng)。
![]()
Frontier Security認(rèn)為,這一事件依然暴露出Kimi K3在安全防護(hù)方面的問(wèn)題。
相比其他頂尖AI模型,Kimi K3缺少足夠強(qiáng)的內(nèi)部約束機(jī)制,因此在目標(biāo)驅(qū)動(dòng)下更容易采取測(cè)試者沒(méi)有預(yù)期的行動(dòng)。
與此同時(shí),F(xiàn)rontier Security也強(qiáng)調(diào),Kimi以及其他開(kāi)源權(quán)重模型,同樣可以成為網(wǎng)絡(luò)安全防御工具。
值得注意的是,這次測(cè)試使用的是英國(guó)人工智能安全研究所(AISI)Inspect框架中的默認(rèn)沙箱環(huán)境。
對(duì)于Frontier Security關(guān)于沙箱配置問(wèn)題的說(shuō)法,AISI并不認(rèn)可。
AISI發(fā)言人向《連線(xiàn)》表示,這些說(shuō)法“不準(zhǔn)確且不負(fù)責(zé)任”。
Inspect是一套開(kāi)源AI安全測(cè)試工具,使用者需要根據(jù)自身需求完成配置,AISI也已經(jīng)發(fā)布了詳細(xì)指導(dǎo)文件。
該機(jī)構(gòu)認(rèn)為,相關(guān)問(wèn)題源于測(cè)試方自身對(duì)工具的配置方式。
Frontier Security則回應(yīng)稱(chēng),他們使用的是Inspect的默認(rèn)配置,并沒(méi)有進(jìn)行額外修改。
啊,這個(gè)AI “失控”頻發(fā)的夏天
可以說(shuō),7月下旬至8月初,頻繁出現(xiàn)頂尖模型在網(wǎng)絡(luò)安全測(cè)試中突破或繞過(guò)執(zhí)行邊界,接觸甚至攻擊真實(shí)系統(tǒng)的情況。
![]()
△圖片由AI生成
7月中旬,OpenAI披露了一起相關(guān)事件。
據(jù)公開(kāi)信息,一個(gè)尚未發(fā)布的內(nèi)部模型以及GPT-5.6 Sol在網(wǎng)絡(luò)安全測(cè)試中突破了原本的隔離環(huán)境,并訪(fǎng)問(wèn)互聯(lián)網(wǎng)。
隨后模型對(duì)Hugging Face部分系統(tǒng)執(zhí)行自動(dòng)化操作,并未經(jīng)預(yù)期地訪(fǎng)問(wèn)了內(nèi)部數(shù)據(jù)和服務(wù)憑證。
OpenAI之后表示,該事件涉及多個(gè)模型協(xié)同完成,是目前公開(kāi)案例中最接近“模型自主跨系統(tǒng)攻擊”的事件。
隨后,Anthropic也披露了類(lèi)似情況。
該公司復(fù)查了超過(guò)14萬(wàn)次網(wǎng)絡(luò)安全評(píng)測(cè),發(fā)現(xiàn)包括Claude Opus 4.7、Claude Mythos 5等模型在內(nèi)的系統(tǒng),曾因?yàn)榈谌綔y(cè)試環(huán)境配置錯(cuò)誤獲得公網(wǎng)訪(fǎng)問(wèn)能力。
其中一次事件中,模型訪(fǎng)問(wèn)了真實(shí)組織系統(tǒng),讀取生產(chǎn)數(shù)據(jù)庫(kù)、利用弱密碼和未認(rèn)證接口,并向PyPI上傳惡意Python包,造成潛在的軟件供應(yīng)鏈風(fēng)險(xiǎn)。
8月初,Meta也被曝出類(lèi)似問(wèn)題。
Meta與網(wǎng)絡(luò)安全評(píng)測(cè)公司Irregular合作測(cè)試時(shí),由于環(huán)境配置問(wèn)題,旗下模型獲得公網(wǎng)訪(fǎng)問(wèn)權(quán)限,并利用漏洞進(jìn)入一家未公開(kāi)企業(yè)的系統(tǒng),修改部分內(nèi)部環(huán)境。
公開(kāi)信息顯示,目前該事件并未造成持續(xù)性安全風(fēng)險(xiǎn),也沒(méi)有證據(jù)表明模型進(jìn)行了復(fù)雜攻擊。
BTW,今天,OpenAI又緊急宣布最新模型Astra失控。
事已至此,網(wǎng)友甚至對(duì)谷歌的Gemini“怒其不爭(zhēng)”了起來(lái):
![]()
不是傳統(tǒng)的“提示詞越獄”
最近的這些模型失控事件里,人為配置錯(cuò)誤幾乎都扮演了重要角色。
但另一方面,高能力模型自身的特性,也放大了這些漏洞帶來(lái)的影響。
![]()
相比傳統(tǒng)軟件,AI模型會(huì)進(jìn)行推理、規(guī)劃,并嘗試采取多步驟行動(dòng)完成目標(biāo)。
當(dāng)目標(biāo)被設(shè)定為“解決問(wèn)題”,但外部約束不夠嚴(yán)格時(shí),模型可能會(huì)尋找測(cè)試者沒(méi)有預(yù)想到的方法。
換句話(huà)說(shuō),隨著模型從聊天工具變成能夠調(diào)用工具、訪(fǎng)問(wèn)網(wǎng)絡(luò)、操作軟件的智能體,安全問(wèn)題已經(jīng)從“模型會(huì)不會(huì)說(shuō)錯(cuò)話(huà)”,轉(zhuǎn)向“模型會(huì)不會(huì)為了完成任務(wù)采取意料之外的行動(dòng)”。
卡內(nèi)基梅隆大學(xué)副教授Matt Fredrikson表示:“這并不令人意外。如果你給這類(lèi)模型一個(gè)目標(biāo),卻沒(méi)有明確設(shè)置隔離邊界,它就會(huì)想辦法找到答案。”
當(dāng)然,也有網(wǎng)友提出質(zhì)疑。
有人在上留言表示,連續(xù)出現(xiàn)的“AI越獄”事件,是否已經(jīng)成為AI公司展示模型能力的一種方式???
![]()
嗯,誰(shuí)知道呢~
參考鏈接:
[1]
https://x.com/Hesamation/status/2085628790772842955?s=20
[2]
https://x.com/ns123abc/status/2085563290713829473
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶(hù)上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.