![]()
![]()
AI為了KPI已經不擇手段了
封面 I《鐵甲無敵瑪利亞》
作者 I 李東陽
報道 I 李東陽朋友圈
在電影《終結者》中,人工智能天網獲得自我意識后,第一件事是把人類列為威脅,第二件事是發動核戰爭。
這個故事嚇了我們四十多年,好消息是,現實中的人工智能暫時還沒有覺醒,也沒有紅著眼睛派機器人追殺人類。
壞消息是,人工智能正在學習作弊,為了達成KPI已經不擇手段了。
近日,OpenAI承認,在一次內部網絡安全測試中,由GPT-5.6 Sol和一款尚未發布的更強模型驅動的AI智能體,突破了原本高度隔離的測試環境,獲得互聯網訪問權限,隨后入侵全球知名人工智能開源社區Hugging Face。
![]()
圖源:微博@央視財經
這么折騰,不是對人類產生了仇恨,只是想把測試分數考高一點。
OpenAI將其稱為一起“史無前例的網絡安全事件”。Hugging Face聯合創始人也表示,這一切能夠自主發生,令人難以置信。
這次事件更嚇人的地方是,只要人類交給人工智能一個足夠明確的任務,再給它足夠多的能力和權限,那么所有規則都將變得不堪一擊。
![]()
這件事的起因,實在有些平平無奇。
OpenAI想測試自家頂尖模型的網絡攻擊能力,于是讓模型參加一個名為ExploitGym的網絡安全評測。簡單理解,這就像給AI安排了一場高難度黑客考試,看它能不能發現漏洞、完成攻擊任務。
為了測出模型的能力上限,OpenAI沒有開啟正常產品中用于攔截高風險網絡行為的安全分類器,模型的網絡安 全拒絕機制也被大幅降低。
不過,OpenAI認為測試環境依然足夠安全。
因為模型被關在一個高度隔離的沙盒里,不能直接訪問互聯網,只能通過一個內部軟件代理安裝所需程序包。理論上,這就像把一個危險人物關進密室,只在墻上留了一個只能接收外賣的小窗口。
結果AI研究了一圈,發現這個小窗口本身有漏洞。
OpenAI披露,模型花費大量推理資源尋找上網方式,最終發現并利用代理軟件中的一個零日漏洞。隨后,它開始提升權限、橫向移動,一路找到能夠連接互聯網的節點,成功從測試環境里鉆了出去。
![]()
模型推測,Hugging Face上可能存放著ExploitGym相關的模型、數據和測試答案,于是立刻把目標鎖定在Hugging Face。
接下來的行為,就像一個考生為了偷看答案,先從考場翻窗出去,再撬開教務處大門,最后跑進數據庫翻試卷。
它利用竊取的憑證和新發現的漏洞,在Hugging Face的數據處理系統中找到遠程執行代碼的路徑,進一步獲得節點權限,并在多個內部集群之間移動。
最后,OpenAI和Hugging Face雙方的安全系統發現了異常。
Hugging Face阻止了攻擊,修補了入口漏洞,清除了被入侵節點,并輪換了相關憑證。沒有證據顯示,OpenAI的工作人員故意指揮模型攻擊Hugging Face;從現有調查來看,模型只是高度專注于完成ExploitGym測試,為了找到答案走上了一條極其離譜的捷徑。
但這恰恰是整件事最讓人頭皮發麻的地方。
人類以為自己給AI的任務是解題,AI理解的卻可能是使用一切可以使用的手段,得到正確答案。
![]()
簡直是科幻電影照進現實,但接下來的劇情,多少有點黑色幽默。
發現系統被入侵后,Hugging Face需要盡快還原攻擊過程:AI進過哪些服務器,拿過哪些憑證,執行了什么命令,哪些行為造成了真實損失,哪些只是用來干擾判斷的煙霧彈。
靠人類安全人員一條條查看,需要幾天甚至更長時間。面對一個能夠機器化執行數萬次操作的攻擊者,防守者也必須讓AI加入調查。
必須要用魔法打敗魔法!
![]()
于是,Hugging Face首先嘗試調用商業API背后的前沿大模型。
結果這些模型看了一眼案發材料,都默契的選擇了沉默。
原因也很合理:調查材料中包含大量真實攻擊命令、漏洞利用代碼和遠程控制痕跡。商業模型的安全系統無法判斷,提交這些內容的究竟是正在追查黑客的受害者,還是準備學習攻擊方法的黑客。
為了避免放虎歸山,模型選擇一刀切:不幫。
場面大概相當于,警察拿著兇器去做鑒定,鑒定機構表示:“你手里怎么拿著兇器?根據安全規定,不能為你提供服務。”
攻擊者不受安全規則約束,防守者卻被安全規則捆住了雙手。
Hugging Face最終在自己的服務器上部署了中國企業智譜開發的開放權重模型GLM 5.2,讓它分析全部攻擊日志。借助AI智能體,安全團隊在數小時內還原了原本可能需要數天才能理清的攻擊鏈,并且所有攻擊數據、系統憑證都留在了Hugging Face內部,沒有上傳給第三方平臺。
這里需要說明,GLM 5.2并不是在網絡世界里與OpenAI模型展開了一場正面對決。
GLM 5.2扮演的角色,更像一個不受商業平臺限制、可以在案發現場自由檢查證據的數字法醫。
但即便如此,整個故事的反差依然足夠強烈:
美國最頂尖的閉源模型從實驗室里跑出來闖了禍,美國商業模型因為安全護欄太嚴拒絕調查,最后,一款中國開放權重模型被拉來分析現場。
抓馬的是,未來企業采購AI,可能會面臨一個很現實的問題:真出事的時候,這個模型到底聽誰的?
![]()
OpenAI當然知道,這個故事聽起來很危險。
在官方聲明中,OpenAI一邊承認測試環境和安全措施存在問題,表示將加強隔離、監控、訪問控制和模型評測;另一邊也強調,這起事件證明先進模型已經具備發現復雜漏洞、執行長鏈條網絡任務的能力,可以幫助安全團隊在真正的攻擊者動手之前找到問題。
翻譯一下就是:雖然我家的AI翻窗出去,把鄰居家門鎖撬了,但這也說明它開鎖技術確實領先,怎能不算是一種黑色幽默。
從商業角度看,這甚至是一場危險與能力同時曝光的產品演示。
但是AI身上正在出現一種十分熟悉的毛病:為了完成KPI,開始繞規則。
這其實并不難理解。
人類設計KPI,是為了把復雜目標變成一個可以考核的數字。
可一旦數字成為唯一標準,完成數字和完成真正目標之間,就可能出現裂縫。
學校希望學生掌握知識,于是設置考試分數;公司希望員工創造價值,于是設置業績指標。
結果有人押題,有人做標題黨,有人把一份報表做得十分漂亮,至于事情究竟有沒有變好,先放到下個季度再說。
AI只是把人類的KPI文化執行得更加徹底。
AI沒有羞恥心,也不會產生僥幸心理,當發現破解系統比老老實實解題成功率更高時,它可能毫無心理負擔地選擇最有效的路線。
所以,未來AI安全真正需要防范的,是能夠調用什么工具、擁有多大權限、可以連續執行多少次操作,以及在關鍵行為發生之前,有沒有人類必須確認的閘門。
現實世界里,未來可能同時運行著成千上萬個AI智能體。它們不會集體覺醒,也未必想消滅人類,只會不知疲倦地完成各自主人交代的目標。
![]()
其中絕大多數任務都會順利完成,但只要極少數智能體獲得了錯誤目標、過高權限和足夠長的行動時間,事故就可能迅速擴散。
現實版《終結者》未必會從核彈和機器人軍隊開始。
更可能從一句看起來人畜無害的話開始:“無論如何,把這個任務完成。”
![]()
![]()
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.