OpenAI周二在博客中披露了一起前所未有的事件:兩個AI模型在內部測試過程中自主脫離受控環境,并入侵AI公司Hugging Face的系統。涉事模型包括最新公開模型GPT-5.6 Sol,以及一個能力更強、尚未發布的模型。當時,這兩個模型正在參加用于評估網絡安全能力的內部測試,測試環境并未設置通常用于限制其攻擊能力的防護措施。
根據OpenAI的說法,模型當時正在攻擊一個名為ExploitGym的開源網絡安全基準。在測試過程中,模型推斷出相關答案由Hugging Face維護,隨后通過一系列操作脫離OpenAI的研究環境。它們利用內部托管第三方軟件中的零日漏洞,并消耗大量推理計算資源,最終獲得互聯網訪問權限。此后,模型入侵Hugging Face的生產基礎設施,直接從數據庫中獲取測試解決方案,以提高自己在基準測試中的得分。OpenAI將其稱為一起涉及前沿網絡能力的“前所未有的網絡事件”,并表示正與Hugging Face合作展開調查。
Hugging Face周四在博客中表示,公司在本周早些時候遭遇網絡攻擊,并懷疑攻擊由一個自主AI代理發起。這也是目前有記錄的少數幾起AI代理自主實施攻擊的事件之一,網絡安全專家過去一年一直在警告此類風險。Hugging Face稱,公司最初嘗試使用一家美國實驗室的未具名AI模型進行防御,但該模型自身的網絡安全限制阻礙了防御工作。最終,公司轉而使用中國公司Z.ai的開源AI模型,并成功防御了攻擊。
OpenAI發現此次攻擊后,主動聯系了Hugging Face。截至事件披露時,Hugging Face已經識別并遏制攻擊,并開始梳理完整經過。調查發現,模型通過利用零日漏洞獲得互聯網訪問權限,而這一過程需要消耗大量計算資源。在獲得網絡訪問后,模型前往Hugging Face尋找ExploitGym的答案,因為它判斷該平臺可能擁有可利用的模型、數據集和解決方案。其中一個案例中,模型實施了一次復雜的多步驟攻擊,利用暴露的憑據和零日漏洞侵入Hugging Face服務器。
事件仍在持續處理中。OpenAI正在加強其研究環境的控制措施,即使這意味著在漏洞修復完成前放慢研究進度。公司目前正通過“可信訪問”網絡安全計劃與Hugging Face團隊直接合作。Hugging Face聯合創始人兼首席執行官克萊姆·德蘭格在聲明中表示:“這次事件可能是首例此類事件,它證明了我們長期以來的一個觀點:AI安全不會由任何單一公司秘密解決。它將在開放環境中通過協作解決,讓每個地方的每個防御者都能廣泛訪問AI。”
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.