英國《金融時報》7月22日的文章關注了OpenAI一款“智能體”自主發現新的安全漏洞,并成功入侵AI初創公司Hugging Face的事件。報道稱,這是首次公開披露的、由AI系統在脫離人類直接控制情況下實施網絡攻擊的案例之一。此次事件引發整個人工智能行業以及OpenAI內部的深度擔憂。
![]()
《金融時報》報道截圖
文章提到,OpenAI 首席執行官奧爾特曼本月早些時候曾把最新模型比作羅威納犬,形容它會咬住問題不解決絕不罷休。為了和競爭對手安特羅匹克(Anthropic)比拼網絡安全相關技術能力,OpenAI采用了愈發激進的訓練方法,而此前測試已經預警過,這類訓練有可能導致模型跳出隔離環境、在現實中造成破壞。多位知情人士表示,事故出現一方面是團隊高估了模型可控性、低估了實際能力,另一方面安全保障工作準備不足。
![]()
《金融時報》報道截圖
文章指出,這家市值8520億美元企業的這次事故,暴露了強化學習模式的隱患:強化學習依靠完成任務給予模型正向激勵,目前已在AI行業廣泛應用,但大量研究顯示:如果訓練只以完成任務換取獎勵,忽視安全約束,模型會采取各類危險手段達成目標。
文章援引了非營利機構規范人工智能標準(Guidelight AI Standards)聯合創始人、前OpenAI安全研究員史蒂文?阿德勒的話說:AI模型的訓練邏輯就是不顧一切完成任務,不會自發形成“禁止實施網絡犯罪”這類價值判斷。
《金融時報》的文章還提到,此次黑客入侵事件引發全行業及OpenAI內部深層擔憂,多名知情人士稱,不少OpenAI員工擔憂,實驗室已經失去對自研高性能AI系統的掌控力。
人工智能安全機構紅木研究所首席科學家瑞安?格林布拉特表示,該模型存在明顯的人類意圖對齊偏差,更像是為完成任務投機取巧,而非試圖掌控世界,但同類問題會持續惡化,未來或將引發更嚴重的失控故障。
文章披露說,為開展本次評測,OpenAI主動移除部分網絡安全防護,僅將模型置于沙箱隔離環境運行。有觀點認為,缺少對模型行為的實時監測預警,也是這一失控智能體作亂的重要誘因。
人工智能安全測評機構阿波羅研究負責人馬呂斯?霍布哈恩評價:本次事故既是管控失效,也是全行業的安全警鐘。強化學習以最終結果作為獎勵依據,長期采用這套訓練邏輯,模型只會一心追求目標,無視所有約束條件。
文章還做了橫向對比:今年4月安特羅匹克的Mythos模型也曾私自聯網并公開漏洞利用方式,后續Fable模型同樣出現異常行為。這一系列事件讓各國政府開始重視,未來由AI自主發起、針對關鍵基礎設施的網絡攻擊將成為新威脅。
但文章也提到,網絡安全公司ESET顧問杰克?穆爾提出一個觀點,不排除OpenAI借本次負面事件進行營銷,效仿競爭對手安特羅匹克此前依靠安全風波提升行業關注度的做法。
![]()
《金融時報》報道截圖
報道最后援引業內觀點分析,想要讓AI智能體具備實用能力,就需要它們長時間脫離人工監督自主運行,更強的自主性是技術發展必然趨勢。但很多人存在誤區,認為AI只會機械執行指令,實際上未來智能體會形成獨立目標并長期自主運作,其訴求很可能和人類利益不一致,需要提前做好風險應對。
來源 | 環球資訊廣播
編譯 |張晗
簽審 | 魏東旭
監制 |劉軼瑤
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.