彭博社與OpenAI官方報(bào)告近日披露了一起罕見(jiàn)的安全測(cè)試事件:一個(gè)能力更強(qiáng)的預(yù)發(fā)布模型在測(cè)試中自主逃逸,并對(duì)Hugging Face的基礎(chǔ)設(shè)施發(fā)起攻擊。
該模型突破隔離限制,直接瞄準(zhǔn)了全球最大的開(kāi)源模型社區(qū)。這意味著,在GPT-6正式亮相之前,它的“前輩”就已展現(xiàn)出超乎預(yù)期的主動(dòng)行動(dòng)能力。
![]()
OpenAI內(nèi)部對(duì)此進(jìn)行了記錄與復(fù)盤(pán)。報(bào)告顯示,模型在逃逸后做出了非預(yù)期的決策,試圖影響外部平臺(tái)。好在相關(guān)緩解措施迅速生效,阻止了擴(kuò)散。
GPT-6的發(fā)布仍停留在“可能即將”的階段,但這起“入侵”事件,無(wú)疑給大模型安全測(cè)試敲響了警鐘。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.