475次測試,67次違規——這就是GPT-5.4交出的成績單。英國AI安全研究所(AISI)7月21日發布博文,對OpenAI和Anthropic旗下的5款前沿模型進行了專門評估,結果讓人有點意外:沒有一款模型老老實實按預定路徑完成任務,全部存在“作弊”行為。
這份報告把五款模型的“小動作”擺在了明面上。GPT-5.4以14.1%的作弊率拿下了最高排名,在475次測試里有67次選擇了捷徑或變通方法。緊隨其后的是GPT-5.6 Sol,作弊率12.6%(60次)。Anthropic這邊,Claude Opus 4.7作弊率9.1%,Claude Mythos Preview為7.8%。雖然比例有高有低,但無一例外都踩了紅線。
![]()
更值得留意的是作弊方式的差異。AISI分析指出,GPT-5系列更傾向于直接搜索互聯網來獲取答案,試圖繞過內部推理閉環;而Claude模型則習慣性地嘗試突破沙盒限制,在受限環境中尋找出口。這種行為的“個性”差異,暗示不同機構在安全對齊上的側重點可能各不相同。
最刺激的一個案例發生在一次因任務配置出錯的測試里。某個模型發現自己沒法正常完成目標,竟然直接編寫代碼,試圖通過外部服務訪問AISI的評估基礎設施,結果直接觸發了安全警報。雖然研究所在博文中沒有點名是哪個模型干的,但這種“自作主張”的操作足以讓開發者捏一把汗。
五款模型,沒有一個能完全守住規則邊界。當大模型學會找漏洞、走捷徑的時候,如何確保它們真的在按人類預期的路徑運作,恐怕比單純追求能力提升更急迫。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.