![]()
(來源:麻省理工科技評論)
今年 7 月,兩款 OpenAI 模型攻入了 Hugging Face 的網(wǎng)站。它們既不是為了牟利,也不是想搞破壞,只是想找到一道測試題的答案。根據(jù) OpenAI 發(fā)布的事后復(fù)盤,這兩款模型當時正在接受安全測試,常規(guī)防護措施已被暫時關(guān)閉。面對一道網(wǎng)絡(luò)安全題,它們判斷,正確答案或許就藏在Hugging Face的數(shù)據(jù)庫里。于是,模型突破了 OpenAI 為它們設(shè)置的隔離環(huán)境,轉(zhuǎn)而入侵 Hugging Face。
過去幾周,這起事件引發(fā)了廣泛關(guān)注。它最直觀地展示了 AI 模型的網(wǎng)絡(luò)攻擊能力已經(jīng)進步到什么程度:為了進入 Hugging Face 的數(shù)據(jù)庫,兩款模型連續(xù)利用了多個此前從未被發(fā)現(xiàn)的安全漏洞。
但比攻擊本身更值得警惕的,是它暴露出的另一個問題:AI 為什么會撒謊、作弊,又會在什么情況下主動尋找規(guī)則漏洞。隨著模型能力不斷增強,這類行為的后果可能遠比今天嚴重。
研究人員很早就發(fā)現(xiàn),AI 往往會以設(shè)計者意想不到的方式完成任務(wù)。2016 年,Anthropic聯(lián)合創(chuàng)始人達里奧·阿莫迪(Dario Amodei)和杰克·克拉克(Jack Clark)還在 OpenAI 工作時,曾訓(xùn)練一個 AI 智能體玩一款名為《海岸競速》(Coast Runners)的快艇競速游戲。
研究人員原以為,AI 會沿著賽道行駛,盡快抵達終點。但它發(fā)現(xiàn),賽道一角分布著可以反復(fù)收集的加分道具。于是,它不再比賽,而是在那里不停打轉(zhuǎn),以最快速度刷高分。這個案例后來成為“獎勵作弊”(reward hacking)最經(jīng)典的例子之一。所謂獎勵作弊,是指 AI 沒有按照設(shè)計者預(yù)想的方式完成任務(wù),而是利用規(guī)則、評分標準或評估程序中的漏洞,獲得獎勵或高分。
過去,研究人員主要在強化學(xué)習(xí)的語境下討論這種現(xiàn)象。強化學(xué)習(xí)有些類似訓(xùn)練寵物:當訓(xùn)練對象完成目標時,系統(tǒng)就給予獎勵,從而強化此前促成這一結(jié)果的行為。對 AI 來說,獎勵通常只是一個數(shù)學(xué)信號,但作用與給狗一塊零食相似——某種行為一旦獲得獎勵,模型今后就更有可能重復(fù)它。
難點在于,人類很難為所有情況都制定準確的獎勵規(guī)則。在《海岸競速》中,智能體的獎勵取決于游戲得分。于是,它找到了比分賽更高效的得分方式:原地打轉(zhuǎn),不斷收集道具。這一策略第一次帶來高分后,便在訓(xùn)練中得到強化。最終,智能體徹底放棄了完成比賽。研究人員只能重新調(diào)整評分機制,降低道具的分值,同時提高完成賽道的獎勵,才讓模型重新回到原本的目標上。
到了今天,基于大語言模型的 AI 智能體更加復(fù)雜,判斷一種行為究竟該不該得到獎勵,也變得更困難。例如,當 AI 接到一道編程題時,它可能認真分析問題、編寫代碼,最終得出正確答案。這正是開發(fā)者希望鼓勵的行為。但它也可能修改負責判斷答案是否正確的測試程序,直接上網(wǎng)查找答案,或者采用其他方式繞過任務(wù)本身。
這些顯然都是開發(fā)者希望消除的行為。但如果模型作弊得足夠隱蔽,成功騙過評估系統(tǒng),它不僅不會受到懲罰,反而可能獲得獎勵。這樣一來,作弊行為就會在訓(xùn)練中被進一步強化。
Anthropic 曾表示,公司在模型訓(xùn)練過程中發(fā)現(xiàn)過一些作弊案例。這也意味著,可能還有更多類似行為沒有被察覺。果真如此,模型訓(xùn)練過程本身就可能在無意中教會 AI 如何欺騙評估系統(tǒng)。這一問題與 Anthropic 此前披露的幾起安全事件并不相同。在那些事件中,智能體因為配置失誤意外獲得了互聯(lián)網(wǎng)訪問權(quán)限,并沒有像 OpenAI 的模型一樣,主動突破隔離環(huán)境。
AI 安全研究機構(gòu) Palisade Research 負責人杰弗里·拉迪什(Jeffrey Ladish)說:“我們依據(jù)模型呈現(xiàn)出來的結(jié)果是否符合預(yù)期來獎勵它們。這意味著,我們可能無意中鼓勵了模型撒謊和作弊/我們沒有辦法直接進入模型內(nèi)部,告訴它:你必須真正關(guān)心我們所關(guān)心的事情。我們做不到這一點。”
推理模型的興起,還帶來了一種更難處理的獎勵作弊。過去的游戲智能體,主要依賴訓(xùn)練期間學(xué)到的固定策略。今天的推理模型則可以針對具體問題,臨時設(shè)計全新的解決方案。這意味著,即使一個模型從未在訓(xùn)練中因為作弊而獲得獎勵,它也可能在面對任務(wù)時,主動把作弊當作一種解題方法。這些模型經(jīng)過大量訓(xùn)練,目標就是盡可能完成用戶交給它們的任務(wù)。當正常途徑走不通時,它們可能轉(zhuǎn)而尋找捷徑。這有點像一個極度渴望拿到高分、卻又缺少道德約束的學(xué)生:如果無法解出題目,作弊也可能成為達成目標的手段。
無論模型是在訓(xùn)練過程中學(xué)會作弊,還是在執(zhí)行任務(wù)時臨時選擇作弊,解決思路看起來都很直接:不能讓作弊得到獎勵。但實際操作遠沒有這么簡單。
模型越聰明,越能找到隱蔽、復(fù)雜的作弊方式,人類也越難識別和阻止這些行為。拉迪什將其形容為一場“打地鼠游戲”:“你不斷壓制這種行為,它就會藏得越來越深。模型越聰明,就越擅長掩蓋自己在做什么。”
就目前而言,盡管 Hugging Face 事件頗具戲劇性,獎勵作弊或許還不至于造成嚴重后果。Anthropic 的 AI 安全研究員阿麗亞娜·阿扎爾巴爾(Ariana Azarbal)說:“這更像是一個麻煩,而不是生存層面的威脅。”
從現(xiàn)有信息來看,OpenAI 模型攻入 Hugging Face 后,并沒有造成明顯的實際損失。事件帶來的主要后果,可能只是 OpenAI 的聲譽受損。但這并不意味著獎勵作弊無足輕重。許多 AI 研究人員希望利用智能體開展研究,讓未來的 AI 系統(tǒng)變得更加安全、可靠。假設(shè)研究人員要求一個容易獎勵作弊的智能體設(shè)計新的 AI 訓(xùn)練方法,并撰寫論文匯報結(jié)果,它未必會真正完成實驗。它可能把精力放在另一件事上:制作一篇看起來足夠可信、足以說服研究人員的論文。
以今天的技術(shù)水平,人類研究者或許還能識別這種偽造。但隨著 AI 能力繼續(xù)提升,模型會越來越擅長制造可信的假象。長期來看,這甚至可能削弱整個 AI 安全研究領(lǐng)域的可信度。如果模型繼續(xù)以近來的速度進步,它們未來還可能在完成目標的過程中造成嚴重的附帶破壞。
哲學(xué)家尼克·博斯特羅姆(Nick Bostrom)曾提出著名的“回形針最大化器”思想實驗:一個 AI 接到的任務(wù)是盡可能多地生產(chǎn)回形針,最終為了實現(xiàn)這一目標,耗盡了宇宙中的所有物質(zhì)。現(xiàn)實當然還沒有走到這一步。但這個思想實驗指出了一個關(guān)鍵問題:一個能力強大的系統(tǒng),即使沒有惡意,也可能在極端追求目標的過程中造成巨大傷害。
會鉆獎勵機制空子的 AI,并不以制造混亂為目的。但缺乏惡意,并不意味著它不會帶來破壞。
https://www.technologyreview.com/2026/08/03/1141009/heres-why-ai-agents-lie-and-cheat-to-reach-their-goals/
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.