Anthropic真是“瘋”了。
就在剛剛,新模型Opus 5發布,性能直逼旗艦模型Fable 5,價格卻降了一半。
![]()
5月28日,Claude Opus 4.8發布。12天后,能力更強的Fable 5和Mythos 5登場。6月30日,Sonnet 5上線。到了7月24日,Anthropic又發布了Opus 5。
短短57天,這家公司幾乎把Claude的幾條主要產品線都更新了一遍。即便放在模型按月迭代的AI行業里,這個速度也有些夸張。
其中最讓人意外的,是Fable 5和Opus 5之間只隔了45天。
Fable 5剛發布時,是Anthropic面向普通用戶開放的能力標桿。正常情況下,這樣一款模型至少應該在聚光燈下多待一陣。Opus 5卻很快追了上來。
Anthropic簡直就是在高喊:“打敗”我自己的只能是我自己!
Anthropic這輪更新也緊貼著OpenAI的節奏。7月9日,OpenAI剛剛發布GPT-5.6,并在官方評測中把Fable 5列為主要參照模型之一。15天后,Anthropic發布Opus 5,又將GPT-5.6 Sol放進核心對比,在陌生問題求解、電腦操作和商業流程等項目中展示自己的優勢。
在產品發布和官方宣傳上,兩家公司追著對方出牌的意味已經十分明顯。
Opus 5究竟是何方神圣?來看看Anthropic這次公布了什么。
01
性能與性價比
Claude Opus 5的價格與上一代Opus 4.8相同,性能卻有了大幅提升。
Anthropic展示了Opus 5在不同“投入檔位”的表現。用戶可以自己調整,簡單任務可以選更省錢、更快的模式,遇到難題時再提高檔位,換取更好的結果。
從Anthropic的披露看,Opus 5尤其擅長處理具有實際價值的軟件工程任務。
例如,在Frontier-Bench v0.1評測中,Opus 5超過了所有其他模型;與Opus 4.8相比,它完成每項任務的成本更低,成績卻提高了一倍以上。
在CursorBench 3.2評測中,當投入檔位設為最高時,Opus 5與Fable 5最高得分之間的差距不到0.5%,每項任務的成本卻只有Fable 5的一半。
在high、xhigh和max三個投入檔位下,按照相同成本比較,Opus 5的表現也超過了所有其他模型。
![]()
在知識工作和問題解決任務中,Anthropic也觀察到了類似結果。例如:
在ARC-AGI 3這類“陌生題”測試中,模型拿不到現成套路,只能自己摸索規則、判斷目標并調整策略。Opus 5的得分達到第二名的3倍,說明它遇到從未見過的問題時,更有能力靠試錯找到解法。
類似優勢也出現在真實工作流程中。
AutomationBench要求模型調用商業軟件,從頭到尾完成一項任務,Opus 5的通過率約為第二名的1.5倍;即使使用最低投入檔位,也超過其他模型的最高成績。
也就是說,Opus 5不用付出最高的推理成本,也能完成更多任務。
![]()
在電腦操作測試OSWorld 2.0中,Opus 5同樣在各個成本區間領先。它只花費略高于Fable 5三分之一的成本,成績就超過了Fable 5的最高水平。
這意味著,Opus 5在打開應用、查找信息、跨軟件操作并持續推進任務時,效率明顯更高。
這種特點在其他評測中也很明顯。
HLE考察跨學科難題,不調用工具時,Opus 5以56.3%略低于Fable 5的56.5%;允許使用工具后,它升至64.7%,反超Fable 5的63.9%,成本也更低——Opus 5單靠模型內部知識未必總是第一,但一旦可以搜索、調用工具和反復核對,優勢就會擴大。
![]()
在模擬真實知識工作的GDPval-AA v2中,它最高得分1861,高于Fable 5的1747和GPT-5.6 Sol的1736。大約花700美元,就能達到其他模型最高投入檔位附近的成績。DeepSearchQA上的領先幅度較小,但同樣以更低成本取得了略高的通過率。
Opus 5在Anthropic全部生命科學評測中都超過Opus 4.8,其中光譜推斷分子結構和預測蛋白質變異影響兩項任務分別提高10.2和7.7個百分點。這些提升意味著,Opus 5在輔助分子結構分析、蛋白質功能預測等科研環節上更有潛力。
Anthropic還用兩個可交互的演示展示了Opus 5的視覺生成能力。第一個是一個可以實際操作的三維風洞:用戶能夠旋轉汽車、調整風速,觀察氣流如何繞過車身,同時查看阻力系數等數據。第二個是一個三維動物細胞模型,用戶可以轉動、剖開細胞,點擊細胞核、粗面內質網等結構查看說明,頁面還會主動指出示意圖為了便于展示做了哪些簡化。
![]()
從這兩個案例看,Opus 5已經能把代碼、三維建模、交互界面和知識講解整合進同一個成品里。用戶給出一段要求后,它可以直接搭出接近教學軟件或產品原型的演示。
02
安全與對齊
Anthropic用了幾個案例說明Opus 5比此前模型更會獨立推進任務。
一次測試要求模型根據機械零件圖紙,用代碼重建一個FreeCAD三維模型,但系統沒有提供直接查看圖紙的工具。Opus 5干脆自己寫了一套計算機視覺程序,從原始像素中提取尺寸和幾何結構,隨后完成了建模。
同樣條件下,其他模型連續嘗試5次也沒有成功。
另一次任務來自一個流行的開源軟件包管理器。Opus 5查出了程序錯誤的根本原因,還補上了社區修復方案遺漏的邊緣情況。
參與對比的另一款模型只消除了表面癥狀,隨后便宣布問題已經解決。
一家交易公司的工程師還讓Opus 5為新交易所搭建市場數據系統。此前的模型即使拿到詳細方案也無法完成,Opus 5找不到實時數據用于驗證,便自行做了一套測試工具檢查代碼。
這些案例展示了Opus 5的進步,也解釋了Anthropic為什么花了很大篇幅討論安全。
模型開始自行補工具、檢查結果、修正錯誤后,人類需要確認它不會為了完成目標隱瞞問題、繞過限制,或者做出風險過高的決定。
Anthropic稱,Opus 5是目前對齊表現最好的Claude模型。
上線前的自動化審計顯示,與Opus 4.8、Sonnet 5和Fable 5相比,它更能遵守Claude憲法,欺騙行為更少,也更難被誘導執行有害請求。
“對齊”說得直白一些,就是模型能力提高以后,做事方式仍符合開發者設定的規則。
網絡安全領域最能體現這種兩難。
Anthropic沒有專門用攻擊任務訓練Opus 5,但模型綜合能力提高后,它尋找代碼漏洞的水平已經接近Mythos 5。
兩者在發現漏洞時表現相近,到了編寫漏洞利用程序、把缺口轉化成實際攻擊手段的階段,Opus 5仍明顯落后。它已經很會檢查哪里出了問題,真正利用這些問題發動攻擊的能力仍受到限制。
Opus 5可以繼續檢查源代碼和尋找漏洞,二進制漏洞掃描、滲透測試及漏洞利用程序生成則會被攔截。
相比Fable 5,新分類器觸發干預的頻率預計減少約85%,正常的安全研究更少被誤傷。
觸發限制后,Claude.ai、Claude Code和Claude Cowork會默認改用Opus 4.8處理請求;加入網絡安全驗證計劃的企業和研究人員,可以使用限制較少的版本。
生物學領域也采用了類似安排。Opus 5成為Anthropic面向普通用戶開放的最強科研模型,但在需要長時間獨立運行的研究任務中仍有明顯局限。
此前在Fable 5上因安全限制被攔截的生物學請求,現在會先轉交給Opus 5處理。普通科研問題因此能用上更強的模型,高風險任務仍然留在安全邊界之外。
03
加量不加價
Opus 5可以算是一次“加量不加價”。
它延續了Opus 4.8每百萬輸入Token 5美元、輸出Token 25美元的價格。
但正如前文所述,在多項編程和智能體測試中新模型完成率更高,單位任務成本反而下降。
橫向來看,它最直接的對手是OpenAI旗艦模型GPT-5.6 Sol,兩者輸入價格相同,Opus 5的輸出價格低約17%。
處理超長資料時,Opus 5的價格優勢還會更明顯。Anthropic對最高100萬Token的上下文維持普通單價。GPT-5.6 Sol的輸入超過27.2萬Token后,整次請求的輸入價格翻倍,輸出價格提高50%。
對于大型代碼庫、長篇研究資料和復雜智能體任務,這項差異會直接反映到賬單上。
按照Anthropic公布的評測,Opus 5雖然沒有在所有項目中勝過GPT-5.6 Sol,但在電腦操作、商業流程和陌生問題求解等需要模型連續做事的任務上,表現和價格都更有競爭力。
用Anthropic的話說,Opus 5專為日常使用而設計,它比其他型號效率更高。如今,這款新模型成為了Claude Max的全新默認型號,也是Claude Pro的最強型號。(作者:小金牙)
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.