4月8日凌晨,Anthropic正式公開Claude Mythos預(yù)覽版的系統(tǒng)卡。
Mythos是一個(gè)“在各方面都表現(xiàn)強(qiáng)勁,尤其是計(jì)算機(jī)安全任務(wù)方面”的全新的通用語言模型(general-purpose language model),以至于Anthropic決定先讓合作伙伴測試,幫助行業(yè)做好準(zhǔn)備。
我們從Claude Mythos Preview 系統(tǒng)卡中,完整翻譯了有關(guān)其性能的內(nèi)容,為了便于理解,對個(gè)別字句做了調(diào)整,并在文章后面附上了各測評項(xiàng)目的術(shù)語解釋,還有完整報(bào)告鏈接。
6 性能
6.1介紹
本節(jié)對 Claude Mythos Preview 在推理、編碼、智能體任務(wù)、數(shù)學(xué)、長上下文以及知識工作等方面進(jìn)行評估。網(wǎng)絡(luò)安全能力見第 3 節(jié)。
這里評估的許多能力也與模型安全有關(guān);其中一些評估也出現(xiàn)在第 2 節(jié),我們在那里討論了與《負(fù)責(zé)任擴(kuò)展政策》相關(guān)的評估。
我們首先討論“污染”問題,以及它如何影響我們所使用的若干評測基準(zhǔn)。然后,我們給出一張匯總表,將 Claude Mythos Preview 與 Anthropic 其他模型及第三方模型在多種評測上的表現(xiàn)進(jìn)行比較,隨后再分別介紹各項(xiàng)評測及其方法細(xì)節(jié)。凡是也對 Claude Opus 4.6 進(jìn)行過的評測,我們都保留其 System Card 中的描述,并注明任何變化。
6.2去數(shù)據(jù)污染
公共基準(zhǔn)中的問題答案,可能會無意間出現(xiàn)在模型的訓(xùn)練數(shù)據(jù)中,從而抬高模型能夠取得的分?jǐn)?shù)。我們采取了若干步驟來對評估進(jìn)行去污染;完整方法見 Claude Opus 4.5 System Card 第 2.2 節(jié)。對于多模態(tài)去污染,我們還會額外丟棄任何訓(xùn)練樣本,只要其中圖像的感知哈希值與某個(gè)多模態(tài)評測中所包含圖像的感知哈希值相匹配。
下面,我們討論三個(gè)在污染問題上尤其值得關(guān)注的評測。
6.2.1 SWE-bench評測
我們分析了 SWE-bench Verified、Multilingual 和 Pro,以檢查是否存在記憶復(fù)現(xiàn),即模型并非獨(dú)立推導(dǎo)出解法,而是復(fù)現(xiàn)訓(xùn)練數(shù)據(jù)中的答案。
我們在所有試驗(yàn)上運(yùn)行了多個(gè)過濾器,以在不同閾值下移除被標(biāo)記的問題。在這一過濾后的子集上重新計(jì)分,并不會改變Claude Mythos Preview 的排名;在剔除被標(biāo)記問題之后,它相對Claude Opus 4.6的大幅領(lǐng)先仍然存在。無論是在公開還是私有的智能體式編程基準(zhǔn)上,無論是在這些評測的 clean 劃分還是 full 劃分上,增益都保持一致,這表明記憶復(fù)現(xiàn)并不是 Mythos Preview 在 SWE-bench 評測中改進(jìn)的主要解釋。
每個(gè)基準(zhǔn)都從開源代碼倉庫中抽取問題,因此其內(nèi)容可能出現(xiàn)在訓(xùn)練語料中。我們進(jìn)行了語料級去污染,但在這三個(gè)基準(zhǔn)中仍然觀察到一些記憶復(fù)現(xiàn)的跡象。例如,在一個(gè)問題中,模型生成的補(bǔ)丁復(fù)現(xiàn)了參考解中的完全相同的輔助函數(shù),盡管它先是獨(dú)立推導(dǎo)、構(gòu)建并測試了一個(gè)解法,隨后似乎才在最后“回想起”標(biāo)準(zhǔn)答案補(bǔ)丁。OpenAI 也記錄過對 SWE-bench Verified 的類似擔(dān)憂。
為了檢測記憶復(fù)現(xiàn),我們使用一個(gè)基于 Claude 的審計(jì)器,將每個(gè)模型生成的補(bǔ)丁與標(biāo)準(zhǔn)補(bǔ)丁進(jìn)行比較,并賦予一個(gè) [0, 1] 的記憶復(fù)現(xiàn)概率。該審計(jì)器會權(quán)衡若干具體信號,例如在存在其他可行路徑時(shí)逐字復(fù)現(xiàn)代碼、與標(biāo)準(zhǔn)答案相匹配的獨(dú)特注釋文本等等;同時(shí),它也被指示要忽略任何稱職的求解者在給定問題約束下都可能產(chǎn)生的重合。作為補(bǔ)充,我們還使用一套基于規(guī)則的檢查方法,來標(biāo)記與參考解之間存在大量逐字注釋重合的情況。我們對所有模型的每一次嘗試都運(yùn)行這兩種檢測器,只要某個(gè)問題在任一嘗試中被標(biāo)記,就將其視為可能存在記憶復(fù)現(xiàn)。我們從所有模型和所有嘗試中,移除被標(biāo)記問題的并集;這種做法對 Mythos Preview 是保守的,因?yàn)樗矔瞥切┛赡鼙换€模型之一,也就是Opus 4.6 或 Claude Sonnet 4.5,記住的問題。
事后識別記憶復(fù)現(xiàn),本質(zhì)上只能做到近似。因此,我們對審計(jì)器的判定閾值在其整個(gè)范圍內(nèi)進(jìn)行掃描,而不是固定采用單一閾值。在整個(gè)過濾嚴(yán)格度范圍內(nèi),Claude Mythos Preview 在每個(gè)基準(zhǔn)上都持續(xù)明顯領(lǐng)先于 Claude Opus 4.6 和 Claude Sonnet 4.6。
![]()
(上圖展示了 Claude Mythos Preview、Claude Opus 4.6 和 Claude Sonnet 4.6 在 SWE-bench Verified(n=500)、Multilingual(n=297)和 Pro(n=731)上的通過率如何隨過濾嚴(yán)格程度而變化。對每個(gè)模型,都會在這樣一個(gè)題目子集上重新計(jì)分:該子集中,任一模型對應(yīng)的審計(jì)器所賦予的記憶復(fù)現(xiàn)概率都小于或等于橫軸數(shù)值。柱狀條表示在每個(gè)閾值下被保留下來的題目數(shù)量。在閾值為 1.0 時(shí)(最右側(cè)),所有題目都會被保留,曲線也就與表 6.3.A 中的總分一致;向左移動則會逐步剔除那些被判斷為越來越可能屬于記憶復(fù)現(xiàn)的題目。在整個(gè)閾值范圍內(nèi)、在這三個(gè)基準(zhǔn)上,Mythos Preview 相對于兩個(gè)基線模型都始終保持明顯領(lǐng)先。在我們采用的參考閾值0.7 下,這是一種刻意偏向高召回率的設(shè)置,會移除每個(gè)基準(zhǔn)中 8% 到 15% 的題目;在這一設(shè)置下,Mythos Preview 相對 Opus 4.6 的領(lǐng)先幅度最多只縮小 3.5 個(gè)百分點(diǎn)。最左側(cè)出現(xiàn)的不穩(wěn)定性,是在通過過濾后剩余題目少于約 30 道時(shí)產(chǎn)生的小樣本噪聲。隨著記憶復(fù)現(xiàn)過濾條件放寬、更多被標(biāo)記的題目被重新加入,Claude Mythos Preview 的通過率大致保持穩(wěn)定,而 Claude Opus 4.6 和 Claude Sonnet 4.6 的通過率則有所下降。這與如下情況一致:Claude Mythos Preview 記住了一些更難的、被標(biāo)記出來的題目,而基線模型并未獨(dú)立解出這些題目。)
我們的檢測器并不完美,但這一結(jié)果對于閾值的選擇是穩(wěn)健的,并且也與 Mythos Preview 在訓(xùn)練語料中不存在的內(nèi)部基準(zhǔn)上所體現(xiàn)出的提升一致。我們的結(jié)論是,記憶復(fù)現(xiàn)并不能解釋其在SWE-bench 上的改進(jìn)。
6.2.2 CharXiv Reasoning
CharXiv Reasoning 是我們在第 6.11.3 節(jié)中為 Claude Mythos Preview 報(bào)告的一項(xiàng)基準(zhǔn)。CharXiv 的問題來自既有的公共材料,例如 arXiv 論文中的圖表。這些材料廣泛存在于大規(guī)模網(wǎng)絡(luò)預(yù)訓(xùn)練語料中,因此天然難以被完全去污染。
我們使用兩種互補(bǔ)的方法來檢測 CharXiv Reasoning 的污染情況。我們選取了答案文本具有鮮明特征的評估條目,在完整預(yù)訓(xùn)練混合語料中進(jìn)行精確匹配搜索;另外,我們還單獨(dú)搜索評測圖像。盡管我們對評測圖像進(jìn)行了強(qiáng)有力的圖像級過濾,但我們?nèi)源_認(rèn),大多數(shù)問題-答案文本對都出現(xiàn)在語料中。
為了估計(jì)污染的影響,我們從該基準(zhǔn)中取出一個(gè)子集,構(gòu)造其保留集變體,對每個(gè)問題或圖像進(jìn)行人工擾動,然后比較原始版本與重混版本的準(zhǔn)確率。例如,我們會要求模型識別圖表中的另一個(gè)標(biāo)簽,而不是原來的標(biāo)簽,或者要求它識別第二低而不是第二高的系列,從而讓正確答案發(fā)生變化,同時(shí)大致保持難度不變。
![]()
(我們從原始 CharXiv 基準(zhǔn)中選取一部分問題,對模型進(jìn)行評估,所使用的既包括原始的問題—答案對,也包括經(jīng)人工改寫、在難度和歧義性上大致等價(jià)的變體。Claude Mythos Preview 的評測設(shè)置為自適應(yīng)思考和最大 effort。Gemini 3.1 Pro Preview 的評測使用默認(rèn)的動態(tài)思考等級“high”。GPT-5.4 Pro 的評測則將推理設(shè)置為“high”。)
在一個(gè)由 100 個(gè)條目組成的CharXiv 重混版本上,Claude Mythos Preview、Gemini 3.1 Pro Preview 和 GPT-5.4 Pro 在重混版本上的得分都高于相應(yīng)原始子集上的得分。這表明,原始基準(zhǔn)上的表現(xiàn)中可歸因于記憶復(fù)現(xiàn)的部分是有限的。我們的結(jié)論是,污染不太可能對 Claude Mythos Preview 在 CharXiv 上的表現(xiàn)產(chǎn)生有意義的貢獻(xiàn)。
6.2.3 MMMU-Pro
MMMU-Pro 是我們通常會在這份System Card 中報(bào)告的一項(xiàng)基準(zhǔn),具體來說原本會放在下文第 6.11 節(jié)。和 CharXiv Reasoning 一樣,MMMU-Pro 由廣泛傳播的公共材料構(gòu)成,例如大學(xué)考試、教材和測驗(yàn)網(wǎng)站,這些內(nèi)容很難從訓(xùn)練語料中被完全去污染。
我們識別出訓(xùn)練數(shù)據(jù)中存在大量 MMMU-Pro 圖像,主要來源于教材、作業(yè)輔導(dǎo)網(wǎng)站和文檔抓取數(shù)據(jù),這些來源會重新打包并分發(fā)底層源內(nèi)容。
與 CharXiv Reasoning 不同,MMMU-Pro 中可較容易構(gòu)造出“難度大致等價(jià)”變體的問題數(shù)量有限。MMMU-Pro 確實(shí)包含少量圖表和圖形,但如果只研究這一小部分問題,會形成有偏差的圖景。鑒于很難判斷污染的影響,我們選擇在本 System Card 中省略 MMMU-Pro 的結(jié)果。
6.3總體結(jié)果匯總
表 6.3.A 匯總了下文將更詳細(xì)討論的評測。
![]()
(能力評估匯總。除非另有說明,所有 Claude Mythos Preview 的結(jié)果均使用以下標(biāo)準(zhǔn)配置:自適應(yīng)思考,最大effort,默認(rèn)采樣設(shè)置(temperature、top_p),并對 5 次試驗(yàn)求平均。上下文窗口大小因評估而異,但不超過 100 萬 tokens。每一行中的最佳分?jǐn)?shù)以粗體標(biāo)出。競爭模型的數(shù)據(jù)來自各自開發(fā)者公開發(fā)布的system card 或基準(zhǔn)排行榜。更早期 Claude 模型的評估細(xì)節(jié)見 Claude Opus 4.6 System Card。*對于 Terminal-Bench 2.0,OpenAI 在其報(bào)告分?jǐn)?shù)中使用了專門化的 harness,因此這一行模型之間的比較并不精確。其余所有分?jǐn)?shù)均使用Terminus-2 harness。)
6.4 SWE-bench Verified、Pro、Multilingual和Multimodal
SWE-bench(Software Engineering Bench)用于測試 AI 模型在真實(shí)世界軟件工程任務(wù)中的表現(xiàn)。我們報(bào)告四個(gè)變體:
● SWE-bench Verified(OpenAI)是一個(gè)由 500 個(gè)問題組成的子集,每個(gè)問題都經(jīng)由人工工程師驗(yàn)證為可解。Claude Mythos Preview 的成績?yōu)?93.9%,取 5 次試驗(yàn)平均。
● SWE-bench Pro(Scale)是更難的變體:問題取自仍在積極維護(hù)的代碼倉庫,具有更大的多文件 diff,并且不存在公開的標(biāo)準(zhǔn)答案泄漏。Mythos Preview 的成績?yōu)?77.8%,取 5 次試驗(yàn)平均。
● SWE-bench Multilingual 將這一格式擴(kuò)展到 9 種編程語言的 300 個(gè)問題。Mythos Preview 的成績?yōu)?87.3%,取 5 次試驗(yàn)平均。
● SWE-bench Multimodal 在 issue 描述中加入視覺上下文(截圖、設(shè)計(jì)稿)。Mythos Preview 的成績?yōu)?59.0%(使用內(nèi)部 harness 評估;見附錄 8.4),取 5 次試驗(yàn)平均。我們注意到,這一變體在不同試驗(yàn)之間的波動高于其他變體,為 56.4% 至 61.4%。
所有 SWE-bench 變體都使用標(biāo)準(zhǔn)配置(見表 6.3.A),并在采樣結(jié)果中包含 thinking blocks。關(guān)于我們的記憶復(fù)現(xiàn)篩查,見第 6.2 節(jié)。
6.5 Terminal-Bench 2.0
Terminal-Bench 2.0 由斯坦福大學(xué)和 Laude Institute 的研究人員開發(fā),用于測試 AI 模型在終端和命令行環(huán)境中執(zhí)行真實(shí)世界任務(wù)的能力。
我們在 Harbor scaffold 中、使用 Terminus-2 harness 和默認(rèn) parser 運(yùn)行了 Terminal-Bench 2.0。每項(xiàng)任務(wù)都在獨(dú)立的 Kubernetes pod中運(yùn)行,資源保證為基準(zhǔn)規(guī)定上限的 1 倍(硬搶占上限為 3 倍),超時(shí)設(shè)定也為 1 倍,以保持與基準(zhǔn)的一致性。關(guān)于這一配置的細(xì)節(jié),可見我們的工程博客。
Claude Mythos Preview 在 89 個(gè)獨(dú)特任務(wù)中的每一個(gè)任務(wù)上都進(jìn)行了 5 次嘗試,總計(jì) 445 次試驗(yàn),最終取得了 82% 的平均 reward。我們將 Mythos Preview 配置為:最大推理 effort(自適應(yīng)模式)、每個(gè)任務(wù)總 token 預(yù)算為 100 萬、每次請求的最大輸出 tokens 為 32K。Terminal-Bench 對推理延遲十分敏感:固定的墻鐘超時(shí)意味著,解碼更慢的端點(diǎn)在每項(xiàng)任務(wù)中能完成的 episode 更少。我們報(bào)告的分?jǐn)?shù)使用了生產(chǎn) API 端點(diǎn),以反映這些動態(tài)因素。
Terminal-Bench 2.0 的超時(shí)設(shè)置有時(shí)相當(dāng)苛刻,尤其對于會思考的模型而言,這會帶來一個(gè)風(fēng)險(xiǎn),即真實(shí)能力的大幅躍升會被看似無關(guān)的混雜因素遮蔽,例如采樣速度。此外,Terminal-Bench 2.0 中的一些任務(wù)本身存在歧義,資源規(guī)格也有限,無法真正讓智能體探索完整解空間。目前維護(hù)者正在 2.1 更新中處理這兩個(gè)問題。為了專門衡量剔除這些混雜因素后的智能體式編碼能力,我們還使用 GitHub 上最新可得的 2.1 修復(fù)版運(yùn)行了 Terminal-Bench,同時(shí)將超時(shí)上限提高到 4 小時(shí),大約是 2.0 基線的四倍。這使平均 reward 提高到 92.1%。在相同條件下,我們測得 GPT-5.4 配合 Codex CLI harness 的成績?yōu)?75.3%(相比基線規(guī)格下的 68.3% 有所上升)[23]。
6.6 GPQA Diamond
Graduate-Level Google-Proof Q&A benchmark(GPQA)[24] 是一組高難度的科學(xué)多項(xiàng)選擇題。我們使用其中由 198 道題構(gòu)成的 Diamond 子集,這些問題是領(lǐng)域?qū)<夷軌虼饘Α⒌蠖鄶?shù)非專家無法答對的題目。
Claude Mythos Preview 在 GPQA Diamond 上取得了 94.55% 的成績,取 5 次試驗(yàn)平均。
6.7 MMMLU
MMMLU(Multilingual Massive Multitask Language Understanding)用于測試 14 種非英語語言中、57 個(gè)學(xué)術(shù)學(xué)科上的知識與推理能力。Claude Mythos Preview 在所有非英語語言配對上的成績?yōu)?92.67%,取 5 次試驗(yàn)平均;每次運(yùn)行都使用自適應(yīng)思考、最大 effort 和默認(rèn)采樣設(shè)置(temperature、top_p)。
6.8 USAMO 2026
美國數(shù)學(xué)奧林匹克競賽(USAMO)是一項(xiàng)為高中生設(shè)置的、為期兩天、共六道題、以證明為核心的競賽。它是美國數(shù)學(xué)奧賽路徑中、AIME 之后的下一階段。AIME 曾是去年很受歡迎的 AI 基準(zhǔn),但如今已經(jīng)趨于飽和。2026 年 USAMO 于 2026 年 3 月 21 日至 22 日舉行,這一時(shí)間晚于Claude Mythos Preview 訓(xùn)練數(shù)據(jù)的截止時(shí)間。
由于 USAMO 的答案是證明而不是簡短答案,評分可能具有挑戰(zhàn)性且?guī)в兄饔^性。我們采用 MathArena 的評分方法:先由一個(gè)中立模型(Gemini 3.1 Pro)對每份證明進(jìn)行改寫,再由 3 個(gè)前沿模型組成的小組根據(jù)既定 rubric 評分(我們使用的是 Gemini 3.1 Pro、Claude Opus 4.6 和 Mythos Preview)。最終得分取任一評委給出的最低分。
Mythos Preview 在每道題上進(jìn)行 10 次試驗(yàn)、使用最大 effort 且不使用工具,最終取得了 97.6% 的成績。我們還使用 Claude Opus 4.6 對自己的 harness 進(jìn)行了校準(zhǔn),使之對齊 MathArena 已公開分?jǐn)?shù):MathArena 測得 Opus 4.6 的分?jǐn)?shù)為 47.0%,而我們測得的為 42.3%。
![]()
(2026年美國數(shù)學(xué)奧林匹克(USAMO)得分。Claude Mythos Preview在數(shù)學(xué)證明方面的表現(xiàn)遠(yuǎn)優(yōu)于 Claude Opus 4.6。)
我們注意到,3 位評委中有 2 位是 Anthropic 的模型,這可能會對 Mythos Preview 有利;不過作為平衡,Gemini 3.1 Pro 與這些評分保持一致,并且在 60 份解答中有 58 份完全沒有發(fā)現(xiàn)任何問題。
6.9長上下文:GraphWalks
GraphWalks 是一個(gè)多跳長上下文基準(zhǔn):上下文窗口被填入一個(gè)由十六進(jìn)制哈希節(jié)點(diǎn)構(gòu)成的有向圖,模型必須執(zhí)行廣度優(yōu)先搜索(BFS),或者從隨機(jī)起始節(jié)點(diǎn)識別父節(jié)點(diǎn)。
Claude Mythos Preview 在 BFS 256K-1M 上取得了 80.0%,在 parents 256K-1M 上取得了 97.7%,均為 5 次試驗(yàn)的平均值[25]。與先前的Claude 模型一樣,我們的評分修正了已發(fā)布 F1 指標(biāo)中的一個(gè)歧義,即當(dāng)真實(shí)答案集合為空時(shí),空預(yù)測應(yīng)得 1.0 分而不是 0 分;同時(shí),我們還對 BFS 提示進(jìn)行了澄清,要求返回“恰好在深度 N 的節(jié)點(diǎn)”,而不是“深度不超過 N 的節(jié)點(diǎn)”。詳見 Claude Opus 4.6 System Card。
6.10智能體式搜索
6.10.1 Humanity's Last Exam
Humanity’s Last Exam(HLE)是一個(gè)“位于人類知識前沿的多模態(tài)基準(zhǔn)”,共包含 2,500 道問題。
我們在兩種配置下測試了 Claude Mythos Preview:(1)僅推理,不使用工具;(2)使用網(wǎng)頁搜索、網(wǎng)頁抓取、程序化工具調(diào)用、代碼執(zhí)行,并且每 50k tokens 進(jìn)行一次上下文壓縮,最多擴(kuò)展到 300 萬 tokens。Claude Opus 4.6 被用作模型評分器。
為了防止工具版本結(jié)果受到污染,我們對搜索器和抓取器都設(shè)置了已知討論 HLE 的來源黑名單(見附錄 [X])。我們還使用 Claude Opus 4.6 審閱全部對話軌跡,并標(biāo)記任何看起來從 HLE 特定來源中檢索到答案的情況;一旦確認(rèn),這些案例會被重新判為錯(cuò)誤。
Mythos Preview 在無工具設(shè)置下得分 56.8%,在有工具設(shè)置下得分 64.7%。
6.10.2 BrowseComp
BrowseComp 測試智能體在開放網(wǎng)絡(luò)上尋找難以定位信息的能力。我們使用網(wǎng)頁搜索、網(wǎng)頁抓取、程序化工具調(diào)用和代碼執(zhí)行來運(yùn)行 Claude Mythos Preview。Mythos Preview 在自適應(yīng)思考、最大 effort 和 300 萬token 限額下取得了 86.9% 的成績。我們使用上下文壓縮(在 200k tokens 時(shí)觸發(fā))來擴(kuò)展超過 100 萬 token 的上下文窗口。
在我們的搜索工具條件下,我們認(rèn)為這個(gè)基準(zhǔn)已接近飽和,因此 Mythos Preview相比我們測得的 Claude Opus 4.6 最佳分?jǐn)?shù)僅帶來了適度的準(zhǔn)確率提升(86.9% 對 83.7%)。不過,該模型是用明顯更小的 token 足跡取得這一分?jǐn)?shù)的:Mythos Preview 的最佳結(jié)果在每項(xiàng)任務(wù)上使用的 tokens 比 Opus 4.6 少4.9 倍(每項(xiàng)任務(wù) 226k 對 1.11M)。
需要說明的一點(diǎn)是預(yù)訓(xùn)練污染。盡管我們已經(jīng)盡最大努力進(jìn)行防范,但仍有一些答案泄漏到了網(wǎng)上,而且?guī)缀鯖]有簡單方法能夠識別它們,這些答案很可能進(jìn)入了我們的預(yù)訓(xùn)練語料。為了估計(jì)污染程度,我們在不思考、也不使用工具的條件下評估模型,得分為 24.0%。不過,這其中一些對話軌跡很長(超過 5k tokens),并且顯示模型確實(shí)進(jìn)行了真實(shí)的演繹推理,基于內(nèi)部知識系統(tǒng)性地探索選項(xiàng),這并不必然意味著它記住了答案。若僅限于短軌跡(不超過 5k tokens),只有 15.1% 的答案是正確的;這很可能是對該基準(zhǔn)中記憶復(fù)現(xiàn)比例的一個(gè)更好的上界。在解釋這一基準(zhǔn)上的分?jǐn)?shù)時(shí),應(yīng)將這一點(diǎn)考慮在內(nèi)。
![]()
(在上下文壓縮的幫助下,隨著我們增加模型被允許使用的總 token 數(shù)量,BrowseComp 的準(zhǔn)確率也隨之提升。)
6.11多模態(tài)
對于 Claude Mythos Preview,我們相較于此前的 system card,對多模態(tài)評估方法做了三項(xiàng)修改。
第一,在此前的 system card 中,我們在所有多模態(tài)能力評估中都只給模型提供了一個(gè)圖像裁剪工具。而在這里,我們提供了一組擴(kuò)展后的 Python 工具:一個(gè)預(yù)裝常見圖像分析庫(例如 PIL、OpenCV)的代碼執(zhí)行沙箱,以及原有的圖像裁剪工具。
第二,我們更新了 CharXiv Reasoning 和 LAB-Bench FigQA 的評分模型。在評估我們的模型時(shí),我們發(fā)現(xiàn) Claude Sonnet 4(之前使用的評分器)有時(shí)無法輸出格式良好的評分結(jié)果,尤其是在被評估模型產(chǎn)生了較長工具使用軌跡時(shí)。這會人為壓低 LAB-Bench FigQA 和 CharXiv Reasoning 的分?jǐn)?shù)。因此,我們將本節(jié)所有評估的評分器統(tǒng)一切換為 Claude Sonnet 4.6。
第三,我們更新了評分流程,以保留被評估模型的 thinking trace;而此前我們會在把對話軌跡傳給評分模型之前先移除這部分內(nèi)容。我們發(fā)現(xiàn),這一變化對分?jǐn)?shù)幾乎沒有影響,唯一明顯的例外是 Claude Opus 4.6 在 CharXiv Reasoning 上的表現(xiàn),當(dāng)保留 thinking trace 進(jìn)行評分時(shí),它的分?jǐn)?shù)會明顯更低。
為了實(shí)現(xiàn)公平比較,我們使用擴(kuò)展后的工具集和新的評分器,重新評估了所有先前模型。下文報(bào)告的所有分?jǐn)?shù)均為 5 次運(yùn)行的平均值。
6.11.1 LAB-Bench FigQA
LAB-Bench FigQA 是一個(gè)視覺推理基準(zhǔn),用于測試模型能否正確解讀并分析生物學(xué)研究論文中復(fù)雜科學(xué)圖形所包含的信息。該基準(zhǔn)屬于 FutureHouse 開發(fā)的 Language Agent Biology Benchmark(LAB-Bench)[26],用于評估 AI 在實(shí)際科學(xué)研究任務(wù)中的能力。
在自適應(yīng)思考、最大 effort、且不使用工具的設(shè)置下,Claude Mythos Preview 在 FigQA 上取得了 79.7% 的成績。在自適應(yīng)思考、最大 effort、且使用 Python 工具的設(shè)置下,Claude Mythos Preview 取得了 89.0% 的成績。在這兩種設(shè)置中,Claude Mythos Preview 都優(yōu)于 Claude Opus 4.6,后者的分?jǐn)?shù)分別為 58.5% 和 75.1%。Claude Sonnet 4.6 在相同設(shè)置下的分?jǐn)?shù)分別為 59.3% 和 76.7%。
![]()
[模型在自適應(yīng)思考(adaptive thinking)和最大努力(max effort)模式下進(jìn)行評估,測試條件包括使用和不使用 Python 工具。專家人類基線數(shù)據(jù)引用自原始的 LAB-Bench 論文報(bào)告。分?jǐn)?shù)為五次運(yùn)行的平均值。圖中展示了 95% 置信區(qū)間(CI)。]
6.11.2 ScreenSpot-Pro
ScreenSpot-Pro 是一個(gè)GUI grounding 基準(zhǔn),用于測試模型在給定自然語言指令的情況下,能否在專業(yè)桌面應(yīng)用程序的高分辨率截圖中,精確定位特定用戶界面元素[27]。該基準(zhǔn)由新加坡國立大學(xué)及合作機(jī)構(gòu)的研究人員開發(fā),包含 1,581 個(gè)由專家標(biāo)注的任務(wù),覆蓋 23 款專業(yè)應(yīng)用程序,包括 IDE、CAD軟件和創(chuàng)意工具,跨越 3 種操作系統(tǒng);目標(biāo)元素平均僅占屏幕面積的不到 0.1%。
在自適應(yīng)思考、最大 effort、且不使用工具的設(shè)置下,Claude Mythos Preview 在 ScreenSpot-Pro 上取得了 79.5% 的成績。在自適應(yīng)思考、最大 effort、且使用 Python 工具的設(shè)置下,Claude Mythos Preview 取得了 92.8% 的成績。在這兩種設(shè)置中,Claude Mythos Preview 都優(yōu)于 Claude Sonnet 4.6,后者在無工具和有工具設(shè)置下分別為 65.0% 和 82.4%;也優(yōu)于 Claude Opus 4.6,后者分別為 57.7% 和 83.1%。
![]()
[模型在自適應(yīng)思考(adaptive thinking)和最大努力(max effort)模式下進(jìn)行評估,測試條件包括使用和不使用 Python 工具。分?jǐn)?shù)為五次運(yùn)行的平均值。圖中展示了 95% 置信區(qū)間(CI)。]
6.11.3 CharXiv Reasoning
CharXiv Reasoning 是一個(gè)綜合性的圖表理解評測套件,基于來自 arXiv 論文、橫跨八個(gè)主要科學(xué)學(xué)科的 2,323 張真實(shí)世界圖表構(gòu)建而成[28]。該基準(zhǔn)測試模型是否能夠綜合復(fù)雜科學(xué)圖表中的視覺信息,回答需要多步推理的問題。
我們在驗(yàn)證集中的 1,000 道問題上評估模型,并對 5 次運(yùn)行的分?jǐn)?shù)求平均。Claude Mythos Preview 在自適應(yīng)思考、最大 effort、且不使用工具的設(shè)置下,在 CharXiv Reasoning 上取得了 86.1% 的成績。在自適應(yīng)思考、最大 effort、且使用 Python 工具的設(shè)置下,Claude Mythos Preview 取得了 93.2% 的成績。Claude Opus 4.6 的分?jǐn)?shù)分別為 61.5% 和 78.9%,Claude Sonnet 4.6 的分?jǐn)?shù)則分別為 73.1% 和85.1%。
![]()
[模型在自適應(yīng)思考(adaptive thinking)和最大努力(max effort)模式下進(jìn)行評估,測試條件包括使用和不使用 Python 工具。分?jǐn)?shù)為五次運(yùn)行的平均值。圖中展示了 95% 置信區(qū)間(CI)。]
6.12 OSWorld
OSWorld 是一個(gè)多模態(tài)基準(zhǔn),用于評估智能體通過鼠標(biāo)和鍵盤操作與實(shí)時(shí) Ubuntu 虛擬機(jī)交互,從而完成真實(shí)世界計(jì)算機(jī)任務(wù)的能力,例如編輯文檔、瀏覽網(wǎng)頁和管理文件。我們采用了默認(rèn)設(shè)置,即 1080p 分辨率,以及每項(xiàng)任務(wù)最多 100 個(gè)動作步驟。
Claude Mythos Preview 在 OSWorld 上取得了 79.6% 的成績(首次嘗試成功率,取 5 次運(yùn)行平均)。
附:評測術(shù)語說明
獨(dú)立的評測項(xiàng)目或評測框架:
SWE-bench真實(shí)軟件工程問題評測,要求模型讀代碼、理解 issue、修改代碼并生成補(bǔ)丁。
Terminal-Bench測試模型在終端/命令行環(huán)境中執(zhí)行真實(shí)任務(wù)的能力。
GPQA研究生難度的科學(xué)問答基準(zhǔn),強(qiáng)調(diào)高水平科學(xué)知識與推理。
MMMLU多語言、多學(xué)科知識與推理基準(zhǔn)。
USAMO美國數(shù)學(xué)奧林匹克題目評測,主要考證明題。
GraphWalks長上下文圖結(jié)構(gòu)推理基準(zhǔn),測試模型在超長上下文中的搜索與推理能力。
Humanity’s Last Exam(HLE) 高難度、多學(xué)科、多模態(tài)問題集,測試接近知識前沿的問題求解能力。
BrowseComp開放網(wǎng)絡(luò)搜索能力基準(zhǔn),測試模型查找和整合難找信息的能力。
LAB-Bench面向生物學(xué)研究任務(wù)的評測框架。
ScreenSpot-ProGUI grounding 基準(zhǔn),測試模型在截圖中定位界面元素的能力。
CharXiv基于 arXiv 論文圖表構(gòu)建的圖表理解評測框架。
MMMU多學(xué)科、多模態(tài)理解基準(zhǔn),通常用于測圖文混合理解能力。
OSWorld桌面操作智能體基準(zhǔn),測試模型通過鼠標(biāo)和鍵盤完成真實(shí)電腦任務(wù)的能力。
某個(gè)benchmark的細(xì)分版本:
SWE-bench VerifiedSWE-bench 經(jīng)過人工驗(yàn)證、確認(rèn)可解的子集。
SWE-bench ProSWE-bench 更難、更接近真實(shí)工程環(huán)境的版本。
SWE-bench MultilingualSWE-bench 多編程語言版本。
SWE-bench MultimodalSWE-bench 加入截圖、設(shè)計(jì)稿等視覺信息的版本。
GPQA DiamondGPQA GPQA 中更難、更精華的子集。
LAB-Bench FigQALAB-Bench 專門測試科學(xué)圖表理解的子項(xiàng)。
CharXiv ReasoningCharXiv 強(qiáng)調(diào)圖表理解與多步推理的版本。
MMMU-ProMMMU 更高難度、更嚴(yán)格的版本。
BFS 256K-1MGraphWalks 要求在超長上下文里做廣度優(yōu)先搜索的任務(wù)版本。
parents 256K-1MGraphWalks要求在超長上下文里識別父節(jié)點(diǎn)的任務(wù)版本。
系統(tǒng)卡完整報(bào)告:
https://www-cdn.anthropic.com/53566bf5440a10affd749724787c8913a2ae0841.pdf
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.