事情是醬的。
幾天前發(fā)了一篇13個(gè)AI做2026高考數(shù)學(xué)全國(guó)一卷的測(cè)試,也得到了許多關(guān)注。
但后臺(tái)有幾位數(shù)學(xué)老師留言以及給我們提意見(jiàn),關(guān)注到幾道題的題面好像不太對(duì)勁以及對(duì)于模型的選擇有問(wèn)題。
我們回去全看了一遍,
第一次測(cè)試的題目,有一部分是從截圖或PDF轉(zhuǎn)LaTeX來(lái)的。轉(zhuǎn)的過(guò)程中,有些上標(biāo)掉了,或者根號(hào)位置歪了,還有的選項(xiàng)條件解釋跟原卷有細(xì)微出入等等等。
![]()
對(duì)于離開(kāi)高數(shù)有點(diǎn)久的我來(lái)說(shuō),一開(kāi)始確實(shí)是沒(méi)找出毛病。
數(shù)學(xué)和模型都是,對(duì)輸入的敏感程度超出想象。
從第一步就被帶進(jìn)溝里,后面推得越認(rèn)真,只會(huì)讓他錯(cuò)得越遠(yuǎn)。
所以這一次,我們來(lái)個(gè)針對(duì)性復(fù)測(cè)。
我們把整套卷子重新人工整理成LaTeX,每道題的題面,參考答案,評(píng)分口徑,都和數(shù)學(xué)老師逐題過(guò)了一遍。然后讓13個(gè)模型重新作答。
所有模型都在全新對(duì)話里,一樣的不聯(lián)網(wǎng),不查資料,不調(diào)用任何外部工具,只按高考答題標(biāo)準(zhǔn)輸出完整過(guò)程。
還是統(tǒng)一說(shuō)一下這次的所有模型,claude,deepseek,gemini,minimax,kimi,gpt,qwen,grok,glm,豆包,混元
![]()
![]()
![]()
為了確保最終考場(chǎng)一致性,以O(shè)penrouter相同API為主,加上了來(lái)自火山引擎的豆包和騰訊的混元進(jìn)行參與(主要是這兩個(gè)沒(méi)有在openrouter上有提供)。
同一份Prompt也盡可能的做到了同一個(gè)API。并且開(kāi)了同樣的 high thinking模式。
評(píng)分模式也嚴(yán)格按高考的來(lái)。單選只看最終選項(xiàng),多選全對(duì)6分,只對(duì)一部分3分,如果錯(cuò)了還會(huì)扣分。
解答題逐題核對(duì)結(jié)論,關(guān)鍵推導(dǎo)和證明完整性,只寫(xiě)可推出,證明見(jiàn)上的模型,一律按缺步驟扣分。
![]()
話不多說(shuō)直接看最終成績(jī)。
![]()
13個(gè)模型對(duì)錯(cuò)排行如下
![]()
![]()
13個(gè)模型,平均分居然高達(dá)139.4。
什么概念?隨便拉到一個(gè)考場(chǎng)里,全是年級(jí)前排的水平。
且這次復(fù)測(cè)最大的發(fā)現(xiàn),真不是誰(shuí)是第一。
是當(dāng)題面,公式,條件足夠干凈的時(shí)候,模型的最終答案能力,已經(jīng)接近到?jīng)]法用客觀題區(qū)分了。
![]()
8道單選,13個(gè)模型,全對(duì)。
3道多選,除了Q11翻了兩家,其余全對(duì)。
3道填空,全對(duì)。
Q15,Q16,Q17三道解答題,13家全部滿分。
整張熱力圖,前17題幾乎一片綠。
綠到我一度懷疑人生了。。。
也人工真實(shí)核了一遍。但真的沒(méi)錯(cuò),就是綠的。。。
那問(wèn)題來(lái)了,既然大家前面都對(duì),148和130之間這18分,到底是丟哪了?
從Q11,這是全卷唯一的客觀題翻車(chē)點(diǎn)。正確答案BCD,而GLM 5.1和Hy3都選了ABCD,多勾了一個(gè)A。按高考多選規(guī)則,含錯(cuò)選就是0分,6分被直接清零。
![]()
如同上次一樣,多選題依舊是AI的事故高發(fā)區(qū)。
選項(xiàng)A之前我們也分析了,成立的條件很微妙,看起來(lái)也挺對(duì)。
然后是Q18,解析幾何。
![]()
大部分模型的最終答案都是對(duì)的,橢圓方程對(duì),直線方程對(duì),最小值4√3也對(duì)。
但是吧,按照閱卷標(biāo)準(zhǔn)去摳過(guò)程,毛病就全出來(lái)了。
面積比是怎么轉(zhuǎn)化成線段關(guān)系的,沒(méi)寫(xiě)。
R和P的中心對(duì)稱關(guān)系,沒(méi)說(shuō)明。
tan∠PQR的表達(dá)式從哪來(lái)的,也一步跳過(guò)去了。
![]()
但真把榜單拉開(kāi)的,還得是可怕的19題壓軸題。
![]()
這是一道函數(shù)新題型,定義了一個(gè)集合D(x),最后要你證明f(x)在(0,+∞)上單調(diào)遞增。
這種題頭疼的地方在于,證明鏈每一環(huán)都必須閉合。
要先證x>0時(shí)f(x)≤0,再證任意正增量d都屬于D(x0),少一環(huán),整個(gè)證明就是斷的。
![]()
![]()
13個(gè)模型,沒(méi)有一家在Q19拿到滿分。
![]()
最好的GPT-5.5,也在最后一問(wèn)的迭代證明里跳了步,扣2分。
GLM 5.1出乎意料的除了證明以外的全做對(duì)了
Opus 4.8, Deepseek, gemini為首的7個(gè)模型因?yàn)榇鸢覆煌暾y(tǒng)一的都被扣了7分。
而另外四個(gè)模型,也在概述想法或者方向錯(cuò)誤上只拿了6分了。
打分過(guò)程中有個(gè)細(xì)節(jié)我印象深刻。
Opus 4.8做到第3問(wèn)后半段,直接在卷面上承認(rèn),這里的嚴(yán)格證明它完成不了。
![]()
![]()
雖然扣了7分。但我反而感受到了真誠(chéng)。。。
比起那些寫(xiě)一堆顯然,同理可證然后糊弄過(guò)去的,至少它清楚自己證沒(méi)證出來(lái)。
看到了好多模型都出現(xiàn)的幻覺(jué),真實(shí)的承認(rèn)在這一刻顯得更有價(jià)值。
很多模型能猜對(duì)結(jié)論,能給思路,能把數(shù)算對(duì)。
但感覺(jué)說(shuō)的對(duì)和寫(xiě)出一份挑不出毛病的證明,是兩件事。
高考閱卷從來(lái)不看你悟沒(méi)悟,
只看你寫(xiě)沒(méi)寫(xiě),以及正不正確。
最后放個(gè)花絮,
上次測(cè)完之后,大家很好奇每一個(gè)模型運(yùn)行的時(shí)間,所以這次我們也統(tǒng)計(jì)下來(lái)了,
![]()
Grok 4.3整份卷子1分鐘做完,快速的拿了全場(chǎng)倒數(shù)134分。
豆包,Opus, Deepseek等很多也都證明了答案只是時(shí)間問(wèn)題,都會(huì)做但就是差那一兩分鐘。
![]()
Qwen 3.7-Max磨了15分鐘的分?jǐn)?shù)跟Minimax m3離譜的2分鐘,竟然都是138分的并列。
![]()
![]()
后來(lái)理解了,和人類考生一模一樣。
每個(gè)班都有那種刷題賊快的同學(xué),也都有大題永遠(yuǎn)「會(huì)做但寫(xiě)不全」的同學(xué)。
老師天天追在后面念,步驟分,步驟分。有的成功聽(tīng)進(jìn)去了持續(xù)進(jìn)步,但有的還是選擇安于現(xiàn)狀平平靜靜。
AI就走到了現(xiàn)今這階段,數(shù)學(xué)能力已經(jīng)十分頂了,離應(yīng)試規(guī)范還差一口氣。
區(qū)別在于,學(xué)生改掉一個(gè)毛病要練三年,但模型可能下個(gè)版本就改掉了。
今年沒(méi)人能在最終的加強(qiáng)版規(guī)則打分下滿分。
明年我們接著測(cè),還是這套規(guī)矩,干凈的題面,嚴(yán)格的口徑,新的模型。
我挺想看看,
第一個(gè)能把證明鏈完整閉合的,
會(huì)是誰(shuí)。
![]()
@ 作者 / 卡爾 & yc星辰
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.