![]()
Kimi K3 的發(fā)布引起了海內(nèi)外網(wǎng)友的高度關(guān)注,2.8T 的萬億大參數(shù)模型,直接在某些測試項(xiàng)目上,把國外閉源模型給擊敗了。
![]()
緊跟在 Kimi K3 之后,定位千問新一代旗艦基座模型的預(yù)覽版 Qwen3.8-Max-Preview,也正式發(fā)布,開放給所有用戶使用,接替 5 月發(fā)布的 Qwen3.7-Max。
兩個(gè)月的時(shí)間,Qwen3.8-Max 的參數(shù)量從 3.7 時(shí)代的「超萬億的千問模型」到現(xiàn)在的 2.4T,千問團(tuán)隊(duì)表示 Qwen3.8-Max 是目前最強(qiáng)大的模型之一,兼容領(lǐng)先的前沿 AI 模型,僅次于 Fable 5。
![]()
▲目前在千問官網(wǎng),已經(jīng)能體驗(yàn)最新的 Qwen3.8-Max-Preview 預(yù)覽版
雖然正式版還沒上,Qwen3.8-Max-Preview 在 X 上的熱度也并不比 Kimi K3 要低,將近 600 萬次的瀏覽,但網(wǎng)友們討論的內(nèi)容都集中在「能聊 ≠ 能用,承諾 ≠ 交付」。
大家都在等正式版/滿血版的 Qwen3.8-Max,以及模型的 benchmark 表、激活參數(shù)量,和 Hugging Face 上帶許可證的真實(shí)權(quán)重文件。
![]()
對比之前 Hy3 的預(yù)覽版和正式版,三個(gè)月的時(shí)間簡直是兩個(gè)模型。這次 Qwen3.8-Max 正式版估計(jì)不會(huì)要等三個(gè)月,所以我們還是簡單測試了一下 Qwen3.8-Max 的預(yù)覽版,看看是不是值得期待。
實(shí)測 Qwen3.8-Max-Preview,速度很快但效果
幾乎所有的大模型公司都開始有自己的「Codex」應(yīng)用,Qwen 用于編程和效率工作場景的應(yīng)用是 Qoder/QoderWork。我們這次使用 Qoder 來對 Qwen3.8-Max-Preview 進(jìn)行測試。
![]()
在 Qoder 內(nèi)可以看到 Qwen3.8-Max-Preview 的定位是最新一代基座模型,深度推理辦公的首選,而模型上下文窗口在模型設(shè)置中,最多可以拉到 1M,即支持百萬字上下文。
我們先是讓它設(shè)計(jì)一個(gè)個(gè)人作品集網(wǎng)站首頁,這類工作對大模型來說基本上都是「灑灑水」,關(guān)鍵點(diǎn)在于怎么做得高級又好看,有創(chuàng)新點(diǎn)。
![]()
生成過程中,Qoder 會(huì)彈出問題要我們選擇網(wǎng)頁的樣式和內(nèi)容,但也可以直接讓 AI 自行決定。
最終的生成的網(wǎng)頁效果確實(shí)不賴,并且還添加了適當(dāng)?shù)木徣刖彸龅臐u變效果,讓網(wǎng)頁的閱讀體驗(yàn)更高級。
![]()
在 Qoder 應(yīng)用內(nèi),我們發(fā)現(xiàn)它提供了 161 種風(fēng)格參考,包括 Aribnb、Apple、Figma、GOV.UK 等不同網(wǎng)站,我們可以直接應(yīng)用對應(yīng)風(fēng)格,來創(chuàng)作網(wǎng)頁。
![]()
此外,Qoder 非常好的一點(diǎn)是,我們可以直接對網(wǎng)頁進(jìn)行修改。通過應(yīng)用內(nèi)的「畫布」功能,我們可以直接選擇網(wǎng)頁上的元素,進(jìn)行排版、顏色、間距、文本內(nèi)容、視覺編輯,以及描邊等參數(shù)的修改。
![]()
接著測試「真才實(shí)學(xué)」的代碼能力,自從 Fable 5 出來之后,有網(wǎng)友用它制作各式各樣的 3D 網(wǎng)頁,模擬真實(shí)的地理環(huán)境,創(chuàng)作不同的游戲場景。3D 測試也成了這段時(shí)間以來新發(fā)布大模型必測的項(xiàng)目之一。
我們從之前的 3D 測試提示詞項(xiàng)目中隨便找了一個(gè),這次是在 Qoder,即代碼場景下的應(yīng)用內(nèi)讓它完成,完整的提示詞是:
創(chuàng)建一款明亮的 Three.js 屋頂跑酷游戲,場景位于風(fēng)格化的紐約街谷上方。玩家開局時(shí)已經(jīng)在奔跑,朝著第一個(gè)發(fā)光的屋頂邊緣沖去。
不要?jiǎng)?chuàng)建標(biāo)題畫面、菜單、關(guān)卡選擇、新手引導(dǎo)浮層或按鍵開始狀態(tài)。
核心玩法只有一個(gè):在計(jì)時(shí)結(jié)束前,從一個(gè)屋頂邊緣跳到另一個(gè)屋頂邊緣,穿過屋頂檢查點(diǎn),最終抵達(dá)終點(diǎn)廣告牌。打造一條充滿活力但范圍集中的天際線路,加入水塔、消防梯、屋頂通風(fēng)口、廣告牌、晾衣繩、遠(yuǎn)處車流、窗格陣列和清晰的落點(diǎn)標(biāo)記。
加入計(jì)時(shí)器、檢查點(diǎn)計(jì)數(shù)、重置功能、緊湊的操作提示和近距離第三人稱鏡頭。整體要明亮、有動(dòng)感、清晰易讀,并且打開后即可游玩。
![]()
Qoder 的整個(gè)任務(wù)界面也很像 Codex,主頁面顯示當(dāng)前任務(wù)的對話窗口,側(cè)邊欄顯示項(xiàng)目概要,包括項(xiàng)目進(jìn)展、產(chǎn)物和文件或 Skill 的引用,以及終端和文件信息等。
Qwen3.8-Max-Preview 的運(yùn)行時(shí)間非常快,深度思考 29s、深度思考 1s、深度思考 1s,沒用幾分鐘就把這個(gè) 3D 網(wǎng)頁給做出來了。
![]()
游戲確實(shí)是能玩的,而且整體的風(fēng)格和 Fable 5 也確實(shí)類似,但是這是第二版的結(jié)果。第一版 Qwen3.8-Max-Preview 給的網(wǎng)頁沒有控制好玩家前進(jìn)的速度,導(dǎo)致游戲體驗(yàn)極差,幾乎每次都要掉下去重來。
我們在 Qoder Work 和網(wǎng)頁版內(nèi)輸入同樣的提示詞,只有 Qoder 交付的結(jié)果是比較樂觀的,其他的平臺應(yīng)該是沒有針對編程項(xiàng)目做過專門的優(yōu)化,以及單獨(dú)的 HTML 文件沒有順利加載 Three.js 庫文件等問題。
![]()
▲ Qoder Work 內(nèi)生成的網(wǎng)頁是一片漆黑
接著我們又讓它生成一些 3D 的藝術(shù)世界,在莫奈位于吉維尼的睡蓮世界中,打造一個(gè)極限的 Three.js 體驗(yàn):一片遼闊的池塘,同時(shí)也是一幅畫,整個(gè)水面與花園都由漂浮的純色筆觸構(gòu)成,乘船穿行其中。
光是聽著就很有難度,這次 Qwen3.8-Max-Preview 的執(zhí)行時(shí)間也比紐約屋頂跑酷任務(wù)更久,但整體上依舊很快,尤其是側(cè)邊欄顯示的進(jìn)展,經(jīng)常是一瞬間就全部 Checked 完成。
最后的結(jié)果就相當(dāng)抽象了,完全不知道這個(gè)網(wǎng)頁是什么。雖然它在結(jié)果里寫著 118,500 個(gè)獨(dú)立色彩筆觸,有睡蓮葉、花朵、日本橋等等元素,但是交付的網(wǎng)頁就是一些碎片在旋轉(zhuǎn)。
![]()
二次修改讓它重新檢查之后,新的結(jié)果依舊是有點(diǎn)一言難盡,但至少是比第一次能明顯地看到這個(gè)橋的形狀了。
![]()
而如果是復(fù)刻 App,我們也輸入「幫我復(fù)刻一個(gè) flighty 的 app,給我可以分享的網(wǎng)頁預(yù)覽鏈接先。」,看看它能否學(xué)到 Flighty 精美的交互和動(dòng)效,以及簡潔大方的 UI。
結(jié)果也是相當(dāng)簡陋,而且?guī)缀鯖]有任何功能,只是找了幾個(gè)航班放在這里展示。我甚至授權(quán)了 Vercel(網(wǎng)頁部署平臺)給它,但是這個(gè)交付的網(wǎng)頁很明顯是不夠格的。
![]()
除了在 Qoder 內(nèi)能體驗(yàn)到 Qwen3.8-Max-Preview,我們在千問官網(wǎng)也測試了一下模型的深度研究能力。
![]()
最后的結(jié)果,基本上和我們用 Qwen3.7-Max 測試是類似的,從核心摘要到市場格局,以及未來行業(yè)發(fā)展趨勢,都沒有太大的差別。
![]()
目前預(yù)覽版的能力或許無法代表最終 Qwen3.8-Max 的能力,但國產(chǎn)開源模型進(jìn)擊的勢頭確實(shí)讓人招架不住。
國產(chǎn)開源大模型首次超過閉源模型
國外的網(wǎng)友說,現(xiàn)在的開源模型幾乎都是來自中國。已經(jīng)發(fā)布的 GLM-5.2 和 Kimi K3,一個(gè)是接近 Anthropic 的 Opus 水平,一個(gè)來到了可以跟 Fable 5 一桌的等級。
而本月還將迎來 Qwen3.8-Max、DeepSeek V4 正式版、GLM-5.5,以及 MiniMax-M3-Pro,幾乎都把「對標(biāo) Fable 5」當(dāng)成了模型的評價(jià)基準(zhǔn)。
![]()
OpenAI 的戰(zhàn)略未來主管 Dean W. Ball 在 X 上發(fā)文,提到 Kimi 是一個(gè)非常優(yōu)秀的模型,它不認(rèn)為 Kimi 的性能可以用蒸餾之類的技術(shù)來解釋。
而在 Agent Coding 測試?yán)铮琄imi K3 的表現(xiàn)幾乎可以與今年一季度最好的公開模型相媲美。
今年以來,主要公司的大模型發(fā)布情況顯示累計(jì)有 39 次模型發(fā)布,其中國產(chǎn)模型有 21 個(gè),而美國的大模型 18 個(gè)。
39 個(gè)大模型中開源模型有 17 個(gè),其中 13 個(gè)來自國產(chǎn)開源模型,4 個(gè)美國模型分別是 Mira Murati 的 Thinking Machine Lab 最新發(fā)布的 Inkling 模型、英偉達(dá)發(fā)布的 Nemotron 3 Ultra、Google 的 Gemma 4 以及英偉達(dá)的 Nemotron 3 Super。
![]()
或許現(xiàn)在談要超過 Fable 5 為時(shí)尚早,但是當(dāng)看到 X 上的網(wǎng)友一本正經(jīng)的分析:
Mythos Preview 是 10T 參數(shù)模型;GPT-6、Fable 5.1 已經(jīng)完成訓(xùn)練但尚未發(fā)布;美國實(shí)驗(yàn)室因?yàn)榘踩L(fēng)險(xiǎn)主動(dòng)壓低或隱藏能力;以及國產(chǎn)模型近期的進(jìn)步有一部分仍然來自蒸餾等判斷……
這就很讓人忍俊不禁,照他們的邏輯,中國模型成績追上來,可以歸因于蒸餾和刷榜;尚未追上的部分,又可以解釋成美國把真正的強(qiáng)模型藏起來了;無論出現(xiàn)什么結(jié)果,都不會(huì)輸。
![]()
今天的榜單上,Kimi K3 可能超過了某個(gè)國外模型;明天 Qwen3.8-Max 可能又在另一個(gè)項(xiàng)目里拿到第一;再過幾天,DeepSeek、智譜還會(huì)繼續(xù)把新的模型推上來。
模型之間的差距,開源和閉源,國產(chǎn)和海外模型,都正在變得越來越短。
以前,想要最強(qiáng)的模型,可能只能選擇少數(shù)幾家海外閉源模型。現(xiàn)在,同樣的能力開始出現(xiàn)在更多模型、更多產(chǎn)品,以及更多本地部署的方案里。
模型能力越接近,我們的選擇就越多。最后決定我們能不能用上更強(qiáng) AI 的,大概會(huì)是這些模型,誰先把價(jià)格打下來。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.