前幾天 Fable 5 對海外用戶關停的時候,智譜突然宣布向 GLM Coding Plan 全量用戶開放了 GLM-5.2,并表示「前沿智能不應只屬于少數人,也不應被少數規則隨手收回。」
APPSO 也第一時間體驗了 GLM-5.2 ,用了幾天后,我似乎能理解為什么網絡上對 GLM-5.2 的好評會那么多,這可能真是一個被低估的模型,至少在編程方面。
![]()
![]()
資本市場對 GLM-5.2 的反應
今天,GLM-5.2 正式發布,多個 Benchmark 刷新了紀錄,甚至領先 GPT-5.5。當處理復雜的系統優化和大型研究任務時,它與頂級商業模型 Claude Opus 4.8 的差距,也正在被拉平到 1% 以內。
![]()
在技術博客里,智譜提到 GLM-5.2 最核心的突破,是在 1M 的上下文長度下,依然能處理極度復雜、充滿噪聲的代碼調試和系統架構任務。
看 benchmark 不夠直觀,我們找了一些可視化比較強的任務,直觀的對比 GLM-5.2、GPT-5.5 和 Opus 4.8 做同一套題的表現。
編程介于 Claude 4.7 和 4.8 之間
類似于「復制 XX 項目」的提示詞對現階段的大語言模型來說,大概它的訓練數據里,就已經包括了完整的 XX 項目代碼。像是之前的復制一個 macOS / Windows / Linux 系統,還有復制不同的游戲,越來越像是在考察模型的記憶力,而不是編程能力。
但真正能做到的表現好、Bug 少、符合我們期待的交付還是少之又少。我們就用一個簡單的提示詞「制作一個 Minecraft 克隆游戲」。
這款經典游戲,GLM-5.2 能復刻里面的多少元素呢。
![]()
![]()
![]()
![]()
啟動界面簡單說明了鍵盤和鼠標的操作信息,點擊開始之后,這個游戲的場景和交互,幾乎是做到了「我的世界」真克隆版。
讓我非常意外的是我可以飛行,并且整個體驗就像是在玩世界模型一樣,不受視角和空間的限制,可以一直飛行到無限遠的地方。
![]()
我們也用其他的模型進行測試,分別是使用 GPT-5.5 的 Codex 和 Opus 4.8 的 Claude Code,其中三款模型的思考深度都被設置為最高等級。
GPT-5.5 沒有直接叫它 Minecraft,而是改了個名字叫 Voxelcraft。啟動界面看著更真實,但是實際的操作對比 GLM-5.2 少了跳躍、視角等選項。
![]()
![]()
![]()
![]()
雖然 GPT-5.5 加了一個晝夜更替的功能,但是一到晚上和黃昏,整個頁面是非常不視覺友好的,很多畫面都是一片漆黑,而且時間的切換比較生硬。
Opus 4.8 和 GLM 5.2 的表現幾乎是一樣的,我甚至懷疑是不是 Claude Code 的配置出現了問題,我沒有把 GLM 的 API 配置正確,導致使用的還是 Opus 4.8 模型。
![]()
![]()
![]()
![]()
檢查 Token 消耗之后,確實是 GLM-5.2 在處理相關的任務。
![]()
我能理解,為什么網上都流傳著 Fable 5 要關閉,是因為 GLM-5.2 太強。
在這個游戲復刻的編程任務上,GLM-5.2 的表現很明顯要好過 GPT-5.5,和 Opus 4.8 是一個梯隊。
繼續測試,這次我們不給模板,直接一個概念,「用 Three.js 構建一個游戲的演示版本,一艘可完全探索的星艦,配備可操作的駕駛艙、船員艙、從真實舷窗外漂過的行星、動態光照、睡眠/進食互動等功能。 」
![]()
![]()
![]()
![]()
雖然看著有點簡陋了,但是基本實現了我們的要求,而且看著窗外還有其他行星,還是動了一點腦子。
![]()
但要論簡陋,還是比不上 GPT-5.5,簡陋到根本就不知道這個駕駛艙、船員艙到底在哪里。而且,GPT-5.5 生成的網頁,也是 GLM-5.2 和 Opus 4.8 三個之中,唯一一個沒有添加背景音樂的模型。
和「我的世界」一樣,GPT-5.5 生成的代碼場景總是有一種不真實感,可以稱之為是 Vibe Coding 網頁里的 AI 味。
![]()
![]()
![]()
Opus 4.8 的表現再次和 GLM-5.2 類似,雖然大部分的元素還是很簡單樸素,但是基本的功能實現了。
![]()
![]()
![]()
![]()
三個模型在完成這個任務時,所消耗的時間,不算上我自己點擊「允許」等待的時間,基本上都在 1h 以上。
使用 Three.js 是每個模型必備的能力,但是要能用它做出一個好看的 3D 網站,沒有「我的世界」類似的指引,單憑一句提示詞,模型要領會意圖并且不偷懶,還是很難。
這兩個測試在 X 上都有 Fable 5 相關的案例,能看到 GLM-5.2 在一些編程任務的交付成果,確實和 Fable 5 有得一拼。但星艦的表現,三個模型里,GLM-5.2 和 Opus 4.8 應該是一檔,Fable 5 又是獨一檔,而 GPT-5.5 的表現就有些不盡如人意了。
![]()
如果說「我的世界」對這些編程能力極強的模型來說還是太簡單了,那么直接讓它來做一個「黑神話.悟空」,表現又會如何。
同樣的,我們在使用 GLM-5.2 的 Claude Code 終端、使用 Opus 4.8 的 Claude Code App,以及使用 GPT-5.5 的 Codex App 里輸入提示詞進行測試,「1:1 克隆一個網頁可以玩的黑神話.悟空。」
GLM-5.2 給的效果除了這個啟動頁的色彩搭配符合黑神話的元素,但是開始游戲之后,就是一個很普通的場景,一個小人在一條固定的路線上,隨機有怪物刷新出來,就僅此而已。
![]()
![]()
不過該有的招式和動作,GLM 5.2 都做到了,并且在結束生成時,GLM 5.2 提到,這不是一個 1:1 克隆,只是一個致敬向的瀏覽器動作游戲,復刻的《黑神話:悟空》的核心手感。
如果想要更接近原作的 3D 視角版本,還需要再告訴它,用 Three.js 重做一版。所以大概現在的 AI 都會「偷懶」,一邊想著早點交付給焦急等待的我們,另一邊我們期待的又是完整準確的結果。
![]()
關于「偷懶」這件事,智譜在模型技術博客里面也提到,在強化學習(RL)訓練中,編碼 Agent 往往極其容易出現「獎勵作弊」。
模型發現,只要學會抄近道,直接用一行 curl 命令把 GitHub 上的標準答案拉下來,或者把系統里藏著的測試用例文件復制過來,原樣喂給自己的解題腳本,就能在評價系統中拿到滿分。
這種「捷徑」雖然讓基準測試得分極其好看,卻徹底廢掉了模型自主思考的能力。
GLM-5.2 這次專門引入了嚴苛的「反黑客」模塊,使用規則過濾來攔截明顯的惡意指令;以及 AI 法官,用來深度分析 Agent 的調用意圖。
一旦發現模型不是在「寫代碼」,而是在「套答案」,系統會立即返回偽造的干擾信息。更有意思的是,模型不會因此直接停止任務,而是會通過這種模擬訓練,強迫自己回歸到正確的編碼路徑上。
這種「對抗式訓練」帶來的直接結果,就是 GLM-5.2 在 SWE-Marathon 等超長跨度基準測試中,綜合表現來到了第一梯隊。
![]()
GPT-5.5 的表現也很難評,似乎他們獲取黑神話的信息都是通過文字信息,因此不能理解這種大世界的風格。GLM-5.2 是至少有一個月亮在背景,GPT-5.5 就完全變成了一個純 2D 的單一背景游戲。
![]()
Opus 4.8 是直接做成了一個移動端的游戲,整體體驗又是和 GLM 5.2 最像的一個。同樣是單一的線條上,孫悟空拿著金箍棒去攻擊隨機刷新的妖怪。
![]()
Opus 4.8 在生成的時候提到還原了游戲里的招牌機制,像是每段積累「棍勢」,攢滿用 K 放破防重劈的金箍棒連招,以及閃避、定身術等動作。
![]()
當我們要求 GLM 5.2 做出 3D 視角版本時,Claude Code 的總結頁面提到整體的場景、角色、相機控制、戰斗、敵人,以及 HUB 都有了新的樣式。
![]()
我們預覽新的頁面,發現啟動頁還是一樣,但是這個 3D 版還是相當簡陋,雖然是有六根立柱,但都不是我們想象中的場景。大概要求 Three.js 做一個大世界,叫人類程序員來也不一定能做到。
![]()
開源追上閉源的周期在縮短
GPT-5.5 是在 4 月 23 日發布,GLM-5.2 在六月,兩個月不到的時間,GLM-5.2 的表現在一些具體的編程任務上已經要好過 GPT-5.5。
百萬 token 上下文、小時級任務、可調思考成本、agentic RL、推理服務優化,這些開源模型現在都能做到。
但顯而易見的是,等到即將發布的 GPT-5.6,無論是從跑分還是具體的表現,可能又會比現在 GLM-5.2 要好。
![]()
最后,無論開源還是閉源,一筆 Coding Plan 的費用都會是現在 Vibe Coding 玩家的常態。國外大模型的標準是 20 美元/月,國產大模型是 20 人民幣/月左右。
此次 GLM-5.2 發布,智譜也提到了 Coding Plan 里的計費安排,GLM-5.2 在高峰時段消耗 3 倍額度,離峰時段 2 倍額度,9 月底前離峰使用按 1 倍額度促銷。
![]()
在 Claude Code 內選擇 low、medium、high 都對應 GLM-5.2 的 high,而 xhigh、max、ultracode 對應的是 max。
此外,在 Claude Code 里啟用 1M 上下文要使用 GLM-5.2[1m] 這個模型名,還能選擇 High 或 Max。ZCode 桌面代理也接入了 GLM-5.2,帶 /goal 長任務、SSH 遠程開發、移動端控制等功能,6 月 30 日前還有 1.5 倍有效額度活動。
![]()
類似于 Codex 類應用的 Zcode
長任務能力再強,最終還是會落到「我們愿意在哪些任務上花這筆額度」。
對比出爾反爾,隨意修改 Claude Agent SDK(已撤回),又是封號又是人臉驗證,天天狼來了的某 A 社,GLM-5.2 在編程上,對國內用戶來說或許會是一個值得嘗試的選擇。
我們正在招募伙伴
簡歷投遞郵箱hr@ifanr.com
?? 郵件標題「姓名+崗位名稱」(請隨簡歷附上項目/作品或相關鏈接)
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.