![]()
千呼萬喚始出來,姚順雨加入騰訊后,第一個(gè)重量級(jí)產(chǎn)品Hy3正式版,今天公布了。
為了這個(gè)產(chǎn)品,騰訊可以說是準(zhǔn)備了大半年。
2025年12月,騰訊對(duì)企業(yè)內(nèi)部的大模型研發(fā)架構(gòu)動(dòng)了大手術(shù),新設(shè)AI Infra部、AI Data部和數(shù)據(jù)計(jì)算平臺(tái)部,同時(shí)請(qǐng)來清華姚班出身的姚順雨出任首席AI科學(xué)家,雙線向劉熾平和盧山匯報(bào)。
姚順雨到任后第一件事,就是推翻舊有訓(xùn)練框架,一個(gè)月內(nèi)重建整套預(yù)訓(xùn)練和強(qiáng)化學(xué)習(xí)基礎(chǔ)設(shè)施,定下“不偏科、不刷榜、不燒錢”三大原則。
重建后的首個(gè)產(chǎn)物,便是4月23日上線的Hy3 preview。這個(gè)模型從啟動(dòng)訓(xùn)練到發(fā)布僅三個(gè)月。
但Hy3 preview畢竟只是個(gè)預(yù)覽版,各方面能力只能說尚可,沒做到國內(nèi) SOTA 的程度。
但這次的 Hy3 正式版不一樣,它是真支棱起來了。
01
Hy3正式版升級(jí)了哪些
Hy3正式版沿用了preview的底層架構(gòu),總參數(shù)量295B,每次推理激活21B參數(shù),另外有3.8B參數(shù)用于MTP(Multi-token Prediction)層。模型共80層(不含MTP層),采用GQA分組注意力機(jī)制,64個(gè)注意力頭中8個(gè)為KV頭,隱藏層維度4096,中間層維度13312。專家系統(tǒng)配置為192個(gè)專家、每次激活top-8。上下文窗口256K,詞匯表120832,精度BF16。
也就是說,有效參數(shù)量約為GLM 5.2的一半。其實(shí)Hy3的整套架構(gòu)設(shè)計(jì)早在preview階段已經(jīng)定型,正式版沒有做結(jié)構(gòu)層面的變動(dòng)。
那正式版到底改了什么?
官方的說法,是“進(jìn)一步提升了后訓(xùn)練數(shù)據(jù)的質(zhì)量和多樣性,擴(kuò)大了RL算力規(guī)模”。
翻譯成大白話,架構(gòu)沒動(dòng),但喂給它的訓(xùn)練數(shù)據(jù)更好了、更多樣了,也給強(qiáng)化學(xué)習(xí)更多的計(jì)算資源。
從benchmark數(shù)據(jù)來看,Hy3這次在官方博客和HuggingFace上放出了相當(dāng)詳細(xì)的得分表,覆蓋代碼、搜索、工作智能體、STEM、推理和上下文學(xué)習(xí)六大方向,并和GLM-5.2、GLM-5.1、DeepSeek V4 Pro、Seed-2.1 Pro、Qwen-3.7 Max、Gemini-3.1-pro-preview、Claude Opus 4.8、GPT-5.5等主流模型做了橫向?qū)Ρ取?/p>
以下數(shù)字均來自混元官方發(fā)布的附錄表格。
![]()
先看代碼智能體方向。Hy3正式版在SWE-Bench Verified上拿到78.0分,SWE-Bench Pro 57.9分,SWE-Bench Multilingual 75.8分,Terminal-Bench 2.1 71.7分,DeepSWE 28.0分。
作為對(duì)比,GPT-5.5在SWE-Bench Verified上是84.4分、SWE-Bench Pro 58.6分;GLM-5.2在SWE-Bench Pro上是62.1分;DeepSeek V4 Pro 在 SWE-Bench Pro 上是55.4分。
Hy3和開源模型相比不相上下,但和頂級(jí)閉源模型之間還有一些差別。
搜索智能體方向是Hy3表現(xiàn)最強(qiáng)的地方。BrowseComp 84.2分,在所有對(duì)比模型中排第一,甚至追平了GPT-5.5。WideSearch 76.4分,DeepSearchQA 91.0分。
工作智能體方向,Hy3在MCP Atlas(公開版)拿到79.1分,ClawEval(pass3)68.5分,Toolathlon 48.5分,WildClawBench(35輪,純文本)53.6分。
混元還跑了內(nèi)部評(píng)測(cè)集Hy-FinModelBench(金融建模),拿到69.0分,基本和GLM-5.2持平。
STEM和推理方向,Hy3在GPQA Diamond上拿到90.4分(GPT-5.5為93.6), HLE(帶工具,純文本)53.2分(GLM-5.2為54.7, DeepSeek V4 Pro 為48.2), USAMO 2026 72.0分,IMOAnswerBench 90.0分,MathArena Apex 38.7分,SuperChem 54.9分。GPQA Diamond的90.4分已經(jīng)相當(dāng)接近GPT-5.5的93.6分,HLE帶工具的53.2分低于 GLM-5.2(54.7)但高于DeepSeek V4 Pro(48.2)。
上下文學(xué)習(xí)方向我得多說兩句,跑的是CL-bench和CL-bench Life這兩個(gè)騰訊自建的評(píng)測(cè)集以及AA-LCR。Hy3在CL-bench上拿到23.8分,CL-bench Life 17.0分,AA-LCR 73.4分。
這三個(gè)數(shù)字看著很低,但這不是Hy3的問題,而是這個(gè)評(píng)測(cè)方向本身的特性。
CL-bench是姚順雨加入騰訊后署名發(fā)表的第一篇論文(2026年2月發(fā)布,arXiv 2602.03587,騰訊混元與復(fù)旦大學(xué)聯(lián)合研究),專門用來測(cè)試語言模型的“上下文學(xué)習(xí)能力”,評(píng)分越高,代表模型越能從上下文中學(xué)習(xí)全新知識(shí)并正確應(yīng)用。
同時(shí),這篇論文中也提到,當(dāng)前幾乎所有SOTA模型在這方面都很差。論文發(fā)布時(shí),表現(xiàn)最好的 GPT-5.1 (High) 在 CL-bench 上的任務(wù)解決率只有23.7%。如果不提供上下文,GPT-5.1只能解決不到1%的任務(wù)。
也正因?yàn)槿绱耍樣瓴虐阉?dāng)作“下半場(chǎng)”要攻克的核心問題之一。
別看hy3沒拿多少分,要知道,在CL-bench面前,哪怕是Claude Opus 4.8,也就才拿了24.8分。Hy3的23.8在國產(chǎn)模型里是最高的。
評(píng)分終歸是評(píng)分,騰訊自己也承認(rèn),公開榜單并不能完全反映模型的“真實(shí)戰(zhàn)斗力”。
Hy3正式版發(fā)布前,騰訊做了一個(gè)特別的測(cè)試,在內(nèi)部組織了270位來自不同學(xué)科的專家,基于真實(shí)工作場(chǎng)景做模型盲測(cè),收集了312份有效對(duì)比。
結(jié)果是Hy3均分2.67/4,優(yōu)于絕大多數(shù)模型,優(yōu)勢(shì)集中在前端開發(fā)、數(shù)據(jù)與存儲(chǔ)、CI/CD等類別。這個(gè)測(cè)試的樣本量不算大,但由于采用的測(cè)試方式是真實(shí)工作場(chǎng)景的專家盲測(cè),所以比純跑benchmark更能反映模型在生產(chǎn)力任務(wù)中的實(shí)際表現(xiàn)。
相較于Hy3 Preview,正式版的幻覺率從12.5%降至5.4%,降幅超過一半。常識(shí)錯(cuò)誤率從25.4%降至12.7%。多輪問題率從17.4%降至7.9%。長(zhǎng)對(duì)話理解基準(zhǔn)MRCR從42.9%升至75.1%。工具調(diào)用的錯(cuò)誤恢復(fù)能力和效率大幅提升,觸發(fā)無限循環(huán)的無效調(diào)用減少了。跨腳手架泛化性也得到增強(qiáng)。
這意味著不管你用哪個(gè)編程工具框架來調(diào)用Hy3,效果差異不會(huì)太大,并且效果要比Hy3 Preview更好。
定價(jià)方面,Hy3延續(xù)了preview的性價(jià)比路線:API輸入1元/百萬tokens,輸出4元/百萬tokens,輸入命中緩存0.25元/百萬tokens。模型權(quán)重以Apache 2.0協(xié)議在GitHub、HuggingFace、ModelScope、GitCode等平臺(tái)開源,全球開發(fā)者可免費(fèi)商用。海外平臺(tái)方面,OpenRouter、Cline、OpenClaw、OpenCode、CherryStudio等也將陸續(xù)接入。
preview上線兩周后,token調(diào)用量達(dá)到上一代Hy2的10倍,在OpenRouter上以3.66萬億token的周調(diào)用量拿到總榜和市場(chǎng)占有率“雙第一”。到了正式版發(fā)布時(shí),日均token消耗量已經(jīng)增加了20倍。
尤其是代碼和Agent類場(chǎng)景的調(diào)用量增長(zhǎng)最為明顯,在WorkBuddy/CodeBuddy以及QClaw類應(yīng)用中增長(zhǎng)超過16.5倍。
02
落到產(chǎn)品里如何
模型跑分再高,最終都要落到產(chǎn)品里才算數(shù)。
Hy3正式版發(fā)布時(shí)已經(jīng)接入了WorkBuddy/CodeBuddy、元寶、ima、Marvis、QQ瀏覽器、騰訊新聞、WeGame、騰訊樂享、搜狗輸入法、微信公眾號(hào)、微信讀書、騰訊地圖、騰訊文檔等核心業(yè)務(wù),另外還有近50個(gè)業(yè)務(wù)在排隊(duì)接入。
WorkBuddy是國內(nèi)目前最受關(guān)注的AI辦公智能體之一,也是Hy3能力驗(yàn)證的主戰(zhàn)場(chǎng)。
從數(shù)據(jù)來看,Hy3在WorkBuddy上的表現(xiàn)確實(shí)有質(zhì)的提升。相比preview版本,任務(wù)解決率從72%躍升至90%,平均耗時(shí)縮短34%。token效率方面,高頻辦公任務(wù)中Hy3的token消耗顯著低于GLM5.2,比如文檔處理方面節(jié)省了47.4%,PPT制作節(jié)省了49.0%。
并且自Hy3 preview發(fā)布以來,WorkBuddy上自主選擇Hy3的用戶數(shù)增長(zhǎng)了6倍。
具體到實(shí)際辦公場(chǎng)景,Hy3能做的事情要比preview版本更復(fù)雜了。
根據(jù)官方給出的showcase,Hy3能從101個(gè)SKU銷售數(shù)據(jù)中產(chǎn)出Excel建模分析以及30頁匯報(bào)PPT;把公司三個(gè)地區(qū)的數(shù)據(jù)用聯(lián)動(dòng)公式匯總成一張5000多個(gè)單元格的表;設(shè)計(jì)核聚變能源引擎的概念宣傳網(wǎng)頁;通過攝像頭用手勢(shì)交互控制圖片粒子融解重組;通過多輪交互制作一個(gè)落日飛車游戲。
元寶是另一個(gè)重要的落地場(chǎng)景。
接入Hy3后,元寶也同步上線了Agent功能。用戶在日常對(duì)話中輸入需求,元寶即可直接執(zhí)行復(fù)雜任務(wù)并交付PPT、Word、Excel、PDF、HTML等文件。
騰訊的內(nèi)部評(píng)估顯示,Hy3在綜合辦公與生活服務(wù)兩大場(chǎng)景上已超過了GLM-5.1,文檔生成綜合分提升7%,網(wǎng)頁制作與自動(dòng)化腳本提升6%。
ima的知識(shí)庫問答和Agent場(chǎng)景也接入了Hy3。Agent任務(wù)中系統(tǒng)穩(wěn)定性達(dá)95.1%,工具編排能力突出,盲目重試、應(yīng)止未止等無效操作大幅減少。知識(shí)庫問答場(chǎng)景推理質(zhì)量?jī)籼嵘?9%,幻覺率下降15個(gè)百分點(diǎn)。Marvis的多Agent協(xié)作場(chǎng)景中,任務(wù)完成率達(dá)93.7%,6個(gè)Agent協(xié)作下任務(wù)派發(fā)正確率達(dá)92%。
QQ瀏覽器的編程與代碼輸出類任務(wù)成功率提升37.6%。微信公眾號(hào)AI分身和客服的意圖識(shí)別準(zhǔn)確率從98.28%提升到98.94%。
WeGame《流放之路:降臨》(POE2)AI游戲助手的多輪推理與工具調(diào)度綜合成功率提升至92%,幻覺率從4.5%降至2.8%。
值得一提的是Hy3在微信小程序開發(fā)方面的能力。
在Hy3 preview發(fā)布時(shí),混元就展示過這么一個(gè)案例,用戶給模型一個(gè)復(fù)雜的Prompt,要求用微信小程序原生框架開發(fā)一個(gè)完整的徒步路線與旅游計(jì)劃推薦小程序,包含首頁圖片輪播和分類導(dǎo)航、路線詳情頁行程時(shí)間軸和圖庫、個(gè)人中心收藏功能,并且要求UI清新自然、代碼邏輯閉環(huán)、可直接導(dǎo)入微信開發(fā)者工具運(yùn)行。
模型一次性輸出了包括app.json全局配置在內(nèi)的所有文件。到了Hy3,這個(gè)能力得到了進(jìn)一步增強(qiáng)。
比如我讓Hy3給我做個(gè)快遞小程序,它就連前端帶后端,外加API、數(shù)據(jù)結(jié)構(gòu)、項(xiàng)目方案一并輸出。
![]()
這里其實(shí)有個(gè)有趣的事情,微信前不久推出的原生AI助手“小微”,也具備通過自然語言生成小程序的能力。
比如下圖,我讓小微給我生成一個(gè)字母AI專用的文章記錄助手。
![]()
但小微背后的模型并不是Hy3,而是微信自研的WeLM和DeepSeek-v4。日常交互由WeLM主導(dǎo),復(fù)雜推理則調(diào)用DeepSeek。
5月15日,微信小程序“成長(zhǎng)計(jì)劃”完成了模型升級(jí),全面采用Hy3 preview模型。
6月8日,微信又發(fā)布了《關(guān)于開發(fā)者接入微信AI生態(tài)的指引》,正式面向小程序開發(fā)者開放AI生態(tài)接入能力。美團(tuán)、滴滴、京東、途虎養(yǎng)車、攜程等頭部平臺(tái)已經(jīng)宣布與騰訊在AI Agent領(lǐng)域達(dá)成合作。
或許在小程序開發(fā)這塊,開發(fā)者用Hy3,普通老百姓用Welm+DeepSeek,才是騰訊想要的完美答案。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.