完勝了,超越了,逼近了,
每次有新模型發(fā)布,介紹基本都長(zhǎng)一個(gè)樣。
推理更強(qiáng)了,代碼更穩(wěn)了,上下文更長(zhǎng)了,Agent更聰明了。
榜單一排,柱狀圖一拉,每一項(xiàng)都比上一代強(qiáng)20%。所以我現(xiàn)在看模型,已經(jīng)越來(lái)越不關(guān)心它在某張榜單上高了幾分,不漲也不會(huì)放出來(lái)。
我更關(guān)心一件事,
穩(wěn)定。
哪怕不是個(gè)全能水桶模型,只要能在我高頻使用場(chǎng)景上一直有效,我很樂(lè)意沖個(gè)plan,很多時(shí)候這比我去openrouter扣扣搜搜挑一個(gè)免費(fèi)模型要好得多得多。
還有67小時(shí)后Kimi額度才重置,F(xiàn)able5用著API的我刷X看到了一個(gè)新模型Macaron V1,這也是我第一次看到公開(kāi)的GLM5.2后訓(xùn)練模型,能一句話直出鵜鶘游戲,主打一個(gè)前端能力拉滿,還把上下文擴(kuò)展到了原生2M。
macaron. im/mindlab/research/introducing-macaron-v1
接入到Claude Code,加上taste skill之后一把出來(lái)的效果也挺能證明這模型UI水平的。待會(huì)我發(fā)發(fā)這個(gè)離譜的提示語(yǔ),專門(mén)來(lái)測(cè)模型UI創(chuàng)意力的。
![]()
Macaron V1這次提出了一個(gè)新框架,MoL,
說(shuō)穿了做了一件事,把基座模型整個(gè)凍住,一個(gè)參數(shù)都不動(dòng)。所有后訓(xùn)練全發(fā)生在 LoRA 空間里。用人話說(shuō),就是同一個(gè)公司共用一套知識(shí)庫(kù),但客服,項(xiàng)目經(jīng)理,程序員和設(shè)計(jì)師,各自保留一顆專業(yè)腦袋。
MoL想做的,就是讓相近的任務(wù)互相強(qiáng)化,差得太遠(yuǎn)的任務(wù)各練各的。
像聊天需要理解你的語(yǔ)氣,記住上下文,還要知道什么時(shí)候承認(rèn)自己錯(cuò)了。
Agent要拆任務(wù),調(diào)工具,處理意外,原來(lái)的路走不通了還得自己拐彎。
Coding更死板一點(diǎn),語(yǔ)法,依賴,測(cè)試,終端,一個(gè)地方出錯(cuò)整段代碼都跑不通。
UI又是另一種腦回路,視覺(jué)得好看,交互得能用,代碼還不能只負(fù)責(zé)把首屏糊出來(lái)。
以前這些能力都擠在同一組后訓(xùn)練參數(shù)里,很容易優(yōu)化蹺蹺板,代碼提升來(lái)了情商就低了,情商上來(lái)了寫(xiě)作就都是幻覺(jué)了,所以我至今還懷念GPT5.4。
Macaron團(tuán)隊(duì)甚至專門(mén)做了一個(gè)插件來(lái)給UI打分,也就是測(cè)試AI模型的A2UI(Agent-to-User Interface) 能力,測(cè)的就是模型在對(duì)話中,除了回復(fù)文字外,能不能在合適的地方生成UI組件。
![]()
![]()
![]()
![]()
對(duì)于不愛(ài)用CLI命令行頁(yè)面的人,馬卡龍也一個(gè)Skill,也把問(wèn)題解決了。
也就是說(shuō)我可以直接看到之前的內(nèi)容還不用/resume的一次次的開(kāi)新視窗。相當(dāng)于一個(gè)不用下載可裝可關(guān)的Desktop App了已經(jīng)。
github. com/mindverse-ltd/macaron-artifacts
紙面實(shí)力和新插件都看差不多了,是時(shí)候上真實(shí)任務(wù)了。
Kimi K3和Macaron V1都說(shuō)自己UI好UI妙,那我就好奇了,在同樣的任務(wù)下的表現(xiàn)會(huì)是怎么樣。所以我給了一段精簡(jiǎn)提示詞,
讓V1來(lái)個(gè)自我介紹,沒(méi)有額外提供技術(shù)棧限制,也沒(méi)有讓skill做場(chǎng)外輔助。
創(chuàng)建一個(gè)名為 web_design 的文件夾,并制作一個(gè)介紹 Macaron-V1-Venti 模型的交互式網(wǎng)頁(yè)。
確保該網(wǎng)站達(dá)到生產(chǎn)級(jí)質(zhì)量標(biāo)準(zhǔn),并可直接部署上線。總共花了十分鐘左右,從0開(kāi)始,一個(gè)沒(méi)啥AI味帶模塊化設(shè)計(jì)還有可視化圖表的介紹站出現(xiàn)了。
![]()
總的來(lái)說(shuō),里面帶的特效,沒(méi)有壓過(guò)文字要表達(dá)的信息,還嵌入了加入Agent后的聊天UI對(duì)話,這是我在其他模型用一樣的提示語(yǔ)還沒(méi)見(jiàn)過(guò)的效果,還挺新穎的。
![]()
也是借由Agent聊天框的想法,讓我萌生了實(shí)測(cè)個(gè)Agent聊天室吧的想法。
一樣是短短的幾句Prompt
創(chuàng)建一個(gè)名為 chat 的新文件夾,并在網(wǎng)頁(yè)中展示一個(gè)多智能體聊天室。
確保各個(gè)智能體能夠相互交流,同時(shí)我可以隨時(shí)終止它們的對(duì)話。
整體氛圍可以像一個(gè)“AI 議會(huì)”,圍繞人工智能的未來(lái)展開(kāi)討論。再等個(gè)十幾分鐘,它又又又出了結(jié)果
![]()
不同Agent各司其職,
有統(tǒng)籌者,有研究員,教育家和工程師也都進(jìn)入了這個(gè)對(duì)話
讓他們開(kāi)始聊天后,消息源源不絕
大家都符合自己人設(shè)的瘋狂表達(dá)。
在每輪對(duì)話主題過(guò)后還都有總結(jié)以及意向在邊上讓我做參考
![]()
從平時(shí)自己在家里跟Fable5斗智斗勇到現(xiàn)在看著Agent們內(nèi)部間辯論的戰(zhàn)火朝天,
這也就是三行提示詞出來(lái)的效果。。。
再來(lái)再來(lái),身為大模型,會(huì)點(diǎn)物理不過(guò)分吧,那讓V1來(lái)做一個(gè)物理課教學(xué)頁(yè)面,再考考模型的世界知識(shí)。
創(chuàng)建一個(gè)名為 gravity 的文件夾,并制作一個(gè)名為 Gravity Particle Lab(引力粒子實(shí)驗(yàn)室) 的精致單頁(yè) HTML 交互體驗(yàn)。
僅使用 HTML、CSS 和原生 JavaScript。所有代碼都放在同一個(gè) index.html 文件中,不使用任何外部庫(kù)或框架。
## 核心概念
在一個(gè)大型交互式畫(huà)布中展示動(dòng)態(tài)粒子系統(tǒng)。畫(huà)布中設(shè)有一個(gè)可以移動(dòng)的引力源,用于吸引或排斥粒子。整體體驗(yàn)應(yīng)更像一個(gè)輕量級(jí)的交互式物理實(shí)驗(yàn)室,而不是單純的裝飾性背景動(dòng)畫(huà)。## 主要交互
在畫(huà)布中渲染 100~300 個(gè)持續(xù)運(yùn)動(dòng)的粒子。
在畫(huà)布中心附近放置一個(gè)引力源。
用戶可以通過(guò)鼠標(biāo)或觸控拖動(dòng)引力源。
粒子會(huì)加速朝引力源移動(dòng)。
添加可選的排斥模式,將粒子推離引力源。
粒子碰到畫(huà)布邊界時(shí)應(yīng)產(chǎn)生柔和的反彈效果。
限制粒子的最大速度,確保模擬過(guò)程保持穩(wěn)定。
防止粒子被困在引力源內(nèi)部。
保持動(dòng)畫(huà)流暢,并確保運(yùn)動(dòng)具有足夠的穩(wěn)定性和可預(yù)測(cè)性,避免出現(xiàn)失控或不穩(wěn)定的情況。
從運(yùn)動(dòng)軌跡到不同參數(shù)導(dǎo)致的反應(yīng),都展現(xiàn)的穩(wěn)定還正確。
因?yàn)槭谴箜?xiàng)目的緣故,在沒(méi)有調(diào)用任何Skill的情況下,V1還能在接受后還自己加上了個(gè)內(nèi)測(cè)。
![]()
而為了繼續(xù)測(cè)它的 Coding 能力,我又想到了一個(gè)看著簡(jiǎn)單,實(shí)際上特別容易出Bug的經(jīng)典大一作業(yè)噩夢(mèng):2048。
這個(gè)游戲大家應(yīng)該都玩過(guò),頁(yè)面本身并不復(fù)雜,
無(wú)非就是一個(gè) 4×4 的格子,幾個(gè)數(shù)字方塊,再加上滑動(dòng)和合并動(dòng)畫(huà)。
但真要把它寫(xiě)對(duì),里面的坑一點(diǎn)都不少。
比如連續(xù)四個(gè)2應(yīng)該合成兩個(gè)4,而不是直接變成8,
同一個(gè)方塊在一輪移動(dòng)中只能合并一次,
無(wú)效移動(dòng)不能生成新方塊,
好多好多都是之前其他Agent踩過(guò)的坑。所以它表面上是個(gè)小游戲,實(shí)際上更像是一場(chǎng)狀態(tài)管理和邊界條件考試。我給它的提示語(yǔ)還是很直接:
創(chuàng)建一個(gè)名為 2048 的新文件夾,并制作一款功能完整且可以正常游玩的 2048 游戲。
使用自適應(yīng)的4×4棋盤(pán),并正確實(shí)現(xiàn)原版 2048 的全部游戲規(guī)則。
支持方向鍵、WASD 鍵以及移動(dòng)端滑動(dòng)手勢(shì)。加入流暢的方塊移動(dòng)與合并動(dòng)畫(huà),并提供當(dāng)前分?jǐn)?shù)、持久化保存的最高分、重新開(kāi)始、獲勝、游戲結(jié)束和繼續(xù)游戲等狀態(tài)。
需要特別注意方塊的合并順序,防止同一回合重復(fù)合并,同時(shí)正確處理無(wú)效移動(dòng)、重復(fù)輸入和響應(yīng)式適配。
確保所有交互均可正常使用,最終完成的游戲中不得包含占位控件或明顯錯(cuò)誤。等它一次性生成結(jié)束后,整個(gè)游戲已經(jīng)可以直接玩了。
從鍵盤(pán)操作,到數(shù)字方塊移動(dòng)和合并的反饋都做得很完整。
分?jǐn)?shù),最高紀(jì)錄,重新開(kāi)始,勝利提示和游戲結(jié)束狀態(tài)也都有對(duì)應(yīng)處理。
最后的最后,我一個(gè)真正的魔王任務(wù)來(lái)了。
這一次,直接把我們一直在做的AI學(xué)習(xí)網(wǎng)站,LearnPrompt交給它,現(xiàn)在重構(gòu)之后長(zhǎng)這樣,
![]()
讓它把原本偏內(nèi)容型的學(xué)習(xí)頁(yè)面,重新做成一個(gè)具有3D特效,可交互,還能清楚解釋課程體系的展示網(wǎng)站。同時(shí),我也允許它根據(jù)需要自行調(diào)用合適的 Skills。接到任務(wù)之后,V1沒(méi)有說(shuō)直接套一個(gè)常見(jiàn)的科技網(wǎng)站模板,是先讀取了現(xiàn)有內(nèi)容和項(xiàng)目規(guī)則,隨后主動(dòng)選擇了Taste Skill,把它作為視覺(jué)與交互設(shè)計(jì)上的參考規(guī)范。
最終生成的結(jié)果,就是剛剛我發(fā)的第一個(gè)case,提示語(yǔ)也就是,
說(shuō)實(shí)話,整體完成度比我預(yù)期中高不少,莫名有種我學(xué)習(xí)之前還可以看一個(gè)過(guò)場(chǎng)動(dòng)畫(huà)的感覺(jué)。
它使用了大量展開(kāi),收縮,切換和空間層級(jí)變化,把原本比較平面的學(xué)習(xí)內(nèi)容重新組織成可以探索的頁(yè)面。
不同內(nèi)容之間不是簡(jiǎn)單地一段接一段往下堆,是通過(guò)交互和動(dòng)畫(huà)逐步呈現(xiàn),讓我在查看頁(yè)面時(shí)有一種進(jìn)入課程地圖、逐層了解內(nèi)容的過(guò)度感。
![]()
![]()
OK啊,就測(cè)到這兒,
聊點(diǎn)技術(shù)的,Macaron V1的2M上下文是怎么做到的,直接讓glm5.2上下文翻了一倍。
他們發(fā)了個(gè)叫LongStraw的訓(xùn)練方法。現(xiàn)在強(qiáng)化學(xué)習(xí)訓(xùn)練有個(gè)硬墻,大概卡在256Ktoken。
模型學(xué)習(xí)的時(shí)候要同時(shí)記住剛才算了什么,反復(fù)比較好幾個(gè)答案哪個(gè)更好,再把經(jīng)驗(yàn)攢起來(lái)一起更新。
這三件事同時(shí)干的話,上下文再長(zhǎng)一點(diǎn)顯卡內(nèi)存根本扛不住。
LongStraw的核心想法其實(shí)挺直覺(jué)的,一道題的題目大家都一樣對(duì)吧,那題目只讀一次,存?zhèn)€快照,后面只重播做題的過(guò)程。省下來(lái)的內(nèi)存全拿去撐更長(zhǎng)的上下文。實(shí)際效果上8 張H20上就把27B模型訓(xùn)到了 2.1M token,32 張H20上,GLM-5.2這種78層256路MoE的滿血大模型也跑通了2.1M。
還有一個(gè)點(diǎn)我覺(jué)得有意思但容易被忽略的,他們的訓(xùn)練框架 MindForge 把上線后用的整套 Agent 環(huán)境原封不動(dòng)搬進(jìn)了訓(xùn)練。路由怎么分發(fā)、工具怎么調(diào)用、內(nèi)存怎么排,訓(xùn)練和上線完全一樣。
這也解決了一個(gè)老問(wèn)題,訓(xùn)練環(huán)境和真實(shí)環(huán)境不一樣導(dǎo)致模型上線就拉胯。
再說(shuō)個(gè)更騷的,他們搞了個(gè)遞歸自我改進(jìn)的閉環(huán)。模型自己出題,自己做,做完審計(jì)軌跡,改進(jìn)harness配置,再拿優(yōu)化后的數(shù)據(jù)更新自己。更新完的模型又能出更難的題。這個(gè)循環(huán)能一直轉(zhuǎn)下去。
左腳踩右腳起飛了屬于是。
從benchmark上看,Venti在大部分賽道上跟Opus 4.8、GPT5.5、Gemini 3.1 Pro打得有來(lái)有回,同時(shí)還是開(kāi)放權(quán)重可以自己部署的。而且他們部署的GLM-5.2推理速度比智譜還快,這個(gè)我自己體感也對(duì)得上。
![]()
問(wèn)題是現(xiàn)在按 API 調(diào)用收費(fèi),跑多了錢(qián)包扛不住。
我直接在線催更,
Mint Coding Plan 什么時(shí)候出?
出了我就是一個(gè)訂訂訂。
@ 作者 / 卡爾 & yc星辰
最后,感謝你看到這里如果喜歡這篇文章,不妨順手給我們點(diǎn)贊|在看|轉(zhuǎn)發(fā)|評(píng)論
如果想要第一時(shí)間收到推送,不妨給我個(gè)星標(biāo)
如果你有更有趣的玩法,歡迎在評(píng)論區(qū)聊聊
更多的內(nèi)容正在不斷填坑中……
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.