事情是醬黃瓜的,
今天在火山引擎Force大會上,Seed-2.1-pro新鮮出爐,
有排face拿到內(nèi)測的我馬上讓本地Agent總結(jié)幾個我最近用最頻繁的工作流來做測試,
說實(shí)話,看前端開發(fā)案例真的已經(jīng)看膩了。要么就是來個3D游戲,或者搞個我的世界,都太常規(guī)了,我都懷疑這些模型已經(jīng)把這些代碼訓(xùn)練到自己的權(quán)重里面了。
所以我們這次直接從正式工作流上手,看看Seed-2.1-pro是怎么把一個想法,從需求一直推到一個能打開,能跑,能繼續(xù)改的東西。老樣子,先光速看看紙面實(shí)力的提升。
![]()
![]()
我來解讀一下,
2.1pro的Agent和GUI操作能力很突出,OSWorld 78.8基本貼著 GPT-5.5 的 78.7;Coding編程能力也進(jìn)入第一梯隊(duì)了,Terminal Bench 2.1 是 71.0,接近 GPT-5.5和Claude;多模態(tài)和視覺理解提升比較大,CharXiv-RQ 85.4、MMMU-Pro 81.6、TOMATO 79.5、LVBench 78.0意味著文檔,圖表,截圖,視頻理解都能上。這個就是2.1pro沒有skill的情況下搓出來的
![]()
這次 Seed 2.1 Pro相比 Seed 2.0,最核心的升級,其實(shí)就卡在這里。
2.0已經(jīng)是一個很不錯的強(qiáng)文本 + 基礎(chǔ)多模態(tài)模型,文本,圖像語音理解都能做,中文場景純舒適區(qū)。2.1 Pro這次明顯往更完整的全模態(tài)能力,推理代碼能力,生產(chǎn)級的Agent能力上補(bǔ)了一大截。
它支持原生的音視頻,圖片,文本混合理解,也開始追上第一梯隊(duì)了,長鏈路的工具調(diào)用,復(fù)雜任務(wù)規(guī)劃,支持快思考和慢思考切換,以及256K上下文(什么時候能蹲到豆包的1M上下文啊啊啊)
![]()
用人話說,2.1 Pro開始更像一個可以被放進(jìn)Agent里干活的執(zhí)行模型了。
昨天晚上我就拿它跑了一大輪。
本來只是想找?guī)讖垐D,測測日常任務(wù)啥的,結(jié)果測著測著,給我整成了一輪小橫測。。。
那來都來了,那就來一個原汁原味的模型大橫測吧。從多模態(tài)圖像理解,到DeepResearch報(bào)告,再到從0開始寫PPT,后面又做了前端UI優(yōu)化,再再再到后面搓了個世界杯網(wǎng)站,以及點(diǎn)球大戰(zhàn)小游戲也都給我跑出來了。。
每天用Agent干的活,差不多就是依賴模型的這些能力。
需要強(qiáng)調(diào)的是下面跑的所有case都沒有用到Skill的,沒用ui pro skill沒有頭腦風(fēng)暴skill沒有用輔助模型,真實(shí)環(huán)境下跑出來的,差別還是很多大,GPT5.5沒有skill的情況下做出來的前端文案全是它的思考過程,非常鬧心。
我們工作流所在意的,也就這些。
先從代碼能力說起。
1. 代碼能力
我這次把任務(wù)按難度排了一下。
先讓它修UI和Debug,再到一個網(wǎng)站,最后以一個小游戲結(jié)尾。
像真實(shí)開發(fā),讓他從基礎(chǔ)開始實(shí)測。
我這次翻了一個之前的舊項(xiàng)目出來。
這種項(xiàng)目最煩的地方就是,它也不是完全不能用。頁面也都能打開,但UI就是有點(diǎn)別扭。
有些地方擠在一起,有些地方間距不舒服,有些組件在移動端一縮就開始亂。
每天真的做產(chǎn)品,最消耗人的往往就是這種小東西。之前到這一步就要燒token讓Claude頭腦風(fēng)暴自己優(yōu)化自己了。
![]()
這次我把這個舊項(xiàng)目直接丟給豆包后,給了任務(wù),看代碼改Bug以及UI。
這類任務(wù)其實(shí)很考驗(yàn)?zāi)P汀?/p>
從零生成的時候,可以自由發(fā)揮。
但改舊項(xiàng)目不一樣,得先全程理解后在記問題。
如果上來就亂改,只會越修越怪。
![]()
沿著項(xiàng)目結(jié)構(gòu)去看組件,再去看樣式和頁面布局,最后才開始動代碼。
在舊項(xiàng)目里找到真實(shí)的位置,再一點(diǎn)點(diǎn)把 UI 往正確方向拉。改完之后,效果就順了很多。
![]()
布局正常了,組件關(guān)系更清楚了。
頁面也沒有因?yàn)楦腢I把其他邏輯帶崩。
說明還是能完成一個日常的開發(fā)閉環(huán)的。
Gogogo,我們下一關(guān),
這個任務(wù)就比UI debug稍微大一點(diǎn)。
我讓2.1pro做一個世界杯主題的網(wǎng)站,要有首頁,賽程,球隊(duì),對陣圖,還要能篩選比賽。
這種東西最容易翻車的地方,是模型只做出一個看起來很完整的靜態(tài)頁面。
點(diǎn)進(jìn)去什么都沒有,篩選也是假篩選。
數(shù)據(jù)也只是寫死的幾行字。但豆包這次做出來的東西,是一個能打開,能瀏覽,能繼續(xù)改的版本。
![]()
它把頁面,賽程篩選,數(shù)據(jù)fallback,暗色模式這些基本東西都搭出來了。
也就是說,這個項(xiàng)目不是單純的視覺Demo。
是有一點(diǎn)真實(shí)項(xiàng)目的骨架。
![]()
當(dāng)然,審美還是老問題。
頁面能用,但不驚艷。
漸變,卡片,圓角這些 AI 味還是能看出來。
如果這是一個正式官網(wǎng),我肯定還要繼續(xù)調(diào)視覺。
但如果目標(biāo)是先把一個帶業(yè)務(wù)邏輯的網(wǎng)站跑起來,我覺得它完成得不錯。
那現(xiàn)在還很流行在網(wǎng)頁里面放AI視頻當(dāng)背景,放點(diǎn)3D小游戲當(dāng)交互,
那我肯定不能不測這個,順著世界杯主題做了一個點(diǎn)球大戰(zhàn),要求是必須有狀態(tài),有規(guī)則,有輸入,有反饋,還要有輸贏結(jié)算。
游戲交互還是挺想一回事的,玩家選隊(duì),選擇射門方向,按住 Space 蓄力,松開射門。然后系統(tǒng)判斷進(jìn)球,撲出或者打偏。CPU 再踢一腳。五輪以后如果打平,還會進(jìn) sudden death。
從選隊(duì)伍的開頭到比賽結(jié)束的結(jié)尾,
整個流程在兩輪后就被跑通了。
![]()
![]()
![]()
代碼測完之后就要看看日常任務(wù)用最多的視覺理解,信息收集和PPT生成了(這應(yīng)該也算是信息輸入輸出了)
2. 多模態(tài)理解
![]()
我先給了一張繪本風(fēng)格的森林插畫,
圖里信息其實(shí)挺多的,有天空,草坡,前景小溪,還有一堆小動物圍著聽歌等等等等
如果是粗略的模型描述,可能一句話完了。
一群森林小動物在開音樂會。
但2.1pro沒有停在這一層。
![]()
![]()
從遠(yuǎn)景到前景,從周遭到細(xì)節(jié)都完整的讀取說明了。關(guān)鍵是,它還把這張圖背后的主題風(fēng)格提了出來,
還把一張圖里的空間關(guān)系,關(guān)系文字,元素和情緒主題都拆清楚了。可以期待一下我們后面用來做視頻剪輯和seedance 2.5 pro生成視頻的提示語生成看看。
很多情況下,我們要的不是一句簡單的圖片描述,而是要把圖片轉(zhuǎn)成后續(xù)還能繼續(xù)使用的文字資產(chǎn)。
所以多模態(tài)圖片理解的價(jià)值,就是把信息結(jié)構(gòu)化,語言化,以及可復(fù)用化。
![]()
![]()
![]()
除了對應(yīng)這種AI視頻畫面的復(fù)雜關(guān)系,直接把一些論文相關(guān)或者是課程報(bào)告相關(guān)的數(shù)據(jù)圖表,都丟給豆包 2.1 Pro,它也都能識別出來。
所以我就在想,明年的高考數(shù)學(xué),豆包是不是要拿滿分了。
3.報(bào)告分析DeepResearch
接著就是報(bào)告測試,我讓它分析 MaaS,也就是模型即服務(wù),以及 Agent 為什么會增長。
讓他看大模型未來怎么從聊天工具變成能自己查資料,拆任務(wù),跑流程,交付報(bào)告的工作助手。
![]()
![]()
這次我還要求它寫清楚Source和Reference,也就是每個關(guān)鍵判斷從哪里來。
同時觀察它能不能自己啟動Workflow,用Deep Search找資料,再整理成一份結(jié)構(gòu)完整的分析報(bào)告。
因?yàn)檫@類報(bào)告型任務(wù),如果沒有逐條查來源,模型很容易寫出一份看起來很真的東西。
但真要發(fā)公開文章,每個數(shù)據(jù)都要自己查證。
所以我這里看的不是2.1 pro能不能直接產(chǎn)出一份可發(fā)布報(bào)告,是它的結(jié)構(gòu)能力,能不能把一個開放性問題拆成研究背景,市場增長,商業(yè)模式,競爭格局等一系列匯報(bào)。
![]()
![]()
半個小時后,報(bào)告新鮮出爐
有結(jié)構(gòu)清晰足夠的數(shù)據(jù)做為支撐,并且一開始就把結(jié)論給完整羅列。
不得不說這個成果報(bào)告我還是很滿意的。
4.匯報(bào)PPT實(shí)測
順著這個報(bào)告,又想到了工作里的PPT匯報(bào)也是避免不了的。
給了個題目,讓豆包自己解釋最新模型的優(yōu)點(diǎn),
自證自己不只是一個更聰明的聊天AI,是在能被塞進(jìn)Agent框架里kuku干活的模型。
![]()
說實(shí)話,里面有些話還是有點(diǎn)發(fā)布會味兒。
比如生產(chǎn)級Agent臨界點(diǎn)、數(shù)字員工底座這種表達(dá),全都提了一次。
![]()
![]()
雖然畫面UI較為固定,
但它把內(nèi)容整理成演示稿的能力是成立的。
還是那句話,在不依賴Skill的時候能做出這樣的水平,其實(shí)已經(jīng)能夠說明2.1 Pro是真的在往Agent模型的路上狂奔了。
所以這幾輪測完,我對豆包2.1的評價(jià)其實(shí)已經(jīng)有答案了。
它不是Opus,Sonnet,GPT的無腦替代。
復(fù)雜架構(gòu),強(qiáng)審美設(shè)計(jì),關(guān)鍵事實(shí)判斷,
還是要更強(qiáng)模型或者人來兜底。
但它已經(jīng)很適合做執(zhí)行層的模型。
看圖拆解,寫prompt,整理報(bào)告結(jié)構(gòu)以及做PPT初稿。修舊項(xiàng)目UI,網(wǎng)站骨架和做一個能玩的小游戲原型。
這些活交給它,我是不擔(dān)心完不成的。
而且這套用法的重點(diǎn)不只是便宜,
還有是分工。
不用非要證明它超過誰。
你只要知道哪些任務(wù)可以交給它,
哪些地方需要人審,
哪些關(guān)鍵節(jié)點(diǎn)要換更強(qiáng)模型。
它開始有了一個很實(shí)際很具體的位置。
一個能進(jìn)我Agent工作流的執(zhí)行型隊(duì)友。
@ 作者 / 卡爾 & yc星辰
最后,感謝你看到這里如果喜歡這篇文章,不妨順手給我們點(diǎn)贊|在看|轉(zhuǎn)發(fā)|評論
如果想要第一時間收到推送,不妨給我個星標(biāo)
如果你有更有趣的玩法,歡迎在評論區(qū)聊聊
更多的內(nèi)容正在不斷填坑中……
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.