![]()
盼星星,盼月亮,我們等來了七月初一的月光——
就在今天凌晨,DeepSeek 官網(wǎng)毫無預(yù)兆地更新,DeepSeek V4 Pro 0813 正式登場。依據(jù)慣例,無需手動調(diào)整,現(xiàn)在 API 接入的 deepseek-v4-pro 就會是最新模型。
此外,DeepSeek API 使用與 OpenAI/Anthropic 兼容的 API 格式,簡單粘貼 API Key,就能在 Codex、Claude Code 和 OpenCode 等第三方工具中將 DeepSeek 作為后端模型使用。
![]()
令人稍顯寬心的是,雖然已經(jīng)通過提前預(yù)告的方式給用戶們打了很久「API 即將漲價」的預(yù)防針,更新到 0813 版本后的 DeepSeek V4 Pro 目前依然沒有漲價。每百萬 token 輸入(緩存未命中)與輸出的定價分別是 3 元和 6 元,和預(yù)覽版保持一致,也正好是 DeepSeek V4 Flash 的三倍。
事不宜遲,這就來看看在預(yù)覽版發(fā)布的 111 天后,終于問世的 DeepSeek V4 Pro 正式版帶來了哪些變化。
Agent 能力,終于支棱起來了
不同于往常偏好在白天流量時段發(fā)布新模型,DeepSeek 這次的凌晨更新顯得有些倉促,看似官網(wǎng)只來得及修改模型參數(shù)介紹、API 使用指南等少數(shù)文檔頁,連這回的更新日志都還沒端上來。進一步的更新解讀,可能要留待今日白天。
但考慮到 V4 Pro 正式版發(fā)布的時間只比 7 月 31 日更新的 V4 Flash 正式版晚了不到半個月,我們可以有很大把握相信,二者共享了相近的優(yōu)化思路(如果不是完全相同的話)。
所以,直接看 V4 Flash 正式版的更新日志來推導(dǎo) V4 Pro 的變化也未嘗不可。
![]()
DeepSeek V4 Flash 0731 更新日志里最引人注目的信息,莫過于官方宣稱其基模與預(yù)覽版在模型結(jié)構(gòu)、尺寸上都保持一致,僅僅重新進行了后訓(xùn)練,但針對性的后訓(xùn)練也確實使得「Agent 能力大幅增強,基準(zhǔn)測試遠超 V4-Pro-Preview」 。
如果今晚的 V4 Pro 正式版也是如此,那我們可以預(yù)期觀察到它在 Agent 能力上的突飛猛進。
![]()
目前網(wǎng)上流傳的第一批跑分結(jié)果,很大程度上印證了這一預(yù)期。在這些與 Agent 強相關(guān)的評測集中,V4 Pro 的表現(xiàn)比起預(yù)覽版可謂突飛猛進,在一些項目中接近甚至超越了目前的性能標(biāo)桿 Fable 5:
代表 DeepSeek 自家軟件工程基準(zhǔn)的 DeepSWE 從 12.8 分飆升至 62.7 分;代表 DeepSeek 全棧開發(fā)基準(zhǔn)困難子集的 DSBench-Hard 分數(shù)翻了一倍多,達到 67.2 分;通過自然語言從零生成代碼倉庫的 NL2Repo 從 38.5 分提至 61.5 分 ……
也就是說,同一個 API 名稱,昨天基本還不會做的活兒,今天就可以跟全球第一梯隊的代碼 Agent 掰掰手腕了。
![]()
當(dāng)然了,有 KIMI K3 珠玉在前,即使是更新后的 DeepSeek V4 Pro 正式版也還沒坐上開源界的頭把交椅(一些測試上與 K3 有輕微差距);但眾所周知,DeepSeek 的思路一向是:
比我強的沒我便宜,比我便宜的沒我強。
在補上了 Agent 能力短板后,我們的大鯨魚,再一次維護了這一神圣秩序。
為了更好地理解 V4 Pro 的能力,我們把它接入了 Workbuddy,做了一些簡單的 Agent 任務(wù)實測,看看它會交出怎樣的結(jié)果。
5 個實測案例,完全自主規(guī)劃
第一個任務(wù)很簡單:接入我的微信讀書 Skill,用讀取到的數(shù)據(jù)做一個簡單的數(shù)據(jù)報表。利用 Skills 來工作,本來就是 Agent 能力的日常體現(xiàn)。
這一點當(dāng)然完全難不倒 DeepSeek,令人驚喜的是,它還主動閱讀了我此前因為其他工作而放在文件庫里的愛范兒設(shè)計規(guī)范 Skill,給閱讀報告也配上了我們的專屬配色。
![]()
接下來兩個是網(wǎng)頁設(shè)計任務(wù):
(1)搜集近日科技新聞,以 THE IFANR POST 為標(biāo)題,制作一個仿照傳統(tǒng)新聞媒體的網(wǎng)站首頁,并為頭條制作一張?zhí)摷俚匿秩九鋱D;
(2)制作一個現(xiàn)代化的設(shè)計風(fēng)格展示網(wǎng)站,展示極簡、斯堪的納維亞、新擬物等多種設(shè)計風(fēng)格的 Bento 卡片。
因為時間所限,我沒有詳細地撰寫提示詞規(guī)定各種約束和指導(dǎo)條件,可以說是相當(dāng)模糊的任務(wù)指令。但就結(jié)果而言,V4 Pro 都完成得非常好——
在構(gòu)建新聞首頁的任務(wù)上,它找到了過去幾天我們在選題會上討論過的真實新聞,模仿傳統(tǒng)媒體格調(diào)的版式設(shè)計和襯線字體也非常對味,還「手繪」了一張看著很像樣的配圖。![]()
構(gòu)思設(shè)計風(fēng)格展示網(wǎng)站時,V4 Pro 更「自作主張」地用上了.style 的網(wǎng)站名稱后綴和漸變色標(biāo)題,各種設(shè)計風(fēng)格示例卡片也大體正確,整體來看精致靈動。
![]()
將模糊指令重新梳理為清晰需求,并根據(jù)這一需求自主規(guī)劃、分步完成項目,DeepSeek V4 Pro 正式版的智能程度可見一斑。
至于更復(fù)雜的交互式實例,V4 Pro 也展現(xiàn)出了不俗實力:
一個是基礎(chǔ)的俄羅斯方塊游戲,方塊的繪制顯然相當(dāng)精美,帶有一點小小的偽 3D 效果。
![]()
另一個案例則是從我讀書記錄中的《隨椋鳥飛行》中獲取靈感,制作了一個顯示簡單規(guī)則如何涌現(xiàn)出復(fù)雜秩序的「椋鳥群模擬器」,動畫效果令人驚艷。
![]()
為什么是模型來「獲取靈感」?那是因為在布置后面幾個任務(wù)時,我只跟模型說了「我要去睡覺」,要以什么方向來構(gòu)思示例、又應(yīng)該以何種方式來實現(xiàn),都完全是 DeepSeek 自己在掂量。
![]()
你看,只要模型足夠聰明,當(dāng)媒體老師也不用真的熬夜追熱點——AI Agent 能夠自行替我解決大多數(shù)問題。
還有一個「隱藏大招」
話說回來,DeepSeek V4 Pro 正式版的發(fā)布當(dāng)然是一件大事,但如果把時間拉長來看,它可能只是另一件大事的前奏。
如果仔細閱讀此前官網(wǎng)關(guān)于 V4 Flash 正式版的更新公告,會發(fā)現(xiàn)里面隱藏著一條關(guān)鍵信息:
對于公開基準(zhǔn)測試集中的 Code Agent 任務(wù),正式版 DeepSeek-V4-Flash 使用 DeepSeek Harness 極簡模式(即將發(fā)布)作為框架進行測試,并使用 max 檔位,topp=0.95,temperature=1.0
沒錯,DeepSeek Harness 要來了。
近一兩年,AI 工程的研究者們逐漸形成了一個共識:隨著各家 AI 模型在推理能力上接近天花板,未來真正決定 AI Agent 能力的將不會是底層模型,而是 Harness(運行框架)。
如果說 LLM 是一個數(shù)字員工的大腦,那 Harness 就是它的辦公系統(tǒng),負責(zé)給它分配權(quán)限與任務(wù)、調(diào)取工具、審批流程、檢查結(jié)果、保存日志等工作。
沒有好的運行框架,再強的智能也無從發(fā)揮,甚或是會讓 AI 成為失去管控的脫韁野馬。反過來說,一套足夠好的 Harness,能讓平庸的員工發(fā)揮出 200% 的實力。
如今,隨著 V4 Pro 正式版問世,未來 DeepSeek AI Agent 系統(tǒng)的模型部分已完全到位。那么,Harness 是不是已經(jīng)準(zhǔn)備好了呢?
![]()
答案顯然是肯定的。無論是此前 DeepSeek 招聘 Harness 研發(fā)工程師的新聞,還是前天注冊「DeepSeek Harness 團隊」公眾號,一切證據(jù)都指向:
短至數(shù)天、長至數(shù)月之內(nèi),DeepSeek Harness 就將與我們見面。
或許,新的 DeepSeek 時刻不會太遠。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.