DeepSeek V4-Flash正式版上線,Agent能力一夜之間變強了
![]()
你有沒有發現,最近國產大模型更新速度快得有點離譜。前腳剛看完預覽版,后腳正式版就來了。7月31日下午,DeepSeek通過API文檔發布了一則更新日志,宣布DeepSeek-V4-Flash正式版API上線公測。這不是一次普通的版本號跳動,而是把Agent(智能體)能力實打實地拉高了一大截。
先說最直觀的變化。官方給出的基準測試數據里,V4-Flash正式版在好幾個Agent專項評測上遠超之前的V4-Pro-Preview版本。比如Terminal Bench 2.1拿到了82.7分,Cybergym是76.7,DeepSWE是54.4,Toolathlon verified到了70.3,DSBench-FullStack也沖到了68.7。這些名字聽起來很技術,翻譯過來就是一句話:這個模型更會自己操作電腦、自己調工具、自己跑代碼任務了。
為什么這件事重要?因為過去一年大家都在聊"大模型能不能干活",而不只是"能不能聊天"。所謂Agent能力,就是讓模型像個小助理一樣,接到一個模糊的任務,自己拆解步驟、調用軟件、查資料、改bug,最后把結果交給你。V4-Flash這次明顯是在往這個方向猛踩油門。
![]()
有意思的是,DeepSeek這次把正式版和預覽版做了區分。官方說明,V4-Flash-0731這個正式版的模型結構、尺寸和之前的preview保持一致,區別是重新做了后訓練。也就是說,底層沒大改,但在"怎么更好地聽話、怎么更穩地完成任務"這件具體的事上下了功夫。另外正式版原生支持Responses API格式,還針對性適配了Codex。對開發者來說,這意味著接入成本更低,寫代碼助手的體驗會更順。
那V4-Pro呢?官方在日志里留了句話:正式版V4-Flash上線公測,而V4-Pro正式版將"盡快"發布。等于說,更強的那個還在路上,今天先把這個更能打的Flash放出來給大家用。
從行業角度看,DeepSeek這波操作其實踩在了一個關鍵節點上。今年上半年開始,國內外模型廠商的競爭焦點已經從"誰參數多"悄悄轉向了"誰的Agent真能替人辦事"。OpenAI、谷歌、Anthropic都在推自己的智能體能力,國產這邊DeepSeek、通義、智譜也都在卷。V4-Flash正式版把基準分數擺出來,本質上是在用公開評測說話:我能干的事,有分數佐證。
對普通用戶來說,感知可能還沒那么直接,畢竟API是開發者先用。但往下傳導會很快:你用的那些AI寫代碼工具、AI自動填表工具、AI客服,底層模型一旦換上這種Agent能力更強的版本,最明顯的變化就是"少廢話、多辦事"。以前要你手把手教三步才能完成的任務,以后可能一段話就搞定了。
當然也要潑點冷水。基準測試分數高,不代表真實場景里就一定完美。Agent跑長任務容易中途走偏、調用工具出錯,這些問題在整個行業都還沒徹底解決。DeepSeek自己也在日志里說,這次主要是后訓練優化,結構沒變,所以上限還得看后續V4-Pro正式版的表現。
總的來說,V4-Flash正式版上線是個信號:國產大模型在Agent這條賽道上,已經開始從"演示給用戶看"走向"真的能交付"。接下來幾個月,V4-Pro正式版、各家的新視頻模型、新編程模型會陸續撞在一起,今年的AI圈,熱鬧才剛開場。
來源:DeepSeek API文檔發布日志(2026年7月31日)、新浪財經、極客公園《極客早知道》(2026年8月1日)
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.