![]()
就在今晚,DeepSeek 正式發布并開源 DeepSeek Harness(DSH)開發者預覽版。
這是一個由 DeepSeek 自己開發的 Agent Harness:它不是新的基礎模型或者一個 API 客戶端,而是負責把模型接入文件系統、終端、網頁、代碼工具和其他 Agent,并組織上下文、工具調用和任務執行的一整套 Agent 運行框架。
![]()
(來源:X)
目前 DeepSeek Harness 已在 GitHub 開源,并可以通過 npm 直接啟動。按照官方說明,用戶安裝Node.js后運行 npx @deepseek-ai/dsh web,即可在本機啟動 Web UI。不過官方也特別強調,目前產品仍處于 Developer Preview 階段,接下來快速迭代過程中可能出現破壞兼容性的修改。
![]()
(開源地址:https://github.com/deepseek-ai/deepseek-harness)
在持續一年多圍繞模型性能、開源權重和低價 API 展開競爭之后,DeepSeek 第一次把手伸到了模型輸出之后的執行層。或者我們可以換一種更直接的說法:DeepSeek 終于有了一個屬于自己的Vibe Coding入口。
這一動作其實早有預兆。7 月 31 日,DeepSeek 發布 V4 Flash 正式版時,就在更新日志中留下了一行容易被忽略的信息:在公開 Code Agent benchmark 中,V4 Flash 使用的測試框架正是“即將發布”的 DeepSeek Harness 極簡模式。也就是說,Harness 在正式公開之前,已經開始參與 DeepSeek 對自身模型 Agent 能力的評估。
就在 Harness 發布前,DeepSeek 還完成了另一塊拼圖。
8 月 13 日早些時候,DeepSeek-V4-Pro 正式版上線 App、Web 和 API,API 對應模型已經更新為 DeepSeek-V4-Pro-0813。V4 Pro 支持 1M Token 上下文、最高 384K Token 輸出。官方尤其強調了 Agent 能力提升:Terminal Bench 2.1 得分達到 87.9,DeepSWE 為 62.7,Toolathlon-Verified 為 74.1,DSBench-FullStack 為 71.1。
![]()
(來源:DeepSeek)
如果把過去兩天的兩次更新放在一起看,邏輯就變得清楚了:V4 Pro 提供更強的基礎模型能力,Harness 則負責把這種能力真正組織成可以工作的 Agent。
這也是 Harness 最關鍵的不同。當傳統聊天模型收到一個問題,然后返回一段文本;Coding Agent 則需要不斷重復“理解任務—尋找文件—修改代碼—運行命令—檢查結果—繼續修改”的循環。這里決定最終效果的已經不只是模型本身,還包括模型拿到了什么工具、系統提示詞如何組織、上下文怎樣壓縮、錯誤之后是否重試、任務如何拆分,以及什么時候應該調用另一個 Agent。
而 DeepSeek 對 Harness 給出的架構答案是:Everything is a plugin,一切皆插件。
官方文檔顯示,DSH 建立在Cordis之上,包括模型適配器、工具注冊、Session Log,甚至 Agent Loop 本身都被設計成可以替換的插件。模型、文件系統、Shell、網頁訪問、Skill、子 Agent、存儲、安全策略和交互界面,都可以通過配置重新組合。因此,它并不只是“DeepSeek 版 Claude Code”或者“DeepSeek 版 Codex”。
![]()
DeepSeek Harness 提供標準、PTC、極簡和創造等多種 Agent 預設
提前參與內測的報道顯示,DSH 已經包含項目管理、長任務協作、多 Agent 編排、上下文管理、聯網搜索、Skill 等本地 Agent 工作臺常見能力;同時可以通過不同 Agent Preset,為同一套系統安裝不同的提示詞、工具和運行規則。
以官方目前開放的形態來看,DeepSeek Harness 更接近一套運行在用戶本地環境里的 Agent 工作臺。
它不只給出答案,還可以進入實際工作環境繼續行動。比如,用戶可以把一個代碼項目所在的文件夾交給它,讓它先閱讀項目結構和文檔,再尋找相關代碼、修改文件、調用終端運行程序或測試;如果測試報錯,它還可以根據錯誤信息繼續定位問題、再次修改,而不是每一步都等用戶復制粘貼代碼和報錯信息。
這些能力主要通過 Web UI 提供,同時還有面向終端用戶的TUI、適合腳本和 CI 的 Headless 模式,以及 ACP、JSON-RPC 和 Python SDK 等自動化入口。換句話說,同一套 Harness 既可以做成人直接操作的編程工作臺,也可以被接進自動化流程:例如收到一個任務后自動檢查代碼、執行測試,完成后再返回結果。提前體驗資料顯示,這些形態共享同一套模型、會話和底層插件,只是通過不同組件組合成不同的產品形態。
它還支持更復雜的長任務和多 Agent 協作。一個主 Agent 可以把工作拆給多個子 Agent,例如讓一個負責搜索項目和資料,一個負責修改代碼,另一個負責執行測試,再由主 Agent 匯總結果并決定下一步。官方框架同時提供計劃、目標、待辦事項和后臺任務等機制,目的就是讓 Agent 不必局限在“一問一答”,而可以持續完成一串彼此關聯的操作。
這讓 DeepSeek 開始進入 Claude Code、Codex 等產品已經率先展開的競爭。基礎模型公司不再滿足于提供一個 API,而是進一步爭奪模型和真實計算環境之間的執行層。
此前OpenAI 甚至已經直接使用“harness”來描述 Codex 的這部分能力。其今年公開的技術文章將 Codex CLI 定義為本地軟件 Agent,并把負責組織模型、工具和用戶交互的 Agent Loop 稱作 Codex Harness。Codex 桌面端隨后又進一步加入多 Agent 并行、Skills、Automations 和 computer use。
這背后還有一個更重要的原因:AI Coding 正在成為觀察和訓練 Agent 能力最理想的場景之一。
相比寫文章、回答問題等開放式任務,代碼擁有密集而且相對客觀的反饋。程序能不能運行、編譯是否成功、測試是否通過、終端返回什么錯誤,都可以直接被機器驗證。因此,一個 Coding Agent 可以不斷形成“執行—獲得反饋—修改—再次執行”的閉環。比如修復一個 Bug 時,模型修改代碼后可以直接運行測試,再根據新的報錯繼續調整,不止停在“給出一段代碼建議”這一步。
這使 Coding 也越來越像基礎模型 Agent 能力的實驗場。模型是否會規劃、能否穩定調用工具、面對錯誤能否調整策略、能不能完成數十甚至上百步的長任務,都會在真實代碼環境中暴露出來。
而 Harness 控制著這個閉環。DeepSeek Harness 的 Session Log 設計要求,凡是模型真正看到的內容都必須能夠從日志重建,包括用戶消息、模型請求、工具調用、工具結果、上下文壓縮和權限變化。其目的首先是讓任務能夠恢復、回放、調試和審計,但從模型工程角度看,這同樣意味著 Agent 的執行過程開始變得可以被系統化記錄和分析。
這也是為什么,同一個模型放進不同 Harness,實際表現可能出現明顯差異。提前體驗 DSH 的媒體曾將同一版本 V4 Flash 放入不同 Agent 框架完成相同任務,結果出現了肉眼可見的差異。當然,單次測試無法證明哪種 Harness 普遍更強,但至少說明,工具、提示詞、上下文組織和執行策略已經成為 Agent 最終性能的一部分。
過去談 DeepSeek,競爭焦點幾乎始終落在模型本身:參數規模、訓練成本、Benchmark 和 API 價格。但到了 V4 Pro 與 DeepSeek Harness,這條邊界正在發生變化。
模型仍然決定智能的上限,但當模型開始真正進入代碼庫、終端和長期任務后,如何把這種智能接入真實環境,開始成為另一半問題。DeepSeek Harness 的意義也正在這里:它不僅給 DeepSeek 補上了一個 Vibe Coding 產品入口,也讓 DeepSeek 第一次擁有了一套自己定義的 Agent 執行框架。
從 V4 Pro 到 Harness,DeepSeek 正在從“造一個更強的模型”,走向“讓這個模型真正開始工作”。
1.https://github.com/deepseek-ai/deepseek-harness
2.https://www.npmjs.com/package/@deepseek-ai/dsh
3.https://api-docs.deepseek.com/updates/
注:封面/首圖由 AI 輔助生成
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.