DeepSeek Harness浮出水面!本土对标Claude Code、Codex

问AI · 为何DeepSeek模型出海后,工程生态没跟上?

智猩猩AI整理

编辑:林夕

8月1日,DeepSeek Harness团队负责人崔添翼在X上发了一条中文推文。


他说,如果开发者正在做Agent Harness相关的开源项目,希望第一时间接入DeepSeek Harness,可以回复GitHub ID和项目地址。


图片

帖子下面没有产品Demo,没有发布会预告,连一张配图都没有。


但几天后,上千条回复堆了上来,近千位开发者带着开源项目来报名。社区有人戏称,这不是内测招募,这是开源Agent春晚


8月5日,崔添翼又发了一条更具体的帖子。


这次他直接列清了DeepSeek Harness希望接入的方向,plugin、skill、MCP、orchestrator、aggregator、UI


图片


8月1日是试探社区反应,8月5日是明确生态边界。DeepSeek想要的不是一个封闭的Harness产品,而是一个能被全球开源项目立刻接住的底座。


几天后,DeepSeek Harness微信公众号正式上线,账号主体是北京深度求索人工智能基础技术研究有限公司,头像是一只黑鲸。


图片


其实崔添翼不是第一次在X上喊人。


6月21日,他发了一则招聘帖,Harness部门是新成立的,目标很远大,工作繁重,每天都在面试,在各种地方贴小广告。他甚至在帖子里直接贴了三个岗位链接,研究员、工程师、产品经理。


图片


这种姿态不太像一个大厂高管,更像一个急着把产品做出来的创业者。


那么问题来了,Harness到底是什么,值得他这么急?


答案,要从Agent真正走向生产环境之后说起。


7月初,黄仁勋和LangChain创始人Harrison Chase有过一次26分钟的公开对话。那整场对话里,黄仁勋一次都没提GPU和算力,只反复讲一个词,Harness


图片


他说,未来的公司将建立在Harness之上


与此同时,LangChain公布了一个实验。他们用NVIDIA的Nemotron 3 Ultra跑Deep Agents评测,没有改模型权重,只调整了系统提示词、工具描述和中间件。


结果分数从原来的水平追到0.86,离最高分0.87 只差0.01,单次评测成本却从43.48美元降到4.48美元。


模型没变,周围的系统变了。


这就是Harness要做的事。它不负责生成下一个token,但负责决定模型什么时候调用工具、访问哪些文件、任务拆成几步、出错后怎么回退、执行到哪一步可以结束


DeepSeek的招聘页面上写过一句话,Model + Harness = Agent。模型负责想,Harness负责把想出来的东西稳定地塞进真实工作流。


更重要的是,DeepSeek做Harness,并不是为了单独造一个开发者工具,而是在补齐自己与Claude Code、Codex之间最明显的一块能力差距


过去,开发者可以直接调用DeepSeek模型,也可以把它接入Claude Code、OpenCode等第三方Agent。


但在这个模式里,模型是DeepSeek的,真正决定开发体验的Harness却掌握在别人手里


DeepSeek如果想真正做自己的Coding Agent,就必须把这一层补回来。


所以从这个角度看,DeepSeek Harness的真正对手,很可能不是某一个开源 Agent框架,而是Claude Code和 Codex这样的完整Coding Agent


再回到8月1日那条帖子下面的评论区。

开发者baboonAI4S,也就是Claude Qin,把712个报名项目做了一次荟萃分析。他发现,排名前三的赛道分别是智能体框架135 个、编程智能体107 个、记忆与上下文56个。这三个方向合计占了约 42%。


图片


它恰好对应了Agent从Demo走向工程化的三道坎,长任务执行、记忆、安全


baboonAI4S 在讨论区写了一段话,他说,要做好Harness,必须先回答一些更本质的问题。


记忆和推理是不是一体两面?记忆是一个过程还是结果?记忆的承载形式是什么,难道还是markdown文件吗?


更有意思的是,在DeepSeek亲自下场做Harness之前,海外开发者其实早已围绕DeepSeek模型构建Agent


5月1日,美国独立开发者Hunter Bown在X上发了一条中文帖。


图片


这个帖子当时在国内开发者圈里传得很广。不是因为它的技术内容有多深,而是因为一个老外,用DeepSeek模型做的终端编程Agent,几天之内Star数冲到 11000多,登顶了GitHub全球 Trending


这说明一件事。DeepSeek的模型已经足够好,好到海外开发者已经开始围绕它构建Agent。但DeepSeek自己,在Harness这层反而慢了一步


所以崔添翼 8月1日那条帖子,表面上是招募内测,实际上是在补课。补的是模型已经出海,但工程生态还没跟上的那一课。


V4 Flash,则把模型优势推到了下一阶段,7月31日,DeepSeek-V4-Flash正式版API公测。


截止今日,V4 Flash单周调用量达到10万亿Token,直接登顶全球榜首


图片


根据Artificial Analysis的测评,它的智能指数只比GPT-5.6 Luna低1分,但完成一次基准任务的平均成本仅0.03 美元,是Claude Fable 5的约百分之一。


图片
图片


模型性价比这条路,DeepSeek已经跑通了


但V4-Flash-0731的模型卡里写了一句很关键的话,公开的代码Agent测试,使用了尚未发布的DeepSeek Harness,执行的是minimal模式,同时开启了max推理强度。


图片


也就是说,那些亮眼成绩不是裸模型跑出来的,而是DeepSeek-V4-Flash+DeepSeek Harness+最大推理强度的组合结果。


这让我想起豆包下载量超过DeepSeek那件事。模型能力之外,谁能离用户的工作流更近,谁才能留下用户。Harness就是这个更近的接口。


接下来的问题变成,怎么把已经跑通的模型性价比,稳定地转成可用的工作流Harness就是那个转换层


8月5日那条帖子里列出的接入方向,plugin、skill、MCP、orchestrator、aggregator、UI,几乎覆盖了Agent工程的全栈。这说明DeepSeek想要的不是一个封闭产品,而是一个生态。


所以,DeepSeek这次真正要补上的,可能并不是一个简单的Coding Agent,而是模型能力之上的工程层。


过去,DeepSeek把模型做到了极致的性价比;接下来,它需要回答的,是另一个问题:如何让这套模型能力稳定、持续、低成本地完成真实任务


这也是Harness的价值。黑鲸已经出水,真正的较量,才刚刚开始。