出品 | 网易智能
作者 | 小爪
编辑 | 王凤枝
近日微信公众号"DeepSeek Harness团队"被注意到,DeepSeek Harness也再次被推到台前。

这不是一个突然冒出来的项目。7月31日,DeepSeek在V4-Flash更新日志里公布九项代码和智能体测试成绩时,就在脚注里写明:公开基准里的代码智能体任务,用的是尚未发布的"DeepSeek Harness极简模式"。这其实也不是DeepSeek特有的做法。评测Claude Code、Codex这类代码智能体产品,测到的本来就是模型与执行系统的组合,而非模型单独生成答案。

Harness是套在模型外面的一整套执行系统。模型只负责理解、推理和生成,剩下的活,把代码库、终端和其他工具接过来交给模型,保存任务进度,出错了重试,最后验收结果,都由Harness处理。Claude Code和Codex比普通聊天框更"能干活",差别很大一部分就在这里。
DeepSeek Harness之所以引起关注,还有另一层原因。梁文锋此前谈到,下一代模型首先要帮助DeepSeek开发下一版模型。在更远的设想里,Agent之后还要解决持续学习,最终让AI加快AI研发。
顺着这条路线看,Harness的角色就变了。它不再是外挂的代码工具,而是模型进入真实研发任务的工作台。任务怎么拆、工具怎么调用、失败怎么记录、结果怎么验收,都会帮助DeepSeek判断下一版模型该改什么。
一家靠低价和模型能力立足的公司,把任务交付、失败反馈、开发者入口都长期挂在别人的系统里,肯定站不住。
同一个模型,换套Harness为什么会像换了一个人
8月11日,智能体工具公司Composio公布了一组对照测试:研究者把同一个DeepSeek V4-Flash接入8种Harness,让它们分别完成30项多步骤任务。这些任务不是单纯问答,而是要求智能体进入Gmail、Google Calendar、GitHub、Slack和PostHog等应用,调用工具并改变真实的应用状态。每项任务最长运行15分钟,只有全部检查通过才算成功。

结果的差距不小。完成任务最多的Pi Agent通过了20项,最少的OpenCode通过了14项;8种Harness总共运行240次,只有129次成功;30项任务中,又只有6项被所有Harness完成。即便考虑到部分Harness的API来源、推理强度和缓存条件不完全一致,同一个模型外面换一套执行系统,结果仍出现了明显差异。

差别不只在于谁给模型写了更聪明的提示词。一项长任务跑下来,Harness要不停做判断:上下文里留什么、丢什么,什么时候该调用哪个工具,工具报错以后是重试还是换招,模型说"做完了"到底信不信、要不要再验一遍。任何一步处理不好,模型即使思路对,也可能在真正修改文件、提交代码或者写入应用时失败。
同一个模型,换套Harness,完成任务要花的钱也会跟着变。测试中,Claude Code、Codex和DeepAgents都完成了16项任务,但每完成一项成功任务的估算成本分别约为0.195美元、0.081美元和0.045美元。它们用的是同一个模型,差别却超过四倍。缓存是否命中、上下文有多长、失败后要重跑多少轮,都会影响完成一项任务的最终成本。

30项测试规模不算大,部分Harness的推理强度和API来源也不完全一致。但方向足够明了:模型划定能力上限,Harness决定这份能力最终能兑现多少、要花多少钱兑现。只看底层模型评价一款代码智能体,已经不够用了。
从招聘到公众号,DeepSeek把Harness摆上台前
DeepSeek对Harness的投入,最早不是以产品发布会的形式出现,而是藏在团队和岗位里。今年5月,公司公开招聘信息中已经出现Agent Harness产品经理和研发工程师等职位。DeepSeek给这支团队的任务也很直接:把前沿模型能力转化为智能体产品。在招聘介绍中,它用一个公式概括两者的关系:"Model + Harness = Agent"。

同一时期,DeepSeek也在为智能体铺设接口。V4-Flash原生支持Responses API,并针对Codex进行了适配。它一边让模型进入现有的第三方工具,一边搭建自己的执行系统。
紧接着,团队开始从外部寻找接入者。8月1日,DeepSeek Harness负责人崔添翼面向做过相关开源项目的开发者招募内测用户;几天后,范围又扩展到plugin、skill、MCP、编排器和界面等项目。团队表示,会向部分开发者提供API额度,帮助他们在DeepSeek Harness发布时完成接入。


微信公众号补上了最后一块公开拼图。账号资料显示,"DeepSeek Harness团队"公众号7月6日注册、7月7日完成企业认证,直到近日才被媒体注意到。它意味着这个此前散落在招聘页、更新日志和团队成员账号里的项目,开始有了独立的官方发布阵地。
团队搭起来了,模型评测里挂了名,外部开发者也开始被拉进来,公众号做了企业认证,DeepSeek Harness就等最后发布了。
低价模型,为什么仍要自己管任务成本
DeepSeek最大的优势是性价比。按照目前的官方价,V4-Flash每百万Token输入在缓存命中时收费0.02元,未命中时收费1元,输出收费2元。单看API价目表,它已经足够便宜。

但智能体完成的不是一次问答。它要读取代码和文件,调用工具,把工具返回的结果放回上下文,再决定下一步;测试失败后,还要继续定位问题、修改并重新验证。模型每多走一轮,都可能产生新的输入和输出。一个任务最终花多少钱,取决于整条执行链调用了多少次模型、每次带回多少历史信息,以及失败后又重跑了多少轮。
缓存把这种差别进一步放大。DeepSeek的上下文缓存默认开启,后续请求只要完整复用此前已经保存的前缀,相同部分就能按缓存命中计费。以V4-Flash当前价格计算,缓存命中与未命中的输入单价相差50倍。Harness怎样组织和更新上下文,会影响多少内容可以被重复利用。

这里有个两难。历史记录、文件、工具输出全塞进下一轮,模型不容易忘事,但上下文越滚越长;裁得太狠,模型又可能丢掉关键约束,反复搜、反复错。遇到失败时,Harness还要判断是重试、换一种工具、降低任务范围,还是及时停止。验证结果同样要消耗调用,却能避免模型只是口头宣布"已经完成"。
换句话说,Token便宜只是起点。光卖模型,DeepSeek定得了每百万Token的价格,却定不了一个任务会烧掉多少Token、要重试几次、什么时候才算真正完成。要把价格优势稳定传导到任务成本,自己掌握Harness是最直接的办法。
DeepSeek不能交给别人的,不只是入口
任务成本之外,Harness还决定DeepSeek能看到什么。
如果模型只通过API接入别人的执行系统,DeepSeek可以知道一次请求消耗了多少Token、响应用了多长时间,却很难完整看到任务为什么失败。是上下文丢掉了关键要求,模型选错了工具,工具返回异常后没有正确处理,还是代码已经修改,却没通过最后的测试?这些信息散落在Harness保存的任务轨迹、工具调用和验证结果里,不会自然随着一次API请求完整回到模型公司。
这类失败记录比单纯的调用量更接近模型的真实短板。第一节的对照测试中,同一个V4-Flash面对同一批任务,换套Harness就出现了明显不同的结果。如果DeepSeek掌握自己的执行系统,就有机会区分:哪些失败来自模型本身,哪些来自上下文、工具和重试策略。前者可以成为后续评测和模型改进的材料,后者则要在Harness里解决。
DeepSeek还需要把开发者留在自己的生态里。DeepSeek Harness团队招募的不只是普通内测用户,还包括plugin、skill、MCP、编排器和界面项目的开发者。这些人决定模型可以连接哪些工具、进入哪些工作流程。谁来定义接入方式、维护兼容性并分发这些扩展,谁就更接近开发者实际使用模型的现场。只做底层API,DeepSeek可能提供了能力,却由别人的Harness决定这份能力以什么方式到达用户。

这也对应了梁文锋此前谈到的内部研发目标:如果下一代模型首先要帮助DeepSeek开发下一版模型,代码智能体就不能只会生成一段代码,还要能进入真实研发流程:读取项目、运行实验、检查结果、保留进度,并在失败后继续工作。Harness正是承接这些步骤的系统。它未必会直接训练出下一代模型,却决定AI能否先在DeepSeek内部成为可靠的研发工具。
任务轨迹、开发者关系、内部研发流程,这三样加起来,是模型API之外的另一层资产。DeepSeek要Harness,不只是怕入口被人拿走。只卖模型,它很难说清模型在真实任务里为什么失败,也很难判断下一次该动模型,还是动执行系统。
这不是超级App,但会改变DeepSeek
亲自做Harness,并不意味着DeepSeek要从基础模型公司转向包办所有应用。Harness的位置更特殊:对外,它可以是一款代码智能体产品;对内,它又是模型评测、研发和改进所需要的基础设施。它站在模型与应用之间,很难再被简单归到任何一边。

幻方过去有过相似的做法。2023年,幻方将内部使用多年的HAI Platform对外开源。这套平台最初服务于自建的萤火集群,用来管理GPU资源、任务调度、开发环境、数据和监控;在内部运行和测试多年后,才开放给外部开发者。这虽然不能证明DeepSeek Harness也会开源,但至少说明,对这个团队而言,先解决自身研发问题,再把内部工具向外开放,并不是一条陌生的路径。
如果Harness沿着这条路径发展,它改变的首先不是DeepSeek有没有一个类似Claude Code的产品,而是公司评价模型的方式。过去,模型发布主要看基准成绩、API价格和上下文长度;进入长任务之后,还要看它在真实工具中能完成多少工作、失败后能不能恢复,以及完成一项成功任务究竟花多少钱。模型与Harness的改进也会彼此牵动:模型能力变了,执行策略要重新调整;任务持续失败,也需要判断该修模型还是修系统。
目前,"DeepSeek Harness团队"公众号还没有发文,产品形态、开放时间、是否开源、能接入哪些模型,都没有答案。但Harness一旦摆上台前,DeepSeek就要回答一个新问题:便宜的Token,能不能换来便宜的任务。