DeepSeek Harness:当 Agent 的一切都能拆成插件

2026 年 8 月 13 日,DeepSeek 打了一套组合拳。
很多人只注意到了当天开源的 DeepSeek Harness(简称 dsh)——一个智能体(Agent,也就是能自己动手干活的 AI)运行时框架。但把最近的时间线摆在一起看,会发现这不是一次孤立的发布:
7 月 31 日,V4-Flash-0731 正式版发布,API 公测、开源权重同步放出;
8 月 12 日至 13 日,V4-Pro-0813 正式 GA,从预览版转为正式版;
8 月 13 日,DeepSeek Harness v0.1 开发者预览版发布。
模型刚刚完成正式版升级,框架紧跟着开源,这两件事是配套的。打个比方:模型是 Agent 的灵魂,Harness 是让灵魂动起来的那副身体——工具、记忆、执行环境、界面,全归它管。DeepSeek 这次不只是升级了灵魂,是连身体一起交了出来。

模型升级还算常规操作,把 Harness 整个开源,就是大多数模型公司不会做的动作了。笔者觉得,这可能是 DeepSeek 今年走得最远的一步棋。为什么这么说?先看一场实验。

一、同一个大脑,换个身体就换个命运

就在 Harness 发布前几天,做 Agent 工具的公司 Composio 搞了一场对比测试:同一款 DeepSeek V4-Flash 模型,分别接进 8 个不同的 Harness,去完成 30 项真实任务。

结果挺扎心。表现最好的 Harness 通过了 20 项,最差的只过了 14 项;每成功完成一次任务的成本,最好和最差之间差了 4 倍。

同样的大脑,同样的考题,就因为身体不一样,成绩天差地别啊。笔者看完这个测试的第一反应是:这两年大家盯着模型跑分较劲,关注点可能并不全面。Agent 能不能落地,瓶颈不只在模型里,也在模型外。

二、Harness 到底是个啥?

Harness 直译过来大概叫“驾驭层”,这个翻译有点玄乎。笔者的理解很朴素:除了模型之外,让 Agent 跑起来的所有东西——工具从哪儿调、对话记在哪儿、命令在什么环境里执行、用户对着什么界面操作,统统归它管。

再说得接地气一点:模型像发动机,Harness 就是整台车剩下的部分——底盘、变速箱、车身、方向盘。光有发动机,你是上不了路的。

以前这副身体各家自己做,各做各的,水平参差不齐。Composio 测出来那个 4 倍的成本差,就是这么来的。

三、一切皆插件,而且是彻头彻尾的那种

把一个 Agent 拆开,里面到底有什么?DeepSeek Harness 给出的答案就五个字:一切皆插件

这个“一切”不是宣传话术。在它里面:

  • 模型适配器是插件
  • 工具注册是插件
  • 会话管理和存储是插件
  • 沙箱(隔离的执行环境)是插件
  • Agent 的决策循环是插件
  • 调度编排是插件
  • 连你看到的那个 Web 界面,也是插件

框架本身就是个近乎空壳的底座,底下垫着一个叫 Cordis 的元框架,只管三件事:装插件、卸插件、管插件之间的依赖。插件和插件之间,靠服务和类型化事件来协作,在配置层自由组合。

这么设计图什么?图的是你可以不动一行源码,就把其中任何一块换掉。想换模型?把模型适配器插件换了。想把执行环境从本机挪到远程沙箱?换掉对应的插件,bash、终端这些工具会跟着一起搬家,不用 fork 一份代码出来改。

官方管这种设计叫“能力接缝”。笔者更愿意拿乐高来比喻:每一块都是标准件,最后拼出什么作品,看的是玩的人。当 Agent 被拆到这个份上,框架本身就“隐身”了——剩下的只有接缝和标准件。

四、内置四种模式,各有各的算盘

针对不同用法,DeepSeek Harness 内置了 4 种模式,每种加载不同的插件组合:

模式定位说人话
标准模式完整编码 Agent文件编辑、Shell、搜索、规划、子 Agent、工作流,全套配齐
Code 模式(PTC)程序化工具调用工具封装成 TypeScript SDK,模型直接写代码,一次编排多轮工具调用
极简模式基准测试只留 bash 和文本编辑器两样工具,环境剥到最干净,测的就是模型裸实力
创造模式自定义模式创作继承标准模式全部能力,外加运行时检查、内存中的插件实验和预设创作指导

笔者单独拎出 Code 模式说两句。传统 Agent 干活是一轮一轮磨:调一次工具,回一次模型,一来一回都是延迟和 token(大模型计费的词元单位)。Code 模式换了个思路——让模型直接生成一段 TypeScript 程序,把好几步工具调用一次性串起来,原本 5 轮交互压缩成 1 轮。

这个思路和笔者一直的看法对得上:Agent 用着贵、用着慢,一大半是“来回跑”跑出来的。

创造模式的野心则更大一些。它不光是给用户用的工具,更是给开发者“发明新工具”用的工具——DeepSeek 想要的显然不止自己下场,还有生态。

五、一分钟上手,社区已经动起来了

上手门槛很低。装好 Node.js,一行命令:

npx @deepseek-ai/dsh web

浏览器打开 http://127.0.0.1:3080 就能用,全程跑在本地,不用内测资格,不用排队等邀请。

想从源码构建也行:

git clone https://github.com/deepseek-ai/deepseek-harness
cd deepseek-harness
pnpm install
pnpm run build
pnpm dsh web

社区的热度也能说明问题。发布几个小时,GitHub 仓库就收了 3.3 万多个 star,到现在已经差不多 7.7 万多个 star 了。这个生态起步速度,在 Agent 框架圈子里可不常见。

六、笔者的一点判断

当然,v0.1 开发者预览版,毛边不少,后面八成还会有重构,这些都是早早期项目的常态吧。

但笔者的态度很明确:方向是对的,而且难得地坦诚。V4 系列的升级说明 DeepSeek 不缺模型,Harness 的开源则说明,他们想聊点比模型更大的事。如果你也相信 Agent 是接下来几年的主线,那么现在就上手参与、定义它的基础设施,比等它成熟了再用,有意思得多。

当 Agent 的一切都能拆成插件,框架最后剩下的是什么?笔者认为是三样东西:接缝、标准,还有交还给每个开发者的定义权。

当然,当下 Agent 市场竞争火热,不确定性也很大。你觉得 Agent 的这副“身体”,最终会长成什么样?

DeepSeek-V4低调上线,但创新依旧是那个味儿

讲个冷知识:DeepSeek-V4发布那天,整个AI圈都在等一个发布会。

结果啥也没有。没有直播,没有CEO演讲,甚至没有预热海报。就那么静悄悄地上线了。

但懂行的人全炸了。

不是因为参数有多炸裂——虽然确实炸裂。而是因为技术报告第七页,写着一行小字:

“已完成华为昇腾、寒武纪、摩尔线程等8家国产芯片的Day-0适配。”

翻译一下:这是中国大模型历史上,第一次有顶级模型把国产算力写进官方技术文档的一号位置

以前的国产适配,都是“模型等芯片”——芯片出来了,团队花几个月慢慢调。

这次是“芯片等模型”——V4发布当天,8家国产芯片厂商同步宣布“我们已经跑通了”。

这盘棋,比参数大得多。

先说模型本身:四件事,值不值得换?

如果你只是个普通用户,关心的就一个问题:比之前强在哪?

第一,记忆力变态了。 100万token上下文,什么概念?《三体》三部曲一口气读完,每个细节都记得。你扔一部小说进去让它分析人物关系,它不会聊着聊着就失忆。

第二,会干活了。 这次最核心的升级不是聊天,是Agent能力。它能自己调用工具、写代码、修bug。DeepSeek内部已经拿它当主力编程助手,内部评测说编程体验对标Claude Sonnet 4.5。

第三,推理能力摸到天花板了。 所有开源模型里,V4的推理和知识储备是第一档。跟谷歌Gemini-Pro-3.1这种顶级闭源模型,也就差一口气。

第四,价格还是那个味。 最便宜的Flash版本,输出价格2块钱/百万token。GPT-4.5是30美元,约合人民币200多块。差了100倍。

该薅羊毛薅羊毛。

但真正的看点,不在参数表里

参数、上下文、价格——这些是明牌。

真正的暗牌,是国产算力生态

DeepSeek-V4在华为昇腾平台上,跑出了1.5到1.73倍的推理加速。这不是“勉强能跑”,这是“跑得比英伟达还快”。

为什么能做到?

因为DeepSeek是真开源——MIT协议,随便下载、随便改、随便商用。

这意味着什么?意味着国产芯片厂商不需要等DeepSeek给他们做适配,他们自己就可以拿模型去优化自己的硬件。

主动权,从模型方交到了芯片方和应用方手里。

所以你会发现,这次最积极适配的,恰恰是那些最需要“落地场景”的国产芯片公司。DeepSeek-V4就是他们最好的“试金石”。

这是教科书级别的生态打法。

泼点冷水:创新公司不容易

说完了好的,也得说点大实话。

第一,Pro版本现在限流。 因为高端算力不够,DeepSeek自己都承认Pro版服务吞吐有限。简单说:菜做得再好,厨房太小也出不了多少桌。

解决方案是什么?等昇腾950超节点下半年批量上市。

你看,闭环又绕回来了——国产算力的产能,直接决定了V4 Pro能服务多少人。

第二,人才在流失。 V4的技术报告有270个作者,但过去5个月里,至少10个人已经离开。包括代码与推理的核心负责人郭达雅,被字节跳动以亿元年薪挖走。

梁文锋的压力,比你想象的大。

第三,现在还是纯文本。 不支持多模态识别。你不能让它“看”一张截图然后修bug。在多模态成为标配的今天,这确实是个短板——不过据说Vision版本已在路上。

最后说一句

DeepSeek的成功值得鼓掌,但更有价值的是它带来的鲶鱼效应——用真开源打破算力封锁,用性价比拉低AI门槛,用Day-0适配证明国产芯片能打。但说到底,技术不该有国界。我希望OpenAI、Anthropic、Google,OpenClaw等都能一起往前冲。AI从来不是零和游戏:一个模型突破推理瓶颈,全行业受益;一个算力方案被验证,全球开发者少踩坑。最好的未来不是一家独大,而是百舸争流。