DeepSeek Harness开源:思维链全公开,一切皆插件!

谁在害怕看得见的思考?DeepSeek Harness开源首日捅破美国AI模型的最后一层窗户纸!

别再把大模型当黑箱供着了,真正会用的工程师已经开始拆开它、看透它、改装它了!

2026年8月13日,DeepSeek正式发布并开源DeepSeek Harness(DSH)开发者预览版(v0.1),同步以MIT协议开放源代码。项目采用“一切皆插件”的插件式开放架构,模型、工具、技能、会话、沙箱、存储、循环、调度、UI等所有Agent能力均由插件组合而成,可自由替换、灵活重组。底层基于Cordis元框架构建。开源首日,GitHub仓库即收获28k Star,Hacker News讨论帖直接冲上TOP 1。

美国模型藏起来的思维链,DeepSeek直接摊在桌面上

这段话来自DeepSeek Harness官方文档:模型看到的所有东西都被记录在一个仅追加的会话日志里——系统提示词、推理过程、工具调用和结果、子Agent调度、每一次上下文注入,全部写进去。在Trajectory视图中,可以按来源逐一检查这些记录。恢复、分叉、检索、回放,全都跑在同一个事件流上。

这听起来像什么?像日志。就是最朴素的那种记录程序跑了什么的日志。

但就是这种最朴素的东西,美国头部模型死活不给你看。OpenAI的思维链是加密的,Anthropic的推理轨迹是混淆的,想看一眼模型到底怎么想的,得用各种绕过手段,而且全都违反服务条款。

Hacker News上有人直接点破了这件事:美国模型不让你看它怎么想的,因为怕你学走它的本事。DeepSeek直接把底牌亮给你——随便看,随便学。

为什么“看得见”这么重要?因为要改进跟模型协作的工具,就必须评估模型到底在做什么、怎么理解你给的数据。看不到思维过程,就等于闭着眼睛调参。美国公司把思维链藏起来,表面说是“安全考虑”,实际上是怕竞争对手蒸馏。但代价是什么?开发者没法真正理解自己用的工具。

DeepSeek的选择是:让你从头到尾看清楚每一个决策是怎么做出的。这跟卖车的把引擎盖焊死,还是把发动机拆开给你看,区别一样大。

零代码改核心:插件化把Agent拆成了乐高

DeepSeek Harness的核心设计原则只有六个字:一切皆插件。

这不是一句口号。打开架构文档会发现:模型适配器是插件,工具注册表是插件,会话日志是插件,Agent循环本身也是插件。沙箱是插件,审批策略是插件,连UI都是插件。

Cordis是底层的框架:插件向共享上下文贡献服务、类型化事件和可逆的副作用。换句话说,整个DeepSeek Harness就是一堆插件拼起来的,每一块都可以单独换掉。

这种设计的实际含义是什么?

第一,改功能不用改源码。开发者不需要动DeepSeek Harness的源代码,就能以插件方式独立选择、替换或扩展任何一个能力。

第二,运行时热插拔。插件可以在不重启整个系统的情况下加载和卸载。Cordis的HMR(热模块替换)插件会监视源文件、追踪Node的模块图、清除受影响的模块缓存,只重载依赖已变更应用文件的插件入口。

第三,卸载干净不残留。每个插件注册的东西都是“可逆的副作用”——提示词片段、工具schema、适配器、监听器通过ctx.effect()安装,reload和teardown时会按预期撤销。插件卸载时,它注册的所有东西都会被清理掉,不会留下孤儿引用或僵尸监听器。

第四,依赖关系自动管理。插件通过inject声明服务依赖,Cordis会等所有依赖就绪才启动插件。加载顺序通过服务依赖表达,不需要手动编排启动序列。

这套机制在插件系统里不算新鲜——OSGi、Eclipse插件系统都做过类似的事。但把它完整地搬到Agent Harness这个场景里,并且做到“产品的每一部分都是插件”,这确实是第一次。

Hacker News上有人直接点出了历史类比,就像Eclispe这样IDE:“Yep sounds just like the Eclipse IDE plugin system indeed. Nice example of things being rediscovered every generation”。

DeepSeek为什么要做一个自己的Harness?

同一个模型跑八个壳,只有六项任务全部通关!

2026年8月11日,智能体工具公司Composio公布了一组对照测试:研究者把同一个DeepSeek V4-Flash接入8种不同的Harness,让它们分别完成30项多步骤任务。8种Harness总共运行了240次,只有129次成功。30项任务里,只有6项被所有Harness完成。

同一个模型,换了个壳,成功率直接从100%掉到53.75%。

这就是Harness的价值——它不只是个“壳”,它直接决定了模型能不能把活儿干成。Anthropic在2026年4月讨论托管Agent时也指出了这一点:Harness包含了开发者对“模型自身做不到什么”的判断,而这些判断会随着模型能力提升而过时。

DeepSeek给出的公式是:Model + Harness = Agent。模型是大脑,Harness是身体和工作台。大脑再聪明,身体不好使也白搭。

四种模式把同一个大脑装进四个不同的身体

DeepSeek Harness提供了四种预设模式,每种加载不同的插件集合。

标准模式:功能完整的编码Agent,支持文件编辑、Shell、文件与网页检索、Skills、计划、目标、子Agent和工作流。

PTC模式:全称Programmatic Tool Calling,具备标准模式的全部能力,但通过Code Mode SDK让模型生成一段TypeScript代码来编排多轮工具调用。中间数据留在运行环境里,只有最终结果进入模型上下文。实测缓存命中率大多在99%左右,有时直接干到100%。

极简模式:仅保留一个持久bash和一个str_replace_editor文件编辑工具。用于最小环境下的模型基准测试。

创造模式:具备标准模式全部能力,额外提供运行时检查、插件实验和preset创作指导。用户可以检查当前运行时,在内存中试验Cordis插件,甚至让Agent改装自身——比如让接入了V4 Pro的Harness给自己创建一个官方Web UI没有的“三栏模式”。

这四种模式本质上是对同一个插件系统做了四次不同的组装。同一个模型,换一套插件组合,就变成了四种完全不同的工具。

社区吵起来了:插件化是万能解药还是新坑?

Hacker News上围绕“一切皆插件”的争论很激烈。

正面观点:对于需要把稳定核心领域和不可预测的长尾集成严格隔离开的软件,插件是正确解决方案。

反面观点更直接:所有依赖社区插件来提供功能的产品,头六个月都运行得很好,之后就是不兼容、过时、缺乏一致性和治理的噩梦。

还有人质疑这种设计方向的本质:过度强调定制化和插件化,本质上就是懒惰和缺乏创新。不想要一个无限可编程的IDE,电脑本身就是。想要一个有观点、能直接产生价值、不用花好几天先配置一遍的东西。

但也有人指出,AI可以帮你写插件,这就改变了游戏规则:AI能帮你写自定义插件,意味着这个工具对你来说无限灵活,甚至不需要社区。

第一天31200颗星背后:看得见的思考才是真优势

截至2026年8月13日,DeepSeek Harness在GitHub上已获得31.2k Stars、2.3k Forks,Hacker News上309分。一个v0.1开发者预览版,开源第一天拿到这个数据,说明需求确实在那里。

Hacker News上最高赞的评论集中在一点:“Every run is traceable”。不是模型多强,不是插件多全,而是——你能看见它在干什么。

这才是DeepSeek Harness真正的杀伤力。美国公司把思维链锁进保险柜,DeepSeek把整个运行轨迹摊开在桌面上。你说这是技术优势?不如说是信任优势。在AI越来越深入开发流程的今天,看不见思考过程的黑箱工具,和每一步都可追溯的透明工具,开发者选哪个,答案已经写在Star数里了。

美国模型拼命藏起来的,DeepSeek第一天就白送。