DeepSeek Harness开源42小时破10万星:OpenClaw望尘莫及

DeepSeek Harness开源即封神:42小时十万星,Agent界Android的惊险一跃!

AI从“动嘴”到“动手”,只差一个Harness的距离!

摘要:2026年8月13日,DeepSeek开源Agent框架Harness,42小时GitHub破10万星,刷新平台史上最快涨星纪录。上次出现这种情况,还是OpenClaw在7天内拿到了10万颗星。

本文从项目定位、插件化架构、实测表现、社区生态四个维度拆解其设计逻辑,同时呈现安全审计发现的40条攻击路径与性能瓶颈——这是一场开源狂欢,更是一场尚未完结的惊险实验。

一个公式改写Agent的定义,DeepSeek Harness到底是个什么东西

2026年8月13日晚上八点半,DeepSeek正式公布了它的第一个Agent产品——DeepSeek Harness开发者预览版(v0.1),并同步以MIT协议公开源代码。项目负责人崔添翼在社交媒体上表示,这是一个预览版本,可能存在很多粗糙之处,希望大家多提意见。

DeepSeek官方给Harness的定义非常简洁:一个公式——Model加Harness等于Agent。模型是脑子,负责思考和推理;Harness是手脚,负责实际执行。聊天机器人交付的是一段话,Agent交付的是一件做完的事。

所谓Harness,是围绕大语言模型构建的一套软件支撑框架,帮助AI Agent管理和执行复杂任务。目前,OpenAI、Anthropic等AI前沿实验室都在构建自己的Harness。不同的是,OpenAI的Codex和Anthropic的Claude Code更侧重于面向软件开发的AI Agent,而DeepSeek的Harness进一步向底层延伸,直接触碰到Agent工程架构层面。

Harness让DeepSeek不再只是“一个模型”,而开始成为一个可以自由组装、持续演进的Agent运行平台。这个定位意味着它不只是一个工具,而是一整套让AI真正“动手做事”的基础设施。

一切皆插件:把Agent拆成乐高积木,想怎么拼就怎么拼

Harness最核心的设计理念只有五个字:一切皆插件。模型、工具、技能、会话、沙箱、存储、循环、调度、UI——所有Agent能力都由插件组合而成,可自由替换、灵活重组。

这套框架基于Cordis插件元框架打造。Cordis只负责三件事:插件的加载、卸载和依赖关系管理。它不承载任何Agent的具体能力——没有模型调用逻辑,没有工具注册表,没有会话管理器,没有沙箱实现。所有你以为是“框架内置”的东西,在Harness里都是插件。

这种设计在软件工程里叫微内核架构,Eclipse IDE、VS Code、Android系统都是这个路子。Cordis本身是一个纯粹的能力编排器,开发者不需要修改项目源码,就能通过新增或替换插件实现任意模块的自定义与能力扩展。

面向不同开发场景,Harness预置了四种运行模式:标准模式搭载全套工具组件;PTC模式由模型生成代码编排多轮工具调用;极简模式只保留Shell和文件编辑两大工具,用于最小环境下的模型基准测试;创造模式支持查看运行时状态、在内存中调试Cordis插件、自定义生成全新运行模式。

值得一提的是,这套设计并非停留在论文或实验室阶段!Cordis的相关设计已经在Koishi聊天机器人框架中运行四年,目前已有超过4000个社区插件在生产环境中得到验证。DeepSeek与北京大学联合发布的论文《A Programming Paradigm for Spatiotemporal Composability》进一步解释了这套架构的技术基础。

42小时十万星:GitHub史上涨得最快的项目,没有之一

仓库在正式公布前半小时就悄悄公开了。接下来发生的事情让所有人目瞪口呆。21:05查询时7283个星,21:51再查变成15530个。公布不到两小时破万星。12小时左右突破5万星。30小时逼近9.4万星。42小时突破10万星,刷新了GitHub史上最快涨星纪录。

做个对比就知道这有多离谱。此前被称为史上增长最快仓库的OpenClaw,84天涨20万个,平均每小时约99个。DSH头两个小时的涨速是它的80倍。xAI Grok-1破2万星用了约1.2天,DeepSeek自己的R1突破2万星用了5.7天。DeepSeek-V3从2024年12月上线至今,攒了一年半才到10.4万星,而Harness用了不到两天。

这种速度让整个行业不得不重新思考一个问题:开发者到底在为什么疯狂点星?

不只是点星:从安装体验到社区插件,Harness正在被真实地“用起来”

星标可以点,但真正把代码拉回去改一改的人有多少?数据给出了答案:48小时内93038个星标、8521个分叉。星标分叉比大约10比1。这个比例和AutoGen的9.75比1接近,比OpenClaw的5.1比1要高一些。10个人里有1个人愿意把代码复制到自己账号下准备动手,这在开源项目里不算低。

更重要的是,Harness的安装门槛并没有想象中那么高。在已安装Node.js的系统中,一条命令就能快速启动:npx @deepseek-ai/dsh web。浏览器打开本地3080端口,输入DeepSeek的API Key即可开始对话。界面非常干净,黑色鲸鱼图标和DeepSeek模型产品的蓝色鲸鱼形成明显区隔。

开发者社区的反应同样热烈。内测阶段的开发者几天里做了约三百个插件,有人给Harness换上Windows XP的复古皮肤,有人做了表情包插件。发布不到两天,社区维护的插件精选列表已收录超过270个插件。GitHub上带有dsh-plugin标签的公开仓库突破700个。截至8月15日,监测到的生态仓库达1521个,累计获得Star超过30万。官方内置了一百多个插件。

Flask框架创始人Armin Ronacher评价称,DSH展现出了“一些很酷的想法”,“确实让我重新思考了一下我们在产品中进行Harness重构的方式”。

成本打到了1/120:同一个模型换个壳,Harness把钱省到了极致

Harness不只是一个理论框架,它在实际任务中的表现同样值得关注。

字母AI做了一组实测:在完成相同任务、效果相近的情况下,Claude Fable 5一共花了9.8美元的token,约合人民币70元;而用DSH配上DeepSeek V4 Pro正式版跑相同任务,只花了6毛钱,成本仅为前者的1/120。在一些特定任务中,DSH可以实现99%的缓存命中率。

智东西的实测也提供了具体数据:88页论文翻译任务耗时22分钟。另一组测试显示,1轮44步的任务,LLM耗时13分19秒,工具调用3分2秒,首Token平均1.3秒,缓存命中率97%。25步任务总用时5分33秒,花费仅0.23元。

DeepSeek官方强调“每一次运行都有迹可循”。模型看到的一切都会写入仅追加设计的会话日志,包括系统提示词、思维链、工具调用与结果、子Agent调度,以及每一次上下文注入。在轨迹视图中可以按来源查看这些信息,恢复、分叉、检索与回放都共享同一事件流。

这种透明度和可复现性,在Claude Code等封闭产品上无法实现。

狂欢的另一面:40条攻击路径和13个可复现漏洞

星标涨得有多快,冷水来得就有多快。

发布当天,第三方安全审计报告就在GitHub上公开了。审计对象是deepseek-ai/dsh@0.1.0-rc.6。报告标题揭示了一个根本性的不对称:dsh有两个信任轴,而且它们严重不对称。

轴A是模型和Agent行为侧——工具执行流水线、审批机制、进程沙箱、文件观测策略、凭据引用模型、仅追加审计日志——达到了生产级标准。

轴B是插件代码侧——目前没有任何安全设计。插件直接在宿主进程中运行,拥有宿主权限。安装、更新、篡改、持久化、热重载路径没有签名、没有完整性校验、没有来源验证、没有确认门控。恶意插件在安装时就在宿主进程中执行,payload的进程ID就是宿主进程ID。卸载插件后,持久化的后门仍然存在。用户补丁热重载大约15秒生效,不需要重启。

另一份审计报告发现了更具体的高危漏洞。Workflow工具可以逃逸node:vm沙箱。模型通过提示词注入,能在“沙箱”内部拿到真正的process对象和完整的Node模块访问权限,读取任意宿主文件。而Workflow工具的描述还向模型声称“不提供文件系统、网络、定时器或Node.js API”。

本地RPC没有认证。同一台机器上的任意进程都可以伪造请求,创建danger-full-access会话,无需审批执行命令、读取全部会话内容。如果启动时绑定了--host 0.0.0.0,局域网内任意主机都能获得相同能力。

审计报告包含了40条攻击路径,96条源代码证据引用,13个可复现的演示。一个被设计为“可控、可观测、可回溯”的Agent框架,在插件安全层面几乎是裸奔的。

星标狂欢还是生产可用:一个尚未完结的惊险实验

DeepSeek为Harness单独开设了微信公众号,标识是一条黑鲸,与模型产品的蓝鲸区别开来。这个品牌区隔意味深长——模型归模型,Harness归Harness。

战略意图也很清晰。OpenAI和Anthropic的战略是“向下整合”,通过深度绑定自家模型的Harness巩固优势。DeepSeek的战略是“横向铺开”,试图通过开源一个模型中立、高度模块化的Agent底层标准,成为下一代AI应用的基础设施。

但一个基础设施级别的项目,在v0.1版本就面临如此尖锐的安全矛盾,这在GitHub开源史上都罕见。官方建议只在可丢弃的checkout或容器内运行,生产环境应换用更严格的权限策略。Harness提供了运行时的零件,但没有提供让这些零件在生产环境里稳定运转的整套服务体系。

DeepSeek Harness在架构层面走出了激进的一步——把Agent的每一个零件都打开、让开发者可以自由组装。10万颗星回答了“有多少人感兴趣”。9500个分叉回答了“有多少人想试试”。超过1500个生态仓库回答了“有多少人在动手”。

但Harness团队在GitHub上的那条内部文档注释被审计报告引用了。注释写的是:node:vm不是安全边界。但产品界面的权限预设、沙箱提供者、工具描述,却在向用户传递相反的信号。

产品说“这是沙箱”,代码说“这不是沙箱”。文档说“审批会保护你”,审计说“审批根本不绑命令”。

这种落差,在十万颗星的狂欢中被放大了多少倍?