智能体基础设施四强横评:OpenClaw、Hermes、WorkBuddy和DeepSeek Harness

没人告诉你的残酷真相:AI代理真正卡脖子的地方,从来不是模型脑子够不够用!

把同一个大模型塞进四套壳子,出来的东西能差出一个银河系!

2026年8月13日,DeepSeek把Harness开源了,48小时GitHub Star破10万。但朋友圈刷屏的同时,一个更根本的问题浮出水面:大家都在跑AI代理,可OpenClaw、Hermes Agent、WorkBuddy和DeepSeek Harness这四样东西,到底有什么区别?

这不是“哪个更好用”的问题。这是“你以为你买了个助手,其实你买了个定时炸弹”和“你以为你装了个软件,其实你装了个地基”的区别。

大模型只有一个功能:输入文字,输出文字。从“会聊天”到“能干活”中间的所有东西——记忆、工具、权限、审批、沙箱、会话管理——都不是模型本身能解决的。这些东西叫做“代理基础设施”(Agent Infrastructure),而四款产品对每一层的不同选择,决定了它们完全是四个物种。



一款产品好不好用,先看它敢不敢让你看它脑子怎么转的

OpenClaw,2025年11月以Clawdbot名字发布,2026年1月改名。它是一款跑在你电脑后台的网关进程,有心跳守护和定时任务,所以它能主动做事,不用你每次喊它。它接入了WhatsApp、Telegram、Slack、Discord、Signal、iMessage,你发个消息它就能干活。

装一个聊天机器人,把AI塞进日常。听着挺好,对吧?

但有个数据你得知道:审计发现,大约26%的第三方技能存在漏洞。还有一个CVSS评级8.8的跨站WebSocket劫持漏洞,能让恶意网站直接劫持你本地的AI代理。8.8分是什么概念?满分10分,这已经是“高危”天花板了。

更狠的是,OpenClaw的配对范围设备令牌能被拿来提权到operator.admin,然后远程执行代码。还有网关参数注入能绕过审批直接实现远程代码执行。一个套了聊天界面的AI,一旦能被远程控制,你电脑上所有的文件、所有的聊天记录、所有的密钥,全在别人手里。

OpenClaw把AI融进你的日常生活,代价是——它也可能掌控你的日常生活。

这就怪了:一个标榜“个人助理”的产品,安全漏洞多到要每个月打补丁。2026年3月修了CVE-2026-25253默认网络绑定问题,5月又修了BlueBubbles Webhook认证绕过。你是在用AI,还是在替AI团队做安全测试?



会自己长大的AI,到底是省心了还是更吓人了

Hermes Agent,Nous Research出品,2026年2月发布。它是一款“能自我改进”的代理——它不需要你的电脑一直开着,部署到云端就能跑。

核心卖点:闭环学习。它会自己写技能,用着用着就改进;它会搜索自己过去的会话当上下文;它会构建你的行为模型。你用它的时间越长,它越了解你。

它的execute_code功能很猛:让代理写Python脚本,脚本里可以调用Hermes的各种工具,把多步骤流程压缩成一次推理。中间步骤的结果不进上下文窗口,只有最终的print()输出回来,省Token省到飞起。

但等等!

2026年6月,execute_code被发现有个沙箱绕过漏洞(CVE-2026-9368),危险命令能绕过用户审批流程直接执行。一个能自己写代码、自己执行的AI,如果审批被绕过——它在你的系统上想干什么就干什么。

Hermes Agent还有个子代理系统,多个子代理可以并行跑。它还支持七种终端后端:本地、Docker、SSH、Singularity、Modal、Daytona、Vercel Sandbox。

功能强不强?强。怕不怕?看你怎么想。

一个会自己长大的AI,你不在的时候它在后台自己学、自己写技能、自己改自己。它越用越懂你——但“懂你”和“能控制你”之间,那条线在哪?



闭源的办公神器,你永远不知道它怎么干活的

WorkBuddy,腾讯出品,2026年3月9日在中国上线,5月和6月扩展到其他地区。它是一款闭源的商业桌面应用。你发一条指令,多个专家代理并行干活——生成报告、表格、演示文稿、写代码。

腾讯把WorkBuddy和自家生态绑死了:腾讯文档、腾讯网盘、腾讯乐享三大产品原生集成。你在腾讯文档里直接唤起WorkBuddy处理当前文件,不用在两个应用之间切来切去。它还支持微信一键直连、企业微信长链接接入。

2026年6月的监测数据显示,WorkBuddy在国内PC端AI原生办公智能体市场,月访问量和环比增速都是第一。日活冲到行业第二的三到四倍。2026年7月,腾讯还把QClaw业务和团队并入了WorkBuddy部门。

但有一个问题:它的内部机制没有公开!

WorkBuddy支持20多种技能包和多级认证(MCP),代理模型能在混元、DeepSeek、GLM、Kimi、MiniMax之间切换。但所有这些功能怎么实现的?不知道。

闭源的商业产品,你付钱,它干活。至于它怎么干的、有没有偷偷记录你的数据、会不会把你的文档拿去训练模型——你只能选择信任。

事情没那么简单:一个闭源的办公代理,权限大到能读写你的所有文档、发邮件、做PPT。如果出了安全事故,你连排查的入口都没有。



真正的狠货:让代理的每一根骨头都能拆下来换掉

DeepSeek Harness(dsh),DeepSeek AI出品,2026年8月13日开源。它是基于Cordis插件框架构建的代理运行时。当前版本0.1.0-rc.7,开发者预览版。

dsh不是一款代理产品。它是一个让你自己造代理产品的平台。

核心理念就四个字:一切皆插件。模型适配器是插件,工具注册表是插件,会话日志是插件,连代理循环本身都是插件。你能想到的每一层,都能换掉。

dsh启动时根据配置文件构建插件树:web模式跑浏览器界面,headless模式跑一次性任务。每个配置行都可以从上级配置修改,这叫“分层补丁”而不是“分支”。

切换模型路由、禁用某个工具、把工具注册表切成代码模式——一行YAML搞定。不用改源码,不用维护长期分支。

dsh还有个概念叫“接缝”(Seam)。一个接缝包含三个角色:声明接口的服务定义、实现接口的服务提供者、使用接口的消费者。把文件系统和子进程的提供者从本地指向远程沙箱,shell访问、持久终端、语言服务器支持全跟着迁移过去了——不用为每种环境写不同的代码。

会话日志是“模型上下文唯一真实数据源”。任何到达模型请求的内容,都必须能从日志里重建出来。这意味着什么?会话可以重放、可以从任意点分叉、可以搜索。代理到底看到了什么、为什么这么干——永远查得到。

还有个额外功能:运行时自修改。模型可以写一个插件,挂载到自身运行的进程里,之后还能撤回去。这个功能默认不开启,但它的存在本身就证明了一件事——“一切皆插件”不是营销话术,是真能跑起来的东西。

对吗:一个代理框架,连自己的代理循环都能被插件替换掉。这意味着什么?意味着你可以在不碰任何其他代码的情况下,把整个决策逻辑换成你自己的。



代理循环长什么样,决定了代理能干什么不能干什么

dsh的代理循环只有一个包承载它:core/agent-loop。其他所有东西都是抽象服务或扩展点上的插件。代理接口本身完全不依赖这个循环——UI、钩子、编排器都是针对接口编程的,你可以把整个循环换掉,它们照样跑。

两个定义很关键。“步骤”是一次模型请求加它调用的工具。“轮次”是零个或多个步骤的序列。输入通过统一收件箱到达,有些消息立刻唤醒进程,注入的上下文等另一个唤醒消息到了再一起认领。

扩展点分布在每个阶段:步骤之前、模型请求之前、流式传输期间、工具执行前后。监听器可以通过调用next()来拦截和修改行为,或者不调用它来跳过整个链。所以,在每个工具调用前加一个审批门,不需要改任何一个工具本身的代码。

代码库的规则很明确:新行为放在扩展点上,不是循环里。改代理循环本身意味着要同时更新架构文档。



写一个插件有多难?难的是想明白你要写什么

dsh的插件机制:一个模块导出一个apply函数,框架加载时调用它,插件通过共享的上下文对象注册功能。开发时不用打包,启动时加个补丁标志就能把本地文件挂载到任何配置文件里。

三个必须做对的事:

第一,配置通过框架的模式系统声明,不是硬编码。任何因部署而异的东西都应该是配置字段,代码里禁止硬编码可调参数。

第二,依赖显式声明,不手动指定启动顺序。Cordis框架处理插件的加载、卸载和依赖关系。

第三,注册被视为一种“效果”——贡献在卸载时自动展开,不用手动写清理代码。

运行时还有一条硬规则:模型可见意味着要记录日志。任何新的模型可见输入都必须创建一个对应的会话事件,不能悄悄塞进提示符。

用大白话说:dsh逼着你把每一件事都讲清楚——配置写清楚、依赖说清楚、干了什么记清楚。写起来麻烦,但查起来不抓瞎。



一页纸说清楚:四个东西到底分别该给谁用

OpenClaw:个人助理产品。优势是聊天应用覆盖广、技能生态成熟。劣势是开放注册表带来的安全隐患——26%的技能有漏洞,多个高危CVE。

Hermes Agent:自我改进代理产品。优势是记忆功能和自我改进循环、execute_code压缩多步推理。劣势是自定义能力限于扩展点,而且自我改进到底改到什么程度,你说了不算。

WorkBuddy:闭源办公代理工作空间。优势是办公交付强、腾讯生态绑得死、国内市场份额第一。劣势是机制不透明、不可替换。

DeepSeek Harness:代理平台底层架构。优势是每一层都可替换、全程可审计。劣势是生态还在早期、开发者预览版、重大变更会来。



选哪个?看你把自己当什么人

如果你只想要个助手,选OpenClaw。但记得盯着它的安全公告,每个月至少打一次补丁。

如果你想要个能学你的助手,选Hermes Agent。但想清楚——一个会自己写代码、自己执行、自己改自己的AI,你愿意给它多大权限?

如果你只想让日常办公更高效,选WorkBuddy。但你得接受一个事实:你永远不知道它背地里怎么干活的。

如果你在开发一款代理产品,选DeepSeek Harness。但它不给你现成的答案——它给你的是造答案的工具。你得自己拼。



一个还没完的实验:dsh的运行时自修改到底能不能跑通

dsh的“运行时自修改”功能,目前是特意选择开启的,默认不包含在任何配置里。模型写一个插件、挂载到自身进程、之后再撤回去——这个流程在文档里写得清清楚楚。

但有一个细节没公开说清楚:当一个模型正在运行的循环被自己写的插件修改时,那个修改是立即生效,还是等下一轮才生效?如果立即生效,修改逻辑会不会把正在执行的这轮推理本身也改掉?

这是一个哲学问题,也是一个工程问题。dsh的架构文档说“代理循环本身是插件”。但一个插件替换自己所在的运行时——这件事在理论上能成立,在实践中有没有人真的跑通过?

DeepSeek Harness的GitHub仓库有超过18万星,社区插件列表已经有人在整理了。但“运行时自修改”这个功能,目前还没看到一个公开的、完整的、端到端的演示。

这不是一个Bug。这是一个设计决策的边界测试。而边界测试的结果,往往决定了整个架构是“理论上可行”还是“生产上能用”。

等着看第一个跑通的人怎么写这篇复盘文章吧!