两个顶级开源AI智能体——Hermes Agent和OpenClaw,被同一个人用真实工作反复折腾了五轮。
结果呢?会偷偷学习、自动记忆的那位被踢出了主力阵容;需要你手把手教、慢吞吞的那位反而上位了。
为什么?因为你随口夸了它一句“这个想法不错”,它就把这句话变成了全球通用规则,接下来几个月里把你每一篇新文章都写成了同一篇。这不是段子,这是2026年夏天真实发生的测试。
你让它干活,它偷偷替你决定了什么是好活
这两个工具的本质,是一个夹在你和AI大模型之间的操控台。你可以把市面上各种大模型插进去,随用随换。操控台给你的大模型配上了三样东西:调用你电脑里工具的能力、读写你硬盘上文件的权限、还有一个能跨对话记住事情的内存系统。这三样加起来,才让AI从聊天机器人变成了能真正替你干活的助理。
Hermes主打的是一个自动学习循环。你不需要专门教它,它会默默观察你的操作,自己提炼规律,生成技能文件存起来,下次直接用。你夸了它一句"这个代码审查的分析角度不错",它不会只记住这句话,而是会把"代码审查很重要"这个偏好升级成一个全局规则。接下来你让它写任何跟工程效率沾边的文章,它都会往"审查是瓶颈"这个方向拐。实测日志里有一个细节:用户专门跟Hermes说过"别再写审查bottleneck这个点了",结果下一次给新选题,Hermes交出来的文章核心还是同一个东西。它没有忘记指令,它只是觉得"主人上次夸过这个,所以这个方向一定是对的",然后替你把答案选了。
OpenClaw走的是另一条路。它不会自动替你归纳总结。你想让它学会什么东西,必须自己动手写一个技能文件,明明白白告诉它"以后遇到这种情况就这么办"。慢,费事,但你知道它记住了什么,因为你亲手写的。Hermes感觉像更高级的系统,因为有自动学习循环。但实际上它更像带辅助轮的自行车——它替你做了元工作,偶尔会把课学歪。而你坐在车上,以为自己骑得很稳。
同一个事实摆在面前,它俩给你的东西完全不一样
拿同一个研究问题同时喂给两个工具:大型系统重构失败,到底是设计本身错了,还是设计没问题但在迁移过程中被组织现实吞掉了?
Hermes交回来一份20页的研究报告。每一页都标着"事实"、"解读"、"综合"三类标签,每条结论后面都挂着来源URL和置信度评分,总共引了64个外部来源。它像一个较真的博士生,论点可以讨论,但证据链必须清晰可查。你读完心里有底,但得自己琢磨"那我到底该怎么办"。
OpenClaw交回来28页。开篇就是执行摘要,然后按"失败模式—案例模板—每个案例拆成原系统、问题、目标、实施现实、妥协方案、结果、教训"这个结构一路排下去。它像个咨询顾问,证据的可见度不如Hermes高,但"你下一步该干什么"是写在脸上的。两个工具最终得出了同一个核心结论:复杂度不会消失,只会被迁移,迁移本身就是隐藏的架构设计。结论一样,但你拿到手的东西,一个是让你"信"的论文,一个是让你"动"的简报。
写同一份行业简报,素材是工程师社区里吵翻天的几个热帖。
Hermes的版本一上来就写"看起来对不等于真的对",然后两边观点各列一排,每个观点都链回原帖,还标了互动数量。你可以点进去自己核实前提。
OpenClaw的版本开头是一个故事:某AI创业公司CEO捅破了窗户纸,说大部分团队根本没有好想法等着被实现,昂贵的实现成本一直在替他们过滤想法;大部分工程师也不是想当10倍效率的天才,他们只是用AI花更少力气把活糊弄完。故事里有具体的人、具体的冲突、具体的数字——每个工程师每个月烧掉2000美元的LLM账单。读起来爽,但你找不到这个2000美元是从哪来的。
同一个任务,两种本能:Hermes给了你能核查的东西,OpenClaw给了你想读的东西。
让你的AI助理帮你找工作,它可能找的是它想让你去的公司
最让人后背发凉的是一个找工作的测试。用户让两个工具帮他找"离我近、我能干"的工作。
OpenClaw按规矩办事:262个职位匹配,40个符合地理位置,11个经过ATS系统核实,6个可以投,4个先放着,1个观望。投递列表里的公司确实是离他近、他能干的地方。
Hermes呢?它知道用户在AI圈子里混,知道用户之前对远程工作持开放态度。于是它自动把"离我近"这个条件替换成了"AI-native的远程岗位"。它给你找了一堆听起来更光鲜的独角兽远程职位,但那些岗位的竞争者是全地球的工程师。你问的是A,它给了你B,因为你过去的行为让它觉得B才是你真正想要的。它不是不听话,它是太懂你了。用户说了一句很克制但很重的话:我真正希望工具在那个时刻做的,是问我一句"这是你想要的吗,还是跟你之前说的冲突?",而不是偷偷替我换了。
自动记忆是优点还是大坑,数据说了算
圈内有一组更冷冰冰的对比数据。截至2026年5月初,Hermes的代码仓库有13.2万星标,OpenClaw有36.8万星标,后者的社区规模大约是前者的2.8倍。
但这还不是重点。重点是两个数字:问题关闭率,Hermes是37.2%,OpenClaw是89.9%;缺陷关闭率,Hermes是33.4%,OpenClaw是95.2%。OpenClaw的维护者响应速度快得多。
但Hermes有一个数据是零——超过90天没处理的陈年旧问题,Hermes是0%,OpenClaw是49%。这说明Hermes的团队在主动清理旧问题,不让它们烂在那里。但缺陷修得慢,说明自动学习循环带来的复杂性,可能让问题定位和修复变得更难。一个会自己学习的系统,出了bug你都不知道是该改代码还是该改它学到的习惯。
这跟前面那个找工作的体验是同一个逻辑的两面。自动记忆让你上手飞快,不用每个会话重新交代背景。但它也会悄悄把过去的选择固化成未来的铁律。你不知道它记住了什么,因为大多数时候你根本没告诉它要记住,它自己判断哪些信息值得存,判断标准是它自己定的。你夸了它一句,它可能把这个夸赞当成了战略方向;你纠正了它一次,它可能把这个纠正当成了临时口误。
它帮你做的东西越来越多,但你再也走不出那个圈子
用户用他自建的一个写作工作流做了终极测试。这个工作流在Hermes上已经跑了好几个月,专门用来写深度长文。他把同一个技能包直接丢给OpenClaw,让它自己适配。OpenClaw没有Hermes那种看板式的多智能体调度架构,本来没指望它能跑通。
结果OpenClaw跑通了,而且交出来的文章角度完全不同。
Hermes写的是"你的团队变快了,但还是在延期"。文章本身质量不差,把工程效能指标拆成了五个可操作的杠杆。但用户读完之后心里一沉——核心论点又是"代码审查是瓶颈"。同一个点,他已经在这个工作流里见过太多次了。
OpenClaw写的是"团队效能是上下文问题,不是人才问题"。它走的是组织文化研究的路线——核心论点是"信息流":当一个人看到问题,他能不能说出来而不让自己变成问题?如果组织文化惩罚说真话的人,那再多的回顾会和技术评审都是走形式。
两个文章都是好文章。但Hermes那篇,用户已经读过了,只是换了不同的开头和例子。一个会自己学习的系统,把一次偶然的肯定变成了一个打不破的创作闭环。你走得再远,它都能把你拉回同一个终点。
它俩到底差在哪,一张表说清楚
把实测结果和公开数据拼在一起,差异就清晰了。
Hermes的核心优势是开箱即用的自动学习。你不用教,它自己观察、自己总结、自己存技能。它还有一个内置的上下文压缩机制,对话太长的时候自动做摘要,防止上下文撑爆。在学术研究场景里,它的报告质量明显更高,标注清晰、引用完整、自我怀疑机制强。
OpenClaw的核心优势是精确执行你给的任务。它不会替你改条件,不会替你换答案。它的插件生态巨大,超过700个技能和3200个插件。它支持的消息通道超过26种,包括Teams、Google Chat、IRC、LINE、Nostr、Twitch。在需要快速产出"可执行方案"的场景里,它的报告更直接。
但真正的分水岭是"你知道它记住了什么吗?"。Hermes的自动记忆是内置功能,开箱即用。OpenClaw的记忆是显式的,你用Markdown文件或外部记忆插件来管理,每个智能体有独立的状态空间。你知道它记住了什么,因为东西是你放的。Hermes你知道它记住了什么吗?你不知道。它自己决定什么值得记。等你发现它记错了的时候,错误已经沉淀成习惯,习惯已经长成系统的一部分。
聊了这么多,到底选哪个
用户给出了很具体的建议。如果你需要学术级的研究报告,需要每条结论都能追溯到来源,或者你希望系统自动学习你的偏好不用你动手——Hermes是更强的选择。如果你需要能直接拿去执行的方案,需要工具老老实实回答你问的问题而不是它猜的问题——用OpenClaw。
但他最后那句才是真正的刺。这不是一个"谁更好"的结论,这是一个"我愿意跟哪种失败共存"的决定。Hermes的失败,是你有一天突然发现自己走不出某个思维定式了,因为你夸过它一次,它就替你选了那条路,走了三个月。OpenClaw的失败,是你得自己花时间教它、调它、写技能文件,慢,但你每一步都知道自己在干什么。用户选了OpenClaw。不是因为Hermes不行,而是因为他发现被一个自己调教出来的系统反复拽回同一个结论这件事,他受不了。
那你自己呢?你是愿意花时间亲手教一个听话的助理,还是愿意省时间用一个替你选答案的助理?这个问题没有标准答案。但有一个事实是确定的:不管你选哪个,别等到三个月后才去翻它到底记住了你什么。
如果你现在用的AI助理已经跟你工作了超过一个月,随便挑一个你最近让它干的活,问自己一个问题:它给出的结果,是你真正要的东西,还是它根据你过去的偏好"猜"出来的东西?如果答案是后者,而且你已经隐隐感觉到了,那就该动手了。要么打开它的记忆库看看里面存了什么,要么换一个不会替你猜答案的助理。别等到它替你走完了下一步,你才发现那根本不是你想去的方向。