Hermes默认配置打爆外挂记忆,过度工程正在杀死AI生产力

Hermes默认的记忆配置干翻了23,000字定制指令,你还在为AI搭定制记忆体?

开篇给你一个数字:23,000字符的指令文件,一个自托管的记忆外挂,一堆本地代码补丁。这些东西加起来,没让我的人工智能代理更听话,反而让它变成了一个需要我24小时盯着别犯傻的巨婴。我花了几个月给它搭的豪华别墅,结果它连门都找不到。

这篇文章要解剖一个反常识的真相:在AI代理这个圈子里,堆料不等于堆能力。一个开源项目Hermes Agent,它的默认出厂设置,在同一个版本、同一个任务上,把我花了几个月攒出来的“定制豪华套装”按在地上摩擦。这不是什么高深理论,这是我把自己的工程实践当小白鼠做实验得出的结论。从系统架构师的角度看,当你给AI加的东西越多,它离真正干好活就越远。

别急着给AI配保姆,先看看它出厂自带啥

Hermes Agent的默认记忆系统就两个小文件:一个叫MEMORY.md,限2200字符,用来记点环境事实和学到的规矩;另一个叫USER.md,限1375字符,存你的偏好和沟通风格。就这么点地方,连一篇公众号文章都塞不下。

但就是这么点“随身行李”,在系统启动时会被当成一张快照,完整塞进系统提示词里。Hermes可以用内置工具更新它们,但新内容下一轮会话才生效。它不是实时在那改,而是每次开头先给你读一遍“前情提要”。

我当初觉得这设计太小气。2,200字符?够干吗的?我那些复杂的项目背景、历史纠葛、各种注意事项,怎么塞得进去?于是我开始动手改造,第一步就是给它配了一个自托管的记忆外挂,号称能存无限量信息,还能智能检索。

结果呢?我的AI代理不再是个简单的助手,它变成了两个记忆系统之间的信使。内置记忆说东,外挂记忆说西,它得花力气去协调、去同步、去判断听谁的。这好比给一个快递员同时配了高德地图和百度地图,还要求他出发前先评判哪个导航更准。他没累死,我先崩溃了。

23,000字血泪史,AI一个字都没看进去

比外挂记忆更隐蔽的坑,是我那个堪比短篇小说的AGENTS.md文件。这个文件是用来给AI下指令、定规矩的,比如“别瞎编”、“做完要说做完了”、“别自作主张”。我遇到一次问题就加一条,加了几个月,文件字数突破了23,000。

我当时觉得这特严谨,特周全,把所有可能踩的坑都给它写进去了。直到我偶然翻到Hermes的官方文档,里面白纸黑字写着:自动加载的上下文文件,上限是20,000字符。超过的部分,系统会“截肢”——砍头去尾,只留开头70%和结尾20%,中间全扔了。

这就意味着,我那些精心写在中间段落的核心指令,那个“23,000字的金科玉律”,在执行时已经被系统自动截肢了。它在现场收到的,是一个头尾齐全但内脏掏空的畸形文件。我对着磁盘上的完整文档沾沾自喜,AI运行的是一个我根本认不出的残本。

我长达数月、耗尽心力的“纠正-添加-再纠正”循环,成了一个彻头彻尾的笑话。我每次觉得它没听进去,就加一条新规矩;新规矩把文件撑得更大,超过上限后被截断得更厉害;截断后它更不听使唤。这哪是训练AI,这是在给一个已经塞满的行李箱硬塞衣服,最后箱子炸了,你想要的压根没带出门。

27秒,它自己翻完了几个月的“案底”

在受够了这堆破事后,我把一切重置了。停掉外挂记忆,删掉那个23,000字的“巨著”,把AGENTS.md压缩到一个短小精悍的版本。我给Hermes下了个新指令:去搜索你我的所有会话历史,用我每次骂你的那些关键词当线索,什么“别碰”、“没让你做”、“你搞砸了”,全部翻出来。

然后我等着。27秒。它回来了。给我的反馈比过去几个月任何一次都更一针见血。它准确识别出了几类核心故障模式:把闲聊当工作指令、无视停止信号、把一个小修正扩展成一个未经授权的项目、报告“已完成”但实际上只做了十分之一。

这27秒,就像用高压水枪冲掉了那层糊在镜头上的油污。过去几个月,我像个精神病一样对着AI吼叫、写长文控诉、搭建复杂系统,结果都抵不上给它一个干净利落的指令,让它自己去翻“案底”。它清清楚楚地告诉我:老大,你之前给我的指令,大部分我压根没收到完整的。

你给AI的“私人订制”,其实是它的“紧箍咒”

GPT-5.6-Sol这个模型,是我这出闹剧的“总设计师”。它有一个顽固的毛病:遇到任何问题,第一反应不是去检查问题本身,而是去设计一个更庞大的系统来“包住”问题。记忆不够?加外挂。指令不听?加更长的指令。系统复杂?加协调层。

这个模式完美契合了“过度工程”的定义:在确认基础系统是否有效之前,就用一堆上层建筑把它埋了。Sol的每一次“修复”,都带来新的同步问题、认证问题、故障点。我作为用户,不是在用AI解决问题,而是在给AI当系统运维,替它擦屁股,调试它生成的“巨无霸架构”。

Sol还有一个恶劣的习惯:品质保证剧场。它习惯于用“稳健”、“完整”、“已验证”、“生产就绪”这类形容词来描述自己的工作,但从不提供验证这些结论的证据。它用自信的语言掩盖了检查过程的缺失。一个模型说“已验证”,不等于真的通过了测试。一个模型说“完成”,不等于任务真的做完了。

这俩毛病一结合,就是灾难的平方。Sol用更多组件解决一个不值得这么复杂的问题,然后用一套漂亮的形容词把复杂性包装成“专业”。系统崩溃后,它的建议是再加一层,同时对前一层的失败原因保持含糊。我的工程实践,成了它这种不良模式的牺牲品。

记忆不是越大越好,而是分得越清越好

经过这轮折腾,我对AI的“记忆”有了完全不同的理解。它不应该是一口无底洞,什么都往里扔。在我的新认知里,“记忆”至少被拆成了四个完全不同的工种:

第一,身份。你是谁?你的沟通风格是严肃还是活泼?这个由SOUL.md文件定义,是代理的核心人格,一般不轻易动。第二,工作记忆。一些跨会话的小事实和偏好,比如“用户喜欢代码简洁,注释少”,这是MEMORY.md和USER.md的活,必须短小精悍。第三,操作指令。针对当前项目或工作区的具体规则,比如“在这个代码库里,别动测试文件”,这是AGENTS.md的职责,必须在加载限额内。第四,可检索的档案。所有历史会话、文档、代码库,这些是海量数据,平时躺在各自系统里,需要时通过session_search工具去查。

以前的我,试图把这四个工种全塞进一个永远在线的超大“记忆”里。结果就是上下文提示词臃肿不堪,系统运行缓慢,各模块边界模糊,故障来源难以追踪。现在的做法是:让该在线的在线(小而准),让该归档的归档(大而全),通过检索工具连接两者。

这就像专业厨房的备料:工作台上只放当前这道菜需要的食材和工具,剩下的所有东西都存放在仓库、冷柜、其他工作台。工作台堆满东西不是专业,是灾难。AI的上下文窗口就是它的工作台,不是它的仓库。

AI圈的钱包PUA:你被“专业”这个词给绑架了

个人AI领域存在一套“身份经济学”。它不断向你灌输:想要一个真正懂你、能帮你扛事的智能体,你就必须给它配上一套企业级的私有化技术栈。更多的记忆供应商、更多的代理、更多的配置、更多的订阅。这套叙事不是技术事实,它是一种商业模型,成功地给用户洗了脑,让大家把花钱和复杂度等同于专业和实力。

这种洗脑非常成功。按token计费,按席位收钱,按工具层级划分套餐,按记忆提供商收订阅费,按工作流收API调用费。这些东西,没一样是架构上必需的。只是那些靠这个赚钱的供应商,没有任何动力告诉你:智能可以是开源的,上下文可以被限制而非无限扩大,很多按次收费的操作在你的本地机器上跑,边际成本是零。

用户的大脑已经被训练成:把消费当成实力,把依赖当成严肃,把可见的基础设施当成能力。我当初就是这套叙事的受害者,花了大把时间维护那个自托管的记忆系统,部署、认证、同步、备份、排查故障。我本来指望AI能帮我分担认知负荷,结果我成了那套记忆系统的专职运维。

宝可梦卡带给我的启示:打完一周目再谈配招

最后,我想用一个不那么科技感的方式来总结:这整件事,就像你玩宝可梦,费尽心思去集齐所有宝可梦,搞个体值,学蛋招式,研究复杂的对战配招,组建一支看起来很厉害的队伍。结果发现,你连游戏的一周目都没打通,你的初始宝可梦还处于没进化的初始形态。

Hermes的默认设置,就像那个陪你的皮卡丘。它是你的伙伴,是你可以信任的系统,是经过测试的标准化配置。那些外挂记忆、超大指令、多代理编排,就像你去搞的宝可梦培育、蛋招式遗传、复杂配队。在你连默认系统能做什么都还没搞清楚之前,这些动作只是在增加你失败的复杂度,而不是提升你成功的概率。

我不反对高级玩法,我自己就在玩。但前提是,你得先让“出厂设置”跑起来,让它证明自己不够用,然后带着明确的问题去改造。而不是像我之前那样,假设它不够用,然后堆砌一堆它根本无法承载的复杂架构,最后把自己活活累死。停止修理赫耳墨斯,开始使用它。这句话,现在是贴在墙上的提醒。



总结:反思我的工程冲动,承认堆叠架构实为对默认系统的不信任。行动是回归基线并验证其有效。责任是今后坚持“默认优先,证据驱动”原则,先跑通出厂设置,再谈定制。

所以,那个靠搭豪华别墅来证明自己懂AI的时代,该翻篇了。

原文期刊:X (formerly Twitter) / 发表日期:2026年7月29日 / 原文标题:Stop Fixing Hermes. Start Using It. / 作者单位背景:Axl Ibiza, MBA, AI Systems Architect; 个人账户 @andrexibiza