Hermes新增提炼命令/refine:把聊天记录蒸馏成可复用记忆和技能

我们总以为,聊天记录存下来就是知识。最值钱的东西,往往藏在那些没记下来的操作流程里。

一段看似顺利的发布流程,背后可能藏着六七次失败的试探。而决定AI下次变聪明还是继续犯傻的关键,不在于记住多少,在于忘掉什么。

聊天记录是全套犯罪证据,不是学习笔记

聊完三个小时,感觉收获满满。系统提示说,是否保存此对话到记忆库。多数人会毫不犹豫点“是”。这个动作,就像把整间屋子的杂物全部扫进床底,然后告诉自己收拾干净了。

那条聊天记录里,有调试时反复尝试的错误指令。有随手输入的测试文件名。有一次性的临时端口号。有因为手误写错又改正的路径。还有几张过期的图片上传链接。这些东西,在对话发生的当下全是“过程”。但对于下一次任务,它们就是噪音。

人类整理笔记,会划线、折角、撕掉废页。AI系统的原始设计里,却往往缺少这个动作。一个对话结束,所有内容被同等对待。结果,有价值的操作规范和无价值的临时痕迹,被一股脑打包塞进记忆库。这就像把复习资料和草稿纸订在一起,考试前根本翻不到重点。

真正要存下来的,不该是对话流水账。而是从这段经历里蒸馏出来的操作手册:下次遇到同类问题,先查什么、后查什么、哪个坑绝对不要踩。

这个新命令在解决一个没人说破的蠢问题

Hermes新发布的这个斜杠命令,/refine,做的事情听起来简单得可笑:它让系统在对话结束后,重新审视刚才发生的一切,然后决定哪些东西值得记住,哪些东西应该扔掉。

这功能蠢就蠢在,它本应是任何学习系统的基础配置。人学完一道数学题,会总结出解题通法,而不是把打草稿的每一笔都刻进脑子。但AI系统之前一直在干这种蠢事:把整场对话的每一行、每一次报错、每一个临时变量,不加区分地塞进所谓的记忆里。

有了/refine,可以在对话结束时告诉系统:把刚才那个发布流程整理成技能,去掉那些一次性的ID和临时报错。或者,更新一下旧的部署手册,把新验证步骤加进去,删掉已经过时的API调用方式。或者,刚才那个纠正了好几遍的写作风格偏好,记到用户画像里,下次别再犯。

一个命令,三种用法。它不创造新知识,它负责分拣。把矿石和废渣分开。把可复用的流程和一次性的噪音分开。

一个成功帖子的背后,藏着七个失败步骤

用AI排一篇帖子,表面上就是“写内容、生成图、定时发布”三步。实际操作起来,是一条充满分支和死胡同的迷宫。

先检查发布队列,发现某个黄金时段已经被占用。临时决定调整时间,把一篇社区问答往后挪。生成配图之后,上传到发布平台,结果平台接口报错,说媒体ID无效。手动把图片附上,重新打开草稿确认。再次检查队列,确保调整后的时间没有和别的帖子撞车。忙活半天,帖子终于发出去了。

整个过程涉及:队列管理、优先级判断、图片上传机制、手动编辑后的状态同步、平台API限制的理解、最终核查清单。

如果只是把聊天记录原样保存,系统下次遇到类似任务时,会被这些信息淹没。它看到“上传图片失败”,会困惑:这到底是一条需要记住的永久规则,还是某次平台临时故障。

/refine的作用,就是在对话刚结束、记忆还新鲜的时候,直接进行干预。明确告诉系统:把那几个关键检查步骤编成技能。把那些一次性的报错信息和临时ID扔进垃圾堆。系统底层会把当前对话内容跑一遍审核,生成更新方案。人只需要确认,这个方案对不对。

不同种类的知识,不该塞进同一个麻袋

很多AI系统的记忆设计,像只有一个抽屉的床头柜。不管什么东西,拉开抽屉往里一扔完事。这种做法,在需要一个螺丝刀的时候,得从一堆旧电池、发票和外卖筷子里翻找。

/refine背后,体现了对不同知识类型的区分。它把可留存的信息分成至少四个篮子:

第一个篮子,用户画像。装的是那些长期稳定的偏好和事实。比如,写文章喜欢用短句,讨厌官方套话,发社交平台的内容要保持轻松语气。这些是常驻信息,每次对话都应该知道。

第二个篮子,通用记忆。装的是项目环境信息、工具特性、确认过的规则。比如,某个部署工具在Windows系统上有个已知bug,需要额外配置环境变量。这些信息轻量、紧凑,跨会话保持。

第三个篮子,技能。装的是完整的操作流程。比如,如何检查发布队列,如何将一篇长文改编成系列短文,如何从代码库提交一个合规的补丁。技能是程序性记忆,只在需要执行特定任务时才被完整加载,平时不占用系统提示词的空间。

第四个篮子,现有知识的补丁。很多时候,新学到的东西不足以建立一项新技能,只需要对旧技能打个补丁。比如,某平台的媒体上传接口更新了,旧流程里需要插入一步“确认媒体状态为ready”的检查。

一个清晰的整理系统,决定了学到的经验到底能不能被用到。如果所有东西都堆在一起,系统很可能在一个地方存了“发布前检查队列”,又在另一个地方存了“发布前先发一篇社区问答”,然后在第三个地方存了“直接发就行,不用管其他”。三条规则同时存在,系统选择听谁的,就成了随机事件。

记住的东西越多,翻车的概率可能越大

这听起来反常识:一个拥有无限记忆容量的系统,难道不是越聪明吗?现实情况恰好相反。

没有淘汰机制的记忆库,迟早会变成一座垃圾填埋场。第一次跑通某个流程时,用了临时方案。第二次改进时,加了一个验证步骤。第三次彻底重构时,换了全新架构。如果每次对话都原样保存,那个最初的临时方案、中间的过渡步骤、最终的新架构,会同时存在于记忆里。系统检索时,可能随机抽中任何一个版本。结果就是,同一个任务,有时候按老办法干,有时候按新办法干,完全不可预测。

更隐蔽的问题在于,系统可能保存了根本不该跨会话保留的东西。一次性的编辑指令、特定时段的排期策略、某次调试用的假数据。这些东西进入长期记忆后,会在某次不相关的任务中被错误调用,制造出匪夷所思的bug。

/refine允许指定要排除的内容,这是整件事最关键的设定。它承认了一个事实:归纳总结的能力,和记忆能力同等重要。知道什么不该留,比知道什么该留更考验一个系统的智能水平。

研究者开始认真对待这个故障模式

最近发布的一个新基准测试,专门研究AI智能体在跨会话学习中的表现。测试设置了二十六个不同场景、两百多个任务片段,对比系统在有记忆能力和没有记忆能力下的表现差异。

结果既鼓舞人心又令人警惕。记忆能力确实有帮助,但不同系统之间的差距极大。更关键的是,两个最终表现差不多的系统,其内部记忆的利用效率可能天差地别。一个系统是真的从过往经验中学习并应用了正确的知识。另一个系统,可能只是碰巧蒙对了答案,或者它调用的知识根本就是错的,但最终输出歪打正着。

研究者把智能体的学习过程拆解成五个环节:规划、渲染、路由、门控、关闭。故障可能发生在任何一环。系统可能成功保存了经验,但在下次任务开始时忘记去检索它。系统可能检索到了正确的经验,但在生成最终方案时没有正确应用。系统可能把本该归入技能的操作流程,错误地存进了通用记忆,导致执行任务时无法加载完整步骤。

这个测试框架表明,/refine所解决的问题,只是整个学习链条的第一环,也是最基础的一环:从原始经验中提取出可保存的信息。如果这一步做的质量很差,后续的检索和应用环节再完美,也无法补救。

两条路径:让AI变强,不止靠换大脑

行业里提升AI能力的主流方式,是等模型升级。GPT出新版本了,Claude更新了,更智能的模型发布了。然后所有系统跟着升级,变聪明一点。

持续性学习系统提供了另一条路径。即使底层模型不变,一个配备了良好的经验提炼、知识整理和技能更新机制的智能体,也能在使用过程中变得越来越顺手。它记住了一个人喜欢的工作节奏。它掌握了特定环境里的各种隐藏规则。它拥有了一套经过实战检验的可复用流程。

这就好比两个人用同一款电脑,一个每次开机都重装系统,另一个把常用软件、快捷方式和配置文件都设置好了。后者开机就能干活,而且效率越来越高,因为他不断优化自己的操作环境。

/refine就是这种优化工具中的一个。它不改变模型的大脑,但整理模型面前的桌面。把用过的工具放回工具箱,把废纸扔进垃圾桶,把重要文件贴在墙上。下次做任务时,不需要先在一堆垃圾里刨半天。

什么时候该用,什么时候碰都别碰

这个命令最适用的场景有几种。

一种是刚完成一次艰难的调试。花了一个小时定位到一个隐藏极深的配置错误,系统最终的解决方案包含根因分析和验证步骤。这时候用/refine把这次诊断流程固化成技能,下次同类故障可以秒级定位。

一种是同一个错误犯了三次以上。每次都纠正系统写文章不要用破折号,但它每次都犯。这说明临时纠正没有被转化为长期规则。用/refine把这个偏好写进用户画像,从根源上解决问题。

一种是在对话过程中建立了一套复杂的工作流。把一篇长文档拆成多篇社交短文,需要经历内容提取、段落重排、配图生成、平台适配等步骤。这些步骤值得被独立封装成一个技能。

还有一种是对旧流程的修正。某个平台的接口变了,旧的发布流程会卡在上传步骤。用/refine精确修补那个步骤,把旧的验证逻辑替换成新的,而不是新建一个技能造成混淆。

但也有很多场景完全不该用这个命令。一次简单的天气查询,一轮随意的闲聊,一个临时决定的会议时间调整。这些对话没有产生任何值得跨会话保留的信息。强行运行/refine,只会让系统在噪音里强行挖掘信号,最终生成一些似是而非的“经验”。

临时性的权宜之计也需要注意。某个紧急状况下采用了一个很不标准的方案。这个方案今天能用,是因为刚好满足某些临时条件。如果把它存成标准流程,下次在正常状况下调用,反而会出问题。要么不存,要么存的时候明确标注“临时方案,非默认”。

审批门:把决定权留在手里

系统可以自动写记忆、自动存技能。但一个更稳妥的做法,是打开审批开关。

开启写入审批后,系统每次提议保存或更新信息时,不会直接生效。它会生成一条待审核的申请。人可以在界面上看到这条申请的具体内容:系统打算存什么,打算更新哪条旧规则,打算删除哪段过时信息。

这是一个保险机制。系统可能会提炼出一个完全正确但范围过大的规则,把一次特殊场景的经验推广到了所有场景。系统可能会错误地把一次手误当成新的写作偏好。系统可能会在记忆里保留了一段本应排除的敏感信息。

在审批环节,可以逐条审查。这个规则适用于所有任务,还是只适用于特定项目?这条更新会覆盖旧规则,还是和旧规则并存?这段记忆是否清晰地标明了适用条件和边界?

系统可以负责从经验中提炼初稿,但最终决定哪些内容真正成为长期知识,这个权限需要保留。

一个可重复的操作手册,胜过一百次成功记录

回到最初那个发帖的案例。整个对话中最有价值的产出,不是那条按时发出的帖子,而是那个帖子背后被梳理出来的流程清单:检查当前队列、识别附近的高优先级内容并保持间距、上传媒体后验证其状态为ready、手动编辑草稿后重新打开确认、最终再次检查队列排期、连接器步骤失败时如实报告。

这些规则被保存为技能后,下次再执行类似任务,系统不需要重新摸索整个流程。它直接加载这套规则,按顺序执行检查步骤。之前掉进去的坑,这次自动绕开。

而那些一次性的数据,那次对话的具体排期时间、临时生成的图片ID、过期的上传链接、草稿的具体文案内容,全部被排除在保存范围之外。它们完成了在本次对话中的使命,不需要再占用未来的认知资源。

最后的筛选:什么都没存,也是好结果

所有对话结束后,运行/refine,系统审核一遍,最终反馈:本次对话未发现值得长期保存的信息,无需更新记忆或技能。

这个结果完全可以接受,甚至可以说是一种成功。它说明系统学会了分辨哪些是真正的经验,哪些只是日常噪音。它没有为了保存而保存,没有把每一个临时操作都包装成“可复用知识”。

在AI持续性学习的设计里,懂得说“这个不需要记”,和懂得说“这个要记”,属于同一项能力。

每次真正值得提炼的经验背后,往往伴随着若干次“什么都没存”的对话。这个筛选过程本身就是价值。

总结下来,AI的学习能力提升,既靠大模型迭代,也靠系统能把每一段经历中的有效成分提取出来、杂质排除出去。那个斜杠命令就是干这个的。

但它干得越多,人需要看住的边界就越清晰——千万别让系统把昨天临时应付检查的那套假动作,当成明天的标准战法。

原文期刊:无(技术文档分析)
发表日期:2026年8月9日(基于原文8月7日推文解读)
原文标题:Hermes Agent /refine: Turn Conversations Into Memory and Skills
作者单位背景:技术社区/独立开发者生态观察