Hermes Agent v0.20.0:先驱者版本现已上线


Nous Research 发布了 Hermes Agent v0.20.0,“The Herald Release”。

亮点包括:实时流式语音(带闯入和唤醒词)、基于可验证引文的研究、签名出站 Webhook、A2A v1.0、桌面插件和工件平台、更快的启动速度、更智能的审批以及更强大的 CLI。

Hermes v0.20.0在五个月内搞定了3650次代码提交,平均每天24次,这不比你家楼下的便利店补货还勤快?

Hermes Agent v0.20.0正式发布,带来实时语音对话、唤醒词、桌面应用平台化、可验证引用、A2A协议等重磅更新。本文从认知心理角度剖析开源AI代理工具如何通过高频迭代颠覆用户交互体验,解析技术更新背后的认知冲突与行为设计,带你理解AI工具进化中的反常识逻辑。适合对AI开发工具、开源生态、人机交互感兴趣的技术爱好者和产品经理阅读。

一个AI代理,迭代速度比你家楼下的便利店还快

五个月,3650个提交。你没看错,平均每天二十四次代码合并。这是个什么概念?你手机上的那些大厂App,一年憋出一个大版本,改几个图标就叫创新。而Hermes这帮人,从v0.19.0到v0.20.0,改了五千两百个文件,新增了五十五万行代码,删掉了四十万行。

你写一个毕业论文改三遍都想吐,人家改代码跟呼吸一样自然。一千两百个issue被关闭,六百五十个贡献者参与,这意味着每四个小时就有一个新功能或者修复被塞进去。普通人早上起床到晚上睡觉,人家已经迭代了两个完整版本。

这背后有一个认知陷阱:我们总觉得大公司靠谱,开源项目不靠谱。但数据打脸了,那些有KPI压力的商业团队,反而干不过一群用爱发电的疯子。为什么?因为大公司要开会评审,要层层审批,而开源社区只需要一个pull request。决策链条越短,进化速度越快。

你对着电脑说话,它终于不让你等它把话说完再听了

以前的语音助手怎么工作的?你说一句话,它转圈圈,生成一整段回复,然后给你播一个长长的录音文件。你中间想插嘴?没门。你只能像个傻子一样听完,然后再喊一遍唤醒词。这跟用对讲机有什么区别?

Hermes这次改了什么?流式语音。它一边生成一边往外蹦词,你听到一半觉得不对,直接说话打断,它立刻闭嘴听你新的指令。那个“barge-in”功能,中文学名叫“插话”,说得直白点就是:你终于可以像跟真人吵架一样跟AI说话了。再加上静音检测,它知道你什么时候说完了,不用你喊“发送”。

这个改进的价值在哪?传统的对话系统设计,把语音交互当成了文件传输——你传一个音频,我传一个音频。但真正的对话是实时双向的。认知心理学上有个概念叫“交互流畅度”,如果你每句话都要等三秒钟才能插嘴,你的短期记忆已经把这个话题给忘了,对话就断了。现在这个设计,是第一个让我觉得“对面坐着个人”的AI语音交互。

喊一句“嘿Hermes”,你的电脑就变成了一只听话的狗

唤醒词这东西,手机早就有了。但是电脑上一直是个痛点。你得按快捷键,或者点图标,然后等它启动。Hermes这版干了什么事?它在本地跑了一个唤醒词检测模型,你的声音根本不出机器,所以在它醒着等你说话的时候,你的隐私是安全的。

更狠的是多profile语音路由。你用“嘿Hermes”唤醒,它切到工作配置;你说“Hey Research”,它切到研究模式。这不只是换名字,它背后连着不同的系统提示词、不同的工具权限、甚至不同的模型后端。一个物理设备,因为你喊的名字不同,变成了完全不同的AI。

这里有个反常识的点:唤醒词检测这种活,通常被认为是低技术含量的脏活累活,但恰恰是这种“脏活”决定了用户的使用频率。如果每次交互要按三个快捷键,一天用十次就是三十次点击,认知负荷累积起来你就懒得用了。现在张嘴就喊,零摩擦。你说这个技术难吗?不难。但之前就是没人做。为什么?因为大厂的产品经理觉得这不性感,不AI,不上档次。结果呢?用户就天天忍受着按快捷键的笨办法。

一个会给你看证据的AI,比一万个“我觉得”都管用

AI最大的毛病是什么?胡说八道还理直气壮。你问它一个事,它给你编一段,你查都查不到来源。Hermes这次加了一个“grounded citations”技能,中文叫“有根引用”。它做研究的时候,每一句结论后面都跟着一个链接,点进去能看到原文的截图,文字是匹配过的,不是它自己编的。

还有一个fact-checking模式,你把一篇文章丢给它,它会告诉你哪句是对的,哪句是编的,哪句查不到证据。这相当于你雇了一个24小时不睡觉的审计员。以前AI的回答像是个牛皮癣广告,你说你的,它说它的;现在它变成了一个严谨的学者,每一句话都带脚注。

我为什么说这个反差大?因为大部分AI公司都在追求“让AI看起来像人”,而Hermes在追求“让AI看起来像图书馆”。前者在制造幻觉,后者在打破幻觉。从认知心理学的角度看,人类天生就信故事不信数据,但数据才是真相。这个功能逼着你信数据,因为每个数据都有出处。这是一个反人性的设计,但恰恰因为反人性,它才稀缺,才值钱。

你的桌面App,从聊天框变成了一整个工作台

以前桌面AI应用是啥样?一个对话框,你问一句它回一句,顶多旁边插个浏览器。Hermes这版把桌面端干成了一个平台。它现在能渲染“artifacts”,就是那种带版本的卡片,你生成的HTML代码或者图表,直接在右侧边栏跑起来,沙盒隔离,不会搞坏你的系统。

还有插件SDK正式落地。第一个插件是Kanban,就是那个看板工具。这意味着什么?意味着Hermes不再是“一个AI聊天软件”,它变成了“一个能跑AI插件的操作系统”。你可以自己写插件,把你的工作流塞进去。ctx.download这个接口能让插件直接甩文件给用户,不用你手动去目录里翻。

最夸张的是全局快捷键快速输入窗。你在任何软件里,按一组快捷键,蹦出来一个小输入框,敲完内容,它直接存到Hermes的某个会话里。你写PPT写到一半突然有个想法,不用切窗口,不用保存,直接呼出来就记。这是一种“侵入式”的设计,它不再是你电脑上的一个应用程序,它变成了你电脑的一个图层。

这个转变的认知冲击在哪?大部分产品的思路是“你来我这儿干活”,Hermes的思路是“我去你那儿等你”。这种主客体关系的倒置,是设计理念上的代差。

一个AI能跟另一个AI说话,这个世界终于开始连起来了

A2A协议,全称Agent-to-Agent,版本号1.0。Hermes这次把它做成一个内置插件。什么意思?Hermes可以发现自己附近还有哪些AI在跑,然后跟它们对话,也可以被其他AI指挥。

这是一个什么场景?你有一个负责写代码的AI,有一个负责测试的AI,有一个负责部署的AI,以前它们各干各的,你得当中间人传话。现在Hermes通过A2A协议,直接喊那个测试AI跑用例,用例过了再喊部署AI上线。整个流程自动化。

行业里一直在喊“多智能体系统”,但喊了五六年没落地,就是因为没有统一的通信协议。大家都用自己的私有API。Hermes直接集成了一个开放标准,这在战略上叫“做连接器”。它的野心不是当最聪明的AI,而是当那个能把所有聪明AI串起来的电话交换机。这个定位比“我要干掉OpenAI”聪明多了。

命令行里的黑话,一个斜杠解决所有麻烦

命令行界面,CLI,看起来土,但实际上是效率最高的地方。Hermes这版给CLI塞了一堆新指令。感叹号加命令,直接跑shell脚本,不经过模型处理。斜杠init,扫描你整个项目,自动生成一个AGENTS.md文件,告诉你这个项目里有啥,能干啥。

斜杠diff,你看代码改了啥,不用切出去git diff,直接在里面看。斜杠context,告诉你现在上下文窗口里塞了啥,哪些占内存多。斜杠focus,精简输出,帮你把注意力收拢。Ctrl+S,写到一半的提示词可以存到面板里,稍后继续。

这一套组合拳打下来,你根本不需要离开这个终端窗口。以前你写代码要在IDE和终端之间切来切去,现在一个窗口干所有事。还有hermes import-agent这条命令,能把Claude Code或者Codex的配置一键迁移过来,不用重新配。这叫“投降式兼容”,你用过别家的?没关系,过来吧,东西都给你搬好。

这背后的行为设计是“锁定效应”。当你的工作流全部嵌在一个工具里,切换成本极高。这些斜杠命令不是在加功能,是在织网。

中间纠正AI,不用重头再来,这是对人性的妥协还是尊重?

你跟AI对话最烦什么?它跑偏了。你让它写一段代码,它开始给你写论文。以前怎么办?Ctrl+C,重来,把话再说一遍。Hermes这次加了个“redirect”功能。你在它说的时候直接打字纠正,它当前的生成不会停,但方向立刻扭过来。上下文里的工作成果保留,原来的提示词也留着,只不过追加了你的新指令。

配合双击ESC键丢弃草稿,还有撤销栈,整个交互从“崩溃重启”变成了“微调”。这个差别巨大。因为人的思路是连续性的,你发现方向错了的时候,前面说过的90%的话是对的,只有10%需要修正。你非要让人把90%再复述一遍,这是在消耗人的耐心。

这里有个认知科学原理叫“认知卸载”。人脑的工作记忆容量有限,你让用户反复输入同样的内容,就是在浪费他宝贵的认知资源。好的设计是让机器记住,让人只管增量信息。这个redirect做到了。

工具自己会救自己,AI终于学会了“别让我猜”

以前用AI工具最痛苦的是,它调用工具失败了,它不告诉你为什么,就愣在那里,或者瞎猜。Hermes这次系统性修复了工具的自愈能力。终端输出太长了,被截断了?它会自动把完整输出倒到一个文件里,然后自己读那个文件。打补丁的时候发现文件已经被改过了?它能识别“已经应用过了”,不会给你报错然后死机。

搜索什么东西没搜到?它不会直接跟你说“没找到”,它会去猜你是不是打错了字,找近义词再试一次。最常见的错误类型,它直接给你附上“操作建议”,告诉你现在该干嘛。而且默认的工具调用迭代次数从90次涨到了500次。长流程的自动化任务不会再撞墙。

这个改进有个隐藏的认知点:用户不需要知道工具是怎么恢复的,只需要看到它没死。这叫“容错透明性”。最完美的工具不是你用的时候觉得它牛逼,是你用的时候根本没感觉到它在修自己。它默默把事情干了,你不察觉,这就是最高级的交互。

压缩算法不删你的记忆,长对话终于不智障了

上下文窗口满了怎么办?大部分AI直接扔最早的对话,你跟它聊了三个小时,它把第一个小时的事全忘了。Hermes的压缩策略这次大修了。它做“渐进式微压缩”,每次聊完一段就压一点,而不是等到窗口满了搞一次大扫除,让你干等一分钟。

它还保证最新的N条用户消息永远保留,不管你压得多狠,最近几轮对话不会丢。超时机制也改了,以前压缩模型跑得慢,整个系统卡死,现在是“你慢你的,我不等你”,按时收工。

长期对话还有一个隐形杀手:技能幽灵。你删掉了一个技能,但压缩的时候没有删干净,结果这个技能在上下文里阴魂不散,导致AI以为它还能用,结果调用失败。这版加了“ghost-skill defense”,压缩的时候检查技能列表,不在列表里的全部清理。长会话终于不智障了,记忆的逻辑清晰了。

审批系统变聪明了,不用你疯狂点“允许”了

AI要执行命令,你得批准。但每干一件事都问一次,你会疯掉。Hermes这版有一个“smart approvals”功能,它会看你以前的批准历史,自动生成一个白名单建议。比如你过去十次都允许了“读取当前目录”,它就提议把这个动作加入自动批准列表。

还有一个“连续拒绝断路器”,如果你连续拒绝一个操作三次,系统会判定这是个死循环,自动切断,防止AI在那边傻转。桌面的配对审批也修好了,不会弹错窗口让你找不到在哪确认。

这其实是对用户行为模式的学习和预测。好的AI不是等指令,而是预判指令。当它熟悉了你的习惯,它就像一个老助理,不用你开口就知道该不该做。

启动快了十几秒,冷屁股终于不烫了

最后聊一个不性感但关键的:速度。Hermes的冷启动从14秒降到了1.8秒。你以前敲完命令,起身倒杯水回来它还没好,现在你手还没离开键盘它就亮了。更新检查也快了2到6秒,配置读取快了54倍。这些数字单个看没什么,叠加起来就是你把注意力消耗在“等”上的时间减少了。

人脑有个特点,等待超过三秒就会开始走神,走神回来重新集中注意力又要十几秒。那些毫秒级的优化,折算成人类认知成本,省下来的时间是天量的。这次桌面端还上了第二个60fps渲染优化,五个标签页同时流式输出也不掉帧,后台挂机CPU近乎为零。技术上的精益求精,最后全变成了你使用时的“顺手”。

你以为你在用一个聊天工具,其实你背后是五千个文件改动堆出来的流畅感。真正的奢侈不是堆料,是你感受不到它在哪里使劲。

总结:这次更新教会我一个道理,高频迭代和用户体验不是反义词,它们是同义词。那些反人性的AI设定,比如等你讲完话再回复、瞎编答案不给来源、启动慢得像乌龟,都被人性化的设计逐个击破。当你开始用赫尔墨斯,你不是用一个工具,而是在体验一个开源社区对“什么叫好好说话”的理解。你的AI助理,终于像个助理了。

你的电脑听懂人话的那一天,就是你失去偷懒借口的那一天。