2026 年 8 月 3 日,Hermes Agent 背后的大脑 Teknium 扔出一组数据,直接把 AI 代理优化这件事从“修修补补”拉到了“认知重构”的层面。借助英伟达 Nemo Relay 的观测能力,团队从 150 多万条真实对话记录里挖出了大量无效轮次和工具报错,然后针对性做了 16 项底层改进。
结果很吓人:弱模型的任务完成轮次、工具调用次数、墙上时钟时间全部下降,工具报错直接归零。单次请求靠精简工具描述(Schema Diet)就能省下约 700 个 Token;重复查看技能描述(Skill View)时,每次能省下 2.5 万个 Token。这意味着一个 130 亿参数的轻量模型,现在跑复杂编程任务不再需要疯狂烧钱堆算力,而是靠“脑子更清楚”来弥补“肌肉不够大”。
优化不是修 Bug,是给 AI 换脑子
大多数人对 AI 代理优化的理解还停留在“让代码跑得更快”或者“少占点内存”。但这批改进的底层逻辑完全不一样——它不是给汽车换更好的轮胎,而是重新设计了导航系统,让司机少绕路、少问路、少走错路。
传统观点认为,模型越强(参数越多)效果越好,弱模型天生就是残废。Hermes 团队用 150 多万条生产数据库记录做了一次大规模尸检。他们发现大量 Token 和时间的浪费,不是模型推理太慢,而是代理在“瞎忙”——重复执行无效操作、读文件读到一半卡住、执行被系统阻止的命令后不报错也不恢复、技能描述反复加载占满上下文。这些问题跟模型智商没关系,是代理的“工作习惯”有严重缺陷。
一个典型案例:读取文件时如果内容超过长度限制,旧版代理直接截断然后尝试用不完整的信息继续干活,结果就是后续工具调用全部跑偏。改进后加了可恢复截断溢出(Recoverable Truncation Spill),读取限制从 500 行提升到 2000 行。44% 的截断读取场景现在一次调用就能搞定,不用来回折腾。这不是让模型变聪明,是让代理别犯蠢。
从 25 万场对话里捞出的“废话税”
这波优化的数据来源很有意思。Teknium 说他跟自己 Hermes 的 25 万场对话全部被拿来当样本。25 万场对话是什么概念?如果每场平均 10 轮交互,那就是 250 万次来回。一个人类程序员一辈子都写不出这么多对话记录,但 AI 代理可以——而且每一句废话、每一次报错、每一次重试都被录下来了。
团队干了件很“变态”的事:他们不只看成功案例,专门盯着“浪费的轮次”和“工具报错”挖。这相当于一个厨师不看自己做得好的菜,专门研究烧糊了的锅底——从失败里总结规律,然后系统性消灭那些“必死无疑”的操作路径。
效果最炸裂的是“重复查看技能描述去重”(Repeat-View Dedup)。代理每次调用技能(Skill)时都要加载完整描述文档,如果同一个技能在一场对话里被调用多次,旧版代理会傻乎乎地重复加载同样的内容。改进后每次重复查看节省约 2.5 万个 Token。按主流大模型 API 定价粗算,单这一项改进,每场复杂对话就能省下几美分到几十美分。积少成多,25 万场对话的累计节省是个天文数字。
英伟达 Nemo Relay 到底干了什么
这次优化的“眼睛”和“大脑”是英伟达的 Nemo Relay。Nemo Relay 本质上是一个代理可观测性(Observability)平台,专门盯着 AI 代理的一举一动。
它通过两种方式收集数据:一是代理原生的生命周期钩子(Hook),能捕捉会话、子代理、工具调用的起止;二是一个透明的 LLM 网关(Gateway),所有模型请求和响应都要经过它,数据被完整记录下来。
更关键的是 Nemo Relay 的“自适应层”(Adaptive Layer)。这个组件会持续观察代理的执行轨迹,学习工具使用模式、LLM 延迟规律和提示词稳定性,然后自动注入性能优化提示。通俗说,Nemo Relay 不只是“录像”,它还会分析录像然后告诉代理“你刚才那段操作是多余的,下次别这么干”。
这次改进中,Nemo Relay 的 ATOF 基准测试套件被用来做大规模验证。ATOF 全称 Agent Task Optimization Framework,专门用来测试代理在各类任务上的表现。16 个 PR(Pull Request,代码合并请求)合入后,跑了大约 460 次 CI(持续集成)检查全部通过。
工具报错清零:从“经常翻车”到“从不翻车”
整份改进清单里最抓眼球的是“工具报错 → 0”。工具报错(Tool Errors)是 AI 代理最烦人的问题之一——代理调用一个工具(比如读文件、执行命令、搜索代码),结果工具返回错误,代理要么傻等要么胡乱重试,浪费大量 Token 和时间。
这次 Hermes 团队用了一整套“组合拳”把工具报错几乎清零:
被系统阻止的命令(Blocked Cmd)现在能自动恢复,脚本会被自动保存。执行命令时当前工作目录(CWD,Current Working Directory)会被回显,代理知道自己在哪里干活。失败时系统会给出具体提示(Failure Hints),而不是只抛一个“命令执行失败”的笼统信息。写入操作完成后会验证是否真的写进去了(Write Verified True)。多路径恢复(Multi-Path Recovery)和探针恢复修复(Probe-Restore Fix)确保代理在遇到异常路径时能自己找回来。
这些改进的逻辑是:与其让模型在报错后“猜”怎么解决,不如提前堵住所有可能导致报错的路径。工具报错清零意味着代理可以把全部注意力放在任务本身,不用再花精力处理“我刚才到底哪一步做错了”这种低级问题。
Schema Diet:每次请求省 700 个 Token
“Schema Diet”是这次优化里另一个值得单独拎出来说的改进。在 AI 代理的语境里,Schema 指的是工具的描述文档——每个工具长什么样、需要什么参数、返回什么结果,这些信息都要在每次请求时发给模型。
旧版代理每次调用工具时都传输完整的 Schema,哪怕同一个工具在一场对话里被调用几十次。改进后 Schema 被“精简”了大约 40%。团队做了什么?去掉冗余字段、压缩描述长度、缓存重复部分。结果每次请求省下约 700 个 Token。
700 个 Token 听起来不多,但乘上 25 万场对话里数百万次的工具调用,总量相当惊人。对于运行在本地或边缘设备上的小模型,每次请求少处理 700 个 Token,意味着响应速度更快、内存占用更少、成本更低。
弱模型翻身:从“带不动”到“跑得飞起”
这批优化的核心受益者是“较小、较弱、本地运行的模型”。为什么要专门照顾弱模型?因为现实世界里的 AI 应用,大部分不会跑在价值几百万美元的 GPU 集群上。普通开发者用消费级显卡、云服务商的小规格实例、甚至手机端跑模型,算力和内存都有限。
传统优化思路是“让强模型更强”,Hermes 的思路是“让弱模型也能干活”。改进后,弱模型(Smaller/Weaker Models)的 LLM 交互轮次(LLM Turns)、工具调用次数和墙上时钟时间全部下降。
推文评论区里有用户现身说法:之前把 Gemma 4 26B 模型接入 Hermes 时跑得很吃力,换成 DeepSeek V4 Flash 后才勉强能用。Teknium 直接回复建议改用小尺寸的 Qwen 模型。这个细节说明:优化后的 Hermes 对小模型的兼容性大幅提升,开发者有了更多模型选择,不用被“只有顶级模型才能跑代理”的预算门槛卡死。
强模型也没亏:省了 Token 但不牺牲效果
有人可能会担心:优化是不是牺牲了强模型的效果来换效率?数据给出了否定答案。对于强模型(Strong Model),改进后的效果跟改进前持平(Parity),但每个任务净节省约 1.4K Token。
“持平”的意思是任务完成质量没下降,“净节省 1.4K Token”的意思是完成同样任务花的钱更少、速度更快。这相当于给强模型做了一次“降本增效”手术——切掉了冗余操作,但核心能力一根毛都没少。
16 个 PR 和 460 次绿勾
这次改进不是拍脑袋想出来的,而是一套完整的工程流程:先挖数据找问题,再针对性地写代码修问题,最后用真实任务做 A/B 测试验证效果。
整个优化批次包含 16 个 PR(15 个功能改进加 1 个集成修复),全部用 Rebase 方式合并进主分支。大约 460 次 CI 检查全部通过(“绿色”代表通过)。6 份技能文档同步更新。
这种规模的工程投入说明一件事:AI 代理的效率优化已经进入“精耕细作”阶段。不再是随便调几个参数就能有 10% 提升的“容易钱”,而是要从生产数据里挖细节、从失败案例里找规律、从底层架构上做手术的“硬功夫”。
跟 DeepSeek V4 Flash 的梦幻联动
Teknium 在推文里特意提了一句:这批优化“跟现在几乎免费且处于前沿的 DeepSeek V4 Flash 0731 是绝配”。
DeepSeek V4 Flash 0731 是2026 年 7 月 31 日刚上线的正式版模型,总参数 2840 亿但激活参数只有 130 亿。它跟预览版模型架构完全一样,只是重新做了一次后训练(Post-Training),结果 Agent 能力“突变式”飙升。在 Terminal Bench 2.1 上拿到 82.7 分,而三个月前 V4-Pro 预览版在 2.0 版本上只有 67.9 分。
一个激活参数仅 130 亿的轻量模型,在代理任务上跑出逼近顶级闭源模型的分数。API 定价更是便宜到离谱:每百万 Token 缓存命中 0.0028 美元、未命中 0.14 美元、输出 0.28 美元。2000 万 Token 的代理任务折前约 3.5 美元。
Hermes 这波优化相当于给 DeepSeek V4 Flash 这辆“省油小车”配了一套“顶级导航系统”——车本身不贵、不费油,但有了好导航就能跑出跟豪华车一样的路线效率。两者叠加,本地跑 AI 代理的成本门槛被砸到了地板上。
代理优化的下一站:从“省钱”到“省脑子”
回顾这 16 项改进,可以提炼出一个核心趋势:AI 代理的优化重心,正在从“让模型算得更快”转向“让代理想得更清楚”。
过去优化主要盯着推理速度、内存占用、批处理大小这些“算力指标”。现在 Hermes 团队盯的是“这个代理在对话里绕了多少冤枉路”、“它反复看了多少次同一份文档”、“它因为工具报错浪费了多少轮次”——这些都是“认知效率”问题,不是“计算效率”问题。
认知效率优化的杠杆效应更大。把模型推理速度提升 20%,需要更好的硬件或更复杂的算法优化。但把代理的无效轮次减少 20%,只需要让它“别犯蠢”——成本更低、效果更持久、而且对弱模型尤其友好。
这波改进也说明了一个更深层的变化:AI 代理正在从“玩具”变成“工具”。玩具阶段大家关心的是“能不能做到”,工具阶段大家关心的是“能不能稳定、便宜、大规模地做到”。Hermes 的 16 个 PR 和 460 次绿勾,本质上是 AI 代理走向工业化的一个注脚。
所有新功能现已加入 Hermes Agent,立即更新即可,或等到明天完整版更新发布。
这场优化的真正赢家不是某个模型,而是所有想用 AI 代理干活但预算有限的人。当工具报错归零、重复加载消失、弱模型也能跑得动,AI 代理才算真正从“富人的玩具”变成了“普通人的工具”。
原文期刊:Teknium on X / 2026年8月3日 / Hermes Agent is now dramatically more efficient / Nous Research