你家AI助手每次从零开始,你才是那个最累的人!
摘要:2026年开源AI智能体框架大爆发,Hermes Agent、OpenClaw、Vellum、DeepSeek Harness四强争霸。有人越用越聪明,有人越用越失控。600张图片的长周期任务到底该交给谁?本文从记忆系统、技能进化、成本结构三个维度拆解四个框架的真实表现,告诉你为什么开源不等于免费,为什么“越用越聪明”可能是个陷阱。
一个Agent连600张图都搞不定,这正常吗?
把600张高中数学卷子的截图扔给一个AI智能体。告诉它,每道题都要写出详细解题步骤,最后整理成Markdown格式的问答文档。然后你关掉电脑去睡觉。
第二天早上打开屏幕。Agent卡在第37张图上。不是算不出来,是忘了自己在干什么。上下文窗口爆了,前面的题全丢了,它从第38张重新开始,把已经做过的又做了一遍。
这不是段子。这是2026年每一个用开源AI智能体处理长周期任务的人每天都在经历的事。
你可能会说,现在的AI不是越来越聪明吗?ChatGPT Work能处理长上下文,Claude有200K窗口,Perplexity能联网搜索。但问题恰恰出在这里——聪明和持久是两回事。
一个模型再聪明,它每次处理你的任务时,都像是一个失忆的天才。你花二十分钟教会它你的项目结构、你的代码风格、你的周报格式。关掉窗口再打开,它问你是谁。你成了那个最累的人,每天都在给不同的AI反复解释你是谁、你在做什么、你需要什么。
这就怪了。开源社区不是有一堆号称“越用越聪明”的智能体框架吗?Hermes Agent、OpenClaw、Vellum、DeepSeek Harness——哪一个不是GitHub上星标过万、社区吹上天的明星项目?可面对600张图片这种级别的任务,它们真的扛得住吗?
开源Agent圈地运动:三个月,三个神话
2026年的开源AI智能体圈,比任何科技赛道都热闹。
先看OpenClaw。奥地利开发者Peter Steinberger在2025年11月发了个周末项目,想做个能自动监控收件箱、分类GitHub Issue的小工具。结果两周四千星,两个月二十五万星,直接把React从GitHub历史第一的位置上踹了下来。六十天,一个AI框架干翻了前端框架十几年攒下来的星标。NVIDIA跑来合作做NemoClaw,腾讯跑来当赞助商。
再看Hermes Agent。Nous Research——就是那个Hermes模型系列累计下载超五千万次的团队——2026年2月悄无声息地把项目挂上GitHub。没有发布会,没有公关稿。四十五天后,五万二千颗星。三个月后,十四万颗星。OpenRouter的调用量榜上,Hermes第一次把OpenClaw踩在脚下。
然后DeepSeek来了。2026年8月13日,DeepSeek Harness v0.1开源。首日GitHub星标破三万,登顶Hacker News。官方给了一个简洁到傲慢的公式:Model + Harness = Agent。
三个项目,三个神话。OpenClaw讲“铺开”的故事——五十多个消息平台、上万种社区技能。Hermes讲“进化”的故事——Agent自己写技能、自己优化、越用越懂你。DeepSeek Harness讲“拆解”的故事——一切皆插件,连Agent主循环都能换。
听起来都很美。但一个朴素的问题摆在这儿:你那个600张图的活儿,到底该交给谁?
别被“越用越聪明”骗了,它首先得“能用完”
先泼一盆冷水。市场上所有宣称“越用越聪明”的智能体,都得先跨过一个门槛——把活儿干完。
600张图。每张图平均包含3到5道题。总共两千道左右的题目。Agent需要依次完成:识别图片中的文字和公式、理解题目要求、调用推理能力解题、将答案格式化为Markdown。整个过程可能涉及数万次API调用、持续数小时的运行。
你的Agent如果在中途崩溃、遗忘、上下文爆炸、或者把自己绕进死循环——它再“聪明”也没用。
这就引出了第一个认知翻转:开源不等于便宜,便宜不等于能用。
社区里有个广泛流传的说法:Hermes Agent可以在5美元的VPS上运行。这话没错——如果只是跑一个聊天的demo。但面对600张图的吞吐量,5美元VPS的内存和CPU根本扛不住图片解码、OCR调用、上下文管理的并发压力。你自己算一笔账:一张高清截图经过压缩后大概200KB,600张就是120MB。Agent每处理一张图,需要把图片加载进内存、调用视觉模型识别、把识别结果塞进上下文、然后执行推理。内存占用会像雪崩一样往上滚。
OpenClaw那边更惨。2026年2月曝出过一波高危漏洞,13.5万个实例裸奔在外网。技能市场里扫出300多个恶意技能。你让它在后台跑几个小时处理你的敏感数据——你敢吗?
DeepSeek Harness倒是新,但开发者预览版v0.1的成熟度摆在那儿。它“一切皆插件”的理念听起来很酷,但你要处理600张图,得自己组合插件、自己调试依赖、自己处理异常——等于把框架的工程债务转嫁给了你。
事情没那么简单。 选Agent不是在选“最好的”,是在选“最能扛住你最坏那个任务的”。
记忆不是越多越好——Hermes的反常识设计
Hermes Agent最反直觉的设计,是主动限制记忆容量。
大多数AI产品在拼命加上下文窗口——从4K到32K到200K到1M。Hermes反着来。它的常驻记忆被限制在不到3600个字符。MEMORY.md上限2200字符,USER.md上限1375字符。
设计者的逻辑很简单:对大模型来说,少量精准的信息比大量模糊的噪音有用得多。
Hermes把记忆拆成四层。第一层是常驻提示,就是那三千多个字符的核心上下文。第二层是会话归档,所有对话完整写入SQLite数据库,支持全文检索,需要时只提取相关部分,不把整个历史塞进去。第三层是技能文件库——任务完成后自动生成结构化的Markdown技能文件,记录完整操作流程。第四层是用户画像,通过Honcho系统持续完善对你的理解。
这套设计的精髓在于:它不追求“记住一切”,追求“记住该记住的”。
对于600张图的任务,这意味着什么?意味着Agent不会因为前300张图的对话记录撑爆上下文而卡死。每处理完一批题目,关键信息被压缩成技能和摘要存下来,上下文被清空,下一批从头开始但带着“经验”。
社区有人做过实测:Hermes处理完十几个GitHub Issue的分类后,自动往技能目录里写了一个技能文件。下次再处理类似任务,直接调用自己写的技能,不再从头推理。
对比一下OpenClaw。早期版本被大量吐槽“会话结束即失忆、记忆混乱”。后来虽然加了SQLite加QMD双引擎补救,但自修改工作流这一层始终没做——进化主要靠人写插件。
OpenClaw铺得开,Hermes扎得深。前者是“别人写好你拿来用”的技能市场逻辑,后者是“写技能这件事它自己干”的进化逻辑。
但Hermes这套也有硬伤。技能懒加载虽然省token——社区说法是“只有OpenClaw的二十分之一”——但首次遇到全新类型的任务时,它没有现成技能可调用,还得靠通用推理硬撑。而且记忆调优、技能编写、MCP配置、网关开关,每一层都让开发者踩坑。
铺得开和扎得深——OpenClaw的广度陷阱
OpenClaw的野心不是做一个聪明的Agent,是做一个能接入一切的Agent操作系统。
微信、飞书、钉钉、WhatsApp、Discord、Slack、iMessage、Signal——全接。Gateway跑在18789端口统一收消息。ClawHub技能市场做到万级规模,邮件、日历、浏览器自动化、Home Assistant全有。多账号、多智能体编排、企业级权限、故障转移——天生自带。
这套架构对“铺开”场景是降维打击。你要一个能同时在微信和Slack里干活、能调上万种现成技能、能支持团队协作的智能体——OpenClaw是目前唯一的选择。
但代价是什么?
代价是每个技能的深度不够。 一个技能市场有上万种技能,意味着大部分技能是社区贡献的“半成品”。你指望它们稳定处理600张图的复杂流程?大概率翻车。而且OpenClaw的核心是“异步消息处理管道”,不是“带学习能力的推理引擎”。它的设计目标是高并发、多任务调度,不是单任务的深度进化。
更致命的是安全。2026年2月那波漏洞曝光后,安全社区对OpenClaw的信任打了折扣。本地部署虽然保护了数据隐私,但服务器实例的补丁管理、社区分叉中的恶意代码审查——这些负担全落在你身上。
这就产生了一个怪圈: OpenClaw最适合的场景是“需要广覆盖、多接入、团队协作”的企业级应用。但企业级应用对安全性和稳定性的要求恰恰最高。而OpenClaw的架构和社区治理,目前还撑不起这个信任。
Vellum的“八种记忆”——是解决方案还是新问题?
Vellum在四个框架里最特殊。它既不是纯粹的开源自托管(虽然代码在GitHub上MIT开源),也不是纯粹的云服务。
它的卖点是“八种不同类型的记忆”: episodic、semantic、procedural、emotional、prospective、behavioral、narrative、shared。每种记忆有自己的陈旧窗口、混合稠密加稀疏检索、按用户和按渠道隔离。身份信息存在SOUL.md里,助手在入职期间观察你的沟通方式,自己写人格文件。每小时重新读一次笔记,找未完成或快到期的任务,主动给你发消息。
听起来很高级。但你把“八种记忆”翻译成人话——就是记忆被拆成了八个抽屉,每个抽屉装不同类型的东西,每个抽屉有各自的过期时间和管理规则。
对开发者来说,这意味着什么?意味着你需要理解八种记忆的运作机制才能用好它。意味着调试时不知道问题出在 episodic 还是 semantic 还是 procedural——你得挨个查。意味着跨任务迁移时,八个抽屉的数据同步是个工程噩梦。
Vellum的定位是“个人智能平台”——Mac原生应用、桌面控制、邮件日历管理、浏览器自动化。它更适合“一个人日常使用”的场景,而不是“600张图批处理”的工业化任务。
社区对比指南里有一句话很精准:选Vellum,如果“持久记忆、凭证隔离、原生桌面控制”是你的优先项。反过来,如果优先项是“把600张图处理完不出错”——Vellum可能不是第一选择。
DeepSeek Harness的插件野心——理想很丰满
DeepSeek Harness是2026年8月才杀入战局的新玩家。但它一上来就摆出了颠覆者的姿态。
“一切皆插件”。模型、工具、技能、会话、沙箱、存储、循环、调度、UI——所有Agent能力全是插件,全可替换。底层是Cordis微内核——DeepSeek把这份源码拷进自己仓库,改了18处。启动清单只有129行,Agent主循环和计时器插件的格式一模一样,没有任何零件焊死。
官方公式写得很直白:Model + Harness = Agent。模型负责思考,Harness负责模型之外的所有工程化工作——读文件、调工具、管上下文、执行命令。
更有意思的是,发布一周后RC.8版本就把Claude Code和Codex收编成了子代理。竞对的产品,变成自己的零件。这招够狠——你不是纠结用Claude还是用DeepSeek吗?Harness让你两个都用,在同一个工作流里调度。
DeepSeek Harness对长周期任务的支持也做了专门设计:项目管理、长周期任务协作、多智能体编排、上下文管理、联网检索、外部技能调用——全部内置。甚至提供了多种机制来处理长程任务,不把所有长任务都塞进同一种Loop。
但是。 但是很大。
开发者预览版v0.1。这四个字意味着什么?意味着API不稳定、文档不完善、社区生态为零、坑多得数不过来。首日三万星是社区对DeepSeek品牌的信任投票,不是对产品成熟度的认证。
对于600张图这种任务,你用Harness等于在用一个刚满月的框架跑生产级负载。插件之间依赖怎么管?异常怎么恢复?断点续传怎么做?这些在“一切皆插件”的架构下,全得你自己摸索。
成本真相:开源Agent的隐藏账单
很多人选开源Agent是冲着“免费”去的。但开源不等于免费——这句话在AI Agent领域尤其尖锐。
先看显性成本。OpenClaw和Hermes Agent本身不收钱,但你要用自己的API Key。处理600张图,假设每张图调用一次视觉模型加一次推理模型,总共1200次调用。用DeepSeek V4 Flash,单次成本约0.0005美元,总共0.6美元。用GPT-4级别的模型,单次成本翻几十倍——几十美元打底。
再看隐性成本。Hermes Agent的token消耗确实低——技能懒加载、记忆按需检索,社区实测只有OpenClaw的二十分之一。但低消耗的前提是你愿意花时间调优记忆配置、编写技能文件、调试MCP网关。你的时间不是钱吗?
OpenClaw那边更狠。技能市场有上万种现成技能,看起来省事。但你要从一万个社区贡献的半成品里找出能稳定跑通的——这本身就是个体力活。而且OpenClaw的进程隔离模型内存占用高,实测比Hermes高出72.7%。多出来的服务器成本谁出?
Vellum走的是另一个路子。代码开源,但推荐你用他们的托管服务。托管意味着你不用自己折腾部署,但意味着你要付费——而且被锁定在他们的平台上。
DeepSeek Harness目前最便宜——开源刚满月,连商业化路径都没想好。但“便宜”是因为还没开始收割。等生态建起来、企业用户进来了,价格还会这么友好吗?
真相是:开源Agent的“免费”,是把成本从“买软件”转移到了“买算力+买时间+买运维能力”上。 你省下了软件授权费,但可能多花了十倍的API调用费、调试时间、服务器租金。
一个让所有Agent都尴尬的实验
说了这么多理论对比,来看一个真实存在的实验数据。
2026年8月,一篇题为《LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks》的论文发布,对多个主流Agent框架在长周期任务上的表现做了基准测试。Hermes Agent的综合得分28.1。具体来看:文档处理47.1分、游戏任务33.3分、网页交互26.7分、日常操作50.0分、软件开发30.8分、空间推理8.3分。
8.3分。空间推理。满分100。
这意味着什么?意味着一个号称“越用越聪明”的Agent,在面对需要理解空间关系、视觉布局、几何图形的任务时,几乎等于瞎了。
回到开头那个场景——600张高中数学卷子的截图。几何题占多少?至少三分之一。如果Agent的空间推理能力只有8.3分,那些几何题它能做对几道?
这不是某个框架的问题,这是整个行业的集体盲区。大家都在卷上下文长度、卷记忆系统、卷技能进化——但没人认真回答一个最基本的问题:Agent到底能不能“看懂”它处理的东西?
视觉模型能识别图片中的文字和图形,但识别不等于理解。一道几何证明题,识别出“三角形ABC”和“角A等于角B”只是第一步。要证明两个三角形全等,需要理解空间关系、推理逻辑链条、应用定理——这些恰恰是8.3分所暴露的短板。
更尴尬的是,大多数Agent框架处理图片的方式是“看一眼就忘”。Hermes的架构里,图片被当作“一次性观察”而非“持久化记忆”。这意味着每张图被识别一次后,识别结果就被丢进上下文,然后被后续的对话淹没。如果需要回头检查某张图的细节——抱歉,找不到了。
DeepSeek Harness倒是有个“土法视觉”的兜底方案:对于不支持图像输入的模型,调用OCR、颜色统计、像素扫描等工具,把图片拆成结构化信息再喂给文本模型。但这也只能解决“识别”,解决不了“理解”。
所以回到最初那个问题:600张图,到底该交给谁?
答案是——谁也别全信。
Hermes适合需要“越用越聪明”的长期个人助理场景,但处理大批量图片时记忆系统会承压。OpenClaw适合需要广覆盖、多接入的团队协作场景,但安全性和单任务深度是短板。Vellum适合追求开箱即用的个人用户,但八种记忆的学习成本和托管锁定的代价不低。DeepSeek Harness最有想象力——插件化架构理论上可以拼出任何想要的工作流——但刚满月的产品成熟度让人捏把汗。
真正能扛住600张图的任务,可能不是一个现成的框架,而是一个用Harness拼出来的、专为此场景定制的工作流——视觉模型做OCR、推理模型做解题、记忆系统做进度管理、技能系统做流程复用、子代理做并行处理。每一块用最合适的插件,拼成一个完整的流水线。
但这就回到了原点——你不是来找“手动创建工作流”的解决方案的,你是来找“托管服务”的【?†L】。
这恰恰是整个开源Agent生态最拧巴的地方:所有框架都在宣传“自动化”“智能化”“越用越聪明”,但当你真的扔给它一个足够复杂、足够长周期的任务时,它需要的不是一个聪明的Agent,而是一个不会忘记自己在干什么、不会中途崩溃、不会算到一半从头开始的工程系统。
而工程系统,从来不是靠“聪明”堆出来的。
论文里那个8.3分,才是整个行业最诚实的答案。