2026年7月,Reddit用户HolmeBengt在r/hermesagent社区发布了一篇更新帖,详细披露了他用Hermes Agent搭建的完整个人AI管家系统。这套系统包含28个定时任务(cron jobs)和30多个技能模块,覆盖财务追踪、饮食记录、健康监测、学习审计、写作反馈等生活全场景。帖子获得23.4万次浏览,评论区200多条追问。一个月后,他带着升级方案回来了——这次,记忆问题解决了,商业产品发布了,整个系统的运转逻辑也更清晰了。这套系统的核心架构、关键升级和社区争议,值得拆开来看清楚一个真实运行的个人AI管家长什么样。
Mnemosyne终结了AI失忆症
HolmeBengt在首帖里坦承,长期记忆是当时最大的未解难题。 dreaming(梦境机制)能帮一点忙,但跨会话回忆仍然不稳定。他试过把Obsidian笔记库接进去,但Hermes很少主动调用。周一聊过的事,周四再问,AI一脸茫然——"你是谁,我们在做什么"这种尴尬场面反复出现。
转机来自评论区。三位用户——Worried_Corner_8541、epigrammaticism和SirDomz——分别推荐了Mnemosyne、Honcho和Basic Memory等方案。HolmeBengt选了Mnemosyne,一个月后给出了 verdict:这是他自搭建gateway以来做过的最正确的决定。
Mnemosyne(记忆女神)是一个本地优先、零外部依赖的SQLite记忆层,专为Hermes Agent设计。它用一套BEAM分层架构管理记忆:工作记忆(working memory)处理当前会话的短期信息,情景记忆(episodic memory)压缩存储跨会话的长期事实,草稿本(scratchpad)供临时记录。搜索层面混合了向量相似度(50%)、全文检索FTS5(30%)和重要性评分(20%),查询延迟在亚毫秒级别。
在LongMemEval基准测试中,Mnemosyne的密集检索版本达到了98.9%的Recall@All@5,超过了Hindsight的91.4%。在BEAM端到端问答基准中,Mnemosyne v3在10万条记忆规模下得分65.2%,高于Honcho的63.0%。
安装过程也简单:
HolmeBengt装的是mnemosyne-hermes这个包,不是mnemosyne-memory[all]。前者是Hermes专用插件,直接暴露23个记忆工具(包括remember、recall、sleep、stats等),后者是通用包需要额外配置。
装完后在config.yaml里关掉Hermes自带的MEMORY.md/USER.md系统,让Mnemosyne独占记忆provider位置。注意别用hermes tools disable memory——那会连Mnemosyne注册的23个工具一起禁掉。
效果立竿见影。周一聊过的项目需求,周三换话题讨论了别的,周四回来继续,Hermes能准确回忆周一的上下文。没有"失忆重启",没有"请再描述一遍你的需求"。记忆连续性这个地基打稳了,上面盖什么技能模块才不会塌。
这里有个有趣的细节。
另一位用户thevinialmeida在评论区分享了一个更激进的方案:他把Mem0、Mnemosyne和Honcho三个记忆系统叠在一起用。Mnemosyne当主记忆和知识中枢,Honcho负责推导和梦境生成,Mem0当策展人。所有系统通过MCP协议互联,形成一个蜂巢记忆结构,家庭实验室、个人生活、工具、工作等不同领域映射到不同的agentic记忆分区。
任何其他agent都可以插进来使用这些知识或者贡献新内容。这种架构比HolmeBengt的单记忆provider方案复杂得多,但也展示了社区在记忆层上的创新深度。
MySalary从个人玩具变成了商业产品
首帖里,HolmeBengt提到所有财务数据都跑在一个叫MySalary的自建仪表盘里,托管在他自己的VPS上。一个月后,这个工具商业化发布了。
MySalary现在是一个可自托管的财务仪表盘,集成了Hermes API、Telegram机器人、净资产追踪和每周/每月AI报告功能。用户可以通过Telegram语音或文字告诉AI一笔支出,AI自动分类、记账、生成可视化报表。月底AI会出一份完整的财务审计,告诉你钱花哪儿了、哪类支出超预算、净资产变化趋势如何。
这个转变本身就有意思。一个人先为自己造工具,用熟了、迭代够了,再包装成产品卖给别人。这和下载现成模板然后硬套在自己身上的路径完全相反。HolmeBengt在评论区反复强调:自己从零跟Hermes一起搭出来的工具,比网上下载的现成技能好用十倍。因为每一个功能都是从他真实的财务痛点里长出来的,不是从别人的假设里抄来的。
这里的关键认知是:AI agent的真正价值不在于它有多聪明,而在于它有多了解你。一个通用财务工具知道怎么记账,但它不知道你每个月底看到信用卡账单时的焦虑点在哪里。一个你自己训练出来的AI管家,会记得你上个月说过"不想再看到外卖支出超过餐饮总支出的40%",会在月底自动标记这个比例,会在你即将超支时提前预警。这种个性化不是调几个参数就能实现的,是无数次真实交互中沉淀下来的上下文理解。
饮食追踪有了自己的专用Gateway
首帖里的饮食记录还处在"我打字告诉AI今天吃了啥,尽量精确到克重"的阶段。一个月后,这个流程升级成了专用Gateway。
新的Food Tracker Gateway支持文字输入、照片识别和条形码扫描三种录入方式。AI会自动解析宏量营养素——卡路里、蛋白质、脂肪,甚至镁离子含量——然后交叉比对用户的增肌目标,实时计算当天还剩多少热量和蛋白质额度。iPhone锁屏小组件上直接显示剩余配额,不用打开任何App。
这套系统的核心逻辑是:把"记录"这个动作的摩擦降到几乎为零。拍照比打字快,扫码比拍照快,锁屏小组件比打开App快。每一步都在减少人类偷懒的借口。两个月增肌4公斤 lean mass(瘦体重),数据不会说谎。
但这里有个更深层的洞察。大多数人减肥或增肌失败,不是因为不知道该怎么吃,而是因为记录饮食这件事太麻烦了。打开App、搜索食物、输入克重、确认保存——四步操作,每天重复三次,一周就崩溃了。HolmeBengt的解决方案是把这四步压缩成一步:拍张照片。AI自动识别食物、估算分量、计算营养、更新目标。摩擦系数从4降到1,坚持的概率就从10%升到80%。这不是技术问题,这是行为设计问题。AI在这里扮演的角色不是营养师,而是那个帮你把"好习惯"的启动成本降到最低的助手。
28个Cron任务和30多个技能模块在跑什么
HolmeBengt的系统里,28个cron job(定时任务)和30多个skill(技能模块)构成了自动化骨架。这些任务不是简单的"每天早上8点发一条消息",而是有明确业务逻辑的闭环工作流。
财务方面,MySalary每天自动拉取银行流水、分类记账、检测异常支出。健康方面,Health Bridge App从iPhone的Apple Health读取数据,直接写入Neon PostgreSQL数据库,Hermes通过API查询——没有Shortcuts捷径、没有iCloud中转、没有导出-导入的繁琐流程。学习方面,Study Audit技能每周复盘学习进度,标记未完成的章节,生成下周优先级清单。写作方面,Writing Improvement工具持续分析用户的写作风格,标记重复的口头禅、语气漂移、结构问题,给出渐进式反馈。
模型选择上,HolmeBengt几乎全用DeepSeek V4 Flash,只有视觉任务才上更贵的模型。每月API花费约17美元。有人不信这么便宜,他甩出截图。对比OpenClaw的定价,DeepSeek V4 Flash的输入成本是每百万token 0.14美元,输出0.28美元,而Claude Opus 4.6的输入成本是每百万token 5美元,输出25美元。差距超过17倍。关键洞察是:分类、摘要、数据提取这类cron job根本不需要昂贵的推理模型,Flash级别的小模型完全够用。贵的推理只留给复杂推理任务。
这个成本结构彻底改变了个人AI管家的可行性。以前用Claude Opus跑24/7的agent,一个月要烧掉200到500美元。现在用DeepSeek V4 Flash,同样的工作量不到10美元。17美元一个月的账单,分摊到28个cron job和30多个skill上,每个任务的成本几乎可以忽略不计。这意味着你可以让AI做的事情从"偶尔问个问题"扩展到"持续监控、主动提醒、自动执行"。
安全护栏从第一天就焊死了
有人问他是不是在"raw dogging it"(裸奔)——意思是没有任何安全限制,让AI随便操作。答案恰恰相反:护栏多得像监狱。
Hermes跑在一台专用的Mac Mini M4上,以标准用户权限运行,不是管理员。关键数据没有删除权限,金融账户没有直接访问,邮件系统没有发送端点。Mail Gatekeeper(邮件守门人)的设计原则是:系统里根本不存在send endpoint。Hermes可以读邮件、可以起草回复,但没有任何物理路径能让邮件真正离开这台机器。每封邮件在到达Hermes之前,先经过一个本地Ollama模型的分类过滤——这个本地模型只负责判断"这封邮件该不该给AI看",真正的agentic工作再交给云端DeepSeek V4 Flash处理。
架构分层很清晰:本地模型负责分类和过滤(快速、免费、私密),云端API负责实际代理工作(强大、灵活、可控)。云模型永远碰不到原始邮件内容。Ollama 24/7运行在Mac Mini上,空闲功耗约15瓦,电费可以忽略不计。通过launchd设置为开机自启,TG Pro管理风扇曲线防止长时间推理过热。
这种分层安全架构值得所有个人AI用户借鉴。核心原则是:永远不要让云模型直接接触敏感原始数据。邮件内容、健康数据、财务记录——这些先过一遍本地小模型的过滤和分类,只把脱敏后的摘要或结构化数据送到云端。本地模型虽然能力弱,但做"这封邮件是不是垃圾邮件""这条记录是不是异常支出"这类二分类任务绰绰有余。而且本地运行意味着数据不出境、不上传、不留痕,隐私风险降到零。
社区争议:伪生产力还是真效率
评论区最有价值的讨论集中在几个核心争议点上。
关于"这是不是伪生产力",HolmeBengt的回应很直接:它应该好玩,如果你因此多完成了20%的工作或者少了一些烦心事,那就够了。另一位用户说这是"效率幻觉",他反驳:我每天都在用我自己写的省时间软件。财务报告省下了几小时手动填表的工作。学习审计让我保持 accountability(问责感)。健康教练帮我在两个月内增肌4公斤。这不是幻觉,是数据。
关于Honcho和Mnemosyne的选型争议,有用户指出Honcho声称自己具备学习和推理能力,这在Mnemosyne的检索基准里无法准确衡量。另一位用户回复说,Honcho是一个AI原生的记忆后端,构建和推理丰富的用户与代理模型,提供深度个性化和跨会话上下文;Mnemosyne是一个本地优先、零依赖的SQLite记忆层,提供快速、完全私密的事实存储和回忆,没有任何外部服务。两者定位不同,Honcho重推理,Mnemosyne重检索和隐私。
关于多Profile还是单Profile,HolmeBengt目前仍用一个Profile跑所有技能。有用户建议拆分成多个Profile,每个Profile配独立的Telegram机器人,Hermes能自动创建。他还没切换,打算等当前系统稳定后再说。
关于Writing Improvement工具是否真的在进步,他的诚实回答是:执行层面还需要打磨,但确实能看到语气和风格的渐进变化。它能捕捉到我自己注意不到的模式。但有时候也会完全跑偏,还在积极迭代中。
这里最值得注意的态度是诚实。HolmeBengt没有夸大任何功能,对每个工具的局限性都直言不讳。Writing Improvement会跑偏,MySalary还在根据反馈迭代,多Profile切换还没做。这种"我知道它不完美,但它已经在帮到我"的务实态度,比那些宣称"AI将彻底改变一切"的浮夸宣传可信得多。真正的个人AI管家不是一夜之间建成的,是每周迭代、每月升级、每年重构的持续工程。
新手入坑的六条铁律
基于一个月的全部经验,HolmeBengt给新用户的建议浓缩成六条:
第一,先装Mnemosyne。记忆是所有东西的地基,地基不稳,上面盖什么都不牢靠。
第二,一次只搭一个技能,把它跑顺了再搭下一个。别试图第一天就复制他的30技能套装。
第三,立刻测试。第一次永远不会成功。快速修复、简化、继续。
第四,自己从零搭的工具比下载的现成技能更贴合需求。下载的技能对他来说从来没好用过。
第五,分享你的提示词。社区回馈给你的,远比你付出的多。
第六,从第一天就设置护栏。专用机器、有限权限、没有发送端点。
这六条里没有一条提到"买更好的GPU"或者"换更贵的模型"。核心逻辑是:先解决记忆连续性,再逐步扩展技能,每一步都经过真实使用验证,安全底线从不动摇。
这六条建议的顺序本身就有深意。记忆排第一,因为没记忆的AI就是每次重启的傻子。一次一个技能排第二,因为贪多嚼不烂是新手最大陷阱。立刻测试排第三,因为纸上谈兵在AI领域毫无意义——你写的prompt在模型A上完美运行,在模型B上可能完全跑偏。自己搭工具排第四,因为别人的解决方案解决的是别人的问题。分享排第五,因为开源社区的飞轮效应会让你的投入成倍返还。护栏排第六,因为安全不是可选项,是底线。
17美元月费养出的AI管家,两个月增肌4公斤,还顺手发布了一个商业产品。记忆、财务、健康、学习——全部自动化。
而这套系统的起点,不过是一个Reddit帖子、几条评论建议、和一个愿意动手尝试的人。你的AI管家,可能正藏在你的下一次动手尝试里。