智能体记忆管理转向主动遗忘:OpenAI用“梦境”后台整理

你的AI助手在悄悄“做梦”,可别误以为只是代码抽风——这招能让它记性翻倍。

AI长期运行后记忆衰退,重复、矛盾数据堆满仓库。OpenAI用“梦境”后台整理,事实召回从41.5%提到82.8%。Anthropic、Google也跟进。

核心理念:主动清理比无限扩容更管用。

长期跑着的AI助手,记性会越来越烂。这不是它偷懒,是你跟它聊得越久,它脑子里塞的东西就越多。每次对话,新信息不断往里写,旧信息从不清理。到了第三周,同一个偏好存了四遍。

上个月的决策还在跟这个月的决策打架。每次搜索都得在一堆半旧不新的重复记录里打分排序。存储越大,召回越慢,这事放在人身上叫老年痴呆,放在AI身上叫记忆退化。

那帮搞AI的人急了。他们翻了一圈生物课本和生活常识,发现人类大脑白天一直录,晚上睡觉重新整理。重要的留下,不重要的淡掉。于是他们给AI也装了这功能,取名叫“梦境”。

记忆变差不是因为存得少,而是因为存得太乱

多数人以为AI记性差是仓库不够大。真实情况恰恰相反:仓库越大,乱得越离谱。里斯本那条三月份写进去,柏林那条今天写进来,两条都躺在那,下次问住哪,两条都蹦出来。

提取记忆的时候,模型只看当前对话窗口和检索到的几条旧记录。它不知道仓库里还有多少同类项,好比让你从一万张拼图里判断整幅画,你只能看到手里那三块。这个盲区造成重复、矛盾、过时条目共存。

这个结构缺陷在传统软件里早就被解决了。没有哪个正经数据库会在写入时做冲突检测,那太慢。它们都是快速写入,后台再压缩:LSM跑压缩,Postgres跑VACUUM,git跑垃圾回收。AI记忆只做了快速写入,后台清理一直缺席。

梦境就是那个迟到的后台大扫除

梦境是一段定时任务,趁着没有请求排队的时候跑。它干三件具体的事。第一件,合并。把同样事实的不同表述压成一条标准记录。“住里斯本”和“居住在里斯本”合成一条。

第二件,取代。发现新事实覆盖旧事实时,让新的赢。搬柏林之后,旧里斯本被打上“已取代”标记,下次搜索只返回柏林。但旧记录不删除,留着当历史查。

第三件,综合。读完一堆相关条目后提炼一条高阶推论。比如“周一迟到、周二迟到、周三迟到”,综合成“这人早上起不来”。综合出来的新记忆自己也会存进仓库。

这里有个容易搞混的分支。有些系统的“梦境”指把知识压回模型参数,那得重新训练。另一类只改写存储记录,模型不动。现在能上线的都是存储层版本,因为只整理数据不重训,成本低。

OpenAI、Anthropic、Google全在搞,路子各不同

OpenAI在ChatGPT里先搞了。它不检索历史,只维持一份关于你的持续摘要,每次都塞进上下文。这办法快但脆:摘要会随事实积累、过时、矛盾而腐烂。2026年6月,OpenAI重建了维护方式,也叫梦境。后台自动读历史、重写档案,没有保存按钮。

事实还能自己修正时间。七月写“要去新加坡”,八月自动改成“七月去了新加坡”。OpenAI内部报告召回率从41.5%涨到82.8%。这个数字是内部评测,当方向看就行。方向是:最常用的AI产品决定用清理后台,而不是扩窗口。

Anthropic早几周在托管Agent里也装了。面向开发者,定时审查会话和记忆,合并重复、淘汰过时。因为它跑在整个Agent群上,能发现单个Agent注意不到的规律:好几个都犯同一类错,或者都走向同一个工作流。哈维公司报告任务完成率涨了约六倍。

Google走基础设施路线。Gemini Agent平台出Memory Bank,为每个用户身份自动生成长期记忆。它更侧重构建干净仓库,不那么强调激进整理,但目标一样:让记忆随规模扩大仍可用,不让它失控。

2026年的研究论文得出同一个结论

产品背后是一波研究浪潮。Google那篇《语言模型需要睡眠》走参数层,睡眠阶段压实知识,梦境阶段生成合成练习。管用但得训练,暂时留在实验室。

Auto-Dreamer最接近产品。它借鉴认知科学的“快速捕获、慢速巩固”分工,把某块记忆设成只读,检查每条记录和来源,再写一套更紧凑的替换集。全部过程端到端训练。结果在ScienceWorld上拿了7分增益,仓库却比最强基线小了12倍,迁移到新任务也不用重训。

还有两篇专攻遗忘。SCM给模型人类式睡眠和基于价值的遗忘,噪音砍掉约91%,召回不丢。SleepGate针对“主动干扰”——过时条目把正确答案淹没了。它加睡眠周期,给被取代的条目打标签,踢掉死重,合并幸存者。不同团队,同一个结论:记得最好的不是存最多的,是主动忘的。

Mem0的梦有个特别约束:什么都不真销毁

Mem0也做这个功能,也叫Dream。它跑合并、取代、综合三件事,但带着一条别家没有的约束:什么都没真正抹掉。取代时给旧事实打标记,链到新事实,返回只给当前答案,但旧记录还能当历史查。

综合出来的高阶记忆保留指向每个来源的指针。每笔改动都是你可读、可追溯、可撤销的diff,不是静默覆盖。没有审计痕迹的后台改写,不是功能,是丢数据。

这些操作都不跑在热路径上。合并和取代在写入时应用,综合按调度跑,所以实时添加和搜索调用速度不受影响。Mem0生产数据里,中位数项目带着几百条重复或矛盾的记忆,每次调用都被检索计费。Dream每周跑一次Pro版,每天跑企业版,攒够记忆才触发。

还没解决的几个硬骨头

事实变了,旧版本彻底消失还是保留为历史?OpenAI倾向干净重写,Mem0保留痕迹。没人证明哪种召回更好。

综合出来的摘要本身是新记忆,会跟其他记忆抢检索位。太急着整合,召回反而更差。节奏也没定,人脑每晚跑,产品从写入时到每周一次都有。合适间隔肯定看工作量。

但底下那个转变很清晰。好多年里,“让Agent记住更多”就是堆更大仓库和扩上下文窗口。梦境是整个领域在承认:更大的堆不是更好的记忆。最后赢的记忆是越长大越干净的,那正是睡眠替我们干的活。

记忆不是囤出来的,是忘出来的。

只有忘记,才有记得;只有忘记,才有记得的界限,才有注意力的界定。有看不见才会看得见!