文件系统突然爆火背后,AI智能体正在重新定义个人计算


AI圈突然集体吹捧文件系统,连数据库公司出来的人都觉得这事既好笑又有道理。但文件系统不是要干掉数据库,它只是用最土的办法解决了AI最头疼的健忘问题。而且这事背后藏着个人计算的本质回归。

文件系统突然火了

你要是最近半年关注过AI智能体领域,肯定注意到一件怪事:

LlamaIndex发了一篇文章,标题就叫"文件就是你所需要的一切"。
LangChain专门写了博客,讲智能体怎么拿文件系统做上下文工程。
Oracle,对,就是那个大家觉得已经老掉牙的Oracle,居然也发了一篇对比文件系统和数据库谁更适合当智能体记忆的文章。
Dan Abramov在写一个基于AT协议的社会化文件系统。
还有人在搞云盘产品,理由特别直接,AI智能体就想要POSIX文件系统。

LlamaIndex的Jerry Liu说了句特别直白的话。他说我们正在从一个智能体配几百个工具的世界,转向一个智能体只配文件系统加上五到十个工具的世界。就这些。文件系统、代码解释器、网络访问。他说这么一套组合的通用性,不会比配一百多个MCP工具的智能体差,甚至可能更强。

卡帕西Karpathy也说过一个让我一直记着的观察:他说Claude Code能成,是因为它跑在你自己的电脑上,用的是你自己的环境、你自己的数据、你自己的上下文。它不是一个你要去访问的网站,它是一个住在你机器里的小精灵。
Karpathy说OpenAI在这件事上想错了,他们把精力放在容器化部署上,放在从ChatGPT里编排云环境,结果忽略了最简单的东西,就是直接跑在localhost上。

这些东西之所以在商业上重要,原因特别直白。现在AI真正的使用场景,大头就是写代码的智能体。Anthropic据说快要盈利了,其中很大一块收入来自Claude Code,就是一个命令行工具。不是一个聊天机器人。是一个在你文件系统里读文件写文件的工具。

上下文窗口根本不是记忆

我觉得大部分讨论都漏掉了更深层的东西。

人类意义上的记忆,是我们怎么运转的基础。我们做决定的时候不会把自己整个人生重新读一遍。我们有长期存储,有选择性回忆,有能力忘掉不重要的东西,把重要的翻出来。大模型的上下文窗口跟这些一点都不沾边。它更像一块白板,而且总有人在擦。

你要是用Claude Code做过真实项目,肯定体验过那种恐惧。看着那个"剩余上下文直到自动压缩"的提示越来越近。你整个对话,智能体对你的代码库积累的所有理解,你的偏好,你做过的决定,全部要被压缩掉或者直接丢掉。

文件系统解决这个问题的方式,土得让人想笑。写下来。放到文件里。需要的时候再读回来。
Claude的CLAUDE.md文件给智能体提供了关于你项目的持久上下文。
Cursor把历史聊天记录存成可搜索的文件。
有人在写aboutme.md文件,这东西特别好玩,它就是一个可移植的身份描述文件,任何智能体都能读,里面写你的偏好、你的技能、你的工作风格,全部放在一个文件里,在不同应用之间随便搬,不需要任何人去协调API。

不过事情可能没那么简单。

ETH Zürich最近发了一篇论文,专门评估这些仓库级别的上下文文件到底有没有帮到写代码的智能体。结论特别反直觉。在多个智能体和多个模型上测试下来,上下文文件反而降低了任务完成率,同时推理成本增加了百分之二十以上。给了上下文文件的智能体探索范围更广,跑了更多测试,翻了更多文件,但是所有这些"认真"反而让它们迟迟到不了真正需要改的代码那里。这些文件就像一个检查清单,智能体太把清单当回事了。

这个发现听起来像是在拆台。但我觉得它反而让整个事情更清楚了。那篇论文的结论不是"别用上下文文件"。它的结论是,不必要的要求会让任务变得更难,上下文文件应该只描述最核心的必要条件。问题不在于文件系统这个持久化层。问题在于大家把CLAUDE.md当成一份两千字的入职文档来写,而不是当成一个简洁的约束集合。这就引出了下一个问题,标准。

文件格式就是API

现在市面上有CLAUDE.md、AGENTS.md、copilot-instructions.md、.cursorrules,等你读到这篇文章的时候可能又多了五六个。所有人都同意智能体需要基于文件系统的持久化上下文。没人同意这个文件该叫什么名字,里面该写什么。我看到有人在推动统一,这是好事。

Dan Abramov那篇关于社会化文件系统的文章把一件重要的事说得很清楚。他描述了AT Protocol怎么把用户数据当成个人仓库里的文件来处理,这些文件有结构,归用户所有,任何能读懂格式的应用都可以读取。关键的设计选择是,不同的应用不需要对"帖子"是什么达成一致。它们只需要把自己的格式放到独立的命名空间里,用域名来区分,就像Java的包名一样,这样就不会撞车。应用对文件做出反应。每个应用的数据库变成了派生数据,也就是所有人文件夹的一个缓存物化视图。

智能体上下文文件这边也存在同样的矛盾。我们不需要把CLAUDE.md、AGENTS.md、copilot-instructions.md合并成一个文件。我们需要它们共存而且不冲突。公平地说,统一化确实在发生。Anthropic发布了Agent Skills这个开放标准,是一个SKILL.md格式,微软、OpenAI、Atlassian、GitHub、Cursor都已经采用了。你在Claude Code里写的一个技能,在Codex里能用,在Copilot里也能用。文件格式本身就是API。

NanoClaw这个轻量级个人AI助手框架把这个思路推到了极致。它不搞不断膨胀的功能集,而是用"技能优先于功能"的模式。想要支持Telegram?没有Telegram模块。有一个/add-telegram技能,本质上就是一个markdown文件,教Claude Code怎么重写你的安装配置来集成Telegram。技能就是文件。它们可移植、可审计、可组合。不需要MCP服务器。不需要浏览插件市场。就一个文件夹,里面放个SKILL.md就完了。

这就是不需要协调的互操作性。我要把这句话说清楚,因为这是一个很强的论断。在技术行业,让两个竞争产品一起工作,通常要么需要一个花好几年才能批准的形式化标准,要么需要一个有统治力的平台来强制兼容。文件系统把这两条路都绕过去了。如果两个应用都能读markdown,它们就能共享上下文。如果它们都懂SKILL.md格式,它们就能共享能力。没人需要签合作协议。没人需要去参加标准组织的会议。文件格式自己就把协调工作做了。

瓶颈转移了

基础设施领域有一个有用的类比。传统的数据架构设计建立在"存储是瓶颈"这个假设之上。CPU等着从内存或者硬盘拿数据,计算本质上是对存储提供的东西做出反应。但是当算力增长速度超过了存储I/O,范式就变了。行业转向了存储和计算分离,让两边独立扩展,结果就出现了S3加临时计算集群这种架构。瓶颈移动了,一切围绕着新的约束重新组织。

AI智能体这边也在发生类似的事情。瓶颈不是模型能力,也不是算力。瓶颈是上下文。模型已经够聪明了。它们只是健忘。而文件系统,虽然简单得不像话,在智能体运行的那个精确位置,也就是开发者的机器上,在它自己的环境里,在数据已经存在的地方,管理持久化上下文的效果好得惊人。

你已经在用图了只不过你不知道

我得承认这里有一个矛盾。有人在推特上开玩笑说,你们这些说智能体不需要图的人,一边用着文件系统,一边否认自己在用图。这句话说得还真没错。文件系统就是一个树形结构。目录、子目录、文件,本质上就是一个有向无环图。你的智能体执行ls、grep、读文件、顺着引用找到另一个文件,所有这些操作都是在遍历一个图。

Oracle那篇文章里的Richmond做了一个我见过最犀利的区分。文件系统作为接口赢了,数据库作为底层存储赢了。
一旦你需要并发访问、需要大规模语义搜索、需要去重、需要按新鲜度加权,你最后肯定会自己建索引。说白了,那不就是个数据库嘛。

我在Weaviate工作过,我可以告诉你这不是二选一的问题。文件接口强大是因为它通用,而且大模型已经天然理解它。数据库底层强大是因为它能在事情变复杂的时候提供你需要的保障。有意思的未来不是文件打数据库。是文件作为人和智能体交互的接口,背后根据具体场景配什么底层存储都行。

这事说到底跟个人计算有关

最后说说我真正的看法,我觉得大家一直在绕圈子没说透的那件事。

文件系统可以重新定义AI时代个人计算到底意味着什么。

不是在"一切都跑在本地"那个意义上,虽然可能也沾点边。是在这个意义上,你的数据、你的上下文、你的偏好、你的技能、你的记忆,所有这些都以一种你拥有的格式存在,任何智能体都能读,不会被锁在某个特定的应用里面。你的aboutme.md文件今天能在你的OpenClaw或者NanoClaw上用,明天出来的新东西也能用。你的技能文件是可移植的。你的项目上下文在不同工具之间保持一致。

这就是个人计算本该有的样子,在一切都搬进围墙花园式的SaaS应用和专有数据库之前的样子。文件是最原始的开放协议。现在AI智能体正在变成人跟计算机交互的主要界面,文件就变成了那个让互操作性成为可能的层,让你可以切换工具、组合工作流、在不同应用之间保持连续性,而且不需要经过任何人的许可。

我承认这有点理想主义。开放格式的历史上,纸上赢了实际上输了的例子比比皆是。公司有强烈的动机把自己的上下文文件做得跟别人"刚好"不一样,让切换成本一直高着。我们现在已经有CLAUDE.md、AGENTS.md、.cursorrules共存而不是一个统一格式,这事本身就说明碎片化是常态而不是例外。ETH Zürich那篇论文也提醒我们,就算格式存在,写好上下文文件比听起来难多了。大多数人会写出糟糕的上下文文件,而糟糕的上下文文件显然比没有更糟糕。

但我总是想起Dan Abramov写的另一句话。他说我们的记忆、我们的想法、我们的设计,应该比我们用来创造它们的软件活得更久。这不是一个技术论点。这是一个价值观论点。而文件系统,虽然老土虽然简单,恰好是承载这个价值观最合适的东西。不是因为它是最好的技术。而是因为它是那个已经属于你的技术。

总结:AI圈追捧文件系统,本质是因为它用最土的方式解决了上下文健忘。文件系统不是要取代数据库,而是重新定义了个人计算的所有权边界。