太狠了!Meta用最土的Markdown+Cron做智能体,直接取代了100人工程师团队

一群AI智能体干翻了100个资深工程师组成的团队,而且干得“非常轻松、极其容易”!

这话不是科幻小说的桥段,是Meta首席AI官 Alexandr Wang 在YC创业学校2026舞台上亲口说的。台下坐着几千个创业者,技术管理层听完直接沉默了。但真正让人后背发凉的,不是100个人被比下去这件事本身。

Meta内部的秘密武器,听起来像是一个技术笑话。

Markdown文件、cron定时任务、目标、指标、数据,就这几样东西。没有外星架构,没有神秘算法,没有花哨的数据库。一群AI智能体用最朴素的工具,干出了百人团队的活。

这就怪了。工具越简单,产出反而越高,对吗?


100个人输给了几个文本文件

Meta这套智能体系统的核心操作是:每个智能体把记忆和状态写成Markdown文件,用Unix系统自带的cron定时器在夜间触发任务,一轮一轮地跑,跑完自己检查、自己修正、自己迭代。cron定时器是什么概念?就是1970年代Unix系统就有的任务调度工具,比大部分程序员的年龄都大。

传统软件团队干活,靠的是人盯人。产品经理写需求文档,工程师拆任务,测试写用例,主管协调资源,每天站会同步进度。层级越多,信息损耗越大,沟通成本越高。一个需求从提出到上线,中间隔着无数次会议、文档和审批。

Meta的做法把中间环节全砍了。智能体拿到目标,自己规划、自己执行、自己验证,不需要人盯着。一轮跑不通,下一轮自动重试,直到指标亮绿灯。

但是,这里有一个被大多数人忽略的前提。

这套系统只在“特定任务”上超过了100人团队。什么叫特定任务?就是那些成功标准可以被精确量化、可以被机器自动验证的工作。代码合并通过率、测试覆盖率、响应延迟、错误率,这类东西可以写成自动化测试脚本,智能体跑一遍就知道过没过。

你让智能体去处理“把产品做得更好用”这种需求试试?什么叫“更好用”?谁来定义?怎么验证?

这就是争议的焦点。有网友直接开喷:现实最难的就是定义好需求和找对指标,你啥都定义好了,这不是废话吗。


评估体系才是真正的老板

Alexandr Wang 反复强调一个反直觉的判断:让智能体群超过100个工程师的,不是模型有多聪明,而是评估系统有多严密。

换句话说,模型本身不是决定因素。评估体系才是。

传统做法是程序员写提示词,祈祷模型别犯错。Meta的做法是把业务目标翻译成机器能自动验证的打分器。模型交卷,系统自动跑测试、算指标、标记坏味道,通不过就打回重做。人不负责盯梢,指标本身充当监工。

这套逻辑可以类比成考试。你不需要一个老师24小时盯着学生写作业,你只需要一套足够好的试卷和评分标准。学生做完自动批改,错了就重来,对了就过关。试卷的质量决定了学习的效果。

2026年亚马逊的教训从反面证明了这一点。亚马逊内部曾经搞过一个叫KiroRank的排行榜,按工程师消耗的Token量排名。加上公司下了硬指标要求八成以上员工每周必须用AI,员工立刻开始“刷Token”:派Agent去干根本没必要的活,把Token烧成排名,再把排名内化成职场安全感。最后亚马逊高级副总裁Dave Treadwell坐不住了,公开呼吁“不要为了用AI而用AI”,榜单随即被下线,新指标换成了“标准化部署量”,衡量工程师到底有没有交付出真正有用的代码。

经济学里有个古德哈特定律:当一个指标变成目标,它就不再是一个好指标。

评估体系的设计质量,直接决定了智能体群的产出方向。指标设计错了,智能体只会更高效地做错事。亚马逊的Token排行榜就是一个活生生的例子,指标一歪,行为立刻扭曲。


在反馈循环里烧掉1000倍Token

Meta智能体群能持续运转的另一个秘密,很多人没注意到:它不在乎单次调用的成本。

高盛2026年5月发布的报告《Decoding the Agentic Economy》给出了一组数据:在Agentic模式下,模型需要不断进行“思考、检索、调用工具、重新读取完整上下文”的循环,Token消耗量达到普通问答模式的1000倍。斯坦福大学和MIT的联合研究也证实了同样的数量级,Agentic编码任务的输入Token消耗量是标准代码问答的约1000倍,原因是智能体在执行每个动作之前都要重新读取完整的对话历史。

普通用户用AI抠抠搜搜,一次调用恨不得掰成两半花。Meta的思路完全反过来:宁可在后台多烧1000倍Token,让智能体不断自查、对跑、互相对抗验证,直到把确定性的业务结果跑出来。

Token的成本是死的,但换来的是一套永不熄火的流水线。

但是,这套打法有个前提条件。你得先有清晰的评估体系。没有评估体系的Agentic循环,只会更自信地烧钱。36氪2026年6月报道过一个案例:有公司给全员开通Claude授权却忘了设上限,一个月烧掉5亿美元,其中相当大一块是员工反复撞上报错、一遍遍手动点重试点出来的。米哈游的技术负责人也提到,有员工为了做一个项目搭了几十个Agent协作,一晚上烧掉200万人民币的Token。

烧钱本身不产生价值,烧钱方向对不对,取决于评估体系有没有把反馈闭环焊死。

这就怪了。同一个工具,有人用它替代100个工程师,有人用它把账单炸上天,差距在哪里?


越朴素越皮实,Markdown比数据库好用

Meta智能体的记忆系统没有用向量数据库,没有用图数据库,没有用任何花哨的存储方案。就是Markdown文件。

一个文本文件,人可以直接打开看,智能体也可以直接读写。持久化记忆存成Markdown,上下文不会因为格式转换而丢失,调试的时候人也能看懂智能体到底记住了什么。

调度系统用的是cron定时器。服务器自带的,零配置,零依赖,跑了几十年从来没出过大问题。夜间触发任务,白天人来检查结果,节奏清晰。

把脚手架做得越轻、越朴素,系统反而越皮实、越不容易出现上下文崩塌。

这跟主流AI圈的风气完全相反。2025年到2026年,各种Agent框架层出不穷,LangChain、AutoGen、CrewAI,每一个都号称能帮你搭建复杂的多智能体系统。但Meta的选择是:不要框架,要基础设施。Markdown是基础设施,cron是基础设施,框架是抽象层。抽象层越多,出问题的环节越多。

一位网友在评论中说得一针见血:“正确的智能体循环不只是多调几次模型,而是把触发条件、可验证的done和失败收据写进循环外。否则循环只会更自信地烧额度。”


技术领袖的新杠杆是什么

过去一个技术负责人的天花板,取决于他能带多少人开会、协调多少跨部门利益、管理多大的团队。

现在这个逻辑正在被改写。Alexandr Wang 从Scale AI带过来的核心方法论是“评估优先”:在让智能体动手写第一行代码之前,先写出“怎么判断它做对了”的自动化测试脚本。Scale AI的整个商业模式就建立在让AI系统的产出可衡量、可追责的基础上,这套思维直接迁移到了Meta的智能体系统里。

未来的技术领袖,唯一的生产力杠杆在于:你能不能把复杂的业务目标,重述成一个连AI都能看得懂的自动化考卷。

这件事对工程师群体的冲击是结构性的。只会接单写代码的人,价值在被快速压缩。能定义目标、设计评估、设定权限红线的人,手里的工具不再是一个编辑器,而是一支随时可以出动的智能体蜂群。

但是,这里有一个必须说清楚的事实。Meta的案例目前还停留在内部描述阶段,没有公开的基准测试数据来验证“100个工程师”这个对比的具体含义。任务类型是什么?时间窗口多长?评估标准怎么定的?这些关键参数都没有披露。有网友直接质疑:“只要你把黎曼猜想的证明告诉了agent,那么他就能远远超越和取代这100个共同证明黎曼猜想的数学家”。话糙理不糙。

定义一个可以被机器验证的好指标,本身可能就是最难的那部分工作。Alexandr Wang 说的“非常轻松、极其容易”,指的是智能体执行循环的容易,不是设计循环的容易。


控制面正在搬家

这场变化最深层的影响,不在于100个工程师会不会被替代,而在于软件系统的控制面正在从人的手里,搬到评估体系里。

以前老板说“把这个功能做好”,产品、研发和测试三个角色把这句话层层翻译成人能执行的任务。翻译过程中每一步都掺杂人的判断、偏好和妥协。现在如果目标、验收标准和约束条件都能写成机器可验证的评估脚本,本质上就是在做一件全新的事:把人的判断固化成机器的规则。

那些规则的质量,决定了整个系统的上限。

回到开头那个问题:工具越简单,产出反而越高,对吗?对,但有个前提。简单的是脚手架,不简单的是脚手架下面那套评估逻辑。Markdown文件和cron定时器只是表层,真正在干活的是那套能让智能体自我纠错、自动迭代的反馈闭环。

当100个人的搬砖产能被一套定时器和文本文件轻松取代,只会接单写代码的时代正在落幕。掌控评估体系的人,手里握着的已经不再是一个工具,而是一家随时可以原地起跳的虚拟跨国公司。

至于那“100个工程师”的具体任务到底是什么,Meta没有说。这个数字背后,藏着什么还没被公开的东西?

FDE总结

提炼 3 个可直接抄作业的工业级认知:

1. 别再迷恋复杂的框架:Agent 的状态用结构化 Markdown 存储,调度用最基础的系统定时器(Cron Jobs),越简单的架构越抗腐烂;
2. 评估体系(Evals)先于代码:在让 Agent 动手写第一行代码之前,先写出“怎么判断它做对了”的自动化测试脚本。没有裁判,蜂群就会在云端变成失控的噪声发生器;
3. 人类的职责位移:从“亲手搬砖”,上移到“定义目标、制定规则、设定不可逆的权限红线”。

大家觉得在未来的软件团队里,一个懂得写自动化 Evals 调动 Agent 的架构师,在产出上能顶替多少个传统的普通程序员?

在 Meta,你需要构建“Markdown files, cron jobs, goal, metrics, data.”来达成 agentic loop,也要持续优化 loop 运行期间的稳定性。 在开源社区,你只需要给 loopx environment 和 goal,即可达成。