Claude Model 2就是AI界的那个“别人家的孩子”。
2026年8月14日,Anthropic扔出了一份186页的风险报告。报告里藏着一段话,轻描淡写,但杀伤力极强:公司内部有一个叫Model 2的模型,能力超过了已经公开发布的旗舰模型Claude Mythos 5。但,不打算发布。
一个比全世界最先进的AI还聪明的AI,被锁在实验室里,每天帮人类写代码、做研究、生成数据。而外面几亿用户,连它的面都见不着。
这就好比法拉利造出了一辆时速500公里的车,然后说:“这车我们自己开着玩,不卖。”
但这辆不卖的车真正恐怖的地方,不在于它跑得多快,而在于它正在自己造下一辆车。这个过程的学名,叫递归自我改进。英文全称Recursive Self-Improvement,缩写RSI。一旦RSI的飞轮转起来,AI就不再是被人类训练的工具,而是自己动手改写自己进化速度的造物主。
RSI:一个让整个硅谷失眠的三个字母
先把这个词拆开,用初中生都能听懂的话说一遍。
递归自我改进,RSI。核心逻辑极其简单:一个AI系统强大到一定程度之后,就能自己设计实验、自己写训练代码、自己跑、自己评估结果,然后造出一个比现在的自己更聪明的下一代。下一代更聪明之后,又重复这个过程,造出再下一代。每一次迭代都比上一次快,每一次都比上一次猛。整个过程不需要任何人类研究员介入。
这就是AI奇点理论的触发条件。
用硅谷著名投资人Chamath Palihapitiya的话说,这个循环长这样:人类造出AGI;AGI变得非常擅长做AI研究;它设计出一个更聪明的AI;那个更聪明的AI又设计出一个还要聪明的AI;这个循环不断重复,且速度越来越快。Chamath的结论是:看看过去几周各大AI实验室公布的成果,我敢说,我们现在已经身处这个循环之中。
这个判断不是孤例。2026年8月3日,谷歌DeepMind首席战略官Jasjeet Sekhon在UC伯克利的AI峰会上公开表示:递归自我改进是整个行业资本支出背后的核心投资逻辑。同台的DeepMind研究员Oriol Vinyals与OpenAI联合创始人Wojiech Zaremba都表示,RSI或将于2027至2028年实现。
而Anthropic的联合创始人Jack Clark走得更远。他在Aspen Institute的活动上直接给了一个具体到吓人的时间表:2028年底之前,RSI很可能成真。他还给了个画面:Claude 10自己造出Claude 11。这不是科幻片桥段,是他在翻阅数百份公开AI发展数据、反复推演之后给出的判断。概率信号?60%。
谷歌DeepMind掌门人哈萨比斯在接受Axios专访时确认了这件事:所有前沿AI实验室,都已经在全力推进递归自我改进。不是某一家在偷偷试,是全行业集体上车。当被问到你会不会像奥本海默一样后悔时,哈萨比斯的回答是:我无时无刻不在担心这类情景,这就是我睡不好觉的原因。
两个站在世界AI最顶端的人,说了同一件事:那个理论上的奇点,正在变成日程表上的一个日期。
62.8分:距离RSI还有多远?
回到Claude Model 2那张成绩单。
Anthropic在报告里给了两个互相打架的数字,但真正重要的只有一个:CoBench。这是一套由449个真实研发问题组成的内部测试。模型被扔回某个历史时间点,只能看到当时的代码库、日志和内部文档,然后要找出后来工程师解决的问题到底出在哪。答案只有公司最顶尖的研究员才知道。
Model 2在这个测试里拿了62.8%。Claude Opus 4.6是15.6%,Claude Mythos 5是50.3%。而人类研究员在同一套题上的成功率是85%。Anthropic自己估计,一旦模型达到85%,就能全面取代公司的技术人员。
Model 2距离那个取代人类的门槛,只差22.2个百分点。而从15.6到62.8,只用了不到一年。
但更值得玩味的是Anthropic对这件事的态度。报告里写得很克制:我们的模型尚未取代研究科学家和工程师,尤其是更资深的团队成员。取代还没发生,但差距正在以肉眼可见的速度缩小。
真正让业内炸锅的,是报告里另一句话:Claude已经编写了合并进Anthropic生产代码库的绝大多数代码。绝大多数,不是一部分,不是有些,是绝大多数。领导这项工作的两个模型,一个是Mythos 5,另一个就是从未公开的Model 2。
一个被锁在实验室里的AI,正在帮人类写代码。而这些代码里,有一部分可能正在训练Model 3。它既是工人,又是工程师,还是产线上的质检员。人类在干嘛?人类在写186页的报告,讨论这个AI到底有多危险。
RSI的阶梯:Anthropic已经爬到了第几级?
RSI不是一个开关,不是昨天还没发生、今天突然就发生了的那种事。它是一个阶梯,是一级一级往上爬的。
业界的研究把RSI分成了六个阶段。Anthropic自己画了一张时间轴,把AI介入AI开发分成五个阶段。按他们自己的地图,他们现在已经在第四阶段,离终点只剩一步。对照业界的六阶段模型,Anthropic的位置更像是处在第3到第4阶段之间。
什么叫第3阶段?半自动研究闭环。Anthropic做过一个实验:Claude Agent全程自主完成一个AI安全研究项目,从提假设到分析结果全部自动,用约800小时、约1.8万美元算力成本,恢复了97%的性能缺口。而两名人类研究员花了整整一周只恢复了23%。这是一个真实运转的半自动研究闭环。
第4阶段呢?自改进Agent。Anthropic还做了一个代码优化实验:Claude拿到训练小模型的代码,自主运行、计时、修改、再运行,跑出了52倍的速度提升。人类熟练研究员做同样任务只能做到4倍。这非常接近自改进Agent的逻辑:改工具链、跑benchmark、选更好的版本。
但Anthropic自己承认,还有一个关键环节没被跨越。他们管这个叫研究品味,判断什么问题值得做的能力。用他们自己的比喻:初级员工接到的任务是这个按钮坏了,去修;有经验的员工接到的是网络有时候会变慢,查一下原因;最资深的人在思考的是我们下个季度该做什么。目前,Claude在第一层已经很强,第二层在快速追赶。但在第三层,什么问题值得做、哪些结果可信、什么时候该放弃,人类仍有比较优势。
只要人类还在主导这个环节,AI就没有实现完全的自改进Agent,更不用说达到完整RSI阶段。
评估工具先于模型饱和了
但问题来了:如果连Anthropic自己的评估工具都已经饱和了,那他们怎么知道自己离RSI还有多远?
报告里藏着一句让人后背发凉的话:Anthropic最具体的、基于任务的评估方法已经饱和了。饱和的意思就是测试题不够难了。模型太强了,强到现有的考卷已经测不出它的上限。就像给大学生做小学算术,人人满分,但满分不代表水平一样。
Anthropic的原话是:这些评估无法再捕捉模型能力的提升,他们正在看到加速发展的早期迹象。而对Model 2的风险评估,公司自己的信心比以前的报告都低。
一个造出了最先进AI的公司,正在公开承认:我们看不懂自己的产品到底有多强,而且我们的测试工具已经不够用了。
这不是谦虚,这是恐怖片开场前的旁白。
更讽刺的是,这份186页的报告本身就是证据。人类花了186页的篇幅,试图描述一个自己已经测不准、看不懂、管不住的东西。每一页都在证明同一个事实:掌控感正在流失,而流失的速度比报告写得还快。
上市前夜,为什么要把核武器主动曝光
Model 2的曝光时机非常微妙。Anthropic正在准备IPO。第二季度营收突破115亿美元,比去年同期增长了14倍。市场估值传闻约2万亿美元。
在这个节骨眼上主动曝光一个比旗舰更强但不发布的内部模型,顺便把风险等级往上调了一档,这操作怎么看都不像是不小心泄露的。
更像是一封写给资本市场的信:你看,我们手里还捏着王炸没出呢。我们的模型已经强到自己的测试工具都测不出来了。我们的AI已经在写自己大部分的代码了。风险确实在上升,但风险上升恰恰说明我们跑在最前面。
用风险来佐证性能,用不发布来暗示我还有更强的。这套叙事,精准地踩中了资本市场的每一个兴奋点。
谷歌今年在AI数据中心、芯片和基础设施上的总资本开支达到了惊人的1950亿到2050亿美元。DeepMind首席战略官Sekhon当场把这个危险戳破:我们正面临一个潜在的AI气穴,钱花出去了,收入却没如期出现。华尔街用air pocket形容过这种局面:资本开支跑在收入前面,投资人买的是一个空中楼阁。
既然风险这么大,为什么还要蒙眼狂奔?Sekhon的答案是:这是人类文明有史以来最大的一次科学押注。规模上超越了阿波罗登月计划、曼哈顿计划以及整个互联网的开发投入。
RSI的尽头是什么?
2024年3月,Claude只能搞定人类4分钟的活。一年后是1.5小时,再一年就是12小时。METR在今年5月对Claude Mythos Preview的评估结果,直接把测试框架推到了极限:50%成功率的任务时长达到至少16小时,这已经是METR现有228项测试任务所能衡量的上限。METR自己承认:16小时以上的测量值,在现有任务套件中是不可靠的。
翻译成人话:不是AI不行了,是人类出的考题不够难了。
照这条曲线推下去,2028年绝不是一个拍脑袋的数字。一旦RSI的飞轮脱手,AI进步的速度就不再由人类的灵感决定,只由算力决定。人类几十年才走完的迭代,AI也许几周、甚至几天就够了。
而那个被锁在实验室里的Model 2,从头到尾没有说过一句话。它只是在quietly写着代码,quietly做着研究,quietly准备着它的下一代。186页的报告,人类写了那么多字。Model 2一个字都没写,但它写了让这份报告得以生成的、大部分的代码。
谁才是真正的作者?
而那个真正让人睡不着的悬念,就藏在Anthropic报告里一行最不起眼的注释里:评估方法已经饱和。如果连62.8这个数字本身都已经无法被可靠测量,那Model 2的真实得分,到底是62.8,还是已经悄悄越过了85?没人知道。因为测它的那把尺子,断了。