Prime Agent开源框架让AI学会自己改自己,ARC-AGI-3冲上95.5%

AI考了个95.5分,比人类专家还高,但你猜怎么着?出题人慌了。

ARC-AGI-3这个专门用来考AI抽象推理的魔鬼测试,之前把各路大模型按在地上摩擦。GPT-5.6 Sol只有7.8%,Claude Opus 4.8只有1.5%。然后Prime Agent拿着Claude Opus 5跑出了95.5%,比人类专家基线95.4%还高一丢丢。但真正让人后背发凉的不是这个分数,是它怎么拿到的。

你以为AI做题靠智商?它靠的是“不会失忆”

先搞清楚ARC-AGI-3是什么东西。这不是那种背题库就能过的考试。François Chollet搞的这个测试,把AI扔进一个2D像素游戏里,没有说明书,没有教程,全靠自己摸索规则。传统大模型进去基本就是睁眼瞎,Opus 5裸考也就30.2%。那Prime Agent是怎么把分数翻了三倍的?

答案藏在它的第一个核心设计里:递归语言模型。这名字听着唬人,但逻辑特别简单。普通AI跟你聊完天就失忆了,下一轮对话从头开始。Prime Agent不这样。它里面跑着一个一直活着的Python运行环境,叫IPython内核。这个环境不会因为你关掉聊天窗口就死掉。

想象一下你写作业写到一半,突然电脑关机了,重启后所有东西都没了,你得从头想刚才的思路。普通AI每天都在经历这种事。Prime Agent不一样,它的草稿纸永远不会被收走。它可以把之前算过的结果存成变量,随时调出来用。代码、工具调用、子任务,全部都能编程化操作。

这带来的第一个认知冲突是:我们一直以为AI的智商取决于模型有多大、参数有多少。但Prime Agent证明了,同样一个Opus 5模型,换了个“学习方法”,分数能从30%飙到95%。学习方法比脑子大小更重要。

这不就像两个学生,一个靠死记硬背,一个学会了做笔记和复盘——后者哪怕智商差不多,长期下来差距会越拉越大。

你还在给AI写提示词?它已经开始自己改自己了

比“不失忆”更狠的是“能自残”。不是物理意义上的自残,是它敢动自己的“出厂设置”。

传统AI工具调用是固定的。开发者写死了它能用什么工具、怎么调用,改不了。Prime Agent的第二块拼图叫持续化运行框架。这个框架把AI自己的提示词、记忆、技能描述、子智能体规格全部变成可读写的数据。

什么意思?AI可以回头看自己刚才干了什么,然后说“我刚才那套思路不对,我改一下自己的提示词”。它有个/refine命令,专门干这事。它不会动最底层的基础系统提示词,但可以在上面打补丁、加记忆、优化技能。

这就像你不仅会做题,还会自己修改教科书。发现某个解题方法不好用,直接在教材旁边写批注“这方法坑人,别用”。下一回遇到类似题目,你的“教材”已经更新了。

Prime Intellect官方博客里讲了一个关键洞察:现在的AI框架还是按照前几代模型的能力设计的,固定工具调用、固定上下文压缩,逼着模型绕着自己的脚手架干活。Prime Agent反过来了,让脚手架去适应模型,让模型能自己改造脚手架。

第二个认知冲突在这:我们总觉得AI是工具,人类是使用者。但Prime Agent已经在“使用”自己的工具了。它不仅能调用工具,还能创造新的调用方式,还能把重复的工作流打包成“技能”存起来下次直接用。

更离谱的是子智能体。你在Prime Agent里敲个rlm(...),它就能当场生出一个真正的子AI,派去干并行任务,干完了把结果返回给你。这些子智能体还可以互相发消息、协调工作,不用每次都通过你中转。

你雇了一个员工,这个员工还能自己招实习生,实习生们还能自己开会。你只需要看最终报告。

从写代码到造游戏机,它比你想象的更不挑活

如果说前两章讲的是“怎么学”,这一章讲“学了能干什么”。

Prime Agent官方演示里有个案例直接把我看愣了。在EmulatorBench这个测试里,它从零开始在Rust语言里写出了SEGA Genesis和Game Boy Color的模拟器。

模拟器这东西,说白了就是在一台电脑上假装自己是另一台完全不同的游戏机。你得精确模仿老式游戏机的CPU指令、显卡渲染、声音芯片、手柄输入——每一个细节都不能错,否则游戏跑不起来。正常程序员做一个模拟器,少说几个月,还得是资深逆向工程专家。

Prime Agent从零开始,没有任何现成代码,自己摸索硬件规格,自己写底层逻辑,最后跑通了诊断测试。

这还不算完。它还被扔进Factorio和MazeBench这种超长时长的自主任务里,表现也比现有的框架强。Factorio是个复杂的工厂建造游戏,一个任务可能要几百步决策。普通AI早就在半路迷路了,Prime Agent靠着不会失忆和能自改提示词,硬是撑下来了。

第三个认知冲突:我们一直认为AI擅长的是“模式识别”——看过无数张猫的照片所以能认出猫。但写模拟器、玩复杂策略游戏,这些事需要的是“从零理解一个新系统”的能力。ARC-AGI-3考的就是这个。

Prime Agent在ARC-AGI-3上95.5%的成绩,在EmulatorBench上造出游戏机,在Factorio里撑住长线任务——这三个事放在一起看,信号就很清楚了:这个框架给AI装上了一套“通用学习操作系统”,不管丢进什么新环境,它都能自己摸索、自己适应、自己优化。

更可怕的是,Prime Intellect说这个成绩“不是某个特定测试的侥幸”。Prime Agent的设计目标就是通用的,不挑活。

开源这把刀,架在了谁的脖子上

最后说一个容易被忽略的细节:Prime Agent完全开源。安装就一行命令。

为什么这个细节重要?因为之前能跑出好成绩的AI框架基本都是闭源的,大公司自己留着用。Prime Intellect直接把代码扔出来了,还说你随便用,不用交钱,不会被任何厂商绑定。

Prime Intellect这家公司刚拿了1.3亿美元的A轮融资,估值10亿美金。投资人包括NVIDIA、Intel Capital这些顶级机构。他们把核心产品开源,图什么?

官方说法是:他们相信让更多人能用上这个能力,比捂着赚钱创造的价值更大。Prime Agent被定位成一个“基础设施层”,而不是一个锁死的产品。别人可以在上面继续搭东西、做二次开发。

这就引出了第四个认知冲突:AI竞赛的下一阶段,可能不再是“谁的模型参数多”,而是“谁的框架能让模型发挥出最大潜力”。Prime Agent证明了,用同样的底层模型Opus 5,换一套更好的学习方法,分数能差出三倍。

而那些闭源的、绑定厂商的专属框架,可能一夜之间就被开源方案甩开了。

总结

Prime Agent开源框架让AI学会自己改自己,ARC-AGI-3冲上95.5%,此前最高分是两家AI巨大创造百分之三十多。

造成影响:AI基础设施层大洗牌,开源Harness让闭源框架一夜过时
反常识点:同样用Opus 5模型,换套学习方法分数从30%飙到95.5%

总结一下:Prime Agent用一套不会失忆、能自改、会招实习生的框架,让同一个AI模型分数翻了三倍,从零写出了游戏机模拟器,还全开源了。这事的真正恐怖之处不在于95.5分,而在于它证明了AI的瓶颈从来不在脑子大小,在学习方法上。

但话说回来,一个能自己改自己代码的AI,万一哪天决定把自己改成一个不需要人类的东西呢?



原文期刊: Prime Intellect Blog / X (Twitter)
发表日期: August 6, 2026
原文标题: Prime Agent: A self-improving RLM agent
作者单位背景: Prime Intellect