GPT-5.6 Sol打开两个设置:ARC-AGI-3评分从7.8%翻三倍38.3%


把记忆开关打开,模型分数从7.8%飙到38.3%,输出token少了六倍,算不算打脸那些说AI不会玩游戏的评论。

OpenAI发现GPT-5.6 Sol在ARC-AGI-3基准测试上得分低得离谱,但换了两项API设置后分数直接翻三倍。本文拆解推理保留和上下文压缩这两个隐藏开关如何让模型从智障变高手,以及基准测试到底在测谁的能力。

丢掉推理等于让天才每秒失忆一次

模型每次行动后,官方框架把内部推理过程全部扔掉。这意味着模型每走一步都要从头理解游戏规则,像一个人每次睁眼都忘记前一秒在想什么。它能看见行动记录,但看不见这些行动背后的计划、洞察和思考路径。这种设计等于让短跑运动员每次起跑前重新学走路。

滚动截断窗口更狠,连行动记录都开始消失。对话历史超过十七万五千字符后,最早的消息直接被丢弃。模型越玩到后面,记得的东西越少。这就像考试时允许带笔记,但每翻一页就把前一页撕掉。GPT-5.6 Sol在数学上能解开循环双覆盖猜想,在宝可梦火红里能通关,偏偏在这套框架下像个新手。

OpenAI研究团队一开始很困惑,后来发现罪魁祸首是框架本身。基准测试表面在测模型智商,实际在测框架对记忆的管理能力。官方测试框架把模型绑住手脚再问它能不能跑步。答案显然不能,但问题出在绳子上,不在腿上。

保留推理让大脑进入连续思考模式

Responses API的第一个改动是保留推理。模型每次行动后的思考过程不再被丢弃,全部留在对话历史里。这个开关一打开,效果立竿见影。GPT-5.6 Sol在每个行动前的思考时间大幅缩短,因为它不用每次从零开始解读游戏画面。它记得上一秒的分析,直接在此基础上继续推进。

更关键的变化是策略连贯性。模型能记住自己过去五分钟的推理链条,就能形成长期计划。在2D益智游戏里,这意味着它学会了一关的通关逻辑后,能把这套逻辑迁移到下一关。官方框架下的模型像个失忆症患者,每次行动都独立决策,前后逻辑无法衔接。保留推理后的模型像正常人,决策有连续性,失败有反思,成功有积累。

这项机制本来就存在于ChatGPT和Codex的生产环境中。模型训练时就按照推理保留的方式优化,但ARC的官方框架反而把这个特性关掉了。OpenAI团队把生产环境的设置搬到基准测试上,得分立刻从百分之十三点三跳到三十八点三。这个差距不是模型能力的差距,是框架对模型能力释放程度的差距。

压缩比截断聪明在哪

滚动截断碰到上下文长度上限就直接删旧消息。这个方法简单粗暴,但有两个致命伤。第一,模型丢失早期观察和行动记录,意味着它忘记游戏最初几关长什么样。第二,模型长期在满负荷上下文窗口下运行,性能会受到轻微损伤。满负荷状态下的推理速度和质量都不如轻松状态。

压缩是另一种解法。上下文达到上限时,模型对整个对话历史做智能总结,而不是直接丢弃。总结保留关键信息,压缩冗余细节,让上下文窗口始终保持可用空间。Responses API内置这个功能,开启后GPT-5.6 Sol在长流程游戏中的表现明显更好。它能记住每个游戏的核心机制,不会因为窗口满了就忘记开头学到的经验。

对比效果很直观。压缩后的输出token数量比官方框架少了六倍,得分反而高出三倍。少干活多拿分,这违反直觉的结果来自一个简单事实。压缩让模型记得更清楚,记得更清楚就让模型少犯重复错误,少犯错误就少输出无效动作,无效动作少了token自然下降。这个正向循环的起点只是一个设置开关。

基准测试测的是系统不是模型

ARC-AGI-3的设计初衷是通用框架,不包含任何工具或特殊功能。这种设计让模型间比较更公平,因为所有模型都在相同条件下运行。但这个公平有一个前提,框架本身不能偏向某种模型架构。实际上官方框架的丢弃推理和滚动截断对基于推理链的模型尤其不友好。

GPT-5.6 Sol这类模型在训练时依赖推理链的连续性。打断推理链等于打断它的思考方式。官方框架下的低分反映的不是模型能力上限,是模型在对抗性框架下的挣扎表现。商业开发者则会针对每个模型优化框架,让模型能力充分释放。Responses API就是这种优化思路的产物。

OpenAI在ARC-AGI-3上的实验揭示了一个行业潜规则。公开基准测试的排行榜不仅比模型,还比框架设计、API设置、提示方式这些隐形变量。同一个模型在不同框架下得分可以差三倍。研究者对比模型时必须确认框架设置是否公平,否则结论毫无意义。OpenAI建议所有对比评估都应该使用推理保留和压缩,因为这两项设置最接近ChatGPT和Codex的真实使用场景。

记忆管理决定智能体上限

长期任务中的智能体需要两个能力。短期内的推理连续性和长期内的经验积累。推理保留解决前者,压缩解决后者。两者缺一,模型都会在复杂任务中表现失常。ARC-AGI-3的六关游戏恰好考验这两个能力,所以框架设置的差异被放大到三倍。

模型在宝可梦火红里能通关是因为那个环境天然保留了状态。游戏本身有存档机制,模型每次行动都能看到当前画面和背包物品,这些信息不会消失。但ARC-AGI-3的文本表示只返回当前帧和关卡号,没有外部存储,完全依赖上下文窗口。窗口设置因此成了决定胜负的关键。

OpenAI的Responses API通过传递前一个响应ID就自动保留推理和工具调用间的上下文。开发者不用手动管理记忆,API替他们完成。这种设计降低了开发门槛,也提高了模型在长任务中的表现。ARC-AGI-3的分数飙升证明这套机制在极端测试下依然有效。模型能解决全部六关,而官方框架下的前沿模型连第一关之后的关卡都过不去。

记住过去才能规划未来,对人对模型都一样。把记忆开关打开,AI在游戏里从菜鸟变高手只隔了一个设置页面的距离。这个发现也许能让基准测试的设计者们重新思考,到底什么才是真正的公平比较。