如果 Codex 或代理工作流程 在GPT 6 Astra 上感觉犹豫不决或不断停滞 ,将这些指南添加到您的项目说明( AGENTS.md / 系统提示)中可以帮助减少不必要的停顿并提高后续工作的完成度。
# 任务执行与自主性 |
OpenAI 在指南中给出了 Astra 的最佳实践 : https://developers.openai.com/api/docs/guides/latest-model ,但是手动进行重构是浪费时间。
原来他们有一项官方技能,可以让 Codex 读取规范并应用推荐的迁移更改:
$openai-docs migrate this project to GPT-6 Astra
技能库:https://github.com/openai/skills/blob/main/skills/.curated/openai-docs/SKILL.md
它会检查你的项目,并应用相关的模型和提示更改,必要时还会标记出更广泛的 API 或架构更改。我在一个中等规模的代码库上测试过,它在我的代码库中开箱即用。
除了 API 的更改(移除诸如 temperature 、 top_p 和 top_logprobs 等不支持的参数,并使用 Responses API 进行工具调用)之外,官方指南还重点介绍了需要在系统提示符中进行修补的主要行为差异:
- 修复“审批暂停”循环: Astra 有时会在您预期它继续执行时暂停以进行澄清。它经常会在修改代码之前暂停以提出方案或请求确认。您必须明确指示它优先处理非破坏性任务。
- 技能冲突解决: 工作区技能中的冲突指令会导致 Astra 不必要地暂停。您必须明确规定用户指令优先于外部技能指令。
- 抑制冗余: 除非另有说明,否则 Astra 会大量使用重复的过渡短语和 Markdown 列表。
简短提示:
在 AGENTS.md:5 文件顶部附近添加了一个 37 行的 GPT-6 Astra 工作合约,内容包括:
- 完成已授权的工作,无需反复暂停审批。
- 只询问那些会对结果产生实质性影响的决策。
- 修改意见后,请继续回答其他问题。
- 解释每个障碍物背后的具体指令。
- 委派有界限的独立工作。
- 报告需简洁明了,并提供具体证据。
- 一旦所有必要的检查都通过,验证就停止。
关于一些人提出的在针对 Astra 优化的代码库中 Sol 或 Opus 会发生什么的问题:如果你将每个合约都保存在工具实际读取的文件中,大部分问题就能迎刃而解。Codex 会读取 AGENTS.md,Claude Code 会读取 CLAUDE.md,因此 Astra 的自治模块可以存在于其中一个文件中,而不会影响到另一个文件。
真正影响所有模型的条款是关于对可逆决策做出合理假设的。在 Astra 中,它会破坏审批流程。在较小的执行器中,它会同时破坏暂停和判断,最终导致你不得不审查那些看似正确实则错误的修改。我将此限制在负责编排的模型范围内,并让执行器专注于明确的、有界的任务。
斜率抑制是值得全局保留的部分。它的任何内容都与特定模型无关。
你还在调温度参数?Astra 直接把这扇门焊死了
打开 OpenAI 的 API 文档,开发者会看到一个让人后背发凉的段落:GPT-6 Astra 不支持 temperature、top_p 和 logprobs。这三个参数是过去三年里每个调参侠的命根子。温度调低一点输出更确定,调高一点更有创造力,top_p 控制采样范围——这些套路从 GPT-3 时代就刻进了肌肉记忆。现在 Astra 说:我不认。
更狠的是工具调用的路也改了。以前 Chat Completions 路径直接挂工具就能跑,Astra 一刀切掉。想用工具?必须换到 Responses API。这意味着什么?意味着你之前写的所有集成代码、所有工具调用封装、所有基于 Chat Completions 的 Agent 框架,全废了。
OpenAI 的官方解释是:Astra 不需要你来控制随机性。模型自己判断什么时候该确定、什么时候该发散。这就像一个顶级厨师跟你说“不用告诉我火候,我懂”。信不信由你,但菜做糊了只能怪自己没看说明书。
推理努力等级也变了。none 和 minimal 被彻底移除,现在只有 low、medium、high、xhigh、max 五个档位。默认从 low 起步。这些变化叠加在一起,等于把过去三年积累的调参经验全部清零。一个习惯了 Sol 的开发者把代码直接怼到 Astra 上——返回的全是错误码。
模型开始反问你了,这不是 bug 是 feature
GPT-5.6 Sol 时代,提示词像 SQL 查询:输入指令,输出结果,最多调几个参数。Astra 完全不吃这套。它比 Sol 更频繁地提出澄清问题。你丢一句“帮我总结一下这份代码”,它不会乖乖干活,而是先反问:总结给谁看、用在什么场景、要详细到哪一层。
这不是模型变笨了,是变较真了。Astra 会把历史消息里的每一句话都当作有效信号。你在几百字前随手写的一个比喻,它能当成硬性风格来执行。旧模型忽略的噪声,Astra 全盘接收并放大。
更麻烦的是“审批暂停”循环。Astra 在执行代码修改前会停下来,先抛出一份计划问你“这样可以吗”。表面上看是谨慎,实际操作中变成无休止的确认 loop。你让它改三行代码,它先花五分钟列计划、要授权、等批复。效率不升反降。
OpenAI 在官方指南里给出诊断:Astra 对上下文冲突极度敏感。如果你的项目里有 AGENTS.md、SKILL.md 这类文件,里面但凡有一条含糊其辞的规则,Astra 就会停下来问“你到底要我听谁的”。那些历史遗留的“遇到问题自行判断”式废话,在旧模型里被忽略,在 Astra 这里变成了它擅自行动的授权书。
官方藏了一个技能,一键迁移能救命
OpenAI 不是没想过开发者会翻车。他们在官方文档里藏了一个技能:让 Codex 读取 GPT-6 Astra 的规格说明,自动应用推荐的迁移改动。命令只有一行:$openai-docs migrate this project to GPT-6 Astra。技能仓库在 GitHub 上挂着。它会扫描你的项目,找出所有不兼容的参数、过时的 API 调用、需要调整的提示词结构,然后批量改掉。
有人在中等规模代码库上测过,开箱即用。但问题在于——多少人知道这个技能存在?多少人会在骂完 Astra“智障”之后,想起来翻一下官方文档?
把这份提示词塞进你的 AGENTS.md,Astra 立刻闭嘴干活
与其跟 Astra 较劲,不如直接告诉它该怎么听话。社区里已经有人把官方指南浓缩成一段可复制的提示词。贴进项目指令文件(AGENTS.md 或系统提示词),Astra 的废话能少一大半。
核心逻辑就三条。
第一,告诉 Astra 别停在计划阶段。对于非破坏性任务,直接推进到完成,别反复请示。日常操作、可逆决策自己拿主意,只有删除、 irreversible 操作才需要审批。
第二,明确用户指令优先于技能文件。Astra 卡住的时候,让它自己报出来“我读了哪个文件的哪条规则才停的”。这样你能分清是规则冲突还是模型自己瞎理解。
第三,管住它的嘴。Astra 爱用“delve”“leverage”“it‘s worth noting”这类套话。直接告诉它:用大白话、主动语态、短段落,结果放前面。要列清单可以,但别每句话都加过渡词。
有人已经把这段提示词精简成一个 37 行的“GPT-6 Astra 工作契约”塞进 AGENTS.md。效果立竿见影——重复审批少了,输出废话少了,该干的活自己干了。
一个模型一套玩法,别拿 Astra 的规矩去管 Sol
有人担心:把项目针对 Astra 优化之后,再用 Sol 或 Opus 会不会出乱子?答案是会,但有解法。
社区里已经有人踩过坑。最危险的是那条“对可逆决策做合理假设”。在 Astra 身上它杀死了审批循环;换到能力弱一些的模型上,它杀死了判断力本身——模型会自信地做出错误修改,你还得回头擦屁股。
解决方案是分文件管理。Codex 读 AGENTS.md,Claude Code 读 CLAUDE.md。Astra 的自主权条款单独放在一个文件里,不让小模型碰。但“废话过滤”那条可以全局共用,跟模型无关。
还有人搞了一套路由机制:默认用 Sol,Sol 判断任务适不适合 Astra 再升级。更复杂的玩法是让 Astra 当总指挥,把具体任务分给 Sol、Terra、Luna 这些子模型去跑。能力强的负责规划,便宜的负责执行。钱花在刀刃上。
有人用插件把 token 消耗压下去四成,你却还在硬扛
GPT-6 Astra 的定价是每百万输入 token 10 美元、输出 50 美元。Sol 促销价才 4 美元输入、20 美元输出。贵了 2.5 倍。上下文窗口暴涨到 105 万 token,输出上限 12.8 万。敞开了用,一周额度三天见底。
有人靠一个叫 Plumbline 的插件把周消耗从见底压到剩四成。原理不复杂:自动清理冗余上下文、合并重复请求、压缩历史记录。但知道这个插件的人依然不多。更多人还在硬扛——要么省着用不敢跑大任务,要么敞开了跑三天断粮。
Codex 在 Astra 上还有个新能力:跨上下文窗口保留笔记。以前上下文满了只能压缩成摘要,信息丢失严重。现在 Astra 可以在不同窗口之间保留笔记,后续还能检索之前的对话和结果。这个功能已经在 Codex 的 config.toml 里可开启,未来几周会成为默认。但同样——不看文档的人不会知道。
Astra 跑单个任务 30.9 分钟,但多数人连跑的权限都没有
Astra 的单个任务平均完成时间从 Sol 的 75 分钟压到了 40 分钟。有人测出更极端的数字:30.9 分钟。你可以丢给它一个数据库迁移、一套测试补全、一个多文件重构,然后去做别的事。这在以前不敢想。
但讽刺的是,大部分独立开发者根本跑不了 Astra。Codex 在普通 ChatGPT 账号上拒绝 gpt-6-astra 的请求。初期只向“可信访问项目”的企业客户开放,后续才逐步推到 ChatGPT Plus、Pro、Business 和 Enterprise。API 渠道同步开放给 Microsoft Azure 和 AWS Bedrock。普通开发者只能看着 Benchmark 流口水,连踩坑的资格都没有。
更微妙的是安全管控。Astra 是 OpenAI 第一个达到“关键”级网络安全能力的模型。给它合适的工具和权限,它能自主发现未公开的安全漏洞并开发利用代码。为了控制风险,OpenAI 对部分高级网络安全能力做了严格访问限制。企业工作区里 Astra 默认是关闭的,管理员要手动开启。能力越强,锁越紧。
ARC-AGI-3 99.9% 看起来很猛,但 Standard 模式下只有 62.7%
Astra 的 Benchmark 数字漂亮得不像话。ARC-AGI-3 拿到 99.9%,而前代 Sol 只有 7.8%。FrontierMath Tier 4 跑出 97.6%。OSWorld 2.0 得分 72.6%。这些数字被媒体疯狂转发,“AGI 已来”的标题刷屏。
但 ARC Prize 组织者泼了一盆冷水:99.9% 是在 OpenAI 定制环境(Provider Adapter)下跑出来的。Standard harness 下的最高分是 62.7%。而且 ARC-AGI-3 用的是封闭环境,属于有限评估。基准测试饱和不等于 AGI 达成。
独立测试也给出了更冷静的判断。Intelligence Index 里 Astra 拿了 61 分,和 Sol 完全持平。生成内容量只有 Sol 的三分之一、Claude Opus 5 的五分之一。能力确实强了,但没强到跨越代际的程度。
更值得关注的不是分数,是行为变化。Astra 在 SRE-Bench 二进制逆向工程里四轮内拿到 99.2%,Sol 只有 68.7%。在 AutomationBench 多步骤专业任务里拿到 41%,Sol 只有 18%。这些才是开发者实际会碰到的场景——不是刷题,是干活。