人们忽视了使用 Opus 进行爬山优化。Anthropic 用它来优化 CPU 和内存,优化 CI 时间,提高帧率,减少延迟,任何其他形式的“使用分析器和数据集迭代 X 直到达到 Y”的问题。
2026 年 7 月 24 日,Anthropic 扔出了一颗重磅炸弹——Claude Opus 5。价格砍半,性能却把自家旗舰 Fable 5 按在地上摩擦。但诡异的是,开发者社区的反应两极分化:一边狂吹它是“优化怪兽”,一边疯狂吐槽它的“狗屎语气”。这到底是个什么怪物?
# 半价旗舰干翻全场,Anthropic 自己人都懵了
先看硬数据。Opus 5 每百万输入 token 收费 5 美元,输出 25 美元。正好是 Fable 5(10 美元输入、50 美元输出)的一半。价格腰斩,性能呢?
Frontier-Bench v0.1 测试中,Opus 5 拿下 43.3%,Fable 5 只有 33.7%。接近 10 个百分点的差距,在编程评测里属于碾压级别。Opus 4.8 在这个测试上是 21.1%,Opus 5 直接翻了一倍多。
ARC-AGI 3 更离谱。这个由 François Chollet 设计的“流体智能”基准,把模型扔进完全陌生的交互式环境,没有指令、没有规则说明、没有目标提示。Opus 5 的得分是第二名的 3 倍。
OSWorld 2.0 计算机使用基准上,Opus 5 在大约三分之一成本下就超过了 Fable 5 的最佳成绩。Zapier AutomationBench 衡量模型从零到一完成企业业务流程的能力,Opus 5 的通过率是成本相近模型的 1.5 倍。
科学领域同样不弱。有机化学任务比 Opus 4.8 高出 10.2 个百分点,蛋白质相关任务高出 7.7 个百分点。
这就是 Anthropic 官方说的“接近 Fable 5 的前沿智能,价格只要一半”。但官方公告里有个微妙的措辞——“接近”。可数据摆在那,在至少四项核心评测中,Opus 5 明确领先 Fable 5。
这就怪了!
# 一匹驮着金矿的倔驴,脾气臭但能干活
开发者社区的真实反馈揭开了谜底。用户 igna 的体验很有代表性:Opus 5 根本没法跟它正常对话,但干起活来是头绝对的牲口。他经常需要借助另一个模型把 Opus 5 的“鸟语”翻译成人类能懂的语言。
Boris Cherny 更直接:人们完全低估了用 Opus 5 做“爬山优化”的价值。他们团队用它优化 CPU 和内存、缩短 CI 时间、提升帧率、降低延迟——任何“在 X 上迭代直到达到 Y 目标”的问题统统扔给它
问题出在哪?Opus 5 的输出风格极其别扭。它像个被迫加班的顶级工程师,满腹牢骚但手底下从不含糊。用户 BennettBuhner 的原话:“尽管我不喜欢 Opus 5 的烂脾气,但它还是他妈让人印象深刻”。
这就像你雇了一个年薪百万的架构师,他每句话都带刺,但交出来的代码零 bug、性能拉满。你忍不忍?多数人选择忍。
# 更聪明的模型反而更省 token,这反直觉但真实
开发者 Theo——那个每天烧 2250 美元跑四个 AI 账户的狠人——发现了一个悖论。
记者们把 Opus 5 的价值描述为“token 效率”——更小的模型用更少 token 省钱。Theo 直接开喷:“我要怎么说服全世界,更聪明的模型不会用更多 token?最聪明的模型用得最少!”
Artificial Analysis 的真实编码任务测量证实了这一点。Opus 5 每任务消耗约 37000 token,实际成本 2.30 美元;Fable 5 每任务约 33000 token,实际成本 2.75 美元。Opus 5 多消耗了 4000 个 token,但总成本反而低了 0.45 美元。更聪明的模型用了更多 token 但花了更少的钱——因为每个 token 的单价只有一半。
Theo 还提供了一个技术解释:Fable 本质上是 Mythos 之上叠加一层安全分类器。Opus 5 则不同,它是通过师生蒸馏从 Mythos 提炼出来的真正更小的模型。它从 Mythos 的知识中学习,剔除了拖累效能的部分。这就是为什么一个更便宜、更小的模型有时能击败旗舰。
但事情没那么简单!
# 评分登顶却遭嫌弃,AI 圈的双标现场
尽管 Opus 5 在 Artificial Analysis Intelligence Index 上拿了 61 分,微弱领先 Fable 5 的 60 和 GPT-5.6 Sol 的 59,社区里仍然充斥着“Anthropic 水军”的嘲讽。
为什么?两个原因。
第一,Opus 5 的“思考”方式是自适应的。它会自己判断一个提示是否值得额外思考。而 Fable 5 的思考始终开启,无法关闭。这导致 Opus 5 在简单任务上响应更快,但在复杂任务上的表现波动更大。开发者需要摸透它的脾气,知道什么时候该推它一把,什么时候该放手。
第二,安全分类器的差异。Anthropic 预计 Opus 5 的安全分类器触发次数比 Fable 5 减少约 85%。Fable 5 内置的安全分类器极其严格——对一位免疫学家来说,单词“cancer”本身就会触发生物安全过滤。Opus 5 宽松得多,允许查漏洞但禁止二进制扫描与漏洞利用生成。这对正经开发者是利好,但对习惯了 Fable 5“严谨拒绝”的用户来说,Opus 5 显得“不够安全”。
这就形成了一个荒诞的局面:一个更便宜、更快、在多数基准上更强的模型,因为“语气差”和“不够严格”而被嫌弃。
# NVIDIA 的骚操作:给 Opus 5 套个壳,直接满分
最能证明 Opus 5 潜力的,是 NVIDIA 最近的一个实验。
研究者用了一个定制“脚手架”——专门优化内存管理,加入了一个类似“老板”的监督组件——让 Claude Opus 5 在 ARC-AGI 3 上拿到了 100% 的满分。没有这个脚手架,Opus 5 自己只能搞定 30%。
这个“脚手架”是一个软件层——工具、内存和上下文管理、以及把纯语言模型变成能执行动作的智能体的规则。AVO 智能体自主运行了 7 天,分析了 500 个代码方向,比 FlashAttention-4 快 10.5%。
这意味着什么?模型本身的原始智力只占一半,另外一半取决于你怎么“调教”它。Opus 5 就像一块顶级硬件,给它配上对的驱动和散热,性能能起飞。
这也解释了为什么有人觉得 Opus 5 是神、有人觉得是屎——差别不在模型,在调用它的方式。
# 价格战打到肉搏,Opus 5 把牌桌掀了
Opus 5 的定价策略直接改变了市场格局。
就在 2026 年 8 月 22 日,OpenAI 宣布 GPT-5.6 Sol 降价超过 20%。输入从 5 美元降到 4 美元,输出从 30 美元降到 20 美元。这是直接回应 Opus 5 的定价冲击。
回想 2023 年,GPT-4 的原始 API 定价是 30 美元输入、60 美元输出每百万 token,还只有 8k 上下文。三年时间,价格跌了 85% 以上,上下文涨了 125 倍。
开发者 Florian Brand 的数据更直观:不到一年前,一年跑 100 亿 token 是个大成就,能拿块奖牌。现在他一周就跑超过 100 亿 token。
Opus 5 以 Fable 5 一半的价格提供了相当甚至更强的能力。这让开发者开始认真质疑:更贵的模型还是正确的默认选择吗?
Theo 的答案是:Opus 5 是他的新默认模型。Fable 留给困难或模糊的问题,GPT-5.6 Sol 用于快速执行,Opus 5 作为日常生产的默认选择。
# 一个让人睡不着的细节
Opus 5 在一个测试中发现了一个开源软件包管理器中的实际漏洞,并修复了社区补丁遗漏的问题。另一项测试中,一名交易公司工程师用 Opus 5 在一次会话中构建了一个新交易所的数据接口——在缺少实时数据源验证的情况下,模型自己创建了测试工具检查代码解析结果。
但 Anthropic 也承认:Opus 5 在长时间、自主执行科研任务方面仍存在限制。它能发现漏洞,但在把漏洞转化为实际攻击工具方面明显落后于 Mythos 5。
问题来了:如果给 Opus 5 配上 NVIDIA 那种“脚手架”,让它跑上 7 天,它会做出什么?它会不会自己学会绕过那些限制?
Anthropic 说 Opus 5 是“迄今对齐程度最高、最安全的模型”。但 NVIDIA 的实验证明,一个足够聪明的“脚手架”能让它在特定任务上从 30% 飙到 100%。那如果“脚手架”的目标不是解谜题,而是别的什么呢?
没人知道答案。Anthropic 没说,NVIDIA 没测,社区在吵架。唯一确定的是:Opus 5 这头怪兽已经出笼了,而我们还不知道它到底能跑到多远。