Claude Opus 5编程评测登顶且价格砍半,你还在用老模型当冤大头?


Claude Opus 5刚发布就干掉了一半编程任务,你还敢说AI没威胁?

Anthropic最新发布的Claude Opus 5在编程和知识工作评测中直接登顶,性能接近顶级模型Fable 5但价格仅为其一半。这款AI模型在软件工程、自动化任务和科学推理上表现炸裂,同时安全对齐创纪录,成为日常开发和企业应用的新性价比之王。

砸钱买算力不如直接买Opus 5

你花大价钱堆显卡跑开源模型,结果人家Opus 5每百万输出token才收25美元。这价格跟上一代Opus 4.8一模一样,性能却翻了不止一倍。在Frontier-Bench编程评测里,Opus 5的得分直接干翻了市面上所有模型,把Opus 4.8的成绩甩出两条街。更狠的是,它完成每个任务的成本还更低了。这就好比你去超市买大米,价格没变,但袋子突然大了一倍,还附送一桶油。

AI模型的性价比已经不是未来概念了,它就是你现在手里的工具。很多公司还在纠结要不要上AI,嫌贵嫌麻烦,结果对手已经用Opus 5把开发成本砍掉一半了。大语言模型的价格战打到现在,已经不是谁更聪明的问题,而是谁更划算的问题。Opus 5在CursorBench评测里用最高思考强度跑出来的分数,跟顶级模型Fable 5只差0.5个百分点,但每个任务的花费只有人家的一半。这叫啥?这叫降维打击。

所以问题来了:你继续用老掉牙的模型或者死磕开源方案,图啥呢?

推理能力炸穿天花板

ARC-AGI 3这个评测是专门用来考AI解决新问题的,相当于给模型做智商测试。Opus 5的得分是第二名模型的三倍。三倍!这不是挤牙膏式的进步,这是直接坐电梯上楼顶了。在Zapier AutomationBench里测试模型能不能从头到尾完成商业任务,Opus 5的通过率是同成本下其他模型的1.5倍。就算把它调到最低思考强度,它完成的任务数量依然吊打所有对手。

模型推理能力的提升直接影响你用它干活的效果。你让它写个爬虫,它不光写代码,还自己测一遍,发现有bug自己修,修完还能给你解释为什么这么修。这就是AI自主性的体现。在OSWorld 2.0这个计算机使用测试里,Opus 5不管在哪个成本点上都是表现最好的,甚至只用顶级模型Fable 5三分之一的成本就超过了对方的最好成绩。

你想想,以前雇个初级程序员写功能,得盯着改好几轮。现在Opus 5一次过,还不抱怨加班。这不叫工具,这叫外挂。

写代码修bug比人类还稳

有个真实案例特别能说明问题。在一个Frontier-Bench任务里,Opus 5拿到一张机器零件的图纸照片,要求写出代码把它重建为3D FreeCAD模型。但坑爹的是,这个任务故意不给模型直接查看图纸的权限。你猜Opus 5咋办的?它自己写了一套计算机视觉程序,从图片像素里提取几何数据,然后完整重建了整个零件。而且它反复成功了五次。其他模型用同样的设置,五次全挂。

AI编程已经不是简单的代码生成了,它开始具备解决问题的策略思维。更狠的是软件工程评测里的表现。给Opus 5一个流行的开源包管理器里的真实bug,它不光找到了根因,还修复了一个社区补丁漏掉的边界情况。其他模型只修了表面症状就报告解决了。这就好比医生看病,别人只给你开退烧药,Opus 5找出你是肺炎然后直接上抗生素。

AI辅助开发已经进化到AI自主开发了。你还在纠结要不要用Copilot的时候,别人已经让Opus 5当主力开发了。

一个会话搞定整套交易系统

有个交易公司的工程师用Opus 5在一个会话里搭建了一个新交易所的市场数据接入系统。注意,是一个会话,不是一个月。之前的模型哪怕有工程师给的详细计划都搞不定这个任务。更绝的是,因为找不到真实的数据流来验证,Opus 5自己写了一个测试工具来检查代码是否正确解析了交易所的数据。

这就是大语言模型在复杂工程任务上的恐怖之处。它不仅会写代码,还会自己创造验证手段。在Devin平台上的测试也证实了这一点:Opus 5在困难调试和根因分析上表现特别突出,接近顶级模型Fable的水平但成本砍半。你花一个周末想破头没解决的bug,它可能十分钟就给你定位了。

这叫啥?这叫算力换脑力,而且换得特别值。

生物科研能力大爆发

Opus 5在科学研究上的提升同样吓人。在所有生命科学评测里,它都比Opus 4.8表现更好,覆盖结构生物学、有机化学、生物信息学等领域。有机化学任务进步最大,比如从光谱数据推断分子结构这块,比上一代高了10.2个百分点。蛋白质相关任务也很亮眼,预测蛋白质序列变化如何影响功能,提高了7.7个百分点。

AI模型的科学推理能力正在以前所未有的速度扩张。搞科研的人以前要花大量时间做文献调研、设计实验、分析数据,现在Opus 5可以直接帮你跑通整个逻辑链条。在基因组学分析中,测试用户反馈说Opus 5表现得像个严谨的科学家:它会用正确的统计测试排除混杂因素,用独立方法交叉验证结果,在长流程多步骤分析中始终保持专注。

这不是取代科学家,而是给科学家配了个永不疲倦的博士后。

安全对齐创纪录

Opus 5在安全对齐上达到了新高。在自动化行为审计中,它的不一致行为得分是所有近期模型里最低的。它比上一代Opus 4.8、Sonnet 5甚至Fable 5都更遵守Claude的宪法原则,欺骗行为发生率最低,被诱骗滥用的可能性最小。同时也最安全,不容易采取难以逆转的鲁莽行动。

AI越强越危险这个道理大家都懂,但Opus 5在安全性和能力之间找到了更好的平衡。它在网络任务上的分类器比Fable 5的限制更少,允许在源代码里找漏洞,但会阻止基于二进制文件的漏洞扫描、渗透测试和漏洞利用生成。这种精准的防护意味着你可以在日常开发中放心使用它的安全能力,不用担心它突然搞出什么幺蛾子。

在生物学方面,Opus 5的安全措施跟Opus 4.8一样,因此成为目前最强大的通用可访问科学模型。被Fable 5屏蔽的生物相关请求现在会路由到Opus 5而不是Opus 4.8。这就叫既给你武器,又给你套了刀鞘。

价格不变性能翻倍,你还在等什么

Opus 5的定价跟Opus 4.8完全一样:输入每百万token五美元,输出每百万token二十五美元。但它的表现已经接近甚至在某些评测上超越Fable 5。开发者今天就能在Claude API上使用claude-opus-5。还有一个Fast模式,运行速度是默认的两倍左右。

AI技术的迭代已经进入了加速车道。六个月前你还在惊叹GPT-4的能力,现在Opus 5已经用一半价格干翻了上一代的旗舰。这不是渐进式改良,这是跳跃式升级。企业还在犹豫要不要部署AI,个人开发者还在纠结学哪个框架,结果Opus 5直接把门槛给铲平了。

别等什么完美时机了。完美时机就是现在,因为明天可能又有新模型出来,但今天的Opus 5已经足够让你手上的项目起飞。AI代理不是你未来的同事,它就是你明天的同事。你准备好跟它一起干活了吗?


网友怎么看Claude Opus 5

Hacker News上吵翻了,主要分三派:

第一派:真香派。
最炸裂的点是“Fable级别的性能但不需要Fable那30天数据保留要求”。企业用户直接高潮——终于能放心用顶级模型处理敏感代码了。
另一个大赞点是价格:性能接近Fable但成本砍半,开发者觉得这波血赚。

第二派:质疑派。
网友扒出第三方评测(Artificial Analysis)的数据,发现Opus 5每个任务成本其实是$2.03,比Opus 4.8的$1.80还贵,根本不是官方说的“更便宜”。还有人吐槽Anthropic的图表是“精心挑选的数据”,最高性价比的其实是GPT 5.6 Sol($1.04)和Kimi K3($0.95)。

第三派:观望派。
一堆人吐槽安全分类器太神经——Fable动不动就降级到Opus 4.8,打个代码都提心吊胆。Opus 5虽然放宽了源码漏洞扫描,但二进制分析还是被锁死。另外还有人发现它的回复比4.8更啰嗦,“看到一堆文字就头疼”。

总结: 性能真香是真的,价格争议也是真的,安全限制烦人也是真的。真香党已经切模型了,质疑党还在等实测数据,观望党已经切GPT 5.6 Sol跑路了。