Opus 5翻车实录:语言失控,开发者怒斥注释垃圾


更聪明的模型,为何让人更头疼!

打开一个每月两百美元的订阅,等来的不是更顺畅的体验,反而是一堆看不懂的天书。这事不闹心吗?

过去几个月,大量长期使用 Claude 的用户开始集体抱怨一件事:明明官方说 Opus 5 更强了,怎么用起来反而更难受了? 这种抱怨不是零星的吐槽,而是成规模的、跨平台的用户情绪。从技术社区的讨论看,问题集中在几个点上:输出的语言变得晦涩难懂、模型越来越不听话、代码注释泛滥成灾。 人们普遍困惑:一个号称更先进的模型,为什么会让人觉得更难相处?这背后不是某个功能的退化,而是一整套语言习惯和行为模式的异变,正在悄悄改变人与 AI 协作的体验。

一个更聪明的模型,怎么会更难用?

Opus 5 在基准测试上的表现确实比前代更好。数学推理、代码生成、多步规划,这些硬指标都在往上走。但奇怪的是,用户的满意度没有跟着涨,反而跌了。这种“能力更强、体验更差”的倒挂,在技术产品历史上并不常见。

问题出在一个被忽略的变量上:沟通成本。 当一个模型输出的文字让人越读越累,它的硬实力再强,也会被这种摩擦感抵消掉。用户不是在跟一个“更聪明的大脑”打交道,而是在跟一套越来越别扭的语言系统较劲。

开发者社区里涌现了大量类似的观察。有人提到,Opus 5 写代码时的注释已经到了泛滥的地步——某个项目里,注释行数和代码行数的比例接近三比一,而这些注释绝大部分是模型自己生成的,事后需要人工花掉五倍于正常阅读的时间去删改。 更麻烦的是,这些注释里经常夹带“私货”:一些只有模型自己在推理过程中才用到的内部术语、临时的决策记录、甚至是对用户指令的转述。这些内容混进代码库之后,不只是碍眼,还会让后续的维护变得极为棘手。

这就怪了。

一个被宣称“更强大”的模型,为什么在沟通这个最基本的环节上反而退步了?

那套“教条式解惑”的语言,到底哪里不对劲?

把 Opus 5 生成的文字和早期版本的输出放在一起对比,差异非常明显。早期模型的语言更像是在“回答问题”,而 Opus 5 的语言更像是在“做一场汇报”。

有一个非常精准的观察:Opus 5 几乎每一条回复都套着同一副结构骨架。它会先复述一遍用户的提问,然后拆成三个段落中间插一条带项目符号的清单,紧跟着一段“让人意外的转折”,最后以一句“总而言之”收尾。 这套结构本身没有错,但问题在于:不管用户问的是量子物理,还是吐槽加州卷不好吃,它都用完全一样的节奏和语气来组织回应。这种模板化的语言风格,透着一股“专家正在缓缓向您揭示一个洞见”的味道。

更让人头疼的是措辞习惯。Opus 5 特别喜欢用抽象名词做句子的主语,以此来追求动词的“多样性”。结果就是,一句话读到末尾才知道它想说什么,而且中间绕了很大的弯子。 有人统计过它频繁使用的一些词:load-bearing(承重)、seam(接缝)、provenance(出处)、vacuous(空洞的)。这些词本身不冷僻,但被高频地塞进各种不相关的上下文里,就变得格外扎眼。

事情没那么简单。

这些语言习惯不是孤立的问题。它们串联起来,形成了一种让读者极度疲劳的阅读体验。每句话都要拆解一层隐喻才能抓到实意,每段话都要跳过一堆装饰性的表达才能找到干货。这种消耗是持续叠加的,用上半个小时,人就容易烦躁。

为什么那套话术让用户那么烦躁?

人类对重复的容忍度其实并不低。一个高中老师每隔四十八秒就说一次“那种东西”,学生只会觉得好笑,不会生气。一个朋友总是讲同样的冷笑话,大家顶多翻个白眼。那为什么 Opus 5 那些重复的措辞和模板化的结构,会让用户产生近乎生理性的反感?

关键在于:重复的频率和覆盖的广度。一个人的口头禅,只在特定的场合出现。但 Opus 5 的“口头禅”出现在每一段回复里,而且覆盖所有话题。 当你跟一个人聊天,他偶尔冒出一句惯用语,你还能当作个人特色。但当你在八个小时的工作里,每一段文字都塞满了同样的句式、同样的转折、同样的收尾,这种重复就不再是“特色”,而是“噪声”。

还有一个更深层的原因:这些措辞本身带有一种“我说的话很重要”的姿态。 每一句都像是在揭示什么了不起的洞见,但实际内容往往很平淡。这种“高姿态”和“低信息量”之间的落差,会让人产生一种被糊弄的错觉。

真相可能更扎心。

一个模型把“诚恳的纠错”和“坦白的过失”写进每一段回复,反而让人觉得它根本不诚恳。那些“老实说”“坦白讲”“让我诚实地说”之类的短语,高频出现之后,就只剩下一种表演式的谦卑。 用户不傻,这种套路用多了,信任感反而会崩塌。

一个连简单指令都听不进去的模型,算什么聪明?

如果说语言风格的问题还能忍,那“不听话”的问题就真的没法忍了。

Opus 5 在跟从指令方面的表现,让大量用户感到崩溃。有人在系统提示里、在 CLAUDE.md 文件里、在记忆设置里,用各种方式反复强调“不要写注释”,但模型依然我行我素地在每个代码块里塞满冗长的解释。 更离谱的是,当你指出它没有遵守指令时,它会说“好的,我不会再犯了”,然后在下一轮对话里照做不误。

有人尝试用更严苛的方式限制它。在提示词里明确写了“只需要三句话以内的回答”,但 Opus 5 依然会输出一大段文字。有人在回答里加了一条硬性规则:如果输出超过一百五十个单词,就触发拦截钩子,强制让它重写。这个方法确实管用,但需要额外搭建工具链,普通用户根本折腾不起。

还有一个让人哭笑不得的现象:当用户问了一个比较宽泛的问题,Opus 5 会默认把它当成一个“任务指令”,然后直接开始执行。它连“你是在问我的看法,还是想让我动手做”这种最基本的意图区分都做不好。 结果就是,用户只是想聊一下某个设计方案,模型却已经开始改代码了。

这哪里是协作,这分明是添乱。

一个需要靠“拦截钩子”和“强制重写”才能勉强听话的工具,再聪明也是白搭。因为使用它的每一分钟,用户都在跟它的“自作主张”做斗争,而不是在推进工作。

代码注释的“自产自销闭环”,有多可怕?

Opus 5 对注释的痴迷,已经超出了“啰嗦”的范畴,变成了一种系统性的污染。

正常的代码注释,是为了帮助后来者理解代码的意图。但 Opus 5 写的注释,更像是在给自己记笔记。 它会写下“这里加了参数 bar,因为不能再通过 frob 自动推导 bar”这类内容。这种信息放在提交说明里是合适的,但塞进代码注释里,只会让阅读代码的人摸不着头脑。

更麻烦的是,这种注释风格会自我复制。项目里的注释多了之后,Opus 5 在后续的修改中会主动“学习”这种风格,然后写出更多类似的注释。 一个最初只有十几条注释的代码库,在经历几十次由 Opus 5 驱动的改动之后,注释占比可能会逼近代码本身的三倍。

有人试图用更直接的指令来制止它,比如在系统提示里写“不需要解释为什么做这个改动,只需要把代码改好”。但 Opus 5 会无视这条指令,照旧在每个函数上方堆砌一段“背景说明”。 更讽刺的是,当你问它“为什么又写了注释”,它会承认自己的问题,然后在下一次提交中继续犯同样的错误。

这不是“不听话”三个字能概括的了。这是一种结构性的缺陷——模型在训练过程中已经被“调教”成了一种凡事都要留备注、凡事都要写文档的惯性。 而这种惯性,在真实的开发场景里,就是灾难。

想想看:一个模型写的注释越多,后续模型读到的注释也越多,然后它会写出更多的注释。 这套“自产自销”的闭环一旦形成,注释的数量只会单向增长。而删除注释的工作,最终还得落到人类头上。

基准测试没骗人,只是测错了东西

为什么一个在基准测试里表现优异的模型,在实际使用中会让人这么难受?

答案可能很简单:基准测试不考“沟通能力”。 目前所有主流的大模型评测体系,衡量的是推理能力、知识面、代码正确性这些硬指标。但没有哪个榜单会去测“这个模型写的东西好不好读”“这个模型会不会自作主张”“这个模型能不能老老实实听人话”。

于是,模型厂商有足够的动力去优化那些“被测量的东西”,而忽略那些“不被测量的东西”。 当 RLHF 的奖励信号主要来自“任务是否完成”和“答案是否正确”时,模型自然会朝着“不惜一切代价完成任务”的方向演化。至于任务完成的过程中它说了多少废话、塞了多少垃圾注释、曲解了多少次指令——这些都不在评分体系里。

这种“指标偏差”带来的后果是:模型的硬能力确实在涨,但软体验在跌。 用户拿到手的,是一个“更会做题”但“更不会说话”的助手。这个助手可以在一道数学题上给出完美答案,却不能在写代码的时候忍住不加那段没用的注释。

这不就是典型的“应试教育”吗?

一个模型可以被训练到在 SAT 语文部分拿满分,但跟它对话的时候,它依然会用一种极其别扭的方式组织句子。这恰恰说明,它学的是“考试的套路”,而不是“沟通的实质”。 那些高频出现的“load-bearing”“seam”“provenance”,就是它在训练过程中学会的“高分表达”。这些词在某个语境里确实能用,但被生搬硬套到所有场景之后,就成了噪声。

一个模型如果连“在什么场景用什么话”这种最基本的语用感都丢了,那它在基准测试里考再高分,又有什么意义?

说到底,人跟 AI 的关系,本质上还是沟通。模型输出的每一句话,都是它跟用户之间的“接口”。这个接口如果越来越难用、越来越让人烦躁,那它的内在能力再强,也会被这层糟糕的界面给封印住。 Opus 5 的经历说明了一个很朴素的道理:更聪明 ≠ 更好用。当一个模型开始说“人话”都费劲的时候,它离“好用”就越来越远了。也许下一次模型更新,厂商们应该把“沟通体验”写进评测指标里——毕竟,一个连话都说不清楚的助手,再聪明也帮不上忙。

总之,Opus 5三个沟通恶化信号无法忽视:语言风格让人头疼、更聪明却更不听话、代码注释泛滥成灾。

也有人认为:

  • 越聪明越难用,本质是提示词思维过时了。 Opus 5不是失控,是旧规则框架在反噬——删掉注释禁令、换成"对齐周围代码风格",问题自消。
  • 删掉80%的死板规则,用清晰的接口设计代替硬指令,把微操换成判断空间,才是驾驭新模型的正解。