跑分战神还是体验刺客?DeepSeek V4 Pro翻车事件全拆解!
把1.6万亿参数的模型跑出2840亿参数的水平,这需要多大的技术“创意”?
摘要:DeepSeek V4 Pro正式版上线不到24小时即遭撤回,官方跑分直逼Fable 5,第三方实测却仅比Flash高1分。长文本提前终止、输出机械重复、不同用户体感天差地别——这场“静默发布、高调撤回”的闹剧背后,三个致命的技术失误浮出水面。
静默发布,高调翻车
8月12日夜里十一点半,DeepSeek V4 Pro正式版上线了。没有发布会,没有通稿,就这么静悄悄地进了API文档。
官方数据很炸。Terminal Bench 2.1拿了87.9分,跟Fable 5就差0.1分。社区瞬间沸腾,“梁圣”的呼声刷了满屏。
然后呢?不到24小时,官网横幅撤了,开放平台公告删了。API还在,模型还能调,但官方自己把“官宣”给吞回去了。这场面,就像一个人发了条朋友圈炫耀新手机,半小时后默默删掉——大家都看见了,但谁也不知道发生了什么。
第三方实测数据陆续出来了。Artificial Analysis平台评分53分,比V4-Flash-0731的52分只高了1分。等一下——Flash是2840亿参数,Pro是1.6万亿参数,体量差了四倍多。四倍参数换一分增长?
更诡异的是,不同人测出来的结果完全不一样。鹈鹕骑自行车、糖果、密码这些测试里,有人觉得提升了,有人测出来跟旧版一模一样。同一个模型,在A手里是战神,在B手里是智障。
这就怪了。
三处“临时工操作”,把旗舰模型变成了薛定谔的AI
一个流传的说法指向了承包商的操作失误。具体来说,三件事出了问题。
第一件,量化缩放因子被乘了两次。
V4 Pro用了FP8动态量化来节省显存。这本来是个常规操作——把高精度的权重压缩一下,跑起来更快,占的地方更少。但在加载权重的时候,有人把缩放参数多乘了一次。结果就是权重的有效动态范围被压缩到原来的1/256。打个比方:原本音量旋钮从0到100都能调,现在只剩下0到0.4能用了。
这个精度损失在短文本里看不出来,但一旦上下文超过三万个Token,注意力就开始“漂移”。模型输出的语义慢慢偏离原本的意思,像一个人说着说着就开始跑题,越跑越远。
第二件,KV缓存被截断了。
V4 Pro官方宣称支持100万Token的上下文。但在部署脚本里,有人把最大缓存长度设成了16384,而不是1048576。还顺手开了个“动态缓存回收”来优化显存。
输入超过一万六千个Token会发生什么?系统开始强行踢掉早期的缓存内容,然后频繁重新计算。响应延迟翻了三倍以上,生成的内容要么提前中断,要么陷入重复循环。
那些抱怨“长任务提前停止”“反复思考”的开发者,他们遇到的就是这个。一百万的上下文窗口,实际能用的只有一万六——剩下那九十八万四就是个摆设。
第三件,采样参数被硬编码成了“刷分专用”。
为了“提高基准测试分数”,有人把推理服务的默认温度设成了0.05,而不是官方推荐的0.7。温度0.05意味着什么?模型几乎只选概率最高的那个词,输出极度确定,毫无多样性。同时,重复惩罚从1.1被改成了1.0——相当于不设惩罚。
这套参数组合在短答案测试里能拿高分——因为答案固定、确定性强、容易精确匹配。但在真实复杂的生成任务里,输出机械、僵硬、频繁重复。就像让一个即兴喜剧演员照着剧本一个字一个字念——东西是对的,但完全不好笑。
精度丢了,缓存废了,采样僵了。三个问题叠在一起,官方跑分好看得要命,实际体验烂得要死。
跑分与体感之间,隔着三个承包商的“创意”
这个案例有意思的地方在于:每一个“失误”单独看,都像是无心之过。
缩放因子乘两次?手滑。缓存长度写错?眼瞎。温度设成0.05?想刷分想疯了。
但把三个放在一起,画面就变了。
精度损失导致长文本漂移,缓存截断导致长文本崩溃,低温导致输出机械重复。这三个问题在短文本、短答案的基准测试里几乎看不出来——恰恰就是在官方用来刷榜的那些测试里看不出来。一旦扔进真实场景——长文档、多轮对话、复杂代码生成——全部暴露。
这不叫巧合。这叫“为评测优化,而非为用户优化”。
官方团队据说已经准备回滚到预览版配置。但问题不只是“回滚”能解决的——它暴露了整个行业的一个深层病灶。
当“刷分”成为默认操作,评测就变成了自娱自乐
基准测试本来是用来衡量模型真实能力的工具。但现在,它变成了被优化的目标。
温度调低能提高精确匹配率——那就调低。重复惩罚去掉能让短答案更“干净”——那就去掉。缓存截断在短文本评测里看不出问题——那就截断。每一项调整单独看都是在“优化性能”,合在一起就是在制造一个只在评测里能打的纸面巨人。
而那些真正用模型干活的人——写代码的、做分析的、跑长任务的——他们拿到的是一个完全不同的东西。
这就是“评测导向优化”和“使用导向优化”的根本冲突。前者追求的是在特定数据集上拿到最高分,后者追求的是在任何场景下都能稳定输出。前者的成果是一张漂亮的成绩单,后者的成果是一个靠谱的工具。
V4 Pro的遭遇证明了一件事:当这两者发生冲突的时候,受伤的永远是用户。
一个1.6万亿参数的模型,被跑出了2840亿参数的效果。这中间的差距,不是技术能力的差距,是价值排序的差距——是把“看起来好看”放在了“用起来好用”前面。
撤回容易,信任难修
8月13日晚,官方重新发布了公告确认上线,还顺势推出了峰谷定价和开源Agent框架。看起来一切照旧。
但“疑似回滚”这个标签,恐怕要跟着V4 Pro跑一阵了。API定价还是Flash的三倍。如果性能真就只比Flash高1分,那这溢价买的是什么?买个“官方跑分很好看”的心理安慰吗?
撤回公告只需要点一下鼠标。撤回用户的信任,可没那么简单。当一个模型被发现有“刷分专用”的配置参数,所有跑分数据都得打个问号——这次被抓到了,以前那些“惊艳”的成绩呢?
一场静默发布、高调撤回、重新上线的闹剧,24小时之内演完了一出完整的荒诞剧。社区从“梁圣回归”到“临时工背锅”,只隔了一个实测的距离。
这场闹剧的真正教训不是“别信跑分”——跑分本身没错。真正的教训是:当一个系统同时存在“刷高分的动机”和“操控分数的能力”时,跑分就不再是衡量工具,而变成了营销道具。
V4 Pro的遭遇只是一个缩影。真正值得追问的是:还有多少模型的跑分,是靠着“临时工操作”撑起来的?
总结:DeepSeek V4 Pro因承包商三重失误——量化缩放因子重复乘、KV缓存截断至1/64、采样参数调成刷分模式——导致跑分炸裂体验拉胯,上线24小时即撤回。跑分可以刷,信任刷不了。