DeepSeek把Pro流量全部路由到Flash:旗舰被自家更便宜的干掉了

Flash干掉了Pro,DeepSeek把自家旗舰模型当场报废!

DeepSeek刚刚宣布,更便宜的V4.1 Flash全面碾压了贵三倍的V4 Pro,还要把Pro的请求全部转到Flash上!

2026年9月10日,DeepSeek将正式发布V4.1 Flash模型。官方通告就一句话:经内部及外部多方测试,V4.1 Flash在性能、费用、速度、总用时等各项指标上已全面超越V4 Pro。全面超越,四个字,一个不留余地。然后DeepSeek干了一件事:所有原本发给V4 Pro的API请求,全部路由到V4.1 Flash,按Flash的便宜价格计费。

Pro没了。不是停产,不是下架,是直接被一个更便宜的型号替代了。一家AI公司,亲手把自己售价三倍的旗舰模型判了死刑。

40天,从旗舰到废铁

要理解这件事有多离谱,得先知道V4 Pro是什么。

2026年4月24日,DeepSeek发布V4系列预览版。8月13日,V4 Pro正式版上线。1.6万亿总参数、490亿激活参数的混合专家(MoE)架构,100万token上下文窗口,384K最大输出。这是DeepSeek的旗舰,是门面,是开发者愿意付三倍价格去调用的那个模型。

价格呢?Pro是Flash的三倍。高峰时段每百万输出token,Flash收9元,Pro收27元。

然后40天后,V4.1 Flash来了。不是V5,是V4.1,一个小版本号。但官方说它全面超越了Pro。

一家公司花了111天打磨的旗舰产品,被40天后出来的小版本干翻了。这不是迭代,这是背刺。

DeepSeek自己问用户:Flash能不能把Pro替了?

更有意思的是DeepSeek的做法。

V4.1 Flash开启内测时,官方配套了一份反馈问卷。问卷里有一道题:“你觉得这个模型能全面替换线上的DeepSeek V4 Pro么?”

选项有四个:可以、不可以、不确定、其他。

一家公司让用户评估自己更便宜的产品能不能把更贵的产品干掉。这相当于苹果发完iPhone Pro Max,隔了一个月发iPhone SE,然后问用户:“你觉得SE能不能把Pro Max替了?”

DeepSeek内部显然已经有了答案。内测48小时,9月8日上线,9月10日过期。然后9月9日直接宣布:正式版9月10日发布,Pro流量全部转Flash。48小时的内测,不是用来验证“能不能”,是用来走个过场。

每秒284个token,比Pro快三倍

数字不会说谎。

V4 Pro生成速度约每秒97个token。V4.1 Flash达到每秒284个token。接近三倍。有开发者测出了507 tokens/s的峰值。

在49k超长上下文检索场景下,新模型的处理速度快了5.2倍;SVG代码生成快了6.0倍;Manacher回文算法题解答快了4.6倍。

价格呢?9月10日中午12点起,Flash系列降价。空闲时段缓存命中输入从0.05元降到0.02元每百万token,降幅60%;缓存未命中输入从1.5元降到1元;输出从4.5元降到4元。

速度翻三倍,价格还往下降。Pro怎么打?

Pro的用户在付三倍价钱,得到更差的东西

这就引出了一个尴尬的问题:在V4.1 Flash上线之后、V4.1 Pro上线之前,所有调用V4 Pro的用户,实际拿到的是V4.1 Flash的响应,但Pro的用户以为自己还在用Pro。

DeepSeek的逻辑是:既然Flash全面超越了Pro,继续给用户提供性能更差、速度更慢、价格更贵的Pro是不合适的。这个逻辑在道理上完全成立。但商业上呢?Pro的用户付着三倍的钱,得到的是一个更便宜模型的服务。他们不知道。或者他们知道,但没得选。

这不是升级,这是强制平替。

V4.1 Pro正在开发中,但没有人知道它是什么

通告里有一句被大多数人忽略的话:“在V4.1 Flash正式上线之后、V4.1 Pro上线之前”。

V4.1 Pro存在。DeepSeek的技术团队成员崔天翼在社交平台上证实了这一点。但V4.1 Pro没有任何模型卡、没有任何技术报告、没有任何端点回应它的名字。它只在路由通知的从句里出现了一次。

有观察者猜测,V4.1 Pro的存在意味着DeepSeek已经“解决了V4系列架构上的问题”。但这个猜测没有任何证据支撑。V4.1 Pro到底是什么?参数多少?什么时候发布?没人知道。

唯一确定的是:V4 Pro已经被放弃了。DeepSeek跳过了对Pro的优化,直接去开发V4.1 Pro。而V4.1 Pro上线之前,所有Pro流量都会被Flash吃掉。

这不是第一次Flash干翻Pro

回头看V4系列的历史,Flash干翻Pro其实有先例。

7月31日,DeepSeek V4 Flash正式版API率先上线公测。Flash正式版的后训练升级,让它在Agent能力上做到了“基准测试远超V4-Pro-Preview”的程度。一个Flash的正式版,在预览版阶段就把Pro的预览版比下去了。然后8月13日Pro正式版上线,补上了后训练这一课。

但补上了也没用。40天后V4.1 Flash又来了,这次是架构层面的更新,不只是后训练。V4.1 Flash是DeepSeek第一款原生多模态模型——不是外挂视觉编码器,是出厂就自带图文一体化输入输出。

V4 Flash Vision-Exp是“外挂式”——在纯文本底座上外接视觉编码器和对齐器。V4.1 Flash不用挂东西,自己就能看图。有测试显示,同一张图片的描述任务,V4.1用了7.6秒,旧Flash跑了751秒。751秒对7.6秒,差了将近100倍。

架构层面的优势,后训练补不回来。

“智能密度”这个词,DeepSeek自己提的

钛媒体的一篇报道提到,DeepSeek正在追求极致的“智能密度”。

这个词什么意思?简单说就是:用更少的计算资源,产出更多的智能。2025年12月的V3.2报告里,DeepSeek第一次提出这个概念。原因很直白:为了达到顶级模型的输出质量,它需要生成更长的推理过程,而等待时间已经变得太重要了。

V4早期模型卡提到,Flash在获得更多思考预算后,推理表现能接近Pro,但在知识和最复杂的Agent工作流上仍然落后。V4.1 Flash补上了这个差距——不只是接近,是全面超越。

这不是渐进式改进。这是把“智能密度”这条路走通了之后的一次跳跃。

但事情没那么简单

速度翻三倍、价格往下降、全面超越Pro——听起来完美。但实测数据里藏着一些让人不安的东西。

有开发者在V4.1 Flash内测期间跑了14组任务,累计消耗3亿token。结论是:模型吐字更快,但交付未必更快。为什么?因为复杂任务中,模型调用工具验证的时间更长了。生成速度快了,但总耗时可能反而更长。

同一个测试还发现,在降价之前的计费标准下,V4.1的测试账户花得比旧版V4 Flash更多。有报道称,同计费下总花费比旧版V4 Flash高36%。

速度快了,但花的钱也多了。因为模型在复杂任务里走了更多步。这就是“智能密度”没有解决的问题——更聪明的模型可能会做更多的事,而更多的事意味着更多的token消耗。

开发者社区的反应:有人欢呼,有人质疑

Reddit上DeepSeek板块的讨论很有意思。

有用户说刚充了20美元就看到V4.1 Flash的消息,觉得时机完美。立刻有人回:20美元撑不过两小时。另一个用户说20美元用了一周,被建议优化输入提示词。

有人质疑V4.1 Flash在长期运行的复杂任务上不如V4 Pro,担心强制路由会影响自己的工作流。有人回应说DeepSeek这么做是因为需要把算力资源从推理挪到训练上去。

最扎心的评论来自一个叫“ExpertPerformer”的用户。他说美国公司不让订阅用户用API,是因为他们想让用户用量化版的网页版——更差的上下文窗口、更严格的配额。另一个用户接了一句:原因很简单,他们是美国人,贪婪是游戏的名字,用户体验是个陌生概念。

这些评论不一定对,但它们捕捉到了一种情绪:当一家中国AI公司的Flash模型能干翻自家Pro的时候,美国那些卖20美元月费还不给API的公司,显得越来越尴尬。

未解的问题

文章写到这里,有几个问题没有答案。

第一,V4.1 Flash的完整参数和基准测试成绩是什么?DeepSeek至今没有发布技术报告。官方说的“全面超越”是内部和外部测试的结果,但具体数字没有公开。

第二,V4.1 Pro到底是什么?什么时候发布?它和V4.1 Flash是什么关系?没有人知道。

第三,强制路由会持续多久?通告说“V4.1 Pro上线之前”。但如果V4.1 Pro三个月后才上线,Pro的用户就要付三个月的三倍价格,拿到Flash的服务。

第四,V4.1 Flash在复杂Agent工作流上的表现到底怎么样?早期测试显示它“在知识和最复杂的Agent工作流上仍然落后”。这个差距在V4.1 Flash上补上了吗?官方说全面超越,但独立验证还没有出来。

第五,也是最大的一个:如果Flash已经能全面超越Pro,那Pro这个产品线还有存在的必要吗?V4.1 Pro出来之后,它和V4.1 Flash的差距是什么?如果Flash每次迭代都能干掉上一代Pro,那Pro的意义是什么?

这些问题,DeepSeek没有回答。9月10日V4.1 Flash正式上线后,开发者会自己找出答案。而V4.1 Pro的存在本身,已经暗示了一个更大的问题:DeepSeek可能自己也不知道Pro和Flash的边界在哪里。