DeepSeek V4.1 Flash吊打Vision Exp:少用43%token快38%

DeepSeek V4.1 Flash用18分49秒干完的活,V4 Flash Vision Exp花了30分11秒!

别急着相信“速度越快成本越低”这句话,事情没那么简单!

2026年9月8日,DeepSeek在官方交流群丢出一颗重磅炸弹——V4.1 Flash中间版本开启限时内测。新模型采用全新结构,原生支持多模态,能力更强、速度更快、成本更低。消息一出,开发者社区炸了锅。有人连夜把API key怼进终端,有人直接在社交平台晒出507 tokens每秒的逆天速度。

但跑完测试的人发现一个诡异现象:速度确实快了,钱包也瘪得更快了。官方说“成本更低”,开发者说“5分钟10块钱”。同一个事实,两种完全不同的解读。这中间到底发生了什么?

一位叫Diru14的开发者做了一组对照测试。他用同一个提示词、同一个技能文件和同一份App规格说明书,让两个模型分别搭建一个叫ApplyTrack的全栈应用——SvelteKit加TypeScript加Tailwind加SQLite,一套标准的现代Web开发组合拳。

结果出来了:V4.1 Flash全程耗时18分49秒,总用量11.59M tokens;V4 Flash Vision Exp耗时30分11秒,总用量20.31M tokens。前者快38%,省43%的token,生成速度361 tok/s对120 tok/s,接近三倍差距。单看数据,V4.1 Flash完胜。但仔细一琢磨,不对劲。

速度翻了三倍,token省了四成,但账单为什么反而更烫手?

DeepSeek官方说V4.1 Flash“成本更低”。但内测定价表摆在那里——空闲时段缓存命中输入每百万tokens0.05元,缓存未命中输入1.5元,输出4.5元。这个价格和V4 Flash完全一样。单价没变,哪来的“成本更低”?答案藏在另一个数字里:总用量。V4.1 Flash完成同一任务消耗11.59M tokens,V4 Flash Vision Exp消耗20.31M tokens。省了43%的token,按相同单价算,账单确实该降43%。但开发者实测反馈却是“5分钟10块钱”“瞬间几十块没了”。单价没变、token少了,为什么花钱反而更快?

因为速度太快了。V4.1 Flash每秒吐出361个token,是Vision Exp的三倍。同样一分钟,前者生成的文字量是后者的三倍。如果按token计费,速度越快,单位时间内消耗的token就越多,账单累积速度也就越快。官方说的“成本更低”是完成特定任务的总成本——因为总token少了。开发者感受到的“烧钱更快”是单位时间内的支出速度——因为生成太快了。同一个事实,从不同时间尺度看,结论完全相反。这就怪了!

一个叫“expires-on-0910”的模型,只活两天的闪电侠!

V4.1 Flash的模型ID里藏着一个残酷的提示:deepseek-v4.1-flash-expires-on-0910。9月10日自动过期下线。从9月8日上线到9月10日消失,满打满算两天窗口期。这不是正式发布,这是一次限时压力测试。DeepSeek在官方反馈问卷里直接问内测用户:“你觉得这个模型能全面替换线上的DeepSeek V4 Pro么?”。Flash的价格、Pro的能力——这才是V4.1 Flash的真正野心。

但两天能测出什么?一个全栈应用从零搭建到跑通,18分49秒。一个开发者从接到通知到跑完测试,可能也就几个小时。20路并发的限流,适合功能验证不适合大规模线上业务。这些限制条件叠加在一起,指向一个清晰的信号:DeepSeek在收集极端场景下的真实反馈,而不是在推销一个成熟产品。

V4 Flash Vision Exp:上线20天就被亲兄弟碾压的短命实验品

要理解V4.1 Flash的凶猛,得先搞清楚它踩在谁的肩膀上。2026年8月21日,DeepSeek上线了V4-Flash-Vision-Exp。这是V4系列第一款原生支持图片输入的视觉模型。官方明确标注“Exp”实验版本,在纯文本能力上和V4 Flash正式版持平,但在需要视觉理解的Agent任务上实现大幅跃升,多模态Agent能力接近Opus-4.8。3050亿参数,支持JPEG、PNG、GIF、WebP等主流图片格式。8月31日开源模型权重。从上线到开源,10天。

然后9月8日,V4.1 Flash来了。新模型把多模态从“实验性扩展”升级为“原生支持”。以前处理图文混合输入需要额外挂载视觉扩展包,现在不用了,模型出厂就自带这个能力。20天前还是“首款”、还是“实验”、还在“接近”Opus-4.8的Vision Exp,20天后就被亲兄弟按在地上摩擦。同一任务端到端,V4.1 Flash全面碾压Vision Exp,SVG代码生成快6倍,长上下文检索快5倍多。这种迭代速度,不是小修小补,是直接换引擎。

361 tok/s vs 120 tok/s:三倍速度差背后藏着什么秘密?

Diru14的测试里有一个关键数字常被忽略:缓存命中率。V4.1 Flash缓存命中99.5%,Vision Exp缓存命中99.7%。两者几乎持平,都极高。这意味着两个模型在测试中绝大部分输入都走了缓存,没花什么钱。真正拉开差距的是输出侧:V4.1 Flash输出126K tokens,Vision Exp输出154K tokens。前者输出少了28K tokens,但生成速度是后者的三倍。少吐字、吐更快——这是效率的双重胜利。

但这里有个更深层的问题:为什么V4.1 Flash能用更少的token完成同样的任务?官方说法是“采用新的模型结构”。有开发者观察发现,这次更新不是在上一版模型上简单后训练,似乎重做了预训练。如果真是从头训的,那V4.1 Flash本质上是一个全新的模型,只是借了V4的名头。

新架构带来了更高效的token利用效率——同样的任务,不需要吐那么多字就能表达清楚。这比单纯堆速度更有价值。速度可以靠硬件和工程优化,token效率要靠模型本身的智商。

但社交平台上已有开发者晒出507 tokens/s的峰值速度。V4.1 Flash最低也有300 tok/s,最高能到600 tok/s。持续吐字速率稳定在355 tok/s,峰值突破365 tok/s。与V4 Pro相比,持续吞吐速度提升了5.7倍(355 tok/s对63 tok/s),首字延迟缩短77%(178ms对766ms)。生成1500字内容从24.7秒压缩到4.4秒,节省82%的等待时间。

这些数字放到真实编程场景里,意味着什么?意味着你写一行提示词按回车,对面已经开始往外吐代码了,你还没反应过来,几百行已经出来了。对于需要频繁试错的编程场景,这种速度提升的实际价值,可能比跑分上涨更容易被用户感知。

“5分钟10块钱”:当速度变成一种昂贵的体验

开发者“5分钟10块钱”的吐槽戳中了一个微妙的事实。按V4.1 Flash的输出速度361 tok/s算,5分钟能吐出108,300个token。按输出价格每百万tokens4.5元算,108K tokens大约值0.49元。离10块钱差着20倍。

问题出在哪?要么开发者跑的不是纯输出任务,输入侧也消耗了大量token;要么测试中缓存没命中,走了更贵的未命中价格;要么“5分钟10块钱”是包含了多次尝试的总成本。不管哪种解释,都指向同一个结论:速度是把双刃剑。快,意味着单位时间内能完成更多任务;也意味着单位时间内消耗更多token。如果任务本身不需要那么快——比如你写一行代码要思考30秒,模型0.3秒就吐完了——那多出来的速度只是让模型干等着。钱花了,体验没提升。

但换个场景:让模型在18分49秒内从零搭建一个全栈应用。这个速度意味着什么?意味着你脑海里有个想法,坐下来打开编辑器,输入需求,然后去倒杯水,回来代码已经能跑了。传统开发流程中光环境配置可能就要半小时。V4.1 Flash把“从想法到原型”的时间压缩到了冲一杯咖啡的工夫。这种场景下,速度本身就是价值。你花钱买的不是token,是时间。而时间,在某些场景下比token贵得多。

四十天六次更新:DeepSeek在下一盘什么棋?

把时间线拉长看,V4.1 Flash不是孤立事件。7月31日,V4 Flash正式版API上线公测。8月13日,V4 Pro正式版发布,同日DeepSeek Harness开发者预览版开源。8月19日,Harness迭代新版本。8月21日,V4 Flash Vision Exp上线API平台。8月31日,Vision Exp开源。9月8日,V4.1 Flash内测。不到40天,围绕模型、原生多模态和Agent开发工具连续六次更新。这种节奏不是在修补,是在铺路。

DeepSeek Harness是什么?它是DeepSeek开源的智能体运行框架,基于Node.js,采用“一切皆插件”的架构。它不是模型,是让模型能调用文件系统、终端、网页、代码工具的那套基础设施。Harness的出现意味着DeepSeek不满足于只卖模型API,它想提供从模型到Agent落地的完整链路。

Flash的速度提升放到Harness的上下文里,价值被放大了——更快的模型意味着Agent能在更短时间内完成更多工具调用和任务迭代。Vision Exp解决的是“模型能不能看懂图”的问题。V4.1 Flash解决的是“模型能不能又快又准地干活”的问题。Harness解决的是“模型能不能自己调用工具把活干了”的问题。三条线并行推进,指向同一个方向:让AI从“聊天对象”变成“能自主做事的智能体”。

用Flash的价格买Pro的能力:这笔账到底怎么算?

DeepSeek在反馈问卷里问的那句话值得再读一遍:“你觉得这个模型能全面替换线上的DeepSeek V4 Pro么?”。V4 Pro的价格是多少?高峰时段每百万tokens输出27元。V4 Flash的价格是多少?输出4.5元。差6倍。如果V4.1 Flash能以Flash的价格提供接近Pro的能力,那整个定价体系就塌了。没人会花6倍的钱买一个更慢的模型,哪怕它稍微聪明一点。

但“接近Pro”和“等于Pro”是两码事。SWE-bench Verified榜单上,DeepSeek V4.1 Pro得分约69%,V4.1 Flash约63%。6个百分点的差距在编程任务上意味着什么?可能意味着一次代码审查多改几处bug,也可能意味着多跑一轮测试才能通过。

V4.1 Flash的速度优势能不能抵消这6个百分点的能力差距?取决于具体任务。写一个CRUD应用,63%和69%的差距几乎感觉不到——反正都能跑通。写一个复杂的算法优化,6个百分点可能就意味着能不能找到最优解。DeepSeek在试探的,正是这条模糊的边界——用户在什么场景下愿意用速度换智商,在什么场景下必须用智商换速度。

V4.1 Flash 9月10日就过期了。两天的内测窗口,20路并发的限流,实验性质的模型ID。这些信号拼在一起,指向一个判断:V4.1 Flash不是终点,是DeepSeek在找一条从“又快又便宜”到“又快又强又便宜”的路径。如果内测反馈正面,正式版可能直接取代V4 Pro。如果反馈负面,那就继续调、继续训、继续测。反正模型名字里的“expires-on-0910”已经把态度写清楚了——这只是个实验,别当真。

但开发者已经当真了。有人在社交平台写道:“V4.1 Flash带来的能力跨越极为突出”。有人说“它明显是GLM5.3 Flash之上的一步,甚至可能比GLM5.3本身更好”。还有人干脆问:“V4 Pro还有什么用?”。两天后这个模型就会消失,但它留下的问题不会消失:如果速度可以这么快、token可以这么省、价格可以这么低,那之前的模型到底在干什么?这个问题,DeepSeek可能自己也还在找答案。

内测群里有人让V4.1 Flash生成一个HTML页面,内容是SVG绘制一只鹈鹕骑自行车。模型输出速度328 tokens/s。生成的动画整体感觉还行,但“鹈鹕骑车”的场景看起来像在骑倒车。

模型没发现这个bug,直接吐出来了。速度快到连错误都来不及检查。这大概是V4.1 Flash最真实的写照——它跑得飞快,但还没学会回头看自己跑过的路。