DeepSeek V4.1 Flash用1%的钱干出了98%的活儿,GPT-6 Astra的脸往哪搁!
OpenDesign刚刚扔出一颗炸弹,DeepSeek V4.1 Flash以GPT-6 Astra百分之一的成本,拿下了它百分之九十八的平均得分!
OpenDesign对DeepSeek V4.1 Flash进行了基准测试,结果发现它在日常设计任务中仅用1.4%的成本就达到了GPT-6 Astra 98%的分数,同时输出速度高达300+tokens/s,远超大多数竞品。
一分钱一分货这个老理儿,被DeepSeek一脚踹翻了
你买东西的时候是不是也这么想:便宜没好货,好货不便宜?
这道理放在AI大模型身上,过去几年确实管用。OpenAI的GPT-6 Astra,2026年9月3日刚发布,被官方称为“全球最智能、对齐最好的模型”。Claude Fable 5.1, Anthropic的当家花旦,贵得离谱。这些顶级模型的价格,让普通开发者和中小企业望而却步。GPT-6 Astra在OpenDesign评测里,平均每个任务成本1.61美元。Claude Fable 5.1更夸张,单份成本3.66美元。做个设计任务就要花两三美元,一天做几十个任务,钱包根本扛不住。
然后DeepSeek V4.1 Flash来了。
OpenDesign Arena的评测数据摆在那里:DeepSeek V4.1 Flash平均任务得分81.2分(满分100),平均任务成本0.023美元。GPT-6 Astra平均任务得分82.7分,成本1.61美元。81.2除以82.7,正好98%。0.023除以1.61,正好1.4%。
这不是接近,这是碾压式的性价比!
这个OpenDesign到底什么来头,凭啥它的评测能信
你可能会问:这评测靠谱吗?不会是DeepSeek自己花钱买的榜吧?
OpenDesign可不是什么野鸡评测机构。2026年9月8日,OpenDesign发布了0.22.0版本,正式推出OpenDesign Arena。这个平台用OpenDesign Harness对十几个模型进行了系统性评估,比较的是设计质量和成本。评测涵盖需求完成度、设计质量、可交付率、完成耗时和成本五个维度。
它不是那种跑几个选择题就出排名的“刷分榜”。OpenDesign测的是真实设计任务——用户提出设计需求,模型给出设计方案,然后从多个角度打分。这种评测方式更接近实际使用场景,比纯学术 benchmarks 更有说服力。
更重要的是,OpenDesign Arena是公开平台,数据透明可查。DeepSeek V4.1 Flash在13个模型中综合排名第一。GPT-6 Astra虽然单项得分最高,但综合性价比被DeepSeek远远甩开。
这不是DeepSeek自己吹的,是第三方评测机构白纸黑字写着的。
三百个token每秒,这个速度让竞品集体破防
光便宜不够,还得快。
DeepSeek V4.1 Flash的内测用户报告显示,模型输出速度稳定在300到500个token每秒。有开发者实测让模型生成一个SVG鹈鹕骑自行车的2D动画,75.4秒完成任务,输出速度328 tokens/s。还有测试者晒出的速度超过500 tokens/s。
什么概念?你打一行字的时间,它已经吐出来几百个字的完整方案了。
对比一下:DeepSeek V4 Pro的持续吞吐量只有63 tokens/s。V4.1 Flash是它的五倍以上。响应速度从V4 Pro的766毫秒首token延迟,降到了178毫秒。你按下回车,几乎同时就看到第一个字蹦出来。
这种速度提升不是简单的数字游戏。在迭代式编码和UI原型设计场景里,频繁重试和快速反馈比单次长文本生成重要得多。你改一个需求,三秒钟之内就能看到新方案,这种工作流效率的提升是质的飞跃。
GPT-6 Astra刚登基,DeepSeek就把龙椅搬走了
GPT-6 Astra是2026年9月3日发布的。OpenAI说它是“全球最智能、对齐最好的模型”。官方公布的benchmark数据确实吓人:ARC-AGI-3得分99.9%,FrontierMath Tier 4得分97.6%,ExploitBench完成率100%。
但注意,这些是OpenAI自己公布的。
OpenDesign的评测是第三方独立进行的。GPT-6 Astra在OpenDesign Arena的平均得分82.7分。DeepSeek V4.1 Flash是81.2分。差距只有1.5分。
差1.5分,价格差70倍。
DeepSeek V4.1 Flash甚至还没正式发布。它只是在2026年9月8日开启了一个为期两天的限时内测。一个测试版模型,就在第三方评测里追上了刚刚登基的GPT-6 Astra。
正式版出来会怎么样?不敢想。
但事情没那么简单,这张成绩单有个致命伤
冷静一下。
OpenDesign评测的是“设计能力”,不是通用智能。GPT-6 Astra在ARC-AGI-3这种抽象推理benchmark上能拿99.9%。DeepSeek V4.1 Flash没测过这些。你说DeepSeek在通用智能上追上了GPT-6 Astra?没人敢打包票。
评论区有人说得直接:“It‘s benchmaxxed, like Gemini and astra, or will be nowhere close to gpt6 lol.” 翻译过来就是:这是刷榜刷出来的,跟Gemini和Astra一样,真实能力离GPT-6还差得远。
这话有道理吗?有。但也不全对。
OpenDesign评测的是“日常设计任务”,不是那种专门针对某个benchmark优化就能刷高分的题目。设计任务是开放的、多样化的,很难通过死记硬背来刷分。而且OpenDesign刚发布0.22.0版本,DeepSeek不太可能在短短几天内针对这个新评测体系做专门优化。
还有一点:DeepSeek V4.1 Flash目前连技术报告都没发布。参数规模不知道,架构细节不知道,官方benchmark数据也没有。我们手里只有第三方评测和社区实测数据。
一个连技术报告都没出的测试版模型,就已经在特定领域追平了GPT-6 Astra。如果DeepSeek把全部实力拿出来呢?
新架构原生多模态,DeepSeek这次动真格了
DeepSeek V4.1 Flash跟之前的V4 Flash不是同一个东西。
V4 Flash-0731是284B总参数、13B激活参数的MoE(混合专家)模型。V4.1 Flash采用了全新模型架构。最大的变化是原生多模态支持——不再是“文本主模型外加视觉插件”的拼接模式,图像理解和文本推理被整合进同一套模型体系。
这意味着什么?以前你给模型一张图再加一段文字描述,模型需要先把图交给视觉模块处理,再把结果拼接到文本模块,中间可能有信息断层。现在是一套系统同时处理图文,逻辑更连贯,理解更准确。
对Agent任务、识图做方案、图文混合处理这些场景,这是质的提升。
DeepSeek官方对V4.1 Flash的描述是四个关键词:新模型结构、原生多模态支持、更强能力、更快生成。
注意“更强能力”这个表述。DeepSeek自己说V4.1 Flash比V4 Flash更强。而V4 Flash在OpenDesign评测里只得了68.6分。V4.1 Flash直接跳到81.2分。
这跳跃幅度,不是简单调参能解释的。
价格还要降,DeepSeek这是要把桌子掀了
更狠的来了。
2026年9月9日,DeepSeek开放平台宣布:9月10日中午12点起,Flash系列API全面降价。空闲时段,每百万token缓存命中输入从0.05元降到0.02元,降幅60%;缓存未命中输入从1.5元降到1元;输出从4.5元降到4元。
高峰时段价格是空闲时段的两倍。
V4.1 Flash内测期间的价格跟V4 Flash一样。正式发布后会不会沿用新价格?大概率会。这意味着DeepSeek V4.1 Flash的使用成本可能比评测时显示的0.023美元还要低。
0.023美元已经够离谱了。GPT-6 Astra做一次任务的钱,够DeepSeek V4.1 Flash做70次。
这不是竞争,这是屠杀。
评论区有人调侃:“The way DeepSeek's arrow has to jump over Fable's insane outlier of a price is just chef's kiss.” DeepSeek的箭头跳过Fable那个离谱的价格 outlier,画面太美了。
但社区实测跟官方宣传对不上,这里头有猫腻
别急着高潮。社区实测数据跟官方宣传有出入。
DeepSeek官方宣传材料说V4.1 Flash的吞吐量是300+tokens/s,是V4 Flash的好几倍。但有独立开发者实测,beta版本只测到约108 tokens/s,跟V4 Flash-0731差不多,根本没有4到6倍的提升。
怎么回事?
一种解释是:内测版本部署在独立服务器上,资源充足,所以社区测出来300-500 tokens/s。独立开发者测的可能是在共享环境或者不同配置下的结果。另一种解释是:官方宣传的“300 tokens/s”是峰值或者特定条件下的数据,不是持续吞吐量。
不管哪种解释,都说明一个问题:别拿宣传数据当真理,等正式版出来自己测。
还有一个问题:DeepSeek V4.1 Flash目前只有官方公告和两天社区速度测试,没有官方规格表、没有技术报告、没有第三方benchmark成绩。Artificial Analysis截至写稿时都还没评测这个模型。
一个连正式评测都没有的测试版模型,就被捧成“GPT-6 Astra杀手”了?
这剧本我们见过。Gemini 3.8 Flash刚出来的时候也短暂刷到过第一。然后呢?然后就没有然后了。
如果DeepSeek真能用1%的钱干98%的活,整个行业都得重写规则
但话又说回来。
就算V4.1 Flash的真实能力只有GPT-6 Astra的90%,只要价格还是它的1%,这个性价比优势依然无人能敌。
就算速度只有宣传的一半,150 tokens/s依然比大多数模型快。
就算OpenDesign的评测有局限性,至少证明了一件事:DeepSeek在特定领域(设计、编码、Agent任务)已经具备了跟顶级模型掰手腕的能力。
评论区有人说得实在:我今天试了很多次,beta版离Astra或Fable还差得远。但这是个好模型,又快又便宜,完美适合简单工作或日常开发任务。
这就够了。
不是每个任务都需要GPT-6 Astra那种顶级智商。日常开发、原型设计、批量处理、迭代优化,这些场景需要的是“足够好+足够快+足够便宜”。DeepSeek V4.1 Flash恰好卡在这个生态位上。
评论区还有人说了句大实话:按照目前的发展速度,用更便宜的模型复制Astra的能力只需要两到三个月。
如果这个趋势持续下去,顶级AI模型的价格壁垒会被彻底击穿。GPT-6 Astra那种动辄每任务一两美元的价格,还能撑多久?
DeepSeek V4.1 Flash在OpenDesign的评测里拿到了81.2分,成本只要0.023美元
这是第三方独立评测给出的数据,不是DeepSeek自己编的。
GPT-6 Astra的82.7分只比它高1.5分,但成本是它的70倍。
DeepSeek官方计划2026年9月10日前后正式发布V4.1 Flash。届时会有完整的技术报告、官方benchmark、正式定价。
到时候再看,DeepSeek是真的把GPT-6 Astra拉下了马,还是又一个“benchmaxxed”的刷榜选手。
但不管结果如何,有一件事已经确定了:AI大模型的性价比之战,才刚刚开始。