OpenAI刚降价!DeepSeek反手就甩出Flash版本

OpenAI 让 Luna 的价格更加亲民,也让它更具吸引力。而仅仅一天之后,Deepseek 就推出了 Flash 版本,进一步提升了其竞争力,重新夺回领先地位。

DeepSeel V4 FLash正式版刚刚发布,GPT-5.6 Luna只比其高1分。根据 https://artificialanalysis.ai/ 的更新,Deepseek V4 Flash 0731 的单次任务成本为 0.03 美元。


DeepSeek-V4-Flash API公测也上线了,Agent能力全面暴涨,Terminal Bench跑出82.7分,NL2Repo拿下54.2分,这波操作直接把开源模型的智能体天花板又捅了个大窟窿。

这次更新的智能体(Agent)能力比之前的 V4-Pro-Preview 强了一大截,各种测试成绩如下:

  • Terminal Bench 2.1(终端操作测试):82.7 分
  • NL2Repo(自然语言转代码仓库):54.2 分
  • Cybergym(网络安全攻防测试):76.7 分
  • DeepSWE(软件工程任务):54.4 分
  • Toolathlon verified(工具调用综合测试):70.3 分
  • Agent Last Exam(智能体终极考试):25.2 分
  • Automation Bench (Public)(自动化公开测试):25.1 分
  • DSBench-FullStack(内部全栈开发测试):68.7 分
  • DSBench-Hard(内部高难度编码测试):59.6 分


考试分数炸了锅但别被数字忽悠了

官方甩出来的那串benchmark分数,Terminal Bench 82.7分,NL2Repo 54.2分,Cybergym 76.7分,一堆数字砸过来跟彩票开奖似的。但这些考试跟咱们学校里的月考不是一回事,它们是专门设计来测AI会不会用工具、会不会写代码、会不会在模拟环境里干活的。

Terminal Bench考的是AI在命令行里能不能像老程序员一样熟练操作。NL2Repo考的是你给AI一段自然语言描述,它能不能在大型代码库里找到正确的位置修改代码。Cybergym是网络安全靶场,看AI能不能自己发现漏洞。这些考试以前很多模型都挂科,因为以前的AI只会聊天,不会动手。

Agent Last Exam 25.2分看着不高对吧?但这考试考的是AI在没有人类帮助的情况下,自己面对从来没见过的复杂任务能不能搞定。25.2分在这个赛道里已经算尖子生了,因为很多模型直接交白卷。

DeepSWE 54.4分更有意思,SWE是软件工程的缩写,这个考试模拟的是AI像真正的程序员一样,拿到一个真实的GitHub issue,自己去理解代码库、定位bug、写补丁。54.4分意味着DeepSeek已经能解决超过一半的真实编程任务了,这意味着什么?意味着初级码农的活,AI真能干个五成了。

Toolathlon verified 70.3分考的是AI同时调用一堆工具的能力,就像一个人同时操作Photoshop、Excel、邮件客户端还不乱套。70.3分说明DeepSeek在多任务并行这块已经相当稳了。

这波升级怎么让隔壁OpenAI坐不住了

就在DeepSeek发布公测的前一天,OpenAI刚宣布Luna模型降价80%,摆明了要抢用户。结果DeepSeek反手就甩出Flash版本的benchmark成绩单,相当于在说:你性价比超过我旧模型是吧?我直接用新模型碾压你。

评论区有人说DeepSeek-V4-Flash已经能跟Claude Opus 4.8掰手腕了。Claude Opus是Anthropic家顶级的模型之一(最新是Opus 5),价格贵得离谱,一般开发者根本用不起。DeepSeek这波等于把超跑性能塞进了家用车的价格区间里。

但要注意,这次升级只是Flash版本,不是Pro。Flash主打的是轻量快速,适合日常高频调用。Pro版本还在后头憋着大招。公告里明说了DeepSeek-V4-Pro API和APP/WEB模型暂时没变,Pro版本要等到八月初。

评论区有人吐槽速度还是慢,官方回复说太多人在测了服务器扛不住。这其实是好事,说明关注度高。另外一个槽点是DeepSeek还不支持视觉识别,不能直接看图理解图像内容。但评论区也说了,如果加上视觉功能,这模型就是全能型选手了。


大模型价格战打到最后谁买单

OpenAI降价,DeepSeek性能追上来,这竞争对用户来说简直是过年。以前用顶级模型抠抠搜搜算着token数,现在Flash版本性能上来了价格还便宜,开发者可以放开手脚去试错了。

评论区有人担心DeepSeek是不是只是追平了Claude Opus但没超越。但更多人看得明白,Flash版本只是个开胃菜,真正的正餐在后面。

还有人说DeepSeek这波操作时机太损了,专门挑OpenAI刚宣布降价的时候发布,等于把对手架在火上烤。商业竞争就是这样,你出牌我也出牌,最后便宜的是掏钱的用户。

从另一个角度看,DeepSeek的开源策略让它天生就有社区优势。开发者可以自己部署、自己调优、自己折腾。闭源模型再强你也改不了它的底层逻辑,但开源模型你拿到手随便改。这波公测之后,估计很快就会有各种基于DeepSeek的社区版本冒出来。