8月21号,DeepSeek API平台突然多了一个新模型名字,长达三十个字符。没有发布会,没有预告,就这么静悄悄地上线了。
DeepSeek-V4-Flash-Vision-Exp。这是DeepSeek V4系列第一个能看懂图片的视觉模型,而且价格跟纯文本版V4-Flash一模一样,一分钱没涨。消息一出,技术圈炸了。有人欢呼我们回来了,有人开始担心这是不是要涨价的前奏,还有人翻出数据发现,这个长眼睛的新模型在某些测试里居然退步了。
这到底是一场技术革命,还是打了折的惊喜?让我们把语言切成小块,看看代码背后到底发生了什么。
眼睛白送,还打折?
AI圈有个默认的潜规则加功能就得加钱。多模态模型比纯文本模型贵,这是行业常识。GPT-4V的定价就是比GPT-4贵一截,Claude 3的视觉版本也单独计费。所以当DeepSeek宣布新模型价格直接对齐V4-Flash的时候,整个开发者社区的第一个反应不是兴奋,是怀疑。
我来翻译一下这意味着什么:你以前调用V4-Flash处理一万字文本花多少钱,现在往里面塞十张截图,还是花那么多钱。图片输入会按尺寸折算成Token,和文本Token一起计费,单张图片最多占384个Token。384个Token是什么概念?大概相当于一段朋友圈小作文的长度。一张高分辨率截图,被压缩成这么短的编码,然后塞进模型的大脑里。
图片不单独按张收费,而是按Token计价。这意味着同样的图片,高峰期和空闲期价格差一倍。缓存命中的话,百万Token输入只要0.05元,几乎等于白送。主打一个量大管饱还便宜。
但是等等!便宜就一定好吗?
加了眼睛,脑子没丢?
官方公告里有一个关键承诺,新模型在纯文本能力上跟V4-Flash正式版持平。翻译成人话就是:长眼睛没让它变傻。Agent能力、推理能力、世界知识,这些核心技能都保住了。这是很多开发者最担心的事,加个视觉模块进去,别把原来的智商拉低了。
然后看第二句:在需要视觉理解的Agent Benchmark上,V4-Flash-Vision-Exp相比V4-Flash实现了大幅跃升,多模态Agent能力已接近Opus-4.8。
这就怪了!前面说纯文本能力持平,后面说视觉Agent能力大幅跃升。那么到底跃升了多少?翻开源代码和测评数据,答案让人倒吸一口凉气。有的测试涨了,有的测试跌了。
DeepSWE测试,新模型得分59.3,旧版本54.4,涨了接近5分。Toolathlon-Verified测试,新模型75.9,旧版本70.3,大涨5.6分。ApexBench测试,新模型36.5,旧版本26.2,暴涨10分以上。
但转到Cybergym测试,新模型75.3,旧版本反而有76.7。视觉能力加进来,在这个测试里倒退了1.4分。Reddit评论区直接有人问:为什么Cybergym变差了?这个问题目前没人能回答。
这就好比你给一辆车加装了全景摄像头,倒车入库变得更容易了,但0到100公里加速反而慢了半秒。你说是升级了还是没升级?事情没那么简单!
多模态Agent,到底解决什么问题?
一个模型光看Benchmark数字没用,得看它到底能干什么是别人干不了的。这次DeepSeek视觉模型最大的看点,不在看得懂图片,在让Agent能看见。
以前AI Agent干活儿,全靠文本输入。你让Agent操作电脑,它只能读代码、读日志、读API返回的JSON字符串。它看不到屏幕截图,看不懂UI布局,识别不了流程图里的箭头方向。这就像让一个盲人修电脑,你给他念说明书,他能修,但效率低到尘埃里。
而多模态Agent能直接看截图!屏幕是什么样,UI按钮在什么位置,错误弹窗里那个红色的叉号长什么样,图表里那条折线是往上还是往下——所有这些视觉信息,一次性灌进模型脑子里。一个能看懂你屏幕的AI,和一个只能读文字的AI,做同样一件事的效率差距可能是十倍。
有开发者评论说,真正的计算机使用场景充满了视觉上下文,截图、UI布局、图表、图表、错误信息、文档。一个能看见Agent在跟什么交互的模型,砍掉了巨大的瓶颈。这就是为什么DeepSeek要押注这个方向。多模态Agent的能力接近Opus-4.8,这句话的分量在于——它意味着DeepSeek在多模态Agent赛道上,已经摸到了顶级闭源模型的脚后跟。
免费的不是午餐,是鱼钩?
但注意了!这次上线的模型名字里带了一个Exp,Experimental,实验性质。这意味着什么?意味着DeepSeek自己都没把话讲满。这个版本可能不稳定,可能某些场景翻车,可能在特定图片格式上识别率翻车。有开发者实际测试后反馈,识别几张图的准确率有点低,不确定是不是自己的问题。也有开发者发现,发了图片之后后续聊天记录缓存命中率变成了零,后来澄清是错误信息。
实验版免费送眼睛,听着像天上掉馅饼。但如果你是一个正经做产品的开发者,你敢不敢在生产环境里直接上Exp模型?这也是评论区那个神回复的精髓:直到他们把价格翻四倍。免费的最贵,这个道理在AI圈同样成立。先让你用顺手,依赖上了,再慢慢涨价。这是商业策略,不是做慈善。
文本压缩成图片:薅羊毛新姿势?
评论区有一个脑洞大开的想法:视觉文本压缩是否好用?如果好用,管理上下文可以变得更便宜。这个逻辑很有意思。按照DeepSeek的计费规则,一张图片最多折算384个Token。如果我有一篇一万字的技术文档,把它截图成一张高分辨率图片,喂给模型,模型只按384个Token收费。而直接喂纯文本,一万字大概值一万多个Token。这个差价是几十倍。
问题是:模型能准确识别截图里的文字吗?OCR精度够吗?格式会不会乱?数学公式能不能看懂?代码缩进会不会丢失?如果这些问题都解决了,那开发者们会立刻找到一个新的薅羊毛姿势,把所有长文本都转成图片再喂给模型。但DeepSeek显然不会留这么大一个漏洞给你钻,图片Token折算规则一定考虑了文本密度。这场猫鼠游戏才刚刚开始。
新模型踩了谁的脚?
DeepSeek这次动作,踩的不是OpenAI,不是Anthropic,踩的是那些靠视觉API溢价吃饭的中间商。多模态Agent能力接近Opus-4.8,价格只有V4-Flash的水平。V4-Flash的价格本来就比主流闭源模型便宜一个量级。现在同样价格,加送一双眼睛。这对开发者来说是福音,对竞品来说是噩梦。
评论区里有人调侃:如果他们想要三连胜,只需要发布一个35b A3B的模型,就能搞垮美国经济。玩笑归玩笑,背后折射出的情绪是:DeepSeek正在用暴力性价比策略,重新定义AI模型的价格锚点。你卖一块钱的服务,我卖一毛钱,功能还比你多。你收视觉附加费,我直接打包送。这种打法,让靠差异化定价生存的对手非常难受。
看不见的地方,藏着真正的底牌
别光盯着视觉能力!这次上线的另一个隐藏更新是Files API正式开放。开发者可以先把图片上传到DeepSeek平台,然后在请求里通过file_id引用,同一张图片在多个请求里不用重复上传。这个API不收费。这意味着什么?意味着DeepSeek在构建自己的生态基础设施,让开发者更便宜、更方便地调用它的能力。Files API是水管,视觉模型是水龙头里的水。水管铺好了,后面换什么水龙头都方便。这才是真正值得关注的战略动作。
同一个名字,不同的灵魂?
最后回到评论区那个最细致的观察:Same model + vision layers? Because the name is still the same. Wow. 这个WOW背后有一层潜台词,如果DeepSeek只是把V4-Flash加了一层视觉模块,没有重新训练整个模型,那意味着它用了一个极其高效的模块化设计。视觉能力是插拔式的,插上去就有,拔下来也不影响文本能力。这种架构设计的工程含量,可能比模型本身的能力提升更值得称道。
但也有另一种可能,名字没变,内核已经换了一套。只是DeepSeek懒得取新名字,或者故意用旧名字来降低用户的心理门槛。不管哪种情况,一个加了眼睛、没涨智商、还没涨价的模型,都值得花一两天时间泡在API文档里亲手测一测。
但至少有一件事是确定的:ApexBench测试里,新模型拿下了36.5分,旧版本只有26.2。暴涨的这10.3分到底是真本事,还是针对测试集做了特殊优化?Cybergym测试里那1.4分的倒退,到底是数据噪声,还是视觉模块影响了Agent的某些决策路径?官方没有解释,评论区在追问,但没人能给出答案。