2026年8月21日,DeepSeek在API平台上线了首个多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp。纯文本能力一分没降,视觉理解免费附赠。单张图最高384个token,价格和纯文本V4-Flash一模一样。
这事没那么简单。
视觉能力,免费赠送?
多模态大模型一直有个潜规则:看图比读字贵。
OpenAI的GPT-4o看图要单独计费,Anthropic的Claude视觉模型定价也高于纯文本版本。行业默认的逻辑是——图像信息密度高、计算量大,贵点应该的。
DeepSeek反着来。
V4-Flash-Vision-Exp的定价和V4-Flash完全对齐:缓存未命中时输入1元/百万token、输出2元/百万token;缓存命中时空闲时段低至0.05元/百万token。图片按尺寸换算成token后和文本token一起计费,单张图封顶384个token。
一张图最多0.001元出头。
对比一下:GPT-4o的输出定价约10美元/百万token。DeepSeek的输出是2元/百万token——按当前汇率,差距在30倍以上。
但便宜不一定好用。对不对?
接近Opus-4.8,但“接近”是个弹性词
官方公布的数据挺好看。
在需要视觉理解的Agent Benchmark上,V4-Flash-Vision-Exp相比V4-Flash实现了大幅跃升,多模态Agent能力已接近Opus-4.8。
具体分数:
Terminal Bench 2.1:新模型83.9分,V4-Flash-0731是82.7分,Opus-4.8是85.0分。
ApexBench (Pass@1):新模型36.5分,V4-Flash-0731只有26.2分,Opus-4.8是39.4分。
Chartography:新模型64.3分,Opus-4.8是65.0分。V4-Flash-0731没参加这项考试。
ZeroBench (Pass@5):新模型35.0分,Opus-4.8是34.0分。新模型反而超了。
纯文本方面更有意思。在七项Agent评测中,加了视觉的V4-Flash-Vision-Exp有六项超过了V4-Flash-0731。Toolathlon-Verified涨了5.6分,DeepSWE涨了4.9分。
按理说,模型加上视觉能力,纯文本多少会受点影响。参数就那么多,多看一样东西,别的就得少看一点。但DeepSeek给出的数据是——加了视觉,文本反而更强了。
这就有意思了。视觉训练可能帮助模型建立了更好的跨模态表征,反过来提升了纯文本推理能力。或者,数据本身就说明了一些问题。
但“接近Opus-4.8”这个说法需要打个问号。
“接近”是多近?差0.5分叫接近,差10分也叫接近。在Terminal Bench 2.1上差1.1分,确实接近。但在NL2Repo上,Opus-4.8是69.7分,新模型57.7分——差了12分。这还叫接近吗?
官方选了一个对自己最有利的角度。这很正常。但开发者得自己看数据。
价格屠刀的刀法:384 token封顶怎么做到的
单张图最高384 token,这个数字是怎么来的?
384不是随便拍的。一张800x800的图片,按Vision Transformer的patch size折算,差不多就是这个数。超过这个尺寸的图片会被自动resize到800x800左右,成本封顶。
换句话说,你塞一张4K壁纸进去,和塞一张800x800的缩略图,花费一样。模型看的都是缩略图。
这就引出一个问题:细节去哪了?
OCR识别小字号文字、检测UI像素级的对齐问题、分析高分辨率医学影像——这些场景需要的是细节,不是缩略图。DeepSeek的方案在成本和细节之间做了一个取舍:便宜,但可能看不清。
官方提供了一个补救措施:"detail": "low"参数可以把图片强制缩放到512x512,进一步省token。但"detail": "high"呢?文档里没提。
三种上传方式,三种坑
DeepSeek支持三种图片传入方式:Base64内联、外部URL、Files API。
Base64内联最直接,把图片编码成文本塞进请求里。但整个请求有48 MiB的上限。一张高质量截图就十几MiB,塞几张就超了。
外部URL发个链接过去,让DeepSeek自己去下载。单张图最大32 MiB,下载时限60秒。公开链接才行,内网地址别想。
Files API是官方推荐的方式。先把图片上传到DeepSeek平台,拿到一个file_id,之后在请求里引用就行。单张图最大64 MiB,带file_id的请求图片总量上限200 MiB。每个用户免费送25 GiB存储空间,最多存10000个文件。
Files API解决了重复上传的问题。你有一张图要在100个请求里用,不用每次都传一遍。
但有个细节:上传的文件可以设置1小时到30天的有效期。过期自动删除。官方文档只允许上传图片,没有提供下载文件内容的接口。
也就是说,传上去的东西,你自己拿不回来了。
600张图一锅端,但别高兴太早
单次请求最多600张图片。
批量分析截图、批量OCR、批量图表理解——这些场景确实需要高吞吐。600张的上限比大多数竞品都慷慨。
但有两个限制要注意。
第一,15张以上图片时,最大分辨率从8192px降到4096px。你塞一堆高分辨率图进去,模型会自动降级处理。
第二,带file_id的请求,图片总量上限200 MiB。600张图,平均每张不能超过0.33 MiB。稍微大点的截图就超了。
所以600张这个数字更像是一个天花板,实际能塞多少取决于你的图片大小。
还有一条硬规则:图片不能放在system或assistant角色里,只能放在user角色里。
实验性质的潜台词
DeepSeek官方把这个模型定义为“一个实验性质的模型”。
“实验性质”翻译一下就是——不保证稳定,不保证效果,不保证一直这么便宜。
官方明确说“不建议直接用于生产环境”。后续会根据线上调用反馈迭代优化,正式版上线时间未公布。
这就有意思了。一个不建议用于生产的模型,却开放了API、公布了定价、拿出了benchmark数据。DeepSeek在做什么?
收集真实场景的数据。生产环境的调用才是最好的测试。各种边缘case、各种奇葩图片、各种意想不到的使用方式——这些东西在内部测试里永远覆盖不全。
Exp版本就是DeepSeek的“众测”手段。开发者免费(或者说低成本)帮他们测试,他们获得真实数据来优化模型。
但开发者也要想清楚:你是在帮别人测试产品,还是在做自己的业务?
视觉Agent的想象力
纯文本模型能调用工具、能写代码、能推理。但有个问题——它看不到。
看不到界面,就看不懂错误截图;看不到图表,就分析不了数据可视化;看不到屏幕,就没法操作GUI。
V4-Flash-Vision-Exp补上了这块。
现在Agent可以:看截图识别问题、读图表提取数据、分析图文混排的文档、识别软件界面元素。
DeepSeek官方展示的几个场景挺有意思:在Agent框架下生成商业定制PPT、对官网进行二次创作、制作黏土怪物风格动态特效的前端Demo。
这些场景的共同点是——视觉理解和工具调用的结合。模型先看懂图,再决定调用什么工具、怎么写代码。
这正是多模态Agent的核心价值:不是“看图说话”,而是“看图做事”。
一个具体的未解之谜
有开发者反馈,用V4-Flash-Vision-Exp分析ERP系统的1080p截图时,“mislabeled pretty much everything”——几乎全标错了。
这是个值得深挖的矛盾点。
benchmark数据显示模型在Chartography上拿了64.3分,接近Opus-4.8的65.0分。但真实场景的ERP截图识别却一塌糊涂。
benchmark和真实场景之间到底差了什么?是测试数据过拟合?是ERP界面的字体太小超出了识别能力?还是截图里的表格结构太复杂?
没人知道答案。DeepSeek没解释,那位开发者也没展开说。
但这个问题指向了一个更深层的困境:我们怎么知道一个模型真的“看懂”了?
benchmark分数可以刷,测试集可以泄露,官方数据可以挑选对自己有利的。真正的考验永远是——扔一个没见过的、 messy的、真实世界的图进去,看它能不能搞定。
V4-Flash-Vision-Exp能搞定吗?
不知道。那位开发者的ERP截图说“不能”。
但也许你的截图可以。
在OpenCode中启用
s1:~/.config/opencode/opencode.json |