一个模型涨价了,但真正会算账的人,发现它反而更便宜了!
8月13日,DeepSeek V4 Pro 0813正式版上线API服务,1M上下文窗口、384K最大输出、思考模式与工具调用能力全部保留。更值得关注的是,它与V4 Flash之间形成了明显的速度、能力、价格三层分化。对于Hermes Agent这类需要连续调用工具、执行多轮任务的智能体来说,真正值得观察的已经不是单次回答有多聪明,而是模型到底能不能少走弯路、少调用工具、少消耗Token,把一次复杂任务从头到尾真正做完。
模型越贵反倒越省钱
8月13日凌晨,DeepSeek V4 Pro正式版开始进入API服务。这个版本最容易被忽略的地方,是它没有采用一个完全陌生的产品体系,而是继续沿用V4 Pro这条产品线。
这让已经接入DeepSeek的智能体能够直接获得新版本能力,不需要修改任何代码。
所谓API,可以简单理解成一根给软件使用的“电话线”。普通用户打开网页和模型聊天,是人在操作。API则允许Hermes Agent、代码工具或者其他智能体直接把任务发送给模型,再把模型返回的结果交给程序继续执行。
这件事情放到智能体环境里,意义马上变了。智能体每天干的事情,往往不是回答一个问题,而是搜索资料;读取文件;运行命令;修改代码;再次检查结果;发现错误以后重新执行。
模型每多绕一圈,服务器就多算一圈。Token也跟着往上跳!
所以V4 Pro 0813真正值得观察的指标,天然就包括Agent能力、工具调用稳定性、长上下文处理能力,以及完成任务时到底需要多少Token。DeepSeek在V4发布时就把Agentic Capabilities列为重点,并明确强调V4 Pro面向Agent任务进行了优化。
1M上下文把整张工作桌都变大了
很多人第一次看到1M上下文,容易把它理解成“模型记性特别好”。实际上上下文窗口更像一张巨大的工作桌,模型可以把更多代码、文件、历史对话、工具结果同时放在桌面上。
DeepSeek V4 Pro和V4 Flash目前都支持1M上下文,最大输出达到384K Token。同时支持思考模式、非思考模式和工具调用。
这对Hermes Agent尤其重要,因为智能体任务很容易越做越长。一个简单的“修复一个Bug”,可能先读取项目结构,再搜索配置文件,再执行测试,再看到报错,再修改代码,最后重新运行测试。
如果上下文太短,智能体就必须不断压缩历史信息。压缩一次可能丢一点细节,压缩几次以后,最早的错误原因可能已经消失。于是模型开始重新调查。
程序员看到的场景就会变成一种非常熟悉的灾难:AI刚刚解决的问题,十分钟后又重新研究了一遍!
1M上下文因此并非单纯的数字竞赛。对于Agentic AI,也就是能够自己规划步骤并调用工具完成任务的人工智能系统来说,它更接近一种工作记忆容量。工作记忆越大,同时处理的信息越多,中途丢失关键线索的概率就越低。
Flash便宜Pro贵,但账单可能反过来
目前DeepSeek官方美元价格显示,V4 Flash缓存命中输入价格为每百万Token 0.0028美元,缓存未命中输入为0.14美元,输出为0.28美元。V4 Pro对应价格分别为0.003625美元、0.435美元和0.87美元。
如果只看数字,Pro确实贵了。缓存未命中输入价格约为Flash的3.1倍,输出价格同样约为3.1倍。
换句话说,模型公司直接告诉用户:想要更强的旗舰能力,可以付出大约三倍的Token成本。
但智能体世界有一个很容易被忽略的公式:总成本并不只等于单价。更准确的理解应该是,总成本等于模型单价乘以实际消耗Token,再乘上任务过程中发生的额外调用。
一个便宜模型如果为了完成任务反复搜索、反复修改、反复调用工具,最后消耗10倍Token,账单照样会变得很漂亮!
这就是为什么Hermes Agent用户特别关心V4 Pro和V4 Flash之间的区别。真正的问题已经从“哪个模型每百万Token便宜”变成“哪个模型完成一个真实任务更便宜”。这个问题的答案,跟价格表上写的数字可能完全相反。
智能体最贵的东西压根不是模型
传统聊天机器人很简单。用户输入一句话,模型回答一句话,任务就结束了。
智能体完全不同。智能体拥有工具之后,模型的输出会变成下一步行动的指令。比如模型说“读取文件”,程序就读取文件。模型说“执行测试”,程序就运行测试。模型看到测试失败,又产生下一条命令。
于是一个回答变成了一条链。
这条链越长,模型能力不足造成的浪费就越明显。一次错误工具调用可能只浪费几十秒,但连续错误可能把几分钟变成几十分钟,再把几千Token变成几万Token。
此前Hermes Agent社区就出现过DeepSeek V4 Pro长时间循环执行任务的案例。其中一次Google Drive OAuth配置任务持续了非常长时间,模型不断在不同方案之间切换。
社区反馈指出,V4 Pro在复杂推理方面表现强,但存在输出冗长、反复论证、重新走回已经放弃方案等问题。
这个现象非常有意思。因为模型“想得更多”并不自动等于Agent“干得更快”!如果模型每一步都写一大段解释,然后做一个错误动作,再写一大段解释解释为什么这个动作合理,最后又回到原来的路线,那么所谓推理能力就可能变成一种昂贵的自我辩论。
Pro真正考验的是少走弯路
智能体最重要的能力之一,是把复杂目标拆成一系列能够执行的小步骤。
比如用户说:“把这个项目的登录功能修好,并确保测试全部通过。”普通模型可能先找到登录代码,然后修改一个文件。更强的Agent会先检查项目结构;寻找认证入口;检查依赖;阅读已有测试;确认错误来源;修改代码;运行测试;分析失败原因;再次修改;最后确认完整测试结果。
这时候模型能力的价值,就隐藏在每一步之间。
如果Pro能够提前判断哪个文件最值得检查,哪个工具最应该调用,什么时候应该停止搜索,什么时候应该直接执行,那么它虽然每个Token更贵,却可能让整个任务变短。
这就是Agent效率最核心的反差:模型越贵,最终任务成本反而可能越低!
当然这不能靠价格表证明。必须通过真实任务测量,包括总Token、工具调用次数、错误次数、任务完成时间和最终成功率。只有把这些数据放到一起,Pro与Flash的真实成本才会浮现。
Hermes Agent正在变成模型路由器
Hermes Agent这类工具还有一个特殊优势:模型并不一定需要固定成一个。
DeepSeek官方目前已经提供了V4 Pro和V4 Flash两种定位明显不同的模型,而且官方文档也直接提供了面向智能体工具的接入方式。比如在Claude Code环境中,DeepSeek官方建议把Pro用于主模型,把Flash用于Haiku和子Agent等更轻量的任务。
这实际上已经暗示了一种模型路由思路。
所谓模型路由,就是根据任务难度选择不同模型。复杂任务交给Pro;简单任务交给Flash;需要大量并发的工作交给Flash;需要深度规划的主任务交给Pro。
这就像公司不会让老板负责打印每一张发票,也不会让实习生决定整个公司的战略。
模型也是一样。如果一个Agent每次执行ls命令、读取一个小文件、检查一个简单状态,都让最贵的模型来处理,成本很快就会失控。如果所有复杂任务都交给便宜模型,错误率又可能上升。
真正成熟的Agent系统,最后很可能会变成一个“模型调度器”。
Flash真正可怕的是便宜到可以随便用
V4 Flash的价值容易被Pro的光环盖住。
DeepSeek在V4预览发布时就明确给出了两者的产品定位:V4 Pro强调更强的Agent能力、知识和推理能力;V4 Flash则强调更快响应、更小规模以及更低成本,同时在简单Agent任务上接近Pro。
这意味着Flash并不是一个“缩水版玩具”。
如果一个任务只是读取文件、整理信息、执行简单命令、生成常规代码或者处理已经明确的步骤,那么Flash可能已经足够。
真正危险的是,用户很容易把“更强”理解成“所有任务都应该用更强”。这就像让一辆赛车去买菜。赛车当然能去,可油钱、维护费和停车费一起算进去以后,事情就开始变得奇怪了!
Agent系统真正需要的是任务分层。简单任务大量使用Flash,复杂任务少量使用Pro,整个系统的单位任务成本才可能下降。
价格上涨反而暴露了真正答案
社区最敏感的一个问题,是价格变化。
最初流传的价格截图中,V4 Flash和V4 Pro分别显示为缓存命中输入0.0028美元与0.003625美元;缓存未命中输入0.14美元与0.435美元;输出0.28美元与0.87美元。帖子同时提醒,这些价格可能还没有反映后续调整。随后官方价格页面确实显示了相同的美元定价结构,并明确提醒产品价格可能发生变化。
价格变化看起来像商业问题,实际上也是模型能力竞争的一部分。因为当模型开始进入Agent工作流以后,Token已经不再只是聊天文字。Token开始对应搜索;代码;工具调用;文件处理;任务规划;错误恢复。
模型每便宜一点,Agent就可以多跑一些任务。模型每贵一点,开发者就会开始考虑路由;缓存;上下文压缩;子Agent;任务分层。
于是价格表本身开始反向影响软件架构!以前程序员写软件时,主要考虑CPU、内存、磁盘和网络。现在还要考虑每一次模型思考到底值多少钱。
缓存命中把账单逻辑整个颠倒了
这里还有一个特别容易被忽视的东西:缓存命中。
缓存可以理解成模型已经看过一部分内容,下一次请求继续使用这些已经处理过的信息,因此价格明显低于重新处理全部输入。DeepSeek官方目前把缓存命中和缓存未命中分别计价,这意味着长时间运行的Agent可以通过重复上下文获得明显不同的成本结构。
对于聊天机器人来说,缓存可能只是一个优化项目。对于Agent来说,缓存可能直接变成经济模型。
一个Agent如果不断围绕同一个代码仓库工作,很多上下文其实会重复出现。项目结构;系统提示;工具定义;历史任务信息,都可能反复进入模型输入。
如果这些内容能够稳定命中缓存,那么真正昂贵的部分就会集中到新增内容和模型输出。
这也是为什么1M上下文与KV Cache优化会越来越重要。上下文越长,重复信息越多,缓存策略就越可能决定最终成本。KV Cache是一种在模型推理时缓存已经计算过的键值对的技术,避免每次生成新Token时重新计算前面的内容。
真正的竞争进入单位任务成本
现在再回头看V4 Pro和V4 Flash,问题就清楚多了。
每百万Token多少钱,只是第一层。第二层是每个任务需要多少Token。第三层是需要调用多少次工具。第四层是工具调用成功率。第五层是任务最终完成率。第六层才是最现实的指标:完成一个真实任务到底花多少钱!
这也是Agent Benchmark越来越重要的原因。传统大语言模型Benchmark经常测试一道数学题、一个知识问题或者一段代码,但真实Agent需要处理连续行动。
近期一项GTM-Bench评测中,Hermes搭配DeepSeek V4 Pro的单次任务轨迹中位数工具调用为30次,Token使用量约192万,成本约0.48美元。该结果说明,在真实Agent任务里,模型成本最终会被整个执行轨迹放大,而不是只由单轮回答价格决定。
这也是一个很有意思的信号。一个模型如果每次回答都非常便宜,却需要不断补救,便宜就只是账面上的便宜。真正便宜的模型,是能够用尽可能少的动作把事情做完。
DeepSeek把模型变成了水管和电线
4月24日,DeepSeek发布V4预览版本时,就已经明确提供V4 Pro与V4 Flash,并支持1M上下文,同时强调Agent能力和工具生态接入。官方还表示V4已经与Claude Code、OpenClaw和OpenCode等Agent工具进行集成。
这说明V4从一开始就没有只被设计成聊天模型。它正在成为一种基础设施。
基础设施的特点是,用户通常不会每天盯着它看,但大量软件会建立在它上面。数据库就是这样。操作系统也是这样。网络协议也是这样。
如果DeepSeek模型越来越稳定地进入Hermes Agent、Claude Code、OpenCode、Pi等工具,那么模型更新的影响就会从一次聊天升级成整个软件生态的行为变化。
今天更新一个模型,可能意味着明天一批Agent的执行方式一起改变。这才是V4 Pro 0813真正值得关注的地方。
Hermes甚至不用更新
社区还有一个很有意思的细节。
当用户问新模型上线后是否需要更新Hermes Agent时,得到的回答是,通常并不需要重新更新Agent本身。只要Provider,也就是模型提供方已经提供新模型,Agent就可以通过模型列表获取可用模型,再切换到对应版本。
这件事情看起来很普通,实际上非常关键。因为它意味着Agent和模型正在逐渐分离。
过去的软件升级逻辑是:软件厂商发布新版;用户下载新版;新功能出现。现在的模型生态越来越像:Agent保持不变;Provider持续增加模型;Agent动态发现模型;用户选择模型。
软件本体开始稳定,模型开始快速变化。这会让Agent越来越像一个操作系统,而模型更像可以随时更换的发动机。
2.4万亿参数也在旁边敲门
与此同时,社区还出现了另一个非常夸张的消息:Qwen 3.8的2.4万亿参数模型已经出现下载入口。
参数量本身不能直接等于能力。模型有多少参数,就像汽车有多少零件,零件多并不代表汽车一定跑得快。
真正重要的是参数如何被激活;训练数据如何组织;推理机制如何设计;模型如何进行工具调用,以及最终完成任务需要多少计算。
这也是为什么DeepSeek V4采用的路线越来越值得关注。V4预览版本已经强调了Token级压缩、DeepSeek Sparse Attention等结构创新,目标之一就是在超长上下文下减少计算和内存压力。DeepSeek Sparse Attention是一种稀疏注意力机制,不是让模型关注所有输入位置,而是有选择性地关注最相关的部分,从而大幅降低计算量。
模型战争正在出现一个奇怪的场景。一边是参数量不断冲向万亿级;另一边却在疯狂研究如何少计算一点。看起来像两拨人朝相反方向跑。实际上两拨人都在追同一个东西:单位智能成本。
最后的赢家可能不是最强模型
如果只比较聊天质量,V4 Pro和V4 Flash之间当然存在能力差异。但当模型进入Agent以后,评价标准会发生变化。
一个优秀Agent需要知道什么时候思考;什么时候搜索;什么时候执行;什么时候停止;什么时候把任务交给另一个模型。
这意味着未来真正强大的系统,很可能不是一个“超级模型”包打天下,而是一组模型组成的动态系统。Pro负责大脑级规划;Flash负责大量执行;工具负责行动;缓存负责降低重复计算;Agent负责协调所有环节。
模型本身只是其中一个零件。
所以V4 Pro 0813最值得观察的地方,并不是它能不能在某个排行榜上多拿几分,而是它能不能让整个任务链少犯错误、少走弯路、少消耗Token。
如果答案是肯定的,那么即使Pro单价更高,它也可能比Flash更便宜。反过来,如果一个模型思考了十分钟,写了三万Token,调用了二十次工具,最后又回到起点,那么再便宜的Token也救不了这张账单!
这才是Agent时代最有意思的变化:模型价格越来越像汽油价格,而真正决定成本的,是汽车到底绕了多少路。
8月13日的V4 Pro 0813,看起来只是一次模型更新,实际上暴露了Agent时代更深的竞争:能力、速度、Token、缓存、工具调用和任务成功率正在被压缩进同一个成本公式。最反常识的地方来了:最贵的模型,可能因为少犯一次错误,反而成为最便宜的选择!