AI大模型变天:最强选手集体翻车, DeepSeek V4 Flash 0731黑马却靠便宜到离谱,杀疯了。
在最大努力下,DeepSeek V4 Flash 0731 在 ARC-AGI-1 半私有任务中得分 89.0%,每个任务收费 0.02 美元;在 ARC-AGI-2 半私有任务中得分 61.4%,每个任务收费 0.04 美元。
DeepSeek V4 Flash 0731在公认最难推理测试ARC-AGI中拿高分,但价格只有同类顶级的几十分之一。成本低到可以开着十几个会话随便用,一天花不了五美元。大模型竞争拐点已到:智力开始按斤卖,用不起了才是真问题。
三毛钱干翻六百块
现在回头看看年初那些AI发布会,就跟看上个世纪的古董纪录片似的。台上西装大佬拍着胸脯说,我们的模型智力水平突破天际,但价格嘛,每百万token收你六十美元,童叟无欺。台下听众鼓掌,心里盘算着,这玩意儿用一次够买两顿全家桶。当时所有人都觉得,高智力就得配高价格,天经地义。
但到了八月初,一张图炸了锅。横轴是价格,纵轴是推理能力打分,各大模型散落在图上,大致呈现一条斜线,越往右上角越贵越强。可就在这条线的左下方,孤零零冒出一个点,价格低到几乎贴在纵轴上,能力却蹦到了跟那些收费六七十美元的大佬同一个海拔。
这个点,叫深度求索V4闪速版。
这个价格低到什么程度?深度求索官方给的价格,输入每百万token收你十四美分,输出收二十八美分。更狠的是缓存命中后的读取价,每百万token只要零点二八美分。零点二八美分是个什么概念?美元一分钱都不到。你在路边捡一毛钱钢镚儿,够读三千五百万个缓存token。读一本《三体》全集大概一百万字,花不到一美分。你扔沙发上那个靠垫缝里掉出来的硬币,够把整部《战争与和平》来回读十来遍。
有用户晒出了自己的账单。累计用了十二亿八千多万个输入token,缓存命中率超过百分之九十八,最终花费八块七毛九美元。八块七毛九,在旧金山够买一杯加了燕麦奶的拿铁,在纽约够坐三趟地铁。用这八块七毛九,他跟AI聊了超过一万零八百个来回,处理了将近十三亿个词块。拿铁喝完只剩空杯子,但那十三亿词块帮他写完了好几个项目的第一版代码。
缓存才是真钞能力
有人要问了,凭什么它这么便宜?赔本赚吆喝?还是背后有大金主烧钱玩票?事情没这么简单。深度求索这家实验室,手头GPU的数量和性能跟硅谷那几家巨头根本不在一个量级。人家OpenAI和Anthropic买GPU是几万张几万张地下单,深度求索还得精打细算。但正因为资源紧巴,他们硬是被逼出了一项独门绝技。
这项技术叫键值缓存,全称Key-Value Cache,简称KV Cache。AI模型生成回答时,内部有个注意力机制,会记住你之前说过什么。传统做法是,每次你发新消息,模型都得重新把整段对话从头到尾算一遍,浪费大量算力。键值缓存就是把之前算好的中间结果存下来。你接着问,它只算新增那部分,省下九成以上的力气。
但别家也搞缓存,深度求索的杀手锏是把这个缓存做到了极致便宜。他们把一种叫多层注意力的压缩技术用到了每一层网络,极大缩小了缓存占用的显存。再加上他们自研的混合架构,把一部分计算任务甩给CPU和硬盘,让昂贵的GPU只管最核心那部分。结果就是,他们的缓存读取价,比第二便宜的竞争对手低了一个数量级。
举个直观的例子。如果你让一个AI助手帮你写代码,通常会把整个项目的上下文都塞进去,几千行代码占了绝大多数输入。这些内容几乎每次都能命中缓存。用深度求索写代码,缓存的token占了百分之九十八以上。这就意味着,你实际付的钱,比按官方标价算出来的还要少一个数量级。有人给出一组对比数据,跑同样一套推理任务,用深度求索V4闪速版,输入token花了不到三美元,输出花了不到三美元。换用当时最主流的前沿模型,光是输入部分就要花掉将近两百美元。
其他提供推理服务的平台也试图跟上。一个叫vLLM的开源项目,在七月底合并了一个新功能,可以把缓存从GPU卸载到硬盘上。但实际测试下来,他们的缓存命中后读取价依然比深度求索贵了十倍以上。等于说,深度求索用一套软硬结合的黑科技,把物理成本压到了几乎所有竞争对手暂时无法跟进的水平。不是不想跟,是真跟不住。
无限续杯的智力自来水
这个价格带来的体验,只有用过的才懂。有个用户说,他现在一天开五六个会话,每个会话背后其实跑着两个实例,一个干活,一个当顾问在后头盯着。总共十二条流在同时跑,一天下来花不了五美元。五美元,放在以前,只够调用顶级模型API跑一次中等规模的代码生成任务。现在够他连续不断使唤十几个AI助手一整天。
更夸张的是,有个叫OpenCode Go的平台,正在搞活动,十美元月费,原本给你价值六十美元的额度,现在翻倍给到一百二十美元。有人在底下留言说,就算敞开了用,想把这一百二十美元额度烧完都费劲。因为他发现,真正的瓶颈压根不是钱,是你有没有那么多活儿交给AI干。
于是,过去想都不敢想的事儿,现在变得稀松平常。比如持续集成服务器上跑测试挂了,以前得工程师亲自登录上去翻日志、查报错、改代码、再提交。现在让AI助手自动接手,看到失败日志就调用模型分析原因,提出修复方案。即便十次里有八次不靠谱,剩下两次也能省下工程师几十分钟。成本呢?修复成功那次花几分钱,失败的那八次加一起可能还不到一毛钱。
又比如自动化生成测试代码。以前写单元测试是苦力活,工程师宁可多写两行业务逻辑也不愿意碰测试。现在每次有人提交新代码到代码库,持续集成系统自动触发一个AI任务,分析新增和修改的函数,按照团队预先写好的测试规范,自动生成相应的测试用例。生成完直接附在拉取请求底下,供人工审阅。人工只需要看一眼逻辑对不对,大部分机械填充工作被模型包揽。有人质疑说AI生成的测试只会验证代码自己说自己对,但实际场景里,只要提前写好明确规则,让模型严格按照规则生成,它能干的远不止拍马屁。
还有人把模型挂在后台,实时扫描服务器日志,看到异常就自动归类、摘要、甚至给出紧急修复命令。这在以前,每个月花在日志分析上的API费用能赶上一名初级工程师的月薪。现在,一个跑在二手服务器上的深度求索实例,日夜不停地盯着,月度成本还不够办公室买两箱可乐。
有用户总结得直白:智力这东西,一旦便宜到不用记挂着花销,它就变成自来水了。你不会盯着水表数着冲一次马桶花几分钱。同样,你也不会再纠结每问AI一个问题值不值当。
硅谷大佬坐不住了?
局面变得微妙了。美国几家头部AI实验室,靠的是技术代差加价格壁垒在吃饭。他们研发最前沿的模型,然后定一个高不可攀的API价格,只对愿意支付溢价的企业级客户开放。这个商业模式有个隐含前提,就是好东西必须贵,便宜没好货。
现在深度求索这个模型,能力跟好几家头部实验室几个月前发布的旗舰款差不多,价格却只有对方的几十分之一。而且它的权重是公开的,任何人都可以下载自己部署。这就把牌桌掀了。一些中小型AI服务商,已经开始大规模用深度求索替换掉原先调用OpenAI和Anthropic的接口。有些提供推理服务的平台,一夜之间冒出几十个托管深度求索的节点,价格一家比一家低。
有分析指出,美国AI实验室现阶段唯一的遮羞布,只剩所谓国家安全条款。政府可以通过行政命令,禁止联邦机构和有政府合同的大企业使用中国产模型。但这条禁令管不了海外市场。欧洲公司、东南亚初创、中东主权基金,他们没有理由为了政治忠诚多付几十倍的钱。商人天然会选择成本最低的解决方案。一旦国际市场上大家都开始用开源模型替代闭源巨头,美国AI实验室的营收预期就要重新写了。
现场已经有人开始算账了。有人在评论区直言,如果深度求索这个价格和性能是真的,那美国AI实验室有大麻烦。唯一能救他们的只剩下政治手段。但政治手段救不了商业基本面。如果开源模型能自托管、能微调、能针对特定任务做优化,大企业没理由再给美国AI实验室交保护费。
更让硅谷难受的是,深度求索的技术路线几乎全是公开论文里写过的。没有天降奇才,没有秘密武器,就是用已知的技术,做极致的工程优化。这意味着这条路是可以被复制的。今天深度求索能做到,明天可能就有其他实验室也能做到。等中国其他几家大模型厂商也开始卷价格的时候,美国AI实验室的溢价空间就会像露水一样蒸发。
最强AI可能是个伪需求
但这场争论里有个更扎心的真相。普通用户真的需要那个所谓的最强模型吗?评论区里一个高赞回复点破了窗户纸:我不在乎顶级模型能不能一把梭解决什么宇宙难题,我只要一个东西,它够聪明,能当个特别靠谱的编程搭档,不偷懒、不胡编、能一起头脑风暴、能替我写那些烦人的模板代码,而且价格低到我用起来不用心疼。这才是真实需求。
所谓状态最优模型,就是那个在各种榜单上排名第一的模型,往往只在一个极窄的测试集上领先几个百分点。但在日常任务里,那几个百分点的领先可能永远用不上。日常任务需要的是稳定、听话、响应快、成本低。一个跑分九十五分的昂贵模型和另一个跑分九十一分但便宜一百倍的模型,放在真实工作流里,后者完胜。
有人把这种现象叫做智力的九十九分位阈值效应。对绝大多数使用场景来说,一旦模型智力跨过了某个基准线,再往上提升,感知到的差别几乎为零。你让它写一封邮件、翻译一段文档、生成一个函数、总结一篇报道,九十一分和九十五分模型给出的结果,在你阅读时根本分不清谁是谁。只有当任务极端刁钻,比如要求在不提供任何示例的情况下解决一个全新的抽象推理谜题,差距才会显现。但这种任务,普通工程师一年到头也碰不上几次。
因此,深度求索的成功不在于它多么逼近神级智能,而在于它足够好,同时足够便宜。这个足够好的门槛一旦被永久性地拉低,整个产业的竞争逻辑就变了。不再是比谁更聪明,而是比谁更便宜、更稳定、更容易接入。有用户直言,他现在只在一种情况下会切回昂贵模型:当深度求索连续两次都没搞定一个复杂规划任务时。而这种情况,一周可能只出现一两回。
还有个细节挺讽刺。深度求索官方平台上挂着一则通知,说近期会大幅上调API价格,暗示现在的低价不可持续。但评论区没人慌。因为模型权重是公开的。就算官方涨价,其他托管方依然可以按照现有成本结构提供服务。就算所有商业托管都涨了,用户也可以自己买台二手服务器,跑个量化版模型,速度慢点,但完全免费。这就是开源护城河。官方定价权被稀释了。
AI变成水电那一天
所以真正的认知冲突在这儿。所有人都在追逐那个遥遥领先的终极智能,但决定这场战争最终走向的,很可能是那个第一个把智力变成水电一样便宜的存在。水力发电不是效率最高的发电方式,核电站也不是。但全世界用的最多的,是烧煤的火电。因为它便宜、稳定、不需要跟老天爷猜谜。
深度求索V4闪速版,就是AI领域的火电。它不优雅,不炫酷,没有让业界大佬半夜惊醒的那种惊艳。但它让一个普通创业团队可以不看账单写代码,让一个中学生可以拿它当私人辅导老师问一整晚物理题,让一个非营利组织可以用它自动给上千份求助邮件写回信。这些事情,昂贵模型也能做,但每次调用都要掂量一下成本。
更深远的影响在别处。当智力变得像带宽一样按兆计费且几乎免费时,整个软件工程的范式会被重塑。持续集成、日志分析、安全审计、社交信息流过滤,所有这些以前只能靠人工或拙劣规则引擎处理的事务,都可以被AI接管。不是未来,现在就已经可以了。有人已经开始尝试用深度求索自动过滤和重排社交媒体信息流,让算法按照自己的意图排序,而不是被推荐算法牵着鼻子走。
另一个冷笑点:当中国和美国都在为了谁先做出通用人工智能而砸下千亿美元时,真正改变普通人生活的,可能是一个不声不响把推理成本打到地板上的开源团队。他们没打算消灭人类,他们只想帮你把那些烦人的重复劳动干掉。而干掉重复劳动这件事本身,就已经让一大半围绕AI的商业故事失去了意义。毕竟,如果人人都能用上便宜到不用思考的智力,那智力本身就不再是稀缺品。
结尾:智力过剩的时代,便宜才是硬通货。降价的每一分钱,都在重新划分权力的版图。当算力廉价到不如一杯拿铁,原来那批靠卖智力稀缺性吃饭的人,该换菜单了。
作者单位背景 Hacker News社区讨论