这台国产AI的价格过山车,把开发者折腾得够呛,但背后的算盘你绝对想不到!
DeepSeek Flash系列API价格正式回调。空闲时段输入缓存命中每百万tokens只要两分钱、缓存未命中一块钱、输出四块钱,高峰时段翻倍。
消息一出,Reddit上炸了锅,有人喊“回来了都回来了”,有人冷笑“晚了”,更多人埋头算汇率——0.15美元输入、0.6美元输出,这价格到底香不香?
这台价格过山车,两个月内涨了又降
先把时间线拉直。
2026年4月,DeepSeek把Flash的缓存命中价格打到0.02元/百万tokens,创下全球大模型价格新低。6月腾讯云跟进,Flash缓存命中再降90%。到了7月31日,V4 Flash正式版API上线,Agent能力暴涨六倍,价格低到离谱。开发者乐疯了——“蹬了一小时才不到一块钱”。
然后翻脸。8月6日DeepSeek突然发预告:要涨价,涨幅不小。8月13日正式宣布峰谷分时定价,高峰时段翻倍。Flash空闲时段缓存命中从0.02涨到0.05,涨幅150%;输出从2块涨到4.5,涨了125%。开发者直接炸了。
Reddit上的MikeX7s说得难听:“well well well,看看谁爬回来了。Muse Spark 1.3严重削价,加上DS涨价,他们的API流量跌到推理算力在那闲得慌”。话糙理不糙。涨价是把双刃剑,砍向用户的同时也砍向了自己。
9月8日,DeepSeek V4.1 Flash中间版本内测开启。同一天宣布9月10日Flash系列开始降价。涨了不到一个月,降回来了。
这就怪了。
缓存命中两分钱,背后藏着一个反常识的真相
很多人盯着输出价格从2块涨到4块再降到4块,觉得降得不够狠——涨价前输出才2块,现在4块,这不还是贵了一倍吗?
账不是这么算的。
DeepSeek真正的杀手锏是缓存命中。0.02元/百万tokens是什么概念?Claude Opus 4.8输出25美元/百万tokens。Flash的输出即使按4块算,也不到Claude的零头。但缓存命中才是那个“几乎不要钱”的部分。
开发者实测发现,接入Claude Code干活,四小时消耗近1亿token,缓存命中率高达99%。这意味着什么?绝大多数输入根本不用重新计算,直接从缓存里读,成本几乎为零。
这才是DeepSeek Flash真正的定价逻辑:用极低的缓存命中价格锁定高频用户,用输出价格覆盖边际成本。你用得越多、越依赖缓存,单次成本就越低。这不是简单的“便宜”,这是把定价策略嵌进了使用习惯里。
Reddit上有人算过:off-peak每百万tokens输入0.22美元降到0.15美元,输出0.66美元降到0.6美元,缓存从0.007降到0.003。数字不大,但乘以亿级token消耗,差别就出来了。
竞争对手同时出牌,这不是巧合
降价的时间点耐人寻味。9月2日Meta发布Muse Spark 1.3。9月3日B.AI宣布DeepSeek V4 Flash停止免费,改为五折计费。
往前看,8月26日智谱的GLM 5.3 Flash上线,标价输入0.15美元/百万tokens、输出0.5美元,限时五折后只要0.075美元输入。Reddit用户Fzzle直言“GLM 5.3 flash probably put some pressure too”。
再往前,6月DeepSeek V4 Flash的输入成本比Claude Sonnet便宜7倍、输出便宜17倍,比Claude Haiku便宜十分之一到二十五分之一。当时DeepSeek是绝对的“价格屠夫”。但涨价给了竞争对手可乘之机。GLM Flash标价0.8元/2.8元,约为GLM 5.3的十分之一,限时五折后约二十分之一。
开发者Zealousideal_Aide787说得直接:“就算降价我也不太会回DS了,GLM flash和muse 1.3看起来稳定多了”。价格可以回调,信任没那么容易。
V4.1才是真正的底牌,降价只是前戏
如果只是降价,那不过是回到原点。但DeepSeek在降价同一天亮出了真正的底牌。
9月8日开启内测的V4.1 Flash,采用全新模型结构,原生多模态支持。开发者反馈第一感受是“太快了”——SVG代码生成快6倍,长上下文检索快5倍多。内测模型ID里带“expires-on-0910”,9月10日自动过期。跟降价生效是同一天。
官方问卷直接问内测用户:“V4.1 Flash能不能全面替换V4 Pro?”。暗示很明确了——V4.1 Flash可能取代现役的Pro版本,成为DeepSeek的主力模型。
技术细节也浮出水面:V4系列在100万token场景下,单token推理计算量只有V3.2的27%,KV Cache占用降至约10%。每层256个专家只激活6个。2840亿参数的MoE模型,激活参数仅130亿。这些数字意味着同一套硬件能撑起更多的并发请求,单位成本持续下降。
这才是降价的底气——不是让利,是成本真的降下来了。
开发者用脚投票,价格战打成了信任战
Reddit评论区最扎心的不是算价格的,是那些说“不回来了”的。
“我改到OpenAI订阅制Luna了,涨价后省了不少钱”。“两个ChatGPT Plus订阅用得好好的,一个Astra low做规划,一个Luna xh做实现。我不会再订阅DS了,这是信任问题,不是价格问题。创始人说不在乎API用户和编程,只关注AGI/ASI,我没理由继续支持他们”。
这话够狠。创始人梁文锋在8月公开表示不想当“价格屠夫”了。从商业角度看没错——长期低价不可持续,企业要盈利。但从开发者角度看,这句话等于说“你们不是我的优先项”。
涨价是商业决策,降价也是商业决策。但信任一旦断裂,不是改个价签就能接上的。
Artificial Analysis的数据显示,DeepSeek模型智能指数36分,排在第15位。前两名是Claude和GPT-6,国内智谱第7、Kimi第9、千问第13。DeepSeek不在第一梯队。V4.1被寄予厚望,外界猜测这次不是简单后训练,可能重做了预训练。
两分钱和四块钱之间,藏着AI商业化的终极难题
把整件事串起来看,DeepSeek面临的是一个经典的商业困境:
技术效率在提升,单位成本在下降,但收入必须增长。
V4 Flash的推理效率已经做到V3.2的27%,KV Cache降到10%。V4.1的速度又翻了五六倍。技术越强、效率越高,理论上应该越便宜。但股东要回报、研发要投入、算力集群要扩张——这些都需要钱。
涨价赶走了用户,降价召回了部分用户,但真正的解法是让用户愿意为更高的价值付费,而不是为更低的成本留下。
V4.1 Flash走了一条巧妙的路径:不直接涨价,但用新模型、新能力重新定义“什么值得付费” 。原生多模态、六倍速度、可能取代Pro的能力——这些东西让开发者觉得“我付的钱买到了更多”,而不是“同样的东西变贵了”。
Reddit用户shing3232的猜测可能最接近真相:“新硬件上线了,比之前的DS4F快得多。950 PR集群有大延迟,意味着正在用于服务”。如果真是新硬件集群上线,那降价的逻辑就完全变了——不是让利,是产能释放后的自然调价。
DeepSeek Harness在GitHub上24小时狂揽7万星。不到40天,DeepSeek从模型到多模态到Agent工具链全线铺开。
价格回到原点,但游戏规则变了
9月10日中午12点,Flash价格回调。跟4月那次打到0.02元的价格战不同,这次降价发生在V4.1内测的阴影下。开发者面对的不是“更便宜的同一个东西”,而是“可能更快更强更便宜的新东西”。
Reddit上那条评论说得妙:“2x drop in every currency”。数学上没错,但商业上不是。
降价当天V4.1内测过期。接下来会发生什么?是V4.1正式上线、价格再调?还是Flash系列彻底被新架构替代?官方问卷里那句“能否全面替换V4 Pro”才是真正的悬念。
有个细节值得留意:内测模型计费跟V4 Flash一样。有开发者反馈“5分钟10块钱”、“瞬间几十块没了”。官方说的“成本更低”可能指底层推理效率,而不是开发者账单。速度快了,token消耗也快了,单位价格没变,总账单可能更高。
这就形成了一个有趣的悖论:技术越 efficient,用户可能付得越多。因为你会用更多。
DeepSeek用两个月时间走完了一个完整的商业周期:降价获客→涨价试探→竞品施压→回调+新品托底。每一步都有清晰的市场信号。
两分钱的缓存命中,四块钱的输出,六倍的速度,一个正在重写规则的AI公司——这场戏还没演完。