谷歌AI模型更新引爆价格战,谁还敢说Flash系列只是“快枪手”?
Google一口气甩出三款新模型,直接把AI价格战打到了每百万token七块五毛钱,这是要把竞争对手逼上绝路的节奏吗?
2026年7月22日,Google DeepMind发布了Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber三款新模型。作为最受开发者关注的轻量级AI模型系列,这次更新聚焦于提升推理效率、降低延迟和优化成本。其中3.6 Flash在代码生成和知识型任务上表现亮眼,3.5 Flash-Lite则以每秒350个输出token的速度刷新了性价比记录,而专攻网络安全的3.5 Flash Cyber则通过CodeMender代理实现了漏洞检测与修复的全链路自动化。
3.6 Flash模型用更少token完成更多任务并直接降低开发者账单
Google官方博客宣称,基于第三方基准测试Artificial Analysis Index的数据,Gemini 3.6 Flash比上一代3.5 Flash减少了17%的输出token用量。这意味着在处理同样的复杂指令时,模型吐出的“废话”更少了。更关键的是,它在DeepSWE这类端到端代码修复测试中,任务完成率从3.5 Flash的37%提升到了49%,在ML Research基准测试里则从49.7%跃升至63.9%。这个涨幅在AI领域可不是挤牙膏,这属于直接换了个引擎。
在价格方面,3.6 Flash的输入token定价为每百万1.5美元,输出token为每百万7.5美元。虽然绝对数字不算低,但考虑到它减少了推理步骤和工具调用次数,完成单个代理任务的总成本反而是下降的。在OSWorld-Verified这类计算机操作测试里,3.6 Flash得分83.0%,比3.5 Flash的78.4%高出一截,计算机使用功能被直接做成了Gemini API和Gemini Enterprise的内置客户端工具。
这种效率提升给企业带来的价值其实很直接。Hebbia和Harvey这类处理大量文档分析和报表生成的客户,发现新模型在解析图表和起草报告时不仅更准,而且快得让人不适应。以前要等十几秒的复杂财务数据提取,现在眨个眼就出结果,这种体验上的落差会直接改变开发者的工作习惯。
3.5 Flash-Lite以低价高吞吐量抢占高频任务市场并实现性能反超
如果3.6 Flash是全能型选手,那3.5 Flash-Lite就是专为“量大管饱”场景设计的特化工具。根据Artificial Analysis的数据,它的输出速度达到每秒350个token,是3.5系列里跑得最快的。定价方面,每百万输入token仅需0.3美元,输出token为2.5美元。这个价格在兼顾多模态理解能力的模型里属于降维打击。
更令人意外的是它在代理任务上的表现。在SWE-Bench Pro编程基准里,3.5 Flash-Lite拿下了54.2%的通过率,居然超过了3.0 Flash的49.6%。在OSWorld-Verified测试中,74.0%的成绩同样压过了3.0 Flash的65.1%。这意味着如果你手里本来在用2.5 Flash或者3.0 Flash处理大批量简单任务,现在直接切换到3.5 Flash-Lite不仅能省下一大笔钱,速度还更快,完成质量也更高。
早期采用者Palo Alto Networks和Ramp这类公司的反馈验证了这一价值定位。在处理大规模电商数据提取、产品特征汇总或者多语言票据翻译时,Flash-Lite的吞吐量优势极其明显。它甚至可以配合3.6 Flash作为主代理,瞬间生成25个独立的网页设计概念,这种分工模式为复杂工作流提供了全新的优化思路。
3.5 Flash Cyber与CodeMender联手填补AI安全自动化最后一块拼图
这是一个非常特殊的发布。Google敏锐地意识到,AI模型发现漏洞的速度已经快过了人类修复漏洞的速度。这个矛盾如果不解决,AI不仅不是安全助手,反而会变成放大风险的加速器。3.5 Flash Cyber就是针对这个矛盾给出的答案。
这个模型基于3.5 Flash进行了微调,专注于识别和修补网络安全漏洞。它与CodeMender代码安全代理深度绑定,让多个Cyber代理协同工作并生成一份综合报告。在流行的CyberGym基准测试中,这套组合方案达到了与前沿模型竞争的性能水平。考虑到这是一个专门领域且token价格比大模型便宜得多,它在企业安全运维场景里具备了极强的落地吸引力。
出于对技术双重用途的审慎考虑,Google没有完全开放这个模型。它仅通过限量的试点项目,独家提供给政府和受信任的合作伙伴。这种“给前线防御者先发优势”的策略,既保护了公共利益,也避免了模型被恶意滥用,是一个在商业竞争和社会责任之间寻找平衡的典型案例。
缺乏外部对比的基准测试和混乱的产品矩阵正在消磨开发者耐心
尽管技术指标亮眼,但这篇发布文章暴露了Google AI战略的深层问题。整篇文章的所有基准测试,无一例外都是对比自家的旧款模型。在GPT-5.6、Kimi K3、Qwen 3.8 Max和GLM 5.2轮番轰炸市场的情况下,这种“自嗨式”的宣传显得缺乏说服力。开发者社区普遍猜测,迟迟未露面的Gemini 3.5 Pro可能因为性能达不到预期而被推迟甚至取消,这些Flash系列的迭代更像是为了维持存在感的补救措施。
除了模型性能的疑虑,Google AI产品矩阵的混乱也在劝退核心用户。Antigravity IDE的订阅政策突变、Gemini Enterprise与个人版的功能割裂、以及Workspace账户长期无法享受到完整AI功能,这些运营层面的失误正在抵消技术层面的优势。有用户直言,Google在AI产品上的混乱程度快赶上当年的Google+了。
Gemini 4预训练启动为未来竞争埋下伏笔但当前定位依然尴尬
在文章结尾处,团队透露已经启动了Gemini 4的预训练,并称之为“最具雄心的尝试”。这个信息耐人寻味。它一方面承认了当前3.5系列在智力水平上难以与OpenAI和Anthropic的旗舰模型抗衡,另一方面也暗示Google把真正的筹码压在了下一代的架构革新上。
在当前阶段,3.6 Flash和3.5 Flash-Lite的定位其实非常明确:它们不是用来争夺“最强AI”头衔的,而是用来争夺“最适合跑生产流量的AI”。在成本、延迟和可靠性这个铁三角里,Flash系列找到了一个极其稳固的平衡点。对于大多数不需要解决黎曼猜想的商业应用来说,这个平衡点的吸引力远超过那百分之几的基准测试分数。
Google正在用这种“闪电战”的方式巩固自己的基本盘。如果Gemini 4能在未来一年内兑现潜力,那么现在的这些Flash模型就是为它铺路的基石;如果Gemini 4也无法突破瓶颈,那今天这些漂亮的token效率数字,就只能成为巨人在时代转折点上的墓志铭了。
这场AI效率革命最讽刺的结局是:当你省下足够多的token时,你最终省掉的可能是你自己的代码审查岗位。现在去GitHub搜索“AI代码审查工具”,看看有多少项目正在试图替代你下个月的工作。
网友观点
关于Gemini新模型的发布,网友的观点主要围绕这几个方面炸开了锅:
“Pro呢?”——旗舰缺席,信心受挫
最集中的火力点在于Gemini 3.5 Pro的再次跳票。网友们觉得,谷歌这是明摆着承认自家旗舰干不过GPT-5.6和Fable 5,只能靠发几个“快枪手”来刷存在感。甚至有评论调侃:“3.6 Flash怕不是Pro版本太拉胯,临时蒸馏出来救场的”。
⚖️ “价不配位”——成本和性价比的争议
虽然官方说3.6 Flash更省token,但网友算账后发现,完成复杂任务时它消耗的总token数还是比竞品多,综合成本并不低。特别是3.5 Flash系列经历了大幅涨价,让很多人觉得“Flash”这个名字已经名不副实了。
“偏科生”——干活快,但不一定聪明
大家普遍承认Gemini 3.5 Flash和3.6 Flash速度确实快,适合处理高频、碎片的“杂活”。但一旦涉及到复杂推理、深度对话或非技术类闲聊,它就显得不够聪明,甚至有点“机械”。不过,Flash-Lite在聊天场景中倒是得到了意外的好评。
️ “产品精分”——内部混乱,用户体验割裂
这是网友最恼火的一点。产品矩阵混乱,Gemini Enterprise、Antigravity、普通Workspace账户之间的功能被强行割裂,甚至个人账户能用的功能,付费的企业账户反而用不了。有人一针见血:“谷歌是在把自己的组织架构图当产品发布”。
结语
大家普遍觉得,谷歌在AI赛道上有点迷失。虽然多模态能力依然是它手里的一张王牌,但不解决旗舰拉胯、产品混乱的问题,靠发几款“经济适用型”Flash很难重拾信心。如今,只能把宝押在不知道还能不能打的3.5 Pro,或是更遥远的Gemini 4上了。