Gemini 3.8 Flash上线:DeepSWE跑分73.7%压过Opus 5

六周发三个模型,谷歌到底在急什么!

2026年9月2日,谷歌DeepMind悄悄上线了Gemini 3.8 Flash。距离3.7 Flash发布才三周。一个Flash系列的“工作马模型”,居然在软件工程长周期任务上压过了Claude Opus 5。但别急着喊“谷歌回来了”,事情没那么简单。

Gemini 3.8 Flash参数规模未公布,1M上下文窗口支持文本、图像、音频和视频输入。API定价每百万输入0.75美元、输出3.75美元。输出速度每秒约300个token。Artificial Analysis Intelligence Index评分59分。DeepSWE v1.1软件工程基准73.7%,比3.7 Flash的65.3%涨了8.4个百分点。Terminal-Bench 2.1得分89.4%,把Claude Opus 5的89.1%压了下去。

但同一个模型在Terminal-Bench 4.0上只有19.1%。什么概念?相当于一个学生在一张卷子上考了89分,换张卷子立马不及格。这就怪了。

三周一个版本,谷歌在赶什么?

Flash系列的迭代速度已经疯了。3.6 Flash、3.7 Flash、3.8 Flash,六周发了三个。一年前新模型还得等三到六个月,现在三周一更。

这种速度通常意味着什么?增量更新、小修小补、换皮改版。但3.8 Flash的改进幅度不像小修小补。DeepSWE从65.3%跳到73.7%,涨了8.4个百分点。Artificial Analysis Intelligence Index从56分跳到59分。3.7 Flash发布也就三周前的事。

谷歌官方说3.8 Flash“在复杂任务上表现出更强的勤奋——执行额外的推理步骤、迭代调用工具”。翻译成人话:这个模型会自己想更多、查更多、算更多,然后才给你答案。

这跟传统软件更新的逻辑完全不同。Chrome浏览器从120跳到121,你不会觉得它变“聪明”了。但Gemini从3.7到3.8,智能水平确实在涨。而且涨得还挺快。

问题来了:既然迭代这么快,为什么3.5 Pro迟迟不出?《华尔街日报》爆料说3.5 Pro的预训练“彻底翻车”,谷歌直接跳过3.5 Pro奔着Gemini 4去了。Flash系列在快速迭代,Pro系列在跳票。这不叫产品策略,这叫两条腿走路一条腿瘸了。

跑分漂亮,但漂亮在哪儿?

Benchmark(基准测试)这玩意得分开看。同一个模型,在不同测试上表现天差地别。

3.8 Flash在Terminal-Bench 2.1上89.4分,排第一。到了Terminal-Bench 4.0,19.1分。差了70个百分点。这只能说明一件事:2.1版本的数据可能已经 leaked 进训练集了。模型不是在解题,是在背答案。

DeepSWE v1.1上73.7%,距离Claude Opus 5的74.0%只差0.3个百分点。但DeepSWE的测试任务是公开的。公开就意味着可能被刷。Google、OpenAI、Anthropic都在干这事,谁也不比谁干净。

Vals Finance Agent V2上61.4%,排第一。Harvey Legal Agent Benchmark上10.0%。金融和法律都是专业领域,差距这么大说明模型在不同垂直领域的泛化能力极其不稳定。

Artificial Analysis Intelligence Index的59分,跟GPT-5.6 Sol的xhigh推理模式(59分)和Grok 4.6的medium推理模式(59分)持平。但3.8 Flash每任务的成本是0.58美元,比3.7 Flash的0.40美元贵了40%。价格没变,每任务成本涨了,因为模型在复杂任务上输出的token更多了。换句话说,3.8 Flash“更努力”了,但努力是要钱的。

0.75美元的定价,藏着什么算盘?

3.8 Flash的定价是每百万输入0.75美元、输出3.75美元。跟3.7 Flash完全一样。但注意,这是“ introductory price ”( introductory price )。2027年1月1日起,价格翻倍——输入1.50美元、输出7.50美元。

为什么搞限时折扣?官方说法是鼓励用户迁移到新一代模型。更直白的解读:用低价抢份额、绑用户,等用户习惯了再涨价。

跟竞品比一比。Claude Opus 5的定价是输入5美元、输出25美元每百万。3.8 Flash输出价格只有Opus 5的15%。GPT-5.6 Sol呢?没公开具体数字,但圈内人都知道比Gemini贵一大截。

便宜是便宜,但便宜有便宜的代价。3.8 Flash在复杂任务上会消耗更多token。谷歌官方说得很直白:“在复杂任务上,模型可能会使用更多token来最大化性能,尤其是在更高的推理级别”。翻译:你想让它想得更深,它就想得更多,你付的钱也更多。

这就像请了个时薪很低的实习生,但他干活慢、反复查资料、写一堆中间文档。时薪低,工时长了,总账单可能并不便宜。

Cyber版本,为什么只给“ trusted defenders ”?

3.8 Flash Cyber是这次发布的另一个版本。专注于漏洞检测和自动打补丁。在CyberGym行业标准基准上86.2%,在CWE-Bench自动打补丁测试上47.2%。处理真实Chrome安全漏洞时,生成的正确补丁是更大模型的2.6倍。

听起来很厉害对吧?但你用不了。

Cyber版本只通过Fairwind Program( Fairwind Program )向“ trusted defenders ”开放。所谓trusted defenders,包括政府机构、关键基础设施运营商、医疗提供商、电信服务商。谷歌目前在全球有超过650个合作伙伴。普通开发者?抱歉,没资格。

谷歌官方说Cyber版本“配备了更宽松的安全缓解措施”。翻译:这个模型能做的事情更多,能造成的破坏也更大,所以我们不敢随便给人。

这里有个悖论:最擅长发现漏洞的AI,被锁在最严格的盒子里。真正需要它来防御的人拿不到,能拿到的人可能用它来攻击。谷歌说他们“优先考虑漏洞修复而非利用能力”。但这话你信几分?

Anthropic也在做类似的事。Claude Mythos 5.1同样只通过trusted access programs开放。整个行业都在把最强的安全AI锁起来,只给“自己人”。问题是,“自己人”的定义权在谁手里?

谷歌在下一盘什么棋?

有人说谷歌放弃了前沿模型竞争,转攻效率型模型。3.8 Flash的表现说明这说法不准确。Flash系列不是放弃竞争,是用另一种方式竞争——用更快的迭代、更低的价格、更广的覆盖去抢市场。

OpenAI和Anthropic在拼“天花板”——谁的模型最聪明。谷歌在拼“地板”——谁的模型能覆盖最多的用户和场景。3.8 Flash的1M上下文窗口、多模态输入(文本、图像、音频、视频)、函数调用、代码执行、计算机使用等能力,面向的是开发者、企业、自动化工作流。这不是实验室里的炫技模型,这是拿来干活的工具。

但3.8 Flash有个致命问题:知识截止日期混乱。官方说“某些领域知识截止到2026年3月,其他领域可能只到2025年1月”。同一模型,不同领域的知识新鲜度不一样。你问它2026年的新框架,它可能给你2025年的答案。这对开发者来说是灾难。

还有个小细节:Google的Gemini App里,免费用户只能看到3.6 Flash。3.7和3.8只对Pro和Ultra订阅用户开放。模型更新了,但大部分用户用不上。谷歌的产品分发和模型发布是脱节的。

六周发三个模型,每个都在特定benchmark上“击败”了竞品。但benchmark是可以刷的,价格是暂时的,Cyber版本是锁起来的。3.8 Flash到底是真的强,还是精心设计的数字游戏?

一个模型在Terminal-Bench 2.1上89.4分,在4.0上19.1分。同一个“智能”,两张卷子,分数差70分。

你说这模型是聪明还是不聪明?