Gemini 3.8 Live与Extended Thinking发布:Google把语音模型劈成两半


Google把语音AI劈成了两半,一半负责说话,一半负责思考!

你以为语音助手变聪明了,其实它只是学会了边想边说!

2026年9月15日,Google发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking,前者主打低成本对话,后者主打多步推理,两款模型在语音质量指数上相差6.6分,在真实客服任务完成率上却暴露了语音智能体的共同天花板。

一个模型说人话,另一个模型干人事

Google在2026年9月15日把语音产品线一刀切开,Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking同日登场,前者定位是“规模化与成本效益”,后者定位是“高复杂度任务与多步骤推理”。

这个切法本身就透露出一个尴尬的事实,过去那种“一个语音模型包打天下”的思路,在真实业务里撞墙了,Google自己承认这两款模型针对的是两种完全不同的职责:一个是对话界面,另一个是碰巧会说话的推理系统。

但是,两款模型在Artificial Analysis语音到语音质量指数上的差距,只有6.6分,Extended Thinking拿下82.6分排第一,标准版Live只有76.0分排第五,中间还夹着两个GPT-Live-1配置和一个Grok Voice Think Fast 2.0。

这就怪了!同一个团队同一天发布的两款模型,语音质量差距只够从第一名滑到第五名,但它们宣称的定位却是一个做“流畅对话”,一个做“复杂推理”,那这6.6分到底买的是什么!

边推理边说话,省掉的沉默值多少钱

Gemini 3.8 Live Extended Thinking最核心的卖点叫“边推理边说话”,模型在后台执行多步骤任务时,会先用“让我查一下”这类语言提示确认用户请求,然后用实时进度叙述引导用户走完整个流程。

这个设计的出发点很朴素,语音智能体在生产环境里最大的失败原因不是答错了,而是不说话了,用户在电话那头等三秒就会挂断。

但这里有一个被忽略的成本问题,Extended Thinking的推理在后台烧算力,同时保持语音输出在持续消耗音频输出带宽,根据Google公布的Live API定价,音频输入每分钟0.005美元,音频输出每分钟0.018美元,双向对话一小时约1.38美元。

相比之下,OpenAI的GPT-Live-1语音前端定价是每分钟0.05美元,一小时3美元,Grok Voice Think Fast 2.0定价是每分钟0.08美元,一小时4.8美元。

Gemini在价格上确实便宜了一大截,但是便宜的代价是什么,标准版Live在语音质量指数上落后Extended Thinking 6.6分,这6.6分对应的是一小时1.38美元里有多少被省掉的“思考时间”。

82.6分的第一名,在真实客服里只过了一半

Google公布的成绩单里有一组数字值得反复看,Gemini 3.8 Live Extended Thinking在τ-Voice基准上任务完成率68.6%,在Sierra的τ-Voice-banking基准上完成率只有35.1%。

τ-Voice不是实验室里的语音识别测试,它给模拟用户加上不同口音和背景噪音,模拟真实网络丢包,覆盖航空、零售、电信三个领域共278个真实场景,用任务完成后数据库状态判断是否成功。

68.6%意味着什么,意味着每三个电话里有一个打不完,Sierra银行场景的35.1%更直接,每三个银行客服电话里有两个搞不定,语音质量指数82.6分的第一名,在真实业务里的表现和这个分数完全不在一个叙事里。

回头看Grok Voice Think Fast 1.0在2026年4月τ-Voice上的成绩是52.1%,语音前沿从30%涨到67%只用了八个月,涨得很快,但离“替代人工客服”还差得远。

后台跑工具,前台说废话

异步函数调用是这两款模型最核心的工程能力,模型在后台执行API和工具调用,同时继续向用户推送语音流,用户不会感觉到任务在“等待”。

但是Sierra τ-Voice-banking基准的35.1%暴露了异步调用的真正瓶颈,问题不在模型能不能在后台跑工具,而在模型知不知道该跑什么工具、跑完工具后该说什么话,银行客服场景涉及698份知识文档、21个产品类别、约19.5万tokens的知识库,模型必须在对话中实时检索并准确引用。

Google在EVA-Bench上宣称两款模型推到了帕累托前沿,平衡了任务准确性和对话质量,但这个基准本身是ServiceNow在2026年6月发布的2.0版本,覆盖3个领域、121个工具、213个场景,2025年发布的1.0版本只有大约四分之一的覆盖量。

更值得注意的是,Gartner估计超过40%的“代理式AI”项目会在2027年前被砍掉,原因是成本超支和效果不佳,另一个2026年的企业调研显示88%的AI代理试点项目根本到不了生产环境。

97种语言切换,和说错话的成本

Gemini 3.8 Live支持97种语言的自动检测和中途切换,这个数字在发布稿里反复出现,但它同时是一把双刃剑。

2026年6月,Gemini Live API的早期版本gemini-3.1-flash-live-preview出现了一个系统性回归,多租户环境下所有代理都受到了影响,问题包括VAD轮次抖动和语言检测错误。

一个语音代理如果在对话中途把用户说的西班牙语误判成葡萄牙语,它不会只是说错一句话,它会用错误的语言继续整个对话,用户听到的每一条后续回复都是错的,97种语言的“支持列表”和97种语言的“可靠识别”之间隔着大量生产环境才暴露的边界条件。

水印能证明它是AI,不能证明它说对了

Google对这两款模型生成的所有音频都嵌入了SynthID不可感知水印,水印织入音频输出本身,用来帮助检测AI生成内容、防止虚假信息传播。

SynthID解决的是“这段语音是不是AI生成的”,它不解决“这段语音的内容对不对”,一个带有SynthID水印的语音代理可能在一小时里完成了40个客服电话,其中12个因为任务失败被转接人工,这12个失败通话的录音每一秒都带着水印。

2026年的企业调研把治理失败列为语音AI部署回滚的首要原因,74%的企业在部署后回滚或关停过语音代理,水印技术的存在让“检测”变得容易,但“治理”要回答的是另一组问题:失败通话的根因是什么,是模型选错了工具,还是VAD切错了轮次,还是97种语言里有一种它其实不熟。

一个银行场景的数据矛盾

Google在发布稿里把τ-Voice的68.6%和τ-Voice-banking的35.1%并排放在同一段话里,前者接近七成,后者刚过三成五,两个数字之间几乎隔着一倍。

τ-Voice覆盖航空、零售、电信三个领域,τ-Voice-banking只覆盖银行客服一个垂直场景,银行场景的失败率是综合场景失败率的两倍,这个差距指向一个具体的未解问题:银行客服对话里到底有什么东西,让语音代理的任务完成率直接砍半。

698份知识文档、21个产品类别、19.5万tokens的检索空间是Sierra给出的解释框架,但框架本身没有回答:是模型检索不到正确的文档,还是检索到了但用错了,还是在对话中途用户改变了问题方向导致检索路径失效,Sierra的τ-Voice-banking还在等待一个能把这35.1%拆开看的实验。