Token导航 LogoToken导航TokenDH.com

我们跑了一遍主流榜单,看看Gemini 3.8 Live把语音Agent推到了哪一步?

更新时间 2026-09-17来源 科技行者正文 5740字阅读约 18分钟11 张图片
作者:周雅

作者|周雅

大家日常用语音跟AI聊天的过程中,有没有遇到这种情况:要么它接话挺快,要么稍微来点复杂的任务它就犯傻,场面一度尴尬。

这是实时对话模型眼下面临的一个技术矛盾:“深度思考”与“流畅对话”之间的平衡,模型越需要“深度思考”,对话往往就越不“实时”,导致人和AI之间的对话走向一种奇怪的不同频节奏。

美国当地时间9月15日,Google正式发布两款实时对话模型Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking,似乎就在试图解决这个矛盾,因为这次升级真正瞄准的,正是能够一边对话、一边推理和调用工具的语音Agent。

具体来看两款模型:

Gemini 3.8 Live走的是更轻量、低延迟、低成本的路线,重点面向实时对话场景。除了语音输入输出,它还能结合图片、视频进行近实时视觉理解,并支持工具调用和Google Search Grounding,更适合客服、日常助手、车载交互等对响应速度、并发规模和成本都比较敏感的场景。

Gemini 3.8 Live Extended Thinking是“深度思考”版本,专注于复杂推理和多步骤任务。它可以在后台持续思考、调用外部工具或API、等待任务结果,同时在前台继续和用户唠嗑。它更适合行程规划、复杂客服、销售助手等需要边交流、边推理、边执行任务的语音Agent场景。

图片

01. 对话质量如何?

Speech to Speech Index由第三方评测机构Artificial Analysis维护,综合评估语音Agent在语音推理(Speech Reasoning)、智能体任务表现(Agentic Performance)、Arena 用户偏好(Arena Preference)、任务成功率(Task Success Rate)四项维度的表现,是目前语音Agent领域最常被引用的整体指数。

在此方面,Gemini 3.8 Live Extended Thinking (High) 以82.6分登顶,领先GPT-Live-1(Astra, Medium)的81.5分,领先Grok Voice Think Fast 2.0 High的81.3 分。Gemini 3.8 Live以76.0分位居第五名。

图片

图:Artificial Analysis Speech to Speech Quality Index位次对比(来源:Artificial Analysis)

需要注意的是,位居榜单中段的 Gemini 3.1 Flash Live High(71.5 分)和更靠后的 Gemini 3.1 Flash Live Minimal(63.9 分),都是Google上一代的语音模型。3.1 系列在综合指数上落后3.8系列10分以上,说明这一代升级是实打实的能力跃迁,而非小幅微调。

从数据分布看,前三名之间的差距非常窄,都在1.5分以内,说明当前主流语音Agent在通用对话质量维度上的能力已经相当接近,真正的分野可能出现在具体任务和成本维度上,这也是接下来两个基准要拆解的内容。

02. 完成Agentic任务如何?

τ-Voice是一个专门评估语音Agent的基准测试,主要看一个语音Agent在真实对话里,能不能听懂、遵守规则、调用工具,并把事情真正办完。

Gemini 3.8 Live Extended Thinking (High) 在τ-Voice方面得到68.6%的通过率,位居第一,险胜于GPT-Live-1 (Astra, medium) 的67.9%,OpenAI的GPT-Live-1 (Sol, low) 以59.3%位居第三。

图片

τ-Voice 的三个测试子域,也就是航空、零售、电信,各自有明显不同的任务特征。航空场景涉及多轮改签和退款;零售场景涉及订单争议和退货流程;电信场景涉及套餐变更和账单处理。

分行业看,Gemini 3.8 Live Extended Thinking 在电信场景以84%的通过率位居第一,明显领先GPT-Live-1 Astra的80%;在航空场景以72%位居第一,与Astra打平;但在零售场景以50%落后Astra的52%。

这一分行业差异对企业采购语音Agent有参照意义:电信、金融、银行等强合规、长链路场景,Gemini 3.8 Live Extended Thinking是当前τ-Voice 榜单上最合适的选择;但如果场景是电商客服或退换货处理,选择的天平会略微倒向OpenAI的Astra。

图片

真正值得注意的是Sierra的τ³-Banking基准,这是一项专门评估语音Agent在银行业务场景下端到端完成能力的基准,涉及账户查询、转账验证、争议处理、身份认证等多步流程,对合规约束、错误处理、多步授权的要求都高于通用场景。

Gemini 3.8 Live Extended Thinking (High) 以35.1%的通过率位居第一,第二名GPT-Live-1 Astra (Medium)是32.0%,第三名xAI-Realtime只有16.5%,第四名Gemini 3.1 Flash Live (High) 是11.3%,第五名GPT-Realtime 2 (High) 是10.3%。

图片

这里值得注意的变化,是Gemini 3.8 Live Extended Thinking,在τ-Voice上仅比Astra高出0.7个百分点(68.6%对67.9%);到了银行业务测试,这一差距扩大到3.1个百分点(35.1%对32.0%)。τ³-Banking要求Agent从大规模、相互关联的银行政策文档中找到正确规则,并连续完成账户查询、争议处理、产品变更等多步工具调用。因此,这组结果至少表明:在更强调知识检索、规则理解、多步骤执行的复杂任务中,Gemini 3.8 Live Extended Thinking相对GPT-Live-1 Astra的领先幅度有所扩大。

不过,35.1%的绝对通过率也揭示了另一面:即使在这组测试中表现最好的模型,在复杂银行业务流程里,仍有相当长的路要走。真正进入生产环境,还需要更严格的权限控制、流程约束、人工兜底和持续评估。

03. 语音推理如何?

Big Bench Audio是评估模型音频推理能力的基准,覆盖对语音材料的理解、逻辑判断和内容推断。Gemini 3.8 Live Extended Thinking在这项基准上拿到97.7%的分数。

但站在这项榜单前三位的,都是中国团队的语音模型:StepFun的StepAudio 3 Realtime以99.7%位居第一,阿里云的Qwen Audio 3.0 Realtime Plus以 99.2% 位居第二,Qwen3.5 Omni Plus Realtime以98.7%位居第三。Gemini 3.8 Live Extended Thinking (High) 以97.7%位居第四,Step-Audio R1.1 (Realtime) 以 97.6% 位居第五。

这是本次评测中最值得国内读者注意的一项结果。语音推理反映的是模型对语音材料本身的理解和逻辑处理能力,是语音Agent最核心的底层能力之一。这说明在语音推理这项底层能力上,中国团队已经站到了全球第一梯队。

图片

04. 成本如何?

如果说前几项基准Gemini 3.8 Live系列是“窄幅领先”,那么在成本维度上,Google打出的是明显的价格优势牌。

Artificial Analysis以“每小时输入音频成本”作为衡量单位,对比了几款前沿语音Agent模型。Gemini 3.8 Live 以0.84 美元/小时的成本,在所有前沿语音Agent模型中位居最低。Gemini 系列(含 2.5 Flash Native Audio Dialog、3.1 Flash Live 两个版本)连续包揽前四位,都在1.75 美元/小时以下。

3.8 Live Extended Thinking (High) 的成本为3.50美元/小时,处于中档位置,仍然低于同档次的GPT-Realtime-2 (High) 4.14 美元/小时,明显低于 GPT-Live-1 (Astra, medium) 的5.83美元/小时和Grok Voice Think Fast 2.0 High的4.80 美元/小时。榜单最贵的是GPT-Realtime-2.1 High,为10.75美元/小时,是3.8 Live Extended Thinking的三倍多。

图片

图:每小时输入音频成本对比(Big Bench Audio子集,数据来源:Artificial Analysis)

这次Live系列则直接把成本对比图放出来,显示Google在争取企业用量的意图非常明确。

如果把τ-Voice通过率作为纵轴、每小时成本作为横轴放到同一张图上,Gemini 3.8 Live Extended Thinking位于AA榜单的“最具吸引力象限”(Most attractive quadrant),也就是高任务通过率+相对较低的成本。同象限内还有GPT-Live-1 Astra(成本高66%,但任务通过率低0.7个百分点)、GPT-Live-1 Sol(成本低27%,但任务通过率低9个百分点)、Grok Voice Think Fast 2.0 High、Qwen Audio 3.0 Realtime Plus 等几款模型。

图片

图:τ-Voice 通过率 vs 每小时输入音频成本,绿色区域为"最具吸引力象限"

05. 从人工偏好到帕累托前沿

除了三项SOTA,Google还提到了一项间接的支撑证据。

在ServiceNow的EVA-Bench测试中,Google表示,3.8 Live两款模型进一步推进了复杂工作流中“任务准确率”和“对话质量”之间的帕累托前沿(Pareto Frontier)。

所谓帕累托前沿,可以理解为两个相互牵制的指标之间所能达到的最佳组合:语音Agent既要把任务做对,又要让对话保持自然流畅,而提升其中一项,往往会以牺牲另一项为代价。Google想表达的是,Gemini 3.8 Live系列的这两项能力同时达到比此前更高的水平。

图片

Google还特别提到,这项测试基于Gemini Enterprise Agent Platform中的Live API完成,因此相比单纯的模型能力测试,它更接近企业Agent实际使用的技术环境。(不过,这仍然属于标准化基准测试,不能直接等同于真实客户生产环境中的实际表现。)

06. 响应时间如何?

3.8 Live Extended Thinking版本的推理增强在多项能力上都有明显加成,但在响应速度上是有代价的。AA榜单上的Time to First Audio(首字响应时间)指标显示,Extended Thinking的首字响应时间是1.35秒,Grok Voice Think Fast 2.0 High是0.70秒,Gemini 3.8 Live是1.18秒,Google 2.5 Flash Native Audio Dialog是0.63 秒。

图片

差异也体现在了用户偏好上。Speech Agent Arena是一项以人工双盲偏好投票排名的语音Agent评测,与Big Bench Audio基准不同,反映的是听感与自然度的综合印象。

Speech Agent Arena的Preference Elo榜单上,Gemini的模型包揽前三名。3.8 Live以1083分位居第二,3.8 Live Extended Thinking以990分位居第三。第一名是Gemini 3.1 Flash Live Minimal的1096分。

图片

07. 底层能力

在具体能力层面,Gemini 3.8 Live 系列的产品设计有几项值得单独说明。

第一项是3.8 Live Extended Thinking的“边想边说”(reason and speak simultaneously)。过去,语音AI在处理需要多步推理的复杂问题时,典型模式是“用户说完,模型思考,模型输出”,中间的思考期是一段静默甚至断裂。3.8 Live Extended Thinking改变了这一顺序:模型会先用一句“Let me check that...”这类早期口头提示接住对话,同时在后台展开多步推理,并通过实时进度叙述(live progress narration)让用户知道多步任务当前进展到哪一步。这一形态改变是本次发布最实质的产品升级,直接对应了语音Agent走进企业客服等真实场景的一个长期障碍:沉默的思考期让用户觉得系统卡顿甚至掉线。

第二项是97种语言的自动切换。Gemini 3.8 Live可以在对话中途识别用户切换到不同语言并跟进。这一点在跨境企业客服和多语言市场的语音应用中意义直接。

第三项是异步函数调用(asynchronous function calling),即模型可以在保持对话不中断的同时,在后台执行工具与API调用,用户不必等待工具调用返回结果。这项能力对语音Agent承担多步业务流程至关重要。

在部署侧,Gemini Live API是核心通道,Google通过Live API把两款模型开放给Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents等多家开发者平台。这些平台已经在语音Agent的实时媒体流基础设施上有各自积累,接入Gemini Live API后,开发者可以直接把注意力放在应用层。

在企业客户侧,Salesforce、Genspark、Lumeris、11Sight、Equal AI、ServiceNow、Lenskart、Ambr AI、Casuu等公司已经在测试或部署这两款模型。在自家产品线上,3.8 Live Extended Thinking已经进入Google Workspace(Docs Live、Gmail Live、Keep Live,面向Google AI Pro和 Ultra 订户),3.8 Live版本接入Search Live提供步骤级问题排障。企业客户可以通过Gemini Enterprise的私有预览接入两款模型。

安全层面,Google 表示所有音频输出都通过 SynthID 加入不可感知的水印,用于AI生成内容的可检测性。

值得注意的是,三家前沿的语音模型能力正在快速趋同,接下来的竞争重心可能会从“模型能力”迁移到“场景应用”以及“实际成本”上,但也不影响它标出了一个可以让企业采购方和开发者作参照的坐标。

文章标签GeminiGoogle智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多