Google DeepMind 正式推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两款新模型,具备准实时推理与并行处理能力,大幅提升语音智能体的多步骤复杂任务处理水平与对话流畅度。
Google DeepMind 正式发布了两款全新的实时对话模型:Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking。新模型在准实时推理与并行处理能力上实现关键突破,让语音交互与复杂任务执行更加自然高效。
两款模型的分工明确:
无论对开发者、企业还是普通用户,这两款模型都为构建可靠、可投入生产的语音 AI 智能体提供了基础构件,同时也让 Gemini 应用、Google Workspace 和 Google 搜索中的语音协作体验更加连贯。
在基准测试中,Gemini 3.8 Live Extended Thinking 展现出企业级的任务执行能力:在 Artificial Analysis 的语音对语音质量指数(Speech to Speech Quality Index)中以 82.6 分斩获总分第一;在智能体任务执行测试中,于 τ-Voice 取得 68.6%、Sierra 的 τ-Voice-banking 取得 35.1% 的领先成绩;在 Big Bench Audio 上获得 97.7% 的高分,且使用成本相比同类前沿模型极具竞争力。
Gemini 3.8 Live 则在兼顾成本与性能的同时赢得了用户的广泛认可,在语音智能体竞技场中位居第二。
在针对语音智能体评估的 ServiceNow EVA-Bench 基准上,该系列模型在任务准确率与对话交互质量之间达成了良好平衡。

Gemini 3.8 Live 支持准实时处理视觉输入,能够结合环境视觉上下文生成更有针对性的回答。模型支持在对话过程中自动识别并无缝切换 97 种语言,并能在后台执行工具和 API 调用的同时继续对话,无需让用户陷入等待。
面对更复杂的场景,Gemini 3.8 Live Extended Thinking 实现了「边想边说」的能力。在保持连贯对话的同时,模型会通过自然的口语提示(例如「我来查一下……」)及时确认用户指令,并在后台处理多步骤任务时同步语音播报进度,大幅降低了用户的等待焦虑。
在安全合规方面,新模型生成的全部音频均嵌入了不可见的 SynthID 水印,确保 AI 生成内容可追溯、可检测,防范虚假信息传播。
通过 Gemini Live API,包括 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 在内的多家开发者平台均已提供支持。这些平台负责底层复杂的实时媒体流传输,让开发者能将精力集中在产品交互体验上。Salesforce、Genspark、Lumeris 与 ServiceNow 等企业也已将该系列模型投入实际业务场景。
两款模型已即日起陆续推送:
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断