谷歌近日发布 Gemini 3.8 Live 与 Extended Thinking 两款实时对话模型,解决语音 Agent 执行任务时的"沉默时刻"问题;同期腾讯 WorkBuddy、百度搭子与小度等也在把 Agent 接入硬件设备,触达聊天框之外的现实场景。
谷歌近日推出两款新的实时对话模型——Gemini 3.8 Live 与进阶版 Gemini 3.8 Live Extended Thinking,据 InfoQ 报道,谷歌方面称其为迄今最先进的实时对话产品。两者定位不同:常规版主打低延迟,适合大规模语音场景铺开;进阶版则专门应对需要多步推理、串联多个工具才能完成的复杂任务,为此额外加了一层后台"思考"能力。目前两款模型都已接入 Gemini API 和 Google AI Studio,开发者可直接调用。
谷歌方面称,此次更新要解决一个常见问题:用户要求助手查数据、调用系统时,语音通话里的几秒沉默会让人难以判断助手是在思考还是已失去响应。Extended Thinking 可在后台规划任务并异步调用工具,先给出"我来查一下"之类的回应,执行中还口头报告进度;开发者需依据 API 返回的 IN_PROGRESS 和 IDLE 状态判断任务是否真正完成。

图:Speech to Speech Index 榜单,来源:infoq.cn
在 Artificial Analysis 榜单上,Extended Thinking(High)取得 82.6 分综合指数,两款模型均支持视觉输入、可识别切换 97 种语言。发布后,有开发者关注后台任务能否与对话同时进行,也有用户追问谷歌为何未发布新 Pro 模型。
这是更大趋势的一部分:极客公园报道指出,过去一年 Agent 主要工作于文件、网页和软件,触达不到会议室对话、孩子作业进度这类现实信息,硬件因此进入 AI 公司视野。9 月 2 日,腾讯 WorkBuddy 生态发布会展示九款联名智能硬件,覆盖眼镜、录音卡、耳机等设备;9 月 8 日,百度搭子落地小度添添闺蜜机 Ultra、智能屏 X9 Ultra、智能摄像机 C1500 和智能音箱 Pro Max。海外,Google 把 Gemini for Home 带入音箱、门铃,Amazon 通过 Alexa+ 连接智能家居。这些动作共同指向:Agent 正从聊天界面延伸到能听、能看、能控制设备的场景。
谷歌尚未回应网友对新版 Pro 模型发布时间的追问。Extended Thinking 的实际表现仍需开发者结合自有工具测试,单项跑分不能直接推算部署完成率;谷歌也提示,视频帧默认会发送给模型,接入方需自行控制输入量以管理成本。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断