谷歌 DeepMind 发布新一代语音转文本模型 Gemini 3.5 Transcribe,主打高精度实时转录。该模型能应对嘈杂环境和口语修正,支持超过85种语言,并提供流式与离线两种 API。开发者现可通过 Gemini API 接入,模型也已在 Gboard、Gemini 应用等多款产品中落地。
谷歌 DeepMind 今日发布 Gemini 3.5 Transcribe,这是其迄今最精准的语音转文本模型。与传统语音识别系统不同,它不只是把语音转成文字,而是能将原始音频直接转换为整洁、带格式的文本,即使在嘈杂环境、复杂术语和口语自我修正的场景下,也能保持高质量转写。

此前,这款模型已经落地到消费者产品中,例如 Android 上的 Rambler 功能和 macOS 版 Gemini 应用 的新语音能力。现在,开发者也可以通过 Google AI Studio 中的 Gemini API 和 Gemini Enterprise Agent Platform 使用该模型。
Gemini 3.5 Transcribe 提供两套 API:Live API 支持亚秒级延迟的双向流式传输,适合实时语音应用;Interactions API 面向预录音频,能输出说话人标注和逐词时间戳。
核心能力
与上一代 Chirp 3 相比,Gemini 3.5 Transcribe 的词错误率更低,最终转录时间缩短了 70%。在 FLEURS 多语言基准上,流式模式 WER 为 5.50%,非流式模式为 5.04%。


产品落地
新模型已在多个谷歌产品中发挥作用:
生态与反馈
开发者平台 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 已接入 Gemini Live API,帮助开发者快速构建高可用语音交互产品。Vivo、Intellitek Health、Lingopal 等公司也反馈了积极评价,认为其延迟、准确率和语言支持令人印象深刻。
免费获取企业 AI 成熟度诊断报告,发现转型机会






可用性
原文链接:Google DeepMind
本文由前途科技编辑整理
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断