Wispr Advanced Interfaces Lab 发布语音识别模型 Canto,在包含 2300 多名真实用户、10 小时听写录音的评测集上,词错误率低于 Google、OpenAI、AssemblyAI、Deepgram 等对比模型,训练采用监督微调加 GRPO 强化学习两阶段方法。
Wispr Advanced Interfaces Lab 推出新一代语音识别模型 Canto,是该实验室"更广泛研发计划"中的第一个模型,专门针对实时听写场景打造。多数语音识别模型在干净录音上表现优异,但 Wispr Flow 的用户实际是在笔记本麦克风、耳机、通勤路上、嘈杂办公室里口述消息、邮件和代码,背景常混有他人说话声、音乐或交通噪音——这类真实条件下的识别效果,一直是行业没有被充分验证的部分。
团队构建了一个由 2300 多名用户贡献、共 10 小时英语 Wispr Flow 听写录音组成的评测集,样本随机抽样自不同应用场景,并严格将训练集和测试集的说话人分开,避免模型对特定口音过拟合。
在这个评测集上,Canto 的词错误率(WER,衡量替换、遗漏、插入错误,越低越好)低于对比的各家模型:官方图表显示,Canto 的 WER 为 3.4%,优于 Google Gemini 3.1 Pro(3.6%)、OpenAI GPT Transcribe(4.0%)、AssemblyAI Universal-3.5 Pro(4.2%)、Google Gemini 3.5 Transcribe(4.5%)和 Deepgram Nova-3(7.4%)。

图:真实听写评测集上,Canto 的 WER 为 3.4%,低于 Google、OpenAI、AssemblyAI、Deepgram 的对比模型,来源:wisprflow.ai
团队还单独构建了 3 小时"挑战集",专挑近处人声、音乐、交通、风声、低音量、耳语或远场说话、上下文极少的简短口述等最容易让听写失败的条件。Canto 在此集上 WER 为 9.1%,仅次于 Gemini 3.1 Pro(8.2%)——但后者是不适合实时低延迟场景的多模态前沿模型,在所有面向实时转写的模型里 Canto 的 WER 最低。
在 LibriSpeech、FLEURS、Common Voice 三个公开英语数据集上,Canto 在 LibriSpeech 上并列最低 WER,另两个数据集上具备竞争力但未领先。团队解释,公开数据集多是"朗读式"语音,和用户即兴口述、语境稀少的真实听写分布不同,这是同时使用两类评测的原因。
Canto 从一个在数百万小时语音和文本上预训练的模型出发,再分两阶段训练:监督微调给模型音频和参考文本,让它学习预测文本中的词;强化学习则让模型对同一段音频生成多个候选转写并打分,使其未来更倾向输出得分更高的转写,区别在于反馈方式——监督微调每步都给"正确答案",强化学习是对模型自己生成的完整转写打分。具体算法是 GRPO(分组相对策略优化,最早出现在 DeepSeekMath 中):将每个候选转写的得分与同组其他候选比较,得到相对优劣的"优势值"指导训练更新。
Canto 是该实验室更广泛研发计划里的第一个模型,官方表示已有后续研究在塑造下一步方向,但未给出下一个模型的时间表,也未说明 Canto 何时或是否已全面替换 Wispr Flow 现有的听写模型。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断