前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.18 · 00:00/5 MIN/作者:苏晚/0 阅读

Wispr Flow发布语音模型Canto,主打真实嘈杂场景听写

Wispr Advanced Interfaces Lab 发布语音识别模型 Canto,在包含 2300 多名真实用户、10 小时听写录音的评测集上,词错误率低于 Google、OpenAI、AssemblyAI、Deepgram 等对比模型,训练采用监督微调加 GRPO 强化学习两阶段方法。

Wispr Advanced Interfaces Lab 推出新一代语音识别模型 Canto,是该实验室"更广泛研发计划"中的第一个模型,专门针对实时听写场景打造。多数语音识别模型在干净录音上表现优异,但 Wispr Flow 的用户实际是在笔记本麦克风、耳机、通勤路上、嘈杂办公室里口述消息、邮件和代码,背景常混有他人说话声、音乐或交通噪音——这类真实条件下的识别效果,一直是行业没有被充分验证的部分。

真实听写数据评测,不只看公开基准

团队构建了一个由 2300 多名用户贡献、共 10 小时英语 Wispr Flow 听写录音组成的评测集,样本随机抽样自不同应用场景,并严格将训练集和测试集的说话人分开,避免模型对特定口音过拟合。

在这个评测集上,Canto 的词错误率(WER,衡量替换、遗漏、插入错误,越低越好)低于对比的各家模型:官方图表显示,Canto 的 WER 为 3.4%,优于 Google Gemini 3.1 Pro(3.6%)、OpenAI GPT Transcribe(4.0%)、AssemblyAI Universal-3.5 Pro(4.2%)、Google Gemini 3.5 Transcribe(4.5%)和 Deepgram Nova-3(7.4%)。

Canto与其他语音模型在真实听写场景下的词错误率对比
图:真实听写评测集上,Canto 的 WER 为 3.4%,低于 Google、OpenAI、AssemblyAI、Deepgram 的对比模型,来源:wisprflow.ai

团队还单独构建了 3 小时"挑战集",专挑近处人声、音乐、交通、风声、低音量、耳语或远场说话、上下文极少的简短口述等最容易让听写失败的条件。Canto 在此集上 WER 为 9.1%,仅次于 Gemini 3.1 Pro(8.2%)——但后者是不适合实时低延迟场景的多模态前沿模型,在所有面向实时转写的模型里 Canto 的 WER 最低。

在 LibriSpeech、FLEURS、Common Voice 三个公开英语数据集上,Canto 在 LibriSpeech 上并列最低 WER,另两个数据集上具备竞争力但未领先。团队解释,公开数据集多是"朗读式"语音,和用户即兴口述、语境稀少的真实听写分布不同,这是同时使用两类评测的原因。

训练分两步:监督微调之后做强化学习

Canto 从一个在数百万小时语音和文本上预训练的模型出发,再分两阶段训练:监督微调给模型音频和参考文本,让它学习预测文本中的词;强化学习则让模型对同一段音频生成多个候选转写并打分,使其未来更倾向输出得分更高的转写,区别在于反馈方式——监督微调每步都给"正确答案",强化学习是对模型自己生成的完整转写打分。具体算法是 GRPO(分组相对策略优化,最早出现在 DeepSeekMath 中):将每个候选转写的得分与同组其他候选比较,得到相对优劣的"优势值"指导训练更新。

Canto 是该实验室更广泛研发计划里的第一个模型,官方表示已有后续研究在塑造下一步方向,但未给出下一个模型的时间表,也未说明 Canto 何时或是否已全面替换 Wispr Flow 现有的听写模型。

标签:Wispr FlowCanto语音识别GRPOWispr Advanced Interfaces Lab
苏晚
苏晚Su Wan

前途科技 · 前沿主笔

关注 AI 与前沿科技的观察者,前途科技前沿内容主笔。

查看全部文章

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

LoRA 让异步 RL 跨机只传几 MB:一个桶加一个代理,再靠三处设置提速 3.9 倍
置顶

LoRA 让异步 RL 跨机只传几 MB:一个桶加一个代理,再靠三处设置提速 3.9 倍

//

24小时热榜

OpenAI发布Astra for Law:面向法律行业的GPT-6模型
TOP1

OpenAI发布Astra for Law:面向法律行业的GPT-6模型

英王查尔斯召集AI巨头闭门会谈
前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
TOP2

英王查尔斯召集AI巨头闭门会谈

3

模式的终局:算法如何驯化了我们的创作

2小时前
模式的终局:算法如何驯化了我们的创作
4

Uber用"错误归属"机制遏制重试风暴,单次事件挡下950万请求

10小时前
Uber用"错误归属"机制遏制重试风暴,单次事件挡下950万请求
5

华为将发布昇腾960芯片,对标英伟达加速算力破局

22小时前
华为将发布昇腾960芯片,对标英伟达加速算力破局
6

Gemini对决GPT-6:差价超90%,开发者该选谁?

2小时前
Gemini对决GPT-6:差价超90%,开发者该选谁?
7

Anthropic发布生命科学计划 解锁生物研发AI限制

2小时前
Anthropic发布生命科学计划 解锁生物研发AI限制
8

AI末日究竟会是什么样:从一封辞职信到三类现实场景

10小时前
AI末日究竟会是什么样:从一封辞职信到三类现实场景
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断