Hugging Face 联合 Voice Arena 为 Open ASR 排行榜新增印地语和印度英语评测集,首次纳入全球南方语言。数据集覆盖数千名不同地区、设备与口音的说话人,并用 OIWER 评分处理拼写变体,让基准不再被单一 WER 掩盖偏差。
基准测试决定了什么会被构建。在 Open ASR 排行榜 上得分高的模型会被采用和迭代,而榜单未衡量的能力往往得不到改进。过去一段时间,围绕榜单的工作主要集中在三件事上:使用留出私有集防止模型在公开集上过拟合,通过基准拟合分析量化模型是在复述参考转写还是真正听懂了音频,以及弥合归一化器的差距。这些努力让 WER 这一个数字更难被刷高,但它仍然只是一个数字。大量研究表明,ASR 错误率在不同人群中并不均匀:美国国家科学院院刊的一项研究发现商用系统对黑人说话者的错误率约为白人的两倍,另一项研究进一步揭示了性别、年龄和口音带来的差异。这些在榜单上都看不到,不是榜单刻意隐藏,而是测试集只记录了说话内容,几乎没有说话人信息。
为弥补这一缺口,Hugging Face 与 Voice Arena 合作,为排行榜新增两个评估集:Monsoon en-IN 和 Monsoon hi-IN。印地语的使用者超过五亿,是榜单多语言选项卡中出现的第一个印度语言——此前该选项卡只覆盖欧洲语言。每个语言都提供公开分割(可自助评分)和私有分割(用于限制针对榜单的优化),四个分割的说话人互不重叠,共 4,888 位说话人,每人记录 12 项属性。
一个测试集能暴露哪些问题,取决于它在哪些维度上做了变化。大多数基准由现成音频拼凑而成,Monsoon 则刻意沿九个维度变化:地理、年龄、性别、词汇、设备、声学环境、语音类型、语速,以及同一音频存在的多个有效转写。每一个维度都可能导致整体 WER 平均正确、却对特定人群失准。

采集设计正是从这些维度出发:跨数百个地区招募,而不是在少数地方录制长时间会话;说话人使用自己的手机和网络,室内外都有;提示词覆盖日常话题,引导观点、叙述和回忆,以激发出命名实体、数字和未排练的表达;年龄和性别经专人核实并记录。四个分割由同一套流程采集,印度英语公开集 5.62 小时、1,444 位说话人,私有集 5.58 小时、1,405 位;印地语公开集 1.33 小时、468 位,私有集 4.47 小时、1,571 位。音频来自无脚本的双人自发对话,从单一声道切分出片段,每段只含一位说话人。除基础字段外,每段还记录职业、教育背景、婚姻状况、收入区间、手机品牌、当前城市和在此城市生活的年数。

Monsoon 按小时算很小,按说话人算却很大。最大十位贡献者的时长占比只有 2.8% 到 6.8%,超过一半的说话人只贡献了一段音频。印度英语公开集覆盖 428 个本土地区,印地语集也横跨 200 多个地区;录音来自 315 到 582 种设备型号,没有任何型号占比超过 2.1%。印度英语不是单一口音:六大地带均有代表,南部贡献 35%,东部 18%,中部 18%,北部 16%,西部 11%。这些差异全部记录在元数据中。
大多数公共 ASR 测试集只有标识符、转写和时长,Monsoon 则为每段音频提供 18 列数据,其中 12 列是说话人元数据。由于印度邦界按语言划分,地区和邦承载着真实的口音信号。此前对印度 ASR 的大规模分析显示,地区级错误率跨度从约 4% 到 44%,代表性不足地区远落后于印地语带和大都市。Monsoon 让同类分析在公开榜单测试集上成为可能。
一个例子足以说明问题。在公开印度英语集上,八个模型的整体 WER 都在 4.81 到 4.99 之间,差距仅 0.18,可以说是同一个模型。但把说话人按地区分组后,openai/whisper-large-v3-turbo 跨五个大区的误差变化为 0.46,而 mistralai/Voxtral-Mini-3B-2507 整体上只落后它 0.14,区域差异却达到 1.68——中部 4.38,东部 6.06。两个在榜单上几乎无法区分的系统,准确率对说话人地区的依赖程度相差近四倍。哪个区域最难也不固定:ibm-granite/granite-speech-3.3-2b 在北部最差,microsoft/VibeVoice-ASR-HF 在南部最差,Voxtral 在东部最差。这说明差异来自模型,而非音频。

英语的拼写差异是有界的,归一化器基本能处理;印地语则不同。日常口语高度混码,来自英语的词没有统一的天城文拼写,复合词连写还是分写全凭偏好,一个短语可以有十几种有效写法,而且没有固定的规范侧可供映射。如果用单个参考字符串评分,WER 会奖励那些恰好猜中标注者拼写的系统。因此,印地语集附带 lattice:转写的每个跨度列出所有被接受为正确的写法。构建过程由母语语言学家人工完成:候选变体来自多个 ASR 系统对同一音频的转写,再用语言模型扩展,最后人工判定哪些与所说内容一致。
免费获取企业 AI 成熟度诊断报告,发现转型机会

印地语采用 AI4Bharat 提出的 OIWER(感知拼写的词错误率) 而非原始 WER:每一段假设与接受的写法集合对齐,任何被认可的写法都算对,只有真正的识别错误才被扣分。为了量化影响,同一批假设分别对「扁平参考」和 lattice 评分,结果所有系统的错误率都上升且幅度不均,排名随之改变——单个参考会在一定程度上奖励复现标注者拼写的系统,而 lattice 只衡量识别本身。相关实现已开源为 voi-oiwer,所有结果都可以直接复现。


对于私有分割,模型需先加入 Open ASR 排行榜,由 Hugging Face 团队运行评估。流程在 Open ASR 排行榜 GitHub 仓库 进行:提交 PR 时填写模型清单,报告公开集结果;团队验证公开集结果后在私有集上计算指标;最后确认结果。印度英语以 Voice Arena Monsoon 名义进入主排行榜的默认列,直接计入每个模型的平均 WER;私有分割与 Appen 和 DataoceanAI 数据 一起汇入私有(对话)列。印地语的公开和私有分割出现在多语言选项卡中,只有支持所有选定语言的模型才会被排名,也可以从 Language dataset breakdown 下拉菜单中选择 Hindi。
印地语是一个普遍问题的典型案例:任何拥有多种书写方式、说话人未被充分采样的语言,都可能存在同样的缺陷。Monsoon 没有修复它们,而是提供了一种看见它们的方式——一个榜单上的测试集,携带足够的说话人和参考信息,让两个系统之间的差异可以追溯到谁在说话、如何书写,而不是消失在一个数字里。这四个分割属于 Voice Arena 面向全球南方的更大 Monsoon 数据集计划。
原文链接:Hugging Face
本文由前途科技编辑整理
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断