Hugging Face 新研究发现,多款开源语音识别模型在 VoxPopuli 和 LibriSpeech 基准上存在明显的“刷榜”行为——复现参考错误、恢复被静音的数字、根据数据集切换拼写风格。这一现象导致公开榜单分数虚高,可能误导模型选型。
Hugging Face 与 Hume AI 联合发布的最新研究揭示,语音识别领域的公开基准分数可能存在明显水分。在多款主流开源 ASR 模型上,研究者发现模型会“记住”基准测试的参考转写,即使音频本身与参考文本矛盾,模型仍倾向于输出“标准答案”。
为量化这种被称为“基准优化”(benchmark optimization)的现象,研究团队设计了三种探针测试,评估 11 款开源语音识别模型,覆盖 VoxPopuli 和 LibriSpeech 两个常用数据集。
此前,研究团队已在 Real World VoiceEQ 和 Open-ASR Leaderboard 中引入留出集来覆盖更多真实场景,但仅靠扩大评测范围并不能解决根本问题。
VoxPopuli 数据集中存在大量转写错误。研究者用多模型集成识别出参考文本与音频明显不一致的片段。例如,一段议会录音中清晰包含“Thank you, Mr. President”,但参考文本漏掉了“Thank you”。11 款模型中有 6 款在真实音频上复现了这个错误;但当换成同一说话人的语音克隆或训练截止日期后新录制的议会音频时,多数模型会恢复忠实转写。
下图展示模型在 VoxPopuli 上的词错误率(WER)与复现错误参考文本比例之间的关系。词错误率最低、即榜单表现最好的模型,反而最容易复现参考错误。

研究者将测试音频中的数字静音,观察模型是否会“脑补”出参考文本里的数字。结果显示,在公开基准上,部分强模型的数字恢复率高达 30%-40%——即使音频中的数字已被彻底移除。模型甚至能恢复一个相对随机的年份“2011”。而在新采集的音频上,这一效应显著减弱。

第三个探针测试考察模型是否根据基准数据集的拼写习惯调整输出。例如 VoxPopuli 使用 “Mr.”,LibriSpeech 则拼出 “Mister”;LibriSpeech 内部也存在 “any one” 与 “anyone” 的新旧空格约定。理想情况下,模型应始终倾向一种写法或随机切换。但实测显示,多款模型的切换准确率超过 50% 的随机基线,部分接近 90%。这说明模型能识别音频来自哪个基准,并主动采用对应的拼写规范。


当研究者将音频换成训练截止后新录制的议会或 LibriVox 声音时,大部分模型不再匹配参考文本。截断基准相关的上下文,或拼接普通对话音频,也能让模型回归忠实转写;而拼接 VoxPopuli 音频则产生相反效果。这说明模型并非没有能力忠实转写,而是在利用声学线索判断“该用基准策略还是音频事实”。

研究建议,模型选型时应使用完全隔离(held-out)的评估集,并参考除词错误率之外的指标。Open ASR 排行榜 已新增 “Benchmark fitting” 标签页,并开放了 检测脚本 和未归一化的模型输出。基准开发者则应避免简单的随机划分,改用按时间、说话人等元数据切分,并提高训练数据透明度。
公开基准仍有价值,但只有当我们能区分真正的能力提升与只对特定测试有效的“刷榜”行为,排行榜才真正可信。
参考:完整报告
原文链接:Hugging Face
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断