返回 文章 学习 CMS 文章

Open ASR 排行榜首次纳入全球南方语言:Monsoon 印地语与印度英语评估集

Open ASR 排行榜新增首个全球南方语言评估集,用元数据和拼写格让 ASR 偏见与正字法差异可见。

ASR语音识别基准测试全球南方
成长分 / 100 83 综合收获、行动、留存与影响

Open ASR 排行榜首次纳入全球南方语言:Monsoon 印地语与印度英语评估集
为什么值得读了解 ASR 基准测试如何从单一 WER 数字转向更细粒度的公平性评估。

认识印地语拼写变体对 WER 评分的挑战,以及 OIWER 和拼写格如何解决这一问题。

关键洞察
  1. 传统 ASR 排行榜的测试集只记录说了什么,几乎不记录谁说的,导致种族、性别、年龄和口音差异不可见。
  2. Monsoon 数据集覆盖 4,888 名说话者,每个片段附带 18 列元数据,包括地理、职业、教育、设备等,支持按人群细分分析。
  3. 印地语拼写变体没有规范形式,单一参考 WER 会奖励系统复现标注者拼写,而非真正识别能力;OIWER 和拼写格只对识别错误计分。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:17336

自动语音识别 • 3B • 已更新 • 72.2k • 55

基准测试决定了什么会被构建。在 Open ASR Leaderboard 上得分高的模型会被采用并迭代,而排行榜未衡量的能力往往不会得到改进。排行榜上最近的许多工作都致力于让评估指标更可信:

所有这些都让一个数字(WER)更难被操纵。但它仍然只是一个数字。一系列研究表明,ASR 错误率在使用者之间的分布并不均匀。自动语音识别中的种族差异 发现,商业系统对黑人说话者的错误率大约是对白人说话者的两倍,而 量化自动语音识别中的偏见 发现了按性别、年龄和口音的进一步差异。这些在排行榜上都不可见,并不是因为排行榜在隐藏它们。它运行的测试集记录了说了什么,却几乎不记录是谁说的。

为了弥补这一差距,我们在 Open ASR Leaderboard 中引入了两个评估集:Monsoon en-INMonsoon hi-IN。印地语,由超过五亿人使用,是目前仅覆盖欧洲语言的多语言标签页上的第一个印度语言。每个数据集都发布了一个公开划分,可用于自行评分,并保留了一个私有划分以限制针对基准的优化。这四个划分在说话者上互不重叠,共包含 4,888 名说话者,并为每位说话者记录了 12 个说话者属性。

测试集只能暴露它在其上有所变化的失败模式。大多数基准测试都是用随手可得的音频构建的。Monsoon 的构建则沿着九个轴变化:地理、年龄、性别、词汇、设备、声学环境、语音类型、语速,以及同一音频存在多个有效转写的情况。每一个轴都是一种聚合 WER 可能在平均上正确、但对特定人群错误的方式。

收集方法由此而来。

四个划分,两种语言,通过同一条流水线收集。

集合 语言 时长 说话者 片段长度(均值 / 中位数) 男/女 地区 邦/联邦属地 设备 风格 转写

数据来源于无脚本的双通道自发对话,片段从单个通道分割而来,因此每个片段只包含一位说话者。除了表中报告的字段外,每个片段还记录了职业、教育、婚姻状况、收入区间、手机品牌、当前城市以及在当前地区居住的年数。

来自公开印度英语划分的五个片段,以及每个片段携带的元数据:

29 岁女性,特里普拉邦西特里普拉。学生,samsung SM-G781B。

32 岁女性,中央邦萨特纳。失业,samsung SM-E146B。

22 岁男性,比哈尔邦罗塔斯。学生,motorola moto g54 5G。

27 岁女性,特伦甘纳邦瓦朗加尔。失业,vivo V2247。

57 岁男性,本地治里。私营工作,Xiaomi M2006C3LI。

英语数据集使用标准字符串引用,排行榜的归一化器会合并大多数拼写变体。印地语的拼写变体要多得多,而且没有归一化器能够解决这个问题,因为这些变体并不是两套约定之间的固定映射。因此,印地语数据集附带一个格:对于转录文本的每一段,都提供一个被接受为正确的拼写列表。

以小时衡量,Monsoon 很小;以说话人衡量,它很大。这正是其设计,也是大部分价值所在。

上述字段之外的说话人集中度与多样性。

---|

由此得出三个特性,每一个都是关于方差而非数量的论断。

没有哪个声音能左右得分: 十个最大的贡献者占总时长的 2.8% 到 6.8%,而且超过一半的说话人只出现一次。Monsoon 上的结果是对数百个不同声音的平均,而不是对少数说话人长时间录音的结果。时长相当的测试集通常以相反的方式构建。

也没有哪个地区或手机能左右它: 印度英语公开集覆盖 30 个邦和联邦属地的 428 个本土地区;印地语数据集作为印地语带语言,分布更为集中,但仍覆盖 202 和 295 个地区。录音来自 315 到 582 种不同的设备型号,在任何子集中,没有任何单一型号超过片段的 2.1%。在标准化硬件上收集的语料库会对某一种麦克风响应过拟合;这个语料库不会。

这里的印度英语不是一种口音: 这是全国范围内所说的英语,而不是某一个地区的英语。所有六个区域都有代表:在公开集中,35% 的片段由南部说话人贡献,18% 来自东部,18% 来自中部,16% 来自北部,11% 来自西部。由此产生的口音差异被记录在元数据中,而不是被断言。

Monsoon 每个片段附带 18 列,其中 12 列是元数据,而大多数公开 ASR 测试集只附带一个标识符、一份转录文本和一个时长。人口统计字段完整或接近完整;贡献者已同意此用途。

分组 字段
片段 idaudioaudio_length_slanguage
参考 lattice(印地语)或 text(印度英语)
说话人 speaker_idgenderdate_of_birth
背景 occupationeducational_backgroundmarital_statusincome
地理 native_districtnative_statecurrent_cityyears_spent_in_current_district
录音 device_manufacturerdevice_model

这两种语言具有不同的地理形态,而这种形态具有信息量。印地语数据集集中在印地语带,其中北方邦约占说话人的 40%,这正是按人口抽样的印地语语料库应有的样子。印度英语数据集则平坦得多:没有任何一个邦超过 13%,三分之一的说话人来自八个最大的邦之外。公开和私有两半在两者上都高度一致。

印度各邦的边界是按语言界线划定的,因此地区和邦本身就承载着真实的口音信号,这也是为什么这些字段被直接发布,而不是被概括掉。这类分析在印度 ASR 上已有大规模报道:地区级错误率大致在 4% 到 44% 之间,代表性不足的地区远远落后于印地语带和大都市,此外还按音频质量、语速、话语时长、性别、年龄和设备进行了细分。那些运行是在一个封闭基准上进行的。Monsoon 使得在公开排行榜测试集上也能进行同一类分析。

广泛的地理覆盖需要在数百个地区招募,而不是从较少的说话人那里获取更长的会话,而这种规模的分布式招募会引入较小规模采集不会面临的失败模式:贡献者钻任务空子、将播放的音频作为实时语音提交,以及不专注的标注。每一种都通过明确的检查加以处理。

招募与录音: 贡献者通过 Voice Arena 社区招募,这是一个全球数字平台,其覆盖范围延伸到语音语料库很少覆盖的农村和半城市地区。随后,配对者通过点对点界面录制两人对话,双声道,围绕指定的日常话题。贡献者使用自己的手机和自己的网络连接。其中许多是低端设备,带宽不稳定,这就是为什么这种情况存在于发布的音频中,而不是被过滤掉。潜在贡献者在获得录音权限之前完成了语言能力筛查,获得了报酬,并提供了涵盖用于训练和分发的知情同意。按说话人设置的时长上限,按语言根据其使用者的人口规模和地理分布进行校准,防止少数多产贡献者主导某种语言或地区;这些集合中超过一半的说话人只贡献一个片段。

引导: 大规模引导自发语音有其自身的困难,因为如果没有结构化指导,贡献者往往会产生简短而稀疏的回应。因此,每段对话都以一个开放式叙事提示作为种子,并逐步揭示后续问题,涵盖旅行、医疗、农业、教育和数字服务等领域,引导交流走向扩展描述,而不为其编写脚本。候选话题用大语言模型生成,然后由母语语言学家审阅和本地化。

质量控制: 每段录音在转写前都通过了一组门控检查。使用在超过30种语言的人工标注数据上训练的语言识别模型,将口语语言与指定语言进行核对。使用专用分类器对照自我报告的标签确认说话者性别,该分类器用作对自我报告的佐证,而非替代。另一个模型区分真正的自发对话与预先录制或回放的音频。信噪比估计移除了清晰度严重受损的录音,同时刻意保留了自然环境背景噪声,以保持真实场景语音的声学真实性。通过这些检查的录音由语音活动检测进行分段,在连续静音两秒处切分,或在十五秒软上限处切分并在下一个检测到的静音处闭合。分段按通道独立应用,因此每个片段都是单说话人、单通道。片段随后通过DNSMOS P.808检查。

转写: 参考转写由人工完成。初稿由在领域内数据上训练的内部ASR模型生成,这些模型均未出现在任何公开排行榜上,因此没有任何在这些数据集上评估的系统为其被评分的参考转写做出贡献。后续每个阶段均由母语语言学家在五级协议下执行,该协议建立在严格的劳动分工之上,每一轮修正之后都有一轮由不同标注员执行的独立验证,因此没有语言学家审核自己的输出。语言学家首先对照声学信号逐段修正初稿;第二位语言学家重新验证并标记残留的分歧。后续级别由新的标注员迭代此循环,逐步解决模糊的语音实现、语码转换边界、命名实体以及拼写变体之间的正字法一致性。数字以文字形式书写,使转写直接对应所说内容。在最终级别仍被标记的片段在准入前被退回重新转写。标注员行为全程自动监控,标记包含目标文字系统之外字符、不自然的字符或词语重复以及异常低或高编辑次数的提交。

以下是一个示例,在公开的印度英语划分上运行,以展示元数据所能实现的评估类型。这不是这些数据集旨在提供的发现;它是对一旦每个片段都带有说话者信息后哪些问题变得可回答的说明。

排行榜上的八个模型在该数据集上的WER介于4.81到4.99之间。从最好到最差相差0.18分,在五小时所能分辨的范围内。在语料库上排名,它们是同一个模型。

按地区对说话人进行分组则呈现出另一番景象。每位说话人的本土区(district)被归入其所在的专区委员会(zonal council),即印度内政部对印度各邦的分组,从而得到五个采样充分的专区。openai/whisper-large-v3-turbo 在各专区之间的差异为 0.46 分。mistralai/Voxtral-Mini-3B-2507 在该语料库上落后前者 0.14 分,其差异为 1.68,中部专区为 4.38,而东部专区为 6.06。两个在排行榜上无法区分的系统,其准确率对说话人来自何处的依赖程度相差近四倍。

哪个专区最难也并非固定不变。ibm-granite/granite-speech-3.3-2b 在北部最差,microsoft/VibeVoice-ASR-HF 在南部最差,mistralai/Voxtral-Mini-3B-2507 在东部最差。如果仅仅是某个地区更难转写,那么每个模型对各专区的排名应该相同。但事实并非如此,这说明问题出在模型而非音频上。

地区是十二个记录属性之一,上述专区是对 428 个区的粗略汇总。同样的细分也适用于年龄、教育、职业和手机型号,并且已发布的文件包含复现这一切所需的所有内容。对于一个只记录说了什么的测试集,这些内容一概不可用。

英语正字法变异是有界的。英式与美式拼写、标点、大小写、数字与单词:一个规范化器可以将其中大部分映射到单一形式,排行榜上的规范化器正是如此。印地语则不是以同样的方式有界的。日常口语中语码混合严重,源自英语的词汇没有固定的天城文拼写,复合形式根据偏好连写或分写。同一个短语可以有十种或更多有效的书写形式,且没有固定的映射能将它们合并,因为不存在可供映射的规范形式。

用单一参考进行评分时,WER 会奖励系统产出标注者恰好选择的拼写。两个对音频识别得同样好的系统,可能仅因正字法差异而相差数分。

因此,印地语数据集附带一个格(lattice):对于转写文本的每一段,给出被接受为正确的书写形式集合。构建它是人工工作。候选变体来自同一音频的多个 ASR 转写,并用语言模型进行扩展,然后由母语语言学家判断哪些对该话语有效并剔除其余,因此只有与所说内容一致的形式才会被接纳。

因此,对于印地语,我们报告 Orthographically-Informed Word Error Rate (OIWER),由 AI4Bharat 提出,而非 WER。假设在每个片段上与可接受集合对齐,因此任何被接纳的形式都计为正确,只有真正的识别错误才会被计入。

为了量化这一效应,我们对相同的假设进行了两次评分。将每个 lattice 按 span 展平为其第一个变体,会得到一种传统基准所提供的单一字符串参考;任何被接受的变体都同样适用,而不同的选择会产生不同的参考。针对展平后的参考进行评分时,所有系统的错误率都会上升,而且上升幅度并不一致。排名也因此发生变化。下图展示了两对系统,它们在两种参考下顺序发生反转:在单一参考下,系统部分因为复现了标注者的正字法而受到奖励,而 lattice 只对识别进行评分。

我们还开源了我们的实现 voi-oiwer,因此这些集合上的每个结果都可以直接复现。

对于私有划分,请将你的模型提交到 Open ASR Leaderboard,Hugging Face 团队将运行评估。和之前一样,向排行榜添加模型的流程在 Open ASR Leaderboard GitHub 上进行:

印度英语作为 Voice Arena Monsoon 加入主排行榜

,位于默认列集中,而不是作为可选开关,因此它会对每个模型的主要平均 WER 产生影响。私有划分与 Appen 和 DataoceanAI 数据一起,为聚合的 Private (conversational)

列提供数据。公开和私有印地语出现在多语言选项卡中,只有当模型支持所有选定的语言时才会被排名,这使得该列成为同类比较。或者,从“语言数据集细分”下拉菜单中选择“印地语”。

印地语是一个普遍问题的鲜明案例。任何以不止一种方式书写、由基准未采样的人群所说的语言,都带有这里描述的两种失败。这些集合并不能修复它们。它们增加的是看到这些失败的方式:一个位于该领域已经在关注的排行榜上的测试集,携带了关于每个说话者和每个参考的足够信息,使得两个系统之间的差异可以追溯到谁在说话以及他们如何书写,而不是消失在一个数字中。

这四个集合是 Monsoon 的一部分,Monsoon 是 Voice Arena 面向全球南方的更广泛数据集计划。

交互式探索语音识别模型基准