返回 文章 apply CMS 文章

语音模型在街道名称上失败率高达39%,合成数据可提升60%

语音模型在基准测试中表现优异,但在街道名称等高风险场景中失败率高达39%,合成数据生成技术可显著提升性能。

语音识别命名实体合成数据跨语言风格迁移
成长分 / 100 82 综合收获、行动、留存与影响

语音模型在街道名称上失败率高达39%,合成数据可提升60%
为什么值得读揭示语音模型在现实世界关键任务中的可靠性差距,如导航和紧急调度。

提供一种低成本、可扩展的合成数据解决方案,无需大量人工标注。

关键洞察
  1. 15个最先进语音模型在街道名称上的平均转录错误率为39%,而通用词错误率仅14%。
  2. 非英语母语者的准确率比英语母语者低18%(46% vs 64%),导致路线目的地平均偏差2.40英里。
  3. 跨语言风格迁移技术利用多语言TTS模型生成多样化发音,仅需不到1000个合成样本。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:7248

摘要

我们证明,当说话者具有不同的语言背景时,语音识别系统难以理解街道名称的发音——在15个最先进的模型中,平均转录错误率为39%,非英语母语者与英语母语者之间的准确率差距为18%。我们展示了一种名为“跨语言风格迁移”的合成数据生成技术,相对于基础模型,可以将这些错误减少高达60%,且使用的训练样本少于1000个。

自动语音识别系统,如Whisper、Deepgram、Phi-4,是我们当前数字基础设施的重要组成部分。这些模型已在Librispeech和Switchboard等语音基准测试中进行了标准测试,并在词错误率等指标上达到了接近人类的水平。然而,这些仅关注单词准确率的总体指标往往掩盖了关键错误。最大的差距之一是,在现实世界中无法可靠地转录简短、高风险的语音。当用户向导航系统或紧急调度员口述指令时,命名实体中的一个错误最终可能给个人和调度实体造成宝贵时间的损失。

我们最新的研究调查了基准性能与现实世界可靠性之间的差距。我们引入了SF Streets和US Streets两个新基准,旨在对部署系统中的命名实体识别进行压力测试。我们的评估显示,即使来自OpenAI、Deepgram、Google和Microsoft的最强大模型也难以完成此任务。为了解决这个问题,我们开发了一种合成数据生成方法,利用跨语言风格迁移,在少于1000个训练样本的情况下,将性能提升高达60%(相对于基础模型)。

STT基准测试中的地址识别

标准语音基准通常以长篇朗读语音为主,其中语义上下文有助于解决歧义。当多语言城市的居民发音街道名称时,这代表了不同的挑战。它们缺乏上下文、声学多样性大,且对语音错误不容忍:发音上的微小差异可能导致地图上的巨大差异。

为了量化这一难度,我们收集了SF Streets数据集。该数据集包含来自美国的78名语言背景多样的参与者发出的2262条语音,发音旧金山的街道名称。我们重点关注该城市的林荫大道,如“Cesar Chavez”或“Alemany”,因为它们作为主要干道,在导航查询中经常被引用。

我们在此数据集上评估了15个最先进的模型,尽管这些模型在通用语音上实现了较低的WER,但它们在街道名称上的平均转录错误率为39%。这种脱节挑战了模型规模自动解决鲁棒性的假设。例如,Whisper-Large实现了14%的可观通用词错误率,但其在街道名称上的特定错误率上升至27%。

在旧金山这样的城市,出租车服务为老年人和残障人群提供了基本且受补贴的交通方式。这些偏差导致了实际的经济损失。使用标准出租车费率表和交通数据,我们估计纠正这些错误所需的额外驾驶时间每次事件约花费4.00美元。如果按全市年度出租车总量汇总,仅转录错误每年就可能造成约43,500小时的可避免延误。这相当于每年浪费约210万美元的时间和车费。

人口统计与差异性影响

这些系统的可靠性在不同群体间差异显著。随着现代语音模型在多样化城市环境中部署,它们会遇到不同口音和语言背景的说话者。我们对SF Streets数据的分析揭示了显著的性能差异。在我们的15个模型及变体中,非英语母语者的准确率比英语母语者低18%(46%对64%)。

这种技术故障直接转化为更实际的操作摩擦:为了衡量现实世界的影响,我们使用Google Maps API将转录的街道名称映射到地理坐标;我们发现,非英语母语者的错误转录导致路线目的地平均偏离目标位置2.40英里。而仅英语母语者的错误则导致较小的偏差,为1.26英里。

通过数据克隆提高代表性

为每个可能的命名实体收集代表性人类语音数据成本高昂且不可扩展。因此,我们研究了合成数据是否能帮助我们弥合这一差距。

我们利用了多语言文本转语音模型的固有偏差。我们采用了一种称为跨语言风格迁移的技术。我们提示开源XTTS模型用外语(如西班牙语)生成语音,但在提示中注入了特定的英语街道名称。这迫使模型对英语单词应用非英语的语音规则。用“Estoy en Washington”提示模型会产生带有明显西班牙语音实现的单词“Washington”。

这种方法使我们能够生成高度多样化的发音,而无需人类说话者。我们创建了一个包含不到1,000个合成话语的微调数据集。在这个小型合成集上微调Whisper-Base,使基础模型的准确率相对提高了60%,其中非英语母语者的改进最大。这表明,小规模的合成和开源语音克隆可以显著改善命名实体的转录。

未来展望

我们的工作突显了现代语音识别中一个持续存在的弱点。虽然通用模型在不断改进,但在驱动紧急调度和导航等关键系统的短小、信息密集的话语上,它们仍然不成比例地失败。然而,我们也证明这是一个可解决的问题。创造性地使用合成数据和风格迁移,使从业者能够在无需大规模、昂贵的数据收集工作的情况下提高模型的鲁棒性。

为了促进进一步的研究,我们将发布 SF Streets 数据集 和更大的 US Streets 基准。US Streets 数据集包含来自美国 12 个主要城市的 3,600 条录音。我们希望这些资源能帮助社区超越总体指标,关注部署中最关键的可靠性。