返回 文章 学习 CMS 文章

Open TTS 排行榜:面向多语言文本转语音与语音克隆的可扩展评估

用客观指标而非投票,快速、可复现地评估多语言 TTS 与语音克隆模型。

TTS语音克隆多语言评估排行榜
成长分 / 100 72 综合收获、行动、留存与影响

Open TTS 排行榜:面向多语言文本转语音与语音克隆的可扩展评估
为什么值得读了解传统 TTS 竞技场排行榜在可扩展性、开放模型代表性和投票一致性上的局限。

掌握 Open TTS Leaderboard 如何用 WER/CER、说话人相似度和 TTFA 等客观指标进行多语言与语音克隆评估。

关键洞察
  1. 传统竞技场依赖人类偏好投票和 Elo 分数,但无法跟上 TTS 模型发布速度,且开放权重模型在排行榜上代表性不足。
  2. Open TTS Leaderboard 使用客观指标:基于 ASR 的 WER 作为可理解性代理,说话人相似度估计语音身份保留,评估时间从数周缩短到数小时。
  3. 默认视图按 Seed TTS Eval 和 CV3 Eval 英语分割的宏平均 WER 排名,并支持切换多语言;中文、日文、韩文报告字符错误率(CER)。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:9619

文本转语音 • 已更新 • 198k • 651

然而,评估并未跟上步伐:它仍然碎片化且缺乏标准化。 黄金标准是人类偏好分数,如 MOS 或 MUSHRA(更多关于指标)。为此,几个基于竞技场的排行榜已成为社区有用的参考点:

这些竞技场通过向用户展示两个模型的 TTS 输出,并要求他们选择其中一个来比较模型。在收集到足够数量的投票后,计算 Elo 分数来对模型进行排名,通常使用 Bradley–Terry 模型(参见 Voice Arena 方法论)。

虽然人类偏好是最终决定因素,但竞技场无法扩展以跟上 TTS 发布的步伐。这可能部分解释了为什么开源模型在竞技场式排行榜上代表性不足:截至 2026 年 9 月 30 日,Artificial Analysis 上的 92 个模型中只有 16 个是开放权重的,Voice Arena 上也有类似的偏差。这可能反映了实际因素:添加 API 模型只需要一个 API 密钥,而开放模型必须由竞技场运营商托管和提供服务,并且商业提供商比开源作者更有理由寻求排名。竞技场式评估的另一个限制是投票者一致性:没有竞技场能确保相同的投票者以相同的“更好”标准随时间一致地评估模型。甚至一个人的偏好也会随时间变化(正如赫拉克利特名言:“人不能两次踏进同一条河流”)。

为此,我们构建了 Open TTS Leaderboard,它使用客观指标来评估模型在性能互补方面的表现:

通过依赖客观指标,评估模型从几周(收集投票)缩短到几个小时 ⚡

重要的是,Open TTS Leaderboard 并不取代人类偏好排名。基于 ASR 的 WER 提供了可理解性的代理,而说话人相似度估计了语音身份保留。两者都没有直接测量自然度、表现力或听众偏好。尽管如此,它们甚至可以为基于投票的排行榜提供哪些模型应纳入其评估的信息。

我们对该排行榜的意图是让它由社区塑造;我们希望听到您的反馈,以便评估保持相关性和洞察力。接下来的几个部分概述了 Open TTS Leaderboard 的主要功能。

从排行榜的默认视图来看,模型根据 Seed TTS Eval(论文)和 CV3 Eval(零样本)(论文)的英语分割上的宏平均 WER 进行排名。

hexgrad/Kokoro-82M、Supertone/supertonic-3 和 fishaudio/s2-pro 在这两个划分上平均后,在英语 WER 上领先,而帕累托图则直观展示了哪些模型在 WER、批量推理(RTFx)和规模之间取得了良好平衡。

英语表现不一定能迁移到其他语言。可以切换多种语言来对模型的多语言表现进行排名。Seed TTS Eval 只有英语和中文的音频,因此其他语言只是 CV3 Eval(零样本)上的得分。请注意,中文、日文和韩文是基于字符的语言,因此报告的是字符错误率(CER),而跨语言的“平均 WER”是跨语言的宏平均。

k2-fsa/OmniVoice、fishaudio/s2-pro 和 FunAudioLLM/Fun-CosyVoice3-0.5B-2512 是强大的多语言模型。

通过切换“声音克隆”,可以比较支持此功能(在所选语言上)的模型。

此外,表格中现在会出现一个用于说话人相似度的 SIM 列,以及另外两个帕累托图,用于可视化 SIM、批量推理和规模之间的权衡。

一些模型的平均 WER,例如 bosonai/higgs-tts-3-4b 和 openbmb/VoxCPM2,在声音克隆下有所改善,即当提供参考音频时。

数字只能说明部分情况,正如前面提到的,人类偏好是最终决定因素。在“Listen”标签页中,你可以比较指标背后的生成输出,以找到你更喜欢的模型!

选择你感兴趣的语言/数据集,是否要比较声音克隆,并可选地选择模型或从随机选择中收听输出。

“Listen”标签页填补了现有 TTS 排行榜的一个重要空白:一个探索各种模型输出的空间。

你甚至可以对生成的输出提供反馈。随着我们从社区收集更多投票,我们可能会将这些数据纳入排行榜。所以请投票!但请使用你的 HF 账户登录,以帮助我们清除垃圾信息/机器人。

“Streaming”标签页比较流式能力。模型按 TTFA(首次音频时间)排名,它量化了用户在探测模型后等待可播放音频的时间。这对于语音代理和其他交互式应用很重要。

对于流式模型(“Streaming API”下的 ✅),这是第一个音频块到达的时间。对于非流式模型,这是整个话语生成完成的时间,因为播放无法更早开始。每个模型一次运行一个音频(批量大小为 1),在相同的硬件上,使用其默认声音,对来自 CV3-Eval 的相同 50 个英语提示进行测试。我们丢弃前 3 次运行作为预热,并报告其余运行的中位 TTFA。

默认视图比较在 H200 GPU 上的性能。对于一小部分(但不断增长的)模型,也提供了 CPU 上的结果!

kyutai/pocket-tts 是一个在 GPU 和 CPU 上都非常适合流式传输的模型!

Open TTS 排行榜的目标不仅是跟上 TTS 模型发布的惊人速度,更是要由社区共同塑造;我们希望听到你的反馈,让评估保持相关性和洞察力。请告诉我们你希望看到哪些数据集、模型和指标!

目前,我们重点关注:

我们很快将开源评估脚本,就像 Open ASR 排行榜的仓库一样,这样你就可以直接通过 GitHub Issues 和 PR 提供反馈和建议!让我们一起塑造 TTS 评估 🤗

非常有趣

很高兴这个榜单将多语言 TTS 质量与语音克隆身份区分开来,而不是用一个综合的绿色指标来概括。

我会持续关注的检查点是:当你固定语言/领域时,排名是否仍然成立,与以克隆为轴心时相比如何。否则,团队会优化更容易的子量表,却仍然称结果为“SOTA TTS”。

英语性能不一定能转化为其他语言的表现。可以切换多种语言来对模型的多语言性能进行排名。Seed TTS Eval 只有

[movie box]英语和中文的音频,因此其他语言只是 CV3 Eval(零样本)上的得分。请注意,中文、日文和韩文是基于字符的语言,因此报告的是字符错误率(CER),而跨语言的“平均 WER”是跨语言的宏平均。

Open TTS 排行榜是一个开放的评估平台,旨在让多语言文本转语音和语音克隆模型更容易进行大规模比较。传统的 TTS 竞技场通常让用户收听两个模型的输出并选择他们更喜欢的一个。这些投票随后可用于计算 Elo 风格的分数,通常通过 Bradley–Terry 模型等方法,为用户提供一种简单的方式来理解不同系统基于人类偏好的表现。

人类反馈仍然是评估语音质量的重要组成部分,但随着新的 TTS 模型快速发布,仅依赖竞技场式投票可能会变得困难。开源模型也可能面临实际障碍,因为它们通常需要由评估平台托管和服务,而基于 API 的商业模型可以更容易地添加。这可能导致开放权重系统在公共排行榜上可见度较低。另一个挑战是一致性:人们的偏好和聆听标准会随时间变化,这意味着相隔数月收集的投票可能并不总是代表完全相同的标准。

Open TTS 排行榜旨在通过提供一个可扩展且透明的空间来评估多语言 TTS 和语音克隆系统,从而应对这些挑战。目标是使比较更容易复现,扩大开放模型的覆盖范围,并在人类偏好之外提供有用的评估信号。通过将可扩展的测试与社区反馈相结合,该项目可以帮助研究人员、开发者和用户更好地理解语音模型在不同语言、声音和用例中的表现。