返回 文章 学习 CMS 文章

Mistral AI 发布 Voxtral TTS:40 亿参数多语言文本转语音模型

Mistral AI 用 40 亿参数的 Voxtral TTS 把多语言、低延迟、可定制的声音生成带进企业语音工作流。

Mistral AIVoxtral TTS文本转语音多语言语音生成
成长分 / 100 79 综合收获、行动、留存与影响

Mistral AI 发布 Voxtral TTS:40 亿参数多语言文本转语音模型
为什么值得读了解 Mistral AI 首个文本转语音模型的技术架构与性能定位,把握语音 AI 领域的最新进展。

获取 Voxtral TTS 在延迟、多语言支持、声音适配等关键维度的具体指标与对比数据。

关键洞察
  1. Voxtral TTS 仅有 40 亿参数,却能在 9 种语言(英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语、阿拉伯语)上提供最先进的语音生成性能。
  2. 模型基于 Ministral 3B 构建,采用 transformer 自回归流匹配架构,包含 3.4B 参数解码器主干、390M 流匹配声学 transformer 和 300M 神经音频编解码器。
  3. 在典型 10 秒输入语音和 500 字符场景下,模型延迟为 70 毫秒,实时因子约 9.7 倍,原生生成长达两分钟的音频。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:8588

思考

摘要

Mistral AI 推出了 Voxtral TTS,这是一个拥有 40 亿参数的文本转语音模型,能够以 9 种语言提供最先进的多语言语音生成,语音逼真且富有情感表现力,延迟低,并易于进行声音适配。该模型在上下文理解、说话人建模和零样本跨语言声音适配方面表现出色,非常适合企业语音工作流和可扩展的 AI 智能体。它可通过 API 和 Mistral Studio 使用,提供高性价比、高质量的语音生成,起价为每 1000 字符 0.016 美元。

今天我们发布 Voxtral TTS,这是我们首个文本转语音模型,在多语言语音生成方面达到了最先进的性能。该模型轻量,仅有 40 亿参数,使由 Voxtral 驱动的智能体能够大规模地自然、可靠且经济高效地运行。

亮点。

以 9 种常用语言提供逼真、富有情感表现力的语音,并支持多种方言。

首音频延迟极低。

易于适配新声音。

可在以下平台测试

Mistral Studio。企业级文本转语音,为关键语音智能体工作流提供支持。

自然的语音生成取决于模型不仅能够朗读文本,还能够准确诠释文本。上下文理解——例如中性、开心、讽刺等——决定了听众认为生成结果是准确还是机械。我们的模型在上下文理解和说话人建模方面都表现出色:捕捉特定人物自然说话的方式。我们的声音适配超越了传统的朗读语音,能够捕捉说话者的个性,包括其自然的停顿、节奏、语调和情感灵活性。凭借其紧凑的规模、低成本与低延迟以及易于适配性,Voxtral TTS 为希望拥有自身语音 AI 技术栈的企业提供了完全的控制和定制能力。

音频是新的用户体验。创造只有语音才能实现的协作与理解新交互。现在就在 AI Studio 中使用我们的 Mistral Voices,体验美式、英式和法式口音。

听一听再判断:你能分辨出区别吗?

我们的团队使用数十种语言和多种方言,我们理解文化细微差别的重要性,并构建了一个能够反映我们自身的模型。语音生成通过类自然的节奏、情感,甚至幽默的使用来建立信任。这就是为什么在声音模拟中,我们专注于真实性和情感表现力。

声音模拟

原始声音

Margaret

Margaret

模型行为架构师

英语(美国)

提示

天哪!我对夏天太兴奋了。这里会非常暖和,等不及去丽都游泳和做樱桃派了。

最先进的性能。

用于多语言文本转语音系统的词错误率和音频质量分数等自动化指标无法衡量语音的自然度。语音之所以自然,极其细微,需要对文化差异和典型说话模式有深入理解。因此,由母语者进行的比较性人工评估至关重要。

对于语音代理而言,延迟与质量始终处于紧张关系之中。人工评估显示,与 ElevenLabs Flash v2.5 相比,Voxtral TTS 在保持相近的首音频时间(TTFA)的同时,实现了更出色的自然度。Voxtral 的质量也与 ElevenLabs v3 持平,成功支持情感引导,从而实现更逼真的交互。

我们在零样本自定义语音场景下,对 Voxtral TTS 和 ElevenLabs v2.5 Flash 进行了对比性人工评估。针对 9 种受支持语言中的每一种,使用两个可识别的母语口音语音,由 3 名标注员对每一对语音在自然度、口音贴合度和与原始参考的声学相似度方面进行并排偏好测试。在这种零样本多语言自定义语音设置中,Voxtral TTS 拉大了与 v2.5 Flash 的质量差距,凸显了 Voxtral TTS 对任意语音的即时可定制性。

原生语音。

Voxtral TTS 基于大型语音数据集训练,专为全球应用而构建。它在 9 种语言中支持最先进的性能:英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语。

该模型经过训练,可使用短至 3 秒的参考来适应自定义语音,并且不仅捕捉声音,还捕捉细微口音、语调变化、音调,甚至类似参考中表达的言语不流畅等细微差别。我们在 API 中提供了一些预设语音选项,但可以轻松扩展到您的内部语音库,根据用例进行定制,将其本地化为特定语言和口音,保持中性或更具情感,随意或正式,更自然对话或更机械。

该模型还展示了零样本跨语言语音适应能力,尽管它并未为此明确训练。例如,该模型可以使用法语语音提示和英语文本生成英语语音。生成的语音听起来自然,同时采用所提供语音提示的口音(在此示例中,生成的语音具有自然的法语口音英语)。这使得该模型可用于构建级联语音到语音翻译系统。

级联语音到语音翻译

点击说话人以运行级联语音到语音翻译。

提示

在我们开始之前,我需要核实一些细节。您能确认您的全名和出生日期吗?

生成的音频

为低延迟流式传输而构建。

延迟对于语音代理应用至关重要。对于典型的 10 秒输入语音样本和 500 个字符,Voxtral TTS 实现了 70 毫秒的模型延迟,实时因子(RTF)约为 9.7 倍。该模型原生生成长达两分钟的音频,我们的 API 通过智能交错处理任意长度的生成。

Voxtral TTS 架构。

该模型是一个基于 transformer 的自回归流匹配模型,构建在 Ministral 3B 之上。它由以下组件组成:

3.4B 参数的 transformer 解码器主干

390M 流匹配声学 transformer

300M 神经音频编解码器(对称编码器-解码器)

该模型接收语音提示(5 到 25 秒)和 9 种受支持语言的文本提示。对于每个音频帧,transformer 主干预测一个语义 token,然后流匹配 transformer 运行 16 次函数评估(NFE)以生成声学潜在表示。

我们开发了一款自研编解码器,它以因果方式处理音频,使用语义 VQ(8192 词汇量)和声学 FSQ(36 维、21 级)潜在表示,并以 12.5Hz 的帧率生成它们。

赋能企业语音工作流。

Voxtral TTS 补全了音频智能的闭环,为企业语音流水线提供了一个能通过人类测试的输出层。它可与 Voxtral Transcribe 配合实现完整的语音到语音,或集成到任何现有的语音转文本和 LLM 技术栈中,并支持跨语言。

工作流

客户支持

语音代理可跨渠道路由并解决查询,使用自然、符合品牌调性的语音。将 Voxtral TTS 置入现有的联系支持呼叫系统,以实现自动语音响应,其输出可集成到现有工作流中。

在 Mistral Studio 中试运行该模型。

直接在 Mistral Studio 演练场中试用 Voxtral TTS。选择其中一个 Mistral 语音或录制你自己的语音。

开始使用 Voxtral TTS。

Voxtral TTS 现已通过 API 提供,价格为每 1k 字符 $0.016。

立即在 Mistral StudioLe Chat 中试用。

一个包含多个参考语音的模型已在 Hugging Face 上以 CC BY NC 4.0 许可证开放权重提供。

探索该模型的文档或阅读我们的研究论文

报名参加我们即将举办的网络研讨会以了解更多!

我们正在招聘!

我们正在构建 AI 的语音层,如果这正是你想研究的问题,我们期待你的来信