返回 文章 apply CMS 文章

Together AI 上线 Rime Arcana V3 系列:原生语码转换 TTS 模型,支持 11 种语言实时切换

Rime Arcana V3 系列 TTS 模型在 Together AI 上线,原生支持多语言语码转换,延迟低至 120ms,适合双语客服、受监管服务等场景。

TTS语码转换多语言Together AI
成长分 / 100 77 综合收获、行动、留存与影响

Together AI 上线 Rime Arcana V3 系列:原生语码转换 TTS 模型,支持 11 种语言实时切换
为什么值得读了解原生语码转换 TTS 如何解决多语言语音助手的韵律不一致和延迟问题。

获取 Rime V3 Turbo 和 V3 的具体性能指标(延迟、语言支持)及部署优势。

关键洞察
  1. Rime Arcana V3 Turbo 在 Together AI 专用端点上首音频延迟约 120ms,支持英语-西班牙语原生语码转换。
  2. Rime Arcana V3 支持 11 种语言之间的自然语码转换,首音频延迟约 160ms。
  3. 模型基于双语语音模式训练,能保持跨语言边界的节奏、重音和韵律一致性。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:6264
  • 即日起,Together AI 提供两款新的 Rime 模型:Rime Arcana V3 Turbo(英语-西班牙语,高性能)和 Rime Arcana V3(11 种语言切换)
  • 原生语码转换,保持跨语言边界的节奏和韵律一致
  • Rime Arcana V3 Turbo:在 Together AI 专用端点上首音频延迟约 120 毫秒
  • 与 LLM 和 STT 工作负载同地部署,统一 API 和可观测性

当通话者在句子中间进行语码转换时,大多数语音助手会失去其听起来像母语者的特质。节奏失调,回复听起来像翻译,信任度下降。团队通过在不同语言特定的 TTS 模型之间路由来修补这一问题,但这种切换增加了延迟,并使同一对话中的语音行为不一致。Rime 的 Arcana V3 系列正是为此而生:以生产速度实现自然的语码转换,而无需将多语言问题变成路由问题。

即日起,AI 原生云 Together AI 将 Rime Arcana V3 Turbo 和 Rime Arcana V3 加入 Together 模型库。V3 Turbo 在专用端点上实现英语-西班牙语语码转换,首音频延迟约 120 毫秒,韵律基于双语语音模式训练。V3 通过单一模型将切换扩展到 11 种语言。两者均与您的 LLM 和 STT 工作负载同地部署,使用您已有的同一 API、认证和可观测性界面。

V3 Turbo:实时双语对话的性能

约 120 毫秒首音频延迟

语音助手需要端到端延迟低于 700 毫秒才能具有对话感,这意味着 TTS 必须为 STT 和 LLM 处理留出余量。V3 Turbo 在 Together AI 专用端点上实现约 120 毫秒的首音频延迟,因此当客户在句子中间从英语切换到西班牙语时,助手的双语回复能及时跟上。将 V3 Turbo 与 LLM 和 STT 同地部署在 Together AI 上,可使整个流水线(从语音识别到推理再到合成)保持在 700 毫秒预算内。

基于原生双语语音训练的英语-西班牙语语码转换

双语通话者会在句子中混合语言。V3 Turbo 针对这些模式进行了训练,包括停顿位置以及边界处重音的变化。客户说:“I need help with my account, es que no puedo acceder.” V3 Turbo 可以用相同的混合语域回复,停顿和强调与双语说话者的实际说话方式相匹配。

高并发部署的高效并发性

V3 Turbo 的性能使得每个 GPU 的并发数更高。对于在双语市场处理数千个并发通话的联络中心,这意味着当客户进行语码转换时,需要更少的 GPU 来维持生产延迟,从而降低总拥有成本,同时保持对话质量。

V3:多语言广度与语码转换

11 种语言约 160 毫秒首音频延迟

V3 在 Together AI 专用端点上达到约 160 毫秒的 p50 首音频延迟,同时支持 11 种语言的语码转换。这使得多语言对话保持响应迅速,即使模型处理任何支持语言对之间的自然转换的复杂性。

11 种语言的自然转换

V3 支持 11 种语言,并可在支持的语言之间进行语码转换。客户以法语开始,切换到英语使用技术术语,再回到法语进行澄清。V3 处理这些转换,同时保持韵律和口音一致性。

多语言市场的单一模型

V3 让团队整合原本需要每种语言单独模型或供应商的资源。

语言。一次部署,即可从单个端点服务多语言客户,无需为每个市场维护独立的基础设施。当对话切换语言时,V3 保持节奏和强调的自然性,使过渡听起来不像是拼接而成。

使用场景

双语都市市场

在双语都市市场中,客服电话经常涉及语码转换。客户以英语开始,切换到西班牙语以表达特定文化背景,再切换回英语进行确认。V3 Turbo 以约 120 毫秒的首音频时间处理这些转换,使客户更长时间停留在自动化流程中,而不是要求转接人工客服。Together AI 的专用端点即使在通话高峰时段也能保持一致的性能。

双语环境中的受监管服务

服务于双语社区的银行、医疗保健机构和政府服务需要能够像客户一样进行语码转换的智能体。客户在咨询处方时可能大部分对话使用英语,但在描述症状或药物名称时切换到母语。自然的切换减少了重复和转接,因为呼叫者不再在通话中途测试智能体的语言能力。在 Together AI 上运行您的完整语音栈意味着一次合规审查即可覆盖 LLM、STT 和 TTS。

国际呼叫中心

服务于多语言市场的呼叫中心需要处理客户在一次通话中跨多种语言的语码转换。卢森堡的商业客户可能在一次对话中混合使用法语、德语和英语。V3 处理这些转换的同时保持流畅性,而 Together AI 的统一可观测性意味着您可以从单个仪表板跟踪所有语言的性能。

在 Together AI 上进行生产推理

Rime Arcana V3 的两个模型都在 Together AI 的专用端点上运行,具有隔离的 GPU 容量,并与 LLM 和 STT 工作负载共存。Together AI 在单一平台上提供广泛的 TTS 目录,从开源模型到企业级专有模型(如 Rime),并配备统一的工具。

基础设施

✔ 专用 GPU 容量,工作负载隔离

✔ 99.9% 正常运行时间 SLA

✔ SOC 2 Type II、HIPAA 就绪、PCI 合规

✔ 全球数据中心

✔ WebSocket 流支持

✔ 零数据保留,完全的数据所有权和控制权

开发者体验

✔ 与 LLM 和 STT 端点相同的 SDK 和身份验证

✔ V3 Turbo 和 V3 统一的发音 API

✔ 整个语音管道的单一可观测性和日志记录界面

✔ 通过配置进行模型选择和切换

✔ 提供专业语音克隆服务

✔ 支持高吞吐量工作负载的批处理

开始使用

→ 立即试用两个模型

→ 阅读 TTS 文档

→ 联系销售团队获取确定性发音控制、专用部署和批量定价