返回 文章 apply CMS 文章

Together AI 推出统一实时语音代理平台,端到端延迟低于 500ms

Together AI 通过共置语音堆栈、原生集成 Deepgram 和 Cartesia,提供低于 500ms 延迟的统一实时语音代理平台。

Together AI实时语音代理STTLLM
成长分 / 100 77 综合收获、行动、留存与影响

Together AI 推出统一实时语音代理平台,端到端延迟低于 500ms
为什么值得读了解如何通过共置架构消除跨供应商网络跳转,实现实时语音交互。

获取生产级语音代理的部署实践,包括模型选择、延迟优化和合规要求。

关键洞察
  1. Together AI 将 STT、LLM 和 TTS 共置于同一集群,从靠近用户的区域提供服务,端到端延迟低于 500ms。
  2. 平台原生集成 Deepgram(Nova-3、Flux 等)和 Cartesia(Sonic-3、Sonic-2),提供更多模型选择。
  3. 统一 API、计费和部署界面,支持零数据保留、SOC 2 Type II、HIPAA 合规及专用数据驻留。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:8390

摘要

Together AI,AI 原生云,宣布推出一整套用于构建实时语音代理的能力——在同一云上共置 STT、LLM 和 TTS,消除供应商之间的网络跳转,实现端到端流水线延迟低于 500 毫秒Cartesia Sonic-3 (TTS) 和 Deepgram (STT)现已原生托管在 Together 基础设施上,扩展了共置堆栈上的模型选择一个 API、一个计费界面、一个部署界面——零数据保留、SOC 2 Type II、HIPAA 合规,以及为企业部署提供的专用数据驻留

想与助手对话而不是阅读这篇博客?请拨打 (847) 851-4323,向我们的助手询问模型、定价或如何部署语音代理。然后在中途打断它。该演示专为实时轮流对话设计,响应速度足够快,感觉就像在交谈。这种体验在分散的语音堆栈中很难实现,而这正是 Together AI 为生产规模所构建的。

今天,Together AI,AI 原生云,推出了全套能力,提供业界首个统一解决方案,用于在共置的 STT、LLM 和 TTS 基础设施上构建实时语音代理。Together 将整个语音堆栈保留在一个云上,降低了延迟,简化了部署,并提高了可靠性。我们还通过原生集成来自 Cartesia (TTS) 和 Deepgram (STT) 的业界领先语音模型,为构建者提供了更多选择。

生产级语音系统通常迫使团队在速度、模型选择和操作稳定性之间进行权衡。Together 的统一解决方案旨在消除这种权衡:为实时对话提供低延迟基础设施,跨语音堆栈提供灵活的模型支持,以及一个安全、生产就绪的平台,使团队无需跨提供商重建即可从评估过渡到部署。

架构:统一模块化与多提供商堆栈

您刚刚拨打的演示之所以保持实时,是因为它将那些交接保持在同一个 Together AI 集群内,从保持到呼叫者的往返延迟较低的区域提供服务。每个组件——STT、LLM 和 TTS——都在具有预预热容量的专用端点上运行,从用户语音结束到第一个音频令牌的端到端延迟低于 500 毫秒。

跨多个供应商构建语音流水线通常意味着通过公共互联网在独立的 STT、LLM 和 TTS 系统之间路由音频和文本。每次交接都会增加延迟,增加操作复杂性,并使堆栈在生产中更难管理。Together AI 的统一模块化架构旨在通过将 STT、LLM 和 TTS 共置于同一集群内,并从靠近最终用户的区域提供服务,来消除这种开销。

该架构之所以重要,有三个原因:

速度:语音代理通常在STT、LLM和TTS跨多个云提供商传递音频和文本时变慢。这些跨供应商的网络跳转在管道的每个阶段都会增加延迟,使实时对话更难维持。Together将这些交接保持在本地数据中心网络而非公共互联网上,从而实现端到端延迟低于500毫秒,以及自然轮流对话所需的响应能力。

灵活性:模型灵活性需要选择。Together在一个地方托管用于转录、推理和合成的领先语音模型,为团队提供速度和控制力,以配置每个用例所需的堆栈。与不透明的语音到语音系统不同,Together的模块化设计保留了对中间转录和响应文本的访问,因此团队可以在数据流中检查、修改和路由数据,作为其自身应用逻辑的一部分。

可靠性:生产环境需要可靠性。Together的零信任架构专为敏感语音数据设计,而其简化的端到端管理体验消除了拼接来自多个供应商的不同解决方案的复杂性。在一个平台上运行整个管道,为团队提供单一API、单一认证层、单一计费面和统一指标——减少了运营开销,降低了延迟,并使生产中的成本更可预测。

对于企业部署,该平台旨在支持严格要求,包括零数据保留、SOC 2 Type II、HIPAA和专用数据驻留选项。

流程图展示了共置用例,包括带有音频块、模型和函数调用的客户服务。

一个平台上的模型选择

团队经常为了速度、富有表现力的合成或语音克隆而拼凑不同的提供商,将其基础设施变成脆弱的多个供应商拼凑物。Together AI用一个单一的、与模型无关的平台取代了这一点。开发者可以配置他们需要的精确STT、LLM和TTS堆栈,并在不重建集成的情况下交换模型。

通过一个平台,团队可以通过Whisper Large v3、Minimax Speech 2.6 Turbo、Rime Arcana、Kokoro以及完整的Together LLM目录等模型路由音频和文本。在我们的STTTTS文档中查看我们支持的模型的完整目录。

为了扩展我们的模型库,我们正在推出与Deepgram(STT)和Cartesia (TTS)的原生集成。直接在Together AI上托管这些模型意味着团队可以获得行业领先的转录和合成,同时将每次交接安全地保留在共置堆栈内。

CartesiaSonic-3Sonic-2引入平台,提供专为语音代理和生产部署而构建的富有表现力、超低延迟的TTS。

“在 Cartesia,我们致力于突破实时、富有表现力的语音 AI 的极限。通过与 Together AI 合作,我们很高兴能将这项技术带给更多构建下一代语音应用的开发者。——Arjun Desai,Cartesia 联合创始人

DeepgramNova-3Nova-3 多语言(语音转文本)、Flux(对话式语音转文本)和 Aura-2(文本转语音)引入平台,涵盖从实时转录到企业级语音合成的所有功能。

“语音代理的成败取决于延迟,而提供商之间的每一次网络跳转都是体验下降的环节。通过在 Together AI 的基础设施上原生托管 Deepgram 的语音转文本服务,我们为开发者提供了生产级转录,无需权衡。快速、准确,并与管道的其余部分共置。”——Abe Pursell,Deepgram 合作伙伴关系副总裁

生产中的语音代理:Decagon

Decagon 在此堆栈上运行 礼宾语音代理 于生产环境中。他们的代理大规模处理复杂的企业客户支持工作流程——例如解决账单查询、管理账户更新和执行技术故障排除。在这些环境中,转录准确性、低延迟和基础设施正常运行时间对于维持自然的客户体验至关重要。在 Together AI 上运行管道提供了流畅对话所需的严格延迟界限,同时保留了 Decagon 对中间转录和响应文本的控制。

开始使用

拨打演示电话:(847) 851-4323

→ 阅读 演示指南

→ 阅读 文本转语音文档

→ 阅读 语音转文本文档