返回 文章 apply CMS 文章

OpenAI 在 API 中推出 GPT-Live-1:面向开发者的自然语音模型

GPT-Live-1 将听与说整合进单一模型,让开发者构建更自然、可打断的语音应用与业务工作流。

OpenAIGPT-Live-1语音模型API
成长分 / 100 80 综合收获、行动、留存与影响

OpenAI 在 API 中推出 GPT-Live-1:面向开发者的自然语音模型
为什么值得读了解 OpenAI 最新语音模型在 API 中的核心能力与定价方式。

掌握 GPT-Live-1 相比传统 STT-LLM-TTS 链式架构的改进点。

关键洞察
  1. GPT-Live-1 在单一模型中同时处理听和说,避免链式 STT–LLM–TTS 架构的延迟和脆弱交接。
  2. 它可以将推理和工具调用委托给后端文本模型,如 GPT-6 Astra 或第三方模型。
  3. 开发者可通过系统提示塑造智能体的语气、节奏和对话风格,并更好地处理背景噪音与静默。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:6649

我们正在 API 中推出 GPT‑Live‑1,为开发者提供一个强大、自然的语音模型,用于构建支持语音的应用和业务工作流。 最初在 ChatGPT 中推出,GPT‑Live‑1 能够同时听和说,并且,正如

, 可以将更深层的推理和操作委托给它所配对的模型和工具。

如 Codex 和 ChatGPT Work 中所见(在新窗口中打开)针对 GPT‑Live‑1 的 API 发布,我们专注于新能力,让开发者能够围绕其用户、工作流和目标来引导和定制语音体验。GPT‑Live‑1 的一项核心优势——流畅的中断处理——已经在产生业务影响:在早期评估中,Speak 发现 GPT‑Live‑1 让学习者在语言导师回应前有更多时间思考,与之前基于轮次的系统相比,中断减少了近 80%。

GPT‑Live‑1 在 API 中的关键优势:

中断处理:通过单一模型同时推理传入和传出的音频,改善中断处理,避免链式 STT–LLM–TTS 架构的延迟和脆弱交接。推理与工具调用委托:GPT‑Live‑1 可以将推理和工具调用委托给后端文本模型,如 GPT‑6 Astra 或第三方模型。语气、节奏和风格:让开发者通过系统提示塑造智能体的语气、节奏和对话风格。静默上下文管理与背景噪音:更好地处理背景噪音和静默,不打断对话,也不把每一步都大声叙述出来。长会话可靠性:在长时间交互中改善上下文保留和对话质量。电话支持:支持部署用于电话通话的全双工语音智能体,从餐厅预订到客户支持。

试用 GPT-Live-1

看看它能做什么

自然地打断它。请求帮助,然后在回复中途打断以更改问题或补充细节。随身携带。尝试在户外散步或日常背景噪音中对话,看看它如何跟上你。让它更有趣。大笑、犹豫、使用简短的回应,或短暂与附近的人交谈——然后继续对话。

此演示有时间限制。使用即表示你同意 OpenAI 的条款并确认我们的隐私政策

Yelp Host 借助 GPT‑Live‑1 处理背景噪音、旁侧对话和打断,无缝确保预订成功。

传统语音智能体将语音转文本、推理模型和文本转语音拼接在一起。每次交接都会增加延迟,并创造更多丢失时机、上下文或对话自然节奏的机会。开发者往往需要协调这些阶段,包括当有人打断、暂停或改变方向时会发生什么。

GPT‑Live‑1 在单一模型中处理听和说,简化了语音层。它可以在打断和回应发生时做出反应,同时将更深层的推理委托给后端。这让对话可以继续,而工作在后台进行。

开发者可以选择对话背后的模型、工具和智能体框架。例如,他们可以将 GPT‑Live‑1 与 Luna 这样的模型搭配,用于排程或订单更新等高并发任务,并使用 Astra 这样的模型处理需要推理的复杂客户问题。这种灵活性让开发者能够为每项任务匹配相应的推理深度、速度和成本。

GPT‑Live‑1 原生提供 ASR 转录文本和响应文本。它还具备强大的字母数字理解能力,并支持关键词偏置。尽管 GPT‑Live‑1 不是回合制模型,但它原生支持轮次检测,因此开发者可以继续围绕明确的轮次边界进行构建。

在我们的各项评估中,GPT‑Live‑1 将 Full Duplex Bench 的表现较 GPT‑Realtime‑2.1 提升了 30 个百分点,在轮次切换延迟和交互行为方面取得了大幅提升。搭配以中等推理强度运行的 GPT‑6 Astra 时,它还在 Tau3 上排名第一,该基准衡量的是端到端任务中的前沿语音智能体智能水平。

评估航空、零售和电信领域的口语客户服务任务。Pass@1 衡量任务成功率;标题分数对每个领域赋予相同权重。

  • GPT Live 后端:Astra(中等)。

评估带有知识检索和账户工具的口语银行支持。Pass@1 是 97 项 banking_knowledge 任务中成功完成的比例。

  • GPT Live 后端:Astra(中等)。

评估停顿处理、对话轮次切换、打断和反馈应答。

测试对背景语音、对他人说话、听者反馈应答和打断的反应。

衡量智能体在用户结束一轮发言后多快开始回复。

测试从包含自然停顿、犹豫和自我纠正的口语请求中进行工具使用。Pass@1 对工具调用序列评分。

  • GPT Live 后端:Terra(低)。

评估对包含停顿、犹豫和自我纠正的工具使用请求所给出的口语回答。评分衡量回答与参考意图的匹配程度。

  • GPT Live 后端:Terra(低)。

开发者需要适合其产品、并且对使用者来说听起来自然的语音。借助 GPT‑Live‑1,我们正从少量实时语音扩展到覆盖不同口音、方言和语言的更广泛选择,让开发者在其助手的声音方面拥有更多选择。

受澳大利亚英语影响

我们将在未来几个月继续扩展语音选项和语言可用性。

GPT‑Live‑1 现已在 API 中提供(在新窗口中打开),前端语音层价格为每分钟 0.05 美元。将其与适合你产品的后端模型和智能体框架搭配,然后构建一种能够随其所需完成的工作而扩展的语音体验。

如需自定义语音访问,请联系销售以了解更多关于资格和申请流程的信息。

在 GPT‑Live‑1 之上构建语音工作流的另一种方式是使用 OpenAI Presence,它使用该模型来驱动实时语音交互。Presence 帮助企业部署可信的 AI 智能体,这些智能体可以回答问题、解决问题、使用公司系统、采取已批准的操作,并在需要时升级给人工处理。请联系你的 OpenAI 客户总监以了解更多信息。

作者

继续阅读

查看全部