我们正在 API 中推出 GPT‑Live‑1,为开发者提供一个强大、自然的语音模型,用于构建支持语音的应用和业务工作流。 最初在 ChatGPT 中推出,GPT‑Live‑1 能够同时听和说,并且,正如
如 Codex 和 ChatGPT Work 中所见(在新窗口中打开)针对 GPT‑Live‑1 的 API 发布,我们专注于新能力,让开发者能够围绕其用户、工作流和目标来引导和定制语音体验。GPT‑Live‑1 的一项核心优势——流畅的中断处理——已经在产生业务影响:在早期评估中,Speak 发现 GPT‑Live‑1 让学习者在语言导师回应前有更多时间思考,与之前基于轮次的系统相比,中断减少了近 80%。
GPT‑Live‑1 在 API 中的关键优势:
中断处理:通过单一模型同时推理传入和传出的音频,改善中断处理,避免链式 STT–LLM–TTS 架构的延迟和脆弱交接。推理与工具调用委托:GPT‑Live‑1 可以将推理和工具调用委托给后端文本模型,如 GPT‑6 Astra 或第三方模型。语气、节奏和风格:让开发者通过系统提示塑造智能体的语气、节奏和对话风格。静默上下文管理与背景噪音:更好地处理背景噪音和静默,不打断对话,也不把每一步都大声叙述出来。长会话可靠性:在长时间交互中改善上下文保留和对话质量。电话支持:支持部署用于电话通话的全双工语音智能体,从餐厅预订到客户支持。
试用 GPT-Live-1
看看它能做什么
自然地打断它。请求帮助,然后在回复中途打断以更改问题或补充细节。随身携带。尝试在户外散步或日常背景噪音中对话,看看它如何跟上你。让它更有趣。大笑、犹豫、使用简短的回应,或短暂与附近的人交谈——然后继续对话。
此演示有时间限制。使用即表示你同意 OpenAI 的条款并确认我们的隐私政策。
Yelp Host 借助 GPT‑Live‑1 处理背景噪音、旁侧对话和打断,无缝确保预订成功。
传统语音智能体将语音转文本、推理模型和文本转语音拼接在一起。每次交接都会增加延迟,并创造更多丢失时机、上下文或对话自然节奏的机会。开发者往往需要协调这些阶段,包括当有人打断、暂停或改变方向时会发生什么。
GPT‑Live‑1 在单一模型中处理听和说,简化了语音层。它可以在打断和回应发生时做出反应,同时将更深层的推理委托给后端。这让对话可以继续,而工作在后台进行。
开发者可以选择对话背后的模型、工具和智能体框架。例如,他们可以将 GPT‑Live‑1 与 Luna 这样的模型搭配,用于排程或订单更新等高并发任务,并使用 Astra 这样的模型处理需要推理的复杂客户问题。这种灵活性让开发者能够为每项任务匹配相应的推理深度、速度和成本。
GPT‑Live‑1 原生提供 ASR 转录文本和响应文本。它还具备强大的字母数字理解能力,并支持关键词偏置。尽管 GPT‑Live‑1 不是回合制模型,但它原生支持轮次检测,因此开发者可以继续围绕明确的轮次边界进行构建。
在我们的各项评估中,GPT‑Live‑1 将 Full Duplex Bench 的表现较 GPT‑Realtime‑2.1 提升了 30 个百分点,在轮次切换延迟和交互行为方面取得了大幅提升。搭配以中等推理强度运行的 GPT‑6 Astra 时,它还在 Tau3 上排名第一,该基准衡量的是端到端任务中的前沿语音智能体智能水平。
评估航空、零售和电信领域的口语客户服务任务。Pass@1 衡量任务成功率;标题分数对每个领域赋予相同权重。
- GPT Live 后端:Astra(中等)。
评估带有知识检索和账户工具的口语银行支持。Pass@1 是 97 项 banking_knowledge 任务中成功完成的比例。
- GPT Live 后端:Astra(中等)。
评估停顿处理、对话轮次切换、打断和反馈应答。
测试对背景语音、对他人说话、听者反馈应答和打断的反应。
衡量智能体在用户结束一轮发言后多快开始回复。
测试从包含自然停顿、犹豫和自我纠正的口语请求中进行工具使用。Pass@1 对工具调用序列评分。
- GPT Live 后端:Terra(低)。
评估对包含停顿、犹豫和自我纠正的工具使用请求所给出的口语回答。评分衡量回答与参考意图的匹配程度。
- GPT Live 后端:Terra(低)。
开发者需要适合其产品、并且对使用者来说听起来自然的语音。借助 GPT‑Live‑1,我们正从少量实时语音扩展到覆盖不同口音、方言和语言的更广泛选择,让开发者在其助手的声音方面拥有更多选择。
受澳大利亚英语影响
我们将在未来几个月继续扩展语音选项和语言可用性。
GPT‑Live‑1 现已在 API 中提供(在新窗口中打开),前端语音层价格为每分钟 0.05 美元。将其与适合你产品的后端模型和智能体框架搭配,然后构建一种能够随其所需完成的工作而扩展的语音体验。
如需自定义语音访问,请联系销售以了解更多关于资格和申请流程的信息。
在 GPT‑Live‑1 之上构建语音工作流的另一种方式是使用 OpenAI Presence,它使用该模型来驱动实时语音交互。Presence 帮助企业部署可信的 AI 智能体,这些智能体可以回答问题、解决问题、使用公司系统、采取已批准的操作,并在需要时升级给人工处理。请联系你的 OpenAI 客户总监以了解更多信息。
