返回 文章 学习 CMS 文章

Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

Google 发布两款 Gemini 3.8 Live 语音模型,分别面向规模化部署与高复杂度推理任务。

Gemini语音模型实时推理Google
成长分 / 100 68 综合收获、行动、留存与影响

Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型
为什么值得读了解 Google 在近实时语音推理方向的最新模型能力与定位差异。

获取两款模型在 Artificial Analysis、τ-Voice、Big Bench Audio 等基准上的具体成绩。

关键洞察
  1. Gemini 3.8 Live 为规模化和成本效率而构建,结合对话智能、流畅对话与视觉基础,在语音代理竞技场排名第二。
  2. Gemini 3.8 Live Extended Thinking 面向高复杂度任务,具备更高智能和多步推理能力,在 Artificial Analysis 语音到语音质量指数中总体第一(82.6)。
  3. Extended Thinking 在 τ-Voice 上达到 68.6%,在 Sierra 的 τ-Voice-banking 基准上达到 35.1%,在 Big Bench Audio 上得分 97.7%。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:8527

推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking

文本“推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking”及 Gemini Spark,置于浅蓝色背景上

今天,我们推出两款新模型,在近实时推理方面取得进步,以更有效地赋能语音代理,并让与 AI 的对话感觉更直观、更智能。

Gemini 3.8 Live:为规模化和成本效率而构建,将对话智能与流畅对话和视觉基础相结合。Gemini 3.8 Live Extended Thinking:为高复杂度任务而构建,具有更高的智能和多步推理能力。

对于开发者和企业,这些模型提供了可靠、生产就绪的语音代理的构建模块。它们还使在 Gemini 应用、Google Workspace 和搜索中与 Gemini 交谈更加流畅和协作——帮助您仅用语音处理复杂任务。

体验更流畅、更智能的对话

Gemini 3.8 Live Extended Thinking 提供企业级任务完成和智能,在 Artificial Analysis 的语音到语音质量指数中夺得总体第一(82.6),并在代理任务完成方面领先,在 τ-Voice 上达到 68.6%,在 Sierra 的 τ-Voice-banking 基准上达到 35.1%。它还提供强大的推理能力,在 Big Bench Audio 上得分 97.7%,同时与其他前沿模型相比保持极具竞争力的价格点。

Gemini 3.8 Live 在用户中表现出高度偏好,在语音代理竞技场中排名第二。除了这一表现,它仍然极具成本效益——为开发者和企业提供了一个为规模化而构建的能力强大且高效的模型。

显示 Artificial Analysis 语音到语音指数的图表

显示 Artificial Analysis 代理性能的图表

显示 Sierra 的图表

显示 Artificial Analysis 每小时输入音频成本的图表

在 ServiceNow 的 EVA-Bench(一个评估语音代理的基准)上,我们的模型通过成功平衡准确性与对话质量,推动了复杂工作流的帕累托前沿。

注意:这是在 Gemini Enterprise Agent Platform 上的 Live API 上运行的。

显示 EVA Bench 体验到任务完成的图表

Gemini 3.8 Live 近实时处理视觉输入,用上下文丰富对话以提供更有帮助的响应。它能在对话中途自动检测并在 97 种支持的语言之间切换。它在继续对话的同时在后台执行工具和 API 调用,因此模型可以确认请求并在任务于后台完成时继续聊天。

Gemini 3.8 Live 实时指导员工入职,使用视觉上下文回答实时问题。

观看 Gemini 3.8 Live 利用视觉上下文、推理和自然对话流程近乎实时地下棋。

对于需要更深层推理的任务,3.8 Live Extended Thinking 能够边推理边说话。它为复杂工作流带来更强的智能,同时保持不间断的对话流程——使用诸如*“让我查一下……”*这样的早期口头提示来自然地确认提示,并通过实时进度叙述,在用户执行多步骤后台任务时全程引导他们。

观看 Gemini 3.8 Live Extended Thinking 将原始草图和近乎实时的语音反馈转化为可用的 React 组件。

观看 Gemini 3.8 Live Extended Thinking 协调多步骤预订和异步函数调用——全程不打断自然的实时对话。

观看 Gemini 3.8 Live 通过自然语音即时构建完整的商业计划和定制营销工具包。

在 Google Workspace 和搜索中,我们的 Live 模型带来更直观、更具协作性的体验——尤其是在处理你最复杂的任务时。

在 Google Workspace 中通过 Docs Live、Gmail Live 和 Keep Live 试用 Gemini 3.8 Live Extended Thinking。

在 Search Live 中直接获取由 Gemini 3.8 Live 驱动的分步实时故障排除帮助。

赋能开发者和企业语音生态系统

通过使用 Gemini Live API,诸如 Agora FishjamLangChain LiveKit Pipecat Vercel Vision Agents 等开发者平台,使开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在幕后管理复杂的实时媒体流基础设施,让开发者能够完全专注于打造用户体验。

我们还与 Salesforce、Genspark 和 Lumeris 等公司合作,它们对 3.8 Live 和 3.8 Live Extended Thinking 充满期待,并强调了其令人印象深刻的延迟、流畅性和工具调用能力。

Salesforce 评价

11Sight 评价

Equal AI 评价

ServiceNow 评价

Genspark 评价

Lenskart 评价

Lumeris 评价

Agora 评价

Ambr AI 评价

LiveKit 评价

Casuu 引言

通过 SynthID 水印确保透明度

我们的 AI 产品生成的所有音频都使用 SynthID 添加了水印。这种不可感知的水印直接编织进音频输出中,确保 AI 生成的内容可被检测,以帮助防止错误信息。有关我们安全与责任方法的详细信息,请查阅模型卡

开始使用我们最新的 Gemini Audio 模型:

3.8 Live 从今天开始逐步推出:

面向开发者:在 Gemini APIGoogle AI Studio面向企业:在 Gemini Enterprise 中提供私密预览,并即将登陆 Gemini Enterprise for Customer Experience面向所有人:在 Search Live 中

3.8 Live Extended Thinking 从今天开始逐步推出:

面向开发者:在 Gemini APIGoogle AI Studio面向企业:在 Gemini Enterprise 中提供私密预览,并即将登陆 Gemini Enterprise for Customer Experience 以及 Google Workspace 商业客户面向所有人:在 Gemini Live 中,以及面向 Workspace 中 Docs 的 Google AI Pro 和 Ultra 订阅者,以及 Gmail 和 Keep 中的所有 Google AI 订阅者