返回 文章 build CMS 文章

Gemini 3.8 Live 语音模型发布:用纯 Web 技术构建实时语音对话界面

Google 发布 Gemini 3.8 Live 语音模型,作者用 GPT-6 Astra 生成了一个纯 Web 技术实现的实时语音对话界面。

Gemini语音模型WebSocketWeb Audio API
成长分 / 100 68 综合收获、行动、留存与影响

Gemini 3.8 Live 语音模型发布:用纯 Web 技术构建实时语音对话界面
为什么值得读了解 Google 最新发布的 Gemini 3.8 Live 和 3.8 Live Extended Thinking 语音到语音模型。

学习如何用纯 Web 技术(WebSocket + Web Audio API)构建实时语音对话界面,无需任何库。

关键洞察
  1. Gemini 3.8 Live 和 3.8 Live Extended Thinking 是 Google 新发布的语音到语音模型,形态与 OpenAI 的 GPT-Live 系列相似。
  2. 作者使用 GPT-6 Astra Extra High 根据文档自动生成了一个 Web UI,用于试用这些新模型。
  3. 该 Web UI 支持选择模型和语音预设、输入可选系统提示词、通过浏览器进行语音对话,并能在模型说话时打断它。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:1657

2026年9月15日

Google 今天发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking——两个新的语音到语音模型,其形态与 OpenAI 的 GPT-Live 系列相似。

我把文档交给 GPT-6 Astra Extra High,让它为我构建了这个 Web UI,用于试用这些新模型。你可以选择一个模型和语音预设,输入可选的系统提示词,然后通过浏览器开始语音对话,包括在模型说话时打断它的能力。

实现不使用任何库。它连接到 wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent?key=...

WebSocket 端点,并使用 Web Audio API 的 AudioContext

进行采集和播放。

这里是Gemini Live 教程,用于入门该 WebSockets API。

近期文章

使用 GPT-6 Astra 和 ChatGPT Work 生成跑步路线- 2026年9月12日OpenAI 智能体早在 5 月就攻击了 RubyGems- 2026年9月12日关于纳维-斯托克斯千禧年大奖难题的一些思考- 2026年9月8日