2026年9月23日
Gemini 3.8 TTS 演练场——通过一个交互式演练场来测试和试验 Google 的 Gemini 3.8 文本转语音 API,你可以在此编写单语音旁白或多说话人对话、预览生成的音频,并查看请求和响应的详细信息。将你的编写设置保存为可收藏的 URL 以便轻松分享,并使用你的 Gemini API 密钥生成高质量的语音合成。
Google 今天发布了两款新的 Gemini 文本转语音模型——gemini-3.8-flash-tts
和 gemini-3.8-flash-lite-tts
。
它们附带了一个包含 2,000 多种声音的库,并且能够用“仅需一段 30 秒的音频样本,可以是你的声音或你有权使用的声音”来创建自定义声音。
我用 GPT-6 Astra 凭感觉编写了这个自带密钥的演练场界面,利用了底层 Gemini API 开放的 CORS 策略。
该 API 的一个显著特点是,它让定义多个角色之间的完整对话变得很容易,每个角色都有不同的声音和声音风格指令。
这里有一段简短的演示片段,是两只鹈鹕在争论它们是否应该搬到 Pacifica Pier。我让 Claude 4.5 Opus 编写了脚本并生成了一个使用该工具渲染它的 URL。
使用 Gemini 3.8 Flash TTS(不是更便宜的 Flash-Lite)生成 1 分 18 秒的音频大约花了 20 秒,成本为 2.74 美分。
近期文章
Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna,以及一场新的价格战- 2026年9月22日Jev 推出一种新形态的 LLM——System One,又名决策模型- 2026年9月21日用 GPT-6 Astra 和 ChatGPT Work 生成跑步路线- 2026年9月12日
