Gemini 3.8 文本转语音向你问好

今天,我们为 Gemini 家族引入两款全新的文本转语音模型,将语音生成从静态预设转变为动态创意工作室。这些模型让创作者、开发者和企业能够打造更丰富、更具表现力的音频体验,同时改善 Gemini Notebook 和 Google Vids 等产品中的用户体验。
Gemini 3.8 Flash TTS:专为深度创意指导和角色设计而打造。使用自然语言提示从零开始创建全新语音,让角色在游戏、沉浸式有声书、播客和互动媒体中栩栩如生。通过对话术提示、节奏、方言转换和附和语的精细控制,逐行指导每一场表演。Gemini 3.8 Flash-Lite TTS:专为大批量、高成本效益的规模化应用而打造。针对大批量配音、音频内容创作和富有表现力的语音代理进行了优化,可对语气、节奏和表现力细微差别进行精细控制。
这些模型补充了我们快速增长的 Gemini Audio 家族,此前已推出 3.5 Live Translate、3.5 Transcribe、3.8 Live 和 3.8 Live Extended Thinking。
创建并自定义你自己的语音
从 30 种原创语音扩展到无限语音库。无论你需要一个完全原创的角色语音,还是一个一致的品牌代言人,我们的 3.8 Flash TTS 模型都能提供完整的语音工作室。这使你能够为每个时刻创建并使用富有表现力、听起来自然的语音,同时让开发者和企业能够轻松构建自定义音频体验。
生成式语音设计:借助 Gemini 3.8 Flash TTS,通过自然语言提示,在 100 多种语言和方言中自定义角色、口音和语音特征,从零开始创建定制语音——无论你是要让一只戏剧性的喷火龙栩栩如生,还是打造一位带有独特地域韵律的魅力旁白。
听听 Gemini 3.8 Flash TTS 如何生成来自墨尔本的高能量 DJ 语音。
听听 Gemini 3.8 Flash TTS 如何生成一种超级尖细、单调的机器人语音。
听听 Gemini 3.8 Flash TTS 如何让一条日本龙栩栩如生。
丰富的语音库:可访问 2,000 多种可直接用于生产的语音,覆盖广泛的语言——包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。语音复刻:仅需一段 30 秒的音频样本,即可根据你自己的声音或你拥有使用权的他人声音,重建一致的语音特征,并配有内置的同意验证、SynthID 水印和 C2PA 凭证,以保护开发者及其配音人才。保存与扩展:保存并管理你设计的自定义语音,以确保在持续进行的项目中保持一致的性能并将漂移降至最低。语音混音:即将推出,从我们的语音库中选择一个语音,并微调音色、音高、语速和口音。使用提示词来调整特征(例如“加入微妙的美国南方口音”或“让表达更柔和”)。
逐行指导表演
选定语音后,两个 TTS 模型都能让你精确控制每一行的表达方式。
逐行指导表演:编写你自己的舞台指示,或让 Gemini 通过自然的脚本提示来引导表达——从冷静的客服人员到低声细语的悬疑场景。
聆听 Gemini 3.8 Flash TTS 如何为交互式语音代理实现自然、极具表现力的对话。
观看并聆听 Gemini 3.8 Flash TTS 如何使用精细的脚本控制,打造深度引人入胜、沉浸式的音频体验。
长篇生成:在数小时的连续音频中保持高语音质量、自然的节奏和角色音色,并将说话人漂移降至最低——非常适合播客和有声书。原生双说话人场景编排:从单个脚本无缝指导多轮对话——无论是播客还是戏剧性叙事——同时让两个声音保持清晰区分,并实现自然的对话轮替。脚本化的人声爆发与附和:使用非语言提示(如
了解 Gemini 3.8 Flash TTS 如何将自然语言提示词从零开始转化为定制的语音角色。
观看 Gemini 3.8 Flash TTS 如何让创作者设计自定义场景,使动画对话栩栩如生。
了解 Gemini 3.8 Flash TTS 如何将脚本转化为完整表演的对话场景,让创作者指导语音表达和自然的对话轮替。
获取为全球规模打造的表现力强、高质量的语音生成
Gemini 3.8 Flash TTS 提供领先的语音定制能力,在 Hume AI 的语音设计基准测试中夺得总分第一(71.4),并在口音建模方面同样领先(60.8)。
Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 在不牺牲可靠性的前提下实现真正富有表现力的表演,并分别在 Hume AI 的总体质量指数中夺得第一和第二名。与 Gemini 3.1 Flash TTS 相比,该模型在长篇内容和双说话人剧本控制等广泛用例上展现出重大改进。
在 Voice Arena 上进行的人类盲测偏好评估中,Gemini 3.8 Flash 和 Flash-Lite TTS 在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语(MSA)、墨西哥西班牙语和印地语等关键全球语言中,于竞争对手之间占据了领先位置。凭借对 100 多种语言的支持,这些模型赋能创作者、开发者和企业,在全球范围内构建高质量的多语言语音体验。



以信任、同意和透明为基础构建
我们在构建语音创建和复制能力时,设置了严格的保障措施,以帮助保护配音人才、尊重身份并确保内容透明。对于语音复制,我们的系统采用同意验证机制:用户必须提供来自声音所有者的口头同意录音,且该录音需与参考说话人匹配,之后才能创建语音。
更广泛地说,我们的 Gemini Audio 模型生成的每一段音频片段都带有 SynthID 水印。这种不可感知的水印被直接编织进音频输出中,确保 AI 生成的语音保持可检测,以帮助防止虚假信息。有关我们安全与责任方法的更多细节,请查阅模型卡。
试用我们全新的 Google AI Studio 音频实验场
从今天起,开发者可以在 Google AI Studio 中体验这些全新的语音生成能力。它被构建为一个语音设计工作区,你可以从零开始提示生成全新的声音身份,或复制你自己的声音
,然后将其直接带入双说话人剧本编辑器,逐行指导语音表达。
在 Google AI Studio 中试用语音复制。
轻松部署高性能语音界面
通过使用 Gemini API,Agora、LiveKit、Pipecat、Vercel 等开发者平台使开发者能够轻松构建和部署高性能语音生成体验。
我们正在与 Figma、HeyGen、Linguana、Wondercraft、99.co 和 Ollang 等公司合作,他们正在集成我们最新的 TTS 模型,以帮助加速全球配音、以细腻的区域口音本地化媒体,并大规模驱动对话式语音代理。











开始使用我们最新的 Gemini Audio 模型:
Gemini 3.8 Flash TTS 从今天开始逐步推出:
面向开发者:在Gemini API和Google AI Studio中面向企业:即将通过 API 在Gemini Enterprise中推出面向所有人:在Gemini Notebook中。
Gemini 3.8 Flash-Lite TTS 从今天开始逐步推出:
面向开发者:在Gemini API和Google AI Studio中面向企业:即将通过 API 在Gemini Enterprise中推出面向所有人:在Google Vids中
