跳到正文
Google DeepMind·· 15 天前精选AI 评分84

Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS

Gemini 3.8 text-to-speech says hello

AI 导读

Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两个文本转语音模型,用于生成更具表现力的音频。

推荐理由

原文列出语音定制、复刻、安全标识和开放渠道,便于判断新 TTS 模型的应用边界。

正文 · AI 翻译

2026 年 9 月 23 日

|

Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 是我们迄今最具表现力的音频生成模型。可在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids 中生成自定义角色声音,并指导场景对话。


Leland Rechis

集团产品经理

Alan Cowen

研究科学总监,代表 Gemini Audio 团队


a text card image reading "Introducing Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS"

今天,我们将向 Gemini 家族推出两款新的文本转语音模型,将语音生成从静态预设转变为动态创意工作室。这些模型使创作者、开发者和企业能够打造更丰富、更具表现力的音频体验,同时也能在 Gemini Notebook 和 Google Vids 等产品中带来更好的用户体验。

  • Gemini 3.8 Flash TTS:专为深度创意指导和角色设计而打造。使用自然语言提示从零开始创建全新的声音,让游戏、沉浸式有声书、播客和互动媒体中的角色鲜活起来。以细粒度控制表演提示、节奏、方言转换和附和语,逐句指导每一次表演。
  • Gemini 3.8 Flash-Lite TTS:专为高容量、经济高效的规模化应用而打造。针对大规模配音、音频内容创作和富有表现力的语音智能体进行优化,可精细控制语气、节奏和表达细微差别。

这些模型补充了我们快速发展的 Gemini Audio 家族,此前我们已推出 3.5 Live Translate、3.5 Transcribe、3.8 Live 和 3.8 Live Extended Thinking。

创建并自定义你自己的声音

从 30 种原始声音扩展到无限的声音库。无论你需要完全原创的角色声音,还是一致的品牌代言人声音,我们的 3.8 Flash TTS 模型都能提供完整的声乐工作室能力。这让你可以为每个时刻创建并使用富有表现力、听起来自然的声音,同时帮助开发者和企业轻松构建自定义音频体验。

  • 生成式声音设计:借助 Gemini 3.8 Flash TTS,你可以使用自然语言提示,在 100 多种语言和方言中自定义角色、口音和声音特征,从零开始创建定制声音——无论是让一条富有戏剧感、会喷火的巨龙栩栩如生,还是打造一位具有鲜明地区韵律的魅力旁白。
  • 庞大的声音库:可访问 2,000 多种可用于制作的声音,覆盖广泛语言——包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。
  • 声音复刻:只需一段 30 秒的你的声音样本,或你有权使用的声音样本,即可重建一致的声音档案,并通过内置的同意验证、SynthID 水印和 C2PA 凭证,为开发者及其配音人才提供保护。
  • 保存并扩展:保存并管理你设计的自定义声音,以确保在持续项目中保持一致表现并尽量减少偏移。
  • 声音混音:即将推出,你可以从我们的声音库中选择一种声音,并微调音色、音高、语速和口音。使用提示来精确设定特征(例如“添加轻微的美国南部口音”或“让表达更柔和”)。

逐句指导表演

选择声音后,两款 TTS 模型都能让你精确控制每一句台词的呈现方式。

  • 逐行直接控制表演: 编写你自己的舞台指示,或让 Gemini 通过自然的脚本提示来引导表达——从平静的客服专员到低声耳语的悬疑场景。
  • 长篇生成: 在数小时连续音频中保持高语音质量、自然节奏和角色音色,并将说话人漂移降至最低——非常适合播客和有声书。
  • 原生双说话人场景调度: 通过单个脚本无缝引导多轮对话——无论是用于播客还是戏剧化叙事——同时让两种声音保持清晰区分,并实现自然的对话轮替。
  • 脚本化的声音爆发与附和: 使用非语言提示(如 <laughs>、<sigh>、<gasp>)以及积极倾听式插话(如 |mhm| 或 |yeah|)添加逼真的对话质感,实现精准的喜剧节奏和反应节拍。

获得面向全球规模打造的富有表现力的高质量语音生成

Gemini 3.8 Flash TTS 提供领先的语音定制能力,在 Hume AI 的 Voice Design Benchmark(71.4)中获得综合第 1 名,并在口音建模(60.8)方面同样领先。

Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 可实现真正富有表现力的表演,同时不牺牲可靠性,还分别在 Hume AI 的 Overall Quality Index 中获得第 1 名和第 2 名。与 Gemini 3.1 Flash TTS 相比,该模型在长篇内容和双说话人剧本控制等广泛用例上都有显著提升。

在 Voice Arena 的盲测人类偏好评估中,Gemini 3.8 Flash 和 Flash-Lite TTS 在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语(MSA)、墨西哥西班牙语和印地语等关键全球语言中位居竞争者前列。凭借对 100 多种语言的支持,这些模型让创作者、开发者和企业能够在全球范围内构建高质量的多语言语音体验。

An evaluation showing text-to-speech quality benchmark Hume AI

an evaluation chart showing text to speech voice design leaderboard Hume AI

an evaluation chart showing text to speech leaderboard for Voice Arena

以信任、同意和透明度为基础进行构建

我们在构建语音创建和复制能力时采用了严格的安全防护措施,以帮助保护配音人才、尊重身份,并确保内容透明。对于语音复制,我们的系统利用同意验证:用户必须提供来自声音所有者的口头同意录音,且该录音需与参考说话人匹配,然后才能创建声音。

更广泛地说,由我们的 Gemini Audio 模型生成的每段音频都会嵌入 SynthID 水印。这种不可感知的水印会直接编织进音频输出中,确保 AI 生成的语音仍可被检测出来,以帮助防止虚假信息。有关我们安全与责任方法的更多详情,请查看模型卡。

试用我们全新的 Google AI Studio 音频体验区

从今天开始,开发者可以在 语音生成 Google AI Studio 中体验这些新的能力。它像一个语音设计工作区,你可以从零开始提示生成全新的声音身份,或复制你自己的声音 1 ,然后将它们直接带入双说话人剧本编辑器,逐行指导表达。

在 Google AI Studio 中试用语音复制。

轻松部署高性能语音界面

通过使用 Gemini API,Agora、LiveKit、Pipecat、Vercel 等开发者平台使开发者能够轻松构建和部署高性能语音生成体验。

我们正在与 Figma、HeyGen、Linguana、Wondercraft、99.co 和 Ollang 等公司合作,它们正在集成我们最新的 TTS 模型,以帮助加速全球配音、用细腻的地区口音对媒体进行本地化,并大规模驱动对话式语音代理。

a quote from Darius Cheung, CEO and Co-Founder of 99 Group

a quote from Mason Adams, Developer Evangelist, Agora

a quote from Jonathan Gur-Zeev, Director of Product, Figma Weave

a quote from Bin Liu, VP of Engineering for Hygen

a quote card from Luke Pane, Developer, katsuyo

quote from Ritwik Baranwal, Associate Director AI/ML of kuku.

a quote from Oded Shafran, Co-Founder & CTO of linguana

Aziz Ulak, CTO & Co-founder, Ollang

a quote from Phil Marshall, Founder and CEO of Spoken

quote from Zina Rahman, Co-Founder and CEO, Transforms.AI

quote from Mei Ki Yiu, CTO of Wondercraft

开始使用我们最新的 Gemini Audio 模型:

Gemini 3.8 Flash TTS 从今天开始推出:

Gemini 3.8 Flash-Lite TTS 从今天开始推出:

在你的收件箱中获取来自 Google 的最新消息

订阅我们的新闻通讯,获取产品更新、活动信息、特别优惠等内容。

你的信息将按照 Google 的隐私政策 使用。你可以随时退订。

来源:Google DeepMind · deepmind.google