Google DeepMind 推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking
Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
Google DeepMind 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,用于近实时推理、语音智能体和更自然的 AI 对话。
原文同时给出语音模型能力、评测结果和开放入口,便于判断其在语音智能体中的适用场景。
2026 年 9 月 15 日
|
Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 是我们迄今最先进的实时对话模型。智能和并行推理方面的重大升级,使它们在协作以及使用语音执行复杂任务时更加直观。
Tom Ouyang
首席工程师
Malini Jaganathan
技术人员,代表 Gemini Audio 团队
你的浏览器不支持 audio 元素。
收听文章
[[duration]] 分钟
此内容由 Google AI 生成。生成式 AI 仍处于实验阶段
更新于 2026 年 9 月 17 日
今天,我们推出两款新模型,将近实时推理方面的进展带来给语音代理,从而更有效地支持语音代理,并让与 AI 对话感觉更直观、更智能。
- Gemini 3.8 Live:为规模化和成本效率而构建,将对话智能与流畅对话和视觉定位相结合。
- Gemini 3.8 Live Extended Thinking:为高复杂度任务而构建,具备更高智能和多步推理能力。
对于开发者和企业而言,这些模型为可靠、可投入生产的语音代理提供了构建模块。它们还让用户在 Gemini 应用、Google Workspace 和搜索中与 Gemini 对话更加流畅、更具协作性——帮助你只用语音就能处理复杂任务。
体验更流畅、更智能的对话
Gemini 3.8 Live Extended Thinking 提供企业级任务完成能力和智能,在 Artificial Analysis 的 Speech to Speech Quality Index(82.6)中取得总体第 1 名,并在代理式任务完成方面领先,在 τ-Voice 上达到 68.6%,在 Sierra 的 τ-Voice-banking 基准测试上达到 35.1%。它还提供强大的推理能力,在 Big Bench Audio 上得分 97.7%,同时相较其他前沿模型保持极具竞争力的价格点。
Gemini 3.8 Live 在用户中显示出较高偏好,在 Speech Agent Arena 中获得第二名。除了这一表现外,它仍然非常具备成本效益——为开发者和企业提供了一个为规模化而构建、能力强且高效的模型。
在 ServiceNow 的 EVA-Bench 上——这是一个用于评估语音代理的基准测试——我们的模型通过成功平衡准确性与对话质量,推动了复杂工作流的帕累托前沿。
注:这是在 Gemini Enterprise Agent Platform 上通过 Live API 运行的。
Gemini 3.8 Live 以近实时方式处理视觉输入,用上下文丰富对话,从而提供更有帮助的回复。它会在对话过程中自动检测并在 97 种受支持语言之间切换。它会在后台执行工具和 API 调用,同时继续对话,因此模型可以确认请求,并在任务于后台完成时继续聊天。
对于需要更深入推理的任务,3.8 Live Extended Thinking 会同时进行推理和说话。它在保持不间断对话流的同时,为复杂工作流提供更高智能——使用类似 “让我查一下……” 这样的早期口头提示来自然确认提示,并通过实时进度讲述,在多步后台任务推进时引导用户了解进展。
在 Google Workspace、搜索和 Gemini 应用中,我们的 Live 模型带来更直观、更具协作性的体验——尤其是在处理你最复杂的任务时。
赋能开发者和企业语音生态系统
通过使用 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台,使开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在幕后管理复杂的实时媒体流基础设施,让开发者可以完全专注于打造用户体验。
我们还在与 Salesforce、Genspark 和 Lumeris 等公司合作,它们对 3.8 Live 和 3.8 Live Extended Thinking 感到兴奋,并重点提及了其令人印象深刻的延迟、流畅性和工具调用能力。
通过 SynthID 水印确保透明度
我们的 AI 产品生成的所有音频都带有 SynthID 水印。这种不可察觉的水印会直接嵌入音频输出中,确保 AI 生成内容仍可被检测到,以帮助防止错误信息传播。有关我们安全与责任方法的详细信息,请查看模型卡。
开始使用我们最新的 Gemini Audio 模型:
3.8 Live 从今天开始推出:
- 面向开发者:在 Gemini API 和 Google AI Studio 中
- 面向企业:在 Gemini Enterprise 中进行私密预览,并即将登陆 Gemini Enterprise for Customer Experience
- 面向所有人:在 Search Live 中
3.8 Live Extended Thinking 从今天开始推出:
- 面向开发者:在 Gemini API 和 Google AI Studio 中
- 面向企业:在 Gemini Enterprise 中进行私密预览,并即将面向 Gemini Enterprise for Customer Experience 和 Google Workspace 企业客户推出
- 面向所有人:在 Gemini Live 中,以及面向 Workspace 中 Docs 里的 Google AI Pro 和 Ultra 订阅者,并面向 Gmail 和 Keep 中的所有 Google AI 订阅者
在您的收件箱中获取 Google 的最新消息
订阅我们的新闻简报,获取产品更新、活动信息、特别优惠等内容。
您的信息将根据 Google 的隐私政策使用。您可以随时选择退出。
来源:Google DeepMind · deepmind.google