跳到正文
Google DeepMind·· 23 天前精选AI 评分86

Google DeepMind 推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking

Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking

AI 导读

Google DeepMind 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,用于近实时推理、语音智能体和更自然的 AI 对话。

推荐理由

原文同时给出语音模型能力、评测结果和开放入口,便于判断其在语音智能体中的适用场景。

正文 · AI 翻译

2026 年 9 月 15 日

|

Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 是我们迄今最先进的实时对话模型。智能和并行推理方面的重大升级,使它们在协作以及使用语音执行复杂任务时更加直观。


Tom Ouyang

首席工程师

Malini Jaganathan

技术人员,代表 Gemini Audio 团队


Text "Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking" with the Gemini Spark, all on a light blue background

你的浏览器不支持 audio 元素。

收听文章

[[duration]] 分钟

此内容由 Google AI 生成。生成式 AI 仍处于实验阶段

更新于 2026 年 9 月 17 日

今天,我们推出两款新模型,将近实时推理方面的进展带来给语音代理,从而更有效地支持语音代理,并让与 AI 对话感觉更直观、更智能。

  • Gemini 3.8 Live:为规模化和成本效率而构建,将对话智能与流畅对话和视觉定位相结合。
  • Gemini 3.8 Live Extended Thinking:为高复杂度任务而构建,具备更高智能和多步推理能力。

对于开发者和企业而言,这些模型为可靠、可投入生产的语音代理提供了构建模块。它们还让用户在 Gemini 应用、Google Workspace 和搜索中与 Gemini 对话更加流畅、更具协作性——帮助你只用语音就能处理复杂任务。

体验更流畅、更智能的对话

Gemini 3.8 Live Extended Thinking 提供企业级任务完成能力和智能,在 Artificial Analysis 的 Speech to Speech Quality Index(82.6)中取得总体第 1 名,并在代理式任务完成方面领先,在 τ-Voice 上达到 68.6%,在 Sierra 的 τ-Voice-banking 基准测试上达到 35.1%。它还提供强大的推理能力,在 Big Bench Audio 上得分 97.7%,同时相较其他前沿模型保持极具竞争力的价格点。

Gemini 3.8 Live 在用户中显示出较高偏好,在 Speech Agent Arena 中获得第二名。除了这一表现外,它仍然非常具备成本效益——为开发者和企业提供了一个为规模化而构建、能力强且高效的模型。

a chart showing Artificial Analysis Speech to Speech Index

A chart showing Artificial Analysis agentic performance

A chart showing Sierra

A chart showing Artificial Analysis cost per hour of input audio

在 ServiceNow 的 EVA-Bench 上——这是一个用于评估语音代理的基准测试——我们的模型通过成功平衡准确性与对话质量,推动了复杂工作流的帕累托前沿。

注:这是在 Gemini Enterprise Agent Platform 上通过 Live API 运行的。

A chart showing EVA Bench Experience to Task Completion

Gemini 3.8 Live 以近实时方式处理视觉输入,用上下文丰富对话,从而提供更有帮助的回复。它会在对话过程中自动检测并在 97 种受支持语言之间切换。它会在后台执行工具和 API 调用,同时继续对话,因此模型可以确认请求,并在任务于后台完成时继续聊天。

对于需要更深入推理的任务,3.8 Live Extended Thinking 会同时进行推理和说话。它在保持不间断对话流的同时,为复杂工作流提供更高智能——使用类似 “让我查一下……” 这样的早期口头提示来自然确认提示,并通过实时进度讲述,在多步后台任务推进时引导用户了解进展。

在 Google Workspace、搜索和 Gemini 应用中,我们的 Live 模型带来更直观、更具协作性的体验——尤其是在处理你最复杂的任务时。

赋能开发者和企业语音生态系统

通过使用 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台,使开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在幕后管理复杂的实时媒体流基础设施,让开发者可以完全专注于打造用户体验。

我们还在与 Salesforce、Genspark 和 Lumeris 等公司合作,它们对 3.8 Live 和 3.8 Live Extended Thinking 感到兴奋,并重点提及了其令人印象深刻的延迟、流畅性和工具调用能力。

Salesforce quote

11Sight Quote

Equal AI Quote

ServiceNow quote

Genspark quote

Lenskart quote

Lumeris quote

Agora quote

Ambr AI quote

LiveKit Quote

Casuu quote

通过 SynthID 水印确保透明度

我们的 AI 产品生成的所有音频都带有 SynthID 水印。这种不可察觉的水印会直接嵌入音频输出中,确保 AI 生成内容仍可被检测到,以帮助防止错误信息传播。有关我们安全与责任方法的详细信息,请查看模型卡。

开始使用我们最新的 Gemini Audio 模型:

3.8 Live 从今天开始推出:

3.8 Live Extended Thinking 从今天开始推出:

在您的收件箱中获取 Google 的最新消息

订阅我们的新闻简报,获取产品更新、活动信息、特别优惠等内容。

您的信息将根据 Google 的隐私政策使用。您可以随时选择退出。

来源:Google DeepMind · deepmind.google