Google DeepMind 推出 Gemini 3.8 Live with Live Avatar
Introducing Gemini 3.8 Live with Live Avatar
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为 Gemini 的对话 AI 带来近实时视觉形象,并已在 Gemini Enterprise 提供。
原文给出实时视频形象、多语言同步和异步工具调用,便于评估企业对话智能体的交互变化。
2026 年 9 月 24 日
|
搭载 Live Avatar 的 Gemini 3.8 Live 为 Gemini 的对话式 AI 带来实时视觉呈现。通过将我们的实时对话能力与低延迟流式视频原生结合,Live Avatar 为企业及其用户提供更自然、更直观的对话体验。
Shuo-yiin Chang
研究科学家
CJ Zheng
软件工程师,代表 Gemini Audio Team
继上周 Gemini 3.8 Live 发布后,今天我们很高兴推出搭载 Live Avatar 的 Gemini 3.8 Live——为我们的原生实时对话模型带来近乎实时的视觉呈现。通过将近乎实时的视频生成与语音相结合,Live Avatar 功能打造出一种能够聆听、观看并以动态视觉形象说话的体验。
凭借精准的唇形同步、自然的表情和流畅的轮次交替,Live Avatar 使企业能够以更具互动性的方式扩展其虚拟服务。无论是提供引人入胜的客户服务,还是交付交互式演示,它都能将数字交流转化为更丰富、更易于访问的体验。
从今天开始,搭载 Live Avatar 的 Gemini 3.8 Live 已在 Gemini Enterprise 中推出。
了解搭载 Live Avatar 的 Gemini 3.8 Live 如何支持多种角色,每个角色都拥有独特的外观、声音和富有表现力的呈现。
更自然的多模态对话
对话本质上是多模态的:我们通过倾听、观察、说话和使用面部表情来交流。Live Avatar 将这些能力带给企业智能体。通过同时处理视觉和音频输入,它能够生成更丰富的对话,带来更全面的体验。
观看搭载 Live Avatar 的 Gemini 3.8 Live 如何近乎实时地接收所见所闻,并以富有表现力的音频和视频作出回应,从而实现更自然的对话。
具备持续呈现的异步工具执行
除了视觉呈现之外,该功能还由 Gemini 的高级推理能力提供支持。借助异步工具调用,Live Avatar 可以在持续进行主动对话的同时,在后台触发工具调用并获取数据,从而处理复杂任务并确保对话流程不中断。
了解搭载 Live Avatar 的 Gemini 3.8 Live 如何处理复杂任务,例如为酒店客人办理入住。在对话持续不中断的同时,在后台调用工具。
为全球规模打造的对话体验
对话呈现应当感觉自然,并且不应受语言限制。Live Avatar 具备原生多语言语音到语音同步能力。该功能会动态调整唇形同步和表情,并可在 97 种语言之间无缝切换,而不会降低视频保真度或引入视觉漂移。
观看 Gemini 3.8 Live Avatar 如何在对话中途切换语言,唇形同步和表情可在 97 种语言之间无缝适配。
适合你品牌需求的 Live Avatar
组织通常需要独特的视觉身份来契合其品牌。除了多样化预设头像库之外,组织还可以自定义自己的 Live Avatar。开发者可以从一张高质量参考图像生成一个完全动画化、响应灵敏的头像,同时保留参考相似度、品牌风格或角色身份。自定义头像创建目前仅通过企业许可名单提供。
以信任和透明为核心
我们构建 Live Avatar 时采用了严格的安全防护措施,旨在尊重身份,并保持 AI 生成内容的透明度。我们 AI 产品生成的所有输出都带有 SynthID 水印。这种不可感知的水印直接嵌入到音频和视频输出中,有助于确保 AI 生成内容保持可检测,从而帮助最大限度减少错误信息和错误归因。要了解我们在安全和负责任部署方面的全面方法,请阅读我们的模型卡。
开始使用搭载 Live Avatar 的 Gemini 3.8 Live
搭载 Live Avatar 的 Gemini 3.8 Live 已在 Gemini Enterprise 中提供。浏览 API 文档以开始使用。
来源:Google DeepMind · deepmind.google