用 Amazon Bedrock AgentCore、Managed Knowledge Base 和 Nova Sonic 构建语音旅行礼宾
AWS Machine Learning Blog 展示如何在航空应用中用 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 和 Amazon Bedrock Knowledge Bases 构建语音旅行礼宾。方案通过 MCP 连接后端工具,支持查询行程、改座位、更新餐食偏好、回答政策问题,并可转接真人客服。
AWS Machine Learning Blog 展示如何在航空应用中用 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 和 Amazon Bedrock Knowledge Bases 构建语音旅行礼宾。方案通过 MCP 连接后端工具,支持查询行程、改座位、更新餐食偏好、回答政策问题,并可转接真人客服。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估开源多语言 TTS 和语音克隆模型,覆盖可懂度、速度和说话人相似度。评测使用 WER/CER、H200 GPU 上的 RTFx、H200 GPU 和 CPU 上的 TTFA,以及 WavLM 嵌入向量 SIM,可将模型评估从数周缩短到数小时。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为 Gemini 的对话 AI 带来近实时视觉形象,并已在 Gemini Enterprise 提供。
推荐理由:原文给出实时视频形象、多语言同步和异步工具调用,便于评估企业对话智能体的交互变化。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两个文本转语音模型,用于生成更具表现力的音频。
推荐理由:原文列出语音定制、复刻、安全标识和开放渠道,便于判断新 TTS 模型的应用边界。
Google DeepMind 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,用于近实时推理、语音智能体和更自然的 AI 对话。
推荐理由:原文同时给出语音模型能力、评测结果和开放入口,便于判断其在语音智能体中的适用场景。