用 Amazon Bedrock AgentCore、Managed Knowledge Base 和 Nova Sonic 构建语音旅行礼宾
AWS Machine Learning Blog 展示如何在航空应用中用 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 和 Amazon Bedrock Knowledge Bases 构建语音旅行礼宾。方案通过 MCP 连接后端工具,支持查询行程、改座位、更新餐食偏好、回答政策问题,并可转接真人客服。
AWS Machine Learning Blog 展示如何在航空应用中用 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 和 Amazon Bedrock Knowledge Bases 构建语音旅行礼宾。方案通过 MCP 连接后端工具,支持查询行程、改座位、更新餐食偏好、回答政策问题,并可转接真人客服。
NVIDIA 与 Microsoft 在旧金山活动上介绍了面向 Windows PC 的本地 AI Agent 方案,包括 RTX Spark 设备预订和 Microsoft Execution Containers 正式可用。
推荐理由:原文给出 Windows 本地智能体的硬件配置和系统基础设施,便于判断端侧 AI 工作流变化。
Microsoft Research Asia 发布并开源 Agent Lightning v1.0,一个约 3,500 行代码的轻量级 Agentic RL 框架,用于在真实 agent harness 中训练智能体。
推荐理由:原文展示了用真实 agent harness 参与 RL 训练的设计,可作为编码智能体训练流程的工程参考。
AWS Machine Learning Blog 介绍了一个用于构建智能体自动化商业论证的 Agentic Value Model,主张传统 RPA 时代的 ROI 模型会漏算异常处理、决策质量和维护经济性等价值。
Qlik 基于 Amazon Bedrock 构建 Qlik Answers,为员工提供带来源的自然语言问答,并支持企业级部署。
AWS Machine Learning Blog 演示了如何用 AWS Lambda Durable Functions、Amazon EventBridge 和 Amazon Bedrock,在 AWS DevOps Agent 完成事件调查后创建自动化修复工作流。
AWS Machine Learning Blog 提出一个为期六周的 AI 构建能力项目,帮助非工程岗位从讨论 AI 转向动手构建。项目参与者每周约投入四小时,结合导师和生产级工具;一支四人团队最终做出 WealthWise 多智能体金融顾问原型,使用 Amazon Nova、Strands Agents SDK 和 DynamoDB,实现复杂金融推理 sub-5-second 响应。
Cornerstone OnDemand 构建了 Orion AI 多智能体系统,用 Amazon Bedrock 和 AWS 开源的 Strands Agents 将数据库诊断从 45 分钟降至 10 分钟,缩短 78%。
AWS Machine Learning Blog 介绍了在 Amazon Bedrock AgentCore runtime 和 OpenClaw 上构建上下文感知个人助手的方法。
推荐理由:文章把记忆命名空间、模型路由和提示词缓存串成可复用架构,便于迁移到其他个人助理场景。
Microsoft Research 访谈 Jennifer Neville,讨论评估如何推动 AI 系统性能边界,并揭示传统 benchmark 之外的“意外失败”。Neville 研究交互式领域与结构化数据中的机器学习和 AI,已发表 130 多篇论文、获 10,000 多次引用,并分享当前 AI 系统使用建议。
Mistral AI 发布 Mistral Large 4 公共预览版,这是一个 1 trillion-parameter 原生多模态模型,拥有 52 billion active parameters,可在 Mistral Studio 试用 preview API,并计划在本月底发布权重。
推荐理由:原文披露了参数规模、开放权重计划和多项基准结果,可用于比较欧洲开放权重模型的能力定位。
OpenAI 与 Ironclad 正在训练和评估 AI 智能体处理复杂合同工作流,以推进专业工作中的 computer use。该合作聚焦 AI 智能体在合同场景中的训练与评估。
Google Research 分享 workshop report《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》,讨论自主智能体面临的隐私与安全基础挑战。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,现已可通过 ReviewBench 网站使用。
推荐理由:原文公开了数据集、评分方法和提交流程,可用于比较代码审查智能体的取舍。
Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用 AI 智能体留下的数据库终态与副作用评估任务是否完成,而不是只看回复或工具调用。
推荐理由:文章把单次成功与连续可靠性分开评估,可帮助判断智能体接入真实业务记录时的风险。
GitHub Blog 提出,开发者应强化三项 AI 时代技能:指挥 AI agents、审查 AI 首次输出、把节省的实现时间用于更大问题。文章建议用第二个 AI model 批判第一个模型的方案,并提到 GitHub Copilot 的 Rubber Duck agent 会用第二个模型审查计划、代码和测试。
NVIDIA DGX Spark 64GB 配置将于 10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 发售,起价 $4,999。
ServiceNow CoreAI 构建 AutoSynthData,用目标模型失败和更强教师模型成功案例生成企业智能体训练任务。它将任务抽象为 system specification、user prompt、verifier,并要求任务可行、真实、能暴露当前模型弱点;在 EnterpriseOps Gym 实验中,流程会验证任务并随模型改进调整课程。
Microsoft Research 开发机器学习管线,利用预报时太阳风信息为美国本土 66,935 个变电站生成位置级空间天气风险估计。系统结合 AE、Dst 预测与纬度、地质、地面电导率等特征,可在风险出现前 30-60 分钟预警。2020-2026 评估中,系统对 major、severe、extreme 事件检测率分别为 76.5%、81.2%、64.1%。
Hugging Face Blog 介绍论文 ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents,提出在 MCP Agent 生成后按 claim 检查事实是否由正确来源支持。
Microsoft Research Asia – Singapore 开设一年来,已扩大团队、深化本地合作,并围绕前沿 AI 的现实应用推进研究。其实验室聚焦下一代 AI 模型与智能体系统、面向行业的 AI、AI-native 研究实践、生态与人才发展,已在医疗、金融、教育和技术等领域开展合作。Microsoft 称该实验室连接其前沿 AI 研究与新加坡高校、政府和产业生态。
H Company 发布 Holo4 系列智能体模型,包括 Holo4-27B dense、Holo4-35B-A3B Mixture of Experts,并更新 Holotron4 Nano。
推荐理由:原文披露了跨 GUI、代码、MCP 和 API 的训练与评测细节,可用于比较通用计算机使用智能体的成本与能力。
GitHub Blog 介绍了 GitHub Copilot app 中用 canvases 构建自定义工作流的方法。用户可在智能体会话中输入 /create-canvas,并用自然语言说明工作流、界面操作和智能体可执行动作,生成共享界面;canvas 可作为扩展保存、复用或与团队共享,也可从 Awesome Copilot 安装现成 canvas extensions 后再定制。
GitHub Blog 介绍 GitHub Copilot app 的 canvas,认为许多 AI 任务不应只依赖 chat 作为交互界面。canvas 是运行在 GitHub Copilot app 内的小型全栈应用,可与 GitHub Copilot agent 双向通信,也能调用第三方 API 或在本机执行代码。
推荐理由:文章用 GitHub Copilot canvases 示例说明,任务型自定义 UI 可减少把 Agent 当工具本身的 token 消耗。
Google Research 介绍了一套用于连贯长视频生成的研究框架,以 AI video co-director 统一协调 Gemini 和 Veo 上的多智能体视频叙事流程。
推荐理由:文章将长视频一致性拆成规划、记忆与闭环优化问题,可为多镜头生成工作流提供结构化参考。
GitHub Security Lab 介绍了 Fuzzing Taskflow,这是一个面向 C/C++ 项目的自主 fuzzing 流水线,基于 GitHub Security Lab Taskflow Agent 构建。
推荐理由:文章拆解了 LLM agent 接管 fuzzing 覆盖改进和崩溃分诊的流程,对安全自动化工作流有参考价值。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为 Gemini 的对话 AI 带来近实时视觉形象,并已在 Gemini Enterprise 提供。
推荐理由:原文给出实时视频形象、多语言同步和异步工具调用,便于评估企业对话智能体的交互变化。
GitHub Podcast 讨论多项 AI 开发热点:AI 生成代码仍需审查,RAG 没有消亡,Skills 也没有取代 MCP。文章认为开发者的关键能力是判断风险、解释 AI 使用方式,并把 agents、Skills、MCP 与 RAG 作为可组合的工作流组件。
Google Research 分享一项研究实验,允许教育者创建定制、交互式、带引导的教育模拟,利用为学习优化的 generative user interfaces(GenUI)动态生成学习交互内容。
Mistral AI 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 迁移到 C++,对象是一个物理密集型油藏模拟器,原项目没有测试套件和集中化文档。
推荐理由:案例给出从校验基准到人机协作流程的迁移路径,可迁移到复杂遗留系统改造。
Mistral AI 推出 Agentic Search,这是一个检索层,可让 AI 系统在复杂文档和数据源中搜索、导航、阅读并验证信息。它通过 Mistral Search Toolkit 和 Libraries 提供,使用 search、open、navigate、read、grep 五个工具,并内置于 Studio 和 Vibe。
推荐理由:原文给出工具接口、适用场景和基准数据,可用于比较 Agentic Search 与传统 RAG 的取舍。
Berkeley AI Research 提出 ABBEL,将长程交互历史压缩为自然语言 belief states,并用 belief grading 监督摘要信息内容。在 CollabBench 协作编码中,ABBEL-rec-BG 将与 Full Context 的性能差距缩小约 50%,训练步数从 100 降至 50,Peak Tokens 为 6.01±0.33×10²。
Berkeley AI Research 发表观点文章,认为 AI 推理成本快速下降正在带来近乎免费的智能,并将改变数据系统面向 Agent 的设计。
推荐理由:文章把推理成本下降与数据系统研究议题相连,提供了面向 Agent 工作负载的系统设计框架。
BAIR 庆祝 2026 届 Ph.D. 毕业生,他们的研究覆盖机器人与具身智能、LLM 与推理、计算机视觉、生成建模、AI 安全、人机交互、AI for science and healthcare 等领域。毕业生将前往高校任教或从事博士后研究、加入产业研究实验室,或创办自己的初创公司。