用 Amazon Bedrock AgentCore、Managed Knowledge Base 和 Nova Sonic 构建语音旅行礼宾
AWS Machine Learning Blog 展示如何在航空应用中用 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 和 Amazon Bedrock Knowledge Bases 构建语音旅行礼宾。方案通过 MCP 连接后端工具,支持查询行程、改座位、更新餐食偏好、回答政策问题,并可转接真人客服。
AWS Machine Learning Blog 展示如何在航空应用中用 Amazon Bedrock AgentCore、Amazon Nova 2.5 Sonic 和 Amazon Bedrock Knowledge Bases 构建语音旅行礼宾。方案通过 MCP 连接后端工具,支持查询行程、改座位、更新餐食偏好、回答政策问题,并可转接真人客服。
Amazon SageMaker Studio 现可直接在 HyperPod EKS 集群上创建和管理 SageMaker Spaces。数据科学家可在浏览器中创建、配置、启动、停止并打开 JupyterLab 或 Code Editor,无需 HyperPod CLI 或 kubectl;Space 冷启动通常需几分钟,启用 over-provisioning 约 30–40 秒。
AWS 介绍如何通过 Amazon SageMaker Unified Studio 管理 SageMaker HyperPod,同时保留底层治理控制。文章将控制分为组织、项目、集群和工作负载 4 层,涵盖身份、容量、可观测性、RBAC、EKS Pod Identity、Slurm、配额、优先级、借用和抢占等策略。
AWS 说明如何用 ISO/IEC 42005:2025 将 AI 系统影响评估纳入企业 AI 治理和风险管理流程。该标准覆盖评估内容、执行时机、文档记录、监测复核,并在 Annex D、Annex E 提供集成流程和独立模板。AWS 还提供 ISO/IEC 42001:2023 AIMS 实施指南和 Responsible AI Lens 等配套工具。
Google Research 介绍了一项关于 AI 辅助对专利律师专业能力影响的三个月现场实验,研究对象为 11 家知识产权律所的 133 名律师。实验随机开放当时未发布、现已属于 Gemini Notebook 的 Google Labs AI 专利写作助手,结果显示 AI 在 10 天和 90 天的起草任务中分别将评分提高 0.34 SD 和 0.38 SD。
推荐理由:这项现场实验区分了 AI 辅助产出与无辅助判断,提供了观察专业技能迁移的具体设计。
AWS 宣布 Claude Haiku 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上可用。Anthropic 称该模型是 Claude 5.5 系列中最快、最高效的模型,面向 subagents 和高容量、成本敏感型工作,多数任务成本比 Claude Haiku 4.5 低约 75%。
推荐理由:原文说明了 Haiku 5.5 在 Bedrock 的可用方式和成本定位,便于评估其在高频子任务中的适配度。
NVIDIA 与 Microsoft 在旧金山活动上介绍了面向 Windows PC 的本地 AI Agent 方案,包括 RTX Spark 设备预订和 Microsoft Execution Containers 正式可用。
推荐理由:原文给出 Windows 本地智能体的硬件配置和系统基础设施,便于判断端侧 AI 工作流变化。
Amazon Quick 和 Amazon Bedrock Knowledge Bases 通过查询时实时 ACL 校验,让 RAG 生成回答遵守企业知识源权限。
GitHub 介绍了与 Microsoft Applied Sciences 构建的微调 ModernBERT 分类器,用于把 push protection 扩展到非结构化密钥。
推荐理由:原文结合九个季度数据与新分类器细节,说明 GitHub 如何把密钥防护前移到代码推送链路。
AOL 账号被锁定通常与多次输错密码、异常登录、安全验证或恢复信息过期有关,并不一定代表账号永久关闭。用户应确认用户名、使用最新密码,无法登录时通过 AOL 官方密码重置或账号恢复流程处理,避免反复猜测密码或泄露验证码。
Microsoft Research Asia 发布并开源 Agent Lightning v1.0,一个约 3,500 行代码的轻量级 Agentic RL 框架,用于在真实 agent harness 中训练智能体。
推荐理由:原文展示了用真实 agent harness 参与 RL 训练的设计,可作为编码智能体训练流程的工程参考。
AWS Machine Learning Blog 介绍了一个用于构建智能体自动化商业论证的 Agentic Value Model,主张传统 RPA 时代的 ROI 模型会漏算异常处理、决策质量和维护经济性等价值。
Qlik 基于 Amazon Bedrock 构建 Qlik Answers,为员工提供带来源的自然语言问答,并支持企业级部署。
AWS Machine Learning Blog 演示了如何用 AWS Lambda Durable Functions、Amazon EventBridge 和 Amazon Bedrock,在 AWS DevOps Agent 完成事件调查后创建自动化修复工作流。
AWS Machine Learning Blog 提出一个为期六周的 AI 构建能力项目,帮助非工程岗位从讨论 AI 转向动手构建。项目参与者每周约投入四小时,结合导师和生产级工具;一支四人团队最终做出 WealthWise 多智能体金融顾问原型,使用 Amazon Nova、Strands Agents SDK 和 DynamoDB,实现复杂金融推理 sub-5-second 响应。
Cornerstone OnDemand 构建了 Orion AI 多智能体系统,用 Amazon Bedrock 和 AWS 开源的 Strands Agents 将数据库诊断从 45 分钟降至 10 分钟,缩短 78%。
Hugging Face 介绍 Nemotron 团队从 Nemotron 3 出发,通过 SFT、RL 和反馈驱动推理,在 IOI 2026 与 IMO 2026 达到金牌水平。
推荐理由:文章同时给出训练数据、推理流程和开源入口,可参考其将基础模型专门化到竞赛任务的方法。
OpenAI 将在 ChatGPT for Teens 中推出 College Planner,帮助学生管理大学申请。新功能还包括 flashcards、quizzes,并将设立 teen AI council,让青少年参与塑造 AI 未来。
Radisson 与 Accenture 合作,使用 OpenAI 技术构建 ChatGPT plugin,帮助旅行者在规划行程时查找、比较并预订酒店。
OpenAI 宣布 GPT‑6 正在 ChatGPT 中全球推出,并配套 Intelligent UI。该更新称可提供更快响应,带来可直接探索和使用的视觉与交互体验。
推荐理由:原文说明了 GPT-6 在 ChatGPT 的全球上线形态,并点出可交互视觉体验这一使用变化。
Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间。该模型基于 Gemma 4 架构,采用 Apache 2.0 许可,拥有 740 million 参数,支持 8K token 上下文窗口,并可通过 MRL 将输出向量从 768 维截断到 512、256 或 128 维。
推荐理由:原文给出参数规模、上下文窗口和端侧内存数据,可用于评估多模态嵌入在本地检索场景中的适配性。
AWS Machine Learning Blog 介绍了在 Amazon Bedrock AgentCore runtime 和 OpenClaw 上构建上下文感知个人助手的方法。
推荐理由:文章把记忆命名空间、模型路由和提示词缓存串成可复用架构,便于迁移到其他个人助理场景。
Microsoft Research 访谈 Jennifer Neville,讨论评估如何推动 AI 系统性能边界,并揭示传统 benchmark 之外的“意外失败”。Neville 研究交互式领域与结构化数据中的机器学习和 AI,已发表 130 多篇论文、获 10,000 多次引用,并分享当前 AI 系统使用建议。
Atlassian 与 OpenAI 扩大合作,将前沿模型与企业知识连接起来,帮助团队规划、构建并交付工作。
Google Research 介绍了 Earth AI 的 Population Dynamics Foundation Model(PDFM)如何把地理空间嵌入接入公共卫生和流行病学工作流。
推荐理由:原文用五类公共卫生案例展示地理空间嵌入接入现有流行病学流程的效果。
NVIDIA 称电信运营商正把 AI 战略转向开放模型,以获得更高的信任、控制和定制能力,覆盖自主网络到客户服务等关键工作负载。其 State of AI in Telecommunications 报告显示,89% 受访者认为开源模型和软件对公司 AI 战略重要。
Mistral AI 发布 Mistral Large 4 公共预览版,这是一个 1 trillion-parameter 原生多模态模型,拥有 52 billion active parameters,可在 Mistral Studio 试用 preview API,并计划在本月底发布权重。
推荐理由:原文披露了参数规模、开放权重计划和多项基准结果,可用于比较欧洲开放权重模型的能力定位。
Jump Trading 使用 OpenAI 扩大量化研究,将更长时间运行的 AI 工作流与多种数据源和人工审核结合。OpenAI News 称其展示了 ChatGPT 在量化研究流程中的应用方式。
OpenAI 公布了一个内部前沿模型在数学开放问题上的新结果。OpenAI 还在 GitHub 分享了 Lean 证明形式化内容和研究细节。
OpenAI 与 Ironclad 正在训练和评估 AI 智能体处理复杂合同工作流,以推进专业工作中的 computer use。该合作聚焦 AI 智能体在合同场景中的训练与评估。
Google Research 分享 workshop report《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》,讨论自主智能体面临的隐私与安全基础挑战。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,现已可通过 ReviewBench 网站使用。
推荐理由:原文公开了数据集、评分方法和提交流程,可用于比较代码审查智能体的取舍。
OpenAI 说明其在欧盟规则下处理文本水印的做法,涵盖水印适用范围、检测方式以及访问安排。相关检测访问将从研究人员开始,以支持文本溯源规则下的研究与验证。
NVIDIA Inception 项目中的多家初创公司正用 AI 支持乳腺癌影像筛查、风险评估和治疗规划。iSono Health 的 FDA-cleared ATUSA 可在约 2 分钟完成单侧乳腺 3D 超声扫描,速度快于最高 45 分钟的传统手持超声,并称敏感性高 28%。
Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用 AI 智能体留下的数据库终态与副作用评估任务是否完成,而不是只看回复或工具调用。
推荐理由:文章把单次成功与连续可靠性分开评估,可帮助判断智能体接入真实业务记录时的风险。
Asta 开源了 AstaBrief 8B,这是一个将研究问题和检索到的文献摘录转成带引用报告的开放权重模型。它已作为 Asta Generate a report 功能中的 Fast mode 提供,并与 Claude 驱动的 Thinking mode 并列;Asta 还开源训练数据,并发布可用自有 PDFs 生成报告的示例 workflow。
推荐理由:文章披露了训练数据筛选、DPO 构造和速度对比,适合参考科学报告生成模型的工程取舍。
GitHub Blog 提出,开发者应强化三项 AI 时代技能:指挥 AI agents、审查 AI 首次输出、把节省的实现时间用于更大问题。文章建议用第二个 AI model 批判第一个模型的方案,并提到 GitHub Copilot 的 Rubber Duck agent 会用第二个模型审查计划、代码和测试。
Google Research 宣布新一代基于 Trusted Execution Environments 的联邦学习系统,用于提供可验证、可审计的数据匿名化保证。
NVIDIA DGX Spark 64GB 配置将于 10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 发售,起价 $4,999。
ServiceNow CoreAI 构建 AutoSynthData,用目标模型失败和更强教师模型成功案例生成企业智能体训练任务。它将任务抽象为 system specification、user prompt、verifier,并要求任务可行、真实、能暴露当前模型弱点;在 EnterpriseOps Gym 实验中,流程会验证任务并随模型改进调整课程。