跳到正文
  1. Microsoft Research76

    Microsoft Research 发布 Agent Lightning v1.0 轻量级 Agentic RL 框架

    Microsoft Research Asia 发布并开源 Agent Lightning v1.0,一个约 3,500 行代码的轻量级 Agentic RL 框架,用于在真实 agent harness 中训练智能体。

    推荐理由:原文展示了用真实 agent harness 参与 RL 训练的设计,可作为编码智能体训练流程的工程参考。

  1. AWS Machine Learning Blog62

    AWS 介绍如何在 AgentCore 和 OpenClaw 上构建上下文感知 AI 助手

    AWS Machine Learning Blog 介绍了在 Amazon Bedrock AgentCore runtime 和 OpenClaw 上构建上下文感知个人助手的方法。

    推荐理由:文章把记忆命名空间、模型路由和提示词缓存串成可复用架构,便于迁移到其他个人助理场景。

  1. Mistral AI84

    Mistral AI 发布 Mistral Large 4 公共预览版

    Mistral AI 发布 Mistral Large 4 公共预览版,这是一个 1 trillion-parameter 原生多模态模型,拥有 52 billion active parameters,可在 Mistral Studio 试用 preview API,并计划在本月底发布权重。

    推荐理由:原文披露了参数规模、开放权重计划和多项基准结果,可用于比较欧洲开放权重模型的能力定位。

  1. GitHub Blog · AI & ML62

    GitHub 发布 AI 代码审查开放基准 ReviewBench

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,现已可通过 ReviewBench 网站使用。

    推荐理由:原文公开了数据集、评分方法和提交流程,可用于比较代码审查智能体的取舍。

  1. Hugging Face Blog76

    Microsoft 与 Hugging Face 发布 ThinkingBox,用后端状态评估 AI 智能体可靠性

    Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用 AI 智能体留下的数据库终态与副作用评估任务是否完成,而不是只看回复或工具调用。

    推荐理由:文章把单次成功与连续可靠性分开评估,可帮助判断智能体接入真实业务记录时的风险。

  1. Hugging Face Blog82

    Holo4 系列智能体模型发布,支持 GUI、代码、MCP 和 API

    H Company 发布 Holo4 系列智能体模型,包括 Holo4-27B dense、Holo4-35B-A3B Mixture of Experts,并更新 Holotron4 Nano。

    推荐理由:原文披露了跨 GUI、代码、MCP 和 API 的训练与评测细节,可用于比较通用计算机使用智能体的成本与能力。

  1. GitHub Blog · AI & ML65

    GitHub Copilot 解释为什么 chat 常常不是合适的 UI

    GitHub Blog 介绍 GitHub Copilot app 的 canvas,认为许多 AI 任务不应只依赖 chat 作为交互界面。canvas 是运行在 GitHub Copilot app 内的小型全栈应用,可与 GitHub Copilot agent 双向通信,也能调用第三方 API 或在本机执行代码。

    推荐理由:文章用 GitHub Copilot canvases 示例说明,任务型自定义 UI 可减少把 Agent 当工具本身的 token 消耗。

  2. Google Research71

    Google Research 提出用于连贯长视频生成的 AI video co-director 框架

    Google Research 介绍了一套用于连贯长视频生成的研究框架,以 AI video co-director 统一协调 Gemini 和 Veo 上的多智能体视频叙事流程。

    推荐理由:文章将长视频一致性拆成规划、记忆与闭环优化问题,可为多镜头生成工作流提供结构化参考。

  3. GitHub Blog · AI & ML65

    GitHub Security Lab 推出用于 AI 驱动 fuzzing 的 Taskflow Agent 流水线

    GitHub Security Lab 介绍了 Fuzzing Taskflow,这是一个面向 C/C++ 项目的自主 fuzzing 流水线,基于 GitHub Security Lab Taskflow Agent 构建。

    推荐理由:文章拆解了 LLM agent 接管 fuzzing 覆盖改进和崩溃分诊的流程,对安全自动化工作流有参考价值。

  4. Google DeepMind73

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,为 Gemini 的对话 AI 带来近实时视觉形象,并已在 Gemini Enterprise 提供。

    推荐理由:原文给出实时视频形象、多语言同步和异步工具调用,便于评估企业对话智能体的交互变化。

  1. Mistral AI68

    Mistral AI 用 AI agents 迁移 40,000 行 Fortran 77 遗留代码

    Mistral AI 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 迁移到 C++,对象是一个物理密集型油藏模拟器,原项目没有测试套件和集中化文档。

    推荐理由:案例给出从校验基准到人机协作流程的迁移路径,可迁移到复杂遗留系统改造。

  1. Mistral AI71

    Mistral AI 推出 Agentic Search,用于提升企业 AI 系统检索准确性与效率

    Mistral AI 推出 Agentic Search,这是一个检索层,可让 AI 系统在复杂文档和数据源中搜索、导航、阅读并验证信息。它通过 Mistral Search Toolkit 和 Libraries 提供,使用 search、open、navigate、read、grep 五个工具,并内置于 Studio 和 Vibe。

    推荐理由:原文给出工具接口、适用场景和基准数据,可用于比较 Agentic Search 与传统 RAG 的取舍。

  1. Berkeley AI Research60

    Berkeley AI Research 讨论近乎免费智能时代的 Agent 数据系统

    Berkeley AI Research 发表观点文章,认为 AI 推理成本快速下降正在带来近乎免费的智能,并将改变数据系统面向 Agent 的设计。

    推荐理由:文章把推理成本下降与数据系统研究议题相连,提供了面向 Agent 工作负载的系统设计框架。

已经到底了