跳到正文
  1. Google Research68

    Google Research 研究 AI 辅助是否会提升或削弱专利律师专业判断

    Google Research 介绍了一项关于 AI 辅助对专利律师专业能力影响的三个月现场实验,研究对象为 11 家知识产权律所的 133 名律师。实验随机开放当时未发布、现已属于 Gemini Notebook 的 Google Labs AI 专利写作助手,结果显示 AI 在 10 天和 90 天的起草任务中分别将评分提高 0.34 SD 和 0.38 SD。

    推荐理由:这项现场实验区分了 AI 辅助产出与无辅助判断,提供了观察专业技能迁移的具体设计。

  2. AWS Machine Learning Blog72

    AWS 在 Amazon Bedrock 和 Claude Platform on AWS 上推出 Claude Haiku 5.5

    AWS 宣布 Claude Haiku 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上可用。Anthropic 称该模型是 Claude 5.5 系列中最快、最高效的模型,面向 subagents 和高容量、成本敏感型工作,多数任务成本比 Claude Haiku 4.5 低约 75%。

    推荐理由:原文说明了 Haiku 5.5 在 Bedrock 的可用方式和成本定位,便于评估其在高频子任务中的适配度。

  3. GitHub Blog · AI & ML70

    GitHub 推出 ModernBERT 分类器以扩展 Secret Protection

    GitHub 介绍了与 Microsoft Applied Sciences 构建的微调 ModernBERT 分类器,用于把 push protection 扩展到非结构化密钥。

    推荐理由:原文结合九个季度数据与新分类器细节,说明 GitHub 如何把密钥防护前移到代码推送链路。

  4. Microsoft Research76

    Microsoft Research 发布 Agent Lightning v1.0 轻量级 Agentic RL 框架

    Microsoft Research Asia 发布并开源 Agent Lightning v1.0,一个约 3,500 行代码的轻量级 Agentic RL 框架,用于在真实 agent harness 中训练智能体。

    推荐理由:原文展示了用真实 agent harness 参与 RL 训练的设计,可作为编码智能体训练流程的工程参考。

  1. Hugging Face Blog82

    Hugging Face 介绍 Nemotron 微调后在 IOI 2026 和 IMO 2026 达到金牌水平

    Hugging Face 介绍 Nemotron 团队从 Nemotron 3 出发,通过 SFT、RL 和反馈驱动推理,在 IOI 2026 与 IMO 2026 达到金牌水平。

    推荐理由:文章同时给出训练数据、推理流程和开源入口,可参考其将基础模型专门化到竞赛任务的方法。

  2. OpenAI News80

    OpenAI 在 ChatGPT 全球推出 GPT-6 和 Intelligent UI

    OpenAI 宣布 GPT‑6 正在 ChatGPT 中全球推出,并配套 Intelligent UI。该更新称可提供更快响应,带来可直接探索和使用的视觉与交互体验。

    推荐理由:原文说明了 GPT-6 在 ChatGPT 的全球上线形态,并点出可交互视觉体验这一使用变化。

  3. Google DeepMind75

    Google DeepMind 发布 EmbeddingGemma 2 开放轻量多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,将文本、代码、图像、视频和音频映射到统一嵌入空间。该模型基于 Gemma 4 架构,采用 Apache 2.0 许可,拥有 740 million 参数,支持 8K token 上下文窗口,并可通过 MRL 将输出向量从 768 维截断到 512、256 或 128 维。

    推荐理由:原文给出参数规模、上下文窗口和端侧内存数据,可用于评估多模态嵌入在本地检索场景中的适配性。

  4. AWS Machine Learning Blog62

    AWS 介绍如何在 AgentCore 和 OpenClaw 上构建上下文感知 AI 助手

    AWS Machine Learning Blog 介绍了在 Amazon Bedrock AgentCore runtime 和 OpenClaw 上构建上下文感知个人助手的方法。

    推荐理由:文章把记忆命名空间、模型路由和提示词缓存串成可复用架构,便于迁移到其他个人助理场景。

  1. Mistral AI84

    Mistral AI 发布 Mistral Large 4 公共预览版

    Mistral AI 发布 Mistral Large 4 公共预览版,这是一个 1 trillion-parameter 原生多模态模型,拥有 52 billion active parameters,可在 Mistral Studio 试用 preview API,并计划在本月底发布权重。

    推荐理由:原文披露了参数规模、开放权重计划和多项基准结果,可用于比较欧洲开放权重模型的能力定位。

  1. GitHub Blog · AI & ML62

    GitHub 发布 AI 代码审查开放基准 ReviewBench

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,现已可通过 ReviewBench 网站使用。

    推荐理由:原文公开了数据集、评分方法和提交流程,可用于比较代码审查智能体的取舍。

  1. Hugging Face Blog76

    Microsoft 与 Hugging Face 发布 ThinkingBox,用后端状态评估 AI 智能体可靠性

    Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用 AI 智能体留下的数据库终态与副作用评估任务是否完成,而不是只看回复或工具调用。

    推荐理由:文章把单次成功与连续可靠性分开评估,可帮助判断智能体接入真实业务记录时的风险。

  1. Hugging Face Blog60

    Asta 开源科学报告生成模型 AstaBrief 8B

    Asta 开源了 AstaBrief 8B,这是一个将研究问题和检索到的文献摘录转成带引用报告的开放权重模型。它已作为 Asta Generate a report 功能中的 Fast mode 提供,并与 Claude 驱动的 Thinking mode 并列;Asta 还开源训练数据,并发布可用自有 PDFs 生成报告的示例 workflow。

    推荐理由:文章披露了训练数据筛选、DPO 构造和速度对比,适合参考科学报告生成模型的工程取舍。

  1. Google DeepMind80

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 宣布 Gemini 4 Argon,这一前沿模型将先通过 Fairwind Program 向一组受信任的网络防御者推出,并逐步扩大访问。

    推荐理由:原文给出发布节奏、价格和多项基准结果,可用于了解 Google 对高能力模型分阶段开放的安排。

  1. Google DeepMind72

    Google DeepMind 推出 SynthID Bio,用于 AI 生成蛋白质水印

    Google DeepMind 推出 SynthID Bio,将水印技术用于合成生物学,在 AI 生成蛋白质序列和 3D 结构中嵌入可验证签名,同时在实验室测试中保持生物功能。

    推荐理由:原文展示了生物设计水印在湿实验和结构预测中的验证结果,可用于理解 AI 生物安全的新防线。

  1. Microsoft Research70

    Microsoft Research 介绍面向复杂生物学的 AI 研究系统 Quine

    Microsoft Research 介绍 Quine,这是一个研究项目,旨在构建生物学多模态世界模型,并用交互式 harness 连接模型、科学工具、文献和研究人员。

    推荐理由:原文提供了 Quine 在肿瘤状态转移中的实验案例,可作为 AI 参与生物研究闭环的参考。

  1. Hugging Face Blog82

    Holo4 系列智能体模型发布,支持 GUI、代码、MCP 和 API

    H Company 发布 Holo4 系列智能体模型,包括 Holo4-27B dense、Holo4-35B-A3B Mixture of Experts,并更新 Holotron4 Nano。

    推荐理由:原文披露了跨 GUI、代码、MCP 和 API 的训练与评测细节,可用于比较通用计算机使用智能体的成本与能力。

  1. GitHub Blog · AI & ML65

    GitHub Copilot 解释为什么 chat 常常不是合适的 UI

    GitHub Blog 介绍 GitHub Copilot app 的 canvas,认为许多 AI 任务不应只依赖 chat 作为交互界面。canvas 是运行在 GitHub Copilot app 内的小型全栈应用,可与 GitHub Copilot agent 双向通信,也能调用第三方 API 或在本机执行代码。

    推荐理由:文章用 GitHub Copilot canvases 示例说明,任务型自定义 UI 可减少把 Agent 当工具本身的 token 消耗。