跳到正文
  1. GitHub Blog · AI & ML70

    GitHub 推出 ModernBERT 分类器以扩展 Secret Protection

    GitHub 介绍了与 Microsoft Applied Sciences 构建的微调 ModernBERT 分类器,用于把 push protection 扩展到非结构化密钥。

    推荐理由:原文结合九个季度数据与新分类器细节,说明 GitHub 如何把密钥防护前移到代码推送链路。

  2. Microsoft Research76

    Microsoft Research 发布 Agent Lightning v1.0 轻量级 Agentic RL 框架

    Microsoft Research Asia 发布并开源 Agent Lightning v1.0,一个约 3,500 行代码的轻量级 Agentic RL 框架,用于在真实 agent harness 中训练智能体。

    推荐理由:原文展示了用真实 agent harness 参与 RL 训练的设计,可作为编码智能体训练流程的工程参考。

  1. GitHub Blog · AI & ML62

    GitHub 发布 AI 代码审查开放基准 ReviewBench

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,现已可通过 ReviewBench 网站使用。

    推荐理由:原文公开了数据集、评分方法和提交流程,可用于比较代码审查智能体的取舍。

  1. Hugging Face Blog76

    Microsoft 与 Hugging Face 发布 ThinkingBox,用后端状态评估 AI 智能体可靠性

    Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用 AI 智能体留下的数据库终态与副作用评估任务是否完成,而不是只看回复或工具调用。

    推荐理由:文章把单次成功与连续可靠性分开评估,可帮助判断智能体接入真实业务记录时的风险。

  1. Microsoft Research70

    Microsoft Research 介绍面向复杂生物学的 AI 研究系统 Quine

    Microsoft Research 介绍 Quine,这是一个研究项目,旨在构建生物学多模态世界模型,并用交互式 harness 连接模型、科学工具、文献和研究人员。

    推荐理由:原文提供了 Quine 在肿瘤状态转移中的实验案例,可作为 AI 参与生物研究闭环的参考。

  1. GitHub Blog · AI & ML65

    GitHub Copilot 解释为什么 chat 常常不是合适的 UI

    GitHub Blog 介绍 GitHub Copilot app 的 canvas,认为许多 AI 任务不应只依赖 chat 作为交互界面。canvas 是运行在 GitHub Copilot app 内的小型全栈应用,可与 GitHub Copilot agent 双向通信,也能调用第三方 API 或在本机执行代码。

    推荐理由:文章用 GitHub Copilot canvases 示例说明,任务型自定义 UI 可减少把 Agent 当工具本身的 token 消耗。

  1. Microsoft Research66

    Microsoft Research 研究机器人真实物理 AI 的卸载推理

    Microsoft Research 研究显示,机器人只依赖机载 GPU 运行物理 AI 推理会限制性能、电池续航和可扩展性,将推理卸载到边缘或云端 GPU 可带来优势。

    推荐理由:文章用机器人移动操作负载比较本地与卸载推理,提供了性能、电池与部署取舍的系统视角。

已经到底了