Microsoft Research 发布 Agent Lightning v1.0 轻量级 Agentic RL 框架
Microsoft Research Asia 发布并开源 Agent Lightning v1.0,一个约 3,500 行代码的轻量级 Agentic RL 框架,用于在真实 agent harness 中训练智能体。
推荐理由:原文展示了用真实 agent harness 参与 RL 训练的设计,可作为编码智能体训练流程的工程参考。
Microsoft Research Asia 发布并开源 Agent Lightning v1.0,一个约 3,500 行代码的轻量级 Agentic RL 框架,用于在真实 agent harness 中训练智能体。
推荐理由:原文展示了用真实 agent harness 参与 RL 训练的设计,可作为编码智能体训练流程的工程参考。
Hugging Face 介绍 Nemotron 团队从 Nemotron 3 出发,通过 SFT、RL 和反馈驱动推理,在 IOI 2026 与 IMO 2026 达到金牌水平。
推荐理由:文章同时给出训练数据、推理流程和开源入口,可参考其将基础模型专门化到竞赛任务的方法。
Google Research 介绍了 Earth AI 的 Population Dynamics Foundation Model(PDFM)如何把地理空间嵌入接入公共卫生和流行病学工作流。
推荐理由:原文用五类公共卫生案例展示地理空间嵌入接入现有流行病学流程的效果。
NVIDIA 称电信运营商正把 AI 战略转向开放模型,以获得更高的信任、控制和定制能力,覆盖自主网络到客户服务等关键工作负载。其 State of AI in Telecommunications 报告显示,89% 受访者认为开源模型和软件对公司 AI 战略重要。
Asta 开源了 AstaBrief 8B,这是一个将研究问题和检索到的文献摘录转成带引用报告的开放权重模型。它已作为 Asta Generate a report 功能中的 Fast mode 提供,并与 Claude 驱动的 Thinking mode 并列;Asta 还开源训练数据,并发布可用自有 PDFs 生成报告的示例 workflow。
推荐理由:文章披露了训练数据筛选、DPO 构造和速度对比,适合参考科学报告生成模型的工程取舍。
Google Research 宣布新一代基于 Trusted Execution Environments 的联邦学习系统,用于提供可验证、可审计的数据匿名化保证。
ServiceNow CoreAI 构建 AutoSynthData,用目标模型失败和更强教师模型成功案例生成企业智能体训练任务。它将任务抽象为 system specification、user prompt、verifier,并要求任务可行、真实、能暴露当前模型弱点;在 EnterpriseOps Gym 实验中,流程会验证任务并随模型改进调整课程。
Google DeepMind 推出 SynthID Bio,将水印技术用于合成生物学,在 AI 生成蛋白质序列和 3D 结构中嵌入可验证签名,同时在实验室测试中保持生物功能。
推荐理由:原文展示了生物设计水印在湿实验和结构预测中的验证结果,可用于理解 AI 生物安全的新防线。
Google Research 提出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题,用轻量“steering damper”网络引导图像生成。实验使用 Stable Diffusion v1.4,并在 SFT、RWL、PPO 三种微调设置下以 HPS-v2 评估;完全解锁版本相对基线模型达到 90% 胜率。
Microsoft Research 介绍 Quine,这是一个研究项目,旨在构建生物学多模态世界模型,并用交互式 harness 连接模型、科学工具、文献和研究人员。
推荐理由:原文提供了 Quine 在肿瘤状态转移中的实验案例,可作为 AI 参与生物研究闭环的参考。
Microsoft Research 报告 RetroChimera 逆合成模型近期发表于 Nature,并开源其实现和权重。RetroChimera 结合 R-SMILES 2 与 NeuralLoc,通过学习式重排序融合两类模型的预测,在常见和稀有反应类别上产生更符合化学家判断的逆合成预测。
Google Research 推出 MilleMiglia,一个用 C++ 编写的中程物流实例生成器,用于创建真实、隐私保护的中程配送问题 benchmark。中程物流连接区域或洲际配送中心,涉及多车辆接力、时间窗口和转运同步,长期缺少公开高质量数据。其源代码和文档已在 GitHub 提供。
Cloudera 与 Mistral 宣布合作,把 Mistral 模型集成到 Cloudera 混合数据平台,支持企业在私有云、公有云、本地和完全隔离环境中运行推理。双方还将帮助企业在受控环境中用专有数据训练定制模型,并让数据、模型、计算与运营保持在客户控制范围内。
Google DeepMind 推出 AlphaGenome Atlas,这是一个包含 9 billion 个单核苷酸变异影响预测的平台,覆盖人类基因组中每一种可能的单字母 DNA 变化。
推荐理由:原文给出平台规模、开放方式和合作案例,可帮助判断基因变异预测资源对科研流程的影响。
Microsoft Research 推出开源研究模型 GigaPath-Flash 和 GigaTIME-Flash,用更高效的病理基础模型支持大规模癌症病理研究。
Berkeley AI Research 提出 ABBEL,将长程交互历史压缩为自然语言 belief states,并用 belief grading 监督摘要信息内容。在 CollabBench 协作编码中,ABBEL-rec-BG 将与 Full Context 的性能差距缩小约 50%,训练步数从 100 降至 50,Peak Tokens 为 6.01±0.33×10²。
Berkeley AI Research 发表观点文章,认为 AI 推理成本快速下降正在带来近乎免费的智能,并将改变数据系统面向 Agent 的设计。
推荐理由:文章把推理成本下降与数据系统研究议题相连,提供了面向 Agent 工作负载的系统设计框架。
Berkeley AI Research 文章分析 Adaptive Parallel Reasoning,认为它让模型在推理时自行决定何时拆解任务、启动多少并行线程以及如何协调。
Berkeley AI Research 介绍 GRASP,一种用于学习动态系统“世界模型”的梯度式规划器,旨在让长时域规划更实用。GRASP 将轨迹提升为虚拟状态以并行优化时间维度,在状态迭代中直接加入随机性用于探索,并重塑梯度,让动作获得更清晰信号,同时避免穿过高维视觉模型的脆弱“state-input”梯度。
Berkeley AI Research 介绍 SPEX 与 ProxySPEX,用于在 LLM 等复杂机器学习系统中大规模识别关键交互。SPEX 将交互发现转化为稀疏恢复问题,利用有选择的 ablation 和解码算法定位影响因素;ProxySPEX 利用层级结构,在保持 SPEX 性能的同时将 ablation 数量减少约 10x。
Berkeley AI Research 提出一种基于互信息直接评估和优化成像系统的框架,只用含噪测量和噪声模型衡量测量区分物体的能力。其 NeurIPS 2025 论文显示,该信息指标可在彩色摄影、射电天文学、无透镜成像和显微成像中预测系统表现,优化设计可匹配 SOTA 端到端方法,同时需要更少内存和计算且无需任务特定解码器。