GitHub 发布 AI 代码审查开放基准 ReviewBench
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,现已可通过 ReviewBench 网站使用。
推荐理由:原文公开了数据集、评分方法和提交流程,可用于比较代码审查智能体的取舍。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,现已可通过 ReviewBench 网站使用。
推荐理由:原文公开了数据集、评分方法和提交流程,可用于比较代码审查智能体的取舍。
Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用 AI 智能体留下的数据库终态与副作用评估任务是否完成,而不是只看回复或工具调用。
推荐理由:文章把单次成功与连续可靠性分开评估,可帮助判断智能体接入真实业务记录时的风险。
Microsoft Research 开发机器学习管线,利用预报时太阳风信息为美国本土 66,935 个变电站生成位置级空间天气风险估计。系统结合 AE、Dst 预测与纬度、地质、地面电导率等特征,可在风险出现前 30-60 分钟预警。2020-2026 评估中,系统对 major、severe、extreme 事件检测率分别为 76.5%、81.2%、64.1%。
Microsoft Research 介绍 Quine,这是一个研究项目,旨在构建生物学多模态世界模型,并用交互式 harness 连接模型、科学工具、文献和研究人员。
推荐理由:原文提供了 Quine 在肿瘤状态转移中的实验案例,可作为 AI 参与生物研究闭环的参考。
Microsoft Research 报告 RetroChimera 逆合成模型近期发表于 Nature,并开源其实现和权重。RetroChimera 结合 R-SMILES 2 与 NeuralLoc,通过学习式重排序融合两类模型的预测,在常见和稀有反应类别上产生更符合化学家判断的逆合成预测。