GitHub 发布 AI 代码审查开放基准 ReviewBench
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,现已可通过 ReviewBench 网站使用。
推荐理由:原文公开了数据集、评分方法和提交流程,可用于比较代码审查智能体的取舍。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,现已可通过 ReviewBench 网站使用。
推荐理由:原文公开了数据集、评分方法和提交流程,可用于比较代码审查智能体的取舍。
Microsoft 与 Hugging Face 发布 ThinkingBox 和 ThinkingBox-Bench,用 AI 智能体留下的数据库终态与副作用评估任务是否完成,而不是只看回复或工具调用。
推荐理由:文章把单次成功与连续可靠性分开评估,可帮助判断智能体接入真实业务记录时的风险。
Google Research 介绍了一套用于连贯长视频生成的研究框架,以 AI video co-director 统一协调 Gemini 和 Veo 上的多智能体视频叙事流程。
推荐理由:文章将长视频一致性拆成规划、记忆与闭环优化问题,可为多镜头生成工作流提供结构化参考。