跳到正文
Hugging Face Blog·· 6 天前精选AI 评分60

Asta 开源科学报告生成模型 AstaBrief 8B

Open-sourcing AstaBrief, the fast report-generation model in Asta

AI 导读

Asta 开源了 AstaBrief 8B,这是一个将研究问题和检索到的文献摘录转成带引用报告的开放权重模型。它已作为 Asta Generate a report 功能中的 Fast mode 提供,并与 Claude 驱动的 Thinking mode 并列;Asta 还开源训练数据,并发布可用自有 PDFs 生成报告的示例 workflow。

推荐理由

文章披露了训练数据筛选、DPO 构造和速度对比,适合参考科学报告生成模型的工程取舍。

正文 · AI 翻译

🤗 模型 | 📊 数据

AstaBrief — scientific report generation

语言模型已经可以帮助研究人员检索文献、综合证据,并梳理复杂问题。但科学工作对这些模型提出了特殊要求——答案需要以证据为基础,模型需要保留证据实际支持的内容,而不是悄悄扩大某项研究的结论,并且研究人员需要能够验证最终输出。

我们从科学家使用 Asta(我们的科学工作智能体平台)的方式中看到了这一点。用户通常不是进行简单的关键词搜索,而是带来大量背景信息和许多约束条件——例如,要求 Asta 在考虑特定方法、人群或场景的情况下,比较一组文献中的不同方法。许多人还会稍后回到生成的报告,把它们当作正在使用的研究成果,而不是一次性的答案。

我们希望帮助科学家更快地生成带引用的报告,并且使用一个他们可以下载并自行运行的模型。为此,我们测试了一个专门为科学报告生成而训练的小型开放模型,是否能达到我们所使用的专有模型的报告质量,同时减少生成时间和服务成本。

我们构建了 AstaBrief 8B,这是一个将研究问题和检索到的文献摘录转化为带引用报告的模型。AstaBrief 目前已在 Asta 的“生成报告”功能中作为 快速模式提供,与由 Claude 驱动的“思考模式”并列;我们还将它及其训练数据开源,以便其他人研究、复现并在我们的方法基础上继续构建。

开发 AstaBrief 需要数万条真实研究查询、以引用为重点的筛选、偏好数据,以及重新设计的报告生成流水线:它一次性写出完整报告,而不是逐节生成。结果是,与我们跟踪的专有模型相比,报告生成时间减少了近一个数量级——在完整的 Asta 流水线中,快速模式平均每份报告耗时 51.1 秒,而思考模式为 178.5 秒,约快 3.5×。

这些效率提升使 AstaBrief 成为一个有用的测试案例,用于探索一个更广泛的目标:构建能够适应科学工作特定需求的开放语言模型。

开放权重还将使机构能够在自己的基础设施上运行 AstaBrief;当研究问题会暴露敏感或未发表的工作时,这是必要的。除了模型权重之外,我们还发布了 一个示例工作流,研究人员可以对其进行调整,用自己的 PDF 创建报告,为本地报告生成提供一个起点

本文介绍我们如何训练 AstaBrief、我们在让它立足于科学证据方面学到了什么,以及我们认为方法中的哪些部分可以延续到未来面向科学的模型中。文中描述的大部分训练和评估是在 2025 年完成的,因此用于生成训练数据并作为比较对象的专有模型反映的是当时的前沿水平。我们尚未针对当今的前沿模型重新运行完整评估;以下结果最好被视为关于我们所测试的特定训练和系统设计选择的证据。

训练模型

我们打造 AstaBrief 的目标,是构建一个开放权重模型,使其具备长篇科学综合任务中最重要的所有品质:答案质量、相关性、结构,以及有引文依据。我们从 Qwen3-8B 出发,并将大部分精力集中在后训练数据、评估以及周边的报告生成脚手架上。

将通用模型适配于科学工作,以及从零开始训练新的科学模型,是我们在 Ai2 内部广泛探索的方向。通过 NSF OMAI——一项由 Ai2 牵头、旨在为科学发现构建完全开放的 AI 基础设施和模型的美国国家级计划——我们的研究人员正直接与科学界合作,了解他们对未来开放模型的需求,以及当今通用模型的不足之处。这包括研究不同科学领域和工作流之间需求如何不同;未来我们还会分享该研究的更多发现。

近期工作,包括我们的 DR Tulu,已经表明,基于强化学习(RL)的方法可以提升开放权重模型的长篇报告生成能力,尤其是在训练循环中引入评判模型时。我们曾考虑为 AstaBrief 采用这一路径,但最终专注于一种更简单的方案,围绕监督微调(SFT)和直接偏好优化(DPO)构建。

基于 RL 的训练可能不稳定且成本高昂。我们想看看,在一种更便宜、更易于运营管理的设置下,能够将报告生成质量推进到什么程度——这种设置也更容易调试和迭代。

这使得训练数据的质量尤为重要。我们没有依赖更复杂的优化方法来弥补噪声样本,而是将项目的大量时间用于弄清楚如何生成、选择和过滤真正展现我们所期望的报告写作行为的样本。

我们还希望 AstaBrief 更快,让用户能够快速获得初步报告,并在随后的轮次中继续迭代。为提升速度,我们决定训练 AstaBrief,使其在给定用户查询和检索到的相关片段时,直接一次性生成最终报告,绕过基于 Claude 的 Thinking 模式所使用的高成本片段总结和聚类阶段,并且不再逐节写出答案。有趣的是,我们发现这样做并不会牺牲性能。

收集 SFT 训练数据

训练流程始于真实用户通过我们论文“Synthesizing scientific literature with retrieval-augmented LMs”中描述的系统以及 ScholarQA 提交的查询;ScholarQA 是如今支撑 Asta 的 Generate a report 功能的框架。我们不想只基于合成提示或基准测试式任务进行训练,而是希望 AstaBrief 从真实科学家的真实查询中学习。

我们的研究表明,科学家向语言模型提出的需求,往往不同于用户对通用聊天机器人或传统搜索工具的使用方式。在我们对数十万条 Asta 查询的分析中,专家研究人员经常提供大量上下文、多重约束,以及概念之间的关系,而不是依赖简短的关键词式提示。

较新的 Asta 用户研究也显示,研究人员希望 AI 以何种方式参与其工作存在差异——有些人愿意使用模型来进行构思或实验,而另一些人则更倾向于让其在综合、文献监测或模式发现中扮演更窄的角色。尽管存在这些差异,参与者都希望来源可追溯性更清晰、更能看见模型正在做什么,并能更好地控制它所使用的上下文。

我们对收集到的用户日志按质量、相关性和隐私进行了过滤,剔除了 beta 测试者和机器人流量,删除了过短而缺乏意义的查询,并使用基于 LLM 的过滤流程来捕捉非英语查询、非科学请求以及包含个人信息的提示词。最终留下了 90K 个以研究为重点的查询。

对于 SFT,我们使用 Asta 报告生成背后的多步骤 ScholarQA 流程,根据过滤后的查询生成完整报告目标输出。该流程检索相关文献,将材料组织成章节,并使用一个后端报告生成模型将证据综合为带引文的报告。我们采用了多种专有系统的组合:Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 和 GPT-4.1。经过质量过滤后,这产生了 47K 个可用训练样本。

创建 DPO 配对

DPO 需要另一种训练数据。我们需要的不是每个查询对应一份目标报告,而是成对的报告,其中一份优于另一份。

我们使用一个未用于 SFT 数据生成的独立查询子集来构建这些配对。每个查询的一份报告来自现有的 ScholarQA 流程,通常由 Claude 3.5 Sonnet 或 3.7 Sonnet 支持。竞争报告则是通过将 ScholarQA 检索到的文献摘录输入给另一个模型生成的:根据不同样本,使用 o3、o4-mini、DeepSeek-V3 或 DeepSeek-R1。

两个评审模型——GPT-4.1 和 DeepSeek-R1——比较每一对报告并选出优胜者。我们确保 LLM 评审与人类偏好保持一致(95% 一致率),并且只保留两个评审都同意的配对,这为我们提供了更干净的偏好集,并减少了大规模生成偏好数据时通常会出现的大量噪声。

经过质量过滤后,最终的 DPO 数据集约为 6K 个样本。

使用多个生成器,并要求两个评审达成一致,为我们提供了一种相对简单的方式来构建偏好数据,而无需将任何单一模型的输出或判断视为真实标准。

过滤数据以改善归因

我们的主要评估目标是 SQABench-CS2,这是一组由用户编写的 200 个计算机科学研究问题。在 AstaBrief 的开发过程中,我们跟踪了四项指标:

  • 评分标准得分,衡量报告覆盖了多少必要内容。
  • 答案精确率,衡量每个段落是否与问题相关。
  • 引文精确率,衡量每条引文是否支持其所附着的主张。
  • 引文召回率,衡量报告中的主张是否得到所提供引文的充分支持。

对于我们的最终模型,我们还进行了二级评估:DeepScholarBench,这是一个由近期 ArXiv 论文构建、包含 63 个查询的长篇研究综合基准;以及两项单独的成对评估,将其与由 Claude 驱动的流水线生成的报告进行比较——一项是在 SQABench-CS2 上由 LLM 评判的比较,另一项是小规模人工研究。

一份报告可能听起来精致而完整,却偏离问题本身,或把引用附加到那些底层证据并不支持的主张上。对于科学综合,我们需要分别衡量这些行为。但引用支持只是科学忠实性的一部分——模型可能引用了正确的研究,却仍然提出比研究本身所支持的更强的主张。这种情况可能以微妙的方式发生,例如,把关于某个特定样本的发现转化为关于整个人群的泛化主张,把过去时报告的结果改写成听起来更具普遍真实性的现在时陈述,或把描述性发现转化为关于临床医生、政策制定者或研究人员应该做什么的建议。

这类泛化对于科学报告生成尤其重要,因为每一步都可能在不引入明显虚假陈述的情况下,扩大证据的表面适用范围。因此,一个带引用的句子可能在技术上与其来源相关,却仍然夸大了研究人员实际确立的内容。我们的开发指标主要关注相关性、覆盖度和引用扎根性;对科学报告写作者的更丰富评估还应测试它们是否保留来源中主张的范围和强度。

我们的首批 SFT 运行提升了整体内容质量,但在答案精确度和引用质量方面仍落后于由 Claude 驱动的报告生成流水线。换句话说,模型在撰写报告方面有所改进,但在证据扎根方面仍未达到我们进行科学综合所需的一致性。

这促使我们在数据质量上投入更多时间。我们测试了四种基于统计的过滤器,用于识别较弱的合成训练样本:

  • 输出到输入 token 比率。比率非常高的答案通常噪声较多,因为它们从过少的证据中生成了大量文本。
  • 引用相关性。对于训练集中的每份合成报告,我们对其引用论文的检索相关性分数取平均值。较低的平均值表明该报告过度依赖排名较低的证据。
  • 引用密度。我们衡量了至少有一个引用的陈述所占比例。低密度报告通常包含大段缺乏支持的文本。
  • 引用多样性:在由 Claude 驱动的报告检索流水线返回的论文集合中,我们衡量了答案中被引用论文所占比例。低分表明报告过度依赖少数几篇论文。

最大的提升来自过滤掉引用密度低的合成报告;更激进的过滤、过滤器组合以及学习率扫描并未带来有意义的增益。

这是该项目最清晰的经验之一:更复杂的过滤并不一定更好。一个相对简单的信号——合成报告是否始终为其主张引用来源——比我们尝试过的几种更复杂的组合更有用。换句话说,科学专业化并不一定是向预训练中加入更多科学文本;后训练数据的构成和质量,以及它是否展示了诸如基于依据和归因这样的行为,都会实质性地改变所得模型的表现。

这种对有依据、实用输出的关注,也与我们在 Asta 用户研究中听到的反馈一致。参与者指出,生成更多文本并不一定更有帮助;他们想要的是简洁的综合总结,以及足够的来源可追溯性,以便审查和验证结果,而不必在不必要的输出中费力筛查。

在获得更强的 SFT 检查点后,我们在其基础上进行了 DPO 训练。该阶段进一步提升了性能,使 AstaBrief 在报告生成方面达到了 Asta 中由 Claude 驱动的报告流水线和 DR Tulu 的水平范围之内。

验证这一方法

由于该模型旨在作为我们的智能体式 Asta 报告生成框架的一部分运行(并不一定作为独立模型),我们的主要问题是:AstaBrief 能否保留我们重视的报告质量,同时实现一个大幅更快、更便宜的报告生成流水线。换句话说,我们问的不仅是该模型能否在单项基准上匹配更强的专有模型;我们还想知道,用一个简单得多的系统,能够保留多少这样的质量。

image

image

每一行均按最佳在前排序;所有指标都是越高越好。Qwen3-8B 仅在 SQABench-CS2 测试集上进行了评估。SQABench-CS2 是一组由用户编写的计算机科学研究问题;DeepScholarBench 使用其自身指标评估长篇研究综合能力,其分数不可与 SQABench-CS2 的分数比较。

在我们开发过程中使用的评估中,AstaBrief 在多项答案和引用质量指标上与由 Claude 驱动的流水线以及 DR Tulu 具有竞争力。下图展示了由 LLM 评判的比较——在另一项包含 14 个问题的人类研究中,三位科学研究人员各自贡献了 4-5 个问题,并根据总体偏好、完整性、相关性、组织结构和引用准确性(允许并列)对三个系统生成的报告进行排名。在总体偏好上,DR-Tulu 胜出,但三位研究人员中有两位在引用准确性指标上更偏好 AstaBrief 胜过其他系统,这证明了我们的 SFT 数据质量过滤器的实用性。

image

柱状图显示了在相同问题上,每个系统相对于 Thinking mode 赢得的 LLM 评判报告比较的占比。人类判断是单独评估的,未包含在内。Thinking mode 是比较基准,因此没有柱状图。与 DR-Tulu 不同,Asta Brief 在 DPO 阶段针对这种成对报告排名进行了优化。

这些数字最好被理解为对我们当时开发该方法时工程思路的验证,而不是在声称这个特定基础模型相对于当今前沿模型处于什么位置。模型生态系统发展很快——我们预计其中更具普适性的部分,是数据构建、归因过滤和服务部署方面的经验。

在 Asta 中验证 AstaBrief 的实用性时,Fast 模式已经展现出令人鼓舞的早期使用情况。在 374 名试用过它的 Asta 用户中,29.1% 使用了两天或更久,用户平均用它生成 3.67 个报告线程。23% 试用过 Fast 模式的用户继续使用它,并且在之后的线程中从未切回 Thinking 模式。另有 18% 的用户会根据自己的目标在 Fast 和 Thinking 模式之间切换,其中约 40% 的线程使用 Fast 模式。

尽管反馈总体上仍然太少,难以得出强有力的结论,但我们看到 Fast 模式获得正面反馈的比例与 Thinking 模式相近(84.2% 对 85.2%)。

下一步走向

Asta 的报告生成是 AstaBrief 首次投入生产使用,为研究人员在现有 Thinking 模式之外提供了一个开放权重的 Fast 模式。由于该模型是开放权重的,机构可以将其部署在自己的硬件上,包括部署在自己的防火墙之后,而无需依赖专有模型 API 来生成报告。

在 Asta 中,这也意味着我们可以直接研究并改进报告生成流水线的这一部分,同时保留 Thinking 模式作为处理更耗费算力任务的选项。

还有更多工作要做。我们正在探索更细粒度的偏好学习、更强的 RAG 加 RL 方法、多轮和多工具能力、更多科学数据源,以及查询分解。我们还对超越“某个论断是否有支持性引用”的评估感兴趣,进而追问模型是否保留了证据性——这既是为了更好地捕捉报告作为研究产物的质量,也是为了考察模型是否保留了其来源的证据范围。这包括简洁性和组织性等特质,也包括模型是否会把针对特定样本的发现转化为宽泛概括,或把描述性结果转化为建议。

AstaBrief 是关于科学语言模型的一系列更长期工作中的一个实验,从 ScholarQA 和 DR Tulu,到如今开始成形的 Olmo 未来版本。这里的经验——尤其是围绕训练数据、过滤和评估的经验——可以帮助指导我们接下来要构建的内容。

立即在 Asta 中试用 Fast 模型,或从 Hugging Face 下载 AstaBrief。

来源:Hugging Face Blog · huggingface.co