跳到正文
Microsoft Research· Nicolo Fusi, Jonathan M. Carlson·· 9 天前精选AI 评分70

Microsoft Research 介绍面向复杂生物学的 AI 研究系统 Quine

Introducing Quine: An AI research system designed for the complexity of biology

AI 导读

Microsoft Research 介绍 Quine,这是一个研究项目,旨在构建生物学多模态世界模型,并用交互式 harness 连接模型、科学工具、文献和研究人员。

推荐理由

原文提供了 Quine 在肿瘤状态转移中的实验案例,可作为 AI 参与生物研究闭环的参考。

正文 · AI 翻译
Diagram of Project Quine’s closed-loop approach to biological research. A scientist asks questions that are passed to Quine for in silico computation. Quine combines a world model of biology, spanning genomics, proteins, chemistry, cell state, and bioimaging, with a harness for orchestration and reasoning, supported by knowledge and tools. Quine generates proposals that are tested through real-world wet-lab experiments. Experimental measurements return to the scientist and inform the next question, creating an iterative loop between computational modeling and real-world experimentation.

概览

  • Quine(在新标签页中打开) 是一项研究工作,旨在创建一个生物学的多模态世界模型,以及一个连接模型、科学工具、文献和研究人员的交互式框架。 
  • 通过与哈佛大学和 MIT 的 Broad Institute 研究人员合作,我们已使用该系统对预计能够驱动治疗性肿瘤状态转变的化合物进行优先排序,并在多种湿实验测定中验证了若干排名靠前的候选化合物。 
  • Quine Fellows program(在新标签页中打开) 将让一批科学家获得该系统的访问权限,并有机会加速他们自己的研究并提供科学反馈。  
  • Quine 是一项实验性研究技术,仅用于研究目的,不用于临床或医疗用途,其输出可能不完整或不准确,需要由合格研究人员审查,并进行适当的科学和实验验证。随着该技术不断成熟,我们预计将通过 Microsoft Discovery(在新标签页中打开) 等产品扩大访问范围。

二十多年来,Microsoft Research 一直致力于计算与生物学的交叉领域。我们的研究涵盖免疫学、病毒学、基因组学、生物医学成像、细胞生物学和蛋白质工程。这些工作产生了基础性方法、新的科学成果,以及进入临床的技术,范围从罕见病和传染病诊断到癌症生物标志物检测。

在这些工作中,有一个经验变得越来越清晰:生物学并不会按照我们的模型和工具常常采用的整齐边界来划分自身。基因影响蛋白质;蛋白质在细胞内相互作用;细胞组织成组织;而实验不断重塑科学家所知道的内容以及他们接下来选择提出的问题。因此,要在最困难的生物学问题上取得进展,需要的不只是针对单个数据集或任务的能力不断增强的模型。它需要能够跨尺度、跨模态连接知识,围绕实验和证据进行推理,并参与科学借以推进的迭代过程的系统。 

今天,Microsoft Research 正在推出 Quine(在新标签页中打开),这是一项旨在跨越这些边界开展工作的研究项目,体现了我们对一个能够通过科学使用而不断演进的发现系统的长期愿景。Quine 将生物学世界模型与一个连接科学工具、文献、湿实验室以及使用它们的研究人员的框架结合在一起。

实验的局限

即使实验技术不断改进、湿实验室通量不断提高,生物学仍从根本上受到时间和复杂性的制约。自然无法被催促,也无法从第一性原理推导出来。实验进展缓慢,迭代周期漫长,而许多最重要的问题涉及相互作用、组合式设计空间和下游效应,这些规模实在太大,无法仅靠实验来探索。

与此同时,大规模机器学习的进步,特别是通用基础模型以及能够迭代地解决问题的推理模型的出现,提出了一种新的可能性。这些系统开始展现出超越模式识别的能力:跨领域整合信息、对抽象概念进行推理,并支持迭代式问题求解。同样重要的是,许多为人类语言开发的技术已被证明能够出色地适用于生物学的诸多方面,使模型能够跨多种数据类型和尺度学习生物系统的表征。

这给我们提出了一个发人深省的问题:要构建一个生物学世界模型,需要什么?所谓世界模型,我们指的是一个能够表示生物系统状态、预测该状态将如何响应干预而演化,并对这些干预在未来多个步骤中的后果进行推理的系统。这样的系统不会取代实验。相反,它将使我们能够在投入稀缺的实验室资源之前,利用计算来探索、提出、排序并优先选择潜在的前进路径。我们的北极星目标是一个未来:科学家、模型和实验在一个持续加速的循环中协同运行。  

我们构建了什么

Quine 是我们迈向这一愿景的第一步。它既包括一个生物学世界模型,也包括一个将该模型与编排和推理模型、科学工具、文献以及使用它们的科学家团队连接起来的框架。  

图 1:Quine 的两个前沿组件——一个生物学世界模型和一个交互式框架——位于一个始于科学家、也终于科学家的循环之中。一个问题变成一组提案,提案变成值得测试的设计,而实验则返回测量结果,进而让科学家的下一个问题和模型本身都变得更加精准。 

这项工作的核心是世界模型,它学习跨生物学模态和尺度的共享表征,包括序列、结构、功能、细胞状态和成像数据。通过联合训练这些模态,Quine 可以利用一种模态中的证据来为另一种模态中的预测提供信息,捕捉那些在不同单一领域专家模型由系统编排时原本会保持孤立或丢失的关系。这种多模态设计反映了生物学的现实:理解任何一个层级都需要来自其他层级的背景。我们发现,跨这些相互连接的表征进行学习并不会稀释性能,反而会增强性能,使模型能够更有效地泛化,并支持更广泛的生物学推理任务。

 图 2:生物学是多尺度、多模态的。(A) 生物学证据从分子到细胞、组织再到患者层层堆叠,而科学语言贯穿其下。(B) Project Quine 训练所使用的模态——基因组学、蛋白质、化学、RNA 和细胞状态、生物成像——各自观察这一范围中的不同跨度,并且彼此重叠。向下阅读是从基因型到表型的因果路径;横向阅读是物理尺度。由于模型联合学习这些表征,而不是编排相互分离的专家模型,一个层级的证据便可以为另一个层级的预测提供信息。 

通过将该模型整合到一个统一系统中,以促进计算实验并从迭代中学习,研究人员可以跨模态生成预测,并在生物学干预措施进入实验室测试之前推理其后果。关键是,世界模型并不需要完美——事实上,它永远不可能完美地建模生物学——它只需要能为实验设计提供有用信息。 

这在癌症生物学中是什么样子

一个具体例子来自我们在胰腺导管腺癌(PDAC)方面的工作。PDAC 是最常见的胰腺癌类型,也是最难治疗的癌症之一。在与 MIT 和 Harvard 的 Broad Institute 研究人员合作中,我们多年来一直在开发并应用患者来源的 ex vivo 模型,以研究一个长期存在的假设:肿瘤行为和药物反应不仅取决于遗传学,也取决于转录细胞状态。在 PDAC 中,肿瘤细胞可以处于不同的细胞状态,而这些状态与它们对治疗的反应方式相关。  

借助 Quine,我们现在已将这一假设付诸实践,探索癌症的非遗传特征,尤其是细胞状态,是否可以作为可操作的治疗靶点。我们使用 Quine 根据数千种化合物在治疗相关状态之间转变肿瘤细胞的潜力,对其进行预测和优先排序。在聚焦于从经典型到基底型细胞状态转变的湿实验室研究中,Quine 排名最高的化合物在各项实验检测中产生了最大的预期转变。整个过程——从快速缩小化合物搜索空间,到优先筛选出少数有前景的候选物以在实验室中验证——只用了一个周末,可能节省数月的实验工作和大量研究成本。值得注意的是,一些最强的效果来自作用机制出人意料的化合物,这提供了早期证据,表明 AI 可以发现药物再利用和发现的新机会。 

虽然反向状态转变被证明更为困难(从基底型到经典型细胞状态),但 Quine 预测可用化合物会产生这种较弱的效果。更值得注意的是,实验揭示了一个我们并未完全预料到的现象:Quine 预测,几种化合物会持续将细胞推向一种不同的第三种表型——这一观察在实验室中得到了证实——表明胰腺癌细胞状态图景比简单的经典型—基底型轴线更加丰富。这些实验不仅检验了模型的假设,也生成了新的假设。 

图 3:Quine 引导的胰腺癌细胞状态探索。在胰腺导管腺癌(PDAC)细胞系中,排名靠前的化合物产生了最大的经典型到基底型转录转变,并由湿实验室实验验证。较弱的反向转变以及朝向额外表型的意外移动,也与 Quine 的预测一致。

我们在这里的持续工作将使用新整合的 RNA 数据集和任务来表征这一更丰富的图景,强化状态转变预测,并提供经过校准的置信度估计,帮助科学家优先选择最有前景的假设进行湿实验室测试。 而这正是 Quine 被构建来支持的反馈循环。每一轮实验都会增进我们对生物学的理解,而每一项新洞见都可以成为下一代系统的训练信号。  

通过发现来学习——一份邀请

我们创建 Quine,是为了改进我们自身开展科学研究的方式。随着系统不断演进,我们将其嵌入到正在进行的科学项目中。每一个研究问题、实验结果和意外发现,都成为完善模型、改进工作流程,以及更好理解 AI 能在何处真正加速我们研究的机会。久而久之,这个系统成为我们在多个领域推进发现的核心方式,包括癌症生物学、蛋白质工程、基因组学和生物成像。

我们希望在这一基础上继续建设,因此在这个早期阶段推出 Quine。Quine 源自我们自己的研究,但我们不希望它后续的发展在孤立中进行。许多将决定它下一步走向的问题,并不是我们能够独自回答的;它们需要更广泛科学界的专业知识、创造力和视角。因此,我们正在开放 Quine Fellows program,把该系统直接交到工作在生物学和医学前沿的科学家手中。

首届 Quine Fellows 队列现已开放申请

负责任地构建始终是第一位的。我们认为,AI 与生物学的进步必须与安全、安保和负责任的管理同步推进。我们正在以审慎、分阶段的方式推进 Quine 的开发与访问,初期可用范围仅限于 Quine Fellows program 和部分研究合作。持续的内部审查和内置的防护措施,将帮助我们随着系统演进保持适当的监督。随着技术成熟,我们预计将通过 Microsoft Discovery(在新标签页中打开) 等产品扩大访问范围。

人们很容易围绕基准测试和排行榜来描述 AI 在生物学领域的进展。这些固然重要,但对 Quine 的真正考验,是当它遇到实际开展中的科学研究时会发生什么。当证据不完整时,它能派上用场吗?在面对真正前所未有的问题时呢?它能帮助缩短从问题到发现的路径吗?

归根结底,这才是我们看重的标准。我们的愿景是让 Quine 退到科学实践的背景中,而让科学在前台更快推进。主角不是模型或平台,而是科学家、实验,以及随之而来的发现。 

在新标签页中打开

文章 Introducing Quine: An AI research system designed for the complexity of biology 最先发布于 Microsoft Research。

来源:Microsoft Research · microsoft.com