在 AI 的世界里,科学的未来会是什么样子?Anthropic 对科学抱有宏大的目标,甚至正在开设一个湿实验室。与此同时,一场静悄悄的改变
正在整个 AI x Science 领域发生。
在这篇客座文章中,Adrian Sanborn 讲述了他所看到的、不那么引人注目但更为直接的种种方式——在他自己的公司 Endura Therapeutics,AI 正在如何改变一线科学研究。
Adrian 在斯坦福大学攻读了计算机科学博士学位,其中大部分时间都在实验台前做实验,这使他成为少数能够告诉你 LLM 正在对代码库和湿实验室做些什么的人之一。请欣赏!
语言模型已经改变了软件的构建方式。编写代码、整理数据、设计系统架构,如今的速度在三年前是无法想象的。
当产品是软件、结果可验证时,更廉价的编程会直接转化为更多的软件和更多的构建者。2 但在科学领域,一切最终都受制于需要数天或数周才能验证任何东西的物理实验。围绕实验的知识工作已变得极其迅速,而 AI 对实验本身的吞吐量却几乎毫无贡献。思考变便宜了,而动手没有。
我们认为生物技术行业以两种方式做出了适应:
代工厂(Foundries)缩小了动手的成本。它们将测量工业化,利用新技术以比以往快一个数量级的速度生成数据。Xaira、NewLimit、Octant、Tahoe 和 Endura 通过下一代测序与多重检测实现了这一点;Insitro、Eikon 和 Noetik 通过高通量显微成像;Lila 和 Periodic Labs 通过物理自动化,这里仅举几例。AI 让这些数据变得可读且可预测,但真正形成差异的资产是实验数据本身。导航者(Navigators)花掉思考的盈余。AI 模型坐落在公司日常的运转机制之中,推动更好的决策和更快的流程。它们越来越多地主宰着工作如何开展、构建哪些工具,以及哪些问题值得做一次实验。不需要专有模型或海量数据集,只需要愿意让公司的工作方式不断演进。
建造一座代工厂是一项真正的战略承诺,需要资本、数年时间,以及对某项特定技术的押注。代工厂很容易被看见:技术激发想象,与 AI 的联系立竿见影,而且总会有某个新模型或新数据集可以发布。相比之下,导航者是无形的,因为其收益体现在运营层面,而且没有人会为一条自己决定不走的路发布新闻稿。但导航是每家公司都可以采用的。显眼的变化发生在几十家公司,而不显眼的变化发生在所有公司。
导航在早期初创公司中运行得最快,因为它们没有历史包袱需要摆脱:没有软件合同的历史、没有标准化的流程、没有僵化的组织结构、没有合规制度。它们也承受着以极少资源快速前进的压力。当一种更好的工作方式出现时,它就直接成为新的常态。
其影响随处可见。当分析只需一小时而非一周时,实验迭代得更快。一类原本需要以六位数授权费获得的软件,变成了一天就能构建出来的东西。疾病项目从 500 个候选方案中挑选,而一个团队通常只能评估五个。以下是从内部看到的景象。
代码如今与科学保持同步
实验科学中存在一种结构性的张力,软件工程对此并无真正的对应物。在工程领域,每隔几周就变化的需求是规划不善的症状。而在研究中,它们就是目标本身。实验的目的在于学到东西,而学到的东西会改变下一个实验应该是什么。3 如果一种方法六个月都没有演进,那就意味着没有任何新发现。
一个新实验的方案在第一年里会演变十几次,而每一次变化都会传导到分析中。每个测量结果都必须用紧密跟踪实验的代码来处理、归一化和解读。历史上,这种分析是由第二个人完成的,从而在理解实验测量内容的人与理解代码在做什么的人之间造成了一道缝隙。这种摩擦催生出一种倾向:为了回避分析返工而少提实验改动,这又累积成未被探索的选项。
既然写代码已经很快,让分析适应修改后的方案就是一下午的工作,而不是一个项目。实验不再受制于更改分析流程的负担。 当灵活性成本低廉、问题可以轻松修复时,实验就可以敏捷起来;换句话说,科学也可以“快速行动,打破常规”。
同样的转变也适用于上一层,即解读。交互式可视化仪表盘如今可以在几分钟内搭建完成,而不是几天。
The most visible consequence is access. Previously, when every experiment was analyzed by the computational person, results waited in a queue. Now the scientist who ran the experiment and has the context presents their own results. The data is no longer gatekept behind someone else’s Python notebooks.
软件现在可以表达你的观点
每个软件界面都有观点。一个数据系统决定了哪些比较只需点击一下,哪些则需要费力寻找。每个实验室都需要某个地方来存储和展示数据,而嵌入该系统中的观点最终会塑造这个实验室注意到什么。
二十年来,这种观点是由别人形成的:少数几家构建实验室软件、充当记录系统的供应商。这些供应商为上千个实验室构建一套系统,必然朝着最低共同标准来设计。所有人都接受了这种近似,因为自行开发的工作量超过任何实验室所能证明的合理范围。
这不再成立。内部构建的数据门户能容纳商业产品无法预料的那些数据怪癖,并且其复杂程度恰好符合团队需要,随着他们的问题一起成长。浏览和探索变得简单轻松,而这会改变行为。想想看,如果看下一条帖子需要切换标签页并复制粘贴,人们会在社交媒体上花多少时间。一直散落在不同幻灯片中的模式开始浮现出来。
实施只需一天,但决定门户应该做什么却可能花上几周。这些设计讨论最终被证明至关重要,因为决定什么该放在一个屏幕上,会迫使团队阐明究竟哪些比较真正驱动他们的决策。当你购买一个软件平台时,你外包的不只是工程,还有你如何实现目标这个问题。
存在权衡:内部构建的门户不够精致,也没有支持团队可以求助。拥有层层验证要求和合同义务的大型组织,仍然难以效仿这些做法。但软件公司早已明白,最好的内部工具来自与使用者并肩工作的工程师。现在,每个研究团队都可以成为自己的前沿部署工程师。
旧规则是“能买就绝不自己造”。新规则是构建塑造你思考方式的工具。
专家级深度现在可以规模化
选择追逐哪些疾病是制药公司做出的最具后果性的决定。一切都取决于这个决定,并且是为了适应疾病生物学及其市场的具体情况而构建的。这个选择实际上不可逆转,一个成功的项目需要大约十年和十亿美元,因此这个决定会被仔细尽职调查。典型流程会召集一组内部和外部专家,他们聚集、综合并辩论科学和市场证据,持续一个月或更长时间。
这个过程假设你已经知道你在争论哪五种疾病。在我的公司 Endura,我们没有这个候选清单,因为我们药物的独特机制。我们正在开发药丸形式的 CRISPR:一种可以在家中方便服用的药物,它会在一个特定的遗传信息上形成化学疤痕,并关闭致病蛋白质的生产。4 找到这些药物需要开发一种新的 DNA 测序方法,能够一次性读取每个基因上的这些疤痕,因此单个实验就能返回跨越数百种疾病的候选药物。我们不是从五种疾病开始,而是必须对整个疾病图谱进行分诊。5
我们构建了一个两阶段分诊,并让一群 LLM 研究代理针对它工作。第一轮覆盖了大约 500 个疾病靶点,为每个靶点生成相当于三页报告的内容,并基于基础问题进行筛选:该疾病是否足够普遍以证明我们的努力合理,该问题是否已被现有药物解决,以及我们药物的靶点降低效应是否真的能缓解该疾病。第二轮针对剩余的大约 100 个疾病靶点,每个产生相当于三十页的内容,彻底梳理疾病生物学和竞争格局。我们编写第二轮提示,使其表现得像一位持怀疑态度的专家,而不是总结者:列出失败的项目、每个项目失败的原因,以及我们需要满足什么条件才能在他们失败的地方取得成功。这种详细程度是必要的,因为与任何市场一样,明显良好的靶点都很拥挤。要得出一个可辩护的立场,意味着找到特定的疾病和特定原因,说明我们的药物将做到现有方法无法做到的事情。
按照旧的速度,第一阶段需要大约一个人年的阅读量,第二阶段则接近一个世纪的专家时间。第二轮仍然会根据原始来源进行检查,选定的项目会接受一如既往的完整人工尽职调查。6 但一年前,如此广泛、如此深入的搜索根本不可能。
在研究中,代价高昂的错误是那些未知的错误。一个团队投入到一个方向,几个月后实验结果为阴性时才发现它是错的。通常,一位专家本可以用一句话说明:那条通路已经尝试过了,这个读出从未预测出任何东西,那家公司在那个患者群体上失败了。能够大规模获取这种专家级的深度洞见之所以是游戏规则改变者,正是因为在研究早期被告知“不行”是如此有价值。
这只是浅水区
以上所有事情都发生在 Endura——灵活而动态的分析、一天内构建的内部工具、跨越 500 种疾病的搜索——而这只是导航的入门版本。每一代后续的语言模型都在移除我们曾视为理所当然的限制。很快我们就能完全跳过构建分析流程或数据仪表盘。相反,一位科学家将提出她真正想问的问题,而回答它所需的分析和界面将从零开始组装。软件不再是工作产物,而成为围绕问题出现的东西。7
在这种规模上获取专业知识开启了以前无人能尝试的工作。一个明显的例子是药物重定位,即一种已在人体中证明安全的药物,被发现作用于一种无人关注的疾病机制。已发表的文献浩如烟海,而若干有用的结论此刻就躺在其中,未被发现,因为没有哪一个人读过正确组合的论文。但模型可以消化这一切,并在正确的提示下,把点连起来。围绕这一赌注,整个公司生态系统正在形成,制药公司和投资者也在运行他们自己的版本。8 尚待观察的是,这会产生三种新药还是 300 种。
这些导航者证明了,当前科学领域最具加速作用的 AI 根本不是用科学数据训练的模型。而是那个帮助科学家或高管弄清楚每个周一早上什么值得做的模型。
Adrian Sanborn 是 Endura Therapeutics 的首席执行官兼联合创始人。他曾是 Atomic AI 的创始成员,在那里他领导技术平台的生物学方面并定义了公司的治疗策略。他拥有斯坦福大学计算机科学博士学位,其中大部分时间他都在 Roger Kornberg 的生物化学实验室的台面上度过。他在 X 上是 @AdrianSanborn。
非常感谢 Brandon Anderson、swyx 和 Lauren Richardson 审阅本文草稿并提供关键反馈。
在这篇博客打磨期间,这篇论文 发表了,讨论了 AI x Science 的早期洞见。我们很兴奋地看到我们的许多洞见得到了实证观察!
这就是杰文斯悖论,得名于 1865 年的观察:更高效的蒸汽机增加了煤炭消耗,而不是减少它。软件版本:迄今为止,编写代码成本的每一次下降都伴随着更多软件,而不是更少的工程师。
软件产品开发实际上也有强调学习的工作流程,并借用了“实验”这个词。产品团队运行 A/B 测试,在功能标志后面发布,并将一次发布视为关于用户想要什么的假设。
大多数基因药物,如 CRISPR,都是无法自行进入细胞的大分子。它们只能到达少数组织,而要让它们到达那里,意味着需要输注、注射,或者对于大脑来说,需要用针刺入椎管。药丸形式的小分子药物可以自行在体内穿行,并且可以吞服。当罗氏推出一款治疗脊髓性肌萎缩症的口服药物时,患者家庭稳步地从一种已经有效的注射药物转向了它。
大多数公司有充分理由先设定一个治疗领域,这由其既有的科学专长、临床关系和业务优先级决定。我们的方法使我们能够从广泛开始,找到最有成效的方向,然后再建立那种深度。
语言模型并不完美,在这种规模下,一些报告包含错误。这是可以容忍的,因为第一遍中的错误只意味着错过了一个机会,而不是浪费时间追逐一个糟糕的想法。
按需生成的分析有一个未解决的问题:可复现性。如果一张图背后的代码是为一个问题拼凑起来的,那么其来源可信度就弱于版本化流水线。
例如,Edison Scientific 就是围绕这一前提建立的,而 Metsera 背后的团队则让其 AI Scientist 系统来生成新的公司想法。
