劳伦斯伯克利国家实验室 — 其中之一
这些数字令人震惊:美国能源部(DOE)的光源与中子源设施目前每年产生数十拍字节的数据——即数百万吉字节,大致相当于流媒体播放 200 万小时的高清视频。这种积压并非一直存在。升级后的探测器从每六秒捕获一张图像提升到每秒 100,000 张图像,这意味着这些设施现在产生的数据量比十年前高出几个数量级,而传统的人工分析根本无法跟上。
问题不仅在于数据量:领域专家稀缺且不堪重负,而现代原位实验——科学家在化学反应或材料失效等动态过程发生时进行观察——要求实时解读,这是任何人工团队都无法手动提供的。
分析挑战在很大程度上归结为一项任务:分割——即识别并围绕图像中不同结构绘制精确边界的过程。在计算机视觉中,分割是实现从区分肿瘤与健康组织的医学扫描到区分行人与路面的自动驾驶汽车等一切应用的基础。在科学研究中,分割将原始 X 射线图像从一片灰度像素墙转变为具有意义结构的标记图——细胞壁、矿物颗粒、半导体层——研究人员可以据此量化并在不同实验间进行比较。
2025 年底,白宫启动了 创世纪任务,这是一项由 DOE 领导的、利用先进人工智能加速科学发现和技术领导地位的全面国家倡议。SYNAPS-I(协同中子与光子科学——智能)是其旗舰项目之一:一项由伯克利实验室领导、与以下机构合作的多实验室倡议
SYNAPS-I 分割流程的核心是 Meta 发布的两个开源基础模型: 分割一切模型 3(SAM 3)和
DINOv3 是一个自监督视觉模型,意味着它从原始图像中学习视觉模式,无需人工先进行标注。它擅长理解图像中不同结构代表什么以及它们位于何处。SAM 将这种理解更进一步,围绕图像中的单个对象绘制精确边界——就像科学家仔细手工勾勒结构一样,但只需几秒而非数小时。
这两个模型共同构成了一个互补的流程:SAM 提供精确的像素级边界,而 DINO 提供全局上下文以识别每个结构及其在样本中的位置。SYNAPS-I 团队在 DOE 光束线收集的科学成像数据上对这两个模型进行了微调,然后将它们部署在 300 块 A100 GPU 上——这些是驱动当今最先进 AI 系统的高性能计算芯片——位于 NERSC. 等国家超级计算设施。结果:一个完全重建、语义标记的 3D 体数据被送回物理上站在光束线仪器旁的科学家手中,在实验仍在进行时即可进行解读。总周转时间:约 15 分钟。
SYNAPS-I 团队在一项紧迫的农业挑战上演示了这条流水线——在细胞层面理解葡萄藤如何应对干旱。利用在先进光源(Advanced Light Source)采集的微型 CT 扫描,该流水线重建葡萄藤茎的三维体数据,并自动识别木质部导管——植物体内负责水分运输的微观管道。通过追踪这些导管随着干旱进展而发生的变化,研究人员获得的洞见可为抗旱作物的开发提供依据,并为未来的农业韧性提供解决方案。
过去每个时间步需要专家标注一个月,如今只需 15 分钟,使科学家能够以数据采集本身的速度研究动态生物过程。
国家实验室将发表前的研究数据和 AI 模型保存在政府基础设施上,而非外部云服务。这项工作在进行过程中必须在安全平台上管理。Meta 的开源方法使之成为可能。SYNAPS-I 团队可以在自己的安全计算环境中下载、微调和部署 SAM 与 DINO,将原本在自然图像上训练的模型适配到它们从未被设计用于的科学领域。
SYNAPS-I 汇集了五个国家实验室的 60 名研究人员,正朝着这样一个未来迈进:用户设施作为智能发现平台运行——在那里,AI 不只是更快地处理数据,还帮助科学家生成假设、推荐下一步实验,并在各设施之间转移知识,使某一条光束线上的突破惠及所有设施的研究人员。随着 Genesis 从种子项目扩展到完整项目,这一开源基础有望在不断扩大的一系列国家优先事项上加速发现。
在最近的万亿参数联盟(Trillion Parameter Consortium)上,美国能源部副部长 Dario Gil 提到了这项工作的前景。
“通过将 AI、先进计算和实验系统无缝结合,SYNAPS-I 在数据产生时即对其进行分析,并实时指导实验,用自适应、自动化的决策取代缓慢的人工步骤,”他说。“这将发现时间从数天压缩到片刻,并建立起一种持续、自我改进的科学模式,这对于充分实现 Genesis 使命的潜力至关重要。”
我们的最新动态已送达您的收件箱
订阅我们的新闻通讯,随时了解 Meta AI 新闻、活动、研究突破等更多内容。
