返回 文章 build CMS 文章

Google 推出生物标志物发现框架:多智能体系统从可穿戴数据中挖掘候选生物标志物

一个将确定性计算与生成式推理分离、强制对抗性验证的多智能体系统,用于从可穿戴数据中严谨地发现候选生物标志物。

多智能体系统可穿戴设备生物标志物发现数字健康
成长分 / 100 69 综合收获、行动、留存与影响

Google 推出生物标志物发现框架:多智能体系统从可穿戴数据中挖掘候选生物标志物
为什么值得读了解如何用多智能体架构解决 AI 在生理时间序列数据上常见的统计有效性问题(虚假相关、数据泄漏、脆弱特征)。

获取一个可参考的六阶段闭环研究流程设计,涵盖假设生成、并行统计分析、模型训练、对抗性验证和文献推理。

关键洞察
  1. 可穿戴设备已能大规模捕获连续生理信号,瓶颈从数据收集转向如何转化为可靠、具有临床意义的生物标志物。
  2. 现有基于语言模型的智能体系统以预测性能为优化目标,忽视统计有效性,导致虚假相关、数据泄漏和脆弱特征。
  3. 该框架将确定性数值计算与生成式推理分离,通过编排器智能体分解自然语言指令,并引导专门化子智能体(Scout、Critic、Defender、Mechanism)完成六阶段流程。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:10325

2026年8月21日

Yubin Kim,学生研究员

我们提出生物标志物发现框架(Biomarker Discovery Framework),这是一个多智能体系统,通过迭代式假设生成、统计分析和基于文献的推理,支持从可穿戴传感器数据中发现候选生物标志物。

可穿戴设备在人群规模上捕获连续的生理信号。这些数据流,从心率动态到睡眠模式,能够在症状出现之前揭示早期的生理变化。瓶颈不再是数据收集,而是如何将这些信号转化为可靠、具有临床意义的生物标志物。

现有的基于语言模型的智能体系统自动化了科学工作流的部分环节,但往往在生理时间序列数据上失效。这些系统以预测性能为优化目标,却忽视了统计有效性,导致虚假相关、数据泄漏和脆弱特征。

为此,我们提出生物标志物发现框架,这是一个多智能体系统,在人类监督下将候选生物标志物的优先级排序构建为迭代式研究循环。通过结合假设生成、并行统计分析、模型训练、对抗性验证和基于文献的推理,生物标志物发现框架在加速发现过程的同时,保持严格的统计严谨性并保留人类监督。在三个队列(N = 9,279 参与者-观测值)中,生物标志物发现框架恢复了已知的临床信号,在独立数据集中识别出一致的生物标志物,并在与人口统计学特征结合时改善了下游预测。

生物标志物发现框架概览。(a) 系统摄取来自消费级可穿戴设备和临床实验室的时间序列数据。(b) 闭环架构编排六个阶段,映射人类生物标志物优先级排序生命周期。(c) 一个编排器智能体将自然语言研究指令分解为执行计划。

生物标志物发现框架将用于数值分析的确定性计算与用于假设形成和解释的生成式推理相结合。一个编排器智能体将自然语言研究指令分解为执行计划,并引导专门化智能体完成六阶段流程。同时,共享记忆、结构化事实表和通用工具在整个工作流中保持可追溯性:

例如,给定一个优先排序与抑郁严重程度相关的可穿戴候选指标的任务,生物标志物发现框架对 DWB 数据集进行了剖析,提出了睡眠时间变异性特征,并估计了睡眠时长变异性与 PHQ-8 严重程度之间的关联(ρ = 0.252)。随后,该工作流检查了稳定性、泄漏、亚组一致性和替代解释,然后将结果构建为基于文献的昼夜节律不稳定性假设,供人类审查。

生物标志物发现框架架构。专门化子智能体(Scout、Critic、Defender、Mechanism)在共享状态上运行。生物标志物发现框架强制执行安全机制以确保统计有效性,将特征构建与目标信号分离,并要求候选指标通过 11 项测试的对抗性过滤阶段。

为评估生物标志物发现框架从噪声数据中提取合理生理学见解的能力,我们在三个大规模队列中独立应用了该框架,共计9,279份参与者观察数据,涵盖心理健康(DWBGLOBEM)与代谢疾病(WEAR-ME)领域。该流程自动识别出41个心理健康候选数字生物标志物和25个代谢结局候选数字生物标志物。

下表展示了候选关联的精选样本。Spearman's ρ 概括了关联的方向和强度。95%置信区间量化了不确定性,校正后的p值考虑了多重比较。机制部分呈现的是基于文献的假设,而非因果结论。重要的是,最后一列描述的是先前证据的强度——而非本研究的临床验证——星号表示证据层级标记,而非统计显著性代码。

生物标志物发现框架并非简单地选择现有变量;它构建了新颖的复合特征。例如,在心理健康领域,它将睡眠时长变异性和入睡时间变异性识别为抑郁严重程度的首要相关因素。在代谢领域,它推导出一个心血管适能指数(步数除以静息心率)作为胰岛素抵抗的无创相关指标,并将其与先前关于血糖调节和心脏代谢适能的研究联系起来。

效应量和不确定性来自确定性分析,机制解释为基于文献的假设。 Established* 表示有大量先前文献支持,* Supported** 表示底层生理轴已确立,但数字化操作化是新的,* Emerging* 表示先前证据有限且需要留出确认,* *R 表示被构念重叠门控拒绝的候选标志物。* * 标记可穿戴设备衍生特征,* Flagged unstable* 标识留出估计方向反转。*

我们在三个不同的大规模队列中部署了生物标志物发现框架,共计9,279份参与者观察数据,涵盖心理健康和代谢疾病领域。

在两个抑郁领域队列中,生物标志物发现框架优先考虑了相关昼夜节律不稳定性构念的不同操作化方式。在DWB中,睡眠时长变异性与PHQ-8严重程度相关(ρ = 0.252,p < 0.001)。在GLOBEM中,入睡时间变异性表现为与PHQ-4的探索性低信号关联(ρ = 0.126,p < 0.001;CV AUC = 0.535)。由于队列、终点和特征定义不同——且没有相同的候选标志物被重复——这一模式应被解释为提示性的构念层面汇聚,而非直接重复。

两个抑郁队列中的相关昼夜节律不稳定性候选标志物。* 在两个队列中,变异性随症状严重程度组别增加而增加,但这些发现是假设生成性的,不构成因果证据或直接的跨队列重复。*

总体而言,生物标志物发现框架为心理健康识别出41个候选数字生物标志物,为代谢结局识别出25个。虽然效应量反映了被动感知数字表型研究典型的适度量级,但将这些由生物标志物发现框架衍生的特征与人口统计学变量相结合,在加入人口统计学特征后提升了预测性能(抑郁症的ΔR² = 0.040,胰岛素抵抗的ΔR² = 0.021)。

生物标志物发现框架概述。 左图:* 生物标志物发现框架还在数据科学和健康基准上进行了评估,在每个基准上均取得了与最强基线相竞争的性能。* 右图:* 在一项盲法人类专家评估中,生物标志物发现框架在各项质量维度上获得了最高的平均分。*

为评估稿件质量,15位来自医学、生物医学数据科学、机器学习、生物信息学和数字健康领域的专家评审了来自生物标志物发现框架和三个当代AI研究系统(Google DeepMind的AI co-scientistBiomniGoogle ADK的Data Science Agent)的盲法报告。生物标志物发现框架、Biomni和Data Science Agent在21次评审中一起评分,而生物标志物发现框架在另外13次评审中使用相同的评估工具单独评分。

在盲法评估中,生物标志物发现框架在所有七个质量维度上获得了最高的平均分。在该研究的模拟编辑评分标准下,它是唯一获得任何“接受”或“小修”建议的系统:2个接受,8个小修,8个大修,3个拒稿。评审者估计,他们平均会保留生物标志物发现框架生成稿件内容的56.9%,而基线为18.8%–30.4%,并且在13次四系统排名评审中有9次将生物标志物发现框架排在第一位。

盲法人类评估。(a) 生物标志物发现框架在所有七个质量维度上获得了最高的专家平均分,在统计有效性和合理性方面表现突出。(b) 编辑决定分布显示,生物标志物发现框架是唯一从专家小组获得非拒稿(接受/小修)决定的系统。

随着可穿戴健康数据在人群中持续规模化,数字医学的瓶颈不再是数据收集,而是有原则、严谨的假设生成。仅扩展模型能力并不能解决科学严谨性问题。然而,当部署在一个精心构建的架构中,将确定性计算与生成式推理分离,并迫使智能体对其发现进行防御性辩论时,AI可以在人类监督下支持结构化的假设生成、验证和优先级排序。通过从黑箱自动化转向透明的人类在环工作流程,我们可以构建能够安全加速临床研究中假设到验证周期的AI系统。

本博客文章由 Google Research 的 Yubin Kim、Hamid Palangi 和 Daniel McDuff 撰写。这项工作由 MIT 博士生 Yubin Kim 在 Google 实习期间主导,指导教师为 Daniel McDuff 和 Hamid Palangi。我们感谢来自 Google Research、Google DeepMind 和学术界的共同作者与合作者对本工作的贡献。