返回 文章 学习 CMS 文章

GlucoFM:面向连续血糖监测的双流自监督基础模型

GlucoFM 用双流自监督预训练把 CGM 信号拆成慢趋势与快偏差,在有限标注下刷新多项代谢预测任务表现。

连续血糖监测基础模型自监督学习双流架构
成长分 / 100 76 综合收获、行动、留存与影响

GlucoFM:面向连续血糖监测的双流自监督基础模型
为什么值得读了解如何用自监督基础模型从稀缺标注的 CGM 数据中提取可迁移的代谢表征。

掌握双流设计、潜在预测目标与 CGM 感知增强等具体建模选择及其消融证据。

关键洞察
  1. CGM 并非无差别数据流,显式分离缓慢基线趋势与短期偏差的双流编码器优于单流设计,仅事件版本表现最弱。
  2. GlucoFM 在 14 项队列-任务评估中将平均 PR-AUC 从最强 CGM 专用基线的 54.7 提升至 58.8,绝对增益 4.1 个百分点。
  3. 在餐后血糖反应预测中,GlucoFM 取得最低平均 MAE 21.88 mg/dL,优于最佳基线的 22.90 mg/dL 和训练折均值基线的 27.69 mg/dL。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:14802

2026年8月26日

Ahmed A. Metwally,资深研究科学家;Zechen Li,学生研究员,Google Research

GlucoFM 是一种轻量级、自监督的 CGM 基础模型,它在独立的流中分别对较缓慢的血糖趋势和短期偏差进行建模,从而生成可迁移的表征,并在多种代谢预测任务中树立了新的性能标准,包括糖尿病风险评估、胰岛素抵抗、β细胞功能障碍以及餐后血糖反应。

消费级可穿戴设备利用运动和生理传感器来估算活动与睡眠,但这些信号只能间接反映血糖调节情况。连续血糖监测仪(CGM)通过一个插入皮下的小型传感器每隔几分钟追踪组织间液葡萄糖,从而补充这些测量,捕捉空腹、夜间和餐后模式。然而,解读这些轨迹仍然具有挑战性,尤其是当有助于解读它们的高质量临床标签稀缺且获取成本高昂时。

许多现有的 CGM 基础模型——包括 CGMformerGluFormerCGM-JEPA——通过单一表征流处理血糖,而不是明确区分缓慢的基线和短暂的事件动态。但 CGM 并非无差别的数据流:它包含相对缓慢的基线模式,其间穿插着可能反映进餐、活动或传感器伪影的短期偏差。如果我们能够利用日常 CGM 数据,在有限标注数据的情况下估算诸如糖尿病风险胰岛素抵抗β细胞功能障碍之类的情况,那会怎样?

这就是我们构建 GlucoFM 的原因,它是一个自监督基础模型,采用双流设计,将较慢的血糖趋势与短期偏差分离,同时保留一天中的时间和缺失情况。潜在预测目标随后学习它们的日常背景和时间演变。我们在四个不同队列中对 GlucoFM 进行了评估,涉及七项临床预测任务——糖尿病风险胰岛素抵抗β细胞功能障碍高脂血症低血糖肥胖血糖型——共计14项队列–任务评估。在这些评估中,GlucoFM 的 PR-AUC 平均比所评估的表现最佳的 GluFormer 变体高出5.8个百分点,两者均在相同语料库上预训练。在 PR-AUC 上,GlucoFM 在所有糖尿病风险和β细胞功能障碍评估以及四项胰岛素抵抗评估中的三项中领先。我们还在餐后血糖反应(PPGR)预测上评估了 GlucoFM。在匹配输入和评估协议下,GlucoFM 在两个 CGM 设备(DexcomLibre)上平均取得了最低的平均绝对误差(MAE)。此外,GlucoFM 取得了最佳的总体跨数据集迁移性能,并展示了强大的少样本适应能力,即使来自新队列或标记受试者的数据极其有限。

GlucoFM 概述,一个用于连续血糖监测的轻量级双流基础模型。

我们在来自 Wear-CGM 的109,066小时未标记 CGM 数据上预训练了 GlucoFM

CGM 记录可能包含缺口、不同的采样间隔和传感器伪影。GlucoFM 将每条记录对齐到24小时、五分钟的网格,并保留观察掩码,使已测量和未观察的位置保持区分。其双流编码器将代表较慢血糖趋势的低频状态分量与捕捉可能来自生理、行为或传感伪影的短期偏差的残差事件分量分离。

GlucoFM 不是重建可能受测量噪声和传感器伪影影响的精确原始血糖读数,而是使用具有两个互补任务的潜在预测预训练:

最后,CGM 感知增强引入基线漂移、类压缩下降、更稀疏采样和短暂断开,使模型暴露于真实 CGM 记录中遇到的变化和缺失。

GlucoFM 的模型框架和预训练目标。

我们在四个队列(CGMacrosStanfordHallShanghaiT2DM)以及七项临床预测任务上评估了 GlucoFM,并单独评估了餐后两小时血糖反应预测。具体而言,我们探究了其冻结表征是否对来自未见参与者的单个 24 小时窗口具有信息量;它们是否为预测餐后血糖轨迹提供了有用的历史背景;结合多天数据是否能改善受试者级别的预测;这些表征迁移到新队列的效果如何;以及在标记数据有限时它们的适应效果如何。

首先,我们使用了受试者不相交的窗口级线性探测。我们冻结每个模型的编码器,在单个 24 小时表征上训练线性分类器,并确保没有参与者在训练和测试折中同时出现。这测试了单日表征是否对未见参与者具有表型信息量,同时保留日间变异性。

GlucoFM 在评估方法中取得了最强的任务平均 PR-AUC。在 14 项队列-任务评估中,它将平均 PR-AUC 从在同一数据上重新训练的最强 CGM 专用基线的 54.7 提高到 58.8——绝对增益 4.1 个百分点,相对于该基线约 7.5%。GlucoFM 在所有糖尿病风险和 β 细胞功能障碍评估中以及四项胰岛素抵抗评估中的三项中取得了最高的 PR-AUC。

代谢表型线性探测性能。

为了在动态预测任务上测试 GlucoFM,我们使用每次记录餐食前可用的信息来预测相对于餐食开始值的完整两小时血糖变化轨迹。我们使用受试者不相交的交叉验证评估了来自 34 名参与者的 874 个配对餐食事件,其中 Dexcom 和 Libre(两种 CGM 设备)在相同划分下分别建模。

我们逐步将每个冻结模型表征与餐前一小时 CGM、餐食营养——包括能量、碳水化合物、脂肪、蛋白质和膳食纤维——以及参与者级别信息(如空腹血糖、BMI 和糖尿病状态)相结合。在完整背景下,GlucoFM 在评估模型中取得了最低的平均 MAE:21.88 mg/dL,而最佳基线为 22.90 mg/dL,训练折均值基线为 27.69 mg/dL。这些结果表明,GlucoFM 为预测餐后血糖变化提供了互补的历史背景。

渐进式背景改善 2 小时全轨迹餐后血糖反应预测。从每个冻结模型表征开始,输入被累积添加:餐前 1 小时 CGM、餐食营养、空腹血糖以及 BMI 加糖尿病状态。平均 MAE(mg/dL;越低越好)是在配对的 Dexcom 和 Libre 评估中取平均。

单次 24 小时监测可能无法完整捕捉一个人的血糖模式,因此我们测试了将多天数据结合是否能改善受试者层面的预测。GlucoFM 分别对每一天进行编码,并在最多七天范围内对表征取平均,每位参与者贡献相同权重。

如下图所示,在大多数数据集的多数设置下,增加天数都提升了 PR-AUC,包括 Stanford 胰岛 β 细胞功能障碍提升 9.6 个百分点,以及 Hall 糖尿病预测提升 14.0 个百分点。CGMacros 在 Dexcom、Libre 和融合传感器数据上也大多呈现正向增益。ShanghaiT2DM 胰岛素抵抗是简单平均下的主要例外,这表明最佳聚合策略可能因任务而异。总体而言,GlucoFM 的冻结每日表征可以组合起来,在无需重新训练编码器的情况下增强受试者层面的预测。

𝐾 天 CGM 观测的效果。正值表示相对于 𝐾 = 1 的改善。

接下来,我们想知道我们的模型学到的生理模式是否能够泛化。如果我们使用来自一个临床队列的数据训练一个下游分类器来识别糖尿病风险,它在来自完全不同研究的患者身上是否仍然有效?跨数据集迁移柱状图突出展示了 GlucoFM 如何应对这一挑战,具体绘制了其在糖尿病风险和胰岛素抵抗方面相对于第二佳模型的直接提升。

在下图中,正值柱表示 GlucoFM 优于最强的竞争方法:它在 12 项评估中的 11 项领先 0.5 – 8.6 个 PR-AUC 百分点,并在一次中落后 0.6 个百分点。其绝对 PR-AUC 范围从 StanfordHall 两项任务的 61.6%,到 HallCGMacros 胰岛素抵抗的 90.0%,表明对底层生理的关注有助于冻结表征越过队列特异性噪声,找到通用的代谢模式。

跨数据集迁移性能。GlucoFM 与最强基线之间的 ΔPR-AUC。

标注临床数据获取成本高昂,因此我们还在两种少样本设置下测试了 GlucoFM:左图改变每类有标注参与者的数量,右图改变每位参与者可用观测的比例。向右移动会增加标注数据,点越高表示任务平均 PR-AUC 越好。

橙色 GlucoFM 标记在每个评估的数据预算下都是最高的,包括每类一个样本和 1% 观测的最有限设置。当有标注受试者稀缺时,这一优势尤为明显,表明该模型即使只有少量样本也能高效地捕捉到正确的信号。

在有限标注受试者和有限每受试者观测下的少样本适应。

我们还仔细研究了将信号拆分为两路是否真的带来了差异。我们将完整的双流设计与更简单的替代方案进行了比较:一种直接处理原始血糖数据,一种旨在强调较慢的趋势,还有一种旨在强调较快的短期偏差。

正如我们的编码器设计分析所示,“仅事件”版本表现最弱,证明仅靠瞬时波动不足以构建稳定的代谢图景。虽然原始输入和“仅状态”版本也具有竞争力,但完整的双流模型始终名列前茅。这些结果支持将较慢和较快的血糖动态组织为互补的两路,然后再进行融合,而不是依赖任何单独一路。

双流与单流设计的性能对比。

我们的结果表明,CGM 模型可以从显式考虑血糖动态的多尺度结构中受益,包括较慢的趋势、短期偏差、每日时间以及传感器缺失。通过从未标注的 CGM 中学习可复用的模式,GlucoFM 生成的表征在所评估的预测、迁移和少样本设置中均表现强劲,为更好地利用有限的标注临床数据提供了一种途径。

代谢反应因人、因队列、因传感器设备而异,而我们当前的预训练人群规模仍然有限。我们的下一步是在更大、更多样化的人群上进行训练,并将 GlucoFM 从独立处理的 24 小时窗口扩展到原生的多天建模,以捕捉数周或数月内展开的趋势,并探索这些表征如何处理实时变化。关于代谢健康,仍有太多需要学习,我们很期待看到这些工具接下来将带我们走向何方。

以下研究人员为本工作做出了贡献:Zechen Li、Keerthana Natarajan、Weizhi Zhang、Simon A. Lee、Yuwei Zhang、Maxwell A Xu、Menglian Zhou、Zeinab Esmaeilpour、Flora D. Salim(来自新南威尔士大学)、Mark Malhotra、Lindsey Sunden、Shwetak Patel、Yuzhe Yang 和 Ahmed A. Metwally。

我们衷心感谢 Bobak J. Mortazavi 和 Ricardo Gutierrez-Osuna(德克萨斯 A&M 大学)提供了本研究中使用的 CGMacros* 数据集。*

两项 Wear-CGM 研究均获得了 Advarra 的批准(IRB 编号 Pro00059582 和 Pro00069880),参与者为去标识化的二次研究和算法开发提供了书面知情同意。已发布的数据集是在各自的伦理批准和同意程序下收集的。