返回 文章 学习 CMS 文章

ME-POIs:用移动性数据让语言模型更懂场所

用移动性数据为语言模型补充场所的动态功能节律,显著提升地理空间属性预测。

地理空间AI语言模型移动性数据场所表示
成长分 / 100 72 综合收获、行动、留存与影响

ME-POIs:用移动性数据让语言模型更懂场所
为什么值得读了解如何将移动性数据从预测输出转变为定义场所的输入特征,突破传统静态元数据的局限。

掌握 ME-POIs 的三步流程(访问对齐、空间多尺度访问传播、文本-移动性协同)及其解决长尾问题的机制。

关键洞察
  1. 场所具有双重特征:纸面上的身份(名称、类别)与实际的功能节律(聚合访问足迹),传统语言模型仅依赖静态元数据。
  2. ME-POIs 通过自监督方法将文本描述与大规模匿名化移动模式融合,生成同时编码身份与动态功能的数值向量表示。
  3. 空间多尺度访问传播机制通过从数据丰富的邻居转移聚合访问模式,缓解长尾场所的数据稀疏问题。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:9642

2026年8月21日

Maria Despoina Siampou 和 Shushman Choudhury,Google Research 研究科学家

我们提出了一个动态的、基于移动性的框架,使 AI 模型能够理解场所在时间维度上的活动节律,并借此显著改进对营业时间、价格水平、繁忙程度等现实世界属性的预测。

人工智能在通过文本理解世界方面取得了令人难以置信的进展。然而,要构建真正理解物理世界的 AI 模型,它们必须理解的不只是文字:它们需要捕捉建成环境中动态的、真实世界的功能。每个场所都有两种截然不同的特征:纸面上的身份,以及其实际的功能节律。

传统的语言模型通常严重依赖静态元数据来构建场所(通常称为“兴趣点”或 POI,无论是商家,还是公园、地标之类的场所)的表示。它们能够成功分析地址、业务类别和文本描述。尽管像 Gemini 这样的世界级语言模型在处理文本数据方面极为擅长,但通过纳入城市环境中真实世界的功能动态,它们的地理空间表示可以得到显著丰富。用移动性数据补充语义标签,可以使这些模型有效捕捉城市中 POI 独特的时间活动节律。

为了展示这种互补能力,我们提出了 Mobility-Embedded POIs(ME-POIs),这是一个新颖的框架,可改进语言模型生成的基于文本的场所表示。ME-POIs 使用公开可用的基准数据集,纳入经过聚合和匿名化的移动模式,例如到达时间、停留时长和周边移动模式。ME-POIs 不把场所视为一组冻结的词语,而是采用自监督方法,将文本描述与来自公共基准的大规模匿名化移动模式(捕捉环境中全天聚合的空间活动足迹)相融合。通过这种方式,模型构建出一种数值向量表示(一种数学上的“签名”,技术上称为嵌入),同时编码了场所的身份及其动态功能。将 ME-POIs 与先进的文本模型相结合,带来了上下文优势,在预测访问意图方面取得了高达 81.9% 的相对提升,在价格水平分类方面提升了 75.1%,在繁忙程度估计准确率方面提升了 24.7%,且适用于未见过的场所。

通过提供预先丰富的场所表示,ME-POIs 框架使 AI 模型能够更轻松地就许多不同属性——例如营业时间、目标价格水平和当前营业状态——做出准确推断,而无需每次都从头计算这些属性。

要构建对场所有更深入理解的模型,我们必须区分场所的身份(其名称和类别)与功能(其聚合的访问足迹)。在以往的地理空间 AI 研究中,移动模式几乎只被用于预测用户下一个将访问的 POI。相比之下,ME-POIs 框架将移动性从输出预测任务转变为定义场所本身的输入特征。

但是,如何将原始的地理点转化为一个干净且数值上有用的数学签名(或嵌入)?我们通过一个三步流程来实现这一点:访问对齐、空间多尺度访问传播和文本-移动性协同。

ME-POIs 框架将静态文本元数据(POI 身份)与来自公开基准数据集的动态访问模式(POI 功能)相结合,以创建对地点的全面表示。

该模型将特定 POI 的聚合访问视为基本数据点。它分析时间到达窗口、离开趋势和典型停留时长。时间编码器不是计算简单的平均值,而是将这些时间序列映射到一个密集的向量空间。这个过程建立了一个“功能质心”——一个独特的多维签名,映射了与特定地点相关的、在一年周期内和不同星期几的聚合匿名移动模式。

地理空间数据科学中一个持续存在的挑战是“长尾”问题。虽然著名地标、大型购物中心和热门市中心连锁店产生了大量的访问数据,但绝大多数本地企业——小型社区精品店、专业维修店或新开的咖啡馆——都遭受严重的数据稀疏性。以前,当模型遇到一个记录很少或没有访问记录的地点时,它会错误地假设该地点的活动为零,导致预测中断。

ME-POIs 通过一种新颖的空间多尺度访问传播机制解决了这个问题。该架构认识到访问通常受到区域限制;高端购物街上的一家小精品店与其邻居共享系统性的行为特征。该框架在多个空间尺度上查看相邻地点:紧邻的街道、街区和更广泛的社区。然后,它统计地将繁忙、数据丰富的邻居的聚合访问模式转移到附近稀疏的地点。通过从活跃区域学习区域“节奏”,该模型将智能的地理先验知识库应用于较小的商店,使其即使在数据中很少或没有出现的情况下也能了解它们的一些信息。

ME-POIs 框架不是丢弃文本描述,而是丰富它们。它通过最大化高级语言嵌入(从 Gemini 等高级模型中提取的标准向量表示)与新生成的移动向量之间的余弦相似度来实现这一点。我们将移动信号直接叠加在语言表示之上,创建对地点或企业的更全面的视图。

这种混合方法确保模型保留结构语义(例如,从其文本描述中知道一个地方出售食物),同时吸收其操作上下文(例如,从其移动签名中知道它是作为午餐地点还是深夜餐厅运营)。

为了评估 ME-POIs 是否真正实现了对物理地点的广义、属性无关的理解,我们在两个大型、文化上不同的大都市区进行了广泛的测试:洛杉矶和休斯顿。

我们在五个不同的任务上评估了该框架。至关重要的是,为了证明模型发展出的是通用智能,而不仅仅是记忆局部模式,我们在一组已观测的地点上训练该框架,然后要求它在完全未见过的地点上预测属性。

五个下游任务如下:

为了建立基线,我们将 ME-POIs 框架与标准的纯文本嵌入模型(如 Gemini embeddings)、现有的基于轨迹的地理空间模型(如 TrajGPT)以及混合变体进行了比较,以精确分离出移动模式为等式增加了多少价值。

实验结果令人瞩目,证实了将真实世界的移动数据添加到现有文本模型中会提供明显的“上下文优势”。在评估模型在未见过的测试地点上的性能时,ME-POIs 的集成带来了显著的准确率提升,在所有预测任务上始终优于纯文本和基于移动的基线。

添加 ME-POIs 持续提升了所有任务上的模型性能,在访问意图和价格水平分类等关键指标上显著优于基线模型。

除了优于标准基线之外,最引人注目的发现之一出现在将仅基于移动数据训练的模型与仅能访问文本元数据的模型进行比较时。在若干情况下,例如在价格水平分类中,仅基于移动的模型超越了纯文本语言模型。这揭示了关于城市动态的一个引人入胜且常被忽视的事实:我们在物理场所的集体行为往往比用来标记它的正式词语更具描述性。

通过成功超越静态数字标签,ME-POIs 框架展示了一种使 AI 能够建模和理解物理世界的新方法。需要强调的是,该框架侧重于在聚合层面理解世界——它无法得出关于个体用户或任何个性化内容的结论。也就是说,ME-POIs 框架可以提供地点或企业的整体表示,捕捉其在广泛人群和时间范围内被访问的方式;它不能用于个体个性化。相反,其力量在于创建丰富的聚合数值签名,从而在下游系统需要对这些地点进行推断时减轻其计算负担。

最终,ME-POIs 为真正理解我们城市节奏的 AI 模型奠定了基础。它也是我们更广泛的 Google Earth AI 工作的一部分,该工作旨在创建地理空间模型和数据集,将行星数据转化为可操作的智能。

我们感谢本文的合著者:Neha Arora(Google Research),以及南加州大学(USC)的 Cyrus Shahabi 教授和博士生 Shang Ling Hsu。