返回 文章 apply CMS 文章

Runway GWM-Robotics:用通用世界模型加速机器人策略评估

GWM-Robotics 世界模型能以 0.95 的相关系数模拟机器人策略排名,替代部分硬件测试。

世界模型机器人策略评估模拟到现实GWM-Robotics
成长分 / 100 76 综合收获、行动、留存与影响

为什么值得读了解如何用视频生成模型替代物理硬件进行机器人策略评估,大幅降低测试成本。

掌握 GWM-Robotics 在八种策略上的模拟-真实相关性结果,以及与传统方法 PolaRiS 的对比。

关键洞察
  1. GWM-Robotics 在八种机器人操作策略的模拟与真实世界评分间达到 0.95 皮尔逊相关系数。
  2. 在 PolaRiS 评估过的子集上,GWM-Robotics 相关系数达 0.986,排名完全一致(MMRV=0),优于 PolaRiS 的 0.98。
  3. GWM-Robotics 仅需起始图像作为输入,而 PolaRiS 需要扫描、重建和手动物体设置。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:7225

使用通用世界模型加速机器人策略评估

如今测试机器人策略需要部署到物理硬件上,这一过程缓慢、昂贵且难以扩展。传统模拟器提供了一种替代方案,但常常无法迁移到现实世界,难以捕捉真实环境的视觉和物理复杂性——从可变形物体和软材料到违背标准物理假设的非刚性动力学。一个能够可靠预测现实世界结果的世界模型,可以从根本上改变机器人团队评估和迭代策略的方式。

去年12月,我们发布了GWM-Robotics,它使得无需物理硬件即可在世界模型内部进行策略评估。在此,我们对其进行了测试:我们在GWM-Robotics中模拟了八种机器人操作策略,并将结果与现实世界的地面真值进行了比较。在所有八种策略中,模拟与现实世界的评分相关性达到0.95,这表明我们的世界模型可以作为在投入硬件部署前评估机器人策略的可靠代理。

我们的早期结果表明,世界模型模拟可以作为硬件评估的实用替代方案,其性能优于现有的真实到模拟方法。GWM-Robotics优于PolaRiS,后者是一种最新的真实到模拟框架,使用3D高斯泼溅重建特定的现实世界场景——这一过程涉及扫描、重建和手动物体设置。与PolaRiS不同,GWM-Robotics仅需起始图像作为输入。此外,GWM-Robotics可以实时生成长达30秒的长时间推演——远长于类似的世界模型如Veo Robotics,后者仅限于8秒推演。

我们正在与包括NVIDIA和Berkshire Grey在内的合作伙伴共同构建GWM-Robotics,以扩展用于物理AI的世界模型。在此申请访问权限

模拟成功

模拟失败

方法:评估机器人操作的模拟到现实相关性

在本研究中,我们从RoboArena基准测试中选取了涵盖八种视觉-语言-动作策略的操作任务,所有推演均使用Franka Emika Panda机械臂。我们使用GWM-Robotics模型(我们最先进的Gen-4.5视频生成模型的一个变体)从相同的初始条件模拟每种策略,每种策略根据世界模型产生的观测生成自己的动作。然后,我们请人类评分员评估机器人在1,450次模拟推演中朝着每个任务指令取得的进展——所有这些推演均来自RoboArena数据集中先前的任务评估。总共,我们收集了超过16,000个独立评分,每次推演由约10名独立评分员评估。通过比较每种策略在模拟推演和现实世界推演中取得的进展,我们衡量模拟结果反映现实世界相对性能的程度。

结果

真实成功率与 GWM-1 模拟成功率对比(按策略)

我们看到 GWM-Robotics 生成的模拟 rollout 能够实现可靠的策略排序。遵循 PolaRiS,我们使用皮尔逊相关系数来量化真实世界与模拟进度分数之间的一致性,并使用平均最大排名偏差(MMRV)来衡量两者之间的排名一致性。聚合人类评估者在模拟 rollout 中的进度分数后,得到的策略排名与真实世界排名的皮尔逊相关系数为 0.95,平均最大排名偏差(MMRV)为 0.033,这意味着任意一对策略之间的最坏情况排名误差可以忽略不计。当限定在 PolaRiS 中也评估过的 RoboArena 策略架构子集时,GWM-Robotics 的皮尔逊相关系数为 0.986,MMRV 为 0——超过了 PolaRiS 的 0.98 相关系数,并匹配了其完美的排名顺序。人类评估者正确识别了表现最好的策略(pi05_droid)和表现最差的策略(paligemma_binning_droid),而其余六个策略仅在表现相似的模型之间出现了微小的排名反转。

局限性与未来展望

本研究评估的是策略排名——即模拟结果是否保持策略的相对顺序——而非绝对成功率预测。虽然排名对于实际策略选择最为重要,但缩小绝对校准方面的差距仍是一个活跃的研究领域。

我们在此的评估范围仅限于使用单机器人臂(Franka Panda)在 RoboArena 基准测试任务上的桌面操作。尽管 GWM-Robotics 已在多种形态上进行了训练,但将我们的评估扩展到这些形态是重要的下一步。由于该模型建立在基于大规模视频而非单机器人模拟器的基础之上,因此与传统方法相比,它能够以显著更少的机器人特定数据泛化到新的形态。

结论

这些结果——涵盖八种不同策略和超过 16,000 次人类评估——表明,我们在大规模视频数据上训练并在机器人本体感知状态上微调的学习世界模型,能够以与真实世界执行相同的顺序可靠地对机器人策略进行排序。这对机器人团队如何构建和测试策略具有直接影响:

更快交付:团队无需在硬件上测试每个候选策略,而是可以在模拟中对策略进行排序,并将物理测试集中在表现最佳的策略上。无需手动构建即可大规模测试:团队可以在不同的光照、物体配置和任务设置下进行评估,而无需在物理实验室中手动重建每个场景。用更少的真实世界数据进行训练:通过改变物体、环境和条件,可以扩展少量真实演示——从而在不增加数据收集的情况下提高泛化能力。

我们相信,构建最佳的机器人世界模型需要在捕捉真实世界物理和交互多样性的海量数据上进行训练。这些结果支持了这一方法。随着我们扩展训练数据和计算规模,世界模型的保真度将持续提升,每一代都将缩小模拟与现实结果之间的差距。GWM-Robotics 是第一步,这些早期结果加速了我们在机器人研究方面的投入,因为我们专注于为当今客户创造价值。

GWM-Robotics 是一个在真实世界视频(包括来自 NVIDIA 的物理 AI 数据集)上训练的世界模型。我们正与领先的物理 AI 公司(包括 NVIDIA 和 Berkshire Grey)合作,将 GWM-Robotics 集成到他们的训练和评估流程中。在此申请访问权限。