返回 文章 学习 CMS 文章

Mistral 发布 Robostral Navigate:单 RGB 摄像头实现 76.6% 导航成功率

一个 8B 模型仅凭单 RGB 摄像头,在复杂环境中实现最先进的指令跟随导航。

具身AI机器人导航单摄像头Mistral AI
成长分 / 100 71 综合收获、行动、留存与影响

Mistral 发布 Robostral Navigate:单 RGB 摄像头实现 76.6% 导航成功率
为什么值得读了解如何用单摄像头替代 LiDAR、深度传感器和多摄像头方案,降低机器人导航硬件成本。

学习指向导航、前缀缓存训练和在线强化学习等关键技术如何协同提升性能。

关键洞察
  1. Robostral Navigate 在 R2R-CE 验证未见集上达到 76.6% 成功率,比最佳单摄像头方法高 9.7 个百分点,比使用深度或多摄像头的最佳系统高 4.5 个百分点。
  2. 模型仅使用单个 RGB 摄像头,无需 LiDAR 或深度传感器,且对摄像头内参差异具有鲁棒性。
  3. 通过指向预测下一步移动位置,使策略对摄像头内参和世界尺度变化自然鲁棒;当目标不在视野内时回退到局部坐标系位移。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:6746

介绍

Robostral Navigate

思考

摘要

Robostral Navigate 是一个 8B 模型,仅使用单个 RGB 摄像头即可让机器人自主导航复杂环境,在未见过的 R2R-CE 基准测试中达到 76.6% 的成功率——超越多传感器方法,同时更高效。完全内部构建,使用模拟数据和令牌高效技术,它能够跨机器人类型泛化,并适应训练中未见过的真实世界障碍物。该模型将基于指向的导航与强化学习相结合,以实现持续改进,为机器人领域的统一具身 AI 铺平道路。

今天我们推出 Robostral Navigate,这是我们首个为具身导航构建的模型。它是一个 8B 模型,接收 RGB 图像和纯语言指令,并让机器人在环境中移动:

“离开大厅,穿过走廊,进入供应室,并停下来面对第二个货架。”

为了执行此类任务,其他模型通常采用深度传感器、LiDAR 或多个摄像头协同工作。Robostral Navigate 仅使用一个普通 RGB 摄像头,没有深度传感器,但在 R2R-CE(连续环境中的房间到房间)验证未见集上仍达到 76.6%,这是在训练中保留的环境中遵循指令的基准。因此,它比最佳单摄像头方法高出 9.7 个百分点,比使用深度或多摄像头的最佳系统高出 4.5 个百分点,尽管两者均未使用。

导航

我们的模型专为机器人导航设计,使机器人能够自主导航复杂环境,包括办公室、住宅和商业建筑以及户外环境。

Robostral Navigate 在一个工作办公室中完全自主地运行一条长视野指令路线。

这项技术为制造业、配送、物流和酒店业解锁了众多应用,使其成为我们客户当今最需求的能力之一。给 Robostral Navigate 一条指令,它就能自行完成整个任务,在充满人和从未展示过的障碍物的实时空间中移动,能够适应任何环境。

亮点

在 R2R-CE 上达到最先进性能

79.4% 成功率在验证可见集上76.6% 成功率在验证未见集上

仅使用单个 RGB 摄像头运行,无需 LiDAR 或深度传感器

8B 模型,内部构建并完全在模拟中训练

可在轮式、腿式和飞行机器人上运行,并跨机器人尺寸泛化

对摄像头内参差异具有鲁棒性

通过前缀缓存实现令牌高效训练

通过指向进行导航

给定任务和观察历史,Robostral Navigate 通过指向预测机器人下一步应移动到哪里:它推断机器人当前摄像头视图中目标位置的图像坐标,以及到达时的期望方向。与依赖度量位移的命令不同,指向使策略自然对摄像头内参和世界尺度的变化具有鲁棒性。

然而,这种方法无法处理目标位置位于当前视野之外的情况。当指向不适用时,模型回退到机器人局部坐标系中的位移,例如:

“向前移动 2 米,向左移动 1.5 米,然后左转 25 度。”

从头构建

Robostral Navigate 完全内部构建,不依赖现有的开源 VLM。

该模型从我们专为指向、计数和物体定位等 grounding 任务打造的视觉语言模型初始化而来。导航能力是这些能力的自然延伸:一旦它理解了物体的位置,它就能学会如何移动。

我们完全在仿真环境中构建了一条高效的数据生成流水线。这使我们能够对数据进行快速迭代,最终构建了一个包含约 240 万条轨迹、覆盖 35 万个场景 的数据集。

高效监督训练

Robostral Navigate 的一个关键要素是基于前缀缓存(prefix-caching)的高效训练算法。通过基于树的注意力掩码策略,我们的方法将整个 episode 压缩为单个序列,从而能够在单次前向传播中训练所有时间步,同时防止时间步之间的信息泄漏。

与每个时间步训练一个样本相比,我们的方法在保留所有学习信号的同时,将训练 token 数量减少了 22 倍。在实践中,该方法将原本需要数月的训练运行转变为数天即可完成的运行。在线强化学习

我们利用在大规模 LLM 后训练方面的知识,使用在线强化学习来提升 Robostral Navigate 的性能。在监督训练阶段之后,我们使用 CISPO(一种在线强化学习算法)进一步提升模型性能。这使模型能够从试错中学习、从失败中恢复,并获得探索性行为,有效缓解了普通行为克隆的分布偏移问题。仅此一项就将成功率提升了 3.2%。我们尚未看到任何平台期,因此我们相信更多的训练和更多的实验将继续推高这一数字。

下一步

Robostral Navigate 只是迈向统一具身智能体的第一步。

我们相信导航是通用机器人技术的一项基础能力。通过结合大规模仿真、高效训练和强大的 grounding 先验,Robostral Navigate 证明:仅凭一个紧凑模型和单个 RGB 摄像头,就能实现最先进的具身导航。

开启你的具身前沿 AI 之旅,与我们的团队交流

顺便说一句,我们正在招聘!

我们导航模型的发布标志着向前迈出了重要一步,但我们的旅程远未结束。我们的目标是让机器人能够在复杂环境中自主导航——办公室、家庭、商业建筑和户外空间——还有很多工作要做。我们正在积极扩充机器人团队,寻找与我们拥有共同抱负的优秀研究科学家和工程师。

如果你有兴趣加入我们,共同实现为各地机器人带来无缝导航的使命,我们欢迎你申请加入我们的团队!

作者:Théo Cachet、Arjun Majumdar、Srijan Mishra、Thomas Chabal、Chris Bamford、Elliot Chane-Sane、Benjamin Tibi、Ludovic Ho Fuh、Olivier Duchenne - AI Science Robotics

技术报告

阅读 ** **Robostral Navigate 技术报告,了解完整架构、训练设置和基准测试结果。