返回 文章 学习 CMS 文章

机器人自主等级:从脚本化运动到通用劳动力的五级演进

机器人自主等级框架:0级脚本化运动→1级智能拾取放置→2级自主移动→3级低技能操作→4级力依赖任务,当前2级已早期生产,3级试点中。

机器人自主等级通用机器人自动化人工智能
成长分 / 100 80 综合收获、行动、留存与影响

机器人自主等级:从脚本化运动到通用劳动力的五级演进
为什么值得读首次提出行业统一的机器人自主等级分类,为理解机器人能力演进提供清晰框架。

基于大量行业调研、公司访谈和会议,数据详实,分析当前部署、经济性和挑战。

关键洞察
  1. 0级机器人(脚本化运动)是工业自动化基石,但缺乏自主性,集成成本高达机器人本身的4-6倍。
  2. 1级(智能拾取放置)在2015-2022年尝试商业化,但受限于数据不足、AI初生和高成本,仅包裹分拣等利基市场可行。
  3. 2级(自主移动)借助基础模型和模拟训练实现开放世界导航,已在建筑、油气、基础设施等场景早期生产。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:68440

机器人自主等级

单一用途机器人自动化数百种工作,低自主性的拾取和放置成本高昂,通用自主性导航和检查大型场地,在早期试点中瞄准低技能劳动力并展现前景,研究中的自主性能够完成任何任务

几十年来,机器人驱动着制造业,但它们始终是单一用途的,并且仅在理想环境中蓬勃发展。以往对智能机器的尝试承诺过多而交付不足。但它们出现得太早了。如今,现代人工智能范式将大多数机器人障碍转化为数据问题,并将机器推向曾经被认为不可能的能力。随着这些模型吸收现实世界的经验,机器人将提升现有技能,获得新技能,并更快部署,从而占据越来越大的劳动力份额。

能够准确执行任何领域任何任务的通用机器人现在已成为必然,大规模劳动力替代即将到来。然而,这些机器人将分阶段到来,逐步增加更多能力,直到所有任务都变得可行。为了衡量这一进展,我们首次提出了行业内的“机器人自主等级”,将机器人分为5个不同的等级。

每个自主等级由解锁的能力定义,并且每个等级依次建立在之前等级的基础上,以实现新的应用。为了将这些等级具体化,我们提供了基于数据的分析,涵盖当前部署、用例和经济性、当前挑战以及进展中的活跃领域。这些等级提供了一种任务细分方式,其中进展是累加的——机器人可能针对某一等级的任务,但仍能从其他等级开发的能力中受益。

我们的自主等级以商业可行性为界限——而不仅仅是可能性。机器人自主性与应用本质上是联系在一起的:只有通过通常不可逆的行动才能创造价值。因此,能力源于可靠性和能力。一旦可靠性得到验证,机器人还必须提供足够的吞吐量以证明其成本合理。

致谢

我们与顶尖科学家进行了广泛交流,调查了众多公司,参加了顶级行业会议,并深入研究了围绕当代机器人的相关研究,以开发这一分类体系。

我们深深感谢合著者的宝贵贡献:行业从业者Niko Ciminelli、Joe Ryu和Robert Ghilduta。我们从合著者Joe Ryu的框架中汲取灵感,以充实这一分类。没有外部专家的帮助,这个项目无法完成。

我们欢迎反馈:请随时联系我们,讨论关于我们新的自主等级分类的任何内容。您可以在大多数顶级行业活动中与我们见面,例如Humanoids Summit SF、CoRL、Humanoids 2025 Seoul等。

描述自主性

通往完全自主性的道路始于精确的单一用途系统。但通用机器人必须重新开始,学习观察、规划、交互并实现卓越的精确性。在此过程中,它们的能力、应用和挑战可能差异很大。每个等级都可以通过以下两个轴进行充分解释:自主性和灵巧性。

通过映射自主性和灵巧性的提升,该框架展示了已经取得的成就、该领域目前的状况以及未来几年可以期待的内容。

目前,通用机器人已经在第2等级的早期生产阶段工作,但基本上仍不为公众所见。在第3等级,通用机器人正在

在自动化低技能工作的早期试点阶段,并已展现出成效。虽然我们仍处于早期,但这一演进将以比大多数人意识到的更快的速度加速。

执行摘要

第0级:脚本化运动——机器人完全预先编程,需要静态环境和任务才能运行。

解锁:高精度、高重复性

能力:24/7自动化、高吞吐量

部署与用例(2025年):汽车和电子工厂的行业标准

第1级:智能拾取与放置——机器人能够识别不同位置的物品并拾取以进行分拣。

解锁:可泛化感知、可泛化抓取

能力:固定位置拾取与放置

部署与用例(2025年):在包裹物流中心采用以进行拾取与放置分拣,随着能力和集成的改进,在更多仓储市场中的渗透率增加

第2级:自主移动——机器人能够理解开放世界、导航并穿越各种地形。

解锁:高级规划、空间推理、稳健运动

能力:开放世界导航与穿越

部署与用例(2025年):用于检查和数据收集角色的早期生产阶段,例如建筑工地、油气精炼厂、关键基础设施等

第3级:低技能操作——机器人能够执行基本的、非关键的、低技能的任务。

解锁:可泛化操作

能力:高级拾取与放置、移动操作

部署与用例(2025年):在厨房、洗衣店、制造业和物流中的早期试点阶段

第4级:力依赖型任务——机器人能够执行需要力和重量理解的精细任务,例如从口袋中找手机、在正确的螺纹上拧螺丝等。

解锁:研究中

能力:精细、力依赖型任务、细粒度操作

部署与用例(2025年):研究中

第0级——脚本化运动

要理解机器人技术的转变,我们必须首先审视其出发点。当大多数人想到机器人时,他们想象的是第0级:几十年来主导工厂的自动化,帮助制造汽车、电子产品、飞机等。执行这些任务的机器人具有惊人的力量、速度和精度,但它们没有智能,仅通过严格的编程和完美的任务/环境来运行。完全缺乏自主性,它们主要是工业工程和资本支出的纪念碑。它们代表了僵化、单一用途的机器人世界,理解它们的本质对于看到向通用机器人技术的巨大转变至关重要。

当前视图

部署与考虑:被锁起来

在第0级,机器人缺乏自主感知和响应环境的能力,环境必须为它们完美设计。一切都以机器人的条件进行,其他一切和所有人都必须服从。

这导致了第0级部署的核心:“单元”。机器人生活在笼子里,出于多种原因和特殊设计而被围起来:

保护机器人周围的人类安全。这些机器人可能专为重物搬运而设计,使其非常强大。然而,缺乏计算机视觉和自主性意味着这些机器人不会适应其环境中的人类,并将继续其动作。相反,通常的安全措施包括急停按钮、光幕、控制屏障功能,但在复杂世界中,这可能不可靠。

足够确保人类安全

该隔离单元将机器人隔离,以限制可能改变其环境、定位或当前任务任何方面的外部干扰或扰动

每个隔离单元都针对机器人和位置进行定制,使得当前任务的安装和编程更加简单

0级的这种刚性将自动化变成了一个工业工程项目。一条新的大型汽车装配线成本可能高达1000万至6000万美元,并且需要数年时间才能建成。一位行业代表开玩笑说,这些项目有“生日”,需要多年才能完成。改造现有工厂更加困难,而对于一个独特的系统,集成成本极其昂贵。

集成成本:机器人本身成本的4到6倍

由于改造费用差异很大,让我们以一个具体场景为例:一个中型汽车工厂改造一条全新的、独特的白车身装配线——组装焊接框架。

通常,必须使用相同的系统集成商和机器人品牌+软件,以确保新系统不会破坏工厂的流程。最终的总集成成本大约是机器人本身成本的4到6倍。隔离单元的建造和部署、配置相关系统(如PLC、输送机/轨道、MES等)以及安装和测试都会产生高昂的费用。可以先建立一个原理验证(PoP),例如生产线的实体模型,来测试系统(大多数应该这样做),但除非是高度独特的情况(如制药),否则大多数会选择跳过。我们注意到,对于标准化的汽车解决方案,这一成本可能约为机器人资本支出的70%。

然而,这种巨大的成本和复杂性正是自动化历史上局限于汽车和电子等高产量、低混合行业的原因。它是资本充裕者的工具,并且常常使大多数中型或小型工厂无法实施任何自动化。相比之下,通用机器人旨在在后续级别中消除这些进入壁垒。

影响:效率和黑灯工厂

在0级,机器人已成为少数行业的普遍补充。汽车工厂每个工厂通常使用400到1000台工业机器人,有些甚至报告使用多达1650台。在电子制造业中,机器人使用较少,一个工厂大约有50到200台机器人。这些可能是执行运输的自主移动机器人、用于将零件静态安装到电路板上的SCARA机器人、用于铣削硬件零件的CNC机床,或用于机器看护的协作机器人。

汽车生产线可以在两年内收回成本,之后运营成本降低近75%。行业代表表示,在回收期之后,这些工厂就像“印钞”。有些工厂甚至每天可生产多达2000辆汽车,而仓库机械臂通常可以完成约10人的工作且不会疲劳。机器人执行0级任务的效率证明了亚马逊拥有数十万台机器人的合理性。例如,50台机器人可以完成200名工人的大型装配和操作工作,每项工作成本降低约73%。

这种模式的顶峰是“黑灯工厂”,即完全由机器人运行、无需照明的工厂。发那科的一位代表表示,日本有一家工厂,他们的机器人每80秒就能制造一台机器人。虽然这是工业自动化的巅峰,但它仍然被归类为0级。机器人完全是预先

  • 编程设定下,环境/任务完全无菌且受控,与人类劳动中动态、非工程化的环境毫无相似之处。相反,任务和环境是为这些机器人完美定制的,使它们能够执行任务、自我维护、更换工具,并提前安排停机时间,以便人类前来维修问题。 当前挑战:刚性问题

0级的基本困难在于机器人完全缺乏自主性。机器人无法自行诊断或解决问题,这引发了一系列后续问题:

持续监督:人类技术人员必须始终在场(黑灯工厂除外)。机器人与人力的比例可能在20:1到12-15:1之间,具体取决于工业环境的苛刻程度。大多数情况下,当人类休息或换班时,机器人也必须停止。如果这些机器人发生故障,停机成本可能极其高昂,例如汽车行业每小时200万美元,半导体工厂每天5000万美元。

资本消耗:编程中的小错误、集成不良或两个系统同步失败,可能导致整个价值数百万美元的工厂无法运行。工厂因此变成一个工业工程项目,这种风险对于小公司来说过高,将它们排除在自动化市场之外。

缺乏灵活性:工业工程巨头亚马逊不得不围绕这些非自主机器人建造其配送中心。事实上,他们发现更容易通过设计特殊安全背心来改变工人,当工人靠近时减慢机器人速度,而不是让机器人更具协作性或智能性。

展望未来

有希望的进展来源

对于0级,我们认为成本下降是一条重要路径。随着实际工资上涨和工业机器人价格下降,它们变得更具吸引力。这一趋势应会持续。机器人作为制成品,意味着随着制造工艺改进、产量增加以及规模经济发挥作用,机器人应变得更加经济高效。

这将降低更广泛市场的准入门槛,使机器人能够更广泛地执行0级任务,而无需工业工程专长或巨额资本支出。

此外,大多数机器人提供设备监控系统,例如发那科的零停机解决方案。这些系统使机器人能够提前预测故障,减少持续监督的需求,并增强黑灯工厂的潜力。虽然这些系统意义重大,但它们相当新,并不断自我改进。

最后,通过更“统一”的工业软件,这些机器人的集成可能会得到简化。系统集成商不再只部署单一品牌的机器人,而是可以即插即用多个品牌/配置,从而更快、更便宜地创建更少问题的自动化系统。

虽然这些改进将提升脚本化运动系统,但挑战在于其完美应用。这些机器人仅在静态、工程化的世界中运行,但真正的劳动力替代需要适应性和自主性。正如1级将强调的,感知变化的任务并适应并不像听起来那么简单。

1级:智能拾取与放置

在1级,机器人现在能够“看见”。大约在2015年,我们看到了智能首次注入机器人领域,创造了一个新的自主级别,后来在2018年左右尝试商业化。在本级中,我们将重点关注2015年至2022年这一时期,在基础模型出现之前。

模型出现了。

机器人首次突破第0级的静态任务,是转向“拾取与放置”,即从区域A拾取物品并放置到区域B。拾取与放置存在于一个非完美的领域中,物体、配置和光照都可能变化。机器人必须泛化其感知能力以识别物体及其姿态,并相应调整抓取——这是第0级机器人无法完成的任务。大规模数据集以及较小但至关重要的抓取数据集,通过解锁灵巧性的一个方面——泛化(尤其是在感知方面),推动了这一尝试进入第1级自主性。有了足够的数据,机器人能够识别各种姿态下的物体(有时是新颖的),并调整抓取角度以进行拾取。

商业化的尝试面向仓库和物流的“拾取与放置”角色,将机器人安置在分拣线附近,通过从料箱A拾取物品并放置到料箱B来整理非易碎物品。然而,这第一次智能机器人的尝试受到数据不足、AI模型初生、高吞吐量要求和高成本的瓶颈,导致投资回报率未经验证。在2015-2022年间,一些公司建立了“机械臂农场”,进行数月的抓取以积累足够的数据用于训练。拾取成功率最终提升到99%,但达到99.99%的“最后一毫米”几乎同样困难,甚至有时这仍不足以证明投资回报率。第1级迈出了勇敢的第一步,并随着时间的推移持续显示出线性改进,但这最终凸显了机器人自主性中仍存在多少挑战。

如今,一些公司继续享受着线性改进的收益,AI模型和部署解决方案的进步为瞄准第1级拾取与放置的机器人创造了新的可行性。这些机器人目前正在解决剩余的挑战,以变得比最初的尝试更强大。

回顾过去 - 2015-2022

适应新颖性

虽然拾取与放置对人类来说很简单,但非静态环境对机器人来说是一个巨大的障碍。物品(有时是新颖的)可能杂乱地到达、被遮挡或以新的方式呈现。这些变量中的每一个,以及阴影、反射或透明物体等挑战,都可能导致机器人早期的感知系统出错。它们可能错误识别物品,误判其位置和形状,最终完全抓取失败。这是超出第0级的混乱程度。缺少了什么?

问题1:看见与理解 - 在第1级之前,机器人上的摄像头主要用于验证动作和任务是否完成。然而,从杂乱料箱中自主拾取物体需要可泛化的感知——能够适应新场景的感知。在第1级的拾取与放置中,这包括识别物品、将其从杂乱中区分出来,并估计其形状和姿态。像这样的广泛视觉推理可以来自今天的视觉-语言模型(VLM),但在2015-2022年这个时代,主要使用的是需要大量标注的特定应用图像数据集的神经网络,而这些数据集在机器人应用中并不存在。

问题2:学习抓取 - 识别物品后,机器人需要在不抓取相邻物品的情况下抓取它。这要求抓取能够每次泛化到新情况,但学习这一点需要大量的试错数据。在2015-2022年,开源社区和众包数据不如今天庞大,因此数据收集

来自真实世界、昂贵的机器人反复尝试缓慢抓取。模拟器允许机器人在虚拟环境中行动和收集数据,但当时还不够稳健,无法取代物理数据。它们受到所谓的“模拟到现实”差距的影响,即模拟中的物理、环境和动作与现实不匹配。在这个时代,模拟到现实的差距要大得多,而且至今仍未解决。

最初的曙光

解决这两个问题的第一个迹象来自计算机视觉领域,它实现了可泛化的感知。大规模ImageNet数据集(2009年)的创建和AlexNet(2012年)等神经网络的成功展示了计算机视觉的潜力。这随后催生了许多新项目,如YOLOv1(2015年),它实现了实时物体和边界框检测以定位物体;Mask R-CNN(2017年)则通过“掩码”进行形状估计,将物体与背景分割;最后是PoseCNN(2018年),它通过立体相机实现了物体的6D姿态估计。通过这些努力,模型具备了早期的可泛化感知能力,首次能够理解多个上下文中的多个物体。

尽管感知终于可泛化,但它仍然脆弱。系统仍然容易被新物体、反光或透明物体、阴影或过多杂乱所迷惑。然而,在2015-2022年这个时代,许多人将这些进步视为支持机器人感知的机会;也许机器人现在可以泛化感知来识别物体及其姿态以进行抓取。

感知能力的这一突破激发了研究人员尝试积累机器人抓取数据集,例如Pinto和Gupta(2015年)展示了700小时的机器人抓取尝试使其机器人达到了80%的抓取准确率。

虽然这种“自适应抓取”对机器人技术具有里程碑意义,但80%的准确率并未达到大多数商业应用的门槛。由于机器人缺乏自主性,每次失败的抓取通常无法自行解决,40%的情况需要人工干预。由于这些通常是危险的工业机械臂,操作员必须暂停整个仓库流水线,解决问题,然后恢复流程,导致平均恢复时间约为6分钟。

在数据规模化显示出机器人学习潜力后,更多项目涌现,例如Levine等人(2016年)发布了约3000小时的抓取数据,并在微调后实现了94.6%的抓取预测准确率。然而,大规模数据集主要来自计算机视觉领域,机器人领域可用的抓取数据要少得多。

即使现代机器人数据激增,该领域仍然很小,而在这个时代,数据量更是少得多。

最终,一些公司认为学习抓取的最佳方法是通过机械臂农场自行生成大量数据。他们确实在几个月内收集了庞大的数据集,但通常99%的成功率仍然不够。更糟糕的是,从99%提升到99.99%需要81倍的改进,比从1%提升到80%还要大。有些公司甚至达到了这一水平,但这变成了西西弗斯式的任务,因为每个新物品和失败的抓取都会使百分比倒退。然而,它们具有挑战性的集成和低自主性最终成为许多公司最大的瓶颈,并且至今仍是一个问题。

部署与考量:狂野西部

在2015-2022年期间,将这些AI机器人集成到优化的、在宽容的仓库环境中——98%-99%的配送准时——却变成了一个充满模糊估计和临时解决方案的“狂野西部”。与0级项目不同,这些拣选和放置机器人面临的挑战不仅是物理上的,还有信息上的。

将这些机械臂和单元集成到仓库生产线中可能需要花费9万到18万美元。但机器人还有一个新的定制API,必须与协调所有库存和物流的仓库管理系统(WMS)完成“握手”。通常,机器人的API在设计时并未考虑WMS。因此,WMS必须更新以适应这种握手差距,而失败的WMS更新可能造成数千万美元的损失。作为一种变通方案,可能会使用第三方集成商,其部署费用高达数十万美元。大多数情况下,会使用临时修复方案来同步系统,例如GUI自动化代理,一种仅模拟人类点击正确按钮的程序。

由于机器人需要完整的单元安装,集成商选择了理想且成本较低的位置,例如两个水平传送带之间的拣选和放置站。像垂直放置墙这样的困难位置则被跳过,因为大多数机器人在水平应用中学习,而将生产线重新配置为水平方向成本高昂。通过筛选合适的位置,安装可能只需4周。

即便如此,仓库实施这些机器人的决策周期可能需要数月,一些客户最终选择只在隔离区域安装机器人,以避免破坏仓库的流程。

尽管如此,这些机器人的自主性仍然太低。员工通常不是被“取代”,而是围绕机器人进行重组。他们通常执行机器人生产线的预处理或后处理工作,或者成为机器人技术员。

影响:狭窄的盈利市场

1级的前景是巨大的:低技能、高流动率的拣选和放置工作的自动化——这是机器人的新市场。任务的基本性质使其看起来非常适合只能做拣选和放置的机器人。企业有巨大的自动化动力,因为工资包含“附加成本”。例如,我们听说亚马逊每周的离职率为2%-4%。这意味着每100名现场工人,到年底可能有104人离职。因此,不断招聘、入职、培训和提升生产力使得工资比没有人员流失时高出56%。事实上,亚马逊目前正面临危机,在某些地区已经用尽了所有低薪工人。

不仅成本巨大,而且不断招聘新员工的物流工作也很繁重,许多招聘浪潮可能导致大多数人在第一周内离职。这些挑战和成本使得该岗位非常适合由AI驱动的机器人作为可行且稳定的劳动力替代品。然而,许多人发现商业案例高度依赖于任务的具体情况。

考虑一个高混合、低吞吐量的任务,如电子商务履行,机器人必须以适中的速度拣选各种物品。

通过将累计拣选次数除以累计成本,我们展示了每次拣选成本随时间的变化。在电子商务案例中,机器人的每次拣选成本在3.5年内不会低于人类,其有效拣选率仍低于人类,11台机器人完成9个人的工作。

E-类似电商仓库的流水线给我们的智能拣选和放置机器人带来了一个有趣的挑战:与人类准确拣选多个物品的能力相匹配。人类可能一次拣选5件物品,而这些机器人很可能一次只拣选一件,无法达到人类的吞吐量。然后,如果机器人能够足够快地拣选,周围的传送带和预处理/后处理系统会被锁定在特定速度,或者被两端的人类堵塞,再次限制吞吐量。仓库可能会通过安装更多机器人来弥补这一点,但成本会高得令人望而却步。更糟糕的是,物品的“高混合度”很可能带来过于新颖的物体或场景,导致抓取失败,因此许多机器人必须达到99%以上的成功率,以减少六分钟的停机时间。总而言之,这种具体的配置使得智能拣选和放置机器人的成本难以合理化。

然而,Level 1引入了一项新的升级:重试。如果任务失败,机器人可以检测到错误并重试(几次),而Level 0中的错误会立即冻结流程。让我们以“包裹”拣选和放置为例,其中物品以包裹形式到达——带有标签的统一箱子和包装。

包裹拣选和放置对智能拣选和放置机器人有双重好处:包裹可能很重,使人类疲劳,从而降低吞吐量基准;而且它们相当统一,因此失败的拣选可以更容易地重试和解决,因为这很可能不是像电商中那样的泛化错误。

机器人可以以每小时550次拣选为目标,但即使在此领域达到95%的准确率,有效拣选率也只有520次。

在这种情况下,我们看到10台机器人完成了23名人类工人的工作。在这些条件下,机器人的每次拣选成本在一年后就低于人类成本。

针对Level 1拣选和放置的机器人找到了一个利基市场,但仅限于非常特定的拣选和放置领域。虽然事后很容易理解什么有效、什么无效,但在当时这是全新的。我们问过一些公司为什么最初没有瞄准包裹领域,一个转述的答案代表了那个时代:我们不知道,我们意识到得太晚了。这是智能机器人的首次尝试,虽然包裹市场比电商小,但自主性实在太早了。

挑战:脆弱智能的极限

在这个2023年之前的时期,感知能力很吃力。一些人试图通过在其实验室的机械臂农场中复制部署地点、遵循机器人将拣选的相同物品目录,甚至部署特定的静态照明装置来规避脆弱的感知。这些防护措施大多只能部分解决缺陷。相反,亚马逊商品目录的25%在“排除列表”上,这是一个因失败风险而不被机器人拣选的物体列表。

这个时代的灵巧性仍然处于萌芽阶段。如果公司引入了一种新物品,他们会用机器人进行测试运行,如果拣选失败5-10次,它就会被放在同一个排除列表上。此外,没有强大的泛化能力,机器人可能会一次拣选多个物品,再次扰乱仓库流程。当时可用的泛化能力根本不够强大。

虽然其他任务看起来相对简单,仅仅是拣选和放置的变体,但它们可能带来不同的挑战。例如折叠衬衫,这看起来对机器人来说是一项简单的任务。实际上,像衬衫这样的物体是可变形且“高维”的。机器人的神经网络

机器人会首先对衬衫上的每一条皱纹、折痕、褶皱等进行分类,以理解它。这被称为“状态爆炸”问题,对于强化学习来说尤其困难,因为模型试图验证过程中的步骤是好的还是坏的决定,因为现在可能存在大量的组合。在第一级,叠衣服成为了那个时代的“圣杯”。

当下与展望

有希望的进展来源

2023年之前的时代充满了缺陷,让许多行业专业人士伤痕累累。然而,如今针对第一级拾取和放置的公司已经创造了可行的解决方案,解决了许多挑战并完善了他们的系统。一些公司正在实施端到端解决方案,以解决无法拾取的物品,降低故障率、恢复时间,并减少排除列表的负面影响。模块化系统现在可以绕过物理集成,提供更高的吞吐量,尽管成本更高。内部操作系统现在允许简化、更便宜的WMS集成。即使是模拟器也已经足够进步,可以引导基本的包裹拾取和放置数据。

但重要的是,许多机器人正在利用基础模型进行深度、可泛化的感知和空间推理。我们探讨基础模型在第二级为机器人提供了什么。

第二级 - 自主移动

在第二级,机器人获得通用自主性。它们现在能够自主规划自己的任务并在开放世界中自主穿行。这种能力以前是不可行的,旧模型会因为开放世界不断变化的场景、地形和物体而感到困惑;僵硬的移动方法在这种混乱中会显得不足。

相反,对于第二级,机器人获得了自主性,通过基础模型和视觉语言模型的最新进展获得了更高层次的规划和空间推理。此外,由于模拟中的大规模强化学习,机器人现在具有穿越困难地形的灵巧性。这种运动中的灵巧性使机器人能够表现出敏捷的动作。两种方法都利用大规模数字数据集进行学习,而不是在每个场景中收集数据,从而缓解了数据稀缺的挑战。在第二级,机器人自主感知和理解周围环境,规划路径,并利用其强大的运动能力在开放世界中长时间机动。

第二级的通用机器人目前正在早期生产阶段部署,用于建筑工地、石油和天然气精炼厂以及基础设施场地等大型领域的数据收集和检查任务。这些场地通常太大,人类无法有效覆盖,传感器化成本太高,对人类太危险,或者太偏远而无法进行低成本的人工检查。相反,这些配备额外传感器的机器人可以利用其自主性来规划和执行这些任务。

这些自主机器人是通用革命的首个证明。这种向自主性的飞跃在后续级别中产生共鸣,成为通用机器人技术的起源。

当前观点

进入开放世界和自主性

自主移动的核心挑战是开放世界,一个没有刚性结构或可预测性的环境。与0-1级的工程环境不同,开放世界是不断变化的场景、障碍物、地形和天气的混乱集合。要在这里运行,机器人必须

超越了简单的感知和经典的、僵化的规划,转向场景理解和更高层次的规划。然而,早期的算法不够鲁棒,无法胜任这一任务。

我在哪里?——在环境中定位

开放世界并不总是提供静态路径,机器人必须确定自身相对于环境的位置,否则可能会迷失方向。这需要不断更新地图,而更新中的微小位置误差会随时间累积,将英寸的误差变成英尺,使机器人陷入困惑。这种误差可能意味着充满电的机器人与地上死机的区别。高级玩家可能无需额外措施就能解决这个问题,但大多数机器人可能仍会使用AprilTags(类似二维码的贴纸)进行重新定位和校准,这些贴纸放置在充电站。它们可以设定固定的、预编程的路径或行为来引导机器人。

第一个解决方案:SLAM——对此的主要工程解决方案是同步定位与地图构建(SLAM)。利用传感器和数据(如激光雷达、速度、时间等),SLAM算法使机器人能够构建周围环境的“地图”,同时跟踪自身在地图中的位置。然而,SLAM仍然局限于几何表示。开放世界环境不断变化,需要更“认知”的理解来减少这种漂移或误差的可能性。SLAM本身可能不够充分,而是作为一种补充。

规划、推理与场景理解

机器人可能知道自己的位置,但除非被明确编程,否则它可能仍然不知道要做什么或周围有什么。为了在混乱的环境中导航,机器人需要对其世界有更基础的理解。例如,机器人可能需要区分黑色水坑和沥青,并规划下一步行动。感知失败可能导致将水坑误认为不是危险。或者,规划失败可能导致机器人在错误的时间躲避水坑。

突破:基础模型

最近的基础模型为机器人提供了推理和长期规划所缺失的部分。通过在互联网规模的文本数据集上训练,机器人不再需要每种情况都通过代码列出,或通过昂贵、稀缺的真实世界数据显式学习;相反,它可以将庞大的知识库泛化到新的情境中。这些模型可以将情境转化为逐步的、自然语言的描述,机器人可以据此进行推理,从而解锁更广泛的能力。

视觉-语言模型(VLM)是一种基础模型,可以桥接语言和视觉模态,实现视觉推理和问题解决。这些基础模型在互联网规模的海量图像、标题和描述数据集上进行训练,并通过机器人特定数据进行微调,以实现更好的空间推理。现在,机器人可以广泛地泛化感知,缓解了之前机器人感知数据缺乏的问题。

所有这些构成了机器人新获得的自主性:可泛化的规划、推理和感知。机器人现在可以在许多新环境中服从并遵循指令。例如,在命令“绕过梯子走到楼梯”中,VLM会识别物体及其关系,然后将场景翻译给基础模型,生成计划“从梯子左侧移动,然后向右走向楼梯”。这种“思考”循环赋予了机器人自主感知和行动的能力。

在长时间范围内导航开放世界

敏捷运动 - 灵巧性

这种自主性通过运动灵巧性的提升得到补充。不是通过实际部署收集大量可能配置的数据,也不是硬编码大量控制,而是模拟器极大地介入以解决运动灵巧性问题。现在,模拟环境提供了强大、广泛的训练平台,可以在大量环境配置上快速迭代运动控制策略,这些配置通常比部署环境困难得多。

这些模拟器改进到足以使许多学到的运动技能通过足够的微调迁移到实际部署中,显著缩小了“模拟到现实”的差距。现在,机器人可以利用其新的运动灵巧性稳健、敏捷地穿越不平坦的地面、斜坡、不稳定的地面(岩石、沙子、建筑托盘),甚至可以在电机损坏的情况下移动。有了这些突破,我们看到四足机器人在第2级达到了其改进的拐点。

硬件提升

最后,硬件的发展通过为这些机器人配备足够的手段实现了其自主性。机载计算能力的进步,如Nvidia Jetson,使机器人能够摄取和处理更多的数据。多个传感器、摄像头和激光雷达现在都可以用于生成高质量、实时的感知数据,从而快速适应环境的固有随机性。最后,高效执行器和增强的电池使这些机器人能够在开放世界中执行长时间任务。

部署与考虑:开放世界中的智能体

第2级的机器人可能具有以下形态:

但值得注意的是,四足机器人得到了突破。大规模模拟平台的进步使其四条腿能够稳健控制,以灵巧性穿越地形,而其自主性可以确定场景并规划,这两者在第2级突破之前都是具有挑战性的。

重要的是,第2级的这些机器人不再需要数百万美元的设施工程。它们的通用自主性意味着它们可以在短短1-3周内部署到新环境中,以学习其领域并可靠地执行任务。然而,电池续航时间决定了现场需要多少机器人或充电器。由于四足机器人平均电池寿命为90分钟,可能需要购买更多的四足机器人或充电站,从而增加成本。

这种自由度在工作场所引入了一个新问题:安全性。对于具有自主移动能力的机器人,如果它们摔倒或着火,无法拔掉电源。它们的挑战更多地转向确保不造成财产损失或人身伤害。例如,开放世界的地形可能对机器人周围的人构成危险,比如光滑的表面导致70磅的四足机器人倒在某人的脚上,或者滚下楼梯撞到某人。可能采取的一些措施包括:

稳健的碰撞避免 - 引导机器人避开静态或动态障碍物

速度和分离监控 - 跟踪附近人员以保持安全距离

操作指南以及声音或视觉提示,向人类同事表明机器人的存在或意图

影响:解锁检查和数据收集角色

通过自主移动,这些机器人可以在开放世界领域中移动,决定路径,避开障碍物,并一次穿越各种地形长达数小时。这些

自主机器人通常在大规模领域执行任务,例如建筑工地、油气田、化工厂和园区环境。关键在于它们自动化了数据收集和检查任务,这些任务仅需自主移动能力和一些数据收集工具。这类场地和任务往往具有细微差别,通常:

太大,无法由人类有效检查或廉价安装传感器

太关键,不能冒险让人类执行不力

对人类来说太危险,无法继续作业

机器人现在将劳动力市场的另一部分纳入其能力范围。让我们看一些例子。

建筑

有时,建筑工地一周计划完成的工作不到一半,而由于涉及管道、电气、砌墙等多个方面,各自的进度可能会在混合中丢失。通常约40%的建筑返工源于文档记录不佳,这可能造成高达20%的账单成本。对工地进行全面检查或“采集”本应解决这一问题,但对建筑公司而言,这意味着要占用其最资深主管的8小时工作日,而且缺乏专业性或客观性仍可能影响采集效果。

相反,许多公司将此外包给外部公司。例如,一个200间客房的酒店项目可能规模足够大,根据州法规需要土木工程师或持证测量员进行采集。这些工作可能每两周进行一次,费用超过100万美元。具有自主移动能力的机器人可以自行处理这些采集任务,安装合适的摄像头/传感器/激光雷达,以获得更客观、更详细的采集结果。完成后,它可能移动到第二个场地并在同一天执行另一项工作,这是人类团队难以匹敌的。

石油与天然气

一家中型炼油厂可能投资数百万美元,经过多年的实施阶段,为其机械全面安装传感器——跟踪泄漏、振动和热量。尽管成本和时间投入巨大,但这项投资至关重要:一小时的意外停机成本高达50万美元。相反,配备适当传感器的防爆四足机器人可以巡逻多个场地,收集更精细的数据,例如诊断热力图,成本仅为几分之一,并让人类远离危险。

关键基础设施

检查风车、电气站和海上钻井平台都是关键工作,但它们对人类构成巨大危险,并且通常需要停机才能进行人工检查。例如,一个传统数据中心可能在暴雨中停机,需要变电站检查。相反,我们听说四足机器人已经能够在不停机的情况下自动化这种检查,一年内为设施节省约35万美元,并可能挽救人类生命。

虽然这些都是很好的例子,但它们仍处于早期生产阶段,目前正在更多场地部署,如半导体工厂、钢铁厂、铁路基础设施或用于最后一英里配送。

当前2级自主性挑战概览

机器人自主性目前面临许多困难,这些困难将影响机器人在每个级别的表现。这些挑战目前如何影响机器人在2级中胜任执行,以及如何可能被规避。

自主性带来了新的挑战,通常通过足够的微调来修补,但并未解决。为了在社交环境中更好地运作,机器人需要更多的社会意识来理解人类要求它们做什么。

o,或者听从哪个人的偏好。虽然规划能力已解锁,但机器人仍可能误判位置,导致许多人依赖激光雷达作为安全校验。

复合误差仍然是一个问题。机器人在导航和定位方面仍不够精确。大多数机器人可能会使用放置在兴趣点(例如执行另一项任务的特定位置)周围的AprilTags来确保精确定位。

运动灵活性仍然是一个挑战,并采用变通解决方案。在Level 2中,这意味着像深泥、冰或透明玻璃这样的地形目前仍然难以穿越,可能需要额外调整,或者完全避开。

协调多个自由度(机器人可以移动的方式数量)仍然困难。例如,双足运动在Level 2中确实存在,但增加更多自由度会增加复杂性,使稳定性和精确定位变得复杂。随着双足行走对各种玩家来说变得更加稳定,可能会使用额外的工程手段,如AprilTags或专门策略来修补这些问题。

展望未来

有希望的进展来源

这些自主性挑战正在通过多种方式得到改善。对于灵活性,运动仿真平台可能会继续改进,实现更稳健的地形穿越。双足运动应通过更多数据和学习的进步得到改善。

自主性应通过更多数据和进一步学习得到提升。合成数据生成目前正在视觉语言模型中进行视觉数据增强,其中数据被轻微改变以生成更多样化的数据用于增强学习。随着视觉语言模型中视觉推理能力的提升,激光雷达可能开始从机器人上剥离。随着这种视觉推理和定位的改进,我们可能会看到AprilTags的使用减少。此外,开放世界部署有助于收集更多边缘案例的数据,可能引导出更好的合成数据,并扩展学习。随着这些挑战的解决,我们预计机器人自主性将提高,并持续部署和改进,直到其目标市场实现高度自动化。

Level 2标志着通用机器人技术的开始。进入自主性为所有未来进步提供了认知基础,下一步是将操作能力添加到这种通用自主性中。

Level 3 - 低技能操作

我们在Level 0的自动化中看到,脚本化自动化和操作在经济上具有不可估量的价值,以超人的速度制造汽车,但仅限于工程任务。Level 1展示了突破到智能拾取和放置的情况,但机器人仅在非常有限的使用场景中可行。在Level 2中,我们看到机器人自主性在长时间范围内安全操作开放世界领域具有巨大价值。现在在Level 3中,机器人迎来了基本类型的可泛化操作:

操作:有目的地根据上下文与环境交互并改变其状态的能力,例如推开一扇门、从把手抓取、从边缘握住盒子等。

机器人可能很好地感知物体,但这并不意味着机器人具备与之交互的必要技能。在Level 3中,机器人现在理解物体如何提供操作可能性,并具有直接泛化这些操作动作的灵活性。利用机器人的自主性,这些操作能力可以具有更长的规划步骤和多步骤规划。

这两种能力都脱离了第1级短视、有角度的抓取。将这种可泛化的操作与第2级获得的自主移动性相结合,我们现在看到了通用移动操作在应用中的引入。

第3级标志着第一代通用机器人的诞生,它们可以针对特定工种,从第1级的基本任务转向技能,如烹饪或清洁。早期试点项目正在厨房、洗衣房、工厂和仓库等领域进行。然而,它们的低技能任务,我们称之为“高级拾取和放置”,是适度的、更长周期的任务:操作/拾取一个物体,可能移动到别处,并执行进一步的操作,或“放置”物体。虽然适度,但这种能力正被用于烹饪、折叠衣物以及分类/整理非易碎物品。第3级的部署是即插即用的,机器人通过人类远程操作——远程控制机器人——和界面(如平板电脑)学习,而不是花费数月时间和数百万美元的工程费用。

执行第3级任务的通用机器人可以自动化全球劳动力中的特定部分,尽管不是人类劳动力的全部——这是第4级所承诺的意义。目前,上述第3级的早期试点用例正在证明其有效性,它们的任务满足以下条件:

大成功标准:任务没有精度约束,例如将物体从箱子A移动到箱子B、将杯子放在桌子上、搅拌锅、将盒子从位置A移动到位置B等

低吞吐量或无吞吐量或异步:任务节奏较慢以匹配,无需满足吞吐量计算,或可以与其他工作异步进行,例如夜间

可重试性:类似于第1级,任务需要允许重试,以便失败执行不会损坏财产,尤其是在第3级中,不会伤害人

无力度或重量感知:这些机器人目前没有触觉,只有关节级别的基本力反馈。它们可能无法执行精细的、依赖力度的操作任务,如拧开新型瓶盖。

当前观点 - 早期阶段

需求 - 可泛化的操作

为了在一切不断变化的环境中操作物体,像第1级那样的弱智能抓取能力是不够的。机器人必须能够调整其动作,以在给定上下文中充分操作物体。这需要可泛化的操作,其中物理AI赋予足够的灵巧性,以生成任务和环境特定的动作来操作物体。

学习操作 - 当前有意义的内容

尽管第3级仍处于非常早期的阶段,但我们看到来自VLM的可泛化操作的有意义结果。目前,VLM已经改进,提供了进一步的空间推理,并增加了输出动作的能力。但要输出动作,我们仍然需要机器人从动作数据中学习。

开源与数据增长

在第1级中,我们看到了数据稀缺问题可能有多么具有挑战性。幸运的是,机器人领域经历了数据相对增长的好运,随着低成本远程操作硬件(如GELLO(2023))的发展,世界各地的用户能够收集并开源他们的机器人动作数据。过去几年中,许多数据集已经发布,逐渐积累了足够的数据用于

学习基本的操作任务。现在,如果我们用这些动作数据训练我们的VLM,就会得到一种新型模型。

视觉-语言-动作模型

简称VLA,通过添加动作模态扩展了视觉-语言模型(VLM)。在配对的图像/文本/动作数据上训练,无论是端到端还是通过微调,VLA意味着VLM可以读取场景、解释任务,并输出动作计划。这些VLA可能有两种形式:

任务特定型:用于高层规划的VLM或修改后的VLM,以及用于特定任务/动作的附加模型

单一型:一个单一的VLM模型执行所有推理、规划和动作

模型的智能体理解任务“是什么”并能相应规划,模型现在直接输出动作计划本身,导致灵巧性立即提升。凭借其庞大的互联网规模知识,机器人现在全面解析新任务和环境,VLA的动作实时执行新颖、流畅的运动,并针对场景定制。

仅仅几年前还极其复杂的任务现在变得可行。来自第1级的“圣杯”——折叠衣物——现在成为可能,不再需要枚举和计算衬衫上的每个褶皱。VLA从互联网数据中理解抽象概念,如“袖子”或“领子”,多模态地推理任务如何执行,并规划和输出所需的操作。

更长周期、抽象的任务现在也可以处理。在这些模型中,如果没有能力理解这个特定卧室“哪里不对”以及如何清洁,那么“清洁卧室”的任务可能非常令人困惑。现在,它可以通过VLA的高阶规划分解为基于上下文的子任务链,如“拿起枕头”或“调整毯子”,所有这些都由模型按时间顺序排列,并生成适当的动作计划。

我们承认,第3级任务不需要极高的精度或力和重量的理解,因此高精度约束可以忽略。此外,由于模型学习的遥操作演示数据具有精细、细致的特性,这些机器人可能会很慢。而且,将操作/动作添加到VLM会显著消耗上下文窗口,并缩短我们在第2级中拥有的时间范围,目前使这些任务仅持续几分钟。

然而,就像第2级中VLM的出现创造了持续改进导航的正反馈学习循环一样,VLA可能为机器人灵巧性创造同样的循环。随着机器人继续在物理世界中行动和推理,它可以继续收集数据、学习和改进。尽管VLA前景广阔,但它们可能也不是完整的解决方案:任务特定的模块/策略可能用于精确的低层控制,而柔顺控制可能用于对抗反作用力,以及其他许多方法。

这种自主级别和移动操作器的出现,现在预示着向更大规模劳动力替代的巨大飞跃。

部署与考量:机器人同事

第0级和第1级的机器人可能需要数百万美元的工程项目和定制软件集成,如仓库管理系统(WMS)。然而,针对第3级的机器人可以像人类员工一样部署。一些公司将它们投放到现场,让遥操作员读取平板电脑,执行工作流程以收集数据并

ach 模型。遥操作成本因任务复杂度而异,但遥操作成本较低,通常外包给新兴市场,并常由投资者补贴支持。

这种易于集成从根本上改变了经济方程。关键指标不再是针对巨额资本支出的多年投资回报率。相反,这些机器人可以通过按小时收费的机器人即服务模式在数天内实现盈利。这打破了之前阻碍大多数中小型企业进入的 Level 0 和 Level 1 的壁垒,使这些机器人现在可供更广泛的企业使用。

虽然移动操作存在,但还处于非常早期的阶段,并且仍面临安全问题。它必须在行动前到达任务现场并知道自己的定位,因为任何错位都可能损坏财产或伤害人员。早期的部署可能会停留在围栏区域内,直到这些物理安全挑战得到解决。

双足平台对某些人具有吸引力,因为它们可以实现髋部“弯曲”以执行任务。然而,双足运动(用两条腿行走)本质上是一种不稳定的行为。它需要不断调整平衡以确保下一步准确。携带物体现在增加了新的质量,运动系统在行走时必须考虑这一点。初始的双足试点虽然可能功能正常,但可以用轮式机器人替代。

在人类周围运行的机器人需要严格的安全要求。由于机器人在早期阶段缺乏自主性,一些安全措施可能仍需实施。遥操作监督——即机器人由遥操作员监控——目前对于这些机器人来说是必需的,以防出现问题时人类必须干预。尽管如此,仍可能出现复杂情况,例如在故障发生后遥操作机器人、遥操作中的延迟问题等。对于更直接的措施,一些部署可能使用:

势场:机器人围绕物体映射的空间以及物体可能对机器人施加的力

风险感知建模:评估碰撞发生的概率并相应规划

速度与分离监控:如 Level 2 中所述,跟踪人类并保持安全距离

在考虑了部署问题后,目前 Level 3 正在尝试哪些角色?

影响:低技能劳动力替代

虽然 Level 3 中存在原始形式的通用操作,但还处于非常早期的阶段。当前机器人的试点测试发现其任务满足我们之前的条件:成功标准的大空间、低吞吐量或无吞吐量或异步、可重试,且无需力或重量传感。在固定应用中,机器人可以执行一系列操作以完成更长期的任务。但大多数时候,机器人会利用其移动性,例如在位置 A 拾取非易碎物体,然后移动到位置 B 放置物体。凭借这些新能力,机器人将很大一部分劳动力纳入其武器库。

虽然我们当前的条件是角色的独特特征,但这些角色规模可观且成本相当高。这些机器人获得优势的方式与 Level 1 的目标相同:减轻负载成本。例如,旧金山餐厅的年离职率可达 170%,而招聘、入职、培训、缺勤和生产力提升导致的成本高于仅低技能工资的成本。以下是我们目前看到的机器人在 Level 3 中尝试的角色

l 3.

餐厅或餐饮服务中的烹饪:食材已预先分好份供机器人使用,它可以执行更长周期、更宽松的任务,通过基本的链式操作将它们一起烹饪。餐厅往往是最劳动密集型的行业,产生同样的100万美元收入所需的员工数量大约是医院的3倍。

工业洗衣:曾经不可能完成的处理可变形物体的任务现在成为可行的夜间工作,目前可以折叠重复物品,如毛巾、床单、枕套、餐巾等。

物流:“即时库存”工作流程,例如仓库生产线非关键补货或设置补货区,均无时间或空间限制。机器人可以在一个地点拣选各种物品并将其放置到另一个地点,例如:补充货架、轮换周转箱、或在设施内运输货物或料箱。

制造业:执行线边转运,补充装配线和线边库存。例如,为第二天的装配进行零件排序和材料整理。

还有其他可能符合我们当前3级任务标准的任务未列出,例如修剪树篱、园艺或其他家政工作。虽然其他角色似乎满足我们的大空间成功标准——低到零吞吐量计算、可重试、且无需力或重量传感——但我们仍为时过早,无法预测会发生什么。

幸运的是,如上所述,存在一些利基角色,它们仅需要低技能的操作能力,并且通常具备自主移动性。凭借这些角色、高昂的工人负载成本以及卓越的RaaS模式工资,3级机器人可以很好地替代劳动力。我们预计,随着这些机器人的改进,它们将逐步自动化越来越多的低技能劳动。然而,在本文发布时,这些机器人仍处于非常早期的阶段,并面临自身的障碍。

当前3级自主性挑战概览

尽管3级处于非常早期的阶段,但让机器人可靠工作仍存在一些困难。记忆架构尚不足以泛化过去的经验,限制了机器人在新环境中执行任务的能力。定位和复合误差使得机器人难以精确导航到任务位置并调整自身姿态以进行操作。有些人可能会使用AprilTags来解决这个问题,采用不易出错的分析方法,或者对机器人进行充分调试以可靠地执行任务。

尽管这些能力存在,但实现起来并不容易或廉价。遥操作可能会被使用一段时间,机器人不会非常快,而添加新的动作只会增加难度。复杂的动作,如全身控制——例如扭转或弯曲——为问题增加了另一层难度。3级的许多问题可以通过更多的学习数据来解决,但移动操作机器人非常需要数据,且仍处于早期阶段。

展望未来

有希望的进展来源

尽管3级正在部署并产生经济影响,但我们仍处于非常早期的阶段。VLA和遥操作数据目前显示出有意义的进展,并可能继续扩展学习,或者其他进展途径可能有所帮助。模拟器可能会在操作学习方面发挥作用。我们有早期证据表明模拟器中的速度大幅提升,并且由于视觉合成数据的一些优势,sim2real差距的某些方面已经开始缩小。合成数据和数据增强

方法正在进步,被证明有助于扩大导航、操作和控制的数据收集。甚至进一步推进真实数据,例如持续的开源数据收集,或现场部署以收集特定领域、特定任务或边缘案例的数据。在大多数情况下,我们看到更大、更多样化的数据集能够扩展学习、完善能力并解决当前挑战。

部署

在部署中,我们期望这些执行3级任务的机器人逐渐摆脱远程操作监督和操作措施。诸如势场或风险感知建模等即时措施应随着自主性的提高而逐渐消失。远程操作监督将从最初的1:1机器人:人类扩展到可能10:1,但这个比例应持续增加,直到自主性接管。此外,这些自主机器人可能最终直接连接到仓库管理系统(WMS),通过完全集成系统来优化其任务/行动并提高吞吐量。

虽然目前有些人可能选择轮式人形机器人,但我们预计双足运动将得到解决。我们已经看到双足运动取得了实质性进展,一些机器人能够应对多种地形并变得越来越稳定。虽然有些进展可能比其他更快,但我们预计这将对3级产生影响。

在这个级别,机器人有潜力进入家庭,但它们可能在范围和功能上受到很大限制。一个定制的机器人可能只处理洗衣任务,从而最小化对人类的风险。主人甚至可能远程操作机器人,或只在房子空着时让它运行。然而,只要一个错误就可能打碎结婚照并损害其声誉。

尽管能力可能继续完善,部署加速,但人类专属任务的最后堡垒仍然存在。

4级:力依赖任务

4级代表了最终进化,机器人能够以精确的精度执行力依赖的精细任务。这些任务需要灵巧性来理解并对环境的物理力做出细微反应。机器人必须执行熟练的、精细的操作,需要细腻、自适应的触感,这比3级的低技能操作任务高出一个层次。

我们看到高度自动化劳动力的承诺在这一级别得以实现,为迄今为止仍由人类独占的剩余劳动任务打开了大门。

展望未来

这仍是一个研究领域,因此我们将详细说明有希望的进展来源和预期影响,但并非详尽列表。

有希望的进展来源

操作可以应对许多用例,但从根本上对任务和手中物体的物理特性“麻木”造成了能力上的硬性上限。在这个级别,机器人“手”进入画面,配备触觉传感或强大的反馈回路来帮助增强这种敏感性。尽管这可能不是完整/最终的解决方案。

公开辩论

到目前为止,扩展视觉模态对大多数任务有效,但仍有一组力依赖的、细粒度的任务尚未解决。视觉模态目前难以捕捉这些物理线索并解决这些任务,但有些人认为这可以通过更多数据来解决。然而,有些人认为这不仅仅是数据问题,需要不同的方法。例如,在口袋里找手机主要通过触觉感知完成,而视觉可能

不能用于此,仅凭视觉将使任务极具挑战性。

尽管如此,近年来触觉传感在成本和效果上都取得了巨大进步。力和力矩传感在训练中也显示出早期有用的迹象。我们认为力和力矩传感以及触觉传感器可能是未来解决方案的有用组成部分,但现在断言任何一种方法为“正确”还为时过早。

潜在有用的途径

第4级是一个正在进行的研究领域,专注于将这种力和重量的理解赋予机器人。未来可以使用多种角度来帮助实现依赖力的任务:

先进传感器:机器人“指尖”上的触觉传感可用于通过演示学习收集数据,并赋予机器人“触觉”

模拟器:大规模模拟可能改善模拟到现实的差距

新学习方法:在触觉和力数据的新流上训练VLA,可能使机器人能够将视觉与物理交互联系起来

任务特定模型:各种单独的策略可用于特定动作或行为,以正确理解力

柔顺控制:控制功能使机器人关节能够理解相反力并屈服或绕开它们

有许多方法,可能还有更多尚未出现的方法,正在被用来解决依赖力的任务问题。我们承认,这些任务的解决方案可能利用其中任何一种、组合或尚未发现的新发展。

第4级影响:大规模劳动力替代

这些依赖力、高精度任务的解锁为大部分体力劳动市场的自动化打开了大门。随着时间的推移,我们可能会看到以下领域的自动化:

熟练工种:需要力和重量直觉的水管、电气工作和精细装配任务。一旦解锁,这些工作首次变得可自动化,面向全球市场。

服务业:精细运动技能使机器人能够自动化零售和酒店行业的其余服务业岗位。

制造业和物流:这些领域的所有剩余任务,如复杂包装、精细装配、安装等,现在都成为可能。

随着针对第4级的机器人变得更加可靠并赢得更多信任,它们将进入更重要的角色,例如每个国家专门组建的、没有“生命”损失风险的灾难恢复团队,或者自主太空探索,它们可以探索新世界并为人类后续抵达建立营地。

此外,我们在第一篇文章中提出的存在威胁,以及我们的合著者Joe Ryu在《自动化边缘》中的深入探讨,可能在此成为现实。具有第4级能力的机器人可能是超人般的劳动者,以比人类劳动力便宜得多的价格出租,并可能被用来大规模制造相同的机器人,将劳动力成本压缩到难以想象的水平。商品可能变得几乎无弹性,传统市场价值可能因不可能的生产能力成为现实而被颠覆。第一个达到这一级别的国家或公司可能设定劳动经济的条款,并引发地缘政治剧变,一些国家实施边境管制,或完全禁止来自其他国家的机器人和服务。

时机已到

通用机器人的梦想不再是遥远的幻想。它正在被构建,一次一个级别。每个

踏上这条道路将释放巨大的经济价值,并以深远的方式重塑我们的世界。

我们发现自己比许多人意识到的更接近最终篇章。必要的0级工业武器向我们展示了机器人在合适的应用中能够做什么,即使没有自主性。在1级,新的适应性带来了巨大的希望,但它来得太早,让许多人留下了苦涩的滋味。然而,新的范式使它们的应用变得更加可行。现在,2级已经到来,基础模型赋予了广泛的推理能力,从而释放了通用机器人所需的自主性。这一向自主性的飞跃使它们能够在我们复杂的开放世界中导航,并且仍然是未来级别多模态推理能力的起源。3级通过新获得的操作能力提高了灵巧性,将操作推广到各种物体和环境,这是1级的梦想。结合2级的移动性,3级创造了第一个真正的人类劳动力替代品,尽管只有基本能力。最后,4级代表了机器人的未来,其中力理解可能是完全自主机器人的最后一座桥梁,将自动化几乎所有体力劳动并创造新的角色。

这个框架不仅仅是一个学术练习,而是一个战略工具。它使行业利益相关者、工程师和研究人员能够区分机器人技术的模糊界限,并将精力集中在他们可能获得最大收益的地方。机器人技术的演进将不是一个单一的、戏剧性的事件,而是一个稳定、有意的攀登。我们通过自主性级别概述了通用机器人的上升过程,专门设计用于穿透过去失败、未来炒作和模糊概念带来的噪音。在接下来的文章中,我们将详细说明供应链中谁将获胜或失败,以及随着转型继续改变格局,我们可以期待什么。