Podcast Script (zh)
[0.120-12.127] SPEAKER_02: 对话MIT教授、Optimus Ride创始人Sirtesh Karaman。 Optimus Ride是全球顶尖的机器人公司之一。 业务涵盖驾驶和飞行机器人。对我而言,他一直是导师、同事和朋友。
[12.207-24.388] SPEAKER_02: 他是我见过最聪明、最慷慨的人之一。 能和他录这次对话,我感到非常荣幸和愉快。 这里是AI播客。喜欢的话,请在YouTube订阅。 在Apple Podcasts打五星,在Patreon支持,或者直接联系我。
[24.468-41.014] SPEAKER_02: Twitter账号Lex Friedman,拼写F-R-I-D-M-A-N。像往常,我先做几分钟广告。 中间绝不会插播广告打断对话。我希望这样没问题。 对您来说没问题,也不影响收听。本节目由Cash App呈现。 它是App Store排名第一的金融应用。下载时使用代码LexPodcast。
[41.094-52.497] SPEAKER_02: 使用代码LexPodcast。Cash App能转账、买比特币。 还能1美元起投资股市。因为Cash App让你数字收发货币。 可以数字收发货币。提个关于实体货币的惊人事实。
[52.577-66.465] SPEAKER_02: 造一个便士要2.4美分。每年花费8500万美元。 生产它们。这是实体货币的疯狂小知识。所以再次提醒,下载Cash App的话, 从App Store或Google Play,用代码LexPodcast,你获10美元,Cash App还会
[66.545-73.569] SPEAKER_02: 再捐10美元给Thirst,推动机器人学和STEM教育。 给全球年轻人。现在开始我与Sirtesh Karaman的对话。
[73.869-76.504] SPEAKER_03: 既然你两个领域都有研究,哪项任务更难?
[76.804-91.551] SPEAKER_00: 自主飞行还是自动驾驶?这问题问得好。我觉得自主飞行更难。 因为它工作方式最难。自主飞行还是自动驾驶? 用在消费无人机上,我们考虑的那种应用, 可能简单些。这可能是它起飞比较早的原因,
[91.631-99.908] SPEAKER_00: 字面意思上比自动驾驶早。但展望未来, 我觉得自主飞行真正的好处,比如在 交通、物流方面,比自动驾驶难多了。
[99.988-109.473] SPEAKER_00: 我猜我们会看到一些机器到处飞,但还没真正看到 任何真正的自主飞行。所以比自动驾驶难得多。 所以要等解决大规模部署问题之后,
[109.773-117.075] SPEAKER_03: 先解决自动驾驶。难在哪?你直觉觉得为什么 规模化后,消费无人机很难?我觉得规模化本来就难。
[117.375-121.821] SPEAKER_00: 比如,想想我们已经部署了很多机器人。 过去50年我们部署了很多机器人。
[122.121-124.408] SPEAKER_03: 你是学者还是商业企业家?
[124.708-133.264] SPEAKER_00: 我觉得是人类。 人类? 很多人在做。我们人类部署了很多机器人。而且我觉得, 嗯,想想看,机器人是自主的。它们自己工作,
[133.344-137.616] SPEAKER_00: 但要么在隔离环境,要么某种程度上,可能处于
[137.696-146.438] SPEAKER_00: 它们只能待在特定环境,很少和人互动。 比如在工厂、仓库,甚至火星上工作。 在那里,它们完全自主运行。
[146.518-155.956] SPEAKER_00: 有人类的地方,所以现在有很多人机交互相关的工作。 这是其一。但就算从基础算法开始。 从系统、商业模式,到架构、规划等等。
[156.036-166.159] SPEAKER_00: 社会法律问题,一大堆和部署机器人车辆相关。 部署到有人类环境。而这些人类可能。 甚至没接受过互动训练,可能根本不会用这些车。
[166.239-182.623] SPEAKER_00: 服务,甚至不知道它们是自主的。他们只是在做自己的。 事情。 嗯。 嗯。 嗯。 嗯。 嗯。 嗯。 嗯。 嗯。 嗯。 是的。 环境是为人类设计的,不是机器人。这是当今最大挑战之一。
[182.703-189.529] SPEAKER_00: 就是让车辆融入进去。回到你的问题。 大规模实现,就是你走进一个城市,有成千上万。
[189.609-202.498] SPEAKER_00: 甚至数万辆自动驾驶车穿梭。密度大到如果你。 看到一辆,环顾四周,又一辆。就是这么密集。这种密度,我们。 以前从未有过。我敢肯定,这种密度会先出现在。
[202.578-211.912] SPEAKER_00: 自动驾驶汽车上,因为我们可以对环境稍作调整。尤其是。 让它们在地面上安全更容易。在空中时。 会复杂一点。但我认为不会有太大。 区别。
[211.992-215.103] SPEAKER_00: 总有一天,我们会很快看到这些发展。
[215.403-219.687] SPEAKER_03: 你觉得会有那么一天,成千上万送货无人机布满。 天空吗?
[219.987-237.067] SPEAKER_00: 老实说,我觉得可能。送货无人机一回事,但你可以想象。 交通方面,一个重要场景是,我们在波士顿,你想从波士顿。 去纽约。而且你想从这栋楼顶出发,到另一栋楼顶。 在曼哈顿,你一个半小时就能完成。
[237.147-239.480] SPEAKER_00: 我觉得那是巨大的机遇。
[239.780-243.413] SPEAKER_03: 个人出行。比如,你和一两个朋友,就像优步那样?
[243.713-253.233] SPEAKER_00: 类似优步,四到八人同行。工作中。 自动驾驶车我见过。单人出行有需求,但 也有几人同行,你我可以一起吃饭。我觉得有点
[253.313-264.867] SPEAKER_00: 听着疯狂甚至俗气,但我觉得这些都是 真正的机会。我在研究这些车,你会 而且我觉得,这不像普通飞机和机场 很快消失,但很多人会觉得他们
[264.947-269.196] SPEAKER_00: 愿意多花一百美元,把四小时旅程缩到
[269.496-282.942] SPEAKER_03: 一个半小时。飞行汽车多可行?一直是梦想,就像人们 想象未来五十年,会想到飞行汽车。像所有技术,它 现在觉得俗气,因为遥远,但一夜之间能变。只是
[283.022-286.493] SPEAKER_03: 技术上,实现它有多可行?我会谈到
[286.793-301.853] SPEAKER_00: 但有一点,我们常想未来会发生什么 未来50年很难猜,对吧?我不知道。我 我是说,可以猜未来50年交通的变化。我们可以 得到飞碟。我打赌,有五成机会,就像你 可以建造机器
[301.933-312.834] SPEAKER_00: 我能电离周围空气,用磁铁向下推,它们像飞碟飞 可能在未来50年内发生。所以有点难猜 就像你想到50年前。但我觉得,有这样一种
[312.914-322.294] SPEAKER_00: 有种概念叫敏捷空域。 那片空域机会很多。 比能飞的地方高一点,机会也多。 这片空间里,想象个扔石头的区域,很棘手。
[322.374-329.932] SPEAKER_00: 仔细想想,小孩扔石头就能击落飞机。 那会发生什么?想象高到扔不了石头。 但又够低,不干扰大型飞机。
[330.012-333.541] SPEAKER_00: 那些飞机飞得高,那片空域没用充分。
[333.621-343.025] SPEAKER_00: 完全没利用,对,有休闲的人。 偶尔飞,很少,抬头看一架都没有。 很少看到飞机用那片空间。 你会惊讶,离开机场它就像消失。
[343.105-348.805] SPEAKER_00: 飞走消失,利用那片空域有技术挑战。 挑战是建立自主性并确保安全。
[348.885-354.376] SPEAKER_00: 最终要安全,需要构建复杂软件。 比今天飞机上的复杂几个数量级。
[354.456-360.237] SPEAKER_00: 同时要像飞机安全一样确保它安全。 那就要去构建。 复杂硬件软件是挑战,尤其当你。
[360.317-368.235] SPEAKER_00: 构建硬件用数据建软件,它是。 当然,有些规则软件能完成特定任务,但 但训练也不少。你觉得机器学习是关键吗?
[368.535-372.285] SPEAKER_03: 未来安全车辆,尤其飞行器,可能不全是安全方面
[372.585-385.962] SPEAKER_00: 一部分,但我觉得 智能部分。嗯,有些东西我们用机器学习,而且 只是现在没别的办法,我也不知道还能怎么 完成。嗯,这难题一直有。我是说,我们也许可以
[386.042-390.314] SPEAKER_00: 我们也许能召集几十亿程序员,呃,人类程序员
[390.394-399.356] SPEAKER_00: 写检测空中物体的感知算法,或者你知道,我们 我不知道,甚至可能让机器人在模拟环境学习然后迁移 它们在模拟环境中的学习效果可能比
[399.436-404.347] SPEAKER_00: 几十亿人齐心编程要好得多,因为人类能力有限。那么,呃
[404.647-412.344] SPEAKER_03: 模拟在无人机中啥作用?你做了不少工作。前景多大? 就你刚才说的,训练和开发一个安全的 飞行机器人
[412.424-418.414] SPEAKER_03: 在模拟中训练并部署,让它在现实世界表现好,这种可能性多大?我认为
[418.714-428.445] SPEAKER_00: 很多人一听到模拟就想到训练,但我 觉得你说的有一点很有趣:开发。我认为模拟环境 其实可能是关键,对开发有利,而且不新鲜。比如,你知道
[428.525-435.665] SPEAKER_00: 汽车行业用动态模拟几十年了 而且它是 如果你想构建,就会模拟 嵌入式控制器,插进另一台计算机
[435.745-442.710] SPEAKER_00: 另一台计算机模拟微小东西,还能快进 能创建很厉害的模拟环境,比如 最近我们可以模拟摄像头
[442.790-450.092] SPEAKER_00: 比以前好得多,之前也能模拟 刚达到改进的转折点,随着硬件改进 特别是机器学习改进,我们会达到
[450.172-454.874] SPEAKER_00: 能非常逼真地模拟摄像头,就是模拟
[455.174-461.478] SPEAKER_03: 真实摄像头如何看待世界,从而探索局限 在模拟中训练感知算法,等等,没错
[461.778-471.193] SPEAKER_00: 没错,模拟所谓的…一直更容易 内感受传感器,比如惯性传感 一直很容易模拟,动力学也容易 比如受常微分方程支配的物理
[471.273-485.300] SPEAKER_00: 比如汽车怎么开、怎么滚动,怎么互动 道路互动,甚至飞机飞行,真正难的是 困难一直很难模拟,真正难的是 始终是要模拟 外部传感器好比从车里向外看,是项新技术。
[485.380-494.041] SPEAKER_00: 激光雷达稍简单,摄像头和雷达稍难。 我认为一旦解决这个问题,模拟的下个挑战是 模拟人类行为,也极其困难。即便想象人类
[494.121-503.745] SPEAKER_00: 驾驶的汽车会如何行动,即使很难,但想象 尝试模拟一个做各种手势的人,而你 知道是模拟,不是动作捕捉,但模拟
[503.825-516.761] SPEAKER_00: 非常困难。实际上,如今我经常参与这类高端 渲染项目,有个测试发给朋友或妈妈,发送 比如两张照片,问哪张是渲染的,哪张是真的 很难区分,除了我意识到
[516.841-526.105] SPEAKER_00: 除非放入人类,大脑经过训练,我们 擅长识别人类,但不擅长建筑环境,因为 建筑环境在人类进化后才出现,但人类
[526.185-539.121] SPEAKER_00: 一直存在。同样,看猴子,你无法区分 个体差异,但它们能区分。看人类时 它们几乎分不清,但我们能。所以我们的 眼睛训练有素,观察人类是否不对劲,我们会发现
[539.201-549.104] SPEAKER_00: 可能无法准确指出。所以朋友或妈妈测试中,结果是 让一个人在场景中行走,他们就会说,这不对。 这视频有点怪,但我能告诉你是那个人。
[549.184-561.400] SPEAKER_00: 带那人过来,给你看楼里或公寓的效果。 有时间渲染的话,会非常棒,非常棒。 这没啥奇怪,很多人看的电影全是电脑 生成的,就算现在看剧情片,好像啥也没发生
[561.480-564.289] SPEAKER_00: 动作上,但发现渲染背景更便宜。
[564.589-571.694] SPEAKER_03: 他们这么做,但我们怎么达成?咋让一个人通过 妈妈朋友测试,模拟人类走路,你觉得我们能 一步步做到?
[571.774-576.963] SPEAKER_03: 通过比较学习,让人类标注哪个更 逼真,而不是只看路径,因为完全神秘。
[577.263-583.869] SPEAKER_00: 我们——你说得对,模拟人类行为很难,因为很多 其他事,包括模拟摄像机,嗯,
[583.949-593.364] SPEAKER_00: 问题是,我们懂物理,知道它怎么运作, 都在现实世界,能写规则,能做到,比如 模拟摄像机,有种光线追踪,基本就是
[593.444-600.084] SPEAKER_00: 想象它很像——不完全一样,但很像逐光子追踪 光子弹射到物体上入眼,但人类行为
[600.164-609.498] SPEAKER_00: 开发动态数学模型,就能把它 放进处理器里。 经历那些事很难。你还能咋办?收集数据, 对吧?试匹配数据。或者,你可以,
[609.578-619.156] SPEAKER_00: 展示前期测试。说这个那个,最后就是 标注。人工标注的事,最终受限于 人手和他们能做的。他们 还得干很多其他事。所以模型人类行为,
[619.236-626.596] SPEAKER_00: 我觉得会特别难。这也影响 自动驾驶发展。我也看到了。比如, 你在造自动驾驶,刚开始,像城市挑战赛后,
[626.676-638.309] SPEAKER_00: 大家专注定位、地图和定位。 SLAM算法出来,谷歌就在做。建高清地图, 就是知道你在哪。 五年后,2012、2013年,AI革命来了,
[638.389-649.572] SPEAKER_00: 告诉我们别人在哪。但还是缺别人 接下来干啥。你想知道你在哪,想知道每个人 在干啥,希望知道自己下一步,然后预测 别人干啥。最后一点是真正挑战。
[649.872-657.139] SPEAKER_03: 你觉得自己的角色是啥?你的车, 机器人你,对未来的控制, 未来咋展开?这点有点被忽略。
[657.219-664.986] SPEAKER_03: 预测未来时,你自己要么 要么有攻击性,要么温和,要么发信号,像游戏 理论舞蹈,目前好像被忽略了
[665.286-675.328] SPEAKER_00: 对,完全忽略了。其实挺有趣的,比如我们怎么 跟事物和人互动的方式。比如,你看到一辆 一辆空车想干什么,突然就变成了一个东西。所以,
[675.408-684.928] SPEAKER_00: 你和桌子互动,可以扔背包或踢它 把脚放上去什么的。但对象要是人,就有各种 跟人互动的方式。比如你和我面对面,我们很礼貌
[685.008-698.594] SPEAKER_00: 我们交谈,通常能互相理解。我们会看到的。你永远不知道会发生 什么。但问题是,比如你和我可能通过YouTube评论交流 对话可能完全走偏。所以我觉得人们滥用这些
[698.674-706.533] SPEAKER_00: 自动驾驶汽车是个大问题。所以,当你是一辆自我车辆时 你正试图…… 协调路线,走你的路。其实比做人还难
[706.613-716.574] SPEAKER_00: 你得不仅像人一样聪明,你还 你是个物体,所以他们有点滥用你。你得确保 你能四处走动做事情。所以总的来说,我相信博弈论
[716.654-742.897] SPEAKER_00: 这种理念。我自己写过不少论文,既关于博弈论,也关于 还有理解社会价值取向的。比如,有些人 有人有攻击性,有人没有。机器人观察驾驶就能判断。靠近时识别攻击性并做决策。但难题是机器人该不该有攻击性?攻击很危险,社会成本高,现代人不接受。所以不好说。但机器人不会攻击。座位空着就像空壳,人们想控制它。机器人需要回应。大规模部署有社会问题。
[742.977-751.034] SPEAKER_00: 光看人们怎么开车。靠近时就能判断。 理解,比如有人表现出攻击性或非攻击性,你就能判断。
[751.334-758.253] SPEAKER_03: 决策。预测他们行为,难题是... 机器人该不该有攻击性? 面对攻击性机器人,攻击性很危险。
[758.333-762.779] SPEAKER_03: 社会成本高,别人看法重要。人们... 现代社会不太接受攻击性机器人。
[763.079-775.643] SPEAKER_00: 没错,确实如此。所以不太确定怎么办。 但我确实知道这些机器人怎么跟别人互动。 而且它们不会有攻击性。不会。 那种互动一直存在。你可能和其他人互动。
[775.723-784.082] SPEAKER_00: 车辆或行人。就像我说的,那一刻... 座位上没人,像个空壳滚下来。 就和其它非人类东西一样。于是人们...
[784.162-795.298] SPEAKER_00: 也许“虐待”不恰当,但人们可能觉得理所当然。 比如,这是人类的礼物,设计成适合人类。他们想要... 他们想要拥有它。机器人需要理解并需要...
[795.378-805.432] SPEAKER_00: 以某种方式回应。这开启了很多有趣的... 大规模部署机器人,社会问题就来了。会发生什么? 大规模部署机器人时,设计系统方式
[805.512-814.347] SPEAKER_00: 让它们高效,或设计得非常可持续。但最终 可持续与效率的权衡,就在那里。我们得 做出选择,不能放着不管。比如
[814.427-824.783] SPEAKER_00: 可以非常激进,减少延误,提高运输能力 或者更友善,允许其他人 拥有环境,住好地方,效率下降。所以当你思考 这个问题时,可持续性会与
[824.863-842.106] SPEAKER_00: 能耗或环境影响直接关联。这些存在。但像 宜居性是另一个可持续问题。所以创造一个人们想住的 环境。如果机器人到处很激进,你可能不想住在那 环境中,也许。但如果不激进,那么你
[842.186-849.790] SPEAKER_00: 可能增加交通等延误。所以总在平衡 这点,这个选择在交通中一直存在。 但随自主性增强,这个选择更明确。
[850.090-855.778] SPEAKER_03: 是的。明确后,开始优化。然后提出 社会问题:更看重效率还是可持续?
[855.858-856.810] SPEAKER_03: 有点意思。
[857.110-865.248] SPEAKER_00: 这会发生的。我们不得不,关于 整个自动驾驶问题,也有点,很多时候我们都有 技术发展几百年,产品自然就跟上。
[865.328-878.078] SPEAKER_00: 然后得做这些选择。现在时机不错,我们甚至考虑 关于自动驾驶出租车的部署和系统演进。而且你 商业模式不同,对架构和城市规划影响也不同。
[878.158-891.686] SPEAKER_00: 会涉及法规等问题,然后遇到之前没想过的问题。 但可持续性和伦理问题才是核心。我的意思是,甚至测试 想想看,你在有人的环境中测试自动驾驶车辆。
[891.766-897.687] SPEAKER_00: 环境中,风险很小,但严格大于零。 你把人们置于其中,面临创新和风险的权衡。
[897.767-911.132] SPEAKER_00: 处于平衡中。我们很清楚,如果你在一个 测试自动驾驶车辆的地方,不测试就发展慢。我的意思是 这不代表我们无法发展。我认为会相当困难, 也许可以,也不确定。但问题在于这类权衡
[911.212-915.054] SPEAKER_00: 我们已经在做了。系统更普及后,这些权衡会
[915.354-923.620] SPEAKER_03: 真正显现。所以你是Optimus Ride的联合创始人,这是家自动驾驶汽车公司。 我们会谈到,但就这点我想问一下
[923.700-927.728] SPEAKER_03: 举个好例子,先不提Optimus Ride,算是不同策略的典型。
[927.808-937.432] SPEAKER_03: 在创新与安全之间的谱系上,比如Waymo,谷歌的自动驾驶 Waymo代表更谨慎的方法,另一边是特斯拉 由埃隆·马斯克领导。另一边特斯拉也一样。
[937.512-946.451] SPEAKER_03: 但这更……怎么说呢,激进的 创新的?不知道。你觉得这两种策略有啥区别? 你觉得哪种更可行?需要啥?更容易成功?
[946.531-948.736] SPEAKER_03: 短期和长期?肯定要有点平衡。
[949.036-954.504] SPEAKER_00: 方向没错。但我认为最重要的其实是—— 让公众知情。所以我不介意。比如我在哪,不太介意
[954.584-960.249] SPEAKER_00: 承担点风险。别人可能介意。关键是要让 大家知情,才能做出选择。有些情况下
[960.329-967.736] SPEAKER_00: 匿名选择当然难。但我不觉得 真的很难告知。所以比如特斯拉 的做法……不知道,知情程度难说,但确实有些知情。
[967.816-977.057] SPEAKER_00: 我是说,事情总会曝光。人们知道自己吃啥之类 等等。但我认为本质上,两家公司都有点 代表什么……当然,一个更安全,另一个
[977.137-984.102] SPEAKER_00: 或者说,不管目标如何,另一个更激进 不管目标。但反过来看,还有 其实两个不同维度。一个是
[984.182-991.983] SPEAKER_00: Waymo,我发现他们更偏向研究,也 所以有点……不确定他们是否真的想要一个 即时产品。他们聊过,有时候
[992.063-1002.465] SPEAKER_00: 谈这事有点压力。他们想试试。可我觉得他们 他们心里可能这么想,但不会明说。可我觉得他们 他们意识到我们在造新引擎,类似AI引擎之类的
[1002.545-1017.454] SPEAKER_00: 就是这样。自动驾驶汽车就是那引擎很酷的应用。 它能让你知道自车位置,其他物体在哪,一切 其他物体在哪,它们要做什么,你怎么反应?实际怎么做? 你知道,怎样正确地和人类互动?怎么构建这些系统?我觉得
[1017.534-1031.700] SPEAKER_00: 他们想知道,想理解。所以他们就继续干下去了。 另外,特斯拉也在做有趣的事。我觉得他们 他们有好产品,很多人用。虽然不适合我,但我完全能 人们喜欢它。而且除了自动化,他们产品也不错。
[1031.780-1044.031] SPEAKER_00: 但我单说自动化。就是有点自动驾驶。 你还是得注意,必须时刻盯着。 你需要留意它,对吧?但人们好像还在用。所以 它在某些方面有用。所以大家愿意花钱买。
[1044.111-1059.078] SPEAKER_00: 愿意买。这也是大家买特斯拉的一个原因。 可能其中一个原因是马斯克是CEO。他看起来很有远见。 大家这么觉得。他显得很有远见。所以这大概给车增值了5000 美元的价值。另外5000可能是自动驾驶。而且它确实有用。我是说,
[1059.158-1069.699] SPEAKER_00: 在人们实际使用中它有用。所以我看出特斯拉,当然 他们有远见,想推出方法,可能真会实现。 但我觉得,搞这么多更新并推出,还有个大好处。
[1069.779-1079.542] SPEAKER_00: 因为人们愿意付费,这是基本需求供给,市场喜欢。 他们乐意多付五千或一万美金,就为图个新奇。 拿到后一直用,不是尝几次就扔。
[1079.622-1093.753] SPEAKER_00: 新奇归新奇,但大部分时间都在用。所以特斯拉就是这么干的。 实际上很不一样。他们在正交维度上搞不同类型的东西。 用同样的AI引擎。所以很有可能,他们有一天都会 用类似内燃机的东西。这个比喻很烂,但
[1093.833-1104.795] SPEAKER_00: 就像内燃机。一个造汽车,另一个造卡车什么的。 所以最终用途差别很大。 所以,你是Optimus Ride创始人之一。退一步说,这是自动驾驶的成功案例。
[1105.095-1118.507] SPEAKER_03: 一家伟大的自动驾驶公司。从头讲,创办一家自动驾驶公司需要啥? 怎么从想法到部署车辆,像你们在很多地方做的那样,包括纽约? 我想说,我们意识到自动驾驶行业早有很多讨论,
[1118.587-1124.554] SPEAKER_03: 大概2014年我们想开始时,总听到"两年后、三年后全自动驾驶"这种话。
[1124.854-1129.683] SPEAKER_00: 包括纽约?我们经历的是… 在我看来,自动驾驶领域的讨论早就很多了。
[1129.763-1140.644] SPEAKER_00: 大概2014年,我们正要开始……我也不太确定,就有点…… 总听人说,两年后、三年后就能全自动驾驶。 我本来不太信。我是MIT城市挑战赛的选手。
[1140.724-1150.360] SPEAKER_00: 这事挺有意思。我高中和大学做了很多数学。 做数学。后来我突然意识到, 我想造点东西,就来了MIT机械工程。现在发现,
[1150.440-1159.101] SPEAKER_00: 导师雇我可能因为我数学好。但我说,不, 不,我要做城市挑战赛的车。造自动驾驶汽车。 我觉得那是过程,我们真正明白了挑战是什么,
[1159.181-1168.782] SPEAKER_00: 还有各种限制,比如计算机的局限, 理解人类行为。太多这类事了,最后没搞成。 于是我们说,干嘛不更市场导向?于是我们
[1168.862-1178.126] SPEAKER_00: 专注一个市场,为它造系统。但我们造的不完全是 纯自动驾驶车。我们把全自主装进车里。但是, 我们的想法是,这方法应该需要
[1178.206-1187.761] SPEAKER_00: 人来操作,而不是光坐着。我觉得现在的情况是 一个人开一辆车,不管什么车。可能是叉车, 卡车或轿车。我们想改变这个局面,
[1187.841-1190.708] SPEAKER_00: 变成10个人管50辆车。怎么做?
[1191.008-1197.730] SPEAKER_03: 你指远程操作那种情况吧?能说说这意味着什么吗? 10个人管50辆车?听众可能糊涂。那是什么意思?
[1198.030-1204.020] SPEAKER_00: 50辆车?好问题。我特意没叫它远程操作。 以前人们以为,有人坐在远处,
[1204.100-1212.377] SPEAKER_00: 戴VR开车,但我们不是这个意思。我们说的是, 人类主导,但车在某些地方能自己操作。 想象一个房间,能看到其他车在干什么。
[1212.457-1219.481] SPEAKER_00: 有些人就像空中交通管制员, 叫他们自动驾驶车辆控制器。他们能看到一张大地图, 理解为什么车很有信心,
[1219.561-1226.480] SPEAKER_00: 以及哪里还需要帮忙。 帮忙不是为了安全,而是为了效率。 车本来就很安全,但没人管的话只能开很慢。
[1226.560-1235.917] SPEAKER_00: 想让车速到25英里每小时,就需要人介入。 比如车到了十字路口, (断句) 是的。 它可以等,稍微往前挪显示意图,或者左转。
[1235.997-1248.515] SPEAKER_00: 现在路况清了我就能转,但你不允许我就不转。 这只是个例子,不一定真这么做。 如果每个路口都这么细,就像要人按按钮,效率提升不大。 你需要能大致绕行和处理这些事。但我认为你需要
[1248.595-1265.176] SPEAKER_00: 你得能大致绕过去,还得会干这些事。不过我觉得你需要 人能设定车辆的高层行为。这也是自动驾驶的一部分。 车?很多人想法大概是这样。就是说,技术领域经常如此。 经常这样。你心里想,我懂车,也听过机器人。所以我猜会这样:
[1265.256-1278.807] SPEAKER_00: 我买辆车,按个钮,它就能自己开。 那什么时候实现?大家通常都这么想。 但真想想实际会怎样呢? 会发现有些东西以你完全想不到的方式出现。要是有人问你,你可能会
[1278.887-1290.348] SPEAKER_00: 说,我不需要那个,或者不该那样等等。然后它就变成了 下一个大事件——代码和代码。所以这种驾驶方式很强大。 可能非常强大。我觉得很快我们会
[1290.428-1300.946] SPEAKER_00: 睁眼看到:你逛商场,会看到一群安保机器人。 正是这样操作。进工厂仓库,会看到一大群 机器人也这样操作。去布鲁克林海军造船厂,
[1301.026-1314.716] SPEAKER_00: 会看到很多自动驾驶车——Optimus Ride——它们可能也是 这样操作的。没错。 但我觉得大家没看到这一点。我真的认为 可能我们会看到这项技术像蘑菇一样 在从未预料的地方冒出来。那才是真惊喜。
[1314.796-1327.081] SPEAKER_00: 然后有天,你车真能自己开了,你大概不会多惊讶, 因为你早习惯了。 你和他们互动,坐Optimus ride,希望是你选的。 接着你听了很多事,到处走,和他们互动。
[1327.161-1341.327] SPEAKER_00: 不知道,比如有辆小送货车上人行道, 送货给你,你拿走,它会说谢谢。 然后你习惯了,有一天你的车真能自动驾驶,法规 通过后,你按个按钮睡觉,一点都不奇怪。 我觉得那可能就是现实。
[1341.627-1351.402] SPEAKER_03: 所以会很多围绕自动驾驶车的应用,一些 其中可能很多是我们完全没想到的。 所以看Optimus ride,你觉得是什么?那个爆款应用,
[1351.482-1357.286] SPEAKER_03: 真正服务移动出行的人,你认为Optimus ride未来会和什么连接? ?
[1357.586-1370.893] SPEAKER_00: 我觉得我首先想瞄准的地方,老实说,是那些 在某个环境里需要交通的地方。 就像人们通常说的地理围栏。 所以你可以想象大概两英里乘两英里的区域,可能更大或更小 的一种环境。
[1370.973-1382.341] SPEAKER_00: 而且很多这类环境通常缺交通。 我们今天所在的布鲁克林海军造船厂,我们在几个不同地方,但那个 是最后公开的那个。 这个例子很好。 所以那边车不多。
[1382.421-1394.019] SPEAKER_00: 而且,在那开优步可能太贵了。 相比之下,别处优先,这里交通匮乏。 相比之下,别处优先,这里交通匮乏。 于是,人们开车进来,一天内从A到B。
[1394.099-1406.721] SPEAKER_00: 于是,人们开车进来,一天内从A到B。 他们开自己的车。 他们开自己的车。 于是我们建了更多停车场,方便开车去吃午饭。 于是我们建了更多停车场,方便开车去吃午饭。
[1406.801-1423.881] SPEAKER_00: 我觉得可以先在这些地方建高效、安全、可持续的交通。 我觉得可以先在这些地方建高效、安全、可持续的交通。 而且我觉得能便宜、方便、可持续地提供出行服务。 而且我觉得能便宜、方便、可持续地提供出行服务。
[1423.961-1439.869] SPEAKER_00: 但这也能回收停车场投入的人力、资金和土地。 但这也能回收停车场投入的人力、资金和土地。 即使是两英里见方的小地方,也不一定在纽约市中心。 即使是两英里见方的小地方,也不一定在纽约市中心。
[1439.949-1452.861] SPEAKER_00: 我的意思是,其他地方都得几千万美元。 在纽约市中心,你能看到省几十亿。 就凭这么做。 这就是经济方面。 还有社会方面,对吧? 我的意思是,看看四周。 我们住的地方就像给车建的。
[1452.941-1464.553] SPEAKER_00: 一百年前,这里不是这样。 现在没人走马路中央。 那是给车用的。 没人告诉过你,但你会慢慢习惯。 所以有时会封路。 这里就有过。 比如庆祝时,他们会封路。
[1464.633-1479.333] SPEAKER_00: 但人们还是不走马路中间,就像平时不会。 但我觉得影响很大。 汽车。 它对我们空间影响很大。 我们还讨论过可持续性、宜居性,最终这些 地方,停车位能变成更有用的东西,或者
[1479.413-1491.664] SPEAKER_00: 就是公园或休闲区。 所以,这是我们瞄准的第一个目标。 我们从经济和社会都得到了积极回应。 特别是那些有前瞻眼光的地方。 比如布鲁克林海军造船厂,有租户。
[1491.744-1503.043] SPEAKER_00: 有个独特区域叫新实验室。 算是个创新中心。 那里有很多初创公司。 你会遇到那些想改善环境的人。 更加宜居。 Optimus Ride的方案几乎自然融入并 成为那样。
[1503.123-1514.015] SPEAKER_00: 很多交通不便的地方,他们会租班车。 所以你可以问任何人。 假设你租了辆车。 假设你租了辆车。 班车体验很差。 人们讨厌班车。 我可以告诉你为什么。
[1514.095-1529.062] SPEAKER_00: 因为司机在班车业务中很贵。 所以合理做法是给一个司机配20、30个座位。 很多人都会误会。 他们觉得班车应该很大。 我们Optimus Ride常碰到这种事。 我们提供四座或六座的车。 他们就会问,那二十座的?
[1529.142-1539.651] SPEAKER_00: 我说,你不需要二十座的。 你想把座位分散开,这样能更快跑。 运输延误就会减少。 这才是你想要的。 车太大,既延误又不灵活。 加速减速都很慢。 你得爬上去。
[1539.731-1543.957] SPEAKER_00: 所以这种车很难用。 调度上,小车多了就更接近
[1544.257-1555.486] SPEAKER_03: 优步那种个性化服务,就是调度车辆 到你面前的物流。 对。 大班车更难,因为车少,而且通常 沿着固定路线走,它该覆盖的路线。 就是那条本应到达的特定路线。
[1555.786-1567.839] SPEAKER_00: 沿着固定路线,所有座位一起移动,不是一整批。 你可以想象其他路线,但把座位分开。 不再让它们相隔一英里,可能相距半英里。 如果分成两组,距离就减半。
[1567.919-1584.256] SPEAKER_00: 对。 所以这不意味着延误,出发时不用等很久。 这也是主要原因,不用攀爬。 另一件事,合理拆分,预知去向,甚至不需要应用。 很多人问应用,我们说直接上车不好吗? 直接上车,它识别你,给你地点选项,你选一个。
[1584.336-1596.645] SPEAKER_00: 对。 我也把应用内化了。 每个人都觉得需要应用。 但其实不需要应用。 直接走进那车就行。 直接上去。 但我们真正想做的是利用穿梭体验。 你直接走进去就行。 你就直接走上去。
[1596.725-1608.825] SPEAKER_00: 不过,我们最想做的,就是利用那种穿梭的感觉。 没人喜欢的东西,把它变成大家都爱的。 所以这是另一个重点。 小心说,我们不做班车服务,像远程操作那样。
[1608.905-1618.564] SPEAKER_00: 我们确实把它当做一个系统或网络来设计。 但最终,我们去那些通常租班车的地方, 人们不太喜欢。 我们希望让它变成人们爱的东西。
[1618.864-1627.908] SPEAKER_03: 你之前提到过,你觉得需要多少辆Optimus, 才能让波士顿或纽约的人一出门就 这是个数学问题:会有两辆Optimus在 视线内。
[1627.988-1629.323] SPEAKER_03: 这个数字对吗?
[1629.623-1643.395] SPEAKER_00: 嗯,至少一辆。 这就是密度。 就是说,看到一辆车,环顾四周,就能看到另一辆。 想想特斯拉说他们收集了大量数据。 你在特斯拉上看到这种情况吗? 你四处走走,看看周围,看到特斯拉了吗?
[1643.695-1646.899] SPEAKER_03: 可能没有。 也许只在加州某些特定区域。
[1647.199-1657.023] SPEAKER_00: 也许吧。 你说得对。 有几个邮编。 但我觉得重要,因为那几组邮编。 我们依赖一件事,我很快回答你,但 今天跑题太多。 当然了。 所以我觉得这很重要。
[1657.103-1667.937] SPEAKER_00: 人们叫它数据密度或速度。 所以,反复看到同一地点收集数据很好。 你可以全国开一万英里,或封闭环境里开一万英里。 你会看到同一个路口上百次。
[1668.017-1680.128] SPEAKER_00: 当预测人们在那路口做什么时, 你就会非常擅长。 相比下,如果你全国开一万英里,你只看过一次。 所以,预测人们行为变得困难。 而且你说出了需要啥。 是数万辆车。
[1680.208-1692.540] SPEAKER_00: 你确实得是特定比例的车。 比如,新加坡天气好,你可以直接拦出租车,他们 流量10%、20%。 出租车真多啊。 说到底,那是你的目标。
[1692.620-1700.340] SPEAKER_00: 这样效益才能翻倍增长。 算是关键点吧。 但到了那点,好处就来了。 而且能载人。 这算一点。 大家真不爱等自己。
[1700.420-1709.522] SPEAKER_00: 比如订商品,他们能等更久。 比如你在家。 你想等半小时。 听着不错。 大家会说很好。 你要打车。 你等了半小时。 那太疯狂了。 你不想等那么久。
[1709.602-1718.425] SPEAKER_00: 我觉得高峰时系统能专注运人。 关于运人。 交通流量里它占很大一块,去那儿一看就有。 东西就在那儿。 然后你就直接进去。
[1718.505-1727.363] SPEAKER_00: 它已经在等你了。 然后拿走它。 大规模做,比如今天,和司机聊,Uber抽成。 一定比例。 这个比例很小。 司机却觉得很大。
[1727.443-1736.800] SPEAKER_00: 但整体看,付给Uber的钱大部分 其实是给了司机。 司机说大部分是他们的时间。 不是油钱。 也不全是车本身。
[1736.880-1743.520] SPEAKER_00: 那些都是时间。 如果没人开,或者只有0.1个人在开, 也就是很少人开车,一人管多辆。
[1743.600-1755.433] SPEAKER_00: 那样你就会发现,燃油车 非常没效率。 造它们就是为了跑高速。 它们通过了碰撞测试。 它们真的很重。 它们真不需要是乘客重量的25倍,面积也不需那么大。 等等。
[1755.513-1768.182] SPEAKER_00: 但如果你克服低效,真正造城市用车之类的, 东西,经济性真说得通了,甚至能到,我不晓得。 你坐进车里,从A到B可能花不了一美元。 不改目的地,付99美分就到。
[1768.262-1775.390] SPEAKER_00: 拼车中途再停一站,就更划算。 这类事,至少在模型、数学理论上, 开始真正说得通了。
[1775.690-1788.800] SPEAKER_03: 我觉得Optimus Ride做的事很让人兴奋,因为它感觉 是最触手可及的。 它真的会到来并产生影响。 对,就这想法。 如果我们对比下,回到老朋友Waymo和特斯拉。
[1788.880-1792.513] SPEAKER_03: Waymo和Optimus Ride技术上方法类似,
[1792.593-1795.925] SPEAKER_03: 但不同在于, 他们不急于今天就有影响。
[1796.005-1806.721] SPEAKER_03: 他们更看重长期投资。 它更像是个研究项目, 据我所知,他们正在试着解决, 或许你能区分一下, 但他们想要更自由的运动, 就是从A到B移动,
[1806.801-1817.934] SPEAKER_03: 但这里A到B无处不在, 而Optimus Ride设置了地理围栏, 真正建立了移动性, 先在特定环境里运行再扩展。 特斯拉则完全相反, 是全球范围,
[1818.014-1826.779] SPEAKER_03: 都要实现自动化。 高速和城市驾驶、 各种驾驶,你知道, 通过逐步改进来接近它, 自动驾驶的能力。 所以对比这些, 另外,我想提一个问题,
[1826.859-1838.169] SPEAKER_03: 没人喜欢,但关乎时间线。 每种方法大概何时能实现? 未来谁说得准?会不会大规模部署? 马斯克预测的方法最疯狂。 我听过今年年底这种说法,对吧?
[1838.249-1840.814] SPEAKER_03: 所以那个可能很不准。 可到底有多不准呢?
[1841.114-1850.218] SPEAKER_00: 我是说,和所有人一样, 真的很难猜。 我不知道特斯拉能看到什么, 或者马斯克看到什么就说, 嘿,就今年年底嘛。 我不知道你能看啥,你知道吗?
[1850.298-1862.421] SPEAKER_00: 就算看数据,你知道,如果你看数据, 甚至想推断最终状态, 却不知道具体会发生啥, 特别是机器学习这种方法, 这真的很难预测。 但我肯定下面这种情况会发生。
[1862.501-1876.679] SPEAKER_00: 我觉得很多人,他们做的就是, 有件事我说过几次, 技术预测里的时间膨胀现象出现了。 我简单说说。 很多事看着遥遥领先, 大家却觉得近在眼前。 也有很多事其实近在眼前, 大家却觉得遥不可及。
[1876.759-1890.763] SPEAKER_00: 大家想看清技术发展格局。 不可否认,挺乱的。 任何事都可能随时、无序发生。 里头有一大堆东西。 大家抓住它、限定它,塞进未来三年。 有些事可能今年底或明年发生。 等等。
[1890.843-1906.449] SPEAKER_00: 但他们却推到几年后。 因为很难说清楚。 还有一些事,比如, 可能还要再等二十年,你懂的。 希望有生之年能看到。 因为,你知道,我们不知道。 希望有生之年能实现。 而且因为,你知道,我们不知道。
[1906.529-1920.835] SPEAKER_00: 其实我们根本不知道有多难。 这本身就是个问题。 我们不知道有些问题是不是 其实这些是AI完备问题。 我们完全不知道怎么回事。 我们把这一切都限制住。 然后我们说三年后起步。 有些人比较乐观。
[1920.915-1931.610] SPEAKER_00: 他们就瞄准年底。 有些人比较现实。 他们说比如五年。 但我们都觉得很难说。 我觉得预测提前两年或 三年后的产品很难知道。 我们一般会说,好吧,
[1931.690-1945.369] SPEAKER_00: 这是一家科技公司。 但有时你确实想构建东西。 技术上确实有差距。 特斯拉在电动汽车上就这样。 就像他们刚开始的时候。 他们会看一种像摩尔定律的图表。 然后他们就大致外推一下。
[1945.449-1961.276] SPEAKER_00: 他们会说,我们想达到这里。 要实现那需要什么技术? 我们不知道。 情况就是这样。 所以很可能会继续发展下去。 至于车载AI,我们还没有。 就像我们没法,我是说,你能量化什么? 嗯。 你在看哪种图表? 你知道吗?
[1961.356-1969.076] SPEAKER_00: 但技术差距这么大时, 真的很难预测。 现在我讲了大概五分钟, 却避开了你的问题。 关于那个我什么也没说。
[1969.376-1971.384] SPEAKER_01: 这做得非常巧妙。
[1971.684-1978.371] SPEAKER_03: 那做得非常好。 而且我不觉得你,其实你已经论证了。 这不是干这个的。 就算你现在回答,也没什么用。
[1978.671-1989.169] SPEAKER_00: 这很难办。 有件事我特别信。 这不是我的主意。 这问题聊过好几次了。 但这有点像创业公司。 或者创新公司。 比如Waymo、特斯拉。 甚至还有其他大公司。
[1989.249-2002.823] SPEAKER_00: 在试各种事。 迭代学习很重要。 我们在那试各种事。 等等,这很重要。 我们尽力去理解。 我觉得, 硅谷商业模式做得挺不错。 现在技术有差距,我们努力做。
[2002.903-2015.711] SPEAKER_00: 现在我们在做这件事。 技术差距实实在在。 以前就是想构建。 我不是在说这些公司。 他们在做很牛的技术,比如, 让搜索速度飞快。 以前这种情况不多见。
[2015.791-2023.488] SPEAKER_00: 但至少是种技术。 某种程度上能预测。 现在我们试着构建, 那些不好量化的事。 我们在看什么指标?
[2023.788-2033.644] SPEAKER_03: 心理上,作为某种, 作为研究生和Optimus Ride的负责人, 一群才华横溢的工程师,只是好奇。 你觉得这样想好吗? 不管什么技术差距。
[2033.724-2045.324] SPEAKER_03: 年底前能弥补吗? 或者你,因为我们不知道。 所以方式... 你想说一切会指数级改善吗? 作为领导者,对自己和周围人? 或者你想变得有点,不一定是愤世嫉俗,
[2045.404-2052.787] SPEAKER_03: 但我不想说现实,因为很难预测。 但是,对,也许更愤世嫉俗,更悲观, 关于弥合差距的能力。
[2053.087-2070.516] SPEAKER_00: 对,我觉得,回到过去, 我觉得迭代学习是关键。 那就是,你在外面, 你在做实验来学习。 这不代表,像,你知道, 比如你是Optimus Ride,你在做某事, 但就像在一个环境里。 但是像特斯拉做的,我觉得, 也是类似的概念。
[2070.596-2083.485] SPEAKER_00: 而且,人们到处说,比如, 今年,明年,后年等等。 但我觉得它的好处 是他们在外头,推动技术。 我觉得他们更应该做的是, 我觉得那种告诉人们 关于他们会用什么技术。 好的坏的都有。
[2083.565-2096.837] SPEAKER_00: 不只是那一点。 如果运行得好,我觉得。 不是说他们做得不好。 他们有点努力。 他们发布了一些东西。 或者YouTube视频会出来。 召唤功能时不时运行。 人们也收到了信息。 所以循环继续。
[2096.917-2108.541] SPEAKER_00: 但我佩服这点。 他们走出去。 做了了不起的事。 自己做实验。 我们也在做。 我们缩小技术差距。 有些是正交的。 就像我们讨论的。 远程工作就这样。
[2108.621-2123.855] SPEAKER_00: 在这个环境里。 或者想想一辆特斯拉汽车, 也许有一天你能用上它, 就像交通畅通, 就像你走走停停, 你只需按下按钮,就能真的, 或者有另一条车道, 你就能并道开进去, 我认为他们能实现,我相信。 是的。
[2123.935-2133.559] SPEAKER_00: 所以我认为那部分, 非常重要且关键。 除此之外,我觉得, 它到底什么时候会发生? 我的意思是,这很难预测。 而且我想,如果能做一个
[2133.639-2139.583] SPEAKER_00: 一两年计划会很好, 等情况更可预测时, 你弥补了技术差距, 以及那种,
[2139.663-2148.544] SPEAKER_00: 随之产生的产品。 所以我知道Optimus Ride 还有其他我参与的公司 我是说,有时会碰到这种情况 你想做一个产品 而且大家也投资建设
[2148.624-2160.097] SPEAKER_00: 投资者确实想知道 比较投资项目时 他们就想知道接下来会怎样 清楚说明这点挺好 但除此之外 它成了我们未来的愿景 比如五年、十年 这没什么意义
[2160.397-2163.032] SPEAKER_03: 但迭代学习是关键 边做边学
[2163.332-2165.526] SPEAKER_00: 这才是关键
[2165.826-2174.243] SPEAKER_03: 我不得不反问你 批评方面 比如特斯拉的沟通 某人如何工作等等 我参观了Optimus Ride 你们在做很棒的事 但互联网不知道这事儿
[2174.323-2188.431] SPEAKER_03: 你们该多交流 展示一下 展示些棒的东西 能用的和不能用的东西 这只是我看到的 对不同物体和行人的追踪 那儿有难以置信的事 也许是我书呆子气犯了 但世界会喜欢看那些东西
[2188.731-2193.433] SPEAKER_00: 对,说得好 我想,这并不是说 我们没能力做到 我们曾经做了个决定
[2193.513-2204.684] SPEAKER_00: 那个决定确实涉及我很多 某种程度上做这事儿 在隐身模式中待了一阵 但我觉得,你知道 我们会再开大一点。 而且我们在Optimus Ride 也进入新时代了。 我们现在规模很大了。
[2204.764-2218.245] SPEAKER_00: 我们在做很多有趣的事。 而且我觉得,一些部署 我们公布的是最早的。 我们掌握的信息。 我们推出的一些东西。 我们也会推出技术。 我们开发的很多东西。 真的很棒。 我们马上开始推出。
[2218.325-2227.020] SPEAKER_00: 我们特别希望 和顶尖人才合作。 而且我觉得,不只是给他们看。 来我们办公室面试时 而是公开地 让大家对我们做的事兴奋。
[2227.320-2230.071] SPEAKER_03: 所以在自动驾驶领域 最后一个问题。
[2230.151-2241.426] SPEAKER_03: 你说过激光雷达是拐杖。 我跟很多人聊过这事。 必须得问你。 你在DARPA时没少用那拐杖。 所以他的总体想法,怎么说呢。 我觉得更有挑衅和趣味。 而不是技术讨论。
[2241.506-2250.329] SPEAKER_03: 但核心观点是,摄像头。 主要靠摄像头的系统将。 定义自动驾驶的未来。 那你怎么看这个观点? 激光雷达是拐杖 vs 摄像头系统?
[2250.629-2263.298] SPEAKER_00: 先说第一点。 我觉得,你知道,我纯粹靠摄像头。 是自动驾驶的忠实信徒。 我认为,可以加很多自主性。 就能取得很棒的成绩。 而且时间上很可能。 像我们说的,20年后无法预测。
[2263.378-2273.527] SPEAKER_00: 就像你也能做我们做的。 今天只用LiDAR就行。 然后只用摄像头也能行。 而且我觉得你可以直接。 我也会签上名字。 就像会有那么一天。 当只用摄像头也行的时候。
[2273.607-2281.374] SPEAKER_00: 不过到那时很可能。 LiDAR能增强系统可靠性。 或者便宜到不装就傻。 就装在那里。 我们可能正面临那种未来。
[2281.674-2287.002] SPEAKER_03: 我们现在是不是太依赖LiDAR? 因为我们更了解它,它更可靠。 从安全角度看?
[2287.302-2302.258] SPEAKER_00: 用它开发更容易。 这是另一回事。 坦白说,我的意思是。 我们见过很多所谓的自动驾驶公司。 来了又走。 而且这种方法,就是把激光雷达装车上。 而且用起来还挺容易的。 有了激光雷达,你只需写代码。
[2302.338-2315.262] SPEAKER_00: 按下按钮,就能做演示。 所以我认为,确实有很多人。 专注激光雷达,因为它更容易用。 这并不意味着,没有摄像头。 仅用摄像头,你做不到他们做的事。 但困难得多。 所以,你需要专业知识才能用这个。
[2315.342-2328.765] SPEAKER_00: 我们相信的,你可能已经看到了,那就是。 我们相信计算机视觉。 我们在Optimus Ride确实大量研究计算机视觉。 我们从第一天就这么做了。 我们也相信传感器融合。 所以,我们对激光雷达用得比较少。
[2328.845-2342.907] SPEAKER_00: 但我们确实在用。 而且我认为,未来,我真的相信。 下面这些事可能会发生。 首先,未来可能会有一种情况。 有些车装了激光雷达什么的 但啥也干不了 没法用摄像头开 但在超前50年的未来
[2342.987-2351.624] SPEAKER_00: 它们也能光用摄像头开 尤其在孤立环境,光用摄像头 就能完成任务 同一个未来,很可能 激光雷达很便宜,说实话,让软件 至少减少计算量
[2351.704-2362.782] SPEAKER_00: 或者更简单好认证 或者保证安全啥的 所以不装激光雷达有点傻 比如想象,你要么花钱买激光雷达 要么为计算花钱 如果不装激光雷达,系统更贵
[2362.862-2375.531] SPEAKER_00: 因为要投入大量计算 这是另一种可能 我确实觉得很多最初部署 自动驾驶车,我觉得会用激光雷达 特别是短距离或低范围, 要么短距离,要么低分辨率LiDAR。 其实制造不难。
[2375.611-2389.568] SPEAKER_00: 固态的。 它们还在扫描。 但像MEMS扫描LiDAR那种, 其实不难。 我觉得它们会在频谱上做文章。 相控阵就难一点。 但我觉得把MEMS反射镜放进去, 让它扫描环境。 这不难。
[2389.648-2402.537] SPEAKER_00: 唯一问题是,像技术开发常遇到的, 现在做技术开发, 你会碰到宇宙的极限。 光速是个难题。 当你扫描环境时, 所以要么分辨率差,要么距离短。 但它还是能低成本装进去。
[2402.837-2412.473] SPEAKER_03: 所以回到无人机。 你在洛克希德·马丁的Alpha Pilot挑战赛中扮演角色。 各团队在这里进行无人机竞速比赛。 这很酷很激烈,是AI的有趣应用。
[2412.553-2422.293] SPEAKER_03: 那你能说说这个挑战的基本情况吗? 你扮演什么角色?对此有什么看法? 这有点像早期的DARPA挑战赛。 之前是穿越沙漠,现在成了无人机竞速。
[2422.593-2430.394] SPEAKER_00: 我是说,有意思的是, 无人机竞速是一种电子竞技。 所以这很像你在玩游戏, 但有一架真实的无人机在现场飞。
[2430.694-2436.475] SPEAKER_03: 一个人戴着护目镜在控制它。 所以没有…… 它是机器人,但没有人工智能。 没有人工智能,对。
[2436.775-2445.900] SPEAKER_00: 是人类在控制它。 所以这已经存在了。 其实我对这个问题感兴趣很久了。 从机器人学家的角度看。 而这正是Alpha Pilot里发生的事。
[2446.200-2448.951] SPEAKER_03: 啥问题?激进飞行? 激进飞行。
[2449.251-2464.880] SPEAKER_00: 完全自主的激进飞行。 我好奇的是…… 我是说,你提到Alpha Pilot,我马上讲。 但我关心的是, 我想造像无人机那样的自主飞行器, 它们能比任何人飞得快得多。 我觉得我们得意识到,人类
[2464.960-2476.990] SPEAKER_00: 处理信息的速度有限。 那是生物限制。 我们对AI也是这么看的。 这问题讨论很多了, 不是我个人的原创, 但很多人思考人类级别的AI。 他们认为AI还没达到人类水平。
[2477.070-2489.158] SPEAKER_00: 总有一天会达到,然后人和AI会互动。 但我觉得现实是,人类在某个位置, AI不断进步,某天会超越过去。 然后,它越来越聪明。 无人机竞速也有同样的问题。 人类玩这个游戏。
[2489.238-2498.572] SPEAKER_00: 你必须在毫秒内做出反应。 你眼睛看到某样东西, 信息经过大脑, 传到双手来操控它。 信息来回也有延迟。 假设没有延迟。
[2498.652-2507.777] SPEAKER_00: 只是眼睛到手之间的延迟 机器人没有这个延迟。 所以我们团队造出了 能以千赫兹频率观察的系统。 人眼只有100赫兹。
[2507.857-2520.096] SPEAKER_00: 想象一下慢动作看东西。 比如十倍慢速。 很有用。 比如常说的自动驾驶。 你看不到这些, 但每天有100人死亡, 仅美国就有交通事故。 而且不少是已知案例。
[2520.176-2532.729] SPEAKER_00: 就像你开车经过匝道, 驶入高速路。 撞到人,然后跑了。 或者,你有点搞混了。 你试图转到隔壁车道。 你冲出了道路。 然后你撞车了,等等。 我觉得如果车上算力够,
[2532.809-2544.479] SPEAKER_00: 而且事故时有个很快的摄像头, 你可以用上所有算力。 比如,你可以关掉娱乐系统, 把那些算力用在别处, 你把它用在那个AI上, 也就是自动驾驶。 你可以选择接管汽车,
[2544.559-2556.786] SPEAKER_00: 让它完全停下。 但就算做不到, 你也能完成人类要做的事。 人类想变道, 但偏离了路线。 光靠手眼做不到。 再说,你也能进去。 好多事你都能做到。 靠高吞吐量计算。
[2556.866-2566.780] SPEAKER_00: 数据输入超快。 还得实时处理。 但现在的CPU,再怎么提频, 通常都不够用。 得从头搭建这些电脑。 好处理所有数据。 这个我很感兴趣。
[2567.080-2574.963] SPEAKER_03: 这点快速说说。 目前瓶颈在哪? 你提到了人的延迟。 是硬件的问题? 你常用NVIDIA硬件。 是硬件还是软件的问题?
[2575.263-2593.144] SPEAKER_00: 我认为都是。 我认为都是。 我认为它们得共同开发。 这有点像英伟达的做法。 他们差不多先造硬件。 然后再做神经网络。 然后再做硬件。 反过来再做神经网络。 就这样反复。 但这就是协同设计。 而且我觉得,比如, 我们很久以前试过。
[2593.224-2609.979] SPEAKER_00: 我们想造一架快的无人机。 能用摄像头图像追踪移动物体。 好在世界中定位自己。 这类典型的,比如, 视觉惯性状态估计问题 我们想解决。 而且我们有点意识到, 有时我们到了极限, 做简单任务时。 相机帧率到极限了。
[2610.059-2622.971] SPEAKER_00: 真要追踪东西的话, 希望相机画面有九成左右, 或者相邻帧差不多。 对。 为什么帧率会到极限? 因为相机要捕捉数据。 数据通过串行连接传输。 可能是USB之类的,
[2623.051-2633.790] SPEAKER_00: 有个叫摄像头串行接口的, 我们常用。 数据放入串行连接。 铜线传输量有限。 会达到香农极限。 而且, 还会遇到另一种极限, 传输数据时。
[2633.870-2639.233] SPEAKER_00: 所以要更智能地 处理像素捕获方式。 可以把计算 直接放在像素旁边。
[2639.533-2642.586] SPEAKER_03: 难不难做? 瓶颈有多难突破? 铜线做的吗?
[2642.886-2654.266] SPEAKER_00: 对,得做大量并行处理。 你也能想象。 GPU也一样。 数据也是并行传输的。 进入并行处理。 我觉得,就像…… 有点跑偏了。 讲到了很多新维度,但是……
[2654.566-2660.893] SPEAKER_03: 好,这就是激进飞行。 怎样让无人机每秒看更多帧? 来实现激进飞行? 这问题很有意思。
[2661.193-2675.081] SPEAKER_00: 确实有趣。 但你想啊。 你有CPU。 给它设时钟频率,几个吉赫兹。 我们为什么不设得更快? 主要是因为,你知道, 就是遇到发热之类的问题。 但另一件事,那个三吉赫的时钟, 光速大概就像,
[2675.161-2687.493] SPEAKER_00: 大概就几英寸。 就是芯片大小。 然后经过一个时钟周期, 当时钟信号在芯片里传播时, 又经过另一个周期。 所以得协调好这些, 芯片复杂,设计就很难。
[2687.573-2701.368] SPEAKER_00: 就是说,很多设计方面 都碰到宇宙极限了。 是啊。 不知道大家意识到没。 真了不起。 但比如,晶体管不能再做小了, 因为量子效应嘛, 电子就开始到处隧穿。 时钟也没法更快了。 比如,一个原因是
[2701.448-2714.465] SPEAKER_00: 信息在宇宙中不会传得更快 对 我们被限制在这里 激光扫描仪也一样 这样就很清楚了 你把芯片做成CPU或GPU的方式 现在要想怎么重新设计 如果你想继续用硅材料 对
[2714.545-2730.871] SPEAKER_00: 也可以试试别的方法 我的意思是,也有可能 但你确实需要把这些晶体管 换个方式放,让信息以不同方式 在这些晶体管上传播 以更具体的方式 适应即将到来的高速摄像头 所以我们经常讨论这个
[2731.171-2736.674] SPEAKER_03: 所以无人机竞速确实让这一点 体现了这一点 它正好说明了这点。 所以它特别让人兴奋。
[2736.974-2750.583] SPEAKER_00: 而且它特别让人兴奋。 它让人很兴奋。 你知道,学生们很喜欢它。 它反映了所有这些问题。 但回到正题,我们在造所谓的另一个引擎。 我希望那引擎能像安全带影响驾驶一样深远。 希望如此。
[2750.663-2769.404] SPEAKER_00: 或者它可能实现,你知道,下一代自主空中出租车之类的。 我是说,这听起来很疯狂,但有一天我们可能需要让它们停靠式着陆。 如果你真想在一个半小时内从波士顿到纽约, 你可能需要一架飞行器。 很多公司都在做所谓的飞行汽车, 他们就专注这个。
[2769.484-2782.106] SPEAKER_00: 但你怎么把它停在大楼顶上呢? 你可能需要让机器人做快速机动动作, 比如停靠式着陆。 你直接停靠到建筑物上。 如果你想那样做,你就需要这类系统。
[2782.186-2790.847] SPEAKER_00: 无人机竞速,速度远超人类想象。 比如飞机。 别想四轴飞行器。 改用固定翼。 后面装火箭引擎,点燃。
[2790.927-2797.834] SPEAKER_00: 冲过门,人类惊呼:刚才怎么了? 他们会说,我做不到。 这正是缩小技术差距的关键,未来能避免车祸。
[2798.134-2807.816] SPEAKER_03: 来,回到实际问题。 就是让它在比赛里正常工作。 这也是件令人兴奋的事。 就像DARPA沙漠挑战赛那样。 理论上,我们有自动驾驶汽车。
[2807.896-2818.054] SPEAKER_03: 但让它们完成比赛,首先— 第一年没人完成。 第二年,仅要求完赛且时间合理, 就是个工程难题。 那我想问问阿尔法飞行员挑战赛。
[2818.134-2822.836] SPEAKER_03: 估计有大奖。 但这让人想起DARPA时代的预测。 你觉得有人能搞定吗?
[2823.136-2834.272] SPEAKER_00: 不会,不会那么快。 关键看你怎么设置比赛路线。 如果是障碍滑雪赛道,大家会愿意试试。 你可以设计赛道,比如真正去设计。 作为算法开发者,你就能设计。 你可以设置赛道。
[2834.352-2843.790] SPEAKER_00: 这样能打败最优秀的人类吗? 那什么时候能实现? 这不容易,就算只是设置赛道。 如果让对手来设置赛道, 那就简单很多,也困难很多。
[2844.090-2848.513] SPEAKER_03: 在所有赛道里,有多少 人类能赢多少,机器能赢多少?
[2848.813-2861.386] SPEAKER_00: 好问题,我们来聊聊。 还有你问的DARPA挑战赛的事,对吧? 最难的是什么? 我们清楚想造什么, 但真正去造,实验和迭代学习, 其实很花时间。
[2861.466-2873.531] SPEAKER_00: 比如我们团队,为了快速开发, 我们搞了个类似VR的环境。 我们拿一架飞机,放进动作捕捉室, 那房间超大,然后让它飞。 实时渲染图像,再传回无人机。
[2873.611-2886.024] SPEAKER_00: 听着简单,做起来可难, 因为要无线传所有数据到无人机。 所以得用点疯狂的方法才行。 但做到后,就能尽情试错。 撞了也不至于真坠毁。 整架无人机就像在VR里。
[2886.104-2897.298] SPEAKER_00: 还能做增强现实之类的。 所以测试到一定阶段特别关键。 Alpha Pilot好就好在造了无人机, 而且造了很多架。 撞了也没事。 其实观众可能还挺爱看坠毁。
[2897.598-2899.792] SPEAKER_03: 那才是最刺激的部分。
[2900.092-2912.064] SPEAKER_00: 这是激动人心的地方。 作为工程师,这挺不一样的。 学术界很多同事也参加了这比赛。 他们都是很厉害的研究人员。 但我见过他们试过类似的事。 他们造了这样一架无人机。
[2912.144-2924.952] SPEAKER_00: 有人戴着发光的口罩,紧跟在无人机后面。 想在它掉下来时接住。 其实你根本不用这么做。 这就是Alpha Pilot挑战赛的好处之一。 我们有这些无人机。 赛道设计会不断推动选手。
[2925.032-2938.467] SPEAKER_00: 直到有人开始坠机。 希望某种程度上… 我们不想说坠机没关系。 我们要小心一点。 因为不想让他们老炸机。 当然,希望他们挑战极限。 这样每人都会炸一两次。 他们真的在逼自己。
[2938.767-2942.075] SPEAKER_03: 迭代学习就派上用场了。 每次炸机都是一次教训。
[2942.375-2943.791] SPEAKER_00: 这就是个教训。
[2944.091-2948.537] SPEAKER_03: 所以,在可能的课程里, 你是怎么想的? 人和机器的较量中,
[2948.837-2957.556] SPEAKER_00: 机器赢在哪儿? 我们常看到这点。 我是说,你马上会看到。 你可以设计一门课, 而且,有些课程里, 比如中间某个位置, 如果你大致跑一遍,
[2957.636-2971.408] SPEAKER_00: 机器几乎每次都差一点输。 但如果你跑十次左右, 人类就会一直微弱地输掉。 所以,到某个时候,你会困惑, 你会累啊什么的, 而相比之下,机器 只是在重复同一行代码。 对。
[2971.488-2983.924] SPEAKER_00: 不知疲倦,只管回到起点。 而且做得一模一样。 我觉得那件事可能发生。 但我发现,作为人, 有一些经典的东西,你懂的, 大家都看得到。 比如加入一些战略思考, 这对机器有点难,
[2984.004-2995.268] SPEAKER_00: 我想你应该明白。 精准很容易。 所以它们很擅长这个。 而且, 一定程度的重复也简单。 这也是它们的强项。 你也可以造出懂战略的机器, 用它来打败人类,
[2995.348-2997.379] SPEAKER_00: 但造起来就难多了。
[2997.679-3010.069] SPEAKER_03: 我还有很多问题, 但时间有限,最后一个问题。 嗯。 最美的想法是什么? 你在机器人学里遇到过什么? 不管是简单的方程、实验、 演示、模拟、软件片段, 是什么让你停下来思考?
[3010.369-3011.762] SPEAKER_02: 这问题挺有意思。
[3012.062-3024.522] SPEAKER_00: 这个问题很有趣。 我主要做决策方面的工作。 所以我对那领域很感兴趣。 所以,机器人学里,有 不知怎么,这领域分成了, 有人研究感知, 机器人怎么感知环境, 然后怎么实际做决策?
[3024.602-3038.060] SPEAKER_00: 也有人研究互动, 人和机器人互动。 有很多不同领域。 而且,我做了很多工作 更多在控制和决策方面 而不是其他方面。 而且我觉得, 有个方程我一直挺困惑的 就是贝尔曼方程
[3038.140-3044.467] SPEAKER_00: 他早就意识到了 半个多世纪前 怎么真正静下心来 如果你有多个变量 得一起确定它们 怎么确定呢
[3044.547-3053.451] SPEAKER_00: 有件美妙的事 和一个美妙方程 现在做强化学习 我们还在用 它让我困惑,因为它既展示了 简单性——只是一个方程 谁都能写下来
[3053.531-3066.977] SPEAKER_00: 决策入门课就能教 同时它告诉你这个计算问题 有多难 我在MIT的很多研究 基本就是这场较量 这样反而效率低。 比如,怎么才能更快做到? 现在得重新设计芯片了。
[3067.057-3074.940] SPEAKER_00: 可能这就是办法。 但我看,这讲的是计算有多难。 有些问题现在到底有多难。 也就是所谓的“维度诅咒”。 所以,变量一多,
[3075.020-3087.793] SPEAKER_00: 能做的决策就暴增。 比如,你有,呃, 一百个变量,每个十种取值, 所有可能组合数超过 宇宙里的原子数。 这太疯狂了。 这种思路正好体现在 我很喜欢的一个方程里。
[3088.093-3097.079] SPEAKER_03: 还有美妙的平衡 理论上最优 和实际上的某种平衡 考虑到维度诅咒, 不过实际做起来吧, 虽然挑战一大堆, 简直不敢相信。
[3097.379-3112.010] SPEAKER_00: 简直不敢相信。 所以说啊, 其实这有点让人糊涂。 你懂的, 好多领域咱知道自己懂太少, 你懂的, 比方说,这儿也一样。 你懂的, 最坏的情况嘛, 事儿挺难的。 但你知道, 实际做起来通常能成。
[3112.090-3127.533] SPEAKER_00: 所以这有点, 这让人困惑,决策里咋, 咱知道得太少。 好比时间的起源,咱懂太少, 咱懂的太少,关于, 你知道, 我们自己的未来。 比如如果你, 如果你深挖Balmain方程, 我是说, 我们对数学了解太少。 我是说,
[3127.613-3130.527] SPEAKER_00: 连公理是否一致都不知道。 这太疯狂了。
[3130.827-3147.037] SPEAKER_03: 是的。 是的。 我认为有个好教训, 好教训, 教训就是, 就像, 就像你说的, 我们总关注最坏情况或者, 所有研究的边界。 平均情况总能解决。 如果从整体看生活, 我们经常搞砸, 你知道, 我们老是回想那些创伤事, 但最后, 好像都能搞定。
[3147.337-3149.333] SPEAKER_00: 好的。 是的。 这个比喻挺好,
[3149.633-3154.625] SPEAKER_03: 先生。 非常感谢你这位朋友, 同事, 导师。 我真的很感激。
[3154.925-3157.490] SPEAKER_00: 很荣幸跟你聊天。 彼此彼此。
[3157.790-3172.316] SPEAKER_02: 谢谢, 莱克斯。 感谢收听西尔塔什·卡拉曼的对话。 感谢我们的主要赞助商, Cash App。 下载Cash App,输入代码LexPodcast支持本播客。 如果你喜欢本播客, 请在YouTube订阅, 在Apple播客给五星好评, 在Patreon支持我们,
[3172.396-3184.182] SPEAKER_02: 或在Twitter找Lex Friedman联系我。 最后,用《2001》里哈尔9000的一句话收尾, 《太空漫游》。 我已尽全力发挥自己的作用, 我觉得这是任何有意识体所能追求的全部。
[3184.262-3186.038] SPEAKER_02: 感谢收听,期待下次再见。
[3186.118-3186.535] SPEAKER_02: 再见。