返回 播客 学习 audios

从《痛苦的教训》看AI指数级进步:计算与算法的未来

本期节目深入探讨Rich Sutton的《痛苦的教训》,分析计算能力与算法创新在AI指数级进步中的作用,并展望未来可能推动AI发展的技术,如主动学习、脑机接口等。

人工智能指数级进步计算能力算法创新
成长分 / 100 71 综合收获、行动、留存与影响

为什么值得读本期节目深入探讨Rich Sutton的《痛苦的教训》,分析计算能力与算法创新在AI指数级进步中的作用,并展望未来可能推动AI发展的技术,如主动学习、脑机接口等

帮助你判断这条信息是否值得继续深入阅读

关键洞察
  1. 这条内容的价值在于把外部信息转化为可执行的判断和行动。
转成行动

Lex Fridman · 中文播客

查看原视频 ↗

节目文字稿

中文播客全文

Podcast Script (zh)

[0.120-12.765] SPEAKER_01: 从历史角度聊聊人工智能的指数级发展 再预测未来哪些可能或不会推动AI指数级进步 这次讨论围绕Rich Sutton那篇《痛苦的教训》 它把几个不同概念串在一起

[12.845-24.666] SPEAKER_01: 特别关注计算在AI发展中的作用 还有在整个计算机科学里的作用 这篇博文和它的讨论是我们Discord上AI论文俱乐部的内容 欢迎加入讨论,链接在描述里

[24.746-38.994] SPEAKER_01: 先聊聊Rich Sutton在《痛苦的教训》里的论点 这个论点谈计算对AI进展的重要性 然后展望未来,看看有哪些可能 能扛起AI指数级进步的大旗 不管是计算方面

[39.074-43.207] SPEAKER_01: 随着摩尔定律延续 还是其他硬件软件的点子

[43.287-50.926] SPEAKER_01: 好,《痛苦的教训》 基本论点包含几个观点 核心是过去70年AI大部分进步 来自计算提升,不是算法提升

[51.006-61.443] SPEAKER_01: 我说的计算改进,就是摩尔定律晶体管每两年翻一番 其实不是算法创新, 而是通用的暴力算法, 能有效利用算力才推动AI进步。

[61.523-70.207] SPEAKER_01: 换句话说,通用方法能利用大规模计算, 比靠小计算和人工调校的特化方法强。 我说的小规模计算,是指任何计算,

[70.287-78.007] SPEAKER_01: 当下可用的算力。 因为摩尔定律让算力指数增长了几十年, 今天拥有的任何东西都比明天小得多。 指数增长就是这样。

[78.087-83.636] SPEAKER_01: 从人工知识注入的角度看, 自己找方案的AI优于被植入人工知识的AI。

[83.936-86.246] SPEAKER_00: Rich Sutton在他博客里也认为,

[86.546-96.309] SPEAKER_01: Rich Sutton在他博客里也认为, 最能利用大量计算的两类技术 是学习和搜索。 比如,搜索技术 就是深蓝击败卡斯帕罗夫用的技术。

[96.389-106.292] SPEAKER_01: 当时被批评为暴力搜索, 因为暴力性质被批评。 同样还有蛮力学习技术 同样还有蛮力学习技术 谷歌DeepMind击败围棋世界冠军的技术

[106.372-120.144] SPEAKER_01: 我称自我对弈机制为蛮力 是因为现在的强化学习方法 本质上非常浪费, 就学习效率而言。 而这就是蛮力方法的关键 里奇·萨顿认为, 这些方法能利用计算资源 所以它们可能不太高效

[120.224-137.328] SPEAKER_01: 或者没有人类智慧巧妙 或者没有人类智慧巧妙 或者没有人类智慧巧妙 或者没有人类专长的巧妙 但它们能利用计算资源 因此随着计算能力指数增长 就能超越其他所有方法 那篇博文还举了其他几个例子 从启发式方法开始的语音识别

[137.408-152.433] SPEAKER_01: 这就是隐马尔可夫模型的统计方法。 现在语音识别和自然语言处理里,神经网络特别成功。 神经网络在自然语言处理方面也大获成功。 计算机视觉领域也一样。 人工设计的那些特征。 最后选出了SIFT特征。

[152.513-161.475] SPEAKER_01: 然后迎来了ImageNet的重大突破。 这说明神经网络能自动发现。 需要的特征层级结构。 做好各种计算机视觉任务。

[161.775-163.470] SPEAKER_00: 我觉得这篇博文很有启发。

[163.770-176.055] SPEAKER_01: 因为它提醒我们开发方法时。 不管是软件还是硬件。 都要考虑长远发展。 我们想法的影响。 不是今年。 而是五年、十年、二十年后。 所以用这个角度看领域进展。 有些东西就不太靠得住了。

[176.135-185.957] SPEAKER_01: 有些事撑不了多久。 但Rich觉得,大多事情其实 我们搞AI的人,尤其是学术圈 太注重灌输人类知识了 这样你才能拿到 能发表的进步成果

[186.037-196.941] SPEAKER_01: 然后呢,你知道 简历上多几篇论文 职业上就往上走 心里也更舒服,因为你把自己 的知识塞进系统里 而不是用那种所谓的 笨办法 从心理学角度看

[197.021-208.645] SPEAKER_01: 笨办法跟创新、牛掰的思路 好像不沾边 可你看那些暴力搜索 或暴力学习的方法 我觉得,放今天回头看 或者用蛮力来学习, 我觉得当时,现在回过头来看。

[208.725-224.064] SPEAKER_01: 这些出版物和相关科学 和这些方法一起,我认为 没得到应有的认可 它们获得大量认可 因为比赛公开演示 它们参加的比赛,但科学界 我觉得没给足够尊重 对这些通用方法的科学贡献

[224.144-233.722] SPEAKER_01: 这想法有趣又发人深省 我希望现在人们发论文时 大概有个类似部分,他们描述 如果计算能力扩展10倍、100倍 展望未来五到十年

[233.802-249.466] SPEAKER_01: 这种方法能经得起这种扩展吗 它可扩展吗 这种方法根本上可扩展吗 我觉得这个问题非常好 这会不会受益于 至少随计算能力线性扩展 对我来说,这问题非常有趣且有挑衅性 所有研究生、老师和研究人员都该

[249.546-262.238] SPEAKER_01: 问问自己他们提出的方法 总的来说,这篇博客文章作为 一个非常好的思想实验 因为我觉得我们常给不成比例 的尊重,我觉得,对算法改进 而看到人工智能进步的大趋势时

[262.318-270.781] SPEAKER_01: 对计算没有给够尊重 对计算的改进 无论是只谈原始晶体管数量 还是其他方面的改进 计算过程

[271.081-273.495] SPEAKER_00: 如果原样看这篇博客文章

[273.795-284.908] SPEAKER_01: 你当然可以提出一些争议 和一些反对意见 首先,这篇博文没提任何数据 而在学习方面 如果我们看看那种学习 现实应用里非常成功的学习 那就是监督学习

[284.988-294.310] SPEAKER_01: 它靠人类标注数据来学习。 所以,学习方法的计算扩展性, 也得和扩展性结合。 也就是标注数据的能力。 而且我不清楚计算的扩展性

[294.390-306.327] SPEAKER_01: 怎么自然协调数据标注扩展。 待会儿我提些想法。 我觉得它们挺让人兴奋的。 在主动学习领域, 但一般两者没直接联系, 至少博客文章里是这样。 公平地说,这篇文章回顾历史,

[306.407-314.592] SPEAKER_01: 人工智能发展的历史背景。 所以这样一来, 它关注的是那些利用 原始计算能力的指数增长, 就像摩尔定律观察到的那样。

[314.672-328.699] SPEAKER_01: 当然,你也能把这篇文章推广到 可以说任何依赖 任何指数级进步的方法。 那计算改进呢,在任何抽象的层面上, 包括后面我们会聊到的 在深度学习最高抽象层面 甚至元学习。 只要能做到,

[328.779-341.006] SPEAKER_01: 这些方法就能抓住指数级的改进 在这样的情况下, 它就能乘上指数级改进的浪潮。 不过主要的指数级改进 过去七年我们看到的就是摩尔定律。 另一个我个人认为

[341.086-358.178] SPEAKER_01: 不太有说服力的点是,你说学习 或者搜索方法不需要太多人工专业知识。 嗯,确实需要一点, 还是得做些微调。 还有一堆技巧, 尽管是在更高层面上, 我觉得这不太有说服力,因为深度学习所需的人工专业知识数量和质量

[358.258-366.617] SPEAKER_01: 比经典机器学习,特别是启发式方法,要少得多,也 更有针对性。 现在有个大问题,是不是争议我不知道,但我没答案。

[366.697-376.159] SPEAKER_01: 追寻智能系统创造时,先想这一点很有用。 我们大脑就是活生生的例子,而且可以说。 创造我们大脑智能的,就是进化。

[376.239-386.920] SPEAKER_01: 和这篇博客有关的问题是:进化到底属于 搜索方法还是学习方法,或是两者混合?它是子集? 是组合还是超集?或者完全是另一个东西?

[387.000-395.417] SPEAKER_01: 这问题有趣又困难,我经常琢磨。 今天表现最好的方法,进化过程是啥?当然, 有遗传算法、遗传编程,这些都特别专门。

[395.497-405.632] SPEAKER_01: 受进化启发的方法。但创造地球生命的进化过程, 创造地球智能生命的进化过程,和搜索 以及那些擅长利用计算的学习方法有何关联?

[405.712-414.349] SPEAKER_01: 宏观来看,进化过程,不管它跟 搜索还是学习相关,都非常会利用计算。 从珍视生命的人类中心视角看,进化

[414.429-427.214] SPEAKER_01: 过程特别暴力、特别浪费。所以或许它确实和 暴力搜索与暴力学习的自对弈机制很像, 我们看到它用得很成功。 总结《苦涩的教训》论点,AI指数级进步在过去

[427.294-439.011] SPEAKER_01: 过去六七十年,摩尔定律和计算指数级进步紧密相连。 晶体管数量翻倍。今天面临一个开放性问题:看看未来 人工智能的指数级提升,这靠的是

[439.091-447.171] SPEAKER_01: 人类的聪明才智,发明新算法?还是靠 计算能力的提升?我觉得两者都有。 视频结尾我会说说我的预测,但现在,

[447.251-455.586] SPEAKER_01: 先聊聊未来AI指数级进步的几个可能标志。 首先,摩尔定律只是个观察结果,不是定律。 我觉得它有两个含义:一个是

[455.666-470.506] SPEAKER_01: 精确的技术含义,就是晶体管数量每两年翻倍一次。 或者从财务角度看,每浮点运算成本 指数级下降。这样就能把CPU、GPU和各种 处理器放在同一张图上比较。第二个含义,在

[470.586-484.915] SPEAKER_01: 大众讨论中很常见,就是计算能力有指数级进步。 我个人接受这种用法,但觉得不是好主意。 我觉得这是个好主意。我觉得这是个好主意。 我觉得这是个好主意。我觉得这是个好主意。 摩尔定律被推广到不同技术和概念时,

[484.995-496.372] SPEAKER_01: 用来表示计算能力指数级进步的普遍观察。 过去几十年,反复被问的问题是: 摩尔定律失效了吗?有两种观点,多数人认为是的。

[496.452-507.170] SPEAKER_01: 也有少数人,比如英特尔的吉姆·凯勒。我访谈过他,推荐。 他说没有,因为看晶体管尺寸,还没达到。 理论物理极限,即晶体管能多小。现在变得极其。

[507.250-516.247] SPEAKER_01: 困难,有诸多原因让制造接近单个。 纳米在功耗、纠错和制造这种器件所需的。 条件方面。但理论物理极限

[516.327-528.717] SPEAKER_01: 没达到,所以摩尔定律能继续。此外,从更广角度看。 计算能力指数增长的定义,还有很多 其他候选者,比如我提到的旗手,能继续扛起指数增长旗帜。

[528.797-539.306] SPEAKER_01: 现在来看看它们。一个是全球计算能力。这个很有趣。 我很难找到好数据回答基本问题。这些数据 不存在。问题是, 当今世界总计算能力是多少?从历史来看。

[539.386-549.756] SPEAKER_01: 它是如何增长的?有些推测研究,我引用了一些。 它们很有趣,但我希望有更多数据。我对 这种潜力很兴奋,它未来可能以意想不到的方式发挥作用。

[549.836-567.543] SPEAKER_01: 我们到底在谈什么?我们在谈世界上的通用计算。 设备的总数。我们在谈世界上的通用计算。 我们在谈世界通用计算设备总数。 过去20年,最强大的计算设备之一就是游戏主机。 另一种,过去十年,是智能手机。现在展望未来,

[567.623-576.179] SPEAKER_01: 首先,智能手机指数增长,所有设备计算面也在增长。 考虑物联网,每个日常物体 获得计算能力,就能分布式利用。

[576.259-584.246] SPEAKER_01: 另一维度设备,未来可能指数爆发, 即VR和AR设备。目前, 尚未普及,但未来有大量计算资源。

[584.326-590.630] SPEAKER_01: 用于虚拟和增强世界。 我对无法预料的潜力兴奋:设备指数增长, 计算表面指数扩展。

[590.710-599.034] SPEAKER_01: 很有趣,迫使我们重新思考 计算本质,向分布式发展。 谈到分布式计算,AI指数增长的另一种可能是

[599.114-605.313] SPEAKER_01: 大规模并行计算:堆叠CPU和GPU, 指数扩大堆叠。会遇到阿姆达尔定律和

[605.393-609.862] SPEAKER_01: 挑战:处理器越多,越难 获得加速。添加处理器,回报递减。

[609.942-619.624] SPEAKER_01: 困难:增加越多,加速收益递减。 处理器 要克服阿姆达尔定律,关键在设计出能够 算法能在数千到数十亿处理器上完美并行

[619.704-627.587] SPEAKER_01: 这会改变游戏规则,让我们能指数级提升 通过指数级增加处理器数量,提升AI算法性能

[627.887-630.801] SPEAKER_00: 另一个助力AI指数增长的维度

[631.101-640.226] SPEAKER_01: 就是核心可并行化设备,比如通用GPU 图形处理器,或专门针对神经网络等 这类专用集成电路ASIC,谷歌TPU就是例子

[640.306-649.547] SPEAKER_01: 其硬件设计决策专门 针对机器学习,让能耗和性能更高效 以及实际性能 另一个引领AI指数增长的领域

[649.627-658.787] SPEAKER_01: AI指数增长改变计算本质,带来全新 计算方式。两个候选:量子计算和 神经形态计算。量子计算机用量子比特

[658.867-667.702] SPEAKER_01: 不同于经典0和1,量子比特还能表示 0和1的叠加态。这个领域让人兴奋 但我觉得还很早期,尤其是通用方法

[667.782-678.544] SPEAKER_01: 能利用计算。首先,建造大型量子计算机很难 但即使做到,也很难构建出能显著超越 经典计算机算法,特别是在AI领域,与

[678.844-682.396] SPEAKER_00: 机器学习。还有另一个计算领域,叫神经形态计算。

[682.696-697.977] SPEAKER_01: 它从人脑汲取了很多灵感,更多得多。具体来说, 它模拟脉冲神经网络。我觉得神经形态计算的想法是它能 以更高效的方式做计算。人脑和计算机相比,一个特征是 人脑和计算机相比,它能更高效地执行计算

[698.057-712.932] SPEAKER_01: 方式。人脑和计算机相比,特征之一就是它能 今天的计算机,比起我们的,同样计算量更节能。 计算量。神经形态计算正努力达到同样性能。 同样,还很早期,不清楚怎么设计出能达到

[713.012-727.689] SPEAKER_01: 甚至接近机器学习算法性能的通用算法,比如, 在现在的经典计算机上,用GPU或ASIC运行。但当然,如果你想实现一个 彻底的改变,就像我们在计算和AI上的阶段转变那样

[727.769-734.688] SPEAKER_01: 智能,一个和我们的经典计算机完全不同方式运行的计算机 可能实现那种阶段转变的东西。

[734.988-738.134] SPEAKER_00: 现在,另一个很让人兴奋的领域是脑机接口。

[738.434-751.532] SPEAKER_01: 短期内,它很让人兴奋,因为能帮我们理解和治疗神经系统疾病。 但从长远看,可能我们能实现那种阶段转变 在利用人脑进行运算的能力方面。这种说法有点奇怪,

[751.612-761.074] SPEAKER_01: 但我们大脑有大量计算能力。我们实际上在做大量计算, 我们每个人的每一刻,可惜无法 与全世界分享计算结果。只能通过

[761.154-770.534] SPEAKER_01: 一条很窄的通道来分享。所以,从计算角度,我们能 但从社会角度看,能否创建一条高带宽连接, 连接计算机和人脑,这样就能利用

[770.614-780.018] SPEAKER_01: 人脑已有的计算力,增加全球计算能力 供世界使用。这是一个非常有趣的可能。我说得有点 不流畅,但通常人们谈脑机接口时,比如 例如,

[780.098-791.197] SPEAKER_01: 埃隆·马斯克谈Neuralink,常从个人角度,讨论如何提升 你与世界交流、接收信息的能力。但如果你 从社会角度看,现在可以利用人脑的计算力,

[791.277-801.830] SPEAKER_01: 无论是空闲时间,还是生存所需的实际计算, 在日常中,都能用来增加全球计算面、全球能力 供世界使用。所以是非常有趣的可能。

[801.910-809.851] SPEAKER_01: 人脑是不可思议的计算机器。所以能连接它分享计算,我认为无需算法大创新就能实现惊人指数增长。

[809.931-824.898] SPEAKER_01: 现在,我们之前谈的很多内容更偏向硬件,或至少是 非常底层的软件方面的指数改进。我真的很喜欢最近 OpenAI的Dani Hernandez等人的论文《Measuring the Algorithmic Efficiency of Neural Networks》,这篇论文

[824.978-841.118] SPEAKER_01: 考察了机器学习和深度学习的多个领域,并表明 算法效率指数增长,远超摩尔定律。从AlexNet的ImageNet时刻起 计算机视觉的神经网络,从2012年的AlexNet到2019年的EfficientNet

[841.198-855.713] SPEAKER_01: 还有2008年的KrivaNet,数字呈指数增长。我们很喜欢这个问题 以及所有相关网络。改进是训练到AlexNet水平的计算量少了44倍 所以同一时期,摩尔定律只有11倍成本降低。而这篇论文

[855.793-867.962] SPEAKER_01: 还强调自然语言处理里类似的指数改进,甚至在 强化学习领域。所以一个开放问题是:深度学习里这些学习方法 算法过程可能比硬件改进带来更大收益

[868.042-877.980] SPEAKER_01: 这可能性令人兴奋,特别是对领域内的人 因为人类智慧对AI持续指数改进很关键 尽管如此,AI是否会继续指数改进仍是开放问题

[878.060-879.267] SPEAKER_01: 我想有点...

[879.567-883.839] SPEAKER_00: 先搁一个观点。我不知道。我每天对多数事改想法。但今天

[884.139-902.740] SPEAKER_01: 我觉得AI会继续指数改进。当然指数改进只是一系列S曲线叠加 它不是单一完美的指数改进。总是一系列重大突破叠加,每个达到平稳后 新创新出现。所以另一个开放问题是:哪些S曲线最可能推动指数增长? 可能的候选者中,我们

[902.820-907.231] SPEAKER_01: 突破性创新层层叠加,逐渐平稳,然后新创新又出现

[907.311-921.535] SPEAKER_01: 那么另一个未解问题是,滋养指数的S曲线从哪来? 最有可能?在我们考虑的候选者中 讨论过了。 对我来说,算法创新和监督学习创新, 是如何组织数据并在学习中利用,所以学习效率

[921.615-934.748] SPEAKER_01: 和搜索过程,尤其是主动学习。你知道,有很多术语 流传着,有点模糊。所以像杨立昆这样的人对 自我监督学习很兴奋。你怎么想都行,怎么定义都行, 但自我监督学习可以理解为

[934.828-947.415] SPEAKER_01: 几乎不用人工标注,也不用人类专业知识。 它关注强大机制,比如自我博弈和 强化学习,或在视频计算机视觉中,思路是 让算法整天看YouTube视频,然后从中

[947.495-959.618] SPEAKER_01: 推理出常识、世界物理等,用 无监督方式,仅观察世界。现在我更兴奋的是主动学习, 这是对选择学习数据方式的优化。 你会说,我要学习,越来越高效,从

[959.698-972.668] SPEAKER_01: 越来越小的数据集中学习,但我会非常挑剔地选择 查看、标注或请求人工监督的数据。我认为一个非常简单 但现实世界的例子是特斯拉Autopilot团队正在做的,

[972.748-985.869] SPEAKER_01: 他们创建了多任务学习框架流水线, 其中有多个不同任务,还有一个发现边缘案例的流水线。 每个任务你都反馈发现的边缘案例,然后不断 反复为不同任务重新训练网络。

[985.949-993.437] SPEAKER_01: 网络共享部分持续学习,所以这个 主动学习循环迭代,越来越强。 因为持续从边缘案例学习。这例子很简单,

[993.517-1001.934] SPEAKER_01: 但这个可能性让我兴奋。创新和学习 发现合适数据提升性能的能力。我相信 主动学习性能未来几年会指数增长。

[1002.014-1009.072] SPEAKER_01: 另一个让我兴奋但不可预测的S-GaRs来源, 是全球计算表面的扩张。虽不确定但很有可能

[1009.152-1017.174] SPEAKER_01: 物联网最终普及,智能设备遍布 各处。不是几个Alexa,而是万物皆可成 计算表面。这未来可能很遥远但令人兴奋。

[1017.254-1027.691] SPEAKER_01: 但我希望成为创造未来的一员。所以 这是令人兴奋的可能。对我来说,真正的游戏改变者 是意想不到疯狂的事,尤其马斯克谈Neuralink

[1027.771-1038.347] SPEAKER_01: 脑机接口。这技术很令人兴奋,有助于理解 治疗神经疾病。如果计算机与大脑高带宽 双向通信,会改变计算和AI的本质。如果AI系统

[1038.427-1049.354] SPEAKER_01: 完全关于计算和AI本质。如果一个人工智能系统可以 跟人脑沟通、互相利用算力,我不认为 我们难以想象那会创造怎样的世界。这极其令人兴奋

[1049.434-1053.021] SPEAKER_01: 目前还很不确定,看似不可能且疯狂

[1053.101-1069.311] SPEAKER_01: 但有人能做到的话,一定是脑机接口专家,比如马斯克和Neuralink的工程师。当你谈论 谈到AI的指数级进步,人们自然会问,奇点 何时到来?2030年、2045年、2050年还是一个世纪后?同样,我没有确切的

[1069.391-1078.609] SPEAKER_01: 从我的角度看,我认为我们正生活在奇点之中 我们参与的AI指数级进步已经足够平滑 以至于我们根本察觉不到这进步曲线有多疯狂

[1078.689-1089.068] SPEAKER_01: 这不可思议,每次新阶段我们都很快习惯。我认为我们正生活在 奇点之中,并会很好地适应AI的 指数级进步。我迫不及待想看到未来

[1089.148-1099.248] SPEAKER_01: 这是我简单探讨Rich Sutton博文《更好的教训》中的观点 以及计算和算法改进在指数进步中的作用 这是我们Discord上AI论文俱乐部的一部分

[1099.328-1114.077] SPEAKER_01: 欢迎加入,这里既有AI也有各行各业的人 在AI领域 以及计算和算法改进在指数级改进中的作用 这已经是我们Discord上AI论文俱乐部的一部分 欢迎你随时加入,这里不仅有AI还有各行各业的人

[1114.157-1123.653] SPEAKER_01: 从艺术家到音乐家,再到科学家,各种水平的人都有。 这个社区太棒了,我很开心能加入。 这很特别,随时欢迎加入。如果有论文建议,

[1123.733-1125.799] SPEAKER_01: 请告诉我。感谢观看,下次再见。