返回 播客 学习 audios

强化学习基础与深度强化学习:拆解智能体的核心构建模块

本期节目深入探讨强化学习的基本定义、核心构建模块(价值函数、策略、模型)以及深度强化学习的原理。嘉宾解释了为何深度学习在高维空间中能持续学习,并反思了低维直觉的局限性。适合对AI和强化学习感兴趣的听众。

强化学习深度强化学习神经网络人工智能
成长分 / 100 71 综合收获、行动、留存与影响

为什么值得读本期节目深入探讨强化学习的基本定义、核心构建模块(价值函数、策略、模型)以及深度强化学习的原理

嘉宾解释了为何深度学习在高维空间中能持续学习,并反思了低维直觉的局限性

关键洞察
  1. 这条内容的价值在于把外部信息转化为可执行的判断和行动。
转成行动

Lex Fridman · 中文播客

查看原视频 ↗

节目文字稿

中文播客全文

Podcast Script (zh)

[0.120-3.626] SPEAKER_02: 我们退一步问个基本问题:对你来说,

[3.926-15.492] SPEAKER_01: 强化学习是什么? 强化学习是研究智能的科学和问题, 通过与环境交互的智能体来呈现。 你解决的问题由环境表示,比如智能体所在的世界, 智能体所处的环境。

[15.572-28.368] SPEAKER_01: 强化学习目标很明确:智能体执行动作,影响环境, 环境返回一个观测,告诉你, 这是你看到或感知到的。 还有一个特殊信号叫奖励,表示智能体表现如何。 在环境中的表现。

[28.448-33.788] SPEAKER_01: 强化学习就是逐步行动,最大化奖励信号。 最大化那个奖励信号。

[34.088-45.407] SPEAKER_02: 所以有几个基本问题。 强化学习方法有哪些类型? 我不知道有没有简洁的方式描述 基于价值、模型、策略的强化学习。

[45.707-57.238] SPEAKER_01: 是的。 那么想想,强化学习的问题定义很宏大。 它确实非常宏大。 它想抓住并包围智能体互动的一切。 环境就像:我们怎么理解它? 破解它? 现在想想怎么解决。

[57.318-64.841] SPEAKER_01: 这种难题怎么解? 一种办法是把难题拆成能协作的小块。 一起搞定难题。 看看智能体内部怎么拆解。

[64.921-72.119] SPEAKER_01: 这种拆解是什么样? 常见的部分有哪些? 组合起来。 常见部分。 比如有没有价值函数。 就是它是否在预测未来能得多少奖励。 未来。

[72.199-79.617] SPEAKER_01: 有没有策略表示? 就是决定怎么选行动的东西。 决策过程是否明确? 系统里有模型吗? 有没有预测环境的东西?

[79.697-89.335] SPEAKER_01: 所以,这三部分对我来说是这样。 最常见的几个构建模块。 强化学习的选择就是是否用这些。 分解方案时的构建模块。 是否要表示一个价值函数?

[89.415-100.505] SPEAKER_01: 是否要表示一个策略? 是否要表示一个模型? 这些部分还能不同组合。 当然,还可以加入其他东西。 但这三个基本选择催生了熟悉的强化学习分支。 非常熟悉。

[100.805-111.822] SPEAKER_02: 就像你提到的那些。 是的。 一个选择是明确指定或建模什么。 而理念是这些都在系统内部隐式学习。 所以这几乎是你解决问题的一个选择。

[111.902-121.538] SPEAKER_02: 你觉得这是根本差异,还是解决问题的细节,其实没本质区别? 只是解决问题的细节,并没有根本不同。 彼此之间?

[121.838-130.023] SPEAKER_01: 我认为根本想法在更高层面,那就是—— 分解的第一步其实是,我们该怎么解决这个问题? 想知道该怎么行动?

[130.103-142.121] SPEAKER_01: 光看这些观察,你有个代理在 感知流里,接收信息,采取行动。 它该怎么做? 这问题从哪下手? 世界可能太复杂了。 对。 你甚至没法想象怎么造个系统来应对 这个问题。

[142.201-150.200] SPEAKER_01: 所以第一步就是说,得学习。 系统得自己学。 注意,强化学习问题没规定你必须 学。 不学也能最大化奖励。 但效果很差。

[150.280-162.473] SPEAKER_01: 学习是必要的,因为在复杂环境里,只有这样才能表现好。 大而复杂的环境。 这就是第一步。 这一步让所有部分有了共性,现在你会问,嗯, 该学点啥? 学习到底是啥意思?

[162.553-171.179] SPEAKER_01: 就是说,学习就是给系统更新参数, 然后系统才能做决定。 这些参数啥都能代表。 比如价值函数、模型或策略的参数。 所以从这个角度看,

[171.259-182.755] SPEAKER_01: 很多共同点:不管表示啥,都是要学的, 而最终目标就是最大化奖励。 但你怎么分解问题,才决定了系统的意义。 整个系统。 比如学预测,像价值函数或模型?

[182.835-190.996] SPEAKER_01: 还是学表现好的,比如策略? 目标形式决定了系统的意义。 所以这其实是更高层次的问题。 作为设计者,我们要做出基本选择,

[191.076-193.305] SPEAKER_01: 或者让算法自己学会选。

[193.605-202.207] SPEAKER_02: 接下来,首先要处理的是, 能不能接收大量观察数据并处理? 自然下一个问题:啥是深度强化学习?

[202.287-205.537] SPEAKER_02: 那用神经网络处理这么多输入,是啥思路?

[205.837-211.560] SPEAKER_01: 所以嘛,深度强化学习就是个强化学习方法。 它有很多解法,靠的是强大的表示能力。

[211.640-225.806] SPEAKER_01: 用神经网络代表智能体的不同部分。 智能体本身。 深度强化学习能表示任何函数,不管是价值函数、模型还是策略。 价值函数、模型或策略,它都能搞定。 深度学习就是提供一个超强的工具包。

[225.886-239.565] SPEAKER_01: 这工具包很万能,能表示任何函数还能学会它。 任何函数都能表示和学习。 所以利用这种通用性,不管要表示什么,策略、价值函数还是模型,深度学习都行。 策略、价值函数或模型,深度学习都能搞定。

[239.645-249.838] SPEAKER_01: 深度学习提供工具包,没秘密,性能也没上限。 当我们往系统里加更多资源、内存、计算和数据, 更多计算、数据以及和环境打交道的经验,

[249.918-261.089] SPEAKER_01: 这些系统做任何任务都会越来越好。 不管任务是什么,它都能学会一个函数,更好地表示知识。 这个函数能更好地表示那些知识。 不管这知识是评估你表现的价值函数,

[261.169-264.361] SPEAKER_01: 还是决定行动的策略,或是理解世界本身。

[264.661-277.852] SPEAKER_02: 接下来会发生什么?模型。但神经网络能学超复杂表示,这事实... 能学超复杂表示,你就能制定策略, 模型或价值函数,在我看来,超美且惊人。 是吗...

[277.932-285.559] SPEAKER_02: 这惊人吗?你当时惊讶吗?你还相信它真这么管用吗? 你对它为啥这么管用、效果这么好有直觉吗?

[285.859-290.909] SPEAKER_01: 我分两部分回答吧。我觉得 强化学习的思想管用,我不惊讶,因为某种意义上,

[290.989-292.103] SPEAKER_01: 我觉得这是...

[292.183-303.609] SPEAKER_01: 我觉得... 我觉得这是最终唯一能做的事。所以必须搞定它。而且 必须尽可能成功,因为人类有智能的例子。它必须 某种程度上能……从经验中学习,然后做得更好,

[303.689-306.521] SPEAKER_01: 像人类面对复杂环境那样合理。必须的。

[306.601-310.745] SPEAKER_01: 我对当前系统表现这么好惊讶吗?我觉得最大的 惊讶之一...

[310.825-324.121] SPEAKER_01: 我觉得,对我和很多同行来说,最大惊讶是深度学习能一直表现这么好,尽管它们代表的神经网络有那种极端的非线性崎岖曲面,按我们低维直觉,肯定会卡住,学习停滞,因为...

[324.201-341.061] SPEAKER_01: 你会没法进步。但最大惊讶是学习持续进行,这些看似局部最优点其实不是。高维空间里,当我们建超大神经网络时,总有出路,总有方式下降,你仍不是局部最优,因为还有别的路带你出去继续下降。所以无论在哪,学习都能继续并越来越好。

[341.141-343.846] SPEAKER_01: 所以无论在哪,学习都能继续并越来越好。

[343.926-350.125] SPEAKER_01: 没有界限。神经网络这个特性既惊人又美妙。 这又美又优雅,但有点吓人,可事实就是这样。

[350.425-354.918] SPEAKER_02: 像你说的,我特别喜欢这点,低维直觉觉得挺惊讶的。

[355.218-363.902] SPEAKER_01: 对,我们太习惯在三维环境里工作了。所以为了 开始想象你要优化的十亿维神经网络表面 到底是什么样,对我们很难。所以我觉得真的,

[363.982-372.004] SPEAKER_01: 要解释AI寒冬,那时人们放弃了神经网络, 我觉得其实是因为缺少从低维推广到高维的能力。 因为那时我们在低维

[372.084-381.348] SPEAKER_01: 空间里,只能建大概50个节点的神经网络。但要 想象建一个十亿维的神经网络是可能的,它可能 有完全不同、性质不同的特点,很难预料。

[381.428-394.596] SPEAKER_01: 而且我觉得就算现在,我们才开始建立理论。还不完整 但现在所有理论似乎都指向一个方向:没错, 这方法真的很通用,不管在复杂性还是 在表示能力上已经知道,而且在学习能力上,这是 挺让人惊讶的。

[394.896-401.142] SPEAKER_02: 这让人想问,因为低维直觉,我们还错过了什么? 一旦发现,这些就显而易见了。

[401.442-405.551] SPEAKER_01: 我常想,如果有一天真有超厉害的AI时, 去理解世界。 对。

[405.851-406.582] SPEAKER_02: 对。

[406.882-414.544] SPEAKER_01: 绝对,绝对。 对。 他们会怎么看我们的算法?会是—— 回想这些日子,我们会觉得这些 算法只是天真的尝试?还是过了万年依然

[414.624-416.795] SPEAKER_01: 是根本思想?对。 不好说。

[417.095-420.543] SPEAKER_02: 他们会回看这段对话,带着微笑——

[420.623-427.588] SPEAKER_02: 我觉得,就像以前以为太阳绕地球转,他们会觉得现在的系统太复杂,答案其实很简单。

[427.668-432.834] SPEAKER_02: 就像围棋,简单规则能涌现复杂。也许简单方法加计算量最有效。

[432.914-434.748] SPEAKER_02: 我完全同意。我觉得……

[435.048-439.993] SPEAKER_01: 对。 预测什么能长久?大概是简单清晰的思想,它们走得更远。

[440.073-445.378] SPEAKER_01: 不过现在得让系统运行,有时要组合复杂系统,因为还不清楚最简约的成分。

[445.678-476.739] SPEAKER_02: 看来我们在设计上遇到麻烦,想法和部件这些。 最终只需要一小部分就能深入,追寻门后的阿尔蒂。 嗯,如果你按这个算法,我们很快能出结果。 我不觉得你做到了。 想知道是不是这样? 带2! 嗯,对,没错。 我觉得你会到那儿,之后它会自己稳定下来。 有时候有想法,干嘛不造点东西呢? 对,原子版和能切到3的东西之间,有种Carson dyck舞,本质是双重任选。

[476.819-477.457] SPEAKER_02: 谢谢。