返回 动态 学习 CMS 文章

Karpathy:深度学习对算力的贪婪与强化学习的魔法

理解深度学习成功的关键:算力是上限,强化学习是魔法来源。

深度学习算力强化学习合成数据
成长分 / 100 77 综合收获、行动、留存与影响

为什么值得读Karpathy 作为 AI 领域权威,对深度学习本质的深刻洞察。

揭示合成数据生成与强化学习之间的等价关系,提供新视角。

关键洞察
  1. 深度学习对计算资源有巨大需求,算力是实现智能的上限。
  2. 数据在很大程度上是计算的下游,合成数据生成与强化学习有深刻联系。
  3. 强化学习(试错学习)远比模仿学习强大,是几乎所有惊人结果的来源。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:2985

对于之前关于V3的那篇文章,我没有太多要补充的,而且我认为它也适用于R1(这是更新的、具有思考能力的等价物)。

我想说的是,深度学习对计算资源有着传奇般的贪婪胃口,就像AI中曾经开发过的任何其他算法一样。你可能并不总是充分利用它,但从长远来看,我绝不会低估计算作为可实现智能的上限。这不仅适用于单个最终训练运行,也适用于默默支撑所有算法创新的整个创新/实验引擎。

数据历来被视为与计算分开的类别,但即使数据在很大程度上也是计算的下游——你可以花费计算来创造数据。大量的数据。你听说过这被称为合成数据生成,但不太明显的是,“合成数据生成”和“强化学习”之间有着非常深刻的联系(甚至等价)。在RL的试错学习过程中,“试验”是模型生成(合成)数据,然后它根据“错误”(/奖励)从中学习。相反,当你生成合成数据然后以任何方式对其进行排名或过滤时,你的过滤器直接等同于一个0-1优势函数——恭喜你,你正在做糟糕的RL。

最后一个想法。不确定这是否显而易见。在儿童和深度学习中,都有两种主要的学习类型。有1)模仿学习(观察并重复,即预训练、监督微调),和2)试错学习(强化学习)。我最喜欢的简单例子是AlphaGo——1)是通过模仿专家棋手来学习,2)是强化学习以赢得比赛。几乎每一个令人震惊的深度学习结果,以及所有魔法的来源,总是2。2要强大得多得多。2是让你惊讶的东西。2是当球拍学会在Breakout中击打挡块后面的球时。2是当AlphaGo击败李世石时。2是当DeepSeek(或o1等)发现重新评估你的假设、回溯、尝试其他方法等效果很好时的“顿悟时刻”。这是你在模型思维链中看到的解决策略。这是它如何来回思考。这些想法是涌现的(!!!),这实际上非常不可思议、令人印象深刻且新颖(如公开可用且有文档记录等)。模型永远无法通过1(模仿)学到这一点,因为模型的认知和人类标注者的认知是不同的。人类永远不会知道如何正确标注这些类型的解决策略,以及它们应该是什么样子。它们必须在强化学习过程中被发现,作为对最终结果具有经验和统计有用性的东西。

(最后最后一点想法/参考,这次是真的,RL是强大的,但RLHF不是。RLHF不是RL。我在之前的一条推文中有单独的吐槽:https://t.co/RMIpFPVpuM)