返回 动态 学习 CMS 文章

卡帕西谈“第37手”:AI通过强化学习发现超越人类的创新策略

了解AI如何通过强化学习发现超越人类认知的创新策略,以及这一现象对未来AI发展的启示。

强化学习第37手AlphaGoLLM
成长分 / 100 78 综合收获、行动、留存与影响

为什么值得读理解“第37手”概念及其在AI发展中的重要性。

了解强化学习与模仿学习的本质区别。

关键洞察
  1. “第37手”是AI通过强化学习发现的、人类专家认为概率极低但事后证明精彩的行动。
  2. 模仿专家无法达到这种创新,只有大规模强化学习才能实现。
  3. 在围棋等封闭环境中已出现“第37手”,在开放领域(如数学、代码)的“思考型”LLM中已见早期迹象。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:2043

"第37手"是今日热词——它指的是,通过强化学习的试错过程训练出来的人工智能,发现了即使对专家人类来说也是新颖、令人惊讶且暗中巧妙的行动。这是一种神奇的、略带不安的涌现现象,只有大规模强化学习才能实现。你无法通过模仿专家达到这一点。这就是AlphaGo在与李世石的第二局比赛中下出第37手时的情形,那是一个奇怪的动作,估计人类下出这一手的概率只有万分之一,但事后看来,这一手富有创意且精彩,最终赢得了那场比赛。

我们已经在围棋这样的封闭、类游戏环境中看到了"第37手",但随着最新一批"思考"型LLM模型(如OpenAI-o1、DeepSeek-R1、Gemini 2.0 Flash Thinking)的出现,我们在开放世界领域看到了类似现象的早期微光。这些模型在尝试解决许多不同的数学、代码等问题时,发现了类似于人类内心独白的策略,这些策略很难(甚至不可能)直接编程到模型中。我称这些为"认知策略"——比如从不同角度处理问题、尝试不同的想法、寻找类比、回溯、重新检查等。听起来很奇怪,但LLM有可能发现更好的思考方式、解决问题的方式、跨学科连接想法的方式,并且以一种我们事后会感到惊讶、困惑,但富有创意和精彩的方式做到这一点。它也可能变得更加奇怪——优化过程发明自己的语言,这种语言对我们来说难以理解,但在解决问题上更高效或更有效,这是可能的(甚至很可能,如果做得好)。强化学习的怪异之处原则上是不受限制的。

我认为我们还没有看到"第37手"的等价物。我不知道它会是什么样子。我认为我们还处于早期阶段,前面还有很多工作,无论是工程还是研究。但这项技术感觉有望找到它们。

https://t.co/JCxTdKpuzv