"第37手"是今日热词——它指的是,通过强化学习的试错过程训练出来的人工智能,发现了即使对专家人类来说也是新颖、令人惊讶且暗中巧妙的行动。这是一种神奇的、略带不安的涌现现象,只有大规模强化学习才能实现。你无法通过模仿专家达到这一点。这就是AlphaGo在与李世石的第二局比赛中下出第37手时的情形,那是一个奇怪的动作,估计人类下出这一手的概率只有万分之一,但事后看来,这一手富有创意且精彩,最终赢得了那场比赛。
我们已经在围棋这样的封闭、类游戏环境中看到了"第37手",但随着最新一批"思考"型LLM模型(如OpenAI-o1、DeepSeek-R1、Gemini 2.0 Flash Thinking)的出现,我们在开放世界领域看到了类似现象的早期微光。这些模型在尝试解决许多不同的数学、代码等问题时,发现了类似于人类内心独白的策略,这些策略很难(甚至不可能)直接编程到模型中。我称这些为"认知策略"——比如从不同角度处理问题、尝试不同的想法、寻找类比、回溯、重新检查等。听起来很奇怪,但LLM有可能发现更好的思考方式、解决问题的方式、跨学科连接想法的方式,并且以一种我们事后会感到惊讶、困惑,但富有创意和精彩的方式做到这一点。它也可能变得更加奇怪——优化过程发明自己的语言,这种语言对我们来说难以理解,但在解决问题上更高效或更有效,这是可能的(甚至很可能,如果做得好)。强化学习的怪异之处原则上是不受限制的。
我认为我们还没有看到"第37手"的等价物。我不知道它会是什么样子。我认为我们还处于早期阶段,前面还有很多工作,无论是工程还是研究。但这项技术感觉有望找到它们。