返回 动态 学习 CMS 文章

Karpathy:把大语言模型送去上学——从教科书到强化学习

用教科书学习类比 LLM 训练,揭示预训练、SFT 和 RL 的本质区别与当前重点。

LLM预训练监督微调强化学习
成长分 / 100 74 综合收获、行动、留存与影响

Karpathy:把大语言模型送去上学——从教科书到强化学习
为什么值得读以直观类比解释 LLM 训练三大阶段,适合初学者理解。

由 AI 领域权威 Karpathy 提出,观点具有前瞻性。

关键洞察
  1. 教科书包含三类信息:背景讲解、例题、练习题,分别对应预训练、SFT 和 RL。
  2. 预训练让模型积累背景知识,SFT 提供专家示范,RL 通过试错学习。
  3. 当前 LLM 已大量接触前两类数据,但练习题(RL)是新兴前沿。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:1329

我们必须把大语言模型送去上学。

打开任何一本教科书,你会看到三种主要类型的信息:

  1. 背景信息/讲解。教科书的主体,解释概念。当你阅读时,你的大脑在训练这些数据。这相当于预训练,模型阅读互联网并积累背景知识。

  2. 带解答的例题。这些是专家如何解决问题的具体示例。它们是供模仿的示范。这相当于监督微调,模型在人类为助手编写的“理想回答”上进行微调。

  3. 练习题。这些是给学生的提示,通常没有解答,但总有最终答案。每章末尾通常有很多很多这样的题目。它们促使学生通过试错来学习——他们必须尝试各种方法才能得到正确答案。这相当于强化学习。

我们已经让大语言模型接触了大量的第1和第2类数据,但第3类是一个新兴的前沿领域。当我们为大语言模型创建数据集时,就像为它们编写教科书一样,包含这3类数据。它们必须阅读,也必须练习。