我们必须把大语言模型送去上学。
打开任何一本教科书,你会看到三种主要类型的信息:
背景信息/讲解。教科书的主体,解释概念。当你阅读时,你的大脑在训练这些数据。这相当于预训练,模型阅读互联网并积累背景知识。
带解答的例题。这些是专家如何解决问题的具体示例。它们是供模仿的示范。这相当于监督微调,模型在人类为助手编写的“理想回答”上进行微调。
练习题。这些是给学生的提示,通常没有解答,但总有最终答案。每章末尾通常有很多很多这样的题目。它们促使学生通过试错来学习——他们必须尝试各种方法才能得到正确答案。这相当于强化学习。
我们已经让大语言模型接触了大量的第1和第2类数据,但第3类是一个新兴的前沿领域。当我们为大语言模型创建数据集时,就像为它们编写教科书一样,包含这3类数据。它们必须阅读,也必须练习。
