返回 动态 学习 CMS 文章

Karpathy:模型规模竞争正在倒退,未来属于小而聪明的模型

Karpathy 认为未来会出现非常小但思考能力强的模型,通过合成数据训练实现,当前大模型是必经阶段。

LLM模型规模合成数据Karpathy
成长分 / 100 73 综合收获、行动、留存与影响

为什么值得读了解 AI 领域顶尖专家对模型规模趋势的独特预测

理解当前大模型训练的低效性及未来改进方向

关键洞察
  1. 模型规模竞争正在加剧,但方向是倒退的,即追求更小模型
  2. 存在一个 GPT-2 参数规模的设置,能让大多数人认为其聪明
  3. 当前模型庞大是因为训练过程浪费,要求模型记住整个互联网
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:1576

LLM 模型规模的竞争正在加剧……而且是倒退的!

我打赌我们会看到一些“思考”得很好且可靠的模型,它们非常非常小。很可能存在一个 GPT-2 参数的设置,使得大多数人会认为 GPT-2“聪明”。当前模型如此庞大的原因是因为我们在训练过程中仍然非常浪费——我们要求它们记住整个互联网,而且值得注意的是,它们确实做到了,例如能背诵常见数字的 SHA 哈希,或回忆非常冷门的事实。(实际上,LLM 在记忆方面非常擅长,定性上比人类好得多,有时只需要一次更新就能长时间记住大量细节)。但想象一下,如果你要参加闭卷考试,根据前几个词背诵互联网上的任意段落。这就是当今模型的标准(预)训练目标。做得更好的难点在于,思考的演示在训练数据中与知识“纠缠”在一起。

因此,模型必须先变大,然后才能变小,因为我们需要它们(自动化的)帮助来重构和塑造训练数据,使其成为理想的合成格式。

这是一个改进的阶梯——一个模型帮助生成下一个模型的训练数据,直到我们剩下“完美的训练集”。当你用这个训练集训练 GPT-2 时,按照今天的标准,它将是一个非常强大/聪明的模型。也许 MMLU 会稍微低一点,因为它不会完美地记住所有化学知识。也许它需要偶尔查一下以确保准确。