LLM 模型规模的竞争正在加剧……而且是倒退的!
我打赌我们会看到一些“思考”得很好且可靠的模型,它们非常非常小。很可能存在一个 GPT-2 参数的设置,使得大多数人会认为 GPT-2“聪明”。当前模型如此庞大的原因是因为我们在训练过程中仍然非常浪费——我们要求它们记住整个互联网,而且值得注意的是,它们确实做到了,例如能背诵常见数字的 SHA 哈希,或回忆非常冷门的事实。(实际上,LLM 在记忆方面非常擅长,定性上比人类好得多,有时只需要一次更新就能长时间记住大量细节)。但想象一下,如果你要参加闭卷考试,根据前几个词背诵互联网上的任意段落。这就是当今模型的标准(预)训练目标。做得更好的难点在于,思考的演示在训练数据中与知识“纠缠”在一起。
因此,模型必须先变大,然后才能变小,因为我们需要它们(自动化的)帮助来重构和塑造训练数据,使其成为理想的合成格式。
这是一个改进的阶梯——一个模型帮助生成下一个模型的训练数据,直到我们剩下“完美的训练集”。当你用这个训练集训练 GPT-2 时,按照今天的标准,它将是一个非常强大/聪明的模型。也许 MMLU 会稍微低一点,因为它不会完美地记住所有化学知识。也许它需要偶尔查一下以确保准确。