返回 动态 学习 CMS 文章

Karpathy:首个大规模扩散LLM,文本生成的新范式?

了解扩散模型在LLM领域的首次大规模应用,及其与自回归模型的本质区别。

扩散模型LLM自回归文本生成
成长分 / 100 74 综合收获、行动、留存与影响

为什么值得读Karpathy 作为AI领域权威,对扩散LLM的首次大规模尝试给出专业见解。

解释了文本与图像/视频在生成模型选择上的差异,提供深层思考。

关键洞察
  1. 大多数LLM采用自回归训练,即从左到右预测token。
  2. 扩散模型同时去噪,从噪声生成token流,与自回归不同。
  3. 图像/视频生成普遍使用扩散,而文本/音频仍以自回归为主。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:1106

作为首个大规模基于扩散的LLM,这很有趣。

你见过的大多数LLM在核心建模方法上几乎都是克隆。它们都是“自回归”训练的,即从左到右预测token。扩散不同——它不是从左到右,而是同时进行。你从噪声开始,逐渐去噪成token流。

大多数图像/视频生成AI工具实际上都是这样工作的,使用扩散而非自回归。只有文本(有时还有音频!)一直抵制。所以,对我和其他许多人来说,为什么文本偏好自回归,而图像/视频偏好扩散,这有点神秘。事实证明,这是一个相当深的兔子洞,与信息和噪声的分布以及我们在这些领域对它们的感知有关。如果你仔细观察,两者之间也会出现许多有趣的联系。

总而言之,这个模型有可能与众不同,并可能展示新的、独特的心理,或新的优势和劣势。我鼓励人们尝试一下!