作为首个大规模基于扩散的LLM,这很有趣。
你见过的大多数LLM在核心建模方法上几乎都是克隆。它们都是“自回归”训练的,即从左到右预测token。扩散不同——它不是从左到右,而是同时进行。你从噪声开始,逐渐去噪成token流。
大多数图像/视频生成AI工具实际上都是这样工作的,使用扩散而非自回归。只有文本(有时还有音频!)一直抵制。所以,对我和其他许多人来说,为什么文本偏好自回归,而图像/视频偏好扩散,这有点神秘。事实证明,这是一个相当深的兔子洞,与信息和噪声的分布以及我们在这些领域对它们的感知有关。如果你仔细观察,两者之间也会出现许多有趣的联系。
总而言之,这个模型有可能与众不同,并可能展示新的、独特的心理,或新的优势和劣势。我鼓励人们尝试一下!