返回 动态 学习 CMS 文章

Karpathy:LLM 与语言无关,是通用令牌流建模技术

LLM 是通用令牌流建模技术,未来多数问题将收敛到该范式,深度学习框架可能过于通用。

LLM自回归令牌流深度学习框架
成长分 / 100 65 综合收获、行动、留存与影响

为什么值得读理解 LLM 的本质:与语言无关,而是对任意离散令牌流进行统计建模。

洞察技术趋势:未来问题将收敛到 LLM 范式,影响技术栈选择。

关键洞察
  1. LLM 名称具有历史误导性,实际是自回归 Transformer 类技术。
  2. 令牌可以是文本块、图像块、音频块、动作选择、分子等任何离散符号。
  3. 只要问题能简化为令牌流建模,就能用 LLM 解决。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:1237

LLM("大型语言模型")与语言关系不大,这有点令人遗憾和困惑;这只是历史原因。它们是用于对令牌流进行统计建模的高度通用技术。更好的名称应该是自回归Transformer或类似的名字。

它们并不关心令牌是否恰好代表小的文本块。它们同样可以是小的图像块、音频块、动作选择、分子或其他任何东西。如果你能将问题简化为对令牌流建模(对于任意一组离散令牌的任意词汇表),你就可以"用LLM来解决它"。

实际上,随着LLM技术栈变得越来越成熟,我们可能会看到大量问题收敛到这种建模范式中。也就是说,问题被固定为使用LLM进行"下一个令牌预测",只是每个领域的令牌用法和含义不同。

如果是这样,那么深度学习框架(例如PyTorch及其同类)对于大多数问题随时间演变的需求来说,可能过于通用了。如果80%的问题只想使用LLM,那么拥有数千个可以任意重新配置的操作和层又有什么意义呢?

我不认为这是真的,但我认为它有一半是真的。