LLM("大型语言模型")与语言关系不大,这有点令人遗憾和困惑;这只是历史原因。它们是用于对令牌流进行统计建模的高度通用技术。更好的名称应该是自回归Transformer或类似的名字。
它们并不关心令牌是否恰好代表小的文本块。它们同样可以是小的图像块、音频块、动作选择、分子或其他任何东西。如果你能将问题简化为对令牌流建模(对于任意一组离散令牌的任意词汇表),你就可以"用LLM来解决它"。
实际上,随着LLM技术栈变得越来越成熟,我们可能会看到大量问题收敛到这种建模范式中。也就是说,问题被固定为使用LLM进行"下一个令牌预测",只是每个领域的令牌用法和含义不同。
如果是这样,那么深度学习框架(例如PyTorch及其同类)对于大多数问题随时间演变的需求来说,可能过于通用了。如果80%的问题只想使用LLM,那么拥有数千个可以任意重新配置的操作和层又有什么意义呢?
我不认为这是真的,但我认为它有一半是真的。