返回 动态 学习 CMS 文章

Karpathy 演示迷你 GPT:有限状态马尔可夫链的可视化教学

通过一个微型 GPT 实例,直观理解 Transformer 如何学习序列中的转移概率,并观察归纳偏差的影响。

GPTTransformer马尔可夫链可视化
成长分 / 100 72 综合收获、行动、留存与影响

Karpathy 演示迷你 GPT:有限状态马尔可夫链的可视化教学
为什么值得读以极简模型揭示 Transformer 内部机制,适合初学者建立直觉。

通过可视化交互,直观展示训练过程中概率变化。

关键洞察
  1. 迷你 GPT 可视为有限状态马尔可夫链,状态由上下文 token 决定。
  2. 训练数据中的确定性转移(如 101→011)概率显著提高,但受限于优化步数未达 100%。
  3. 训练数据中未出现的状态(如 000)仍具有尖锐的转移概率,体现 Transformer 的归纳偏差。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:1260

这是一个带有两个标记 0/1 和上下文长度为 3 的迷你 GPT,将其视为有限状态马尔可夫链。它在序列 "111101111011110" 上训练了 50 次迭代。Transformer 的参数和架构修改了箭头上的概率。

例如,我们可以看到:

  • 状态 101 在训练数据中确定性地转移到 011,因此该转移的概率变得更高(79%)。不是接近 100%,因为我们只做了 50 步优化。
  • 状态 111 以 50% 的概率分别转移到 111 和 110,模型几乎学会了(45%,55%)。
  • 像 000 这样的状态在训练中从未遇到过,但有相对尖锐的转移概率,例如有 73% 的概率转移到 001。这是 Transformer 中归纳偏差的结果。人们可能会想象希望这是 50%,但在实际部署中,几乎每个输入序列都是唯一的,不会逐字出现在训练数据中。

不太确定我到底想表达什么 :D,我认为训练/研究微型 GPT 很有趣,因为可以可视化并直观地理解整个动态系统。在这里玩:https://t.co/8jdceMLpqy