这是一个带有两个标记 0/1 和上下文长度为 3 的迷你 GPT,将其视为有限状态马尔可夫链。它在序列 "111101111011110" 上训练了 50 次迭代。Transformer 的参数和架构修改了箭头上的概率。
例如,我们可以看到:
- 状态 101 在训练数据中确定性地转移到 011,因此该转移的概率变得更高(79%)。不是接近 100%,因为我们只做了 50 步优化。
- 状态 111 以 50% 的概率分别转移到 111 和 110,模型几乎学会了(45%,55%)。
- 像 000 这样的状态在训练中从未遇到过,但有相对尖锐的转移概率,例如有 73% 的概率转移到 001。这是 Transformer 中归纳偏差的结果。人们可能会想象希望这是 50%,但在实际部署中,几乎每个输入序列都是唯一的,不会逐字出现在训练数据中。
不太确定我到底想表达什么 :D,我认为训练/研究微型 GPT 很有趣,因为可以可视化并直观地理解整个动态系统。在这里玩:https://t.co/8jdceMLpqy
