Podcast Script (zh)
[0.120-3.324] SPEAKER_01: 你在学习率上玩了点魔法,挺有意思的。
[3.624-10.729] SPEAKER_00: 对,这些工作都来自一位叫莱斯利·史密斯的研究员。他是 和我们一样,特别关心怎么又快又准地训练神经网络。
[10.809-21.167] SPEAKER_00: 你可能觉得这事儿人人都该关心,但几乎没人去做。而他 发现了一个特别有趣的现象,他管它叫“超级收敛”,就是某些 网络在特定的高参数下,用高出十倍的学习率,
[21.247-26.889] SPEAKER_00: 训练速度能突然提升十倍。但没人发表那篇 论文,因为这在学术界不是个热门研究领域。没有
[26.969-39.707] SPEAKER_00: 学者认识到这很重要。而且,在学术界,深度学习不被看作 一门实验科学。所以不像物理学,你可以说,比如,我刚 看到一个理论解释不了的亚原子粒子行为,你可以发表
[39.787-52.653] SPEAKER_00: 这个发现,不需要解释。之后六十年,人们慢慢搞明白 怎么解释它。但在深度学习领域,我们不允许这样。所以实际上 莱斯利不可能发论文说“我刚刚看到了一些惊人的事。 训练速度比正常快了十倍。我不知道为什么。我不知道
[52.733-56.239] SPEAKER_00: 为什么。”所以审稿人就说“我们不能发,因为你不知道为什么。”所以
[56.539-66.131] SPEAKER_01: 就这样吧。 这点很重要,值得停下来想想,因为很多发现都得这么开始。 我所知道的其他科学领域都是这么运作的。我不知道为什么我们领域不是。
[66.431-77.335] SPEAKER_00: 我知道的其他科学领域都是那样运作的。不知道为啥我们的不是。 对发表无法解释的结果特别冷淡,但事实如此。所以 它没被发表。不过我读了更多未发表的论文和出版物
[77.415-87.646] SPEAKER_00: 已发表的论文里有很多有趣见解。所以我绝对 我读了这篇论文,就觉得这震惊、不可思议又怪异 太棒了。为什么没人讨论这个?因为如果能训练这些
[87.726-97.048] SPEAKER_00: 东西快十倍,泛化能力也更好,因为轮次更少,这 意味着数据更少,精度更高。所以我一直研究这个 后来,Leslie大致搞清楚了怎么实现
[97.128-109.460] SPEAKER_00: 我们做了些小调整,技巧主要从很低的学习率开始 非常慢地增加。所以训练模型时,一开始 迈出很小的步子,然后逐渐加大,直到 步幅比任何人想象的都大。还有其他几个
[109.540-116.645] SPEAKER_00: 小技巧让它生效,但基本上能做到 可以稳定实现超收敛。所以在dawn bench项目里,我们用了 比预期高得多的学习率
[116.945-125.466] SPEAKER_01: 你认为未来会怎样?我是说,学习率作为关键超参数来调很合理 用学习率这个超参数来变。你觉得学习率魔法的未来 会是什么样?
[125.766-136.101] SPEAKER_00: 嗯,过去一年,这领域有很多好工作。而且人们 越来越意识到,我们其实不懂优化是怎么进行的 工作。 权重衰减、学习率和其他参数会奇怪地协同作用。
[136.181-143.100] SPEAKER_00: 我们研究模型不同部分以不同速率和方式训练。 所以我们用了所谓的判别学习率。 这在迁移学习中特别重要。
[143.180-155.500] SPEAKER_00: 我觉得过去一年里,很多人意识到这些东西很重要。 现在有很多好成果,有些算法几乎不用调参。 我觉得学习率这个概念,最近的研究里快消失了。 相反,我们很了解怎么解释看到的东西。
[155.580-161.686] SPEAKER_00: 知道怎么设置每个参数。 所以,可以自动调参。 实际上,我们对解读已经了解得够多了。 嗯。
[161.766-163.693] SPEAKER_00: 我们看看怎么设置每个参数。
[163.993-165.304] SPEAKER_02: 这样就能自动调参。