返回 播客 学习 audios

杰瑞米·霍华德谈Fast.ai、编程语言与深度学习未来

杰瑞米·霍华德分享编程生涯、对J语言的推崇、Swift在深度学习中的潜力,以及Fast.ai如何降低门槛。讨论医疗AI应用、数据隐私、学习率优化和间隔重复学习法。

深度学习编程语言Fast.ai
成长分 / 100 71 综合收获、行动、留存与影响

为什么值得读杰瑞米·霍华德分享编程生涯、对J语言的推崇、Swift在深度学习中的潜力,以及Fast.ai如何降低门槛

讨论医疗AI应用、数据隐私、学习率优化和间隔重复学习法

关键洞察
  1. 这条内容的价值在于把外部信息转化为可执行的判断和行动。
转成行动

Lex Fridman · 中文播客

查看原视频 ↗

节目文字稿

中文播客全文

Podcast Script (zh)

[0.120-12.635] SPEAKER_02: 下面是对杰瑞米·霍华德的访谈。 他创立了Fast.ai,让深度学习更易上手。 也是旧金山大学杰出研究科学家。 曾任Kaggle总裁,也是顶级参赛者。

[12.715-25.427] SPEAKER_02: 总之,他是企业家、教育者、研究者。 也是AI社区中鼓舞人心的人物。 有人问我怎么开始深度学习? 我首推Fast.ai。 免费、易上手,见解深刻且易懂。

[25.507-29.419] SPEAKER_02: 几乎没有注水的废话。 尤其在深度学习这种热门领域。

[29.499-39.820] SPEAKER_02: Fast.ai注重实战和前沿动手探索。 既对新手友好,也对专家有价值。 这就是人工智能。 喜欢请订阅YouTube,五星评价,Patreon支持。

[39.900-49.396] SPEAKER_02: 或在Twitter找我@Lex Friedman,拼写F-R-I-D-M-A-N。 下面是我对杰瑞米·霍华德的访谈。

[49.476-52.308] SPEAKER_02: 你写的第一个程序是什么?

[52.608-54.419] SPEAKER_00: 我第一个程序是在高中写的。

[54.499-63.380] SPEAKER_00: 呃... 我做了个... 作业里我试着找更好的音阶 比标准十二音阶更好 我用BASIC在Commodore 64上写程序搜其他音阶大小

[63.460-66.211] SPEAKER_00: 看能不能找到更精确的和声

[66.511-67.718] SPEAKER_02: 比如中音?

[68.018-74.264] SPEAKER_00: 比如你要精确的3:2比例,但在十二间隔音阶里 它并不精确…… 比如3:2 这就是平均律

[74.564-80.705] SPEAKER_02: 还是在Commodore 64上用BASIC 对 对音乐的兴趣怎么来的? 还是只是技术上的?

[81.005-85.927] SPEAKER_00: 我一辈子都在搞音乐 所以我演奏萨克斯、单簧管、钢琴、吉他、鼓等

[86.227-89.617] SPEAKER_02: 这条线索怎么贯穿你的人生? 现在音乐在哪儿?

[89.917-92.331] SPEAKER_00: 它不在我希望的地方

[92.631-93.408] SPEAKER_02: 我……

[93.708-101.045] SPEAKER_00: 因为各种原因,实在没法继续了。 特别是手指有严重的重复性劳损。 所以只能减少所有用手和手指的活动。

[101.125-103.714] SPEAKER_00: 希望以后健康允许能重新投入。

[104.014-106.649] SPEAKER_02: 所以对音乐的热爱一直没变。 当然是的。

[106.729-109.341] SPEAKER_02: 你最喜欢什么乐器?

[109.641-110.790] SPEAKER_00: 萨克斯管。

[111.090-113.121] SPEAKER_02: 萨克斯。

[113.421-117.612] SPEAKER_00: 上低音萨克斯。 嗯,可能是低音萨克斯,但不方便。

[117.912-127.954] SPEAKER_02: 嗯,我一直喜欢当... 音乐和编程紧密相连。 两者同时用,创意就来了。 所以你用过不少编程语言。 说说你用过的语言? 每种语言有什么优缺点?

[128.254-137.588] SPEAKER_00: 嗯,最喜欢的编程环境大概就是早期的微软Access。 那就是VBA,Visual Basic for Applications。 它并不是... 不算好语言,但编程环境真棒。

[137.668-143.507] SPEAKER_00: 它能轻松创建界面,绑定数据和操作,还能做报告。 从没见过这么出色的东西。

[143.587-149.914] SPEAKER_00: 现在的Airtable之类,只是它的一小部分,大家喜欢它有原因。 但可惜,从来没人…

[149.994-151.770] SPEAKER_00: 实现过类似的东西。

[152.070-157.793] SPEAKER_02: 那是什么? 能暂停一下吗? 哦,Access? 它是个… 本质上就是数据库。

[158.093-166.370] SPEAKER_00: 微软Office的数据库程序,有点过时了。 但能图形化建表、关系、查询,绑定表单,设事件和计算。

[166.450-170.397] SPEAKER_00: 非常完整强大,专门为… 不是大规模,而是适合小应用。

[170.697-173.541] SPEAKER_02: 那Excel和Access什么关系?

[173.841-197.899] SPEAKER_00: 关系很近。 Access相当于关系数据库的Excel版。 很多人用Excel做本应Access做的事,因为熟悉。 Excel也很棒。 所以它没那么丰富。 嗯。 没错。 对。 是啊。 对。 嗯。 没错。 对。 是啊。 对。 嗯。 没错。 对。 是啊。 对。 嗯。 没错。 对。 是啊。 对。 没错。 嗯。 是的。 确实。 就是这样。 嗯哼。

[197.979-209.359] SPEAKER_00: 对的。 没错。 是的。 对。 确实。 嗯。 对的。 没错。 嗯。 是的。 确实。 对。 没错。 嗯。 所以我一直很喜欢关系数据库。 但现在,在关系数据库上编程麻烦多了。 你知道,通常你得有个连接的东西,

[209.439-213.444] SPEAKER_00: 它跑个数据库服务器,除非用SQLite,但SQLite也有自己的问题。

[213.524-225.949] SPEAKER_00: 然后通常,要得到好的编程模型,你需要,比如, 创建一个…… 在上面加个ORM。然后,得拼凑好多部分,而且 这比它本该做的别扭多了。有些人正在努力让它

[226.029-238.463] SPEAKER_00: 更容易。特别是F#,Don Syme和他的团队做得很好, 让数据库似的东西出现在类型系统里。这样你就能得到制表符

[238.543-248.457] SPEAKER_00: 补全字段、表格等等。总之,这个有点……总之 所以像VBA Office这类东西,我想,是个起点,我到现在还怀念它。 我开始学标准Visual Basic,它……

[248.757-260.265] SPEAKER_02: 这挺有意思,先停一下。有趣的是,你正在 把编程语言和数据管理的便利联系起来。所以你在用编程语言时, 你总有一个…… 对数据的热爱和联系。

[260.565-269.063] SPEAKER_00: 我一直喜欢做对自己和他人有用的事,这通常 就是获取数据,处理,再输出。 我一直很感兴趣,用AppleScript做了很多事。

[269.143-274.808] SPEAKER_00: 早期就让计算机互相交流。 还能帮你做事,很不错。 那时我最喜欢的语言是Delphi。

[274.888-286.544] SPEAKER_00: Anders Helzberg做了Object Pascal,之前做了Turbo Pascal。 接着他又做了.NET和TypeScript。Delphi非常棒。 它是编译型快速,像VB一样易用。

[286.844-290.431] SPEAKER_02: Delphi。 它是什么? 它跟现代语言有哪里像?

[290.731-291.799] SPEAKER_00: Visual Basic。

[292.099-294.165] SPEAKER_02: Visual Basic。

[294.465-300.304] SPEAKER_00: 没错,编译型快速版。不知道现在还有没有类似的。 把C#或Java去掉虚拟机,换成

[300.384-311.776] SPEAKER_00: 能编译成小二进制,Swift可能做到。 通过新的Swift UI。 对。 对。 对。 对。 我觉得挺有意思的。看Delphi和跨平台发展挺好玩。 还在继续。我希望我们能回到Delphi那个巅峰。

[311.856-317.719] SPEAKER_00: 现在有个叫Lazarus的免费Pascal项目,也在努力重现Delphi。 他们做得不错。

[318.019-320.863] SPEAKER_02: 那Delphi是你最喜欢的编程语言之一吗?

[321.163-327.026] SPEAKER_00: 至少会用两种语言。 环境。再说,我觉得Pascal不算好语言。你问我的话, 我肯定选J,因为它太棒了。

[327.106-329.555] SPEAKER_00: J是啥?你听说过APL吗?

[329.855-332.583] SPEAKER_02: 不太熟,除了稍微研究过你的作品。

[332.883-345.494] SPEAKER_00: 你不熟悉很正常,它不出名。 但它其实是主要编程语言家族之一,能追溯到50年代末60年代初。 所以有几个方向。一个是阿隆佐·丘奇的lambda演算,

[345.574-352.493] SPEAKER_00: 就是Lisp、Scheme这些,历史很早。 第二个方向是命令式/面向对象,像Algo、Simula,

[352.573-364.336] SPEAKER_00: 再到C、C++等等。 还有第三种,叫面向数组的语言。 始于肯·艾弗森的一篇论文,其实是数学理论,不是编程。 题目是《作为思维工具的符号》。

[364.416-372.542] SPEAKER_00: 这篇数学论文不是讲编程的,叫《作为思维工具的符号》。 它是一种新型数学符号。它的思想是,这种符号 更灵活。 是的。

[372.622-385.372] SPEAKER_00: 它比传统数学符号更灵活、更有表现力,定义也清晰, 传统符号都没这些特点,很糟糕。于是他把它变成一种 编程语言,因为是50年代末,名字随便用。于是他命名为

[385.452-395.390] SPEAKER_00: 他的语言叫编程语言或APL。所以APL是 符号是思维工具的一种实现,他指的就是数学符号。 好的。 肯和他儿子做了很多事,但最终他们创造了

[395.470-398.720] SPEAKER_00: 一种基于APL所有经验的新语言,叫J。

[398.800-403.931] SPEAKER_00: J是我见过最有表现力、组合性最强、设计最精美的语言。

[404.231-407.981] SPEAKER_02: 它有面向对象的组件吗?有这种东西吗?

[408.281-412.286] SPEAKER_00: 不完全。它是一种面向数组的语言。它是一种 它是第三条路。

[412.586-414.582] SPEAKER_02: 你是说数组吗?

[414.882-416.530] SPEAKER_00: 面向数组,是的。

[416.830-418.664] SPEAKER_02: 什么叫面向数组?

[418.964-426.522] SPEAKER_00: 面向数组就是通常不用任何循环,而是通过 一种极端的广播形式完成所有操作,如果你熟悉NumPy/Python的话

[426.602-438.214] SPEAKER_00: 概念上,一行代码能干很多事,很像数学符号。 所以它基本上... 高度紧凑,理念是,一行代码就能做很多事, 一行代码,一屏幕代码几乎不可能,很少需要超过

[438.294-448.034] SPEAKER_00: 用它表达程序,大致都能记在脑子里, 还能清晰传达。有趣的是,APL有两个主要分支, K和J。J有点像开放源码的小众社区,由 疯狂的...

[448.114-455.056] SPEAKER_00: 像我这样的疯子组成。而K则令人着迷,它惊人地 昂贵的编程语言,很多顶级对冲基金在用。

[455.136-464.238] SPEAKER_00: 整个K机器非常小,能放进CPU三级缓存,轻松赢 我见过的所有基准测试,数据处理速度第一。但你不常见到它,

[464.318-470.924] SPEAKER_00: 因为每个CPU运行费约10万美元。但这条路 各方面都强大得多,我不知道,比那些 几乎人人每天用的语言。

[471.224-474.335] SPEAKER_02: 所以它完全关于计算,非常专注于...

[474.635-476.922] SPEAKER_00: 它非常侧重计算。我的意思是,

[477.002-485.721] SPEAKER_00: 编程很大部分就是数据处理,所以你能用它做很多事, 但确实,在用户界面方面没做太多工作, 工具包之类的。有一些,但都不太好。

[486.021-488.772] SPEAKER_02: 你用Perl和Python做了很多工作。

[489.072-489.582] SPEAKER_00: 对。

[489.882-493.968] SPEAKER_02: 那这跟J、K、APL这些有什么关系?

[494.268-498.877] SPEAKER_00: 嗯,它更务实,最后你得用现成的库。 对,对我来说重点就是

[498.957-505.922] SPEAKER_00: 我只想高效完成任务,所以Perl很好用。我创立了 公司叫FastMail。Perl好用,因为九十年代末、二十一世纪初,

[506.002-514.187] SPEAKER_00: 它能做很多事。我还是得自己写监控系统 还有我自己写的Web框架和各种东西,因为当时都没有。但它是一个 做这些事的语言,非常灵活。

[514.487-519.630] SPEAKER_02: 你在FastMail把Perl当后端?所有东西都用Perl写?

[519.930-521.636] SPEAKER_00: 对,所有东西都用Perl。

[521.936-532.431] SPEAKER_02: 你觉得Perl为什么没主宰市场,而Python却占了上风? 嗯,Perl确实曾经主导过。它无处不在。但后来Perl的负责人拉里

[532.731-539.615] SPEAKER_00: 拉里·沃尔……对,Perl确实主导过,但后来 就是不再花时间了。而且 没有强领导,项目就成不了。尤其是那种最初有强领导

[539.695-545.441] SPEAKER_00: 后来失去领导的项目。所以Python替代了它。Python 几乎在哪方面都不太优雅的语言,但

[545.521-551.186] SPEAKER_00: 它有个更好的生态系统。就像大家都用Python。 数据科学库很多很棒,所以我有点用它。

[551.266-554.679] SPEAKER_00: 它是最好的,但还不够好。

[554.979-560.981] SPEAKER_02: 你怎么看编程的未来?你希望 编程的未来什么样?特别是计算和数据科学领域?

[561.281-564.125] SPEAKER_00: 机器学习领域?我希望Swift能成功。

[564.205-565.017] SPEAKER_00: 因为...

[565.097-573.955] SPEAKER_00: Swift目标是无限可入侵性,这正是 我希望我和研究伙伴、学生们能查看并 从上到下改变一切,没有神秘和不可触碰的东西。

[574.035-595.971] SPEAKER_00: 可惜,Python正好相反。因为Python非常 慢,极其不具可入侵性。你会到:从这里开始往下都是 C语言,所以调试器无法像以前那样工作。于是你说,好,用C。所以你的 调试器无法像以前那样工作。于是你说,好,用C。所以调试器不 能以同样方式工作。分析器不行,构建系统也不行。 这真的很不具可入侵性。你希望哪部分可入侵?

[596.271-602.017] SPEAKER_02: 是为了优化神经网络的训练和推理吗? 是系统性能吗?还是非性能相关的?

[602.317-611.639] SPEAKER_00: 是一切。作为从业者,我希望能高效。所以目前, 我们对深度学习理解很初级,了解非常少。 多数效果不好,虽然比现有其他都好用。

[611.719-622.228] SPEAKER_00: 很多地方都能改进。你看任何领域, 比如用深度学习做语音识别或自然语言处理。 分类之类的。每次研究一个深度学习领域, 哎,太糟糕了。有太多太多

[622.308-626.940] SPEAKER_00: 明显很蠢的做法需要修正。 我马上动手实验,让它们变得更好。

[627.240-629.910] SPEAKER_02: 编程语言在这方面有用吗?

[630.210-635.341] SPEAKER_00: 作用巨大。对。Python拖累创新能力, 尤其在循环神经网络和自然语言方面。因为太

[635.421-642.886] SPEAKER_00: 慢了。实际逐词循环时,必须在 用CUDA C跑完整个流程。无法创新内核,核心算法。

[642.966-649.688] SPEAKER_00: 大问题,无处不在。我们遇到研究瓶颈。 另一个例子:卷积神经网络,最流行的架构,

[649.768-659.485] SPEAKER_00: 在大多数深度学习领域,我们肯定要用 稀疏卷积神经网络。只有两人做,因为要这样做, 重写所有CUDA C代码。研究者和实践者都不做。

[659.565-665.393] SPEAKER_00: 所以实际研究和实现之间存在巨大差距, 就因为编程语言的问题。所以你觉得

[665.693-675.549] SPEAKER_02: 用CUDA C太难,以致像Swift这样的高级 语言能让RNN创造性折腾变得更容易? 或者用稀疏卷积神经网络?算是吧。

[675.629-685.207] SPEAKER_02: 是谁的错?谁负责让研究人员轻松尝试? 没人有错,只是还没人做,或者太难了。工作量很大。 不,我们必须让研究人员轻松一点。

[685.507-697.131] SPEAKER_00: 说得好。我们会尽力。 您觉得谁该让用RNN或稀疏卷积神经网络做创意更简单? 算是吧,嗯。您觉得谁该让用RNN做创意更简单? 还没人做。很难。部分原因是我们忽略了整个

[697.211-706.707] SPEAKER_00: APL这类方向,或者说几乎所有人都忽略了60、50年。但最近, 人们开始重新发明其中部分,并创造了一些有趣的新方向

[706.787-714.333] SPEAKER_00: 在编译器技术领域。目前这种情况特别发生的地方是 MLIR,又由Chris Lattner,Swift开发者,主导。

[714.413-725.746] SPEAKER_00: 因为仅靠Swift解决不了这个问题,因为 问题在于,写一个够快的GPU程序太复杂了,无论 你用什么语言。而这仅仅是因为如果你得处理这样一个事实:我有

[725.826-740.085] SPEAKER_00: 一万个线程,我必须 在它们之间同步,还得把我的东西放到网格块里,并考虑 线程束以及所有这些,这么多样板代码,以至于要做好你得 成为这方面专家,并且用那种方式优化算法得花一年。

[740.165-746.225] SPEAKER_00: 但有了TF Comprehensions、Tile、MLIR、TVM, 这些不同项目都在说,

[746.305-755.964] SPEAKER_00: 让人们创造自己的版本。 让人们创造自己的版本。 创建张量计算的专用语言,这些就是 我们常在GPU做深度学习,然后编译器优化

[756.044-764.379] SPEAKER_00: 那个张量计算。很多工作其实建立在 Halide项目之上,这项目很棒,提出了专用语言。 其实是两个:一个专用语言描述张量计算,

[764.459-771.726] SPEAKER_00: 另一个描述如何组织 它的编译,比如分块、并行处理。他们 能展示压缩代码量十倍,相比优化过的

[771.806-779.503] SPEAKER_00: GPU代码且性能相同。其他东西建立在那 的研究上,MLIR整合了最佳实践。现在开始

[779.583-791.636] SPEAKER_00: 有些工作让这些能通过Swift访问,这样我就能用 Swift写那些专用语言。希望以后能有Swift CUDA内核, 写起来有表现力又简洁,有点像APL里的J,然后Swift

[791.716-797.764] SPEAKER_00: 层叠其上,再加上Swift UI。 嗯哼。 如果能做到,那就太好了。

[798.064-802.394] SPEAKER_02: 那最后都归结到CUDA和NVIDIA GPU上吗?

[802.694-808.835] SPEAKER_00: 可惜现在是这样,但MLIR有个好处:要是AMD振作起来… 虽说不大可能,但他们或别人能写MLIR后端,

[808.915-814.615] SPEAKER_00: 给别的GPU或张量设备。 嗯。 现在这类设备越来越多,比如Graphcore或Vertex AI。

[814.695-826.226] SPEAKER_00: 所以能支持很多后端是好事,而且市场需要竞争。 现在NVIDIA把企业显卡价格抬得很高, 因为没有真正竞争,别人软件搞不定。 对。 嗯。 云领域有点竞争,是吧?

[826.526-830.055] SPEAKER_02: 其实没有,除了TPU,但TPU几乎没法编程。

[830.355-832.560] SPEAKER_00: TPU也一个毛病,你没法……

[832.860-834.531] SPEAKER_02: 甚至更糟。

[834.831-847.058] SPEAKER_00: TPU上,谷歌故意让它几乎完全不可编程, 因为觉得知识产权太多,让人直接编程就会泄露秘密。 对。 所以你实际上不能直接…… 对。 所以其实你不能直接……

[847.138-859.296] SPEAKER_00: 在TPU里写内存程序,连直接创建运行的代码都不行,而且 你在有GPU的机器上看,全都在虚拟机里跑 所以你只能干这种千篇一律的活儿,把高级的东西拼在一起

[859.376-862.162] SPEAKER_00: 这又繁又烦,完全没必要

[862.462-868.789] SPEAKER_02: 是的 是的 是的 是的 是的 突然,你有了另一个AI 动机、使命、梦想是什么?

[869.089-876.972] SPEAKER_00: 所以我的创业故事跟我上一家初创公司关系很大,那家公司 叫Analytique,是首家专注医学深度学习的公司

[877.052-885.933] SPEAKER_00: 我创办它是因为看到了巨大机会,大概有10倍 全球医生数量短缺 全球和发展中国家都需要。我估计大概要300年才能

[886.013-893.234] SPEAKER_00: 培训足够医生填补缺口,但我想如果用深度学习 处理一些分析,也许能让培训要求没那么高的 医生来做诊断和治疗规划

[893.534-899.559] SPEAKER_02: 最大的好处在哪?说fast AI之前,最大的好处在哪? 你今天在医学里看到的人工智能?

[899.859-905.663] SPEAKER_00: 今天实际应用不多,还很早期。 但机会来说,是印度、中国和印尼这些市场。

[905.743-911.048] SPEAKER_00: 这些市场人口多,非洲医生少,还能提供诊断。 尤其在设备上做治疗计划和分诊。

[911.128-918.175] SPEAKER_00: 所以做了疟疾或结核病检测,立即获得信息。 即使只培训一个月的医疗工作者,也能获得非常高质量的

[918.255-930.645] SPEAKER_00: 评估,判断患者有没有风险,然后决定,好的,我们把他们送去 医院。比如在非洲,除了南非,只有五位 儿科放射科医生,服务整个非洲大陆。 所以大多数国家一个都没有。如果你孩子生病,需要诊断

[930.725-940.280] SPEAKER_00: 通过医学影像,即使你做了检查,看影像的人 最多也就是个护士。但在印度和中国,几乎没有任何 X光片是专业人员读的,因为数量不够。

[940.360-947.082] SPEAKER_00: 所以如果我们有一种算法,能找出最 是的。 可能的高风险5%,然后说基本就是分流,好的,有人需要看这个,

[947.162-957.973] SPEAKER_00: 这会极大改变发展中国家在医学上的可能性。 世界。记住,他们越来越有钱了。他们是发展中国家,不是 穷国,他们是发展中国家。所以有钱,正在建设

[958.053-961.582] SPEAKER_00: 医院有诊断设备,但短期内还缺 专业知识。

[961.882-966.711] SPEAKER_02: 缺专业知识。这正是深度学习能介入并放大 他们现有的专业知识。

[967.011-968.021] SPEAKER_00: 没错。是的。

[968.321-977.783] SPEAKER_02: 那么,我们多看看这个互动,你是否还认为 人类专家还是这些系统的核心? 当然,绝对是的。 医学里有没有几乎完全自动化的事?

[978.083-988.975] SPEAKER_00: 我觉得没意义。 甚至想这个都没意义,我们严重缺人手。 为啥要想办法不用他们?我们有人员。所以这想法,就算从 经济角度看,如果你能让他们效率提高十倍,淘汰人员

[989.055-995.440] SPEAKER_00: 根本不影响你的单位经济。而且它完全忽略了一些事 人比机器做得好。所以对我来说,这不是定义问题的好框架。

[995.740-1004.784] SPEAKER_02: 我想 澄清一下,我的意思是,有些问题甚至不用咨询 专家,比如预防性护理或基本事情,让专家集中做 真正重要的事,你懂的。

[1005.084-1014.209] SPEAKER_00: 嗯,这就是分诊,对吧?分诊会说, 好的,99%确定没有。设备上搞定,他们就能说,回家吧。 说,好的,回家吧。所以专家就来看那些

[1014.289-1018.073] SPEAKER_00: 有些东西值得一看,但大多不值得,你知道,这没问题。

[1018.373-1021.507] SPEAKER_02: 你觉得为啥我们在AI医疗应用上还没啥进展?

[1021.587-1024.756] SPEAKER_02: AI在医疗领域的应用程度呢?

[1025.056-1032.695] SPEAKER_00: 嗯,原因很多。主要是它还很新。我才开始 大概2014年开始分析工作。那之前,就像,

[1032.775-1040.878] SPEAKER_00: 很难说医学界有多没意识到 这里的机会。我就去了RSNA,全球最大的放射学会议。 我尽量告诉每个人我在做深度学习,

[1040.958-1045.845] SPEAKER_00: 请过来看看。但没人知道我在说啥, 也没人感兴趣。所以就像从零开始,很难。

[1045.925-1056.106] SPEAKER_00: 然后监管框架、教育体系,全都只是 用非常不同的方式看待医疗。所以现在,只有少数人 既是深度学习实践者又是医生。我们开始看到

[1056.186-1061.677] SPEAKER_00: 第一批人从博士项目出来。所以波士顿剑桥的Zach Kahane有很多

[1061.757-1065.808] SPEAKER_00: 学生现在是数据科学专家、深度学习专家还有真正的医生。

[1065.888-1077.454] SPEAKER_00: 好多医生现在完成了我们的fast.ai课程,还在发表论文并创建 美国放射学会的期刊阅读小组。就像,这才刚刚开始, 但这会是个漫长的过程。监管者得学会怎么监管。

[1077.534-1081.527] SPEAKER_00: 他们得先定指南,然后医院律师们 得换个理解法,有时数据被

[1081.607-1084.579] SPEAKER_00: 大量看原始数据,才能改变世界

[1084.879-1090.242] SPEAKER_02: 对,数据监管听着最难,但这也 让人想到自动驾驶,监管挑战相同

[1090.542-1095.290] SPEAKER_00: 数据挑战。问题不在监管,而在 医院律师怎么解释。HIPAA初衷是

[1095.370-1103.555] SPEAKER_00: P不是隐私,是可移植性。它 为了数据能用,设计留了很多灰色区 因为这样更实用,能帮大家用这法规

[1103.635-1111.297] SPEAKER_00: 更周到共享数据。可惜起了反作用 律师看灰色区就说:不确定就不被起诉 那就不能做。问题不在HIPAA,更多是

[1111.377-1116.462] SPEAKER_00: 医院律师没动力做大胆决定 比如数据可移植性,甚至接受能救

[1116.762-1120.105] SPEAKER_02: 生命。对。 他们更怕接受那个会惹麻烦

[1120.405-1127.986] SPEAKER_00: 对,救人方式很抽象,比如我们发布了 十万条匿名数据。我说不出具体谁 被救了。只能说,论文发现了这个结果

[1128.066-1132.895] SPEAKER_00: 多诊断了一千个人,但这就像 哪些人得到了帮助?太抽象了

[1133.195-1137.397] SPEAKER_02: 对,也能指出一个因……逝去的生命 因为某些事而……

[1137.697-1140.065] SPEAKER_00: 对,或者隐私被侵犯。比如这个人

[1140.365-1149.525] SPEAKER_02: 去标识后又标识了 话题真有趣,我们跳了。但关于快速AI 隐私和数据…… 数据是深度学习创新的燃料。你怎么看隐私?无论

[1149.605-1157.511] SPEAKER_02: 我们在谈Twitter、Facebook、YouTube,还是医疗技术 它们依赖用户数据发挥作用。怎么做好?既尊重

[1157.591-1164.812] SPEAKER_02: 隐私,又创造出从数据学习的技术? 嗯,我学到一点:数据是深度学习创新的燃料

[1165.112-1173.947] SPEAKER_00: 我关注用更少数据做更多事。所以大多数供应商 不幸,他们被激励去找更多数据和计算的方法 谷歌和IBM就是最明显的例子

[1174.247-1175.779] SPEAKER_02: IBM?抱歉

[1176.079-1185.158] SPEAKER_00: 对,Watson。所以谷歌和IBM都大力推行这个观点,即 你必须…… 是的 他们的数据、算力和人才都是最多的。 所以你得信任他们,别人做不到。

[1185.238-1190.265] SPEAKER_00: 谷歌很坦诚。杰夫·迪恩公开说过, 我们的目标是千倍算力,但更少人力。

[1190.345-1196.312] SPEAKER_00: 我们要更好利用现有的人才、数据和算力。 更好利用它们。我们发现的一点是,你

[1196.392-1205.830] SPEAKER_00: 往往根本不需要大量数据。你已有的数据 就能得到最先进的结果。所以我的观点是, 隐私方面,很多人找方法共享和聚合数据。

[1205.910-1212.875] SPEAKER_00: 但我觉得通常没必要。他们以为需要更多数据,因为 他们不懂迁移学习的基础,这是关键技术。 用于减少数量级的数据需求。

[1213.175-1224.241] SPEAKER_02: 你觉得,想从每个人那收集数据的原因可能是 比如推荐系统里,你和杰里米·霍华德的个人数据 对提供影响你的产品最有用。比如为你投广告、

[1224.321-1236.026] SPEAKER_02: 推荐电影、医疗诊断。你觉得我们能用少量数据建出 通用模型,对大多人有巨大影响,我们不需要 从每个人收集数据?总的来说,我会说是的。我的意思是,有

[1236.326-1248.310] SPEAKER_00: 像推荐系统,有冷启动问题,比如杰里米是新客户。我们 以前没见过他。所以我们进来就说,我得知道发生了什么。然后, 不能光根据他以前买了啥就推荐。

[1248.390-1257.074] SPEAKER_00: 办法挺多,很多音乐软件会先问: 你喜欢哪些歌手、专辑、歌? 你爱看啥?Netflix以前这么干,现在不干了。大家不喜欢,觉得

[1257.154-1260.288] SPEAKER_00: 不想打扰用户。所以能靠数据共享来绕过, 你从哪儿弄我的

[1260.368-1264.071] SPEAKER_00: 从Axiom这类机构拿营销记录,再试着管。对我来说,

[1264.151-1265.996] SPEAKER_00: 对我和社会的好处是

[1266.076-1268.804] SPEAKER_00: 回答问题省五分钟,但相比

[1268.884-1272.587] SPEAKER_00: 隐私问题的坏处,不划算。所以我觉得很多时候,

[1272.667-1275.279] SPEAKER_00: 他们打着便利的旗号侵犯隐私,

[1275.359-1279.643] SPEAKER_00: 其实只为多赚钱,把坏处 甩给别人买单。所以你真看到

[1279.723-1287.281] SPEAKER_00: 法规出来,逼着这些制造 坏处的公司自己掏钱,他们就说不干了。所以 成本其实太高。但像医疗,医院有我的影像、

[1287.361-1294.141] SPEAKER_00: 病理、病历,我也拥有这些数据。所以我帮一家初创公司 DocAI。它有个应用,能连Sata Health、LabCorp

[1294.221-1302.046] SPEAKER_00: 和Walgreens, 把你的医疗数据下到手机,再按你的意愿上传共享。 这样就能和想分享的人共享医疗信息。

[1302.346-1307.570] SPEAKER_02: 对,就是控制跟谁分享。 这就回到Fast AI的起源故事了。

[1307.650-1311.713] SPEAKER_02: 创办Fast AI前,我花一年找深度学习最大机遇。

[1312.013-1314.961] SPEAKER_00: Kaggle经历让我知道深度学习到了临界点。

[1315.041-1321.960] SPEAKER_00: 它迅速成为各领域最先进的方法。 我研究神经网络超20年,知道一旦到临界点, 它就会在每个领域都这样。

[1322.040-1330.225] SPEAKER_00: 我花了一年研究哪些领域能最快出成果。 我选了医学,但可选的其实很多。 我有点挫败:虽然打开了医学深度学习大门,

[1330.305-1334.914] SPEAKER_00: 它已很庞大,但我不能做所有事。 花很久才弄清医疗从业者解决什么问题。

[1334.994-1340.055] SPEAKER_00: 他们有什么数据?谁有数据? 所以我想最大化深度学习的影响,得换方式。

[1340.135-1347.936] SPEAKER_00: 与其选个领域埋头苦干, 不如让领域专家和数据持有者自己去做。 所以Fast.ai初衷就是让深度学习惠及需要的人。

[1348.016-1357.199] SPEAKER_00: 数据让他们自己做。Fast.ai就是为了弄清楚, 如何让深度学习惠及更多人。 帮它们更快、更简单、更有效地做到这一点。

[1357.499-1360.029] SPEAKER_02: 明白了。就是赋能领域专家。

[1360.329-1367.271] SPEAKER_00: 对。因为我和这个领域大多数人不同, 我背景很偏应用和工业界。第一份工作在麦肯锡。我花了10

[1367.351-1375.675] SPEAKER_00: 年做管理咨询。和领域专家待了很久。所以我有点尊重 并欣赏他们。我知道那里是社会创造价值的地方。

[1375.755-1378.924] SPEAKER_00: 我也知道他们大多不会编程,也没时间投入

[1379.004-1385.865] SPEAKER_00: 三年读研究生。所以问题是怎么提升这些领域专家的技能? 那会非常强大,可能是我最大的社会影响。

[1385.945-1387.651] SPEAKER_00: 对,那就是我的想法。

[1387.951-1393.221] SPEAKER_02: Fast.ai很多学生、研究人员,还有你教的内容都是

[1393.301-1400.580] SPEAKER_02: 以务实和实践为导向,找快速解决实际问题的方法。 对。 那深度学习理论和实践有啥区别?

[1400.880-1408.380] SPEAKER_00: 嗯,大部分深度学习研究完全是浪费时间。 对。这正是我想说的。 是的。这是整个科学界的问题。科学家要发论文,

[1408.460-1418.714] SPEAKER_00: 意味着他们得研究同行非常熟悉、能识别的工作。 所以他们都必须研究一样的东西。而他们研究的, 没有任何东西鼓励他们研究实际有用的。所以你会得到

[1418.794-1426.630] SPEAKER_00: 大量研究只是对已有成果做小修小补。 没什么实际影响。真正有影响的,比如 我提过迁移学习,如果能做得更好,

[1426.710-1429.206] SPEAKER_00: 那就是改变世界,更多人能

[1429.286-1438.748] SPEAKER_00: 用很少资源数据做出世界级工作。但几乎没人研究这个。 再比如主动学习,它研究怎么让 在循环中的人发挥更大作用?

[1439.048-1440.835] SPEAKER_02: 这是我最喜欢的话题。

[1441.135-1445.825] SPEAKER_00: 是的,主动学习很好,但几乎没人研究。 因为现在不流行。 你知道吗?有人说,

[1446.125-1450.037] SPEAKER_02: 抱歉打断一下,他说没人发表主动学习文章。

[1450.117-1453.065] SPEAKER_02: 但公司内部,真正需要解决问题的人,

[1453.145-1455.954] SPEAKER_02: 他们都会在主动学习上创新。

[1456.254-1471.639] SPEAKER_00: 是的,每个人工作中都会重新发明主动学习, 因为他们开始标数据,然后想,天哪,这花很多时间还非常 昂贵。然后他们想,为什么标所有东西?机器只 只在这两种上犯错。对。 那些难的类别。也许我标这两类。然后你

[1471.719-1479.637] SPEAKER_00: 开始想,我为什么手动做?为什么不让系统告诉我哪些 最难的时候?其实很简单,就像迁移。 学习这块,研究不足,学术界不关心结果。

[1479.717-1494.742] SPEAKER_00: 我只写过一篇论文,特讨厌写。 甚至不是我写的,是我同事塞巴斯蒂安·鲁德。 是他写的,我同事塞巴斯蒂安·鲁德。 他写的,我做的研究。这是首次把迁移 学习成功引入自然语言处理。算法叫ULM fit。

[1494.822-1504.202] SPEAKER_00: 为课程写的,fast AI。想教人们自然语言处理。 我只想教实用的东西。唯一实用的就是 迁移学习,我在自然语言处理中找不到例子,所以做了。

[1504.282-1513.964] SPEAKER_00: 我震惊发现,一做出来,原型只用几天, 在我不了解的领域,打破了最牛数据集的纪录。 我当时觉得太荒谬,就告诉了塞巴斯蒂安。

[1514.044-1520.870] SPEAKER_00: 他好心写出结果,最终登上ACL。 这可是计算语言学的顶级会议。 所以等你做到了,大家真的会在意,但我觉得

[1520.950-1531.866] SPEAKER_00: 对初级研究者可能很难,或者像我一样不在乎引用或论文。 生活中没什么让那变得重要,所以我从没真正 自己写论文挺费心,可那些在意的人,也只能这么选。

[1531.946-1535.696] SPEAKER_00: 那种稳妥的做法,比如在某事上小改一下。 大家其实都在做了。

[1535.996-1539.467] SPEAKER_02: 嗯。 没人靠选安稳的路做出成绩。

[1539.767-1549.310] SPEAKER_00: 嗯,现在好处是,大家都在搞NLP迁移学习, 因为后来有了GPT、GPT-2和BERT, 所以呢。 一旦证明可行,大家都会跟上。

[1549.610-1559.095] SPEAKER_02: 希望更多人参与,带来更多创新和主动学习, 同样方式。 我觉得是迁移学习和主动学习。 这挺有意思的。 公开的开放工作。

[1559.395-1571.100] SPEAKER_00: 我帮忙创办了一家叫Platform AI的公司,专注主动学习。 嗯,试着看看研究并好好利用,挺有意思, 充分利用它。 基本上没有。 所以我们只能自己做完所有研究。

[1571.400-1577.042] SPEAKER_02: 就像你说的,能讲讲斯坦福竞赛的故事吗? Dawn Bench和FastAI那次成就的故事?

[1577.342-1585.341] SPEAKER_00: 当然。 所以啊。 我每年教两门课,一门实用深度学习。 这是入门课,然后是前沿课程。 面向程序员的深度学习研究课程。

[1585.421-1596.322] SPEAKER_00: 教课同时,在旧金山大学有个大办公室。 就在旧金山大学。 能容纳30人,我邀请所有想来的学生。 一起待着。 我负责设计课程。 所以经常满员。

[1596.402-1606.479] SPEAKER_00: 二十多人一起,只学深度学习。 有次团队说,有个 Dawn Bench看起来很有趣。 我当时想,那是什么? 他们搞竞赛,看多快能训好模型。

[1606.559-1618.090] SPEAKER_00: 跟我们在做的无关,但像是 你会感兴趣的东西。 一查,只剩10天就结束了。 东西不错,可惜太晚。 我们忙着教课,但想,要是做成... 课程里的一个有趣案例。

[1618.170-1628.668] SPEAKER_00: 这些其实我们已经在做了。 不如把我们最好的做法和想法合起来。 于是我和四个学生决定试试。 我们专注一个小数据集CIFAR 10,全是32x32的小图。 对。

[1628.748-1633.241] SPEAKER_00: 所以这是个比谁训练模型更快的比赛。 主办方是斯坦福大学。

[1633.541-1635.595] SPEAKER_02: 同时还要尽量省钱。

[1635.895-1649.411] SPEAKER_00: 这又是一个追求低成本的类别。 有几类:ImageNet和CIFAR 10。 ImageNet有130万张图,训练要几天。 我朋友皮特·沃登,现在在谷歌,他几年前怎么训练ImageNet的?他在后院一个小房间里,

[1649.491-1659.765] SPEAKER_00: 改成了ImageNet训练中心。 花了大概一年,他搞出了10天就能训练完的方法。 那真是个浩大工程。 而CIFAR 10几小时就能搞定,小得多也容易。

[1659.845-1668.111] SPEAKER_00: 所以我们决定试CIFAR 10。 对。 嗯。 我从来没做过。 对。 对。 对。 以前没做过。 我从没一次用多个GPU。

[1668.191-1672.776] SPEAKER_00: 我尽量避免,这违背了可访问性理念。 她最好用单个GPU。

[1673.076-1676.419] SPEAKER_02: 做完事后,你有没有想过怎么更快? 怎么才能快很多?

[1676.719-1685.554] SPEAKER_00: 哦,总是。 但我总想怎么让单个GPU更快,这个GPU是 普通人买得起的。 不,我怎么才能更快? 对。 我不是说有大数据中心,关键在于

[1685.634-1692.994] SPEAKER_00: 让更多人能用好,不用管基础设施。 总之,我们可以租AWS机器用八块GPU。 机器。 所以我们想试试。

[1693.074-1700.910] SPEAKER_00: 我们就用现有的方法,成功提速了。 几天内,就把速度降到了…… 很短,就几分钟。 记不清具体数字,大概10分钟吧。 差不多。

[1700.990-1710.951] SPEAKER_00: 我们就轻松登顶,不管时间还是 金钱上也是,我很震惊,因为其他队像谷歌 和英特尔,他们比我们懂多了。 我们受鼓舞,就想也试试ImageNet。

[1711.031-1720.330] SPEAKER_00: 嗯,它看起来好多了。 虽然远超能力,但目标定在12小时内。 我们做到了,超兴奋,但没上传排行榜。 不过已经降到大约10小时。

[1720.410-1729.166] SPEAKER_00: 但后来谷歌做到5小时左右,我们心想,哦 完蛋了。 但还想继续努力,如果谷歌能在5小时内完成…… 就是说谷歌是用TPU集群之类的做到的。 嗯。

[1729.246-1736.908] SPEAKER_00: 所以需要很多硬件,但我们还有不少想法。 比如一个简单问题,为什么用这么大的图? 大概是224或256乘256像素。

[1737.208-1738.554] SPEAKER_01: 不如试试更小的?

[1738.854-1741.640] SPEAKER_02: 训练模型得有精度要求,对吧? 对吧?

[1741.940-1745.829] SPEAKER_00: 是的。 得达到93%,我记得是ImageNet的93%。 没错。

[1746.129-1747.974] SPEAKER_02: 这很难。 所以你得…

[1748.274-1761.291] SPEAKER_00: 93%,他们选了个不错的阈值。 比当时主流的ResNet-50稍高一点。 很难,但只用64乘64图像就能练出好模型。 同一个模型,只练几个周期就能学224乘224。

[1761.371-1774.179] SPEAKER_00: 它基本练好了,这很合理。 就像教人认狗,先看低分辨率,再看清晰的。 到224乘224。 它基本练好了,这很合理。 比如教别人认狗,看低分辨率图片。

[1774.259-1780.122] SPEAKER_00: 然后说这是清晰的狗照片,他们就知道了。 狗的样子。 我们抢先一步,赢了那场比赛的几项奖。

[1780.202-1788.201] SPEAKER_00: 最后我们在多台机器上做了个分布式版本。 几个月后,我们终于登顶排行榜。 我们有十八分钟。 ImageNet。 是的。 从那以后,人们就不断突破。

[1788.501-1792.564] SPEAKER_02: 您怎么看多GPU或多机训练加速代码? 加速代码?

[1792.864-1794.779] SPEAKER_00: 我觉得这基本是浪费时间。

[1795.079-1797.644] SPEAKER_02: 不管是单机多GPU还是...

[1797.944-1800.231] SPEAKER_00: 对,特别是多机,太笨重了。

[1800.531-1801.343] SPEAKER_02: 是的。

[1801.643-1809.862] SPEAKER_00: 多GPU现在没那么笨重了。 但任何减慢迭代速度的事都是浪费时间。 所以需要的话,用多GPU做最后的模型优化。

[1809.942-1821.310] SPEAKER_00: 但在ImageNet上做事常是浪费时间。 为什么要在130万张图上测试? 我们大部分人不会用130万张图。 而且我们做过研究,在小图像子集上做事。

[1821.390-1830.945] SPEAKER_00: 反正答案都一样。 那干嘛还浪费时间? 我最近发布了一些新数据集。 一个叫ImageNet。 法国ImageNet是ImageNet小子集,设计容易。 分类。

[1831.245-1833.810] SPEAKER_02: 什么?ImageNet怎么拼?

[1834.110-1846.187] SPEAKER_00: 末尾多了T和E,因为它很法国。 还有个ImageWoof,是ImageNet的子集,只包含 狗的种类。 但那个很难,对吧? 那是难题。 我发现如果你只看这两个子集,可以训练模型

[1846.267-1854.452] SPEAKER_00: 单个GPU十分钟搞定,结果几乎直接迁移到ImageNet。 总是这样。 现在我看到一些研究员开始用这些更小的数据集。

[1854.752-1862.716] SPEAKER_02: 哦,天哪。 我很喜欢你这种思考方式,好像你写过博客说 用大数据集等于鼓励大家不创造性思考。 绝对是。

[1862.796-1870.539] SPEAKER_02: 所以说,这也限制了你用大资源训练。 有了这些资源,就觉得更多更好。 然后不知不觉就扼杀了创造力。

[1870.839-1880.234] SPEAKER_00: 是的。 更糟的是,Lex。 我总听人说,决定不搞深度学习,因为我不…… 相信只有谷歌才能用它做有用的事。 所以我看到很多人决定不学这个非常有价值的……

[1880.314-1889.195] SPEAKER_00: 工具,因为他们信了谷歌那套,觉得只有谷歌才够大。 而且够聪明来做这事。 我觉得这太让人失望,而且大错特错。

[1889.495-1903.034] SPEAKER_02: 而且未来10年、20年、30年,所有AI重大突破都会…… 是这种情况。 对。 我觉得未来20年所有AI重大突破都能在…… 单个GPU上完成。 比如我会说,我感觉所有那些重大的,嗯,这么说吧……

[1903.334-1912.238] SPEAKER_00: 嗯。 过去20年的大突破,没有一个需要多个GPU。 像批归一化、ReLU、dropout,每个都证明了自身价值。

[1912.538-1917.031] SPEAKER_02: 都不需要多个GPU和GAN,原始GAN就不需要。 多个GPU也不需要。

[1917.331-1930.859] SPEAKER_00: 我们最近还证明,连多个GPU都不需要。 是的。 甚至连GAN都不需要。 所以我们开发了,不用GAN也能有GAN的效果。 而且我们用迁移学习,几个小时内就能搞定。 在单个GPU上,几小时就能完成。

[1931.159-1933.945] SPEAKER_02: 所以你只用生成模型,没有对抗部分?

[1934.245-1946.856] SPEAKER_00: 是的。 我们发现一些损失函数,不用对抗部分也表现很好。 然后学生Jason Antich创建了de-oldify系统, 给老旧黑白电影上色。 嗯哼。 单个GPU几小时就能给整部电影上色。

[1946.936-1956.421] SPEAKER_00: Jason和我一起,想出了在最后加入一点GAN, 结果发现上色时画面更亮更好看。 更亮一点,更好看。 Jason做了很多实验来精确确定加多少,

[1956.501-1964.941] SPEAKER_00: 全都在他家客厅的单GPU上完成。 对。 就像给好莱坞电影上色一样。 听起来只有大制片厂能做,但他这方面世界第一。 这点上。

[1965.241-1978.095] SPEAKER_02: 麦克风有问题。 我们就这样对着麦克风讲。 对。 用这些麦收好声音真麻烦。 我想试试放一堆便宜传感器,从多个源重建高质量音频,因为我还没看到有人研究。 好。 可以保存然后扩展。

[1978.175-1989.854] SPEAKER_02: 贵麦克风自动组合多路音频,提升合成效果。 嗯。 还没人做到。 感觉是个学习问题。 对。 所以希望有人能解决。 这明显可行,而且早就该做。

[1990.154-2003.426] SPEAKER_00: 所以希望有人能做到。 嗯,这显然可行,而且早该实现了。 四年前我也这么看计算摄影,没记错的话。 为啥要花大钱买大镜头?三个便宜镜头再加点 有意识的移动。 比如连续拍几张照片。

[2003.506-2014.758] SPEAKER_00: 这能提供足够信息,获得极好亚像素分辨率,尤其加上 深度学习,你就知道该看什么了。 嗯,音频也能做到同样的事。 居然还没人做,太疯狂了!

[2015.058-2017.867] SPEAKER_02: 那家摄影公司有进展吗?

[2018.167-2030.580] SPEAKER_00: 对。 现在计算摄影基本成标准了。 谷歌Pixel的夜拍功能,你试过吗? 超级惊艳。 在几乎全黑环境下拍照,就能得到 一张高质量照片,不是靠镜头,是用同样方法

[2030.660-2033.074] SPEAKER_00: 比如加虚化,背景模糊是算出来的。

[2033.374-2035.904] SPEAKER_02: 就靠照片里的算法。

[2036.204-2042.287] SPEAKER_00: 对,现在大家用手机做各种花哨功能 都靠计算摄影。 而且手机背后越来越多镜头。 音频肯定也一样。

[2042.587-2057.752] SPEAKER_02: 而且音频也有应用。 看看Alexa这类设备,我见过多数人,尤其我在谷歌工作时。 在谷歌工作过。 去噪时,你不会想到多个音源。 你没像我那样试多种音源,但单个也能做,因为研究还少。

[2058.052-2068.921] SPEAKER_00: 所以我们很快发布音频库,鼓励开发,因为方法被低估。 是的。 超分辨率和Jason的deodify方法生成高质量图像。 同样方法也适用于音频。 还没人做过,但只需几个月。

[2069.001-2072.135] SPEAKER_00: 好的。 嗯,Dawn Bench的学习率。

[2072.435-2079.656] SPEAKER_02: 嗯,你在学习率上做了有趣调整。 这挺有意思。 是的。 这些工作都来自Leslie Smith。

[2079.956-2093.205] SPEAKER_00: 嗯,莱斯利和我们一样关注实用性。 都是莱斯利·史密斯这家伙的工作。 呃,莱斯利和我们一样,很注重实用性。 你可能觉得,快速准确训练神经网络挺实用。 是每个人都该关心的,但几乎没人在乎。

[2093.285-2104.735] SPEAKER_00: 他发现了个很有趣的东西,叫超收敛。 也就是说,某些网络在特定高参数设置下能—— 学习率提高10倍,训练速度就快10倍。 现在呢,没人发表那篇论文。

[2104.815-2111.003] SPEAKER_00: 好吧。 因为学术界并不怎么研究这个。 没有学者意识到这很重要。 而且,深度学习在学术界不算实验科学。

[2111.083-2122.010] SPEAKER_00: 所以不像物理学,比如你说,我刚看到个亚原子粒子干了啥, 理论解释不了,你也能直接发表。 然后接下来六十年,人们慢慢琢磨怎么解释。 但深度学习领域不允许这样。

[2122.090-2132.425] SPEAKER_00: 所以Leslie根本没法发表论文说,我刚看到 发生了不可思议的事。 这玩意儿训练速度比正常快了10倍。 我不知道为什么。 审稿人就说,不能发表,因为不知道 为什么。

[2132.725-2137.496] SPEAKER_02: 总之呢, 这点值得琢磨,因为很多发现都这样开始。 就像那样。

[2137.796-2146.352] SPEAKER_00: 我所知的每个其他科学领域都这样运作。 不知道我们领域为什么偏偏不感兴趣。 好吧。 发表没解释的结果,但就是这样。 所以没被发表。

[2146.432-2155.615] SPEAKER_00: 话虽如此,呃,我读未发表论文比已发表还多。 因为那才是找到有趣见解的地方。 所以我读了这篇论文,觉得颠覆认知、 又怪异又棒。

[2155.695-2166.947] SPEAKER_00: 而且,为什么没人讨论这个? 因为如果你能把这些训练快10倍,就能 快10倍完成。 它们泛化更好,因为轮数更少,意味着你 看数据更少,但准确率更高。 所以后来我一直在研究这个。

[2167.027-2178.535] SPEAKER_00: 呃,后来Leslie搞清楚了怎么实现。 我们做了点调整,大诀窍是从很低的学习率开始。 慢慢提高这个比率。 训练模型时,一开始步子很小,然后 慢慢把步子加大。

[2178.615-2188.471] SPEAKER_00: 最终步子大到超乎想象。 有几个技巧能让它奏效,基本可靠得到 超收敛。 Dawn Bench挑战赛,我们用的学习率比预期高很多 才有效。

[2188.771-2195.411] SPEAKER_02: 未来学习率这个关键超参数,意义重大。 也就是你调整的学习率。 学习率魔法的未来会怎样?

[2195.711-2206.952] SPEAKER_00: 嗯,就这样。 过去一年,这个领域有很多出色成果。 大家越来越意识到优化,比如我们真不知道 优化器怎么工作,权重衰减(正则化方法)和 优化器和学习率的组合。

[2207.032-2219.167] SPEAKER_00: 还有比如Adam里的epsilon,它们奇怪地协同工作 在模型不同部分奇怪地协同。 我们做了很多工作研究模型的不同部分 模型的。 训练方法要不一样,节奏也得不同。 嗯哼。

[2219.247-2231.985] SPEAKER_00: 嗯,所以我们用了判别性学习率,这很重要。 特别是做迁移学习时。 嗯,过去一年大家意识到了,这些都关键。 很多好成果冒出来,我们也看到了一些新算法。 这些算法几乎不需要你调任何旋钮。

[2232.065-2243.840] SPEAKER_00: 所以呢,我觉得学习率这个概念快消失了。 嗯哼。 研究已经非常多。 取而代之,我们懂怎么解读梯度变化,知道怎么调每个参数。 那深度学习未来还需要人类专家吗? 是的。

[2243.920-2249.411] SPEAKER_00: 嗯,希望从深度学习看,人类专家几乎完全不用介入。

[2249.711-2253.077] SPEAKER_02: 嗯,再说一遍,就像。 需要人类专家吗?

[2253.377-2268.019] SPEAKER_00: 嗯。 嗯,希望人类专家几乎完全不需要从。 深度学习角度来看。 嗯,再说一遍。 是的。 要这样,就得用几千倍算力跑一堆模型。 同时希望有一个好的。 很多机器学习之类的东西。

[2268.099-2277.737] SPEAKER_00: 是的,很多机器学习这些,太疯狂了。当你更懂机制 模型怎么学的,就不用试一千个不同的模型来找哪个 恰好最好的那个,直接跳过去,这意味着

[2277.817-2286.512] SPEAKER_00: 计算上更便宜、更容易,而且超参数也更少 这样就不用深度学习专家来训练模型了 这样领域专家就能干更多活,现在你可以把人类

[2286.592-2289.866] SPEAKER_00: 时间花在解释、收数据、找模型错误这些上

[2290.166-2300.162] SPEAKER_02: 这类事。对,数据方面。你现在多久处理一次数据,包括 清洗、看数据?就像达尔文观察 不同物种在旅行中。你看数据吗?你的根在Kaggle吗?

[2300.462-2313.223] SPEAKER_00: 总是这样。对。这是我的课程关键。就像训练模型之前 课程中我们学看数据。然后训练后第一件事 第一个模型,微调一个ImageNet模型五分钟。然后 之后立即做的就是学习如何通过查看

[2313.303-2322.767] SPEAKER_00: 错误分类的图片示例, 再看分类矩阵,然后在谷歌上研究各种 对我来说,机器学习最酷的是它怎么处理误分类。 模型解释时会告诉你哪些特征最重要。

[2322.847-2333.937] SPEAKER_00: 哪些群体被误分类,这能帮你更快成为专家。 因为你可以聚焦模型指出的关键部分。 嗯哼。 它能帮你发现数据泄露问题,比如模型说主要特征是客户ID。

[2334.017-2341.284] SPEAKER_00: 你会想,客户ID不该有预测性吧。 然后问管客户ID的人,他们告诉你,客户申请通过后。 会在ID末尾加个1。

[2341.364-2346.634] SPEAKER_00: 所以从模型视角看数据非常重要。 就像用模型调试数据,了解数据更多信息。

[2346.934-2348.129] SPEAKER_02: 没错。

[2348.429-2349.357] SPEAKER_00: 确实。

[2349.657-2361.327] SPEAKER_02: 训练网络有哪些云选项?最后一个问题关于DawnBench。 这是你很多工作的一部分,但从性能角度,你博客写过。 有AWS、谷歌TPU。你觉得未来怎样?

[2361.407-2372.520] SPEAKER_02: 现在云端训练有什么推荐? 好,从高速公路角度,我不确定能给出合适答案。 但问题很好。有AWS、谷歌TPU。你觉得未来怎样?现在有什么推荐? 好。

[2372.820-2379.042] SPEAKER_00: 硬件上,谷歌TPU和英伟达最强GPU 差不多,TPU快30%左右,但更难编程。

[2379.122-2391.117] SPEAKER_00: 硬件上还没有明确的领先者,但更重要的是, 英伟达GPU编程更容易,支持的程序更多。 所以我觉得它才是领先者,我愿意花时间。 但平台方面,

[2391.197-2399.637] SPEAKER_00: 现在我们很幸运,有谷歌GCP、谷歌云和AWS。 可以快速方便地使用GPU。但AWS还是太难了,比如

[2399.717-2408.575] SPEAKER_00: 得找个AMI,启动实例,再装软件。 等等。GCP是目前服务器入门最佳方式。 他们有fast AI和PyTorch即用实例。

[2408.655-2418.395] SPEAKER_00: 课程都预装了,Jupyter Notebook也预运行。 这是个出色的交互式计算系统,人人都该用它。 做任何数据研究。但更好的还有, 呃,

[2418.475-2423.699] SPEAKER_00: 比如我们有的Salamander和Paperspace,只需点击 按钮,立刻弹出Jupyter Notebook,无需

[2423.779-2427.470] SPEAKER_00: 安装或设置。所有课程笔记本已预装。

[2427.550-2435.293] SPEAKER_00: 这是我们花了很多时间整理的一环。 因为刚开始课程时,最大的问题是学员退出。 之前他们搞不定AWS实例,现在好多了。

[2435.373-2440.121] SPEAKER_00: 去course.fast.ai,首先看到的是 教你用GPU。点链接,再点

[2440.421-2444.763] SPEAKER_02: 点开始就能跑。转到GCP。我没用过Google GCP。

[2445.063-2451.251] SPEAKER_00: 对,GCP提供300美元免费资源,这 真不错。但我说过,Salamander和Paperspace更简单。

[2451.551-2462.731] SPEAKER_02: 好,那从深度学习框架看,你用fast.ai, 如果你用这个框架,呃,PyTorch和TensorFlow,各自有啥优势? 平台呢?你怎么看?就我们做的

[2463.031-2466.235] SPEAKER_00: 研究和教学方面,我们最早用Theano,

[2466.315-2474.372] SPEAKER_00: 和Keras,然后转TensorFlow和Keras,再转PyTorch, 然后转PyTorch和fast.ai。这反映了

[2474.452-2477.342] SPEAKER_00: 深度学习库生态的发展。

[2477.422-2490.114] SPEAKER_00: Theano和TensorFlow很好,但教学和研究开发难得多 对深度学习。第二点,呃,这个挺重要,那就是 任何计算机都该做并深入探索,然后竞争 太激烈了,但这是鼓励人的好方式,你知道。

[2490.194-2504.302] SPEAKER_00: 我们在深度学习和学习开发上做了很多研究,呃, 还搞了不同类型的系统,你知道, 这能时不时做很多事。很自然。 这很正常,因为它们定义了计算图。 事先定义静态图,必须说清楚所有操作。 嗯哼。

[2504.382-2513.681] SPEAKER_00: 直接用普通Python,你会的都能用。 必要时让它跑在GPU上,成了研究和教学的飞跃。 我们能拿它做什么,以及我们能 用它教什么。

[2513.981-2515.734] SPEAKER_02: 因为它没限制。

[2516.034-2531.280] SPEAKER_00: 对,像DawnBench比赛能快速试各种方法,很重要。事先全做好没法检查就更难了。 快速试各种方法很关键。事先做好无法检查,对研究者更难。 PyTorch对新手不友好,要自己写训练循环和管理

[2531.360-2539.359] SPEAKER_00: 梯度之类的。对研究者也不好,因为 时间花在样板代码上,而不是思考 算法。 所以我们写了多层API,顶层你

[2539.439-2547.635] SPEAKER_00: 三行代码就能训练最先进的神经网络,这API 和别的API交互,还能随时深入 到任何层级,接近机器级控制。

[2547.715-2556.155] SPEAKER_00: 这就是Fast.ai库,对我们、学生和很多人都至关重要。 Fast.ai库,对我们、学生和许多人都至关重要。

[2556.235-2565.116] SPEAKER_00: 用它赢大赛写论文的。已经 影响巨大。但Python限制了我们。特别是 像循环神经网络这类,改不了,除非

[2565.196-2570.420] SPEAKER_00: 慢得不现实。所以新版课程中 还有现在的研究,开始用Swift了 Swift。我觉得还得三年

[2570.500-2578.139] SPEAKER_00: 很实用。我不急,乐意慢慢实现 但还是有了Fast.ai初版库,用于 Swift for TF的视觉库。Py for TF不行

[2578.219-2585.057] SPEAKER_00: 需求。简直是灾难。他们想复制 说喜欢PyTorch的交互式体验 但没改基础运行时。所以加了点

[2585.137-2593.101] SPEAKER_00: 叫TF Eager的语法糖,让它像PyTorch 但每步比PyTorch慢十倍。没投入 时间重造基础,代码库太复杂

[2593.401-2595.467] SPEAKER_02: 是的,我觉得重造很困难

[2595.767-2609.643] SPEAKER_00: 是啊,尤其是TF的编写方式,很难 重造。嗯,尤其是TensorFlow的 编写方式。很多人快又乱地写。所以 我常看代码,总感叹:天哪!什么 他们怎么想的?太糟了。所以我非常悲观。

[2609.723-2620.055] SPEAKER_00: Python在TensorFlow的未来。但Swift for TensorFlow可能不同。 完全不同。它可以是MLIR上的一层,需要大量时间。 来构建。它利用Swift优秀的编译器技术。

[2620.135-2623.141] SPEAKER_00: 它基于LLVM。对,我觉得会很棒。

[2623.441-2629.629] SPEAKER_02: 嗯,你鼓励了我。我还没真正感受TF2.0 Python的痛苦。 对我没问题,不过……

[2629.929-2632.483] SPEAKER_00: 对,但如果你用别人预定义好的,它能用。

[2632.563-2643.618] SPEAKER_00: 用过的。 但如果你真比较,就像我最近必须做的,因为我做了很多。 跟TF有关的事,你比较一下,比如我想从头写。 然后你会发现,它比PyTorch慢十倍。 比PyTorch慢。

[2643.918-2648.329] SPEAKER_02: 那最大成本?不谈运行时间,编程要多久? 编程?

[2648.629-2661.692] SPEAKER_00: 现在差别不大。多亏TF Eager,差别不大。但 很多事需要很长时间才能完成。 是的。 运行时,你不会让它慢十倍。你只会想,哦,太久。 还有不少地方可编程性差,比如tf.data,它

[2661.772-2672.153] SPEAKER_00: TensorFlow数据处理乱成一团,效率太低。 而且他们没办法,只能那么写,因为TPU的问题。 所以我觉得他们背着很重的技术债,根本不会 不重写就解决不了。

[2672.453-2677.282] SPEAKER_02: 这里有个有趣的问题:如果新生开始学, 你会推荐他们用什么?

[2677.582-2690.390] SPEAKER_00: 嗯,我们肯定推荐FastAI和PyTorch,因为我们教新手。 而且这就是教学工具,所以强烈推荐,因为它能 让你更快掌握概念,这样就能成为真正的—— 还能学到真正前沿技术,这样实际上

[2690.470-2702.291] SPEAKER_00: 获得世界级的—— 世界级的结果。说实话,学什么库不重要,因为 从Chainer换到MXNet再到TensorFlow再到PyTorch,只需几天 的工作量,只要你理解基础就行。

[2702.591-2706.097] SPEAKER_02: 但你觉得,Swift会慢慢成为人们常用的吗?

[2706.397-2713.943] SPEAKER_00: 几年内不可能,尤其是因为Swift没有 数据科学社区、库和工具。 Swift社区完全缺乏对数值计算的认识和理解。

[2714.023-2722.126] SPEAKER_00: 所以他们一直做蠢决定,多年来只是 在性能和优先级上犯蠢。现在明显在改,因为开发者, 克里斯…… 克里斯……

[2722.206-2734.236] SPEAKER_00: 克里斯·拉特纳是Swift开发者,在谷歌做Swift与TF。 所以这算优先。看苹果怎么行动,很有意思,因为就像 苹果根本不在乎Swift数值编程。所以,希望

[2734.316-2743.975] SPEAKER_00: 他们得行动起来重视,因为目前底层 库都不是Swift写的,不够Swifty。 一点也不。像core ML这样的,其实很糟。所以,还有很长的

[2744.055-2754.387] SPEAKER_00: 路还长。但至少有个好处:Swift for TensorFlow能直接 用Python代码和Python库。其实整个第一课的笔记本 fast AI现在在Swift里用Python模式跑。所以这算不错的过渡

[2754.687-2762.488] SPEAKER_02: 方式。 要多久?比如那两个fast AI库,需要 多久? 两个fast AI课程。从零开始到完成 这两个课程要多久?

[2762.788-2765.318] SPEAKER_00: 因人而异。一般两月到两年。

[2765.618-2768.253] SPEAKER_02: 如果两个月,每天几小时?

[2768.553-2772.686] SPEAKER_00: 所以一个很牛的程序员,每门课花70小时。 70?就这些?好的。

[2772.766-2778.988] SPEAKER_00: 对,很多人休学一年专注学AI,年底就熟练了。 比如参加Kaggle比赛,读Goodfellow的书。

[2779.068-2786.486] SPEAKER_00: 哦对,他们做很多事。 比如读Goodfellow的书。 嗯。 对。 尤其专家编程一般,所以得多写代码。 除了入门搭建,常规瓶颈是啥?

[2786.786-2790.756] SPEAKER_02: 编码是瓶颈。编程强学得好,有经验也是。 嗯。

[2791.056-2804.235] SPEAKER_00: 统计出身的人挣扎,直觉相悖,总减参数。 编程强、不懂统计的人处境最好。 你教深度学习课,费曼说理解方法就是 嗯。 经典统计学会遇到困难,直觉是

[2804.315-2813.312] SPEAKER_00: 这与习惯相反,他们总想减少。 减少参数数量,查看系数等。 像那样。编程背景强,却对...一无所知 统计通常处境最好。

[2813.612-2818.581] SPEAKER_02: 你教深度学习课,费曼说理解最佳方式 教学就是教东西嘛。

[2818.661-2821.168] SPEAKER_02: 教深度学习,你学到了啥?

[2821.468-2829.304] SPEAKER_00: 很多,我教这门课的重要原因之一。 让专家熟悉深度学习,这很必要,但 也是我自己真正掌握深度学习必须的。

[2829.384-2833.470] SPEAKER_00: 看到这么多不同背景的专家,真的

[2833.550-2846.880] SPEAKER_00: 不能说是教会了我,而是让我相信了一些我希望是真的事。 那就是谁都能学会。可有人势利地说只有少数人能学编程做AI。 那是我希望是真的。但我也觉得这很重要。 明确是我希望是真的。但同样重要的是要

[2846.960-2857.014] SPEAKER_00: 胡说!我看到各种背景的人都在各自领域取得顶尖成果。 这让我明白,成功和失败的关键区别就是毅力。 好像那基本是唯一重要的事。

[2857.094-2860.019] SPEAKER_00: 很多人放弃。但不放弃的人,几乎都能成功。

[2860.099-2861.910] SPEAKER_00: 几乎每个人都能成功。

[2861.990-2875.077] SPEAKER_00: 即使一开始我会想,哇,他们还没完全搞懂,对吧? 但最终他们都会理解并成功。所以我觉得那一直是 这两件事我过去都希望是真的,但我不觉得我 真有确凿证据证明它们是真的。但现在我可以一次次看到。

[2875.377-2878.430] SPEAKER_02: 那对于想学深度学习的人,你有什么建议?

[2878.730-2886.729] SPEAKER_00: 训练大量模型。 这就是学习方法。我们的课程很好,很多人独立 都说它很好。最近获得CogEx AI课程奖,被评为全球最佳

[2886.809-2900.125] SPEAKER_00: 课程。欢迎参加course.fast.ai。我课上一直强调一点是 训练模型,打印输入,打印输出, 比如研究,稍微改变输入,观察输出变化,只需运行大量

[2900.205-2902.840] SPEAKER_00: 实验,获得直观理解,从而被吸引。

[2903.140-2907.586] SPEAKER_02: 你提到训练,认为只是运行模型推理?比如我们谈论

[2907.886-2922.877] SPEAKER_00: 入门?不,你必须找到模型中的真实值,这才是关键。 因为那样你才有了领域内的模型,所以没有没有没有 运行别人的模型没有意义,因为那不是你的。而且只需五分钟 就能为你关心的数据微调模型。课程第二课,我们

[2922.957-2936.984] SPEAKER_00: 教你写谷歌图片搜索脚本,从零创建自己的数据集,而且 我们展示如何创建在线运行的Web应用。课程中我创建了 区分泰迪熊、灰熊和棕熊的应用,而且准确率达到了 基本上

[2937.064-2949.500] SPEAKER_00: 100%。我花了大约四分钟用脚本从谷歌搜索抓取图片, 笔记本中有一些小的图形化工具,帮你清理数据集, 还有其他工具帮你研究结果,查看错误发生的位置。

[2949.580-2963.781] SPEAKER_00: 现在,在我们的‘分享你的作品’帖子,已经收到超过一千条学生回复,他们表示 我做的东西,有人喜欢,很多都最先进。 就像有人说的,哦,我试着看过。 天城文,我真不敢相信,生成结果比…

[2963.861-2975.949] SPEAKER_00: 第一课后最佳论文还准,还有更有趣的。 比如有人研究特立尼达和多巴哥的蜂鸟,她说这有点像它们的… 国鸟,她有个工具现在能分类那些蜂鸟。

[2976.029-2981.056] SPEAKER_00: 所以对,训练模型,用你的数据微调,然后研究输入输出。

[2981.356-2983.643] SPEAKER_02: fast ai课程要钱吗?

[2983.943-2986.729] SPEAKER_00: 我们做的全部免费,没有收入,这只是…

[2987.029-2994.993] SPEAKER_02: 对社区服务。你真是圣人。好,一旦懂了基础知识… 训练了很多模型。从多年尺度看,你有什么建议给…

[2995.293-3003.094] SPEAKER_00: 那些想成为专家的人?训练很多模型,特别是训练很多… 你领域的模型。那专家呢?对啊,我们不需要更多专家?

[3003.174-3009.942] SPEAKER_00: 比如在大家都在做的领域做渐进研究。我们需要专家… 用深度学习诊断疟疾,或者用深度学习分析…

[3010.022-3013.296] SPEAKER_00: 语言研究媒体偏见。所以我们需要专家在…

[3013.376-3027.043] SPEAKER_00: 分析渔业来识别… 诸如此类。需要识别问题区域,你知道,在海洋中… 你知道,这就是需要的。所以,成为你热爱领域的专家,而这是个工具… 你可以用它做任何事,你会比…

[3027.123-3030.048] SPEAKER_00: 特别是结合热情和专长,跟别人分享。

[3030.348-3035.038] SPEAKER_02: 这真的很有意思,即使你想在迁移学习或主动学习上创新。

[3035.118-3042.142] SPEAKER_02: 你的想法我同意,你还需要找到一个领域。 或者是你在意的数据集,对吧?如果你不是在处理真实问题。

[3042.442-3055.389] SPEAKER_00: 你知道的,怎么知道自己做得好?你怎么知道 结果好不好?怎么知道结果不好?为什么不好? 是数据的问题吗?怎么知道自己在做有用的事?对,唯一 对我来说,真正有趣的研究不止一个,但绝大多数有趣的研究

[3055.469-3059.602] SPEAKER_00: 是尝试解决实际问题,并且解决好它,所以既要理解

[3059.902-3063.686] SPEAKER_02: 深度学习工具要足够,还要成为特定领域的专家。

[3063.986-3072.821] SPEAKER_00: 对任何人来说都可以实现。是的,我会把它比作 研究自动驾驶车,却从没见过车,没坐过,没启动过。 对吧?这就像很多人,他们研究学术数据集

[3072.901-3076.372] SPEAKER_00: 却对这些数据集一无所知。顺便说,我不知道你对

[3076.672-3090.200] SPEAKER_02: 自动驾驶这个话题有多熟悉。 但说实话,你描述的正是很多机器人领域的人 在自动驾驶领域工作:其实他们没考虑过驾驶,没真正 没看过驾驶是什么样,没开过车。所以这是个问题,因为

[3090.500-3093.750] SPEAKER_00: 当你真正开过车,就知道这些都是我开车时经历的。

[3094.050-3100.772] SPEAKER_02: 没有什么比亲身经历的真实例子更宝贵。 你做过很多成功创业,那创业成功需要什么?

[3101.072-3104.485] SPEAKER_00: 就像深度学习高手一样,关键是不放弃,所以

[3104.565-3105.435] SPEAKER_00: 你可以

[3105.515-3111.122] SPEAKER_00: 钱和时间都用光了,但如果你把成本压到很低 提前存点钱,这样你就有缓冲时间

[3111.202-3115.811] SPEAKER_00: 那么坚持下去就很重要 说到这个啊 你在乎的事情很重要,我不是说

[3115.891-3118.700] SPEAKER_00: 我见过深度学习的人最大的问题是

[3118.780-3130.311] SPEAKER_00: 读深度学习博士,然后想商业化 这浪费时间,解决不了实际问题 选博士课题是因为它是个有趣的工程或数学问题 或者是研究练习。但如果你当过招聘官,就知道大部分时候都搞错了

[3130.391-3138.935] SPEAKER_00: 你花时间筛简历,而且大部分时间只是在找 某些东西。你可以试试用模型花几分钟做这事,看看 模型好像能做得跟你一样好,那你就走对了

[3139.015-3146.004] SPEAKER_00: 然后要务实,尽量远离风险 资本资金,越久越好,最好永远不要。那么,关于这个,你是

[3146.304-3149.647] SPEAKER_02: 风险投资。那你能靠自筹资金运营公司吗?

[3149.947-3153.151] SPEAKER_00: 对,我前两家公司就是自筹资金,而且这是对的。

[3153.451-3155.204] SPEAKER_02: 那可怕吗?

[3155.504-3167.511] SPEAKER_00: 不,风投初创公司才吓人,背后那些人整天盯着你。 他们经验丰富,整天让你增长增长。我可不想这样。 他们才不会那样。 他们不在乎你失败,只在乎你增长慢。所以很可怕。

[3167.591-3170.679] SPEAKER_00: 自己做,和朋友搭档就很好。就像我们只是

[3170.759-3173.568] SPEAKER_00: 按合理节奏,我们能建一个

[3173.648-3181.345] SPEAKER_00: 大到不用再工作,但又不至于让风投觉得厉害。 他们不会觉得惊艳,但我们自己很兴奋,你知道吗? 所以我觉得这比大多数人强多了。

[3181.645-3186.567] SPEAKER_02: 一般来讲,不是为了自己,那过程中怎么赚钱? 你会动用储蓄吗?

[3186.867-3193.194] SPEAKER_00: 对,1999年我同时创办了Fastmail和Optimal Decisions。 和两个朋友。Fastmail每月服务器花70美元。

[3193.274-3202.376] SPEAKER_00: 服务器宕机时花了一大笔钱。然后 空间不够时,我在主页放了个付款按钮,说 想要超过10兆空间?每年付10美元。

[3202.676-3205.566] SPEAKER_02: 所以保持低成本,降低开支。

[3205.866-3214.167] SPEAKER_00: 是的。 所以我一直保持低成本。 有次要花更多钱,我就找人帮我花。 差不多从那时起,我们就开始赚钱,我也赚了。 从那时起。

[3214.247-3225.546] SPEAKER_00: 所以最佳决策有点难,因为我们卖的东西。 更像是笔百万美元的大单。 但我们做的是售前范围界定项目。 类似原型项目,但不是免费,而是卖。 收他们五到十万美元。

[3225.626-3231.187] SPEAKER_00: 这样我们保本,客户也觉得我们做得值。 很有价值。 所以这两种情况,我们六个月就开始盈利了。

[3231.487-3232.055] SPEAKER_01: 对。

[3232.355-3235.687] SPEAKER_02: 不过还是挺吓人的。 我是说,对,当然。

[3235.987-3244.589] SPEAKER_00: 我是说,跳进去之前很可怕,我就是在比较。 它和风投的可怕程度。 我觉得风投更吓人,更依赖别人。 你知道,他们会不会投你?

[3244.669-3258.998] SPEAKER_00: 还有他们对你在做的事的看法。 我还发现,风投支持的初创公司,实际做起来很难。 对客户很重要。 公司不做那事,风投就开心,他们总 告诉你别做让他们开心的事。 可你不做,他们就会难过。 所以。

[3259.298-3262.722] SPEAKER_02: 那优化退出是好事吗? 去优化?

[3263.022-3274.727] SPEAKER_00: 这也许好,但风投不行,他们退出需要 一千倍回报。 对。 还有什么别的方式? 生活方式退出。 如果能用1000万卖掉。 是的。 而且做得对。 所以,这取决于你想建什么,

[3274.807-3280.170] SPEAKER_00: 一直做下去,没问题。 如果想三年后卖掉,那也行。 两者都很好。

[3280.470-3289.966] SPEAKER_02: 所以你学Swift,已经在用,我听说你至少用 有时候,间隔重复是学习新东西的好方法。 对。 我经常用Anki。

[3290.266-3291.380] SPEAKER_00: 我也是。

[3291.680-3300.735] SPEAKER_02: 其实我从没跟别人聊过这个。 不知道别人怎样,但我觉得很有效。 能说说你的经验吗? 比方说吧,你是怎么做的?先回顾一下。 什么是间隔重复?

[3301.035-3308.616] SPEAKER_00: 间隔重复是心理学家艾宾浩斯提出的。 我不知道。 大概是几百年前,或者150年前吧。 他做了一件听起来很无聊的事。

[3308.696-3316.997] SPEAKER_00: 他在卡片上写随机字母,测自己一天后或一周后能记住多少。 就是那些随机字母。 他发现有个曲线,是记住一个字母的概率。

[3317.077-3328.004] SPEAKER_00: 第二天大幅下降,第三天再降一点。 之后又降一点。 他发现,如果一天后复习这些卡片,概率会降得慢些。 下降得更慢了。 一周后复习,遗忘速度就慢了。

[3328.084-3334.353] SPEAKER_00: 他找到了最佳复习时间的公式。 你要记的内容。 间隔重复学习,算法很简单。 一天后复习一次。 你就照做。

[3334.433-3344.289] SPEAKER_00: 然后三天、一周、三周,类推。 用Anki这类软件,它会自动安排。 它会问,你还记得吗? 你说不,就让你快十倍复习。 不然不会这么快。

[3344.369-3349.117] SPEAKER_00: 这能确保你学会,因为根据定义, 没学会就重新安排,更快复习。

[3349.197-3356.221] SPEAKER_00: 可惜它不让你自欺欺人。 没学会的话,复习次数会 越来越多。 所以得高效学习,比如善待大脑。

[3356.301-3366.018] SPEAKER_00: 比如用记忆法、故事和上下文。 所以这是很棒的技术。 学会学习,每个人都该学。 嗯。 学任何东西前,先学会学习。 嗯,但几乎没人这么做。

[3366.318-3374.735] SPEAKER_02: 诸如此类,学新语言很有效。 像个小项目,我开始用它,如果你有谁 有篇博客启发了我,可能是你,呃。

[3374.815-3379.377] SPEAKER_02: 读论文时我就这么干,记下概念想法。 是迈克尔·尼尔森吗? 嗯。

[3379.677-3389.081] SPEAKER_00: 迈克尔最近开始这么做,还一直写相关文章。 今天的艾宾浩斯式人物是彼得·沃兹尼亚克,他开发了 SuperMemo系统,呃,他总想成为像世界

[3389.161-3400.634] SPEAKER_00: 最伟大的文艺复兴式人物,过去几十年里。 呃,他一直用间隔重复学一切。 嗯。 迈克尔最近才涉足这个领域,但他开始 他对用这方法学各种东西特兴奋。

[3400.714-3407.018] SPEAKER_00: 嗯,我除了中文,没用来学别的。 呃,因为中文比较特殊。 我决定要一直记住,嗯,即使我不

[3407.098-3417.770] SPEAKER_00: 我很少有机会练习,因为不常在国内。 所以我就,不练了。 嗯,像编程或论文那些,我的方法很不一样, 就是不去死学,而是抓关键概念,真正消化。

[3417.850-3426.569] SPEAKER_00: 深入理解那个概念,仔细琢磨它。 嗯,判断它重不重要,重要就融进知识体系, 呃,融进我做事的方式里。 对。 或者觉得不值得,就放弃。

[3426.649-3437.286] SPEAKER_00: 所以我发现我记得的都是我关心的,因为老在用。 所以过去25年,我每天至少花一半时间学新东西。 嗯,同事一直讨厌这样,觉得我不干正事,

[3437.366-3444.494] SPEAKER_00: 但这样我工作更快,因为我练了好多东西。 所以我给自己很多机会练新事物。 现在发现,我很少希望自己记住什么。 方法。

[3444.574-3451.876] SPEAKER_00: 我工作更快了,因为练得多。 所以我算是给自己不少机会练新东西。 所以现在发现,我其实不太希望自己能记起来。 某事。

[3451.956-3456.658] SPEAKER_00: 有用的东西,我一直大量用。 谷歌查很容易,但中文查不了。 在谷歌上

[3456.958-3465.201] SPEAKER_02: 所以 学新东西的人,有什么建议? 那你学到了什么? 这能赚钱吗? 这是个过程,从挤出时间开始。 可用 是的

[3465.501-3477.380] SPEAKER_00: 你必须坚持,这是99%的人做不到的。 同上 当初学中文的人,12个月后没人坚持。 稍后 十年后我还在坚持。 我试过联系他们,但没人像学中文那样坚持。 比如研究人类学习原理。

[3477.460-3487.340] SPEAKER_00: 所以每张中文闪卡都有故事。 故事设计成容易记住,我们发现那些 有趣、恶心、性感或与认识的人相关的更容易记住。 差不多。

[3487.420-3489.765] SPEAKER_00: 所以我尽量让所有故事都有这些特点。

[3490.065-3491.017] SPEAKER_02: 是的。

[3491.317-3500.593] SPEAKER_00: 所以,没背景你就记不牢。 而且,要是不常练习,不管... 这就是你日常生活的一部分。 是的。 这就是我做的其中一件事。 还有,我有时故意失败。

[3500.673-3508.660] SPEAKER_00: 比如过去几年我健康问题多,抽认卡 停了大概三年。 还有几次我停了好几个月,很难,因为 重新开始,就像一万八千张卡到期。

[3508.740-3516.367] SPEAKER_00: 所以就想,好吧,要么... 要么放弃所有,要么接下来两年每天做。 直到重新开始。 神奇的是,三年后,中文

[3516.447-3519.616] SPEAKER_00: 还在,重学比初学快很多。

[3519.916-3534.872] SPEAKER_02: 时间。 是的。 没错,绝对是。 它就在那儿。 我也有同感,关于吉他、音乐这些。 挺可惜的,工作一忙起来,可能一年都不碰。 不过要是每天重新练,就能恢复正常。

[3534.952-3543.276] SPEAKER_02: 你觉得AI下一个重大突破是什么? 对深度学习或更远的领域,你有哪些期望?人们该往哪努力? 会有突破吗?

[3543.576-3554.039] SPEAKER_00: 我觉得没法预测。 我觉得我们已经有了一个超强的平台,能解决很多 还没解决的社会重大问题。 所以我希望更多人学会这个工具。 这个工具包,并试着用它。

[3554.119-3557.613] SPEAKER_00: 我觉得不需要太多新技术突破,就能做很多大事。

[3557.913-3565.436] SPEAKER_02: 现在就可以。 你觉得我们什么时候能造出人类级别的AI? 你觉得有多难? 还要多久? 不知道。

[3565.736-3575.558] SPEAKER_00: 没法知道。 我不清楚。 比如,我不懂为什么有人预测,没数据也没根据。 一点依据都没有。 没错。 就像,太多了。 当前最要紧的社会问题。

[3575.638-3577.785] SPEAKER_00: 这问题一点没意思,完全不值得回答。

[3578.085-3581.150] SPEAKER_02: 那社会重要问题里,内部问题是什么?

[3581.450-3593.828] SPEAKER_00: 嗯,比如人工智能造成的问题。 对。 所以更具体来说。 劳动力失业问题会很严重,但人们总在做轻率的经济计量。 这种论证。 比如,以前有其他技术出现,也没造成。

[3593.908-3600.630] SPEAKER_00: 造成大规模失业,人工智能也不会——所以你特别担忧哦。 是的,Injury Yang在研究,我非常担忧,你已看到。

[3600.710-3608.987] SPEAKER_00: 工作变化导致中产空心化,你正在看到。 嗯,现在毕业生的经济前景不如。 他们父母,过去几百年都没发生过,你知道我们。

[3609.067-3615.870] SPEAKER_00: 以前总在进步,现在却变成了焦虑、绝望,甚至。 暴力让我很担心。你写过不少伦理内容,我认为

[3615.950-3621.650] SPEAKER_00: 用深度学习的数据科学家要意识到,工具影响极大,能多方位影响社会

[3621.950-3625.537] SPEAKER_02: 如果他们做研究,成果会被同行使用

[3625.837-3631.142] SPEAKER_00: 他们有责任考虑后果,并思考这类问题: 如何让人参与?如何避免反馈循环失控?

[3631.222-3640.405] SPEAKER_00: 如何确保受我算法影响的人有申诉流程? 如何确保算法约束条件能充分解释给使用者? 有各种人类问题,其实只有数据科学家才能教育他人

[3640.485-3648.205] SPEAKER_00: 但数据科学家常觉得自己只是工程师,不需要参与,不,这是错的 你位置完美,能更好地教他们读文献、学历史

[3648.285-3653.091] SPEAKER_00: 学历史。杰里米,非常感谢,你激励了很多人

[3653.391-3660.333] SPEAKER_02: 进入深度学习领域,产生了涟漪效应 蝴蝶效应可能改变世界,所以非常感谢你 我们下个视频见

[3660.413-3661.086] SPEAKER_02: 你

[3661.166-3663.255] SPEAKER_02: 我们下个视频见 你