Podcast Script (zh)
[0.120-14.008] SPEAKER_02: 接下来和Ishan Mizra的对话。 他是Facebook AI研究院的研究科学家。 他研究自监督机器学习。 在计算机视觉领域。 换句话说,就是让AI系统理解 视觉世界,几乎不需要人类帮助。
[14.088-27.453] SPEAKER_02: Transformer和自注意力机制已成功用于 OpenAI的GPT-3等语言模型。 在语言领域做自监督学习。 Ishan和Yann LeCun等人一起。 正尝试在图像和视频领域 取得同样成功。
[27.533-41.247] SPEAKER_02: 目标是让机器人整夜看YouTube视频。 到早上, 得到一个更聪明的机器人。 我读了篇博客文章, 《自监督学习:智能的暗物质》 是Ishan和Yann LeCun写的。 然后听了Ishan在
[41.327-51.845] SPEAKER_02: 优秀播客Machine Learning Street Talk的访谈。 我得跟他聊聊。 对了,如果你对AI和机器学习感兴趣, 我推荐ML Street Talk播客。 他们很棒。 简单提下赞助商。
[51.925-64.652] SPEAKER_02: Onnit、The Information、Grammarly和Athletic Greens。 去简介查看,支持我们播客。 补充一句,我想对那些 可能听了很久的朋友说, 本播客以前叫 人工智能播客,因为我的热情
[64.732-73.915] SPEAKER_02: 永远是AI, 无论狭义还是广义。 我做这个播客的目标仍是多聊, 与AI、数学、物理、生物等领域顶级专家, 以及其他科学领域。
[73.995-105.103] SPEAKER_02: 但我也想想和历史学家、音乐家、运动员, 当然,偶尔还有喜剧演员。 其实,我正试着每周更新三期, 这样更自由。 有嘉宾选择,也许你知道 我不知道,我不知道,我不知道,我不知道,我不知道,我不知道,我不知道 我不知道,我不知道,我不知道,我不知道,我不知道,我不知道,我不知道 所以我请你,有机会的时候, 有机会找点乐子。 说到乐趣,这次对话中,
[105.183-117.399] SPEAKER_02: 我挑战听众数一数 香蕉这个词出现的次数。 伊山和我用香蕉当典型例子 在计算机视觉难题的核心 也许还有意识的难题。 这里是Lex Friedman播客,
[117.699-120.171] SPEAKER_01: 下面是我和伊山·米兹拉的对话。
[120.471-127.239] SPEAKER_02: 什么是自给自足? 监督学习?或者更根本,什么是监督和 半监督学习。还有为什么自监督学习比
[127.539-141.903] SPEAKER_00: 无监督学习是更好的术语?从监督学习开始。通常机器学习 系统,训练方式是找一群人。他们标出特定的 概念。所以对于图像,让人类告诉你里面有什么, 在图像中画框、掩膜、像素等,它们是
[141.983-155.592] SPEAKER_00: 它要么属于某类,要么不属于。在NLP里,这种任务特别多。 比如情感分析、蕴含关系等。所以监督学习通常 我们会得到大量标注数据,然后输入系统。 系统其实在学习模仿。它接收输入,然后模仿输出。
[155.672-161.395] SPEAKER_00: 比如它看到一张图,人类标注了里面有香蕉。 系统就在模仿这个,这就是学习信号。
[161.475-173.586] SPEAKER_00: 所以对于监督学习, 我们收集大量数据,训练模型来模仿。 输入输出。希望通过这样做,模型在没见过的数据上, 能自动预测这些概念。这是一种标准的
[173.666-181.363] SPEAKER_00: 监督设置。半监督设置呢,你当然有 所有监督数据,但还有很多无监督的 未标注数据。监督学习的问题,以及为什么会有
[181.443-191.485] SPEAKER_00: 这个范式,是因为它无法扩展。比如你去看 计算机视觉里,最大最流行的数据集之一就是ImageNet,对吧? ImageNet有2.2万个概念,1400万张图像。
[191.565-204.965] SPEAKER_00: 这些概念基本都是名词,在图像上标注过。 这个数据集收集工作巨大,催生了强大学习 算法,被认为是深度学习兴起的原因之一。但现在这个数据集 花了大约22人年才收集标注完。
[205.045-218.526] SPEAKER_00: 概念也不算多,对吧? 图像也不多。 1400万真不算什么。 比如,大概有四亿张图像, 甚至更多,上传到主流 社交媒体网站。 所以监督学习根本扩展不了。 如果要标注更多概念, 需要各种细粒度概念,
[218.606-232.331] SPEAKER_00: 那就无法真正扩展。 所以现在想到这些 不同的学习范式, 比如半监督学习, 它的理念是, 有标注好的监督数据, 还有大量未标注图像。 算法应该 尝试测量一致性, 或者测量某种信号
[232.411-248.368] SPEAKER_00: 在这些未标注数据上。 让它变得更自信 关于它真正想预测的东西 所以通过访问大量未标注的数据 想法是让算法 就变得更自信了 预测这些概念也更准了 现在我们有了大量数据 我们到了另一个极端
[248.448-257.468] SPEAKER_00: 就是自监督学习 本质是让机器或算法 要真正发现概念 或发现世界的事物 或学习世界的有用特征 不用人来明确监督
[257.768-270.936] SPEAKER_02: 所以“监督”这个词还是 出现在“自监督”这个术语里 那监督信号是什么? 也许这正是Yann LeCun和你 认为“无监督”是错误术语 那监督信号是什么? 当人不在画面里时,
[271.016-273.523] SPEAKER_02: 或者不是画面的主体? 对。
[273.823-286.097] SPEAKER_00: 所以自监督, 之所以叫“监督”, 因为用数据本身当监督。 数据自己充当监督来源, 这就是自监督。 现在很多人, 我和Yann的博客里提到, 但很多其他人也主张 用“自监督”这个术语。
[286.177-301.168] SPEAKER_00: 差不多94年,Virginia de Sars团队, 应该是加州大学圣地亚哥分校, 她现在就在那里。 Jitendra Malik也多次提到。 所以有监督学习。 无监督学习意味着所有 非监督学习的东西。 包括半监督学习之类。 比如转导学习之类的。
[301.248-315.577] SPEAKER_00: 很多其他设置。 所以原因就是,比如, 现在大家更爱用“自监督”这个词, 因为它清楚说明了本质。 数据本身就是监督信号。 任何试图 从数据中提取监督信号的 从数据本身提取的 就是自监督学习算法。
[315.877-326.293] SPEAKER_02: 但在数据内部, 有些技巧能解锁监督。 对。 能举几个例子吗? 还需要创意, 巧妙构思才能解锁这种监督。 数据不会直接告诉你怎么做。 得用点技巧。
[326.373-333.362] SPEAKER_02: 你最喜欢哪个领域? 你专门做视觉学习。 但是有最喜欢的例子吗? 也许在语言或其他领域?
[333.662-346.574] SPEAKER_00: 也许最成功的应用 是在自然语言处理中。 基本想法是训练模型 比如你有一个句子, 然后你遮住某些词。 模型学习预测被遮住的词。 比如句子“猫跳过狗”, 你可以遮住“猫”。
[346.654-357.813] SPEAKER_00: 让模型预测 我遮住了什么? 模型会预测 所有可能词的分布。 并且可能, 如果模型训练良好, 它会有更高的概率密度 对于“猫”这个词。 对于视觉领域,
[357.893-370.446] SPEAKER_00: 更简单的例子。 现在用得不那么多了。 比如视频预测。 视频就是一系列画面。 所以你可以问模型。 比如一段十秒的视频。 把前九秒输入模型。 然后问它,接下来呢? 第十秒会怎样? 能预测会发生什么吗?
[370.526-385.331] SPEAKER_00: 核心思想就是, 模型预测数据本身的一些东西。 当然,你不需要别人 告诉你发生了什么。 因为那段视频是实拍的。 模型在预测那里的变化。 它会自动学到一些东西。 关于世界的结构, 物体如何移动、恒存性, 以及这类东西。
[385.411-401.098] SPEAKER_00: 比如,桌子边缘有个东西。 它会掉下来。 像这种事, 你其实不用坐下来标。 在监督学习里, 我就得坐下来标。 这是个杯子。 现在移动杯子。 它还是个杯子。 现在移动杯子。 它还是个杯子。 然后它掉了。 这是个掉下来的杯子。 所以这些我都不用标。 在自监督学习里。
[401.398-409.083] SPEAKER_02: 这技巧很巧妙吧? 取一组一致的数据, 然后去掉其中一项, 让算法预测那一项? 这本身就很巧妙吧?
[409.163-414.166] SPEAKER_02: 这似乎啥都适用。 有约束条件 序列与物理现实一致 跟物理现实一致
[414.246-418.797] SPEAKER_02: 问题是有没有其他类似方法 能生成自监督信号
[419.097-431.847] SPEAKER_00: 所以序列是自然语言处理中最常用的 视觉中,图像的方法 最近很流行 基本就是取一张图像 然后对图像做不同裁剪 你可以决定裁剪,比如 左上角 再剪右下角,然后问
[431.927-443.806] SPEAKER_00: 让网络做一个选择 说,好,现在有这张图 这两张图一样吗 所以基本思路是利用不同部分 像一张图里,不同部分 是互相关联的 比如,有椅子和一张桌子 这些事物通常靠得很近
[443.886-458.819] SPEAKER_00: 如果你再取一次 如果你有张椅子放大图 如果你换种裁剪方式 就会得到椅子不同部分 这个思路就是,图像的不同裁剪 是相互关联的 所以从不同裁剪中得到的特征 也应该相关 所以这可以说是最常用的 现在广泛使用的技巧
[458.899-462.323] SPEAKER_00: 用在计算机视觉的自监督学习
[462.623-477.175] SPEAKER_02: 所以,再次利用一致性 这是视觉物理现实固有的 也就是图像各部分一致 然后在语言领域 或任何有序列的东西 比如语言或时间序列 那么你可以切分部分 你可以在时间上拼接事物
[477.255-480.122] SPEAKER_02: 跟RNN和CNN的故事类似。
[480.202-494.926] SPEAKER_02: 讲的是RNN和约定。 Yann LeCun在2021年3月写了这篇博客。 标题叫《自监督学习》。 还有《智能的暗物质》。 你能总结一下这篇博客吗? 或者解释下主要思想或观点?
[495.226-507.314] SPEAKER_00: 这篇博客主要讲的是, 这确实是公认的事实。 对现在很多人来说, 自监督学习是这样的, 你不能独自搞定它。 自监督学习将会, 对机器学习算法有重要作用, 将来甚至现在都如此。
[507.614-512.199] SPEAKER_02: 嗯,我评论一下,我们还没有 对暗物质理解得很清楚。
[512.499-515.413] SPEAKER_00: 确实如此。 所以这个想法基本上就是——
[515.713-523.340] SPEAKER_02: 也许这个比喻不太恰当。 但也许它真的转移得很好。 我们不知道。 我们感觉它会是很大一部分。 不管智能长什么样。
[523.640-540.941] SPEAKER_00: 对。 所以我认为自监督学习, 目前的方式嘛,你知道, 我觉得这可能是迈向它 最终就像学习的第一步那样。 或者它该让我们能做什么。 是的。 所以那个具体想法的关键是 自监督学习会是一种很强大的方式 来学习关于世界的常识 或者像那些很难标记的东西。
[541.021-555.129] SPEAKER_00: 比如, 那边那块比杯子重吗? 现在,所有这类事情, 你只能坐下来标记这些东西。 所以监督学习显然没法规模化。 那到底啥能规模化呢? 很可能是, 比如一个能真正互动的代理 把它举起来,或者看我做。
[555.209-568.841] SPEAKER_00: 所以,如果我基本在举这些, 它可能能推理, 嘿,这花了他更久举起 或者速度不一样。 而这个速度不同, 可能这个更重。 所以,看数据就能 推断出世界的很多事, 不用别人明说, 这个重,这个不重, 这个能倒出来,
[568.921-572.229] SPEAKER_00: 这个倒不出来, 这是个能坐的地方, 这不是能坐的地方。
[572.529-585.314] SPEAKER_02: 但你提到一个观点 关于跟世界互动的能力。 有太多问题还没解决 还悬而未决 那就是怎么选数据集 自监督学习用的数据集 有多少互动性 比如主动学习或机器教学
[585.394-596.042] SPEAKER_02: 有多少互动?奖励信号是什么? 比如有多少实际互动 和物理世界的互动等等 所以这可能是大问题 除此之外 我有无数疑问 我们不知道答案 但值得讨论的是
[596.122-603.889] SPEAKER_02: 涉及多少推理 多少知识积累 和更接近学习的东西比 或者它们是不是一回事 所以我们觉得这确实是暗物质
[604.189-609.216] SPEAKER_00: 我们不知道具体该怎么做 但我们很多人其实相信 这会是机器学习领域的大事
[609.516-615.019] SPEAKER_02: 我再说清楚一点 人类监督很难大规模做 这正是智能方案的来源
[615.319-615.829] SPEAKER_00: 对
[616.129-619.495] SPEAKER_02: 机器得自己找监督 从自然信号里
[619.795-632.556] SPEAKER_00: 对,还有一点就是 人不是特别好的标注者 他们不太稳定 比如,有什么区别 餐桌和桌子之间 难道只是因为一个 比如只看某一张桌子 是什么让我们说这是餐桌 而另一张不是 人类并不太一致
[632.636-644.550] SPEAKER_00: 他们不是很好的监督来源 对于很多边缘情况 所以如果我们想要这样, 比如要个算法或机器, 来帮我们干一个任务, 也许只设个最终目标就行。 至于中间过程, 最好别去指定,
[644.630-646.301] SPEAKER_00: 因为其实不会搞混。
[646.601-658.654] SPEAKER_02: 嗯,人类连生命意义都说不清。 所以我们不确定自己是不是最终目标的 好监督者。 那问您一个分类的问题吧。 人类不擅长区分 什么是桌子什么不是,像您说的。
[658.734-661.961] SPEAKER_02: 您觉得这可能吗? 假如您是柏拉图,我问您:
[662.041-675.789] SPEAKER_02: 能不能搞出一个不错的 世界物体分类法? 好像很多机器学习方法 都乐观认为有可能 搞出完美分类,或它本就存在。 也许够不着,但能更靠近。 越来越近了。
[675.869-677.842] SPEAKER_02: 还是说这根本没希望?
[678.142-694.398] SPEAKER_00: 我觉得,某种程度上没希望。 所以问题在于,任何分类, 如果你有明确分类方式, 我总能挑出最近的两个概念, 或拿第三个概念混进去, 这样就造出新类别。 所以如果你列出 n 个类别, 我总能找出 n+1 个类别。 它不在那 n 个类别里。
[694.478-711.164] SPEAKER_00: 而且我不仅能造出 n+1 个, 轻易就能造出远多于 n 个。 关键是,我们说的很多东西 其实都是组合出来的。 所以我们很难坐下来 把它们全列出来。 而且它们组合的方式千奇百怪,对吧? 比如牛角包和甜甜圈。 一起就成了可颂甜甜圈。
[711.244-721.858] SPEAKER_00: 所以如果你要列出所有食物,直到—— 我不确定,大概十年前或十五年前,可颂甜甜圈出现时, 那整个叫可颂甜甜圈的就不存在了。 就不会存在。
[722.158-726.267] SPEAKER_02: 对,我记得有个超棒的视频, 一只猫穿着猴子戏服。
[726.567-727.124] SPEAKER_00: 对。
[727.424-739.477] SPEAKER_02: 大家都该看看,真的超棒。 那到底是猴子还是猫? 这是个非常难的哲学问题。 所以有个概念是物体之间的相似性。 所以你觉得这个能走很远吗? 只要找到一个好函数,
[739.557-743.202] SPEAKER_02: 一个好方法,判断事物哪些部分相似, 哪些部分非常不同。
[743.502-749.806] SPEAKER_00: 我觉得是的。 所以你不必每样东西都起名字, 或者每样都得有个名才能用,对吧? 所以有很多——
[750.106-752.300] SPEAKER_02: 名字有什么关系?莎士比亚说的。
[752.600-754.434] SPEAKER_00: 是啊,名字没关系。
[754.734-756.162] SPEAKER_02: 嗯,好吧。
[756.462-768.039] SPEAKER_00: 比如很多动物,对吧? 它们不一定有很完善 像语法那样的语言, 但照样过得挺好。 我们也一样。 所以,我们观察事物, 发现这和以前见过的东西很像。 然后可能就学会怎么用了。
[768.119-782.483] SPEAKER_00: 我并没见过所有可能性, 所有可能的门把手。 但如果给我看,我就能 很容易进入某个地方。 那个门把手我从没见过。 自然联想到见过的所有门把手, 清楚知道它会怎么打开, 或者很有把握。 我觉得这种经验转换
[782.563-790.260] SPEAKER_00: 就因为相似。 因为我能把它和门把手联系起来。 如果我把它和吹风机联系起来, 我可能还会被困在外面, 进不去。
[790.560-795.111] SPEAKER_02: 同样,这有点像哲学问题, 但是,相似性能不能 让我们完全理解一件事?
[795.191-800.682] SPEAKER_02: 有一个善于比较物体的好功能, 能不能让我们深刻理解 关于单个物体的一些东西?
[800.982-803.512] SPEAKER_00: 我想反问您一个问题。 理解物体是什么意思?
[803.812-813.088] SPEAKER_02: 嗯,我告诉您这跟什么像。 不,这有点像类比推理 的概念。 我认为理解是把那个东西 放到你已有的知识网络里, 你所拥有的,
[813.168-819.472] SPEAKER_02: 它可能和其他概念有根本联系。 所以理解不完全是跟 通过其他概念组合有关 或许还跟其他概念有关。
[819.552-822.779] SPEAKER_02: 理解越来越深入 只是给那张图加更多边。
[822.859-829.999] SPEAKER_02: 所以它可能真是其他概念的组合, 就是相似性的组合。 说到底,它就是一种嵌入 在那个智慧空间里。
[830.299-831.750] SPEAKER_00: 对,智慧空间不错。
[831.830-845.694] SPEAKER_00: 我想,确实是这样,对吧? 所以相似性真能带你去很远。 它是万物的答案吗? 其实我连万物是啥都不知道, 但它能带我们走很远。 问题在于, 东西在不同环境下是相似的,对吧? 所以一头大象跟 另一种野生动物相似。
[845.774-859.209] SPEAKER_00: 那就选,嗯,一头狮子,以不同方式 因为它们都是四足动物。 它们也是陆生动物。 但它们差别很大。 在很多方面。 所以大象吃草,狮子不吃。 所以相似点和不同点, 能帮我们理解很多事。 所以这就是为什么我觉得
[859.289-874.454] SPEAKER_00: 离散分类很难。 比如把大象归成一类, 狮子归成另一类。 也许对像 分类学、生物分类学有用。 但说到其他东西时, 比如烤奶酪三明治这种不明确的东西。 我有个烤奶酪三明治, 蘸了番茄酱放外面了。 现在它还是烤奶酪三明治吗?
[874.534-875.811] SPEAKER_00: 还是别的了?
[876.111-884.029] SPEAKER_02: 好,分类还是很有用的。 用来解决问题 但你的直觉是不是有点 自监督学习应该是 用Yann LeCun的话说 应该是蛋糕,然后分类
[884.109-891.829] SPEAKER_02: 分类,也许像监督层 应该只是上面的东西 樱桃或糖霜之类的 所以如果你把它当蛋糕 它会阻碍学习
[892.129-906.853] SPEAKER_00: 如果你把它当蛋糕 那你就不 我们就没法坐下来标注所有内容 就这么简单 这就是我很实际的看法 只是,我是说,读博期间 我坐下来标了一堆卡片 为了我的一个项目 很快,我就觉得 那是在一个视频里,我基本在画框 全都是这些卡片。
[906.933-921.517] SPEAKER_00: 我花了差不多一周做这些。 结果啥也没干成。 基本上就是, 我博士第一年吧, 要么是硕士第二年。 到最后,我想, 好吧,彻底没戏了。 我可以接着做。 做完那事后, 有人过来跟我说, 哦,这是皮卡。 不是轿车。
[921.597-930.838] SPEAKER_00: 然后就像,啊哈, 这就有道理了。 因为皮卡其实不像, 我到底在标什么? 我标的是所有移动的? 还是只标某些轿车? 或者是标SUV? 我当时在干嘛?
[931.138-933.912] SPEAKER_02: 问一下,标注是边界框?
[934.212-936.139] SPEAKER_00: 边界框,对。
[936.439-948.016] SPEAKER_02: 这里问题又多又深。 你好像在故意回避这些。 顺便一说,用自监督学习, 就像,物体是什么构成的? 跟解决智能问题不一样, 也许你根本不用回答那个。
[948.096-960.881] SPEAKER_02: 我是说,问题就在这。 所有做过标注的人, 因为太痛苦,只能问: 我干嘛要仔细画? 绕着物体画一整条线? 比如,这有啥价值? 我记得第一次看到语义分割时,
[960.961-972.376] SPEAKER_02: 还有像实例分割, 有一条很精确的线, 在二维平面绕着物体, 这是三维物体在二维的投影。 所以你在给一辆车画线 那辆车可能被挡住 它前面可能有别的东西
[972.456-985.125] SPEAKER_02: 但你仍然在画线 画出你看到的那部分车 那怎么就是那辆车呢? 为什么那是那辆车? 就像我每次陷入存在危机 比如那怎么帮我们理解 软计算机视觉? 我不确定有什么更好
[985.205-994.284] SPEAKER_02: 我不太认同你的自信 自监督学习能带我们走很远 我想我越来越确信 它是一个重要部分 但我仍然觉得需要理解 是什么让这个梦想,也许就叫
[994.364-1002.630] SPEAKER_02: 比如符号人工智能的到来 比如一旦有了这个常识基础 就能玩弄这些概念 然后构建概念图或层次结构 形成深刻理解
[1002.710-1012.671] SPEAKER_02: 对三维或四维世界的理解 还能推理 再投影到二维平面 来解释二维图像 我能问个离谱的问题吗 我记得安德烈·卡帕西写过篇博客
[1012.751-1023.687] SPEAKER_02: 说计算机视觉很难 忘了标题,很多年前的事了 他有一张奥巴马站秤上的图片 带幽默,一群人在笑 等等 有趣的是,很多有趣的事 关于那张图
[1023.767-1033.287] SPEAKER_02: 安德烈强调了很多点 关于那张图,我们能 立即理解 比如重力概念 还有重量的概念 你有一个,立刻投射。 因为我们了解姿态。 还有人体结构。
[1033.367-1045.397] SPEAKER_02: 你如何运用理解力。 在人体上。 真正有趣的是别的事。 你能理解的是, 图里好多人互相看着。 你能建个心理模型。 关于别人在想什么。 你能推断出, 哦,这人可能认为,
[1045.477-1051.978] SPEAKER_02: 比如在嘲笑这有多幽默。 而这个人很困惑。 因为他们朝这边看。 我们都能推断出来。 这就是人类视觉。
[1052.058-1065.063] SPEAKER_02: 计算机视觉有多难, 比如要达到那种水平? 也许有多大? 自监督学习的作用有多大? 你觉得呢? 那你还是支持那个看法吗? 那是十多年前的事了。 我觉得安德烈,很多人都同意,
[1065.143-1068.509] SPEAKER_02: 计算机视觉真的很难。 你还觉得计算机视觉很难吗?
[1068.809-1079.701] SPEAKER_00: 嗯,没错。 要达到那种理解, 我是说,还很遥远。 所以如果只让我解决那个问题, 我可以用监督学习来做。 我总能建个数据集,然后预测, 哦,有没有幽默? 这里面有幽默吗?
[1080.001-1085.341] SPEAKER_02: 我当然可以。 其实这是个好问题。 你觉得你能吗?好吧。 你觉得能让人工标注幽默吗?
[1085.641-1092.189] SPEAKER_00: 某种程度上,是的。 我相信这能行。 至少不会比瞎猜差。 我肯定它还能预测。 它算是有点幽默。
[1092.489-1095.716] SPEAKER_02: 对,Reddit的点赞可能就是信号。 我不知道。
[1096.016-1104.340] SPEAKER_00: 它做得不怎么样,但有点用。 实际上它可能会发现些东西。 不幽默的东西也被当搞笑。 那对我们可糟了。 但它会做得不错。 所以不会是瞎猜。
[1104.640-1110.050] SPEAKER_02: 对,跟我幽默感像。 好,那个特定问题,是的。 但你讲的普遍问题难。
[1110.350-1126.072] SPEAKER_00: 普遍问题很难。 我是说,自监督学习 不能解决所有问题。 当然不是。 我觉得,如果机器要交流。 到最后,和人类一起。 你想知道算法在干嘛,对吧? 你希望它输出个结果。 你能看懂,能理解。 或者对别的事有用。 这终归还是人。
[1126.152-1139.749] SPEAKER_00: 所以在这循环中,某时, 人类介入。 现在人得懂怎么回事。 所以那时, 语言或语义的概念才引入。 如果机器只是吐出东西, 但我们看不懂它, 那对我们没太大用。 所以自监督学习可能很有用
[1139.829-1146.388] SPEAKER_00: 对那之前的事。 在机器需要沟通前, 和人类交流输出。 因为不然它怎么办? 没有语言的话。
[1146.688-1160.669] SPEAKER_02: 或者就是一种交流。 但你说有可能。 建个庞大的理解基础啥的。 关于什么更好—— 概念。 关于概念。 概念,对。 比如常识概念。 对。 计算机视觉里的监督学习 是你一直关注的。 但那是个很困难的领域。
[1160.749-1175.449] SPEAKER_02: 而且可以说是前沿。 是我们整个社区努力的方向。 我们能退一步吗? 看看语言方面? 你能总结一下成功的历史吗? 自然语言处理里自监督学习的成功史, 语言建模? 什么是Transformer? 遮罩和句子补全是啥?
[1175.529-1181.229] SPEAKER_02: 你之前提的那个? 它怎么帮我们理解事物? 词语的语义和句法作用 还有句子?
[1181.529-1196.752] SPEAKER_00: 当然,我不是自然语言处理专家。 我也就是从侧面稍微关注一下。 所以所有这些遮罩方法之所以有效 主要原因呢,我觉得是分布。 在自然语言处理里,这叫分布假说。 它的核心思想是,出现在 相同语境里的词语,意思应该差不多。
[1196.832-1210.453] SPEAKER_00: 所以如果有“____ 跳过 ____”, 基本上,第一个空里的内容 就是能跳的东西, 会是一些能跳的东西。 比如猫、狗,或者羊之类的, 这些东西基本上 都能出现在那个特定语境里。 所以本质上,这个想法是
[1210.533-1223.306] SPEAKER_00: 如果单词在相同语境里 然后预测它们,你就会 了解词语之间的关联 通过看上下文来预测 这个词是什么 这个例子中,空白处跳过了栅栏 如果是羊,它跳过了栅栏 狗跳过了栅栏
[1223.386-1235.300] SPEAKER_00: 所以本质上,算法或表示 把这两个概念合在一起 所以它认为狗和羊有关联 因为出现在相同语境 当然,你可以根据 具体应用来决定 你可以认为狗绝对不 和羊有关,因为我确实
[1235.380-1246.330] SPEAKER_00: 关心狗粮,比如 我是狗粮爱好者,我非常 想把狗粮给这只动物 所以取决于你的下游应用 当然,相似性这个概念。 或者说你学到的概念。 可能不适用。 但关键是,仅仅预测
[1246.410-1248.383] SPEAKER_00: 填空就能取得很大进展。
[1248.683-1261.491] SPEAKER_02: 所以语言有个好特性。 就是特定语言的词汇量。 虽然很大,但有限。 宏观来看其实没这么大。 还要强调,我们太习惯了。 所以首先,说到掩码, 就是填空的过程。
[1261.571-1274.321] SPEAKER_02: 从句子中去掉单词。 知道原来那是什么词。 在原始数据集中。 这就是训练的真实答案。 然后你让神经网络 预测那里该是什么。 这就像个小技巧。 是的。 这技巧很强。 对。
[1274.401-1284.594] SPEAKER_02: 问题是,这能走多远? 还有别的技巧吗? 因为对我来说,很可能 还有其他有趣的技巧。 举个例子。 自动驾驶中,有很多技巧 能提供自监督信号。
[1284.674-1291.814] SPEAKER_02: 比如,和句子很像 就是有信号 来自人类开车 因为很多人开车出行 所以让神经网络预测
[1291.894-1301.170] SPEAKER_02: 接下来两秒的事 来实现安全导航。 信号来自你知道的 接下来两秒的情况 因为有视频数据。 自动驾驶问题,与语言类似。
[1301.250-1312.804] SPEAKER_02: 能学习吗? 怎么靠自我监督来自动驾驶? 恐怕不行。 问题是能进步多少? 语言也一样。 能进步多少? 还有别的技巧吗? 有时效果好的技巧会让人兴奋。 这个技巧确实管用。
[1312.884-1323.718] SPEAKER_02: 但我觉得像淘金。 数据里到底有多少信号? 能被利用的都在那儿。 那是…… 我只想知道, 我想在这儿停一下。 因为大家容易以为 这种掩码就是自我监督学习。 没错。
[1323.798-1336.002] SPEAKER_02: 不,这只是其中一种。 可能还有很多其他方法。 很多巧妙的办法, 也许用人类计算的巧思路 很有趣的方式 其实可能接近半监督学习 等等。 显然,互联网是人造的 说到底。
[1336.082-1341.422] SPEAKER_02: 所以总之, 你怎么看, 就这个语言背景来说, 这种掩码方法能走多远?
[1341.722-1356.805] SPEAKER_00: 所以它经得起时间考验,对吧? 我的意思是,Word2Vec 最早用这技术的NLP方法, 到现在,像BERT那些 还有我们搞出来的大模型, 比如BERT和Roberta, 它们本质上还是基于 一样的掩码原理。 已经带我们走了很远。 就是说,你可以做些事,比如,
[1356.885-1373.571] SPEAKER_00: 哦,这两句像不像, 是不是这个特定的句子 跟在另一句后面 从逻辑上讲,就是蕴含关系。 你可以做很多这类事 光靠这个掩码技巧。 对。 所以我不确定能不能预测 它能带我们走多远, 因为它刚出来的时候, 当Word2Vec刚出来时, 我不觉得我们很多人会想象到
[1373.651-1388.653] SPEAKER_00: 这其实能帮助我们 解决某种蕴含问题 而且效果还那么好。 所以就是因为 通过扩大数据量 我们训练时用的 并用更好更强大的 神经网络架构 带我们从那时到现在 只是告诉你有可能 我们预测得有多差
[1388.733-1397.150] SPEAKER_00: 人类预测能力有多差 某种特定技术 会多成功 所以我现在可以说点东西了 但十年后 我会显得很蠢 在预测方面
[1397.450-1407.704] SPEAKER_02: 在语言领域 你的工作里有没有 你觉得有用又有洞察力 还能用在计算机视觉上的 而且,不知道 美丽的东西 美丽又深刻 我觉得这贯穿 到视觉领域
[1408.004-1424.550] SPEAKER_00: 掩码这个想法呢, 一直都很强大。 视觉领域也用上了, 像你说的,用于预测 下一类。 如果你有n种帧, 并预测接下来会发生什么 在下一帧中。 所以一直都很强大。 在建模方面, 比如说在术语上, 在架构上, 你可能会问 关于Transformer早期。 确实已经变得,
[1424.630-1431.572] SPEAKER_00: 变得超级令人兴奋 对现在的计算机视觉。 比如在过去, 一年半的时间里, 它变得非常强大。 有啥区别?
[1431.872-1433.845] SPEAKER_02: 那Transformer之间呢?
[1434.145-1447.348] SPEAKER_00: 对。 我指的是核心部分。 Transformer的核心是 自注意力模型。 这来自谷歌。 基本思路是, 如果有n个元素, 你要做的是 让这n个元素 互相沟通。 所以核心就是 “关注”。 每个元素都在关注 其他每一个。
[1447.428-1462.848] SPEAKER_00: 通过这么做, 它其实在搞清楚, 最终你会获得 对数据的更好视角。 比如说, 如果你有个句子 包含四个词, 关键是,你拿到 这个句子的表示, 它的构建方式 让每个词 都关注了 其他所有词。 这和卷积网络不同的地方在于, 简单说,
[1462.928-1477.454] SPEAKER_00: 在卷积网络里, 你只关注 一个局部窗口。 所以每个词只关注 它相邻的词 或者再往后一个。 图像也一样。 图像也是同理。 图像也一样。 在图像里, 你主要关注 一个3x3 或7x7邻域内的像素。 就这些。 而transformer呢,
[1477.534-1482.781] SPEAKER_00: 核心是自注意力机制, 核心思想是 每个元素都要关注 其他每个元素。
[1483.081-1496.702] SPEAKER_02: 说到注意力, 换个说法是 你在考虑上下文, 大范围的上下文, 从句子整体上下文 出发, 来理解 某个词的含义。 而在计算机视觉中, 那就是理解 看更大的范围 看懂局部的模式
[1496.782-1499.533] SPEAKER_02: 图像里某个局部部分 它的模式。
[1499.833-1511.225] SPEAKER_00: 对。 所以基本上 再说一遍, 图像中的一根香蕉, 你是在看 整张图先。 所以不管是像 你知道, 你在看 所有像素 那些不在厨房的 或者餐桌这些。 然后你基本上
[1511.525-1518.223] SPEAKER_02: 也在看香蕉。 是的。 顺便说一下, 如果我们 训练搞笑分类器 有件有趣的事 香蕉这个词
[1518.303-1519.313] SPEAKER_02: 先说一下
[1519.613-1522.120] SPEAKER_00: 我穿香蕉衬衫 没错
[1522.420-1524.509] SPEAKER_02: 这是香蕉吗
[1524.589-1528.536] SPEAKER_02: 好 掩码起作用了 视觉上也是 所以这个转换器
[1528.836-1545.034] SPEAKER_00: 想法也行得通 基本上 看所有元素 来理解 某个元素 很强 在视觉上 原因是 很多事 看着它们时 单独看时 所以如果你只看 一团像素 麻省理工的安东尼奥·托拉尔巴 曾经有一张 很有名的图像 我看过的 读博的时候 他通常会 展示一团像素
[1545.114-1561.974] SPEAKER_00: 然后问你 嘿,这是啥? 它看起来基本 像一只鞋 或者可能看着 像电视遥控器 它可能像任何东西 结果发现 那就是个啤酒瓶。 但我不确定。 它是其中之一。 有三样东西。 不过他展示的是 整个画面 然后就很清楚了 它是什么。 但关键是, 光靠看 那个局部窗口, 你搞不清楚
[1562.054-1570.610] SPEAKER_00: 因为分辨率, 因为其他原因。 这不容易 每次都弄清楚 光靠看 周围的像素, 这些像素是啥。 是的。 同样的事情也发生在
[1570.910-1587.433] SPEAKER_02: 在语言上 说到参数 它们要学习 数据里的部分内容 你得给它 能力 去学本质的东西 比如它其实 根本没法 收到信号 它就没法 学那个信号 还有为了 看懂图像 还要理解语言 你必须能 看到词语 在完整的上下文里
[1587.733-1589.161] SPEAKER_01: 好的 什么更难?
[1589.461-1593.710] SPEAKER_02: 解决, 视觉还是语言? 视觉智能 还是语言智能? 所以我想说
[1594.010-1608.885] SPEAKER_00: 计算机视觉 更难。 我这么说的原因是 主要是因为 语言, 当然, 结构很庞大 因为我们创造了它。 但视觉 是某种 普遍存在于 很多动物身上。 每个人都能 勉强应付。 很多这些动物 其实在地球上 能生存 没有语言 而且很多动物 我们也觉得
[1608.965-1621.994] SPEAKER_00: 很聪明 所以很明显 智力 确实有 视觉成分 而且没错 当然 对人类来说 它当然 也有语言成分 但这表示 有些东西 更根本的 关于视觉 比语言相关的多。 很抱歉。 对不赞同的人,
[1622.294-1638.538] SPEAKER_02: 不过,确实, 我就是这么觉得的。 所以这有点 体现出来 在了挑战中 和 进展有关的 自监督学习的, 你会这么说吗? 很偶然的事件 进展之中 AI圈子的 我们关注的 或者我们发现的 自注意力 和Transformer 在上下文里 先说语言。
[1638.838-1656.107] SPEAKER_00: 所以呢,像这种情况 自监督学习能成功 其实, 对视觉来说 关系不大 跟Transformer部分 我会说 它其实是独立的 一点儿 我觉得这只是 那个信号 不太一样 对视觉 比起存在 比如NLP 而且可能NLP 之前就有人发现了 所以,对视觉 主要成功 说白了
[1656.187-1661.957] SPEAKER_00: 到现在为止就跟庄稼一样 就像拍不同的 图像裁剪 说到NLP 就是这种掩码处理
[1662.257-1665.542] SPEAKER_02: 但成功 的程度 对语言来说
[1665.842-1684.980] SPEAKER_00: 还是要高得多 没错,就是这样 所以这和很多因素有关 也就是说 我可以细说 这个具体问题的 好多细节 那就开始吧 好 首先呢 语言结构非常清晰 那你要生成 一个分布 在有限词汇表上 英语词汇有限 单词数量有限 其实没那么多 然后你要生成 基本上 做的时候
[1685.060-1700.004] SPEAKER_00: 掩码操作时 你要做的 就是告诉我 哪个词 比如五万个词里的一个 对 就这样 现在说到视觉 想象一下做 同样的事 好 我们基本遮掉 一个特定部分 图像区域 然后让网络 这个神经网络 预测有什么 在缺失的地方 这个组合非常大 对吧?
[1700.084-1717.292] SPEAKER_00: 有256个像素值 如果要生成 一个7 乘7 或者一个14 乘14 这样的像素窗口 在169个位置 或在49个位置 有256个值 需要预测 嗯。 所以这事吧,真 特别大 而且特别快 就像是 预测问题 我们正在搭的 就会变得 非常
[1717.372-1733.097] SPEAKER_00: 我们搞不定。 所以问题就是 自然语言处理这块, 一直挺成功的 因为我们很擅长 预测 就是那种 分布 在一个有限范围里 可问题是 当这个范围 变得特别大 我们会变得 特别糟糕 做这些预测时 还有在解决 基本上 这个特定的 一组问题 所以
[1733.177-1751.662] SPEAKER_00: 如果你想做它 完全用这种 和NLP一样的方式 用在视觉 成功很有限 事情运作方式 目前运作方式 其实不是 靠预测这些掩码 基本是靠说 你拿这两个 就像从图像里裁剪出东西, 你得到一个特征 从中提取出表示 然后就说 这两个特征, 它们就像向量, 就说 之间的距离
[1751.742-1767.510] SPEAKER_00: 向量间的距离要小 所以, 这是一种很不同的 学习方式 从视觉信号中 和NLP里不一样 好的。 另一个原因是 分布假设 我们之前讨论过 对NLP来说,对吧? 一个词, 根据上下文, 基本上, 上下文其实 给了很多意思 给这个词。 现在, 因为只有
[1767.590-1784.369] SPEAKER_00: 数量有限, 单词数量有限 还有一种有限的方式 组合单词的方式, 当然, 同样的事 适用于像素, 但在语言里 结构很多对吧? 所以我常说, 随便, 破折号跳过栅栏, 例如。 像这样的句子还有很多。 经常见到这种句子。 从这里, 你可以看到 这个句子 会出现在 很多不同的语境里。
[1784.449-1804.304] SPEAKER_00: 也是一样。 同一个句子, 在这个上下文里。 然后羊跳过了 篱笆, 猫跳过了篱笆, 狗跳过了篱笆。 这样你马上就有了 很多类似的词, 它们会这样, 是因为这个标记本身 包含了大量信息, 你得到了很多这种标记。 或者这些词 实际上要 有一个 有这种含义 跨越 从这个上下文 而对于视觉
[1804.384-1821.081] SPEAKER_00: 它要难得多 因为 仅仅通过纯的 比如我们拍照这样 光线可能不同 可能会有 传感器里的噪声不同 所以问题是 你在捕捉 一个物理现象 然后你基本上 要经历 一个很复杂的过程 就像图像处理 然后你在翻译 转化成 类似于某种
[1821.381-1822.855] SPEAKER_01: 数字信号
[1823.155-1829.923] SPEAKER_00: 语言方面 你写下来 然后传输 成数字信号 几乎就像无损 那样的传输 而每个标记 都定义得非常明确
[1830.223-1840.500] SPEAKER_02: 可能有 存在一些争议 因为语言 书面形式 是思想的投影 这是个开放性问题 是 如果你能完美地 解决语言问题 你是不是越来越接近 能够解决 你知道
[1840.580-1851.890] SPEAKER_02: 轻松且出色地 通过图灵测试 这类事情 所以这 类似于 但又不同于 计算机视觉问题 在二维平面上 是三维世界 的投影 所以或许 那里存在类似问题 也许这个
[1852.190-1870.411] SPEAKER_00: 我的意思是 我想说的是 NLP其实不容易。 当然, 别误会我的意思。 我觉得这个问题 什么是预期呢? 在知识里, 或者说知识基本上 在语言里预期的 真的很困难 去理解,对吧? 我的意思是, 我们一直在沟通 用语言这么久了, 而且它, 当然, 是个很复杂的概念。 关键是 至少得到
[1870.491-1876.098] SPEAKER_00: 像一些 比较合理的 比如能 解决某个问题 合理的任务 通过语言, 我会说稍微容易点
[1876.398-1889.903] SPEAKER_02: 比起 用计算机视觉 是的,我会说, 是的, 这么说很好 想要获得 很棒的性能 更容易 我觉得 语言方面 和计算机视觉 都会有 一堵墙 比如 像这样的障碍 你得克服 才能达到 超人水平
[1889.983-1906.611] SPEAKER_02: 表现 或者人类水平 表现。 我觉得 对语言来说, 那道墙更远。 所以,你能获得 挺不错的, 你能做到 很多花招。 你可以展示 印象深刻的 表现。 你甚至能 糊弄别人 以为你在发推特 或者写博客 或者你在写博客 或者你在回答问题
[1906.691-1920.103] SPEAKER_02: 是, 有智能 在它背后。 但要 真正展示 对对话的 理解, 对连续 的长篇对话, 这 需要 或许 重大突破。 同样, 在计算机视觉里, 我觉得重大突破 需要更早 发生
[1920.183-1928.867] SPEAKER_02: 实现了 性能很亮眼 这可能是 一个合适的地方 你刚提到了它 但什么是 对比学习 还有什么是 基于能量的模型 对比学习
[1929.167-1943.473] SPEAKER_00: 有点像 一种模式 的学习 它的思路 就是你在 学这个 嵌入空间 或者说你在学 这种向量空间 涵盖所有概念 那方式 你学到这个 其实就是 靠对比。 所以思路是 你有个样本。 还有另一个 跟它相关的。 这就叫 正样本。
[1943.553-1961.147] SPEAKER_00: 而你还有 另一个样本 跟它无关的。 那就是负样本。 比如说, 我们拿NLP 在计算机视觉的例子。 所以呢,你有 一张猫的图片。 你还有一张图 一张狗的照片。 不管是什么 你正在做的应用 比如你想弄明白 宠物是什么 你觉得这些 这两张图相关 猫的图片 和狗的图片有关 但现在你有
[1961.227-1966.312] SPEAKER_00: 第三张图片 一张香蕉图片 因为你不 喜欢那个词 所以现在你
[1966.612-1969.839] SPEAKER_02: 有这根香蕉 感谢你的发言
[1970.139-1987.324] SPEAKER_00: 对观众 然后你拿 这两张图片 然后你得到图像 从猫身上 狗身上的图像 你得到一个特征 从两者中 现在你正在 你在做的是 把这两个 特征拉到一起 同时把它们推开 远离那个特征 香蕉的特征 所以这就是 对比的部分 所以你在对比 和香蕉对比 所以总会有这种
[1987.404-2004.008] SPEAKER_00: 负样本的概念 和正样本 现在看基于能量的 模型就像 有一种方式 Jan 简单解释 这些方法很多 所以 Jan 基本 我估计几年 或者更久 比如我加入 Facebook Jan 一直 提到这个词 能量模型 当然 我完全不知道 他在说什么 所以有一天 他到我房间
[2004.088-2019.230] SPEAKER_00: 然后我说 你能告诉我 这是什么 然后他特别耐心 坐下了 拿着记号笔 还有块白板 他的基本想法是 与其 谈概率 分布 不如谈 模型能量 所以模型试图 最小化特定 空间中的能量 或者试图 最大化某种 能量 这个想法基本是
[2019.310-2037.101] SPEAKER_00: 你可以解释 很多对比 模型,生成对抗网络 比如, 它们类似 生成对抗 网络。 很多这类 现在的学习方法 你真的可以解释 它们很清楚 从能量角度 函数,它们在 想最小化 或最大化。 所以,通过引入 这种共同的 语言对所有的 这些模型, 看起来很不同的东西
[2037.181-2051.429] SPEAKER_00: 在机器学习中 比如说,VAEs是 很不同于 GAN是什么 很不一样 跟什么比 模型是 你会有种感觉 就像,哦,这些是 其实密切相关 只是方式 或机制 其中它们 某种程度上最大化 或最小化 这个能量函数
[2051.729-2064.467] SPEAKER_02: 略有不同 它揭示了 共同点 和方法 再加个吸引人的词 在它上面 比如能量 所以说,相似的地方 两个东西 相似能量就低 就像能量低 就代表相似 对,没错 所以大体上
[2064.767-2079.514] SPEAKER_00: 意思是 假设你想象 比如嵌入 看成一个流形 一个二维的流形 就会看到一个山丘 或者像一座高的 一个高峰 在能量流形里 每当两个东西 不相关的时候 而大体上 你就会得到 像个凹陷 两个东西 是有关联的
[2079.814-2086.094] SPEAKER_02: 所以就有个凹陷 在流形里 如果你有 既有监督上下文 你怎么知道 两个东西有关联 而两个东西 是不相关吗?
[2086.394-2104.208] SPEAKER_00: 对 所以这就是 所有那些 巧妙的地方或技巧 发挥作用的地方,对吧? 比方说 你可以拿 填空题 或者你可以拿 在上下文中 而你可以说 是两个词 在相同上下文里 相关 两个词 在不同上下文里 不相关 对于图像 基本上两个裁剪 来自同一张图
[2104.288-2122.239] SPEAKER_00: 相关 而第三张图 完全不相关 对于视频 不同视频的两帧 两帧相关 因为它们很可能 包含相同 概念类型 它们当中。 而第三帧 来自不同视频 是不相关的。 所以基本上, 这是个很常见的术语。 对比学习 其实并没有 和...有关 自监督学习。 它其实很流行
[2122.319-2131.444] SPEAKER_00: 比如, 像各种 度量学习 或各种 嵌入学习。 所以也用于 监督学习。 问题是 因为我们不是 真正用标签 得到这些正例 或负例对 它基本可以
[2131.744-2147.605] SPEAKER_02: 也能用于 作为方法 有点像 操作数据 来生成 例子 相似的 显然 有很多 其他技术 你提到光照 作为一个非常 你知道 在图像里 光照是种 变化很大的东西 然后你能人为地 改变那些种类 的事情 有整个
[2147.685-2160.377] SPEAKER_02: 广阔的领域 数据增强的 这个 你知道 可以用来 在很多 不同的方式 所以 我觉得 这是 其中一件事 我们需要 考虑的 这方面 数据增强 所以说, 我觉得 那是 其中一件事 我们需要
[2160.457-2163.463] SPEAKER_02: 考虑的 在数据增强上 数据增强。 所以,
[2163.763-2177.349] SPEAKER_00: 数据增强 只是一种方式, 就像你说的, 它基本上是 一种增强 数据的方法。 所以, 你有, 比如说, n个样本 而你做的 就是你基本上 定义某种 做变换 对样本 所以 你可以取 颜色 或亮度 图像的
[2177.429-2189.645] SPEAKER_00: 或增加 或减少 对比度 图像的 比方说 或取 不同裁剪 的 所以 数据增强 只是个过程 基本是为了 扰动数据 或者增强 数据 对吧? 所以 它扮演了 一个关键作用 在计算机视觉里
[2189.725-2205.029] SPEAKER_00: 对自监督 学习 尤其是 这种方式 数据增强 的原理就是 你可以 拿一个样本 再计算 基本上两个 它的扰动 所以 这些可能是 两种不同作物 在图中 不同类型 照明 或不同对比度 或不同颜色 所以
[2205.109-2219.113] SPEAKER_00: 你抖动颜色 一点点 等等 现在 基本思路是 因为它是 同一个物体 或者因为它是 相关概念 在这两种 扰动中 你想要特征 来自这两个 图像属于 在同一个簇里 因为它们有关联 而图像 像另一张图 应该属于 到另一个簇里
[2219.193-2230.004] SPEAKER_00: 所以 有各种 不同的方法 主要是强制 这个约束 顺便说一下 说到特征 这意味着 有个很大的 神经网络 正在提取 图像里的模式 还有那种模式 图片 会拥有 在图像里。
[2230.304-2238.883] SPEAKER_02: 所以, 你可以这么干 靠对比学习。 所以, 基本上, 这两件事 还有那种模式 它从中提取的 应该 要么完全一样 要么非常像。 对。
[2239.183-2255.151] SPEAKER_00: 就是这个意思。 所以, 神经网络 基本上接收图片 然后输出 一组像 基本上就是个向量 比如数字 这就是特征 你想要 这个特征 对这两个来说 比如不同的裁剪 你算出来的 是相似的。 所以, 你想要这个向量
[2255.451-2274.902] SPEAKER_02: 是一样的 在它的那些项里, 比如说。 比如字面上接近 在这个多维 空间里彼此靠近。 对。 属于同一集群 或者类似的东西 在这片大空间里 首先 那个 我想知道 有没有联系 和人类的方式 学习这个 几乎就像 也许是潜意识里 为了理解 一件事
[2274.982-2286.397] SPEAKER_02: 你总得 看到它 从两个 三个 多个角度 我想知道 我有很多 朋友 是 神经科学家 也许 和认知科学家 我想知道 如果那是 在那里某处 比如 你知道 为了让我们 放 一个概念
[2286.477-2298.391] SPEAKER_02: 在合适的位置 我们必须 基本上裁剪它 以各种方式 做基本的数据增强 在它上面 在任何 真聪明的办法 大脑爱干的事。 对。 比如旋转 在脑子里 不知为啥 这招很管用。
[2298.691-2315.737] SPEAKER_00: 所以我觉得 有些事 可能得这样。 比如婴儿, 比如, 拿东西, 比如移动它们, 凑近眼睛, 等等。 但对其他事, 像那样, 也得想象它。 对。 所以如果你 我从来没见过 比如说 从上面看的大象 我基本没从上往下看过它 嗯 但如果你给我看
[2315.817-2324.060] SPEAKER_00: 它的照片 我肯定能告诉你 那是一头大象 所以我觉得有一部分 我们就像 我们自然就构建它 或者把它从一个物体 移到另一个
[2324.360-2335.450] SPEAKER_02: 我们见过的 物体上 去想象 它会是什么样子 有人做过这个吗 通过增强? 比如, 想象所有可能性 被挡住的 比如普通东西 比如奇怪东西 但它们还是 物理上一致 所以,
[2335.750-2353.297] SPEAKER_00: 我是说, 人们确实会 有点像 基于遮挡的增强 也一样 所以你把 比如一个随机 比如盒子, 灰色盒子 来部分遮挡 图像某部分 而且这个东西呢 基本上就是 你有点遮住它了。 比如说, 你把它放在, 像是, 在人脸的一半位置。 所以就是说, 你知道,
[2353.377-2356.105] SPEAKER_00: 他们鼻子下面那部分 被挡住了,
[2356.405-2371.512] SPEAKER_02: 因为它是灰色的。 不, 我是说,比如 一张桌子, 你看不见 桌子后面, 而且你想象 有一堆 精灵。 带根香蕉 在桌子后头。 比如说, 我想知道管不管用。 有 想象力很丰富。 为了上网, 因为这办得到。 嗯, 也许不是精灵, 但像小狗
[2371.592-2389.114] SPEAKER_02: 和小猫 或者类似的东西。 只要有丰富的想象力, 就像 不停地 冒出 那种丰富的想象。 因为 从这个角度来说, 数据增强 现在正在用的 它特别厉害 很无聊 它很基础 数据增强 我想知道是不是 我想知道有没有 好处是 特别好想象 同时也在努力做到
[2389.194-2392.560] SPEAKER_02: 保持一致 和物理现实 我觉得这是个
[2392.860-2401.521] SPEAKER_00: 一种 鸡和蛋的问题 对吧 因为要有 像很棒的 数据增强 你得明白 场景是啥 对 我们正在试 做数据增强 去学一个场景
[2401.821-2417.589] SPEAKER_02: 到底是啥 所以基本上 就这样继续 在你明白前 只要把精灵和香蕉放一起 直到你知道 它不是真的 直到想象力 直到成年人 毁掉一切 好的 那什么是 不同种类 的数据增强 你见过的 挺有效的 在视觉智能里?
[2417.889-2432.357] SPEAKER_00: 比如说视觉, 有好多这种 图片过滤操作。 比如模糊 图片, 你知道, 各种各样的 Instagram滤镜 你能想到的。 比如说随意地 比如把红色 变得超级红, 把绿色 变得超级绿, 比如让图片饱和。
[2432.657-2434.909] SPEAKER_02: 旋转裁剪。 旋转裁剪。
[2435.209-2437.124] SPEAKER_00: 没错。 所有这些
[2437.424-2443.310] SPEAKER_02: 那种事。 灯光其实是个 对我来说挺有意思的东西。 感觉就像 做起来真的很复杂。
[2443.610-2461.401] SPEAKER_00: 所以呢他们不 那些增强 我们做的 没那么复杂。 它们不会变成 像物理上很逼真的 灯光效果。 并不是说 你假设 头顶有个光源 然后你移动它 往右 然后会发生什么 这东西看着像什么? 其实更多是关于 比如图像的亮度, 图像的整体亮度, 或者整体对比度,
[2461.701-2475.171] SPEAKER_02: 还有图像之类的。 可这真是一个 对我很重要的点。 我一直认为 数据增强 是关键 对巨大改进 在机器学习中。 而且好像 它是一个重要方面 自监督学习中的。 所以我想知道 有没有巨大的改进 可以实现
[2475.251-2490.543] SPEAKER_02: 在更多方面。 智能类型 做数据增强 比如说, 现在, 可能你得纠正我 如果我说错了, 数据增强 不是参数化的 没错。 你没在学习。 你没在学习。 在我看来, 好像 数据增强 可能 应该包括 更多学习 比学习
[2490.623-2506.708] SPEAKER_02: 过程本身。 对。 你差点 好像在思考 像在生成 有点像 是精灵们 拿着香蕉 你在尝试 就像特别活跃的 想象力 搞乱 与世界 还教导 那个机制 用来搞乱 与世界 让它成真 对 因为感觉像是
[2506.788-2519.619] SPEAKER_02: 我是说 这就是想象力 就像你说的 感觉就像 我们人类 能 有时候可能 下意识 想象 在看到东西之前 想象我们 想看到的 可能有 几种可能 尤其是 可能忘了 但年轻时 那些可能性 更狂野
[2519.699-2533.900] SPEAKER_02: 也更多 然后随着年纪变大 我们慢慢变得 理解世界 还有可能性 我们可能看到 越来越少了 而且更少了。 所以我想知道 你觉得还有 很多突破 还没实现 数据增强方面 也许还有, 你能就这点 评论一下吗? 那部分很重要吗?
[2534.200-2552.490] SPEAKER_00: 在自监督学习中? 是的。 所以数据增强 是关键 对自监督学习来说。 这有一种 增强 我们用的 基本上 其实我们想 学习这些 神经网络 它们在预测 这些特征 从图像里 这些特征很稳定 经过数据增强 一直是关键 在视觉中 自监督学习
[2552.570-2569.967] SPEAKER_00: 它们发挥 很基础 的作用 现在, 讽刺的是 所有这一切 是深度学习纯粹派 觉得你输入了 像素 给神经网络 它该自己找出来 模式 所以它真想 看边缘 它就该看边缘 你真的不该 用手工去做 这些特征 你不该去 教它看边缘
[2570.047-2587.812] SPEAKER_00: 所以数据增强 基本上算 属于同一类 为啥我们要 告诉网络 或者告诉整个这个 学习模式 哪种数据增强 我们在找什么? 我们在编码 有一种非常 人类特有的 偏差在那里 我们知道 事物是 比如 如果你改变 图像的其余部分 它应该还是个苹果 或者它仍然应该是
[2587.892-2605.135] SPEAKER_00: 是苹果不是香蕉 谢谢 基本上 如果我们改变 比如颜色 它仍然应该是 同类概念。 对。 当然, 这不是一个。 这感觉并不 很让人满意, 因为有很多 我们的知识 或者我们的监督 其实正在 进入数据增强里。 所以虽然我们叫它 自监督学习, 但很多人类知识
[2605.215-2613.980] SPEAKER_00: 其实被编码 在数据增强过程中。 这就像 我们有点 偷偷地 把监督转移了。 在输入端 这些好的点 数据增强列表 效果非常好。
[2614.280-2631.302] SPEAKER_02: 当然, 想法是 容易很多 设计一个列表 做数据增强 比实际做要容易。 所以人类在做, 但是, 干的活越来越少 还可以利用 他们的创造力 越来越多。 当我们说 数据增强 不是参数化的, 就是说它不是参数 学习过程的一部分。 你觉得有可能吗? 整合 一些数据增强
[2631.382-2633.553] SPEAKER_02: 到学习过程中? 我认为是这样。
[2633.853-2648.878] SPEAKER_00: 我认为是这样。 事实上, 这会非常 对我们有好处 因为 很多这些数据增强 我们在视觉中用的 非常极端。 比如, 比如你有 某些概念, 再次, 一根香蕉, 你拿起香蕉 然后基本上 你改颜色 香蕉的颜色,对吧? 所以你就把它变成 一个紫色香蕉 现在
[2648.958-2664.982] SPEAKER_00: 这个数据增强过程 其实是独立的 于 比如说 它不知道 对图像里 有什么 所以它能随便 改颜色 它也能把它变成 一个红色香蕉 而现在我们做的 就是告诉 所谓的神经网络 这个红色香蕉 还有裁剪图像 我改颜色的地方 变成紫色香蕉 应该是 特征得一样
[2665.062-2676.152] SPEAKER_00: 现在香蕉不是红色 也不是紫色 绝大多数情况 所以实际上 数据增强过程 得考虑 图像里有什么 还有哪些种类 物理现实 可行 不能完全 脱离图像本身
[2676.452-2683.255] SPEAKER_02: 你可能会大赚一笔 如果你 别用太激烈的手段, 而是做微妙的增强, 但得逼真。 对,逼真。
[2683.555-2686.585] SPEAKER_00: 我不确定是不是微妙, 但肯定要逼真。 如果逼真,
[2686.885-2690.391] SPEAKER_02: 那么哪怕是微妙的 增强 也会带来很大好处。 没错。
[2690.691-2706.134] SPEAKER_00: 是的。 而且它还会, 比如说, 针对特定领域, 你可能会看到, 比如, 举个例子, 我们现在做医学影像, 会有一些 比如某些类型 几何增强 其实并不会 很有效 对人体来说 嗯哼 所以如果你要 比如说实际把 数据增强 放进学习过程 它其实会
[2706.214-2721.158] SPEAKER_00: 更有用 现在 这会带我们 到一个半监督 类型设置 因为你想要 理解 你试图解决的是什么 问题 所以目前呢, 自监督学习 就像在 真实环境里运行,对吧? 所以你搞 自监督学习, 而纯粹派 和我们大家 基本都会说, 好吧, 它应该学到
[2721.238-2738.643] SPEAKER_00: 有用的表示, 而且这些表示要 适合任何最终任务, 不管是像 香蕉识别 还是自动驾驶。 现在呢, 这个要求挺高的。 也许先走一小步。 对我们来说呢, 那个,好吧, 如果你想循环 数据增强 到学习过程里, 那我们至少 得有个概念 到底想做什么。 是要区分 不同种类的 香蕉,
[2738.723-2746.490] SPEAKER_00: 还是区分 香蕉和苹果, 还是想 同时做这些? 所以对于 比如, 最终结果的概念 其实能帮我们做得更好 好得多。 在这边
[2746.790-2761.397] SPEAKER_02: 我问你 一个荒谬的问题 如果我要给你 比如一个黑盒子 比如一个选择 你可以拥有任意一个 大型数据集 真实自然数据 和真正好的 数据增强算法相比 你更喜欢哪个 来用 你想用哪个 用自我监督训练 呢
[2761.477-2773.971] SPEAKER_02: 所以自然数据 来自互联网 任意大的 也就是无限数据 或者说,就像 更可控 好的数据增强 数据集有限的时候 问题是,就像 因为我们的学习 视觉算法 现在 特别依赖
[2774.271-2782.351] SPEAKER_00: 数据增强 就算你 给我,比方说 无限多的 那种 图像数据 我还是需要 好的数据增强 算法 你得有个东西 来告诉你
[2782.651-2785.402] SPEAKER_02: 那两件事 很像 对
[2785.702-2805.757] SPEAKER_00: 所以有些东西 因为你给了 我一个任意的 大数据集 我还是要使用 数据增强 来拿到那张图 构造,比如 它的这两个扰动 然后从中学 所以问题是 我们的学习模式 目前还很原始 就算你 给我很多图片 就算你是 给我很多图片 还是没什么用。 一个不错的数据增强 算法其实
[2805.837-2818.343] SPEAKER_00: 会更有用。 所以你可以,比如, 减少 数据量 你给我的 比如十倍。 但如果你给我 一个靠谱的数据增强 算法, 那给我,比如, 十倍大小的 那个数据, 但我只能依赖 比如,一个很原始的 数据增强方法。
[2818.643-2830.987] SPEAKER_02: 比如,通过标注 以及各种方法。 事物呢, 有没有办法 找到事物 语义上 网上相似的? 肯定有, 但它们可能 很嘈杂。 对。 但差异 可能更远 比你能接受的 觉得舒服的。
[2831.287-2845.778] SPEAKER_00: 所以说,对, 标签很有帮助。 它其实会 帮很多 搞清楚 哪些图片 相关还是无关。 然后,所以 但是最纯粹的 会争辩说 当你用 人类标签 因为这些标签 就像是监督 这是真的真的 自监督学习吗? 是的。 因为你用 人类标签 来确定
[2845.858-2848.412] SPEAKER_00: 哪些图像就像
[2848.712-2851.103] SPEAKER_02: 相似的。 标签无滤镜
[2851.403-2865.291] SPEAKER_00: 意味着很多事。 是的。 我是说有些 特定标签 会是 几乎能用上 任何东西。 所以它们挺 对学习没用。 对。 但我的意思是, 有些标签 其实像是, 眼睛滤镜, 比如, 或者泰姬陵, 而且它们都是, 我是说, 都是人在监督。
[2865.591-2880.013] SPEAKER_02: 对。 这是其中一个任务 发现 从人类数据里 强信号 可以被利用的 用于自我监督 就像,人类正在做 已经做了很多工作 就像,很多年前 有一些东西 被称为, 我猜, 人类计算 在当时 人类正在做
[2880.093-2898.474] SPEAKER_02: 那么多工作 那会令人兴奋 去发现 利用的方法 他们正在做的工作 来教机器 没有任何 他们的额外努力 举个例子,可能是 像我们说的, 开车。 人在开车 机器能学习 从开车中学习。 我一直希望 能有 某种监督信号 在游戏里被发现 因为有很多 人玩
[2898.554-2908.947] SPEAKER_02: 电子游戏 感觉就像 这么多努力 投在游戏里, 投在玩游戏上, 你可以设计 游戏 成本不高地 来包含 任何信号 你想要的 感觉就像 那可能 被某种方式利用了
[2909.247-2921.196] SPEAKER_00: 所以大家都在利用这个 比如其实有 在这儿的人 在UT Austin 比如Philip Graham 是位教授 在UT Austin 他一直在,比如 研究电子游戏 当监督信号用 我是说,这很有趣 比如作为博士生 基本可以 玩电子游戏 一整天
[2921.496-2936.220] SPEAKER_02: 对。 所以我真的希望 那种事能扩展。 还有比如 最后, 说白了是 发现了 一些不可否认的 很好的信号。 就像 NLP里的掩码。 对。 但就算这样, 有哪些 非对比方法? 对。 什么 非对比 基于能量的 自监督
[2936.300-2940.409] SPEAKER_02: 学习方法 看起来像什么? 它们为啥有前景?
[2940.709-2954.899] SPEAKER_00: 所以, 就像我说的,关于 对比学习, 你懂这个概念 正例 还有负例。 现在, 问题是, 这种学习方式 真的需要 用到大量 负例 来学习 一个好的 特征空间。 想法是, 如果我告诉你, 好的, 有只猫 和一根香蕉
[2954.979-2967.787] SPEAKER_00: 很不一样。 问题是, 这是个相当 简单的比方, 对吧? 因为, 嗯, 香蕉看起来 跟猫狗 做的事 很不一样。 所以很快, 如果这是 我给你的唯一 监督信息, 你的学习 就不会是 比如说 到某个节点后 神经网络
[2967.867-2981.476] SPEAKER_00: 真的不会 学到太多 因为负样本 你得到的 会很随机 所以可能是 哦 一只猫和一只狗 和一只猫 和一只熊 问题是 相比之下 对于学习 的质量 负样本 确实非常重要 所以 发生了什么 基本上 通常
[2981.556-2995.061] SPEAKER_00: 这些方法 对比方法 确实得访问 很多负样本 这变得 越来越难 用某种方式扩展 当设计 一个学习算法的时候 所以这就是 一个原因 为什么非对比方法 变得 就像 流行 还有为什么大家认为 它们会 来看这两个样本。
[2995.141-2999.552] SPEAKER_00: 猫和狗是这张图片的两个裁剪部分。 它们属于同一个聚类。
[2999.632-3012.022] SPEAKER_00: 本质是在线做聚类。 训练这个网络时, 这和能访问 大量负样本完全不同。 另一个流行的方法 叫自蒸馏。 基本思想是有一个教师网络 和一个学生网络。 教师网络生成一个特征。
[3012.102-3024.353] SPEAKER_00: 它接收图像 神经网络找出模式, 提取特征。 还有另一个网络, 也就是学生网络, 它也会生成特征。 现在你是在说 教师网络生成的特征 学生网络应该挺像的。 没错。
[3024.653-3026.266] SPEAKER_02: 不再有负面概念。
[3026.566-3038.898] SPEAKER_00: 对。 所以核心是让 这两个特征尽量相似。 我现在要找出 怎么弄出两个并行网络, 学生网络和教师网络。 研究人员已经找到 很省钱的方法。 等于白送, 两种神经网络。
[3038.978-3043.250] SPEAKER_00: 它们有些关联, 但差别足够大, 你基本就能 设一个学习任务。
[3043.550-3046.417] SPEAKER_02: 这样它们始终有差别, 不会变得无聊。
[3046.717-3057.029] SPEAKER_00: 正是这样。 自监督学习的最大敌人是崩溃。 任何相似性最大化都会引发崩溃。 崩溃就是你学到相同的特征。 所有事物都得到相同的表征。 这完全没用。
[3057.329-3059.395] SPEAKER_02: 一切都是香蕉。
[3059.695-3073.583] SPEAKER_00: 全都是香蕉。 全都是猫。 全都是车。 没错。 我们要做的就是提出方法。 防止崩溃的方法。 对比学习就是一种方法。 再举个例子。 比如聚类或自蒸馏。 还有其他方法。 我们最近一篇论文用了类似去相关的方法。
[3073.663-3080.524] SPEAKER_00: 在两套特征间去相关来防止崩溃。 这个想法受到了一点启发。 来自霍勒斯·巴洛的神经科学原理。
[3080.824-3088.463] SPEAKER_02: 对了, 我来评一下,谁统计了这次对话里 用了香蕉、苹果、猫、狗这些词的次数, 谁就赢了互联网。 祝你成功!
[3088.543-3098.063] SPEAKER_02: SWAV是什么,论文的主要改进呢? 关于用对比聚类分配做视觉特征监督学习? SWAV主要是一种基于聚类的方法,
[3098.363-3110.393] SPEAKER_00: 再说一遍,它用于 视觉中的自监督学习。 我们有两个裁剪块, 基本思路是,你希望 同图的两个裁剪块特征在同一聚类里, 而不同图像的裁剪块 就在不同聚类里。
[3110.473-3126.671] SPEAKER_00: 通常,某种程度上, 如果你要做这种聚类, 你会离线做聚类。 也就是说你会—— 也就是说你会, 如果你有N个样本的数据集, 你会遍历所有这N个样本, 提取特征,做聚类。 所以基本得到一些簇。 然后重复这个过程。 再次重复这个过程。
[3126.751-3140.395] SPEAKER_00: 所以这基本是离线方式, 因为要遍历一遍数据 来计算它的簇。 SWAV基本就是一种在线完成的简单方法。 所以当遍历数据时, 你实际上在线计算这些簇。 当然,这有很多技巧, 关于如何稳健进行而不崩溃。
[3140.475-3143.226] SPEAKER_00: 但这就是它的关键思路。
[3143.526-3147.310] SPEAKER_02: 有没有好办法描述关键方法论? 这种聚类方法怎么实现的?
[3147.610-3160.778] SPEAKER_00: 没错,基本思想是, 当你有N个样本时, 假设我们可以拿到,比如, 数据集里始终有K个聚类。 K是一个固定数字。 比如K等于3000。 所以,如果你有... 当你随便看少量样本时,
[3160.858-3165.687] SPEAKER_00: 它们都必须属于这些K个聚类之一。 我们加了这种等分约束。 意思就是,
[3165.767-3179.759] SPEAKER_00: 全部N个样本 要平均分成K个聚类。 所以所有K个聚类大小差不多, 对这N个样本贡献一样。 这就能防止坍缩。 坍缩指的是, 所有样本都挤到一个聚类里,对吧? 如果所有特征都变得一样, 那就只剩一个巨型聚类了。
[3179.839-3193.889] SPEAKER_00: 连10个或3000个聚类都没了。 所以SWAV确保每个时刻, 这3000个聚类全都被用到。 聚类的时候。 就这样。 主要就是搞清楚怎么在线做。 然后——嗯哼。 所以再说一遍,只要确保。 同一张图的两个裁剪块。
[3193.969-3196.534] SPEAKER_00: 属于同一个类,其他不是。
[3196.834-3199.179] SPEAKER_02: 固定K值让事情更简单。
[3199.479-3211.463] SPEAKER_00: 固定K值简化了事情。 我们的聚类不是硬聚类, 而是软聚类。 所以你有0.2的概率属于类一, 0.8的概率属于类二。 所以它并不严格。 所以就算有3000个类, 实际上能代表很多类。
[3211.763-3214.108] SPEAKER_02: 什么是SEER,S-E-E-R?
[3214.188-3222.965] SPEAKER_02: 还有论文《视觉特征在野外自监督预训练》 关键结果和见解是什么? 在野外呢? 这个庞大的SEER系统到底是什么?
[3223.265-3241.146] SPEAKER_00: SEER,所以我先选SWAV 因为SWAV是SEER的关键部分。 专门用于SEER。 我们用SWAV的时候, 是在ImageNet上演示的。 自监督方法通常就像 我们研究圈有点 作弊。 我们拿ImageNet,当然,刚说了, 有点作弊。 我们拿ImageNet,当然,刚说了, 我们拿ImageNet,当然,刚说了,
[3241.226-3253.477] SPEAKER_00: 它有很多标签, 然后我们扔掉标签, 就像扔掉所有辛苦工作 背后标注的过程, 假装是自监督,像是无监督。 但问题在于,我们有, 比如收集这些图像时, ImageNet数据集有特定分布
[3253.557-3258.282] SPEAKER_00: 这个概念,对吧? 所以这些图像都精心策划过 也就是说,这些图像
[3258.362-3272.192] SPEAKER_00: 当然属于一类名词概念 而且ImageNet还有这种偏向 所有图像都包含一个物体 物体很大,通常都在中心 所以说到狗,它构图很好 它靠近图片中心 因此,很多数据增强 很多自监督学习中的 隐藏假设
[3272.272-3280.549] SPEAKER_00: 其实都用了ImageNet的偏向 所以,我的很多工作 还有其他很多人的工作 总把ImageNet当基准 来展示自监督学习的成功
[3280.849-3283.983] SPEAKER_02: 所以你在暗示这种数据集 有特定局限性?
[3284.283-3292.502] SPEAKER_00: 对,我是说,基本上 因为我们搞的数据增强 就像我们给自监督、视觉做的增强 它们有点过拟合ImageNet 但你说有点写死
[3292.802-3296.006] SPEAKER_02: 比如裁剪方面 对,裁剪参数
[3296.306-3301.449] SPEAKER_00: 我们用的光照类型 我们用的模糊类型 对,但真实世界的数据集
[3301.749-3307.449] SPEAKER_02: 你要更聪明或更小心 来设定参数范围 还有这类东西 所以对Seer,主要目标有两个
[3307.749-3320.174] SPEAKER_00: 第一,基本要远离ImageNet训练 所以我们用未筛选的图像 现在有很多争议 它们到底筛没筛过 但我等会儿会讲 那个我后面再聊 但基本思路就是, 就是随机从网上抓的图 我们不会刻意筛选
[3320.254-3332.923] SPEAKER_00: 按特定类别来。 所以我们没说,比如只挑狗图片 和猫的图才能入选, 香蕉也能进来。 而其他图片 就直接不要了。 所以我们没这么干。 就是随机网上图片。 当然这也回到了规模问题 你提到的那个。
[3333.003-3350.408] SPEAKER_00: 所以大概有十亿张图片。 而Context ImageNet呢, 我们用的ImageNet版本 之前只有100万张图片。 所以这大约是 多了三个数量级。 这么做就是为了看看 如果我们能训练一个很大的卷积模型 用自监督方式在没整理过的 但确实非常大的图像集上
[3350.488-3364.434] SPEAKER_00: 那这个模型的表现会怎样 自监督学习真的过拟合ImageNet了吗 还是它能在真实场景里工作 也是出于好奇心 这个模型能学到什么 它还能不能识别出 不同类型的物体等等 会不会有特定的任务
[3364.514-3379.121] SPEAKER_00: 它比ImageNet训练的模型做得更好 所以对于Seer我们的主要发现之一是 我们其实可以训练很大的模型 用完全自监督的方式 在大量互联网图像上 不一定非要过滤掉它们 这本身就是好事 因为这个过程很简单对吧
[3379.201-3392.508] SPEAKER_00: 所以你得到的上传的图像 基本上能立刻用上 用无监督方式训练模型 不用坐下来手动筛选 可以是卡通、表情包、 或者真人上传的照片 你根本不在乎是什么图 甚至不在乎里面有什么 所以这个设置很简单
[3392.808-3396.836] SPEAKER_02: 那有没有什么图像筛选机制 是过程中自带的呢?
[3396.916-3402.906] SPEAKER_02: 你意思是几乎没这种机制, 但要是仔细想想, 你觉得存在什么样的机制?
[3403.206-3415.735] SPEAKER_00: 对,也不是完全没筛选, 想象一种毫无筛选的方式, 基本就像摄像机 能从任意角度拍照 人们上传图片到网上时, 通常会在意构图。 不会上传那种,比如—— 比如一张放大到整面墙的照片。
[3416.035-3420.365] SPEAKER_02: 嗯,说到互联网的时候, 你是指社交网络吗? 对,好的。
[3420.665-3439.629] SPEAKER_00: 所以这些并不是照片或图像。 所以这些并不是照片或图像。 比如一张放大的桌子或一面墙。 所以不是完全没筛选过。 因为人们确实有摄影师的偏好, 他们确实想把东西 稍微偏向中心一点, 或者,比如说,一定要有,你知道, 照片里有好看的东西之类的。 这就是这类数据集里常见的那种 偏差。
[3439.709-3450.404] SPEAKER_00: 还有用户群体,对吧? 你得不到很多照片 来自世界不同地方, 因为世界上有些地方 人们可能根本没在上传。 大量图片上传到网上 甚至可能看不了很多网络内容。
[3450.704-3459.539] SPEAKER_02: 所以这是一个巨大的 一个数据集和巨大的神经网络。 我不觉得我们讨论过哪些架构 在自监督学习中效果很好。
[3459.839-3475.503] SPEAKER_00: 对于Seer和Swap 我们用卷积网络 但最近在Dyno这个工作中 我们用Transformer处理视觉任务。 两者表现都不错, 卷积网络和Transformer, 根据你的需求 你可能会选特定形式。 所以Seer是卷积网络。 特别是RegNet模型, 这也是一个工作
[3475.583-3488.194] SPEAKER_00: 来自Facebook。 RegNets计算量和准确度很好。 说到计算和准确性 因为这个模型效率很高, 计算和内存都高效, 扩展性也非常好。 所以我们用了很大的RegNet模型, 在十亿张图上训练。
[3488.494-3490.142] SPEAKER_02: 简单介绍一下RegNet?
[3490.222-3493.287] SPEAKER_02: 它来自这篇论文, 《设计网络设计空间》。
[3493.587-3494.260] SPEAKER_00: 对。
[3494.560-3499.203] SPEAKER_02: 这个概念很有趣, 讲如何构建高效神经网络。 对。 大型神经网络。
[3499.503-3513.611] SPEAKER_00: 这篇论文的关键收获, 作者们, 听他们介绍这个工作时, 他们总说神经网络 都用FLOPs来衡量,对吧? FLOPs就是浮点运算次数。 大家很喜欢用FLOPs。 这个模型计算量非常大。 我们的模型计算量很小。
[3513.691-3526.394] SPEAKER_00: 事实证明,FLOPs不是好指标。 用来衡量网络好坏。 比如它有多高效。 更好的指标是 激活值或内存 这个模型用了多少。 所以设计中的一个关键发现 来自这篇论文,简单说就是 你要设计网络系列
[3526.474-3539.920] SPEAKER_00: 或神经网络架构 这些架构非常高效 在内存空间上也一样。 不只是看FLOPs。 所以RegNet就是一个网络架构系列 出自这篇论文 它在FLOPs和 内存方面都特别出色。 当然,它建立在早期工作上。 比如更流行的ResNet,
[3540.000-3555.420] SPEAKER_00: 它的流行带来了启发。 其中有残差连接。 但关键是要点其实是 他们还用了类似SE模块。 所以技术创新很多。 这些都来自之前的工作。 还有作者们的巧思。 怎么组合这些模块。 但核心约束是优化 浮点运算次数和内存。
[3555.500-3558.890] SPEAKER_00: 基本上,你这么做了, 别只看浮点运算次数。
[3559.190-3565.517] SPEAKER_02: 那能让你做什么呢? 拥有一个非常大的网络。 通过这个过程, 优化到低水平,提升效率。
[3565.817-3580.912] SPEAKER_00: 为了降低内存。 对,单从硬件来说, 它们很适合GPU内存。 所以它们非常强大 神经网络参数多,架构大 需要大量浮点运算 但也因为效率高 从内存使用看 实际能装很多这种模型 比如一个超大的模型 能放在单张GPU上
[3581.212-3589.838] SPEAKER_02: 你会说,选架构 比选数据更重要吗? 数据增强技术呢? 能说哪个更重要吗? 你暗示说,光用基本卷积 就能走很远
[3590.138-3603.050] SPEAKER_00: 我觉得数据和增强 自监督训练算法 比具体架构重要得多 用不同架构 会得到不同特性 在最终表征里 其实吧,秘诀就是 数据增强, 还有训练算法。 嗯哼。
[3603.130-3607.576] SPEAKER_00: 这些架构呢,到这会儿, 表现都差不多, 就看具体任务, 各有优缺点。
[3607.876-3617.372] SPEAKER_02: 有没有什么有趣的 跟Sears合作, 训练超大神经网络的事? 你要处理海量数据, 超大的网络。 有没有什么有趣的 关于咋样快速高效训练?
[3617.672-3618.925] SPEAKER_00: 大量GPU。
[3619.225-3619.817] SPEAKER_02: 好。
[3620.117-3634.202] SPEAKER_00: 这个模型嘛,就像,哦,就像, 大概有十亿个参数。 对。 它是用十亿张图像训练的。 对。 所以基本上,参数的数量 和图像数量一样,花了些时间。 确切数字记不清,论文里有写, 但确实花了时间。
[3634.502-3636.092] SPEAKER_02: 我想说的是,
[3636.172-3645.251] SPEAKER_02: 当考虑扩展这些时, 一个很让人兴奋的可能性 是自监督学习。 能扩展几个数量级, 包括神经网络 和数据规模。 所以问题是,
[3645.331-3652.053] SPEAKER_02: 有没有什么有趣的技巧 来做大规模分布式计算, 还是已超出深度学习范畴? 这更像硬件工程的问题。
[3652.353-3665.254] SPEAKER_00: 我觉得越来越多 系统被设计出来。 考虑到 机器学习的需求,对吧? 因为每次你在运行 分布式训练时,会有很多 节点间互相通信。 比如传递梯度或参数。 所以你要尽量降低通信成本。
[3665.334-3673.971] SPEAKER_00: 当你想扩大模型规模时。 你希望通信量 尽可能小。 目前的主流范式 是同步训练。 每次梯度计算后 你都要同步一次,
[3674.051-3686.464] SPEAKER_00: 在所有芯片之间 你训练的那些。 异步训练以前流行过, 但效果好像没以前好了。 不过总的来说,我觉得有点像 这个超出我知识范围了,嗯。 但主要是尽量少。
[3686.544-3692.430] SPEAKER_00: 需要的同步步骤数。 依我经验,这是关键。 至于别人,我完全不会设计芯片。
[3692.730-3706.734] SPEAKER_02: 是的,很少有事。 能让吉姆·凯勒眼睛像 讨论巨型计算机那样亮起来。 比如你提到的快速通信。 训练机器学习系统时。 VSL是什么?就是V-I-S-S-L,基于PyTorch的SSL库。
[3706.814-3708.265] SPEAKER_02: 它有哪些用例?
[3708.565-3724.066] SPEAKER_00: VSL主要来自我们Facebook团队。 做自监督学习研究。 所以它是个通用框架,我们实现了许多。 用于视觉的自监督学习方法。 它还有一个基准测试,比如, 它还有个基准测试,类似, 一组可以评估的任务。 评估自监督表示。
[3724.146-3739.546] SPEAKER_00: 所以它的用例基本人人都能用。 要么在评估自监督模型 要么训练自监督模型 或是试图构建 新自监督技术的研究者 所以基本涵盖所有方面 比如在VSL之前的研究者 或者刚开始认真做时
[3739.626-3753.632] SPEAKER_00: 在Facebook,我们很难 实现每个自监督模型 用一致方式测试 方法一致 实验设置差异很大 不同团队之间 即使有人说报告 ImageNet准确率也意义不同 所以用VSL,我们尽力标准化 尽量多
[3753.712-3768.981] SPEAKER_00: 还有我们2019年的论文 只是基准测试 所以VSL基于很多这类工作 我们做了些基准测试之类的事。 每次我们像这样尝试时, 我们提出了一种自监督学习方法, 很多人想把它推广到VSL中, 让它成为核心部分, 很多方法都能用。
[3769.281-3780.554] SPEAKER_02: 纯粹好奇,大家可能, 在Facebook之外,研究人员, 或者懂Python编程的人, 会用PyTorch,用例是什么? 在VSL上能玩什么有趣的东西? 比如,什么好玩,
[3780.634-3789.097] SPEAKER_02: 自监督学习方面,你会怎么说? 有没有好的hello world程序? 是不是总得大规模? 或者有没有小规模的游乐场, 可以玩玩?
[3789.397-3802.762] SPEAKER_00: 我们正朝那个方向推。 我觉得有些设置, 但小规模上没标准。 我是说,ImageNet本身就很大。 所以这不可行。 对很多人来说, 但我们试图推动 一些小案例。 问题是,在小规模下,
[3802.842-3817.949] SPEAKER_00: 很多观察结果 或者很多有效算法 不一定能转化 到中等或更大规模。 所以得想出 一个好的小规模设置非常棘手。 因为你的很多经验观察 才能用到其他设置。 所以这很有挑战性。 我也一直尝试这样做, 因为ImageNet训练很耗时。
[3818.029-3831.743] SPEAKER_00: 训练更多图像确实需要时间。 但每次我尝试这样做, 都不成功,因为所有观察 从小数据集实验我得出结论 别直接套用到ImageNet 也别用到其他数据集 所以对我们来说很难 我非得搞明白这个 但这是个重要问题
[3832.043-3846.836] SPEAKER_02: 所以有个很有趣的想法 叫做跨模态学习 你有篇CVPR 2021最佳论文候选 题目叫《视听实例判别》 和跨模态一致性 这篇论文的关键结果和见解是什么 以及总的来说你怎么看
[3846.916-3850.259] SPEAKER_02: 关于多模态学习的潜力和威力
[3850.559-3866.420] SPEAKER_00: 对于这篇论文 其实让我有点惊讶 效果竟然这么好 我先说说问题设置 之前很多人用过这个 比如MIT的Andrew Owens 来自伯克利的Alyosha Efros 来自牛津的Andrew Zisterman 很多人展示了某种结果 在这方面 当然我知道这个结果
[3866.500-3877.497] SPEAKER_00: 不太确定实际效果如何 比如其他下游任务 结果越来越好 我不确定自监督学习的很多见解 能否转化到 多模态学习问题 多模态学习就是当你拥有 多种模态时
[3877.577-3892.080] SPEAKER_00: 这还差得远呢 好 我们研究的具体模态 是音频和视频 基本想法是如果你有一个视频 你就有对应的音频轨道 你想同时使用这两种信号 音频和视频信号 学习视频的好表示 还有音频的好表示
[3892.380-3894.249] SPEAKER_02: 比如这个播客。
[3894.549-3910.770] SPEAKER_00: 就是这个播客,没错。 这个工作中,我们训练了 两个不同的神经网络, 一个针对视频,一个针对音频, 我们基本上想要的是 从这两个神经网络得到的特征 应该是相似的 所以它基本上能产生 从视频提取相同特征 也从音频提取相同特征
[3910.850-3925.666] SPEAKER_00: 那这有什么用呢? 嗯,很多物体 它们都有独特的声音,对吧? 比如火车经过时, 会发出特有的声音 船也会发出特有的声音 人们跳来跳去时 就会大喊大叫什么的。 香蕉不会出声。 所以,你没法从那里了解香蕉的信息。
[3925.966-3928.276] SPEAKER_02: 或者人类提到香蕉的时候。
[3928.576-3930.689] SPEAKER_00: 嗯,他们说‘香蕉’时,那么——
[3930.989-3936.190] SPEAKER_02: 所以你基本不能相信 任何人类嘴里说出的信息源, 那个音频源没用。
[3936.490-3953.512] SPEAKER_00: 所以典型用例就像, 比如,有人演奏乐器。 吉他有特定的声音,等等。 因为很多事情都有关联, 多模态学习的理念 就是同时利用两种模态, 视频和音频,学习共同的嵌入空间, 一个共同特征空间, 这样这两种相关的模态 基本上就靠在一起。
[3953.592-3967.689] SPEAKER_00: 而且,再次,用对比学习来实现。 所以在对比学习中, 视频和对应音频就是正例 随便取别的视频或音频 那就是负例 差不多就这样 这就是对比学习的简单应用 我们工作的主要发现
[3967.769-3979.799] SPEAKER_00: 实际上可以学到 特别强大的特征表示 特别强大的视频表示 所以能学到那种视频网络 最终学到的网络可以用于 下游任务,比如识别人类动作 或识别不同类型的声音
[3979.879-3982.154] SPEAKER_00: 这就是关键发现
[3982.454-3986.784] SPEAKER_02: 能给个人体动作的例子吗 或者为了建立直觉 大概是哪些事
[3987.084-4000.205] SPEAKER_00: 有个叫Kinetics的数据集 比如它大约有400种不同类型 的人体动作 人们跳跃,做各种运动 或者各种游泳 比如不同泳姿、高尔夫这些 就有各种不同的动作 关键是这个视频网络 通过自监督学习
[4000.285-4004.836] SPEAKER_00: 能轻松用来识别 这些不同的动作 它还能识别 各种物体
[4004.916-4015.808] SPEAKER_00: 我们想可视化 网络能不能找到 声音从哪里来 比如给一段视频播放 一个人弹吉他的视频 当然视频里没声音 给它吉他的声音 然后让它尝试可视化 网络的位置
[4015.888-4028.870] SPEAKER_00: 网络判断声音来源,并像可视化那样画出来 你看它主要聚焦吉他,对,同样的事,比如 对某些人的声音,比如名人,它能找出声音来源 比如嘴的位置,所以它能区分不同人的声音
[4029.170-4032.316] SPEAKER_02: 比如也有一点,从未标注过,对吧,所以这是
[4032.616-4042.252] SPEAKER_00: 它发现的所有东西,我们从不说这是吉他,这是 它产生的声音,它自然能找出,因为它看到如此 这种声音和物体的很多关联,它基本学会了
[4042.552-4052.385] SPEAKER_02: 将声音和物体关联起来,对,真的很迷人 对,很有趣,所以这种网络,你后来微调它 为特定任务,对吧,在神经网络中形成很好的知识库
[4052.465-4056.516] SPEAKER_02: 基于这个,你再训练一点,就能很好完成特定任务
[4056.816-4060.786] SPEAKER_00: 正是这样,所以不需大量标注人类动作视频,只用
[4061.086-4074.358] SPEAKER_02: 几个就能基本识别。你从这样的事实得到多少洞察: 你能找出声音来源,我试着理解,所以这有点 这是非常CVPR的漂亮,对吧,一个很酷的洞察,我想知道多深刻
[4074.438-4087.606] SPEAKER_02: 你知道,它是否说明多模态 某种程度上比各部分之和大得多,或者多模态真的非常有用 多模态,或者只是那个酷的东西,即世界的某些部分可以被
[4087.686-4091.795] SPEAKER_02: 通过多模态有效揭示,但大部分实际上都是关于
[4092.095-4100.221] SPEAKER_00: 视觉或其中一种模态。我会说有点倾向于第二部分,所以 可以大致弄清楚,多一种方式总有用。 比如,你看别人切东西时。
[4100.301-4108.300] SPEAKER_00: 没声音难分辨,听到声音就容易了。 因为声音特性完全不同。 靠声音判断容易得多。 多种信息让生活更简单。
[4108.380-4117.459] SPEAKER_00: 我这样关联,可能全错。 不对,分布假设说上下文赋予意义。 声音也一样,对吧?相同声音。 在不同视频上下文,很可能观察到。
[4117.539-4127.035] SPEAKER_00: 相同概念,所以能识别出吉他。 它在多个视频听到相同声音,判断。 这可能是共同因素。 我和父亲争论通用智能,气味重要吗?
[4127.335-4133.674] SPEAKER_02: 重要的感官,我们主要谈的是— 爱上AI,他认为嗅觉触觉重要。 我反驳说根本不重要,虽然好。
[4133.754-4142.089] SPEAKER_02: 仅语言就能爱上,声音更强大。 嗅觉不重要。能问主动学习过程吗? 气味不重要。嗯,主动学习过程能问一下吗?
[4142.169-4150.446] SPEAKER_02: 你提到交互性啦?自监督学习里它有价值吗? 在上下文中智能选择数据部分 让它们从学习过程受益
[4150.746-4153.172] SPEAKER_00: 对吧?我知道你是主动学习粉丝
[4153.472-4165.943] SPEAKER_02: 答案我知道,你先说香蕉,现在又说主动学习 我喜欢主动学习。Gianna Coon说它没那么有趣 但当时我不想争论,可当我们再聊 我们会花三小时争论主动学习。我觉得
[4166.023-4173.650] SPEAKER_02: 主动学习能走很远,也许比任何方法都远 有种直觉,像数据增强,你能从中得到很多
[4173.730-4180.417] SPEAKER_02: 数据来自智能优化使用,对吧?我试着泛泛地说 包括数据增强和主动学习,可能有些关于
[4180.497-4187.625] SPEAKER_02: 交互式探索数据,至少这部分是智能解决方案 的重要部分。你对主动学习怎么看?其实我
[4187.925-4201.174] SPEAKER_00: 真的很喜欢主动学习。之前我们做了篇CVPR论文,叫 “通过提问来学习”,就是训练一个智能体 对图像提问题,得到答案,然后更新自己 它看到下一张图,决定最难的问题,能学到最多
[4201.254-4212.599] SPEAKER_00: 因为它聪明地选择要问的问题类型 提问时用更少样本,更高效利用数据,我们确实做到了 发现其实这比随机提问要好。 主动学习也像先有鸡还是蛋,看图时…
[4212.679-4220.237] SPEAKER_00: 提出好问题需要理解图片,对吧? 不能问跟图片完全无关的随机问题。 所以主动学习时,其实在不断积累理解。 所以我认为主动
[4220.317-4229.837] SPEAKER_00: 学习本身很好,我们主要要搞清楚。 如何提出技术,先对已知建模,再对未知建模。 对未知建模,这正是魅力所在,因为你知道
[4229.917-4241.689] SPEAKER_00: 当完全不了解时,问这些问题 实际最有价值,也是核心挑战。 自监督学习本身,比如选数据等, 非常有用。 但这只是狭隘看主动学习,更广泛地
[4241.769-4249.675] SPEAKER_00: 它看模型对n个概念有没有知识,薄弱处 所以它需要提问,要么发现新概念, 要么增加相关知识。所以在这个层面上,
[4249.755-4257.382] SPEAKER_00: 它很强大,我觉得它非常有用,甚至 连数据标注这种简单事也很有用。 简单的主动学习方法,比如你有自监督模型。
[4257.462-4265.461] SPEAKER_00: 它很擅长预测相似和不同,所以如果 你给图打标签说是香蕉,那所有跟它很像的图 很可能也是香蕉,所以当你想
[4265.541-4277.896] SPEAKER_00: 理解其他香蕉时,你不会用那些图,你 而是用一张既不同又相近的图 它跟这张图既不太像也不太不像,这能告诉你 更多关于香蕉的信息,有点像启发法。我想知道是否
[4278.196-4285.382] SPEAKER_02: 能学会找到最有用、最可能的方式 不只是找和香蕉有点相似又不完全一样的 而是更复杂的
[4285.462-4291.789] SPEAKER_02: 学习系统,比如学习发现机制,告诉你该找什么图 比如具体怎么做?对,用自监督的方式
[4291.869-4295.758] SPEAKER_02: 严格学一个函数,判断这张图有没有用
[4296.058-4299.645] SPEAKER_00: 据我所知,这里有很多协同作用,嗯,我觉得是的
[4299.945-4308.710] SPEAKER_02: 这点会被研究,很相关,让我想到特斯拉 自动驾驶现在做的 现在作为一种主动学习,安德烈·卡帕蒂团队在做的
[4308.790-4319.169] SPEAKER_02: 叫数据引擎。对,你基本部署一批 神经网络到实际环境,收集大量边缘案例,这些案例 然后送回标注,特别是那些接近失败的边缘案例,或者
[4319.249-4323.091] SPEAKER_02: 某个任务上出现怪现象,反馈回来,就这样。
[4323.171-4336.037] SPEAKER_02: 不完全是香蕉案例,但差不多被送回标注,然后形成循环。 过程持续进行,不断重新训练,主动学习就在那里。 或者管它叫什么,其实是汽车自己在发回数据。
[4336.117-4350.202] SPEAKER_02: 比如这里发生了什么?很奇怪,你对这有什么看法? 在现实环境部署神经网络,另一种提问方式是从第一个问题开始。 你的想法可能是。 如果你想评论,自动驾驶有没有应用,比如基于计算机视觉?
[4350.282-4354.624] SPEAKER_02: 自动驾驶中,基于计算机视觉的自监督学习应用。
[4354.924-4364.655] SPEAKER_00: 自动驾驶?我认为是的。自监督学习要用于自动驾驶。 驾驶有很多机会。就像预测中的纯粹一致性是一种。 方式对吧?因为你有一连串好数据流入,一个视频流。
[4364.735-4379.145] SPEAKER_00: 当然,与汽车行动相关联,你可以形成非常好的。 预测模型来预测发生的事。比如一种可能的方式。 他们如何确定哪些数据需要标注?基本上通过预测。 不确定性对吧?你预测汽车会右转,这就是将要发生的动作。
[4379.225-4397.443] SPEAKER_00: 比如在影子模式下。现在驾驶员向左转了,这是一个。 非常大的意外。基本上,通过形成好预测模型,你是在,我的意思是。 这些有点像自监督的。 模型对吧?预测模型基本上只是通过观察将发生的事来训练。 让他们预测接下来会发生什么,这就是
[4397.523-4401.249] SPEAKER_00: 自我监督学习,观察数据来预测 就是个预测模型
[4401.549-4403.696] SPEAKER_02: 关于主动学习,您有什么发现?
[4403.776-4407.526] SPEAKER_02: 比如系统部署后表现不如预期 然后重新训练系统?
[4407.826-4416.127] SPEAKER_00: 我觉得这确实 引起了共鸣,很明智。任何实际系统 比如自动驾驶,边缘情况才是关键 问题所在,对吧?高速驾驶基本上
[4416.207-4422.813] SPEAKER_00: 这部分长期取得了成功 大概从八十年代开始 关键是这些失败案例让自动驾驶还没
[4422.893-4428.639] SPEAKER_00: 普及到每辆车。所以通过 扩大问题范围,快速找出边缘情况 然后用它们改进模型,非常聪明
[4428.719-4431.366] SPEAKER_00: 用预测不确定性来做,很棒的方法
[4431.666-4439.491] SPEAKER_02: 考考你,我们提到过Jitendra Malik,他认为 特斯拉或任何自动驾驶方法,都还很远
[4439.571-4446.339] SPEAKER_02: 如果让你赌一把,还需要多少年? 只靠计算机视觉和机器学习的自动驾驶方案 方法呢?
[4446.639-4452.548] SPEAKER_00: 好,那解决自动驾驶是什么意思?在美国吗? 在印度呢?我跟你说,那边驾驶情况完全不同。
[4452.848-4466.457] SPEAKER_02: 不是印度也不是俄罗斯。在美国,自动驾驶所谓的解决,意思是当 汽车声称它接管了控制时, 它负全责。你可以睡觉,车自己开。这包括高速和城市
[4466.537-4473.619] SPEAKER_02: 但不是所有地方,是大部分。而且好很多。比如 事故率是人类的五分之一,足够安全,让大家觉得
[4473.699-4478.621] SPEAKER_02: 这种转变有吸引力、有好处,不管对安全、经济还是别的 方面考虑。
[4478.921-4492.124] SPEAKER_00: 好,首先,免责声明。 免责声明:我不是自动驾驶专家。我得说明一下。呃,我 觉得至少五到十年,这是我现在的猜测。 嗯,其实我印象很深。比如最近坐朋友特斯拉时,
[4492.204-4505.767] SPEAKER_00: 当然,呃,看着屏幕,它基本显示了所有 检测结果和行驶中的一切操作。 这让我很分心,因为我一直看那些 边界框和它跟踪的车辆。这真的很厉害。尤其是 下雨天还能做到,这是我觉得最了不起的。
[4505.847-4520.199] SPEAKER_00: 其实它能穿透雨水做到这点。原因之一是,像 我们很多人,包括我,相信是激光雷达的,呃,某种 自动驾驶是关键推动力,对吧?Waymo一直在用 它很长时间。然后特斯拉决定走完全不同路线,哦
[4520.279-4536.280] SPEAKER_00: 我们连激光雷达都不用。所以最初系统基于摄像头和雷达 现在他们实际上在转向全视觉系统。所以那简直是 听起来太疯狂了。激光雷达在低能见度时很有用, 呃,当然它也有自身问题,但现在看到 这种情况在真实特斯拉上发生,基本证明大家都错了。我
[4536.360-4546.916] SPEAKER_00: 可以说某种程度上,效果非常好。 摄像头技术也进步很多。比如, 我知道卡内基梅隆大学开发了一种特殊摄像头, 它在低能见度下表现很好。比如大雪
[4546.996-4558.922] SPEAKER_00: 和大雨时,它仍能保持不错能见度。而且我认为 传感器本身会有很多这样的创新, 这会让未来变得非常容易。 所以也许这就是我对视觉自动驾驶更乐观的原因。
[4559.002-4572.623] SPEAKER_00: 我想叫它自我监督驾驶,但其实是视觉自动驾驶。 这就是我这么乐观的原因,因为会有很多 这就是我相当乐观的原因,因为会有很多 这些进步中 嗯嗯嗯嗯嗯。 传感器本身。拿到这些数据,我们就能好很多。
[4572.703-4581.038] SPEAKER_00: 更好。当然,一旦能像安德烈说的那样涵盖所有边缘情况,我们就能走很远。 是的。挺有意思,我同意你说的五到十年,可能十年。但是
[4581.338-4589.824] SPEAKER_02: 你说的……我不确定你怎么说的,但有人觉得远,有人觉得近,然后 它可能看起来很接近。 有不少基本问题。 这里面有多少博弈论?
[4589.904-4604.593] SPEAKER_02: 比如这多大程度上只是碰撞避免问题? 以及多大程度上你还在和场景里其他人互动? 并且你想创造引人入胜的体验? 所以你希望快速从A点到B点, 你想要安全地导航场景, 但你也需要表现出一些侵略性
[4604.673-4620.302] SPEAKER_02: 因为,嗯,当然这就是为什么你在印度会倒霉。 因为你需要表现出侵略性。 但也要展现出一些攻击性。 因为,嗯,显然这就是你在印度会完蛋。 因为你必须表现出攻击性。 要么泽西岛,要么新泽西。 或者泽西,对吧。
[4620.382-4630.972] SPEAKER_02: 比如纽约或者任何主要城市。 但我觉得可能是埃隆。 我最常聊这个。 这让我惊讶他们 没把人类当大问题 在这个问题中是来源。 比如开车是根本。
[4631.052-4642.803] SPEAKER_02: 其实是机器人对机器人 跟环境问题相对 比如你可以认为人类 不是问题的一部分。 我以前觉得人类几乎肯定 必须被好好建模。 行人、骑车人和其他车里的人,
[4642.883-4647.468] SPEAKER_02: 你得给他们建心理模型。 不能只把它们当物体。 但越来越多,就像,
[4647.548-4666.939] SPEAKER_02: 这也是一种反直觉的东西。 那就是自监督学习,对吧? 这是违背直觉的自监督学习,对吧? 这是违背直觉的自监督学习,对吧? 就是说,也许通过学习, 你会得到所有人类的, 比如你需要的人类信息,对吧? 只要有足够数据就能得到它。 你不需要明确的良好模型 关于人类行为的。
[4667.019-4679.688] SPEAKER_02: 也许通过数据就能得到它。 所以,我的怀疑也只是因为知道 很多汽车公司 以及创新有多难。 我曾怀疑他们能否大规模地 把驾驶数据 在全球看到的转化为数字形式,
[4679.768-4691.682] SPEAKER_02: 以便你能大规模创建这个数据引擎。 而特斯拉至少正在接近目标 或者说已经做到了, 让我觉得它现在开始结合起来了。 自我监督学习的这个愿景,
[4691.762-4703.130] SPEAKER_02: 这就好比,如果真能行, 光靠这个过程,你就能进步很大, 说不定就能解决驾驶问题。 我不知道。 我觉得我们对人类的伟大, 不管是驾驶还是监督自动驾驶,
[4703.210-4713.612] SPEAKER_02: 的赞誉还不够。 而且也没做到,我希望我们能, 希望特斯拉加强驾驶员感知, 以及更深入考虑人为因素, 比如心理学、困倦这些,
[4713.692-4729.089] SPEAKER_02: 比如心理学、困倦这些, 比如心理学、困倦这些, 诸如此类, 汽车越来越能干了, 怎么持续用那一点人类监督, 来确保系统安全。 我是说,这是一场迷人的, 人机共舞。 我一直觉得,自动驾驶
[4729.169-4739.701] SPEAKER_02: 是人机交互问题。 不是机器人或计算机视觉问题。 比如,得让人参与。 所以,我认为需要十年以上。 但我相信会有 一些城市和场景, 在地理限制下效果很好。
[4740.001-4748.023] SPEAKER_00: 对。 我乐观估计五年, 很多情况也是五年。 十年以上,我同意。 十年以上,要覆盖大部分, 比如美国本土这些地方。
[4748.323-4762.211] SPEAKER_02: 哦,有意思。 我乐观五年,悲观三十年。 三十年。 这个问题上,我考虑了长尾效应。 我看过很多驾驶视频。 看过很多行人视频,所以觉得 我们可能会说,心里还有一小部分, 不是一小部分,是很大一部分。
[4762.291-4765.321] SPEAKER_02: 觉得必须造通用AI解决驾驶问题。
[4765.621-4766.828] SPEAKER_00: 哦,哇。
[4767.128-4781.201] SPEAKER_02: 对我来说,就像有某种东西, 因为人类是其中一部分, 深深嵌在其中, 而且人类社会也在其中, 因为人类生命很危险。 每当机器人杀死一个人, 我不确定这是不是问题。 机器学习也得解决这个问题。 是的。
[4781.281-4796.841] SPEAKER_02: 你得把它整合到整个系统。 就像Facebook或社交网络, 一件事是如何制作, 一个非常好的推荐系统, 另一件事是整合, 把记者都整合进推荐系统。 他们会写推荐系统的文章。 就像你得考虑社会
[4796.921-4807.021] SPEAKER_02: AI系统就在那里面运作 而且政客们也一样 你知道,这是监管的事 用于自动驾驶 对 有趣的是,AI系统越成功就越被整合
[4807.101-4816.783] SPEAKER_02: 到社会里,政客、公众、标题党记者等等 各种社会力量就开始影响它,然后就不再只是 你最初任务做得好不好,还要看你会不会应对人性
[4816.863-4823.329] SPEAKER_02: 这是个迷人的领域。你觉得深度学习有什么局限?要是你允许的话 我们拉远镜头,聊聊AI的大问题
[4823.409-4830.990] SPEAKER_02: 你说智能的暗物质是自监督学习,但可能还有更多 那你觉得自监督学习、一般学习和深度学习的局限在哪?
[4831.290-4844.168] SPEAKER_00: 我觉得特别是深度学习,因为自监督学习现在还有点模糊 所以我不太愿意,对这么模糊的东西 很难预测它的局限。但就像我说的,我觉得 在任何跟人类互动的地方,自监督学习都会碰到边界
[4844.248-4855.233] SPEAKER_00: 很快,因为你得有个接口才能跟人交流 所以,如果你只有空洞或模糊的概念,由某个 网络很难避免引入某种东西。 人类知识或偏见。总之对深度学习来说,
[4855.313-4866.414] SPEAKER_00: 最大的挑战是数据效率。就算有自监督学习, 如果你只看一个概念一次,比如一张图片,随便你想。 怎么称呼都行,比如任何概念,这些方法很难只看一个。
[4866.494-4883.609] SPEAKER_00: 或两个样本泛化。这确实是个挑战。我觉得这实际上是 为什么边缘案例,比如特斯拉,这么重要?因为如果你看到 仅仅一个汽车故障例子,你只需标注它然后纳入你的 数据集,它的间隙非常有限。而且如果你只标注它并 纳入你的数据集,它就能保证不再发生。并且你将会
[4883.689-4899.249] SPEAKER_00: 实际上能在不同场景识别这种实例。所以比如 下雪时你标注了它,但现在下雨时, 你实际上无法识别。或者在别的地方有相同场景, 所以光照不同等等。所以对这些模型,特别是深度学习, 要真正做好这点很难。你怎么看?我们怎么解决
[4899.549-4905.551] SPEAKER_02: 每个数字只有一个样本时,手写数字识别怎么解? 感觉人类在用某种东西, 比如学习。
[4905.851-4919.599] SPEAKER_00: 对。我觉得我们挺擅长知识迁移。只是更擅长, 比如很多从单个样本泛化这类问题。 我们靠领域知识和经验,从单个样本里识别。 比如把归纳偏置融入样本,就能泛化。我从来没见过你写
[4919.679-4931.790] SPEAKER_00: 比如数字9。你写出来,我还是能认。如果你写 另一种字母,用两种不同写法,我大概也能 分辨出这些都是 一样的字符。 只是一辈子见惯了手写数字。 深度学习或机器学习系统还有个问题:
[4931.870-4941.404] SPEAKER_00: 没保证,对吧?你可以说人类 也没保证。比如我不能保证认出每只猫 在每种场景下。肯定有很多猫认不出,很多场景 我根本认不出猫。但从应用上,
[4941.484-4949.924] SPEAKER_00: 你确实需要保证。 需要保证。传统算法像排序就有保证。 排序是保证的。你对一组数字 调用排序,保证排好,否则是bug。但
[4950.004-4961.454] SPEAKER_00: 机器学习很难这么保证。比如猫识别 模型认不出所有猫,这大家都同意, 但我们还是接受。 嗯哼。 我们还不把这叫bug。而在传统计算机科学或传统
[4961.534-4976.176] SPEAKER_00: 科学里,比如你有这种失败案例,就会觉得这是 出了什么问题。嗯哼。 所以我觉得机器学习里,有种模糊的正确性概念, 而且我们要很适应这点。对深度学习或像 很多这类机器学习算法,我们不知道怎么描述这种
[4976.256-4994.930] SPEAKER_00: 正确性概念?我觉得这是我们理解的局限,或者至少是 我们在表达上的局限。如果能想出更好的算法,我们就能做到 这一点。但我觉得机器学习里,存在一种模糊的正确性概念。而且 如果能想出更好的算法,我们就能描述这种正确性概念。 如果能想出更好的方法来理解这个局限,
[4995.230-4999.014] SPEAKER_02: 那就会帮我们很多。你觉得学习和推理的概念
[4999.094-5002.100] SPEAKER_02: 有没有区别?你觉得神经网络有没有可能
[5002.180-5004.850] SPEAKER_02: 进行推理?所以我的想法有点不一样。
[5005.150-5020.141] SPEAKER_00: 对我来说,学习就是能快速判断的时候。比如你给我看一张 狗的照片,我能立刻说这是狗。但如果你给我个谜题,比如 复杂装置之类的,某种事情会发生,那我就得推理, 因为我从没见过那个特定设置。而且我
[5020.221-5024.586] SPEAKER_00: 真的需要,你知道,在脑子里画出来想象会发生什么来解决它。
[5024.666-5036.278] SPEAKER_00: 所以我觉得是的,神经网络很擅长识别,但它们不太擅长 推理时,就像见过类似的东西。 他们擅长快速判断,但给个全新的 复杂东西就不行。不擅长创造未见过的,
[5036.358-5040.665] SPEAKER_00: 组合能力很有限。 比如见过这部分和那部分, 怎么一起工作很难。
[5040.965-5051.878] SPEAKER_02: 让他们想出这种很难。推理的某方面 也许能变成编程过程。所以有整个 程序合成领域,用机器学习解决。 推理的某方面也许能转化为编程。
[5051.958-5057.948] SPEAKER_02: 组合步骤,为啥不能学?基础上构建, 一点点直觉,概念叠加,能学吗?你觉得呢?
[5058.028-5060.094] SPEAKER_02: 或者类似技术,你觉得能行吗?
[5060.394-5066.535] SPEAKER_00: 当然可学。因为人类就是例子, 像机器一样学会了。就像我们人类 也学会了。这是很容易学的技术。
[5066.615-5074.312] SPEAKER_00: 我觉得我们遇到瓶颈,当前机器学习 网络学了这么多信息,我们基本无法 搞清楚它怎么推广到未见之物。也没有
[5074.392-5080.080] SPEAKER_00: 先验方法描述。这告诉我们很多事实。 真搞不懂这模型学了啥,表现咋样,因为我们不知道
[5080.380-5082.655] SPEAKER_02: 它的迁移效果。另外感觉,
[5082.735-5091.059] SPEAKER_02: 人类可能没意识到自己背景模型多强, 我们积累了多少知识。 感觉神经网络总在丢东西。比如在计算机视觉里
[5091.139-5099.939] SPEAKER_02: 完成一个很牛的任务,学了个特定问题,你庆祝 最新成功,然后就扔了,感觉永远不会 用之前学的东西去搞别的领域。而人类
[5100.019-5106.009] SPEAKER_02: 这方面做得好。虽然也会忘掉一些东西, 但留下了核心真理。对。所以我感觉这样,
[5106.309-5119.001] SPEAKER_00: 持续学习是机器学习里的一个范式。我不觉得这 是个被充分探索的范式。深度学习里就有例子,对吧? 灾难性遗忘就是其中 典型问题。简单说,你教网络识别狗, 再教它识别猫,它就忘了怎么认狗。
[5119.081-5125.071] SPEAKER_00: 所以忘得很快。而人类,你教一个人认 狗,再教他认猫,他不会立刻忘了狗。 我觉得你大概就是这个意思。
[5125.371-5133.695] SPEAKER_02: 对。我只是好奇,长期记忆机制 或者存储机制,不光记忆,还能让你推理的概念。 推理和组合概念,如果和神经网络完全不一样,
[5133.775-5143.678] SPEAKER_02: 或者是否能在单个特定架构的神经网络里做到? 怪癖,这似乎是个未解的问题。我对此也常变来变去,因为
[5143.758-5155.173] SPEAKER_02: 符号人工智能或基于逻辑的思想,有种特别吸引人的地方 系统。你有像人类可解释的事实,它们相互叠加。 这真的很烦人,比如自监督学习的人工智能不太可解释。
[5155.253-5162.578] SPEAKER_02: 比如你理解不了它学到的所有美妙事物,没法像提问那样 提出问题。但回过来想,也许这是人类想要的蠢事。
[5162.878-5177.497] SPEAKER_00: 对。我觉得每次我们理解它时,都在加入主观的人类偏见。 加进去。是的。 我觉得这就是那种 自监督学习的问题,目标是让它自然地从数据中学习。 所以现在你要理解它,就是带着对这个模型所学内容的先入之见。
[5177.577-5181.268] SPEAKER_00: 我认为这就是问题所在。高层次的问题,你认为呢?
[5181.568-5189.474] SPEAKER_02: 构建一个超人、或人类水平的系统需要什么? 通用智能?我们已经聊到这个了,你的直觉呢? 比如,这东西必须有身体吗?
[5189.554-5191.945] SPEAKER_02: 它是否需要与世界有丰富的互动?
[5192.025-5195.194] SPEAKER_02: 它需不需要更多人类元素,比如自我意识?
[5195.494-5198.048] SPEAKER_00: 我觉得是情感。我觉得情感是某种
[5198.128-5212.167] SPEAKER_00: 标准机器学习通常不真正归因这些。这不是我们 思考的是自然语言处理、计算机视觉,没有情感。情感从来不是 情感不属于其中。这有点奇怪。我认为根本原因 是存在。 是的。 惊讶这类情绪产生的原因之一就像
[5212.247-5221.024] SPEAKER_00: 实际发生和预期不符,两者不匹配。 于是我会感到惊讶、悲伤或快乐 等等。这说明我脑中已有预测模型 我预测可能发生的事。然后观察到
[5221.104-5226.514] SPEAKER_00: 实际发生的事与预期脱节。而这 嗯哼。 也许这就是你有很多情感的原因之一。
[5226.814-5233.838] SPEAKER_02: 是的。我常和人谈论丽莎·费尔德曼·巴雷特 她的情感概念很有趣,但我感觉情感
[5233.918-5242.021] SPEAKER_02: 主要在于我们怎么想,情感展示是沟通 机制存在于人类之间,是人际互动的重要部分。一个重要的
[5242.101-5245.885] SPEAKER_02: 部分,但只是一部分。所以我会把它放进完整的
[5245.965-5248.739] SPEAKER_02: 沟通组合里。沟通可以用非人类物体完成。
[5249.039-5249.607] SPEAKER_00: 好的。
[5249.907-5261.566] SPEAKER_02: 我发现我们会拟人化,还能跟看起来像的东西连接。 Roomba,我们建立联系的能力。先聊聊其他生物系统,比如 狗,我们爱那些和人类完全不同的东西。
[5261.866-5268.530] SPEAKER_00: 但狗确实会表达情感,对吧?我是说,狗会表达情感,所以不必是 拟人化才能展示我们没有的情感。
[5268.830-5271.604] SPEAKER_02: 没错。但后来‘情感’这个词就没意义了。
[5271.684-5283.842] SPEAKER_02: 那我觉得得具体一点,对,得有丰富有风味的交流。 交流。对。 对。就像,它充满了情感。充满了智慧和幽默,还有情绪。 对。还有所有这些东西。对。所以你说的是风味。
[5284.142-5288.309] SPEAKER_00: 风味。对。好,就这么叫。所以有内容,再有风味。 我在讲风味。
[5288.609-5295.075] SPEAKER_02: 你觉得它需要身体吗?需要和物理世界互动吗? 你觉得如果不直接跟物理世界互动,你能理解它吗?
[5295.375-5310.737] SPEAKER_00: 我不同意。对,我觉得总有一天,得咬咬牙, 实际上跟物理世界互动, 虽然我很喜欢搞被动计算机视觉这类工作,就坐着, 看视频学习。 我确实觉得,嗯,我们得需要某种具身化, 或者某种互动,嗯,来搞懂世界上的事。
[5311.037-5317.619] SPEAKER_02: 那意识呢?你多久会想到意识? 当你思考工作时,可以理解为更简单的自我意识。
[5317.699-5322.702] SPEAKER_02: 意识到你是一个能感知、感觉、行动的实体。 或者你可以这么想。
[5322.782-5325.173] SPEAKER_02: 更宏大的版本,意识拥有
[5325.253-5327.946] SPEAKER_02: 作为那个实体的主观体验。
[5328.246-5341.298] SPEAKER_00: 所以我更常把自我意识看作更宏大的目标,因为 我认为自我意识对通用人工智能或你 不管叫什么,都很关键,因为它需要理解自身是什么以及 以及它在周围事物中的角色。而且我认为,
[5341.378-5352.723] SPEAKER_00: 这需要自我意识,它要知道自己是一辆自动驾驶汽车, 对吧?那意味着什么?它的局限是什么?它应该 做什么?它扮演什么角色?这些是 我们期望它做到的事情。所以这就是
[5352.803-5355.949] SPEAKER_00: 至少是基本的自我意识,甚至更高。
[5356.249-5365.304] SPEAKER_02: 是的。我倾向认为,在情感上,它必须 能够展现意识。展现意识。你是什么意思? 意思是就像我们人类相互连接或与其他生命连接,
[5365.384-5375.182] SPEAKER_02: 我们需要感觉到,才能真正感受到另一个存在, 我们必须相信它们有意识。所以我们永远不会与某物建立连接 这不具备意识。我现在觉得
[5375.262-5381.891] SPEAKER_02: 比听上去简单,我们总爱拟人化 比如带轮杯子,会转还会响 我觉得几天后,尤其不跟人说话
[5381.971-5390.991] SPEAKER_02: 你可能就觉得那杯子有意识。人类特会拟人化 但我认为它属于情感范畴。这说明我觉得 意识就是承受痛苦。如果你能感知世间事物
[5391.071-5397.619] SPEAKER_02: 并传达给他人。我觉得这是跟人互动的强大方式 要造AGI系统,就得能跟人丰富互动
[5397.699-5407.497] SPEAKER_02: 就像人想跟你互动。不能是机器人自我学习,还得付费才动 所以互动应自然有趣。然后互动量大增 就是Alexa大奖,他们要我当评委
[5407.577-5419.944] SPEAKER_02: 我考虑下,但挑战是跟你聊天,让评委和人类感兴趣 让人跟Alexa聊20分钟。目前离得远,因为不够智能时 对话就无聊没趣。机器人得有趣。一种方法是它能
[5420.024-5429.149] SPEAKER_02: 决定比赛。我考虑下,但挑战是 跟你聊天,让评委和人类感兴趣,人就会继续 跟Alexa聊20分钟。现在还很远,因为这只是
[5429.229-5440.722] SPEAKER_02: 变得很无聊,智力不够时,就特别没趣 跟它聊很有趣。机器人得有趣。它有趣的方式之一 有趣的是,承受苦难的能力,本质上就是在展示意识。
[5440.802-5452.751] SPEAKER_02: 展现意识的能力,就像一个非常像人类的实体,当然。 这到底是什么意思?我不知道根本上是个机器人问题,还是别的。 我们甚至意识不到的问题。比如,如果真是个困难的意识问题。
[5452.831-5465.418] SPEAKER_02: 我比较乐观,觉得我们可以先假装,直到成功。 所以短期内,我们能展示很多类似人类的元素,这将会。 足以和人类建立紧密联系。对,什么是最美的想法?
[5465.498-5469.584] SPEAKER_02: 自监督学习中。比如你放松坐着,嗯,端着一杯酒。
[5469.664-5476.467] SPEAKER_02: 坐在扶手椅上,壁炉旁,想着世界有多美。 这个可以探索的世界,你觉得什么想法最美?
[5476.767-5480.876] SPEAKER_00: 实际上,物体层面,就是知道某些物体是什么。 知识,是的。
[5481.176-5485.599] SPEAKER_01: 物体性概念,正通过自监督学习从模型里涌现出来。
[5485.899-5495.593] SPEAKER_00: 比如,我参与的那个DINO论文。 在Facebook,物体边界从这些表征里涌现出来,所以如果你。 有只狗在田野跑,狗周围的边界,网络。
[5495.673-5507.541] SPEAKER_00: 基本上能自动找出这只狗的边界是什么。 对,它从未被训练过做这个,从没训练过。 没人教它这是一只狗,这些像素属于狗,它能。 自动把这些东西分组。这就是个例子。总的来说,那。
[5507.621-5519.999] SPEAKER_00: 简单说,这个笨办法:取一张图的两个裁剪区域,然后 说这些特征应该相似,结果就这样,就像 模型能分辨出狗的像素,这看着非常 很惊人。嗯,我觉得很多人都不明白这是怎么做到的。
[5520.079-5529.680] SPEAKER_00: 真的吗? 我们习以为常了,嗯,比如怎么设置 这些算法,但这想法非常优美强大。所以它真的 它告诉我们一些本质。像素信号太多,以至于我们
[5529.760-5538.943] SPEAKER_00: 可以很笨地处理它,比如怎么设置自监督问题。而且 虽然我们很笨,但结果却很好。嗯,就像我们真会 得到一些能做出惊人事情的东西。
[5539.243-5552.132] SPEAKER_02: 我想知道还有没有别的,比如 物体性,还有别的涌现概念。我不知道你关不关注弗朗索瓦 肖莱,他搞了个智力竞赛,有点像智商测试, 不过是给机器的。智商测试需要一些想用的概念。
[5552.212-5556.519] SPEAKER_02: 其中一个是物体性。想知道这些概念能否通过自监督
[5556.819-5573.435] SPEAKER_00: 在几十亿张图上学习而融合。我觉得物体恒存这类概念肯定能涌现。 对,那是个基本概念,我们拥有它,嗯,可能不是通过图像, 而是通过视频,但那是另一个该涌现的概念,因为它不是 像你那样,我们没教人类这不是,这就像概念本身。
[5573.515-5582.117] SPEAKER_00: 客体永久性,它会自然出现。动物也一样,比如狗。 我觉得永久性是天生的,所以我认为… 它应该从数据里自然出现,而且很快。
[5582.417-5585.749] SPEAKER_02: 我想知道对称性、旋转这些概念会不会出现。
[5586.049-5588.220] SPEAKER_00: 所以旋转可能就是这样,没错。
[5588.520-5591.805] SPEAKER_02: 我的意思是,架构本身有限制。
[5591.885-5594.857] SPEAKER_02: 但如果这些都能…嗯,计数也是个例子。
[5594.937-5605.432] SPEAKER_02: 你知道,就是能看懂图里有多个同类物体。 还能数清。我想知道这些能不能都… 如果构建得好,它们就会出现,然后你就能把概念迁移到…
[5605.512-5608.298] SPEAKER_02: 然后更深层地理解图像。
[5608.598-5614.089] SPEAKER_00: 对,计数的确可能,我觉得应该是可行的。 嗯,虽然还不确定,但我认为并不遥远。
[5614.389-5628.311] SPEAKER_02: 是的。如果用自监督学习处理图像, 然后去解决那些几乎不可能的智商测试。 那会很有趣。你觉得哪个观点大家都不认同? 嗯,或者不理解?不同意?呃,我不确定,我觉得需要很…
[5628.611-5635.437] SPEAKER_00: 不同意你的想法。有类似情况吗?所以这会有点… 有争议,但好吧。我不太相信模拟,比如用模拟来做…
[5635.737-5643.724] SPEAKER_02: 很多事情。澄清一下,因为你在说“我们是不是生活在… 模拟中经常用吗?就是建个虚拟世界,然后...
[5644.024-5651.082] SPEAKER_00: 用机器学习。对,比如训练自动驾驶汽车。 先搭个模拟器,模拟出真实环境。 然后让机器学习系统在里面训练。
[5651.162-5657.744] SPEAKER_00: 我觉得可能行,但成本真的很高。 最后还得看真实世界。所以我不确定。 有些场景回报很大,比如自动驾驶。
[5657.824-5667.158] SPEAKER_00: 回报大到值得投入那么多钱去建。 但作为一般原则,不适用很多概念。 你不可能模拟所有东西。 不仅贵,而且很多事情根本做不到。
[5667.238-5670.790] SPEAKER_00: 所以关于合成数据和模拟器的工作...
[5671.090-5676.175] SPEAKER_02: 我不太信那个。你是说视觉上很难模拟? 比如光照这些效果,确实难。
[5676.475-5687.820] SPEAKER_00: 对,我的意思是... 你看那些公司,像皮克斯。 它们计算机图形学都追求精确。 都在研究光照、物体反射、闪亮效果。 这非常难。所以我们得先解决这个问题,才能...
[5687.900-5691.533] SPEAKER_00: 这个问题很难,得先解决它,才能... 计算机视觉?不一定。
[5691.833-5700.331] SPEAKER_02: 对我来说,在自动驾驶中, 能用仿真很诱人,对吧?因为安全关键。 但仿真的另个限制,可能比视觉更大。
[5700.411-5707.852] SPEAKER_02: 是物体行为。你最终关注的是边缘情况。 对。 问题是,仿真里你能多好地生成边缘情况? 尤其是人类行为时?
[5708.152-5720.124] SPEAKER_00: 另一个问题,比如自动驾驶, 不断变化的世界。说到自动驾驶,比如十年后, 有很多自动驾驶车,但仍有人类。那时一半是人类。 一半是自动驾驶的,像驾驶汽车的代理。
[5720.204-5731.189] SPEAKER_00: 所以混合比例变了。你期望其他车的行为 会非常不同。而且随着 自动驾驶与人类比例变化,行为会 变化很大。如果你要构建一个 嗯哼。 基于现在的仿真器,你没有那么多
[5731.269-5737.538] SPEAKER_00: 自动驾驶车在路上。你会让所有其他代理 在仿真中表现得像人类。但十年二十年后就不成立了。
[5737.838-5745.303] SPEAKER_02: 现在。 你觉得我们活在模拟器里吗? 不。 有多难呢?所以我说这问题有意思。 做一个像虚拟现实那样逼真的游戏,有多难?
[5745.383-5752.883] SPEAKER_02: 比如说,让人忘记现实。 真实到难以分辨,但美好到让你 只想待在那里,不想回来。 你觉得这辈子能实现吗?
[5753.183-5756.131] SPEAKER_00: 有生之年?可能。我吃得健康,活得久。
[5756.431-5761.794] SPEAKER_02: 你会难过吗?因为不少孩子几乎 95%、99%的时间都在虚拟世界里?
[5762.094-5770.453] SPEAKER_00: 很难回答。对有些人,这可能是他们 从中获得很多价值和快乐。 也许现实没给,所以他们这么做。 所以对有些人可能是好的。
[5770.753-5773.388] SPEAKER_02: 所以如果它最终能最大化幸福感,
[5773.688-5779.249] SPEAKER_00: 对,我觉得是的。 我认为如果它能让人快乐, 也许吧。 这问题很难,就像你一直做的。
[5779.549-5785.737] SPEAKER_02: 你参与了很多好论文,有什么写作建议? 研究生写论文,你发现有哪些共同点?
[5785.817-5788.591] SPEAKER_02: 写好论文需要好想法和好写作,对吧?
[5788.891-5796.716] SPEAKER_00: 这两点我从合作者那里学到,其中一点是 选对研究问题跟找到解决方案一样重要。 原因很多,其中有些问题
[5796.796-5804.841] SPEAKER_00: 在一定时间内能解决。比如你想研究 寻找生命的意义,这问题很棒,多数人都同意。 但你相信吗? 你的才能和精力能创造意义,就像
[5804.921-5807.475] SPEAKER_00: 在有生之年取得进展?乐观就去做。
[5807.775-5819.085] SPEAKER_02: 所以我开始这个播客,不断问生命的意义,希望 大约第220期能搞明白。没多少期了。好吧,也许今天 不知道,但你说得对。那问题现在难解决。
[5819.385-5830.707] SPEAKER_00: 比如你刚开始读博时 你想专注哪个问题,觉得它足够有趣? 并且能取得合理进展,你会为此 攻读博士,在那个时间框架内。这是其一,还有第二部分:
[5830.787-5843.734] SPEAKER_00: 真正让你兴奋的是什么。所以别选不感兴趣的问题。 作为研究生或研究者,你得真正热爱才能... 坚持下去,因为生活中还有很多其他选择。 所以你必须有信念,才能坚持这么久。
[5843.814-5853.589] SPEAKER_00: 关于论文,我学到一件事:以前我写东西时, 总是想塞进很多内容。 但真正重要的,是推进一个简单想法,就那么简单。
[5853.669-5859.555] SPEAKER_00: 论文也就八九页,塞太多想法的话, 你相信的那个点就很难突出。所以如果真想做
[5859.635-5871.607] SPEAKER_00: 尤其在写作上,就专注一个想法,把它讲清楚。 用不同方式阐述,对读者也更有价值。 读者当然喜欢,因为他们知道这个想法和论文相关。 而且对你来说,换个方式写同一个想法,
[5871.687-5882.870] SPEAKER_00: 你会思考更深入。我以前总拖到最后一周才写论文, 觉得实验比写作更重要。 导师总让我早点写,我还不当回事。 现在越来越觉得他是对的。每次写作时,
[5882.950-5892.168] SPEAKER_00: 我反而能想得更清楚。所以早点开始写, 早一点,你就能得到更好的想法,至少能发现理论漏洞。 或者知道该做什么实验来填补漏洞。是的。
[5892.248-5895.173] SPEAKER_00: 或者该做哪些实验来堵住漏洞?对,我…
[5895.473-5902.311] SPEAKER_02: 总惊讶于有这么多 真正好的论文简短简单,这里有教训 比如你想写一篇改变世界的论文
[5902.391-5905.177] SPEAKER_02: 参考榜样,它们很简单,不是堆砌
[5905.257-5908.345] SPEAKER_02: 专注一个想法深入思考,写作过程
[5908.425-5911.571] SPEAKER_02: 就是那个想法,挑战你真正思考
[5911.871-5921.367] SPEAKER_00: 串联所有内容的线索,著名研究者会从 比如实验之前,很多人会 先写引言,没有实验,因为 帮他们弄明白要解决什么,如何适应
[5921.447-5927.008] SPEAKER_00: 当前背景,指导整个研究,从写作开始 先写引言,没有实验,这就是
[5927.308-5933.507] SPEAKER_02: 启动项目的方式,对初学者关于人的问题 对机器学习感兴趣,最好编程语言?
[5933.807-5938.172] SPEAKER_00: Python最容易学习,很多编程 机器学习用Python,不懂其他语言
[5938.472-5944.752] SPEAKER_02: Python能带你走远,这有点争议 现在Python主导了这个领域 我好奇替代方案,比如Swift,很多
[5944.832-5957.350] SPEAKER_02: 新方案涌现,甚至JavaScript,我更像是对 数据科学应用,但Python现在也常教大学编程入门,结合得很好。 更难的问题:PyTorch和TensorFlow各有什么优缺点?我看到……
[5957.430-5960.796] SPEAKER_02: 你可以不评论,我就声明一下,我最后一次用TensorFlow。
[5961.096-5973.974] SPEAKER_00: 大概四年前它刚出来,那时我开始…… 深度学习大概2014年,那时我们主要框架是…… 视觉领域是Cafe。 它来自伯克利,我们常用Cafe,很好用,然后TensorFlow出现了。
[5974.054-5984.177] SPEAKER_00: TensorFlow以Python优先,Cafe主要是C++,而且它只有很松散的…… Python绑定,所以Python不是首选,你实际会用…… 用MATLAB或C++在Cafe里做,然后Python……
[5984.257-5996.868] SPEAKER_00: 当然稍晚才流行,TensorFlow大概在2015年。 2016年我最后一次用它,已经过了一段时间,然后训练中会用…… 但后来你用了Torch还是转了别的?我转到了Lua Torch,也就是……
[5997.168-6001.695] SPEAKER_02: Lua里的Torch,然后2017年我基本完全转到了PyTorch。
[6001.995-6005.547] SPEAKER_00: 哦,有意思,你在它流行前就用Lua Torch了,是的。
[6005.847-6010.212] SPEAKER_02: 哇,你在它火之前就用了,没错,Lua Torch真的很好,因为……
[6010.512-6028.730] SPEAKER_00: 它实际能让你做很多不同的事,而Cafe…… 结构很僵化,比如只能建一个神经网络,然后没了。 如果你没有自己的神经网络,就需要数据和服务器。 在Cafe里搞定,Python稍晚才流行,TensorFlow就在那个时期。 想要动态图表这些,以前很难做,但旧版Torch更容易实现。
[6028.810-6039.308] SPEAKER_00: 这方面都很友好。所以说到PyTorch和TensorFlow,我更喜欢 PyTorch,因为我用它更久,更熟悉,而且PyTorch 调试更容易,我发现,因为它是命令式的,而TensorFlow
[6039.388-6050.280] SPEAKER_00: 不是命令式的,但说明很多,基本上命令式设计是 很多人学编程的方式,这实际上让 调试对他们更容易。比如我学编程从C、C++开始,所以命令式
[6050.580-6060.564] SPEAKER_02: 编程更自然。你觉得这两类社区之间的这种 竞争好吗?我觉得PyTorch在研究社区越来越占主导地位, 但TensorFlow在更偏向应用机器学习的
[6060.644-6071.046] SPEAKER_02: 社区中仍然很流行。所以你觉得代码库这种分裂是好事吗?嗯,好处是竞争挑战 促使了 库 开发者 提升 水平。但缺点是存在这些代码库
[6071.126-6074.899] SPEAKER_02: 使用不同的库。所以我觉得缺点在于,很多
[6075.199-6091.397] SPEAKER_00: 研究代码只在一个框架发布,如果你用另一个框架,就很难 真正基于它构建。但幸运的是,机器学习的开源社区 非常棒,所以每当TensorFlow出现新东西,等几天就有人 聪明人会把这个代码库翻译成PyTorch 而且它还会继续
[6091.477-6103.008] SPEAKER_00: 基本上搞明白了所有细节,所以开源社区 太棒了,他们填补了空白,所以我认为有这些 两个或多个框架,当然各有不同用途,所以会有 用哪个都有好处,而且竞争是健康的
[6103.088-6107.755] SPEAKER_00: 因为这些框架都在不断学习 互相学习,不断融入新东西,越来越好
[6108.055-6113.662] SPEAKER_02: 你对新手有什么建议? 机器学习,可能刚开始甚至没开始但很好奇
[6113.962-6127.176] SPEAKER_00: 想进入这领域,不要怕弄脏手,这是关键 如果东西不工作,就深挖为什么,你能 详细说下弄脏手什么意思?比如,如果你尝试一个算法 训练网络但不收敛,而不是去谷歌搜答案
[6127.256-6141.109] SPEAKER_00: 比如花五、八、十、十五、二十个小时,不管多少 花时间自己弄明白,过程中你会学到很多 更多。是的,谷歌搜索是好方法,需要快速答案时但 起初,特别是刚开始时,自己搞明白要好得多
[6141.189-6152.325] SPEAKER_00: 而且凭经验说,因为我刚开始时 没有很多资源,实验室里我们很多人会仰望资深人士 高年级学生很忙,会说:“你怎么不自己搞清楚?” 你自己来吧,我忙着写论文呢。
[6152.405-6158.395] SPEAKER_00: 这里的博士生会坐下来一起研究,真的帮了我很多。 我觉得这帮我解决了大问题。总的来说,
[6158.695-6171.085] SPEAKER_02: 坚持克服困难是好事,让人知道调试值得花时间。 实际上任何困难,比如大量搜索, 对,基本上就是这样。 任何事坚持下来,经历困难,可能要重新实现。
[6171.165-6177.306] SPEAKER_02: 或者换库或编程语言重新做。 形式多样,但困难磨炼人。 我在匹兹堡读博,那里总下雪。
[6177.606-6185.187] SPEAKER_00: 下雪时其实做不了多少事。 很多人说雪塑造性格,只能专心工作。 对成功但年轻的人或刚上大学高中的,有什么建议?
[6185.487-6195.285] SPEAKER_02: 关于职业和生活,如何铺就成功之路? 保持饥饿,永远渴望你想要的东西。 我受很多有动力的人启发,他们不顾一切追求目标。
[6195.585-6207.336] SPEAKER_00: 你需要它,不只是想要。如果需要,总能找到办法。 想要,而且我受很多有干劲的人启发。 无论如何都要去追求,你不该只是想要,而是需要。所以如果你
[6207.416-6211.607] SPEAKER_00: 需要某样东西,得走到尽头才管用,怎么知道遇到时
[6211.907-6215.099] SPEAKER_02: 碰到一个需要的,没有单一的东西
[6215.399-6227.208] SPEAKER_00: 需要的东西有不同类型,但 每当你需要就去争取,但尝试可能得不到 可能发现那不是你要找的,而是别的 但关键是,你在不断努力争取 突破障碍,会带给你很多技能
[6227.288-6230.492] SPEAKER_00: 建立的态度可能帮得到别的,一旦你
[6230.792-6240.335] SPEAKER_02: 弄清真正想要的。很多人,我注意到他们 有点怕,因为怕承诺,也因为世界精彩 不想因为承诺错过其他美好事物 所以关键是允许自己
[6240.415-6243.747] SPEAKER_02: 注意到目标,全力以赴。我也喜欢失败,对吧?
[6244.047-6251.814] SPEAKER_00: 我知道听起来俗,但失败是你应该 准备接受的,尤其在研究中,失败是 几乎每天发生,比如实验失败、不奏效
[6251.894-6258.233] SPEAKER_00: 所以得习惯,脸皮厚,但基本上 当你挺过去,就找到那一个有效的东西 就像爱迪生那样?我小时候常
[6258.313-6268.912] SPEAKER_00: 读他如何找到灯丝,然后他... 他试了大概990种方法都不行,然后他们 问学到了什么,这些都是失败的实验,然后他
[6268.992-6272.683] SPEAKER_00: 他说这990种方法都不行,我知道。你知道吗?真的很鼓舞人心。
[6272.983-6286.360] SPEAKER_02: 你这几年在地球上自监督学习,找到生命的意义了吗? 我跟你说过,我做这个播客就是为了找答案。你能告诉我这一切的意义吗? 想找到答案。希望你能告诉我,这一切的意义是什么?
[6286.660-6289.655] SPEAKER_00: 我没想明白,不,我不知道。你认为
[6289.955-6294.819] SPEAKER_02: 人工智能能帮我们找到答案吗?还是说没有答案,重要的是不断探索?
[6295.119-6302.177] SPEAKER_00: 是的,我觉得这是永无止境的探索。 我觉得人工智能帮不了我们。 这是个非常非常非常难的问题, 很多人都试着回答过。
[6302.477-6306.343] SPEAKER_02: 有意思的地方就在这, 人工智能和人类的差异。
[6306.423-6312.553] SPEAKER_02: 人类根本不知道自己在干嘛。 人工智能几乎总是在 在明确的目标函数下运行。
[6312.633-6322.547] SPEAKER_02: 我想知道,我们是不是缺乏 制定良好长期目标函数的能力, 或者反思目标函数是啥。 我们身处的环境,算是特点还是缺点?
[6322.847-6334.738] SPEAKER_00: 要我说,这算是特点。 因为这样,每个人实际优化的东西都不同。 他们优化的目标函数五花八门。 这些目标函数会不断变化。 而且人生中会发生巨大改变。 这恰恰是我们有趣的地方,对吧?
[6334.818-6343.583] SPEAKER_00: 否则,人人都做一样的事, 那就太无聊了。 我们当然希望大家想法不同, 但人也在不断变化。 我想说,这就像 人类最大的特点。
[6343.883-6358.490] SPEAKER_02: 我们常常喜欢那些死去的人, 因为他们干过傻事。 我们可以观察、看见并从中学习。 作为人类,我们吸取教训, 并变得越来越好, 因为世上所有犯傻的人, 那些因做疯狂又美丽的事而死去的人。
[6358.570-6372.307] SPEAKER_02: Ishan,非常感谢今天精彩的对话。 我们做了深度优先。 我们在机器学习领域深度搜索。 既有趣又迷人。 能见到你真的很荣幸。 而且这次对话特别棒。 谢谢你今天来跟我聊。
[6372.607-6380.687] SPEAKER_00: 谢谢,Lex。 我是说,我听过你的节目。 跟你说,能亲眼见到你太不真实了。 见到你本人,我很开心。 谢谢。
[6380.987-6382.682] SPEAKER_02: 谢了,兄弟。
[6382.762-6398.647] SPEAKER_02: 感谢收听我和Ishan Mizra的对话。 还要感谢Anit、The Information和Grammarly。 还有Athletic Greens。 支持本播客,请看简介。 最后,我用一句话结尾。 来自阿瑟·C·克拉克。 任何足够先进的技术
[6398.727-6400.979] SPEAKER_02: 跟魔法差不多。
[6401.279-6403.310] SPEAKER_01: 谢谢大家,下次再见。