Podcast Script (zh)
[0.120-10.139] SPEAKER_01: 本期视频聊聊图灵70年前的问题 论文《计算机器与智能》问机器能思考吗?这是俱乐部首篇 我发起一个论文阅读俱乐部专注AI还涵盖
[10.219-19.483] SPEAKER_01: 数学物理计算机神经科学以及所有理工科 表面是哲学论文实则最具影响力且 迈向工程智能系统的重要一步因为它提供测试
[19.563-27.063] SPEAKER_01: 即图灵测试基准用来量化判断一个 系统是否智能我先概述论文思想 说说论文内外提出的反对意见
[27.143-36.558] SPEAKER_01: 再谈谈测试的一些替代方案 接着聊聊论文里提出的问题 最后分享收获论文标题《计算机器 与智能》1950年发表图灵著
[36.638-45.380] SPEAKER_01: 我觉得这点有争议幻灯片说这是最有影响论文之一 我认为它可能是AI史上最具影响力论文 尽管只是哲学论文却激励了
[45.460-54.817] SPEAKER_01: 计算机界内外无数研究者让他们在 集体智慧层面梦想激励相信可能 其影响不可估量对重大工程突破和计算机科学
[54.897-68.309] SPEAKER_01: 突破追溯到三四十年代甚至包括那项工作 图灵和图灵机,还有计算机科学的数学基础。 还有一些计算机科学的数学基础。 到今天的深度学习,从实用的AlexNet论文开始。
[68.389-75.796] SPEAKER_01: 再到反向传播论文。这些构成了该领域的成功。 种子已播下,梦想随这篇论文诞生。而且它还有
[75.876-79.579] SPEAKER_01: 我最喜欢的开场白之一,它写道: 我提议考虑……
[79.659-86.857] SPEAKER_01: 我提议考虑机器能否思考。定义机器和思考很关键,但常用用法危险,会导向统计调查。
[86.937-101.312] SPEAKER_01: 就会得出需要统计调查来回答机器能否思考。 这很荒谬。与其这样定义, 我会用一个密切相关的问题来代替。 这个问题表述更清晰。 然后他定义了模仿游戏,也就是今天的图灵测试。 测试,
[101.392-105.815] SPEAKER_01: 其中, 人类询问者与墙另一侧的两个实体通过文字交流。
[105.895-114.672] SPEAKER_01: 文字来回传递。对话一段时间后, 人类询问者要判断另外两个哪个是 人类,哪个是机器。这是工程学的一大飞跃,把
[114.752-128.315] SPEAKER_01: 一个模糊深刻的问题,比如机器能否思考,转化为具体 可以作为智力测试基准。但这个问题和某些 跟我们常问的深刻问题有共鸣。那么,机器不仅能思考,机器还能
[128.395-137.590] SPEAKER_01: 有意识吗?能坠入爱河吗?能创作艺术、音乐、诗歌吗?机器能 享用一顿美食、一块巧克力蛋糕吗? 我觉得这是非常重要的问题,但当我们试图
[137.670-147.689] SPEAKER_01: 创造一个人级能力的非人类系统时,这些问题很难问。所以这就是 图灵提出了模仿游戏。他预测到2000年,或者论文发表后50
[147.769-158.499] SPEAKER_01: 年,一台有100兆字节存储的机器能在五分钟测试中骗过30%的人,在 一个五分钟的测试中。 当然。 对话。他的另一个更广泛的社会预测,我觉得也很有趣,
[158.579-171.178] SPEAKER_01: 是大家不再觉得“会思考的机器”这种说法矛盾。所以基本上, 人类级AI变得很普遍,以至于我们会觉得它是 理所当然。他在论文结尾详细描述的另一部分,
[171.258-178.758] SPEAKER_01: 他相信学习机器或机器学习会是成功的关键 我觉得,把论文里两个隐含的主张——开放的
[178.838-191.913] SPEAKER_01: 主张、开放的问题——分开讨论也很有用。一个是图灵提出的模仿游戏是智力的好测试 第二个是机器确实能通过这个测试。所以当你说, 机器能思考吗?
[191.993-199.794] SPEAKER_01: 你既给“思考”这个词设了个工程基准,又提出了问题, 机器能否通过这个测试?这既遗憾又令人兴奋。
[199.874-214.098] SPEAKER_01: 这个领域我们还有很多工作要做。所以,在演讲中, 我不仅会讲论文中的想法,还有之后多年的其他想法。 还会讨论一些还没解决的开放问题。 不管是哲学、心理还是技术层面。所以,这里的一个开放性
[214.178-224.615] SPEAKER_01: 问题是,能不能为人工系统创造智能测试? 能让我们信服吗?还是标准会不断提高?这个问题的推论是 回顾图灵的预测:人们不再认为
[224.695-234.493] SPEAKER_01: 会思考的机器这个说法矛盾。为什么我们仍然觉得矛盾?为什么我们仍然 认为计算机完全没智能?对很多人来说,国际象棋被视为
[234.573-243.977] SPEAKER_01: 早期智能的最高水平。事实上,我们赋予了极大的智能 加里·卡斯帕罗夫,人类历史上最伟大的棋手之一,甚至可能是最伟大的。
[244.057-257.666] SPEAKER_01: 为什么深蓝击败卡斯帕罗夫时,我们连一点智能都不愿给?当然,现在 人们开始说那只是暴力算法, 或者以AlphaGo和AlphaZero为例, 你知道这些算法背后的学习机制 是如何运作的,
[257.746-260.335] SPEAKER_01: 当它们掌握了围棋和国际象棋时。
[260.415-274.605] SPEAKER_01: 我们谈谈其中一些反对意见, 但这有某种深层的心理因素—— 这些反对意见几乎让人害怕 一种通过了测试的人工智能 所以图灵测试很有意思 它既是思想实验也是哲学构想 但作为工程测试也很有趣
[274.685-282.672] SPEAKER_01: 它的一个实际应用 叫做洛布纳奖 从1991年运行到现在 它的奖项结构 文本系统奖两万五千美元
[282.752-296.048] SPEAKER_01: 通过测试则另奖十万给多模态系统 比如视觉和听觉 比赛规则这些年来一直在变 目前是这样的 一段二十五分钟的对话 要赢就得通过测试 你得骗过一半的评委
[296.128-305.044] SPEAKER_01: 和系统对话的那些评委 沃斯威克与威尔科克斯的Mitsuko和Rose 过去十年一直占据主导 除了有一年,其他都赢了。
[305.124-329.637] SPEAKER_01: Mitsuko和Rose,她们细节上也类似。 主要是脚本驱动的聊天机器人,所以不是,你懂的。 它们都是脚本驱动的规则聊天机器人。 它们不是脚本驱动的规则聊天机器人,所以不是,你懂的。 它们不是端到端的学习系统。 我相信这里面用了机器学习。 但据我所知,它们核心主要是脚本驱动。 下一张幻灯,我们会看一段对话记录。
[329.717-343.024] SPEAKER_01: 与Mitsuko的对话,帮你感受一下。 这些对话啥样? 但我想说个有点悲剧的事实,真的。 据我所知,这个奖项已经没资金了。 但撇开资金,这说兴趣并不广泛。 这个构建,无论是内部
[343.104-356.411] SPEAKER_01: 还是研究社区的外部。 让我惊讶的是,Google DeepMind, Facebook AI,主要团队和研究员。 AI领域都没接下这个挑战。 我希望成为一小部分。 稍微改一下 因为我觉得很有价值
[356.491-366.510] SPEAKER_01: 在考虑图灵测试时 我觉得这不是干扰 后面再提这个 你可以暂停看转录,我高亮右侧 右栏顶:人说“你是机器人”,Mitsuku回“人怎么会是”
[366.590-377.271] SPEAKER_01: Mitsuku:机器人。人类:很多人像机器人。Mitsuku:多少?超百万? 人类:是。Mitsuku:真多。人类:南安普顿能赢斯旺西?Mitsuku:会
[377.351-384.874] SPEAKER_01: 人类:为什么?Mitsuku:没理由,只是想法 人类:你肯定有理由。Mitsuku:不,真没理由
[384.954-395.728] SPEAKER_01: 人类:你支持哪个队?Mitsuku:利兹联 人类:利兹!赛季怎样?Mitsuku:那是英格兰北部城市,约50万人 Mitsuku:和利兹联一样,一样,一样。它
[395.808-402.448] SPEAKER_01: 一如既往。你看,转录中有非人性的小缺口 有观点徘徊重复,理解差距,跟不话题转移之类
[402.528-408.634] SPEAKER_01: 但我觉得具体测试失败的点在哪,不清楚 我觉得这些构建没研究好,不是最终决策
[408.714-418.768] SPEAKER_01: 测试失败在哪还不清楚,我觉得实际上根本就没成。 这些构建研究得很透彻,不是最终决策。 对话里,怎么区分人和AI?标记可疑部分。
[418.848-424.397] SPEAKER_01: 比如让你怀疑不是人的片段。我觉得这 有意思,看能否找出对话的问题。 这就是失败点。
[424.477-433.614] SPEAKER_01: 图灵测试被通过,最有名的是2014年。 在纪念图灵逝世60周年的展览上。 尤金·古兹曼骗了33%的评审。他扮13岁
[433.694-439.464] SPEAKER_01: 乌克兰男孩,一堆怪癖,语言也有 障碍,加上幽默,总把话题带偏。
[439.544-446.010] SPEAKER_01: 回到它自在的领域。所以你可以 批评这活动,像烟雾弹和营销。 这类展览常有,先放一边。
[446.090-451.418] SPEAKER_01: 有趣的教训是,参数和工程规则 图灵测试能决定是否包含
[451.498-456.409] SPEAKER_01: 图灵测试精神,是测智能体能力。 进行有深度的对话。所以,有些技巧
[456.489-462.537] SPEAKER_01: 用来回避深入对话。30%评审被 没经严格公开测试就骗了。左边有对话记录。
[462.617-470.894] SPEAKER_01: 斯科特·阿伦森,计算机科学家。播客里聊过 他是天才,公开了和尤金的对话。 他博客那个评委挺有意思,能看出这评委...
[470.974-480.993] SPEAKER_01: 专家审问的话,就能主导对话,真测出机器人水平。 像斯科特那样,他根本不让尤金搞那些误导, 对话记录里看得见,斯科特就是不吃这套。
[481.073-487.841] SPEAKER_01: 所以,勒布纳奖和图灵测试虽然没那么火了, 但谷歌发了一篇论文,搞了个叫MENA的聊天机器人。
[487.921-503.898] SPEAKER_01: 这是个端到端深度学习系统,26亿参数的目标是 捕捉对话的内容。所以目标就是 捕捉对话中的内容。所以目标是抓住 上下文,这样才能生成符合上下文的文本。 现在,除了是正经做个开放域对话系统外,有意思的是
[503.978-516.414] SPEAKER_01: 它提了个新指标。 这指标分合理性和特异性两部分。合理性就是机器人的回答要 在上下文里说得通。给你个概念,对人类来说, 我们97%的时候都得理解上下文,必须理解。
[516.494-524.458] SPEAKER_01: 必须理解上下文。必须得理解上下文。 必须理解上下文。必须得理解上下文。 那为啥还需要另一面呢?因为你可以合理,可以
[524.538-534.557] SPEAKER_01: 用无聊的回答应付,比如“不知道”或“说得好”, 这种万能回答能套进很多不同上下文。 所以,指标另一面是特异性,目标就是别太笼统。
[534.637-543.100] SPEAKER_01: 要讲得非常具体,不能无聊。 这样才符合上下文。 而且抓住了很独特的东西。 针对这个特定的对话线索。 形成了上下文。
[543.180-558.983] SPEAKER_01: 可以说,对话的美感、音乐性、幽默和智慧,都来自这种能力。 就是利用具体细节,也就是特异性指标。 所以两者都很重要。 人类在合理性和特异性上准确率是86%。 Mina是79%,Mitsuko是56%。
[559.063-565.402] SPEAKER_01: 但这些数据仅供参考。 我得小心一点。 不是贬低它。 但它是闭源的。 感觉有点像。 公关营销。
[565.482-579.288] SPEAKER_01: 也许很自然。 这篇论文就是这么写的。 论文就是这么写的。 方法和结果都展示出来了。 用有利于学习的方式。 搭建了学习框架。 我不想过分批评这个。 因为我觉得还有不少 有趣思路在这篇论文里。
[579.368-587.135] SPEAKER_01: 但从实际百分比来看 人类86%,Mina79%。 我觉得我们离得还远 下结论。 关于达到人类水平的对话系统。
[587.215-594.633] SPEAKER_01: 所以对这些图表要保留,但实际内容 这些想法很有趣。长期看,但 希望短期在于端到端学习开放领域
[594.713-603.815] SPEAKER_01: 对话。就像图灵70年前说的,有趣的是,机器 学习至关重要,我也相信。现在没那么有趣 革命性了,但机器学习仍要成为
[603.895-606.542] SPEAKER_01: 实现人类对话能力的核心。
[606.622-615.608] SPEAKER_01: 我们讨论反对意见。其中九个是图灵在论文中强调的 论文中。我做个非正式总结。第一个反对意见是 宗教把思考和灵魂挂钩。
[615.688-619.333] SPEAKER_01: 上帝是灵魂的赋予者,图灵说上帝万能。
[619.413-627.249] SPEAKER_01: 没理由不能把灵魂给任何生物或人造物,所以这并不… 灵魂进入人类的机制没法同样用在… 人造生物。
[627.329-633.795] SPEAKER_01: 第二个反对意见是鸵鸟政策,有点荒谬但很重要,马斯克和罗素也提过。 斯图尔特·罗素等人。
[633.875-648.924] SPEAKER_01: 鸵鸟政策说AGI可怕,人类级超人类级都可怕,今天讨论存在威胁,世界将会完全… 这样的东西让世界彻底改变,所以思考这点很重要。 有了它世界会彻底改变,所以思考这点很重要。 思考这点,然后它可能被…
[649.004-658.419] SPEAKER_01: 以消极方式改变,所以别去想它,因为太遥远很可能不会… 发生,所以别想它。这是对图灵测试的反对,太遥远不值得去…
[658.499-667.078] SPEAKER_01: 甚至思考这种智能测试,或人类级智能或超人类级… 智能意味着什么。自然回应:你的感受如何以及是否发生并不重要。
[667.158-676.956] SPEAKER_01: 所以放下情绪,不让恐惧或情感塑造思维,分散精力,不去… 思考它。第三个反对意见是哥德尔不完备定理,说计算有局限。这是罗杰…
[677.036-683.734] SPEAKER_01: 彭罗斯的思路:机器如果是计算系统,能力有限,永远无法成为… 完全理性的系统。
[683.814-689.514] SPEAKER_01: 图灵回应:人类也不理性,有缺陷。没说过智能等于无错误。事实上它可能…
[689.594-702.971] SPEAKER_01: 有人会说,易错性才是智能的核心。第四个反对意见是,意识可能是智能必需的。图灵的 回应是:区分“有意识”和“看起来有意识”。所以图灵测试的关键在于 它看起来怎样。
[703.051-715.801] SPEAKER_01: 图灵回应说,要区分“有意识”和“看起来有意识”。图灵测试的重心是 我们人类,据我们所知,也只是看起来有意识。我们没法证明别人真有意识。既然人类只是看起来
[715.881-726.808] SPEAKER_01: 有意识,机器为啥不能同样看起来有意识?这正是图灵测试的核心。它其实绕开了 “是否有智能、是否有意识”的问题。根本问题是:它看起来智能吗?
[726.888-735.014] SPEAKER_01: 它看起来有意识吗?所以他没有直接回应意识是否是智能必需。他只是说,就算是必需的,也 可以伪装。而这足以模拟智能。
[735.094-748.982] SPEAKER_01: 第五个反对意见是“消极南希式”的:机器永远做不到X,无论X是啥。X可以是爱、幽默、理解、生成幽默、吃、享受食物、创作艺术、音乐、诗歌等等。有很多事机器永远做不到。
[749.062-756.550] SPEAKER_01: 这主要体现了我们对机器局限的直觉。跟第二个反对意见一样,这里的回应是:说机器永远做不到X,
[756.630-761.053] SPEAKER_01: 背后并没有真正的推理。 这只是基于当今世界的空洞看法,
[761.133-765.521] SPEAKER_01: 拒绝相信未来世界 会不同。 第六个反对意见,可能是最重要、
[765.601-779.326] SPEAKER_01: 最有趣的, 来自阿达·洛芙莱斯,洛夫莱斯夫人, 计算机科学之母。 计算机科学之母, 基本想法是:机器只能做我们设定的事。 就是我们让它们做的事。 这种反对意见有多种形式。
[779.406-788.917] SPEAKER_01: 图灵前后一直存在。 我觉得这个反对意见很重要。 值得好好想想。 具体到这个案例, 我觉得图灵的回答很肤浅。 不过还挺有意思的。 我们后面再聊这个。
[788.997-793.942] SPEAKER_01: 他说:如果机器只能做 我们让它们做的事, 我们可以换个说法: 机器不会让我们吃惊。
[794.022-807.051] SPEAKER_01: 这么一说, 就清楚了: 机器其实总能让我们吃惊。 一个够复杂的系统, 我们对其行为 有稳定直觉的系统。 就算我们把所有代码片段都写好了。 对于写过代码的人来说,
[807.131-820.403] SPEAKER_01: 所以我写了很多程序。 在最初设计的时候, 你对它该有的行为有种直觉。 有设计,有计划, 你知道每个函数是干嘛的。 但随着代码变多, 你的能力, 直觉理解输入输出映射,
[820.483-825.974] SPEAKER_01: 会随代码库变大而减弱。 就算你理解所有代码, 先不管逻辑和语法错误。
[826.054-841.242] SPEAKER_01: 第七个异议是关于大脑的, 关注那个神经网络的连续模拟性质。 关注那个神经网络的连续模拟性质。 图灵对此的回应是, 当然,大脑可能是模拟的, 而数字计算机是离散的, 但如果有足够大的数字计算机,
[841.322-846.244] SPEAKER_01: 它几乎能完全模拟系统。 也就是说,够接近了。 看起来像是智能的。
[846.324-852.024] SPEAKER_01: 第八个反对意见,自由意志,对吧? 是不是有了确定的规则、规律和算法, 会导致可预测行为。
[852.104-860.939] SPEAKER_01: 而且, 这种完全确定可预测的行为 并不太像心智, 就是人类拥有的那种。 这种潜在感觉 是智能需要的, 对心智来说,
[861.019-874.500] SPEAKER_01: 我认为是中文房间思想实验背后的东西, 我们后面会讨论。 所以图灵这里的回应是 人类很可能是一个复杂的, 规则集合。没迹象表明我们不是。只是因为我们不理解或
[874.580-881.847] SPEAKER_01: 甚至没工具探索大脑底层规则,不意味着它 不只是一组确定且完全可预测的规则。反对意见九。
[881.927-893.098] SPEAKER_01: 有点意思。图灵可能在逗我们,但更可能他那时对于 读心术、超感知、心灵感应当时更流行。所以 反对意见是,如果用读心术作弊测试怎么办?基本上,
[893.178-901.235] SPEAKER_01: 如果心灵感应交流成为可能,机器就做不到那种 相同的心灵感应。所以可用来规避测试有效性。 测试有效性。现在,
[901.315-913.345] SPEAKER_01: 图灵回应说,嗯,你只需设计一个房间,既要保护你不被 看到它是机器人还是人,还要防心灵感应的房间, 阻止心灵感应。同样,可能图灵在逗我们,
[913.425-925.014] SPEAKER_01: 但更重要的是,这当时是个好说明,至今仍如此。 关于思维运作有很多神秘。如果你一笑而完全 否定心灵感应,那你对自己思维运作的知识假设太多。
[925.094-934.498] SPEAKER_01: 知识。我觉得我们对自己的思维知之甚少。事实上, 确实,几乎没有科学证据,但你不该迈出 下一步,觉得你理解了心灵感应是
[934.578-947.711] SPEAKER_01: 不可能的。但你应该保持开放。不过作为反对意见,它不太 似乎很有效。我想用一张幻灯片介绍最著名的 对图灵测试的反驳,约翰·塞尔1980年论文《心灵、大脑与程序》提出,
[947.791-964.094] SPEAKER_01: 常被称为中文房间思想实验。这有点 结合了上一张的第四、六、八条反对意见。 意识是智能必需的,艾达·洛夫莱斯认为程序只能执行设定,意识才是关键。 程序只能执行设定,意识是智能必需的。
[964.174-980.314] SPEAKER_01: 我们编程让它们做事,但决定论认为规则导致可预测行为,不像心智。 导致可预测行为,不像心智所为。因此图灵预见的反对意见都汇聚到中文。 房间中。顺便说,早上6点,昨晚没睡,全靠这瓶魔法药水。
[980.394-989.519] SPEAKER_01: 在周六早晨支撑我。敬你们,朋友们。好的,中文房间。 涉及遵循算法指令。有个人坐房间里,不懂中文,但纸条在传递。
[989.599-994.347] SPEAKER_01: 所以大脑在试图理解这个人在做什么。 大脑在理解这个人在做什么,而他们
[994.427-1006.457] SPEAKER_01: 所做的只是遵循规则回应语言。所以观点是,如果 通过图灵测试的系统内部只遵循规则,那它并未真正理解。 没有意识,没有心智。这个反对是哲学性的。 所以,
[1006.537-1014.396] SPEAKER_01: 以我计算机科学背景看,它缺乏内涵,甚至不有趣。 非常以人类为中心,但进一步探讨。关键是程序,
[1014.476-1025.273] SPEAKER_01: 计算系统是形式化的,可以捕捉句法结构。心智、我们的大脑 所以并没有, 对我计算机工程出身的人,里面没实质内容,连有趣都做不到。
[1025.353-1034.373] SPEAKER_01: 非常以人为中心,但进一步探讨。关键论点:程序, 计算系统是形式化的,能够捕捉句法结构。心智,我们的大脑
[1034.453-1045.006] SPEAKER_01: 有心理内容,所以能捕捉语义。 所以,这个主张, 我认为论文最关键的是,句法本身不能 构成语义,也不足以产生。所以,仅仅复制句法
[1045.086-1053.352] SPEAKER_01: 不代表你真正理解。这正是现在我们对 Transformer模型的批评:GPT-2并不理解 语言。它模仿得太好,以至于能生成
[1053.432-1063.370] SPEAKER_01: 句法正确、带语义回响的文本,暗示着某种 理解,却没有。对我来说,这种观点 从工程角度看没趣,因为像说人类能理解,
[1063.450-1068.558] SPEAKER_01: 人类特殊,所以机器无法理解。 这个论点太人类中心,不让我们严格探索
[1068.638-1076.962] SPEAKER_01: 到底 从计算看,理解是什么?换句话说, 如果理解、智能、意识等都无法通过 计算实现,那计算在哪碰壁?
[1077.042-1086.399] SPEAKER_01: 我觉得最有趣的问题是伪造和模仿, 或表象。模仿思考等于思考吗?模仿 意识等于意识吗?模仿爱等于爱吗?这是我
[1086.479-1096.138] SPEAKER_01: 常思考的问题,每天看法不同。但我倾向于相信 从工程学看,我同意图灵的精神和工作。 现在当工程师,我们只做思考、意识的样子。
[1096.218-1102.301] SPEAKER_01: 还有爱的样子。我们努力做这些样子。 开始理解意识、爱、思考的真谛。
[1102.381-1107.744] SPEAKER_01: 你可能听过我说,意识的样子就是意识。 我觉得这有点诗意,但从我们视角看
[1107.824-1118.844] SPEAKER_01: 从我们有限理解,这两个问题都指向 同一个方向。从我们视角,问题同向。 我们专注做意识的样子,不会走错路。 依我看,反而引导我们真正理解并
[1118.924-1127.944] SPEAKER_01: 或许设计出意识。现在谈图灵测试替代方案 和变体,我觉得有趣。图灵测试有自然 变体和扩展。1989年完整图灵测试。
[1128.024-1135.907] SPEAKER_01: 它把自然语言对话扩展到感知、 计算机视觉和操作物体,测试进物理 世界。有趣的是,加额外模态如音频、
[1135.987-1144.787] SPEAKER_01: 视觉操作,是否更难或更易。很可能, 一个狭窄的通信测试 窄带宽的测试,如图灵测试的自然语言。
[1144.867-1148.315] SPEAKER_01: 实际比含其他模态的测试更难通过。
[1148.395-1158.112] SPEAKER_01: 但原始图灵测试最棒的地方就是简单。 2001年提出的洛芙莱斯测试,来自阿达·洛芙莱斯的反对意见。 机器得做些让创造者惊讶的事。
[1158.192-1166.516] SPEAKER_01: 连知道程序原理的人也解释不了,才能真惊讶。 2014年有人提出洛芙莱斯2.0,对惊讶定义更严格。
[1166.596-1180.542] SPEAKER_01: 因为“惊讶”这个概念很难确定和形式化。 原版洛芙莱斯测试关注惊讶和解释。 洛芙莱斯2.0让原版表述更难确定,因为太模糊。 但洛芙莱斯2.0强调创造力和艺术,比惊讶更具体。
[1180.622-1191.781] SPEAKER_01: 它比“惊讶”更具体,尤其是定义了创意媒介的约束条件。 你基本上得创作一件令人印象深刻的艺术作品。 这想法有趣,但让我们进入更主观的领域。
[1191.861-1197.352] SPEAKER_01: 相比之下,原版图灵测试没那么主观。 但这引出关于惊讶的开放又有趣的问题。
[1197.432-1203.736] SPEAKER_01: 我认为这其实是智能概念的核心。 我们对智能机器的看法就是它能真正让人惊讶。
[1203.816-1213.579] SPEAKER_01: 所以当我们最终造出人类级或超人类级的智能系统时,一定会惊讶。 所以得思考,什么样的行为会让我们深感惊讶? 对我来说,我有很多例子。
[1213.659-1218.221] SPEAKER_01: 对我来说,我有很多例子。 未来视频会聊这些,但幽默肯定最难。
[1218.301-1228.877] SPEAKER_01: 最后,1998年提出的真正完全图灵测试,带来了有趣的哲学观点。 就是说,不该孤立评判单个智能体。 而应该看它产生的全部工作。
[1228.957-1233.484] SPEAKER_01: 一群智能体进化中产生的所有工作。 但进化一致性有约束。
[1233.564-1243.119] SPEAKER_01: 有趣的是,有人认为人类对智能的理解 根植于共同创造的全部工作成果历史中。 我不觉得有说服力,但看到了有趣的问题,
[1243.199-1252.185] SPEAKER_01: 呃,开放性问题,就是不该只在当下测量系统, 或只测五分钟二十分钟,而要数月数年测量, 呃,或许在模拟中浓缩。
[1252.265-1258.929] SPEAKER_01: 这样评判交互的规模就提高几个数量级。 对我来说,这想法很有趣。 比如评判AlphaZero不是看一局棋,
[1259.009-1266.648] SPEAKER_01: 而是看百万局,且不是静态参数下的百万局, 而是从零训练过程中下的数百万局。 并越下越好。
[1266.728-1278.630] SPEAKER_01: 整个历程可能蕴含捕捉智能的要素。 所以,智能可能就是这样。 旅程,而非目的地。 我觉得那里有东西。 这种构造很不精确, 但这让我觉得这像是, 一个很新颖的想法。
[1278.710-1295.314] SPEAKER_01: 说到基准测试, 不是为了测瞬时性能, 而是测随时间变化的性能, 以及性能随时间的提升。 看来确实有点道理, 但我没法具体说。 而且不确定能不能像图灵测试那样形式化。 另一种测试是维诺格拉德系统,
[1295.394-1310.118] SPEAKER_01: 也就是模式挑战, 我觉得它在很多方面都很引人注目。 先举个例子解释一下, 有个句子, 其实是两个句子, 说奖杯放不进棕色手提箱,因为它太小了, 还有奖杯放不进棕色手提箱,因为它太大了。 问题来了
[1310.198-1320.754] SPEAKER_01: 什么叫太小? 什么叫太大? 关于‘小’,什么叫太小? 就是手提箱太小了 奖杯放不进棕色手提箱,因为太小了 第二个问题是 什么叫太大? 答案是奖杯
[1320.834-1331.433] SPEAKER_01: 奖杯太大,放不进棕色手提箱 这个挑战的核心是 句子里的歧义 只能靠 关于世界概念的常识推理 才能解决 所以这个测试的优势 就在于 很明确
[1331.513-1343.590] SPEAKER_01: 很简单 但需要 至少从理论上说, 我们觉得这是人类最根本的东西。 人类, 也就是推理能力。 在最基本的常识推理层面。 另一点, 好处是它可以作为 一个基准,
[1343.670-1357.116] SPEAKER_01: 就像机器学习里常见的那样, 不需要人类主观评判。 确实有正确答案。 这里的弱点, 也就是制约。 其他类似的挑战 在这个领域特别困难。 问题很多,我是说每道题 是手工做的。 所以你不能
[1357.196-1369.284] SPEAKER_01: 构建一个基准 做个基准测试。 几百万甚至几十亿个问题。 它必须是 规模要小 变种 温诺格拉德方案被用在 一些自然语言里 现在的基准测试中 人们用在机器学习领域的
[1369.584-1373.728] SPEAKER_00: 亚马逊Alexa 奖,我觉得,抓住了
[1374.028-1391.108] SPEAKER_01: 很好地体现了精髓 图灵测试的。我觉得这其实是 一个非常了不起的挑战和竞赛 它用的是 现实世界里的语音对话,然后和 真人,他们可以用 一个,我觉得它叫社交机器人 技能在他们的Alexa设备上 我不想 叫醒我自己的Alexa,但基本上
[1391.188-1406.074] SPEAKER_01: 先叫她名字,然后说,咱们聊聊天吧。 这就引出了 挑战中的一台机器人,然后 你就可以开始对话。然后 需要满足的标准 就是让你 跟机器人聊20分钟或 更久的时间, 而且要求三分之二 或更多互动达到
[1406.154-1422.015] SPEAKER_01: 这个时长。所以成功互动的关键指标 就是互动时长。 而到今天为止, 我们离这个目标还差得很远很远。 那为什么这是个好标准呢? 而且我觉得这是个很有力的 指标。比起我们事后评价 对话质量, 我们用行动来表达。 我们用行动说话。
[1422.095-1435.193] SPEAKER_01: 所以,一场深入有意义的对话 让我们不想离开。 当有其他事抢时间, 我们选择留下对话, 那是个强烈信号, 表明对话有内容, 有意义, 令人愉快。 我认为这就是 图灵测试最初的精神。
[1435.273-1450.496] SPEAKER_01: 而且直到今天, 没有团队接近通过 图灵测试。 按Alexa的奖项标准。 有几个方面很让人惊讶。 没有团队,连边都沾不上 通过了图灵测试 按照Alexa搭的。 说到奖项,有几个方面特别关键。 这个挑战真让人惊讶。
[1450.576-1463.082] SPEAKER_01: 一个原因是它不太受欢迎。 第二, 亚马逊把它限制在 只给学生。我是说, 几乎变成一种教育 活动,而不是 面向整个研究世代的 登月挑战。 我前面提过, 但我再说一遍,
[1463.162-1477.630] SPEAKER_01: 让我惊讶的是,最大的 学术界的实验室产业 没专注在 这个问题,没 在图灵测试和Alexa Prize里 发现了魔力,其表述 我相信, 体现图灵测试的精神 相当好。 一个非常不同的
[1477.710-1490.028] SPEAKER_01: 这个测试叫Hutter Prize, Marcus Hutter提出,我觉得 这非常迷人。 从哲学和数学角度, 它的根本, 理念是 压缩, 强相关, 与智能。换句话说, 能够很好地
[1490.108-1502.335] SPEAKER_01: 压缩知识的能力, 需要智能,而且 你压缩知识越好,就越 聪明。我觉得这是 一个非常吸引人的 概念,这样我们就能 明确量化 你有多聪明, 通过你压缩的程度 知识。
[1502.415-1515.699] SPEAKER_01: 就像奖项网站说的 能高效压缩 与智能行为密切相关 从而把难以捉摸的概念 把智能简化为文件 大小的数字,所以 任务是获取 1GB的维基百科 数据,然后 尽可能多压缩
[1515.779-1529.307] SPEAKER_01: 目前最好的结果是 8.58倍 压缩因子,所以 从1GB降到 117MB并且 每改进1%的奖励是 你将赢得5000欧元 我发现这场比赛 非常惊人且迷人 在很多层面,我觉得这是个
[1529.387-1543.507] SPEAKER_01: 说得非常好 说到智能 挑战,但它 不是测试,而是它的一种 局限性,至少 诗意地说,它 没设定一个超越后的 让我们很震撼的标杆 意思是,设标杆更难 像图灵测试定的那样
[1543.587-1560.284] SPEAKER_01: 的标杆,超过它我们会觉得 达到了人类智能水平 如今,图灵设的标杆 还有其他奖项,像罗布纳奖、 Alexa奖,也都是随意的 但感觉我们 能在那个语境里凭直觉找到好标杆 比 能凭直觉找到我们需要的标杆 给压缩挑战设标杆更容易
[1560.364-1576.341] SPEAKER_01: 另一个迷人的挑战 是抽象推理挑战 是FrancoisChollet提出的 就在几个月前 所以这非常令人兴奋,它正在进行 作为KEGO上的一个竞赛,我想 五月份截止 这个非常非常有趣 想法,我还没完全消化 它以后可能单独做一个
[1576.421-1591.296] SPEAKER_01: 关于这个视频 就这篇论文,我会和Francois谈谈 我肯定会在播客和其他 以后的交流中谈到它 很多精彩的想法 我还需要某种程度上 消化一下,然后我来描述 高层次上 这个基准背后的想法 所以首先
[1591.376-1604.579] SPEAKER_01: 名称是抽象和推理。 语料库或挑战性弧。 领域在于 在一个模式网格世界中。 不限于大小,但 网格世界被填满 包含不同的 颜色的单元格。 弗朗索瓦提出的测试精神 是接近
[1604.659-1617.003] SPEAKER_01: 智商测试,即心理测量 我们用来 测量 人类智力的测试。 现在,图灵测试 在某种意义上处于更高层次 自然语言层面。 在这种构建中 ARC,它尽可能 接近
[1617.083-1627.708] SPEAKER_01: 到最基本的元素 推理的 就像智商测试的 模式,它触及到 核心 这样我们就可以 明确先验知识 我们已有的概念 带到这些测试中 如果我们能让它们明确
[1627.788-1644.627] SPEAKER_01: 这就会把测试减少到 尽可能接近 衡量系统能力 推理的能力。现在 被带到这个网格世界的概念 这里只是先验知识的几个例子 弗朗索瓦 在他一篇我极力推荐的论文中展示的 题为《论智力的衡量》 这里,先验概念
[1644.707-1657.715] SPEAKER_01: 不是指之前的概念,而是 就是之前存在的 你带来的一套知识 所以这第一行插图 两个网格世界的 世界展示了对象的 有噪声的持续性 所以我们可以 理解 大型物体,当有
[1657.795-1669.570] SPEAKER_01: 一些视觉 噪声遮挡 我们的能力 看到它们,它们仍然存在 世界上,如果噪声改变 物体仍然不变 所以这个想法 对象 在世界中的持续性 是我们自带的一个先验
[1669.650-1681.146] SPEAKER_01: 理解这个网格世界的表格。 另一个先验是 在左下方 是物体 由以下定义 空间连续性。 所以物体 在这个网格世界中, 当格子颜色相同 且彼此相邻时,
[1681.226-1693.662] SPEAKER_01: 它们很可能属于同一物体。 而如果有黑色格子分隔 这些组, 那就代表有多个物体。 因此这种颜色格子的 空间连续性 定义了 物体的 实体。而在右边 底部是
[1693.742-1707.595] SPEAKER_01: 根据颜色连续性 也就是说,就算单元格 不同颜色的格子挨在一起 如果颜色不同,那就说明 它多半属于不同物体 这是个基本前提 另外还有几个 美极了 那篇论文里的图片 让你真正思考
[1707.675-1720.402] SPEAKER_01: 关于核心要素 智能,我喜欢那篇论文 值得一看,有很多 有趣的见解 只是给你一些 实际例子 机器在这个任务里的任务 测试看起来类似那种 就像智商测试里的任务 所以这里有三个配对
[1720.482-1732.454] SPEAKER_01: 以及 任务是针对第四对 图像生成 网格世界 适合其他三个。 适合生成 其他三个的模式。 所以这种情况下,图四 来自论文的任务,其中 隐含目标是完成一个对称的
[1732.534-1745.621] SPEAKER_01: 模式。该任务的性质 由三个输入输出 示例指定。测试者必须 生成对应于 测试输入的输入网格的 右下角。所以这里 你的任务是理解 在前三个配对中 即 输入有
[1745.701-1757.406] SPEAKER_01: 一个完美的 全局对称性 对它,而且还有 有些部分 图像缺失,可以 填上完成那个 完美的对称性。现在是 依赖另一个先验,另一个 对称的基本概念 我认为这构成了
[1757.486-1771.513] SPEAKER_01: 我们理解视觉模式的基础 再次,所以 智能系统必须要有 一个好的 对称性的表示 在不同上下文里 这很迷人,而且 美丽,美丽的图像 好,另一个例子,图十 来自论文,一个任务,其中
[1771.593-1789.138] SPEAKER_01: 隐含目标就是算唯一对象有几个 然后选出出现的对象 次数最多的那个,实际上 任务里的演示对比这些多得多 三个,所以图十 来自论文,有个任务 隐含目标就是算唯一对象个数 再选出出现的对象 次数最多的那个,再次 有三个配对
[1789.218-1800.830] SPEAKER_01: 你看第一个里有 三个蓝色对象,在 第二个里有四个黄色 第三个里有三个红色 所以你得搞清楚,然后 输出就是 捕获的网格单元 出现次数最多的那个对象 所以应用那种 推理来完成
[1800.910-1814.879] SPEAKER_01: 这个输出结果 第四对,其中一个 这个测试的挑战在于 很难生成,但正如 就像我说的,有很多非常有趣 技术和哲学思想 这里值得 所以,我们快速讨论一下 几个要点 所以,我们放大来看
[1814.959-1827.442] SPEAKER_01: 图灵测试是衡量 智能,看它能否 作为对 这个宏大、模糊又深刻 哲学问题:机器能否 思考?那首先,一些 关于 图灵测试的潜在挑战 测试,我们来谈谈 关于智能
[1827.522-1836.217] SPEAKER_01: 所以要是比较人类行为 跟智能行为比 很明显 图灵测试想捕捉 人类行为里 智能的部分 但要是真想 捕捉人类 级别的智能 也有可能
[1836.297-1847.921] SPEAKER_01: 想捕捉不智能的 非理性的人类行为 所以这问题待探讨 自然对话到底是 是对 智能测试还是 人性测试 因为要是智能测试它 只关心 理性系统的思维
[1848.001-1863.955] SPEAKER_01: 如果这是对人性的测试, 那你就得捕捉到完整的 情感、混乱、 非理性、懒惰、 无聊,所有那些 让我们成为人的东西,还有所有 然后投射到 我们进行的 对话的方式里。就像我在 之前目标里提到的,图灵测试
[1864.035-1879.072] SPEAKER_01: 真正关注的是 外部表现,而不是 内部过程。所以 就像我说的,从工程学的 角度来看,我觉得这是非常 很难创造出一个测试来检验 有些我们理解非常有限的 概念的内在过程,比如 智力, 比如意识。我觉得
[1879.152-1887.487] SPEAKER_01: 我们现在能做的最好 量化方面 而且有衡量标准 对某事物,我们得看 系统外部表现 而不是内部过程的某些 属性 另一个
[1887.787-1890.178] SPEAKER_00: 对图灵测试的挑战,就像
[1890.478-1903.892] SPEAKER_01: 斯科特·阿伦森和尤金·古兹曼的对话 所表明的就是 审问者的 技能在这里很重要 这包括 对话技巧 就是你能多大程度跟机器人展开 挑战对话 也包括人类方面 审问者识别
[1903.972-1912.574] SPEAKER_01: 审讯者去识别 人和机器的人性 机器,所以 对话能力 挑战 机器人的,还有 识别人类 或机器,都是技能 是 图灵测试必需的
[1912.654-1923.152] SPEAKER_01: 测试。对我来说 真有趣,拟人化 的 人类对 和无生命物体互动 我觉得这很迷人 这是个开放问题 在某些构建中 图灵测试,拟人化是否 被用来说服人类
[1923.232-1937.375] SPEAKER_01: 是否在作弊图灵测试 其实,这是个关键。 这个要素是用来 说服我们,有个东西 是有智能的。也许作为 起点,我们不得不把它拟人化 它,然后我们才被允许 是聪明的。 我们主观觉得 关于它的智能
[1937.675-1940.925] SPEAKER_00: 最后,还有一个 图灵测试有个局限
[1941.225-1954.579] SPEAKER_01: 简单说就是 为什么我们指望一个机器人 会说话?如果 它不想说话呢? 它还是失败吗?我认为 更普遍的说法是 就是,为什么我们判断 一个系统的表现 在这么短的时间窗口里? 就像我说的
[1954.659-1967.130] SPEAKER_01: 之前,可能有些有趣的事 关于 拉长时间窗口 这段时间 我们分析智能 系统时,不只关注 只关注平均表现 而是性能的增长 当它和你单独互动时 我觉得有一个关键
[1967.210-1979.391] SPEAKER_01: 智能的方面是 社交方面 和社交 联系,我认为 部分可能需要 了解这个人 而图灵测试有些需要重新思考的地方 这取决于我们 和这个人建立关系 作为测试的一部分,你可以
[1979.471-1992.314] SPEAKER_01: 看作是一种 《机械姬》图灵测试 他们花时间 进行一系列对话 共处几天 诸如此类的事,这 感觉是个有趣的 图灵测试延伸,这 能揭示明显限制 当前构建的
[1992.394-2005.481] SPEAKER_01: 图灵测试,时间窗口有限 在测试 结束时,问或判断 判断它是人还是机器 现在我的看法 总的来说,关于图灵测试 嗯,是的,就像 图灵测试 最初设计的那样,所以 自然语言
[2005.561-2018.961] SPEAKER_01: 对话接近了 这是对智能的终极测试 另外 这就是我不同意的地方 和Francois Chollet等人 世界级研究人员的观点 在该领域Stuart Russell等人 我觉得图灵测试 对我们不是干扰 去思考,它不会把我们
[2019.041-2033.428] SPEAKER_01: 从实际中 在该领域进展中拉开 我认为它让我们诚实 我认为真正分析 我们在自然语言对话中的位置 语言对话将 帮我们理解我们离目标多远 更重要的是 我认为应该有积极的 关于这个领域,我认为
[2033.508-2047.036] SPEAKER_01: 像洛布纳奖那种表述,Alexa 奖项表述应该更 受欢迎,而且我觉得 研究人员要非常 认真对待它们,但这不代表 ARC基准测试 像智商测试那种 智能测试不会 也可能有成果,潜在 非常有成果
[2047.116-2059.564] SPEAKER_01: 但我觉得最终 真正的测试 人类水平的智能 会发生在类似 图灵测试框架,用自然语言 开放域对话 产生深刻有意义的 开放域对话 这带来了深刻有意义的 人和
[2059.644-2069.744] SPEAKER_01: 和机器,缩小一点 一点, 总的来说,我觉得 人工智能研究人员 不喜欢,也尽量避免 人类的混乱 就像 人机交互领域 和一系列问题,我觉得 不只是
[2069.824-2083.979] SPEAKER_01: 拥抱图灵测试,我觉得我们应该 拥抱人类的混乱 在 所有不同的计算机领域 视觉、自然语言、 机器人学、 自动驾驶汽车。 我一直倡导 半自动驾驶汽车已经来了 我们会待很久,然后要
[2084.059-2098.283] SPEAKER_01: 搞清楚人机交互 的问题,而为了 做到这点,必须接受 感知车里人的一切, 感知车外人的一切。 就像我说的,这篇 论文展示是我们论文阅读 俱乐部的一部分, 俱乐部专注于 人工智能,我们在那
[2098.363-2113.632] SPEAKER_01: 每周讨论几次, 就在一个叫 Lex Plus AI 播客的 Discord 服务器上。 欢迎加入,我们有个 精英组成的精彩社区, 他们讨论各种话题, 涉及 AI 和其他领域。 这个特别的 这个特别的 我最爱的插画是
[2113.712-2125.707] SPEAKER_01: 来自插画家威尔·斯科比 来自英国 他是Discord社区一员 所以他贡献了这幅画 总之,除了 精彩的对话以外 我希望看到 社区其他成员贡献 艺术、代码、 可视化和幻灯片
[2125.787-2140.069] SPEAKER_01: 这类视频的创意 我特别兴奋 因为看到了这种对话 如果你在看这个视频 想加入请点Discord链接 幻灯片描述里的链接 加入对话 每周都有新论文,很有趣 就是想给你一点 理解这些想法背后的含义
[2140.149-2153.410] SPEAKER_01: AI论文阅读俱乐部,比如 目标是这样,那它是什么? 我觉得 目标是选一篇领域里的开创性论文 这篇论文不只关注 具体的那种 逐段逐节地 分析论文的内容 而是用这篇论文来 讨论历史大的
[2153.490-2170.292] SPEAKER_01: 领域发展的宏观图景 在这篇论文的背景下 论文,那可能是哲学性的 像这篇图灵测试论文这样的 或者是非常具体的论文 在这个领域,再次强调,物理、数学、 计算机科学,而且可能挺 一些深度学习 所以, 希望是首选
[2170.372-2180.809] SPEAKER_01: 美丽有力的见解 不求全覆盖 整篇论文 但实际上 Discord的含义 更希望少一些 单人演讲 讨论少,人才多 他们礼貌,所以能 三四百人同时
[2180.889-2194.289] SPEAKER_01: 在语音聊天里,亲密 环境,然而大家 不会互相打断 不是混乱,社区很棒 另一个目标是 就算我们讲 技术论文,也要让它 让每个人都能懂 所以,不管高中生 学生和外界人士
[2194.369-2209.162] SPEAKER_01: 总体来说,这些领域 同时,我很想让这个 对……有用 领域专家和专业研究人员 所以,避免 用专业术语,但还是 尝试发现 新的见解,这些见解 有趣的,对……很重要 这个领域的研究人员,这就是我
[2209.242-2224.244] SPEAKER_01: 希望通过这个 论文阅读俱乐部实现。如果你感兴趣, 加入进来,收听, 或者为对话做贡献。建议 论文,建议 内容、可视化、代码。 都欢迎。这是一个很棒的 社区,谢谢观看这个 很长的演示。 有建议的话,告诉我。
[2224.324-2225.856] SPEAKER_01: 不然,希望下次见你。
[2226.156-2226.864] SPEAKER_00: 时间。