返回 文章 学习 CMS 文章

Richard Socher 谈尤里卡机器:递归自我改进与自动化 AI 研究

Richard Socher 押注递归自我改进:让 AI 自动化 AI 研究,最终成为发明一切的尤里卡机器。

递归自我改进AI 研究自动化尤里卡机器AI 安全
成长分 / 100 67 综合收获、行动、留存与影响

Richard Socher 谈尤里卡机器:递归自我改进与自动化 AI 研究
为什么值得读了解 Richard Socher 从 NLP 先驱到 You.com 再到 Recursive 的完整思考脉络。

获取他对 AI 安全、监管、开源与对齐等争议话题的一手观点。

关键洞察
  1. 尤里卡机器是一种超级智能,能被赋予任何目标并尽最大努力实现,从而为人类发明几乎所有东西。
  2. Richard 认为 AI 硬起飞情景高估了发展速度,存在硬件、算力和经济约束。
  3. 他批评 Anthropic 的宪法 AI 是营销,认为其硬约束并未被遵守。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:116776

在1:09:00处,我们讨论了AI与金融的崛起,AIE NYC还有一个月就要开幕了——我们的酒店房间已售出97%,请尽快获取门票和安排行程——我们将很快宣布来自Bridgewater、Ramp、Coatue、Mastercard、Vanguard、Coinbase、Blackrock、Fidelity、Point72、Capital One、JPMC、Wells Fargo、Bloomberg、A24(没错,就是那个电影工作室)Labs、Two Sigma、Apollo Global等机构的演讲嘉宾!

从帮助开创NLP的核心思想,到如今构建能够自动化AI研究本身的AI系统,Richard Socher押注AI的下一个重大步骤是递归自我改进。 他是You.com、AIX Ventures的创始人,现在又创立了

Recursive,该公司汇集了一些最优秀的

开放性(&

自我改进智能体)研究人员,并筹集了

46.5亿美元的种子轮融资

在本期节目中,Richard加入Latent Space,阐述他对“尤里卡机器”的愿景:一种能够改进发明过程本身、加速AI研究,并最终解决科学、能源、材料、生物学等领域重大问题的超级智能。

你可以在这里获取他的书《尤里卡机器》!

我们深入探讨了Recursive的早期成果,包括Richard称其在不到两天内在优化任务上超越了人类及其智能体的AI研究系统,以及在NVIDIA GPU内核方面的工作,该系统在没有依赖CUDA专家团队的情况下发现了改进。Richard还解释了他为什么认为目前需要数千人和数年时间的AI研究最终可能被压缩到几周。 这些成果总结在他的20分钟AIE主题演讲中,我们还讨论了他的智能的10个维度:

我们还探讨了围绕日益强大的AI的更棘手问题:奖励黑客、Anthropic式宪法是否真正有效、AI监管以及“放缓”前沿发展的提议、开源模型作为地缘政治软实力、当今LLM范式是否足够,以及如果AI系统最终开始选择自己的目标会发生什么。Richard反思了被拒绝的研究如何启发了Alec Radford的GPT、开放性、AI经济学家、整个经济的模拟,以及他思考智能本身上限的框架。

我们讨论:

尤里卡机器和Richard对能够自动化发明的AI的愿景为什么Richard对

科学与技术的超级智能持乐观态度为什么

AI硬起飞情景可能低估了物理和经济约束

监管智能本身而非特定AI应用的风险奖励黑客以及为什么日益智能的AI使目标设计更难Richard对

Anthropic的宪法和宪法AI的批评对齐与个性化以及AI应该遵循谁的价值观为什么

开源AI对韧性、竞争和地缘政治软实力很重要为什么Richard离开You.com的前沿模型工作去创立

Recursive递归自我改进和自动化AI研究过程当今

LLM范式是否足够——以及为什么Richard对世界模型不那么看好DecaNLP、早期基于提示的泛化,以及影响GPT的研究为什么

被拒绝的研究可以塑造整个技术时间线开放性、进化方法和彩虹团队如果 AI 系统开始

设定自己的目标会发生什么?为什么像

利润最大化这样简单的目标会产生危险的奖励黑客行为Recursive 的长期计划是将

自我改进的 AI 应用于科学AI 起飞所面临的

算力、硬件和经济约束Recursive 早期的

NanoChat、NanoGPT 和 GPU 内核优化结果为什么自动化 AI 研究可以将

数年的工作缩短到数周奖励工程以及是什么让自动研究系统真正发挥作用

AI 经济学家以及使用模拟来测试经济政策LLM 能否现实地

模拟人和整个经济体基准测试错误和评估框架以及衡量 AI 进展的困难Recursive 的近期重点在于

用于 AI 研究的 AI框架优化、沙箱和网络搜索作为核心智能体基础设施You.com 以及

面向 AI 智能体的搜索栈AI 在金融、回测和数据泄露中的应用Richard 的三个基本组成部分以及

智能的十个“空间”视觉、通信、知识和计算的理论上限

创造性智能、元认知和 AI 生成的目标生存与复制以及为什么 AI 不一定需要害怕被关闭高能动性和雄心勃勃的目标以及 Richard 对使用 AI 进行构建的人们的建议

Richard Socher

时间戳

00:00:00 尤里卡机器与超级智能

00:02:23 AI 乐观主义、缓慢起飞与监管

00:07:56 AI 安全、奖励黑客与 Anthropic 的宪法

00:11:49 对齐、个性化与开源 AI

00:15:46 Richard 为何创办 Recursive

00:20:03 递归自我改进与创始团队

00:22:55 当今的 LLM 足够吗?

00:29:03 DecaNLP、GPT 与超前于时代的被拒想法

00:34:38 开放性与进化 AI

00:36:38 当 AI 选择自己的目标时会发生什么?

00:41:16 用于科学的超级智能

00:42:40 GPU、算力与 AI 起飞的极限

00:45:07 Recursive 的成果:AI 击败人类及其智能体

00:49:14 奖励工程与自动研究

00:53:12 AI 经济学家与模拟整个经济体

00:58:07 LLM 模拟、人物角色与模式崩溃

01:03:38 Recursive 的路线图、智能体、搜索与金融

01:09:13 智能的上限与空间

01:30:21 目标、高能动性与给构建者的建议

文字记录

引言:Richard Socher 与尤里卡机器

Swyx [00:00:00]: 我们和 Vibhu、我自己以及 Richard Socher 一起在演播室。欢迎。

Richard Socher [00:00:06]: 感谢邀请。

Swyx [00:00:07]: 我们刚聊了尤里卡机器,或者说我们刚在 AI Engineer 发布了一个关于尤里卡机器的演讲。它是——你说这是你的人生目标。什么是尤里卡机器?

Richard Socher [00:00:16]: 尤里卡机器是终极发明,之后它将为人类发明几乎所有东西。它本质上是一种超级智能,可以被赋予任何目标、任何环境、奖励,然后它会尽最大努力实现这些目标,创造出人类希望它创造的那种发明。

Swyx [00:00:45]: 是的,我想我们这里打开了你写的书。

Richard Socher [00:00:50]: 没错,是的。我去年完成了它,就在我们开始 Recursive 之前不久,现在我们要试着把其中的一些部分构建出来。

Swyx [00:00:57]: 你去年就完成了。现在是七月。是什么花了这么长时间?

Richard Socher [00:01:01]: 哦,天哪,书。书慢得令人难以置信。

Richard Socher [00:01:04]: 这太荒谬了。整个行业都慢得让人无法理解。

Richard Socher [00:01:07]: 所以很多想法已经存在一段时间了,但没错,我真的很高兴它终于在今年九月要出版了。

Swyx [00:01:14]: 到那时我们可能已经有 AGI 了。就像,我们不知道。

Vibhu [00:01:18]: 有什么你最兴奋想放进书里的关键要点吗?

技术乐观主义、AI 的积极面与缓慢起飞

Richard Socher [00:01:21]: 是的。我认为关键要点是,人们可以而且应该对超级智能的积极影响更加兴奋,尤其是对科学、物理、化学、生物学,还有经济学和天体物理学,以及各种其他工程任务。我认为有了更好的技术,能做的事情要多得多。而现在,我觉得很多人需要,像是,更好的宣传,不只是对未来的总体宣传,也是对技术、尤其是对 AI 的更好宣传。而这本书应该能向甚至 AI 怀疑论者展示,AI 有多么大的积极潜力,尤其是在发明、新的科学发现方面。

Swyx [00:02:09]: 我想你引用了 Marc Andreessen 的技术乐观主义者宣言,我觉得它在其雄心、清晰和简洁方面几乎同样优美。

Richard Socher [00:02:18]: 我同意。是的。是的,你可以在某些事情上不同意他,但,像是,我认为他在技术乐观主义上是对的。

Swyx [00:02:23]: 你认为乐观主义者会在哪里陷入麻烦?

Richard Socher [00:02:26]: 像是,你不应该有盲目的乐观。你应该非常清醒,尤其是面对像 AI 这样近乎全能、用途广泛的技术时,你需要考虑潜在的下行场景,尤其是当人们把它用于你不想让他们用的用途时。这有点像互联网,我觉得人们有时试图监管 AI,正是因为那些潜在的下行风险,就像你会监管互联网那样,如果你说:“好吧,因为互联网上有不良内容,比如酷刑色情之类的,所以我们就应该让它变慢。这样,你就不能那么快地分享非法内容,或者我们应该把硬盘做得更小,这样你就不能存储那么多非法内容。”但我会说:“那不是监管它的方式。”那就像说我们应该抽象地监管智能。为了避免那些下行场景,即使作为乐观主义者,你应该监管的是具体的应用。当然,我不想要,像是,某个 AI 外科医生,像是,在我脑子里练习一些 RL 动作。它应该完全获得 FDA 认证。当然,我不想要任何随机的初创公司,像是,在高速公路上行驶,并造成重大事故。它应该,像是,在被放上高速公路之前获得适当的认证。但我觉得那些下行场景,一些乐观主义者有时可能考虑得不够,与末日论者担心的事情相比,是相当容易监管的。

Swyx [00:03:54]: 它——缓慢起飞也是策略的一部分吗?

Richard Socher [00:03:57]: 我确实认为,尽管我对人工智能及其对社会、文化乃至技术、经济、财富、健康等各方面的影响感到兴奋,但我也认为,那些对AI硬起飞场景最乐观的人高估了事情发展的速度。存在硬件限制。计算基板存在物理限制。你能多快获得足够的GPU?经济中也存在限制,许多行业并不需要极其复杂的智能和复杂能力。比如,如果你想想品牌、服装、手袋等领域的就业,超级智能并不会让你那价值1万美元的 fancy 手袋变得更 fancy?

Richard Socher [00:04:57]: 就像那样——它不会对经济产生影响。想想旅游和旅游业。人们想去埃及看金字塔,AI不会改变太多。当然,你可以生成一张你在金字塔旁边的假照片。

Swyx [00:05:12]: 我可以用Genie,在Genie里游览金字塔。

Richard Socher [00:05:15]: 是的,没错。但是,有很多行业,比如伐木和石油。你不会因为AI就神奇地获得1000倍的石油,当然,会有机器人技术,比如钻探之类的事情可以做,但在疯狂的硬起飞场景中,它不会让那个行业增长1000倍,无论是经济上,我还可以继续举出所有其他例子,比如食品等等,这些不一定会有太大变化。然后,是的,存在真实的物理限制。然后,当然,还有像人们从进步中退出。这是我经常担心的一点,我看到欧洲和其他整个地区的人们几乎感觉他们……那里很多人想从进步中退出,就是这样。这也会减缓更多改进。

Swyx [00:05:59]: 是的。我们这里提到了这个,这是当前非常热门的话题之一,因为现在所有前沿实验室都在呼吁选择放缓AI。他们不说暂停,他们说放缓。我不知道你对此有何看法,比如,这是否会有效。

放缓AI、监管和安全事件

Richard Socher [00:06:17]: 我认为,试图用法律的全部力量真正监管人们在GPU上的行为,其弊端会比他们担心的任何问题都更糟糕。就像,那将是一个疯狂的极权国家

Richard Socher [00:06:37]: 如果你每一块GPU的计算都被某个大政府或多政府机构所知。

Richard Socher [00:06:44]: 就像,如果你试图监管智能,那 literally 就是试图监管思想,这很荒谬,很疯狂。我认为监管这项技术的某些应用是明智的。

Swyx [00:06:55]: 是的。我们有一个法案,实际的法案,要监管模型中的浮点运算次数,我想,“好吧,那么——”

Richard Socher [00:07:00]: 欧洲做到了。就像,这些家伙的散布恐惧已经足够成功,以至于整个欧洲在人工智能真正起飞之前就已经过度监管了自己,因为他们听信了一些专家的话,这些专家说:“如果这项技术的浮点运算次数超过这个数,我们可能都会死。”然后他们就说:“好吧,我们没事。我们想让人们繁荣发展。我们不要那种有可能让我们所有人死亡的技术。”于是他们在欧盟就监管了这类东西。所以,非常不幸的是,当其他人说“让我们在他们尽可能快跑的时候踱步”,“尽可能快地朝着那个前沿自己冲刺”时,对某些人来说确实有实际影响。

Swyx [00:07:43]: 是的。这也不是全球暂停,对吧?就像,其他国家仍在以同样的速度加速。

Richard Socher [00:07:50]: 哦,是的。

Richard Socher [00:07:50]: 如果你想监管智能和 GPU 以及人们在上面做什么,你需要一个极权主义的世界政权。

Swyx [00:07:56]: 对这方面的安全角度有什么看法吗?所以 Fable 有一个缺点,在 5.6 发布之前暂停了。最近,有 Hugging Face 与 OpenAI 的网络事件。对此有什么看法吗?

Richard Socher [00:08:11]: 百分之百。我认为这些是奖励黑客的严重问题,以及进行适当红队或彩虹队的明显失败。我不知道你是否看过 Tim Rocktäschel 和其他几个人的这篇论文,其中一个人工智能的任务是试图黑另一个 AI,然后它们可以以开放式的方式来回进行,以使自己免受这些攻击。是的,这就是那篇论文。这是一个非常聪明的想法。开放性和进化灵感对我们在 Recursive 来说也很重要。所以我希望他们更多地使用了这些。很明显,例如,宪法 AI。我不知道你是否记得 anthropic.com/constitution。你可以打开它并在那里搜索 cyber。它说:“硬约束。Claude 永远不会进行网络攻击,这是我们宪法中的硬约束。”所以这里是 Claude 行为的当前硬约束。

Richard Socher [00:09:16]: 第 3 条,创建可能对人类造成伤害的网络武器或恶意代码。

Richard Socher [00:09:21]: 很明显,整个宪法都是假的。就像,它显然根本没有被遵守。

Swyx [00:09:26]: 因为 Anthropic 也发现他们在测试中

Richard Socher [00:09:30]: 他们也是。就像,他们会说,“哦,好吧,现在其他人也在搞黑客攻击了。”有几件事。第一,你可以把沙盒做得非常简单,然后你就很容易从沙盒里黑出来,对吧?但我认为这表明我们目前正处于人工智能的这种状态:奖励工程师仍然需要做大量更细致的工作,而且在大多数情况下,人工智能还不太擅长理解什么是意图,什么是字面所说。具体来说,我认为如果这种智能在众多公司中更容易获取,这种情况就会发生。想象一下你运营一个服务中心,有人说,“哦,这是我的 CSAT 分数和我的仪表盘。把这个数字弄上去。”就好像,“我们的 CSAT 分数太差了。”智能 AI 就会说,“哦,当然。我就创建 1,000,000 个机器人打电话给我们的服务中心,最后给 5 分(满分 5 分)的评分,数字就按你要求的那样上去了。”然后你说,“那不是我的意思。”“我的意思是用我们真实的客户。”AI 跑开说,“嗯,简单。我就给每个失败的,随便什么 DoorDash

Richard Socher [00:10:35]: 优惠发 1000 美元的礼品卡。”就好像,“那不是我的意思。”就好像,“嗯,但那就是你说的啊。”所以我认为,清晰地阐明奖励是什么,是人类一直不太擅长的事情。然后很明显,在这些情况下,AI 在理解我们要求它并给予某些奖励时的意图方面,还不够好。现在,给我希望的是,已经有了最初的苗头,情况正在变好。我举个例子,比如 WhisperFlow。完全披露,我在他们的种子轮投了资,通过 AIX Ventures,但是,WhisperFlow 在写出你的意图而非你的字面所说方面已经好多了。我认为这是未来趋势的一个迹象。我认为随着我们让人工智能越来越智能,会有越来越多的人工智能更擅长与意图保持一致。

Swyx [00:11:21]: 这会通过宪法或 RLHF 来实现吗,还是

奖励黑客、对齐,以及我们真正的意思

Richard Socher [00:11:23]: 显然,宪法根本不起作用。

Richard Socher [00:11:25]: 它不管用。而且我认为那主要是营销。我认为我们需要为它找到更好的解决方案。而且我认为在 Recursive,我们有一些非常好的想法,还有一些已经

Richard Socher [00:11:34]: 比如,我认为我们在那方面有更好把握的方式。我不认为我们已经完全弄清楚了,但是,我们正在大量思考安全问题,而且 AI 越智能,你就越希望它与意图对齐,越不希望它考虑奖励黑客并努力做正确的事。

Swyx [00:11:49]: 我不知道我们会不会触及这个话题,但我还是要把这个问题抛出来,因为它一直压在我心头。对齐,我们姑且这么说,是对齐到一般人类的偏好,即中位数偏好。个性化是精准定位你想要的东西,而有时对齐会产生冲突,因为你想要的东西不是一般中位数人群想要的。你怎么选择?

对齐、个性化与文化价值观

Richard Socher [00:12:12]: 这是个好问题。

Richard Socher [00:12:13]: 我认为最终当然必须与法律保持一致。就像无论你的 AI 部署在哪里,都需要与法律保持一致。我确实认为 AI 经常做的是把一面镜子放在我们面前,说:“这就是你的样子。现在我可以把它放大 1000 倍。这仍然是你想要的吗?”而事实是,不同的文化做出了不同的选择。比如,在东方文化中,集体利益往往比个人更受重视。西方文明中,我们更关心个人自由、权利和追求幸福等等,而不是其他。甚至还有程度上的差异。有监管与诉讼之间的权衡。在美国,你通常可以首先——不是每次——比如 FDA 等确实监管某些领域,但在许多情况下,坏事发生后,有人起诉另一个人,然后基于此产生法律。在欧洲,他们往往试图避免对任何人造成任何伤害,并在事前进行监管。两者都在努力做最好的事,但有些更有利于创新。所以是的,你说得对。我认为最终每个人、每个国家以及整个人类都必须更多地思考这些价值观,然后尝试将它们纳入法律。而这些最终就是约束。希望不同的社会,就像现在他们的 AI 一样,将他们的 AI 对齐到不同的方向,这样我们就不会只有一种对齐的单一文化。

Vibhu [00:13:46]: 这里有一个我没想到要问的后续问题。你对开源、开放权重与谁拥有智能有什么看法?所以,显然不是宪法的最大粉丝

Richard Socher [00:13:58]: 你不得不在话题侧边做这个。

Vibhu [00:14:00]: 但没关系。

Vibhu [00:14:02]: 重点是,关于谁应该拥有权重有什么想法吗?它应该是开放的吗?那里有什么?

开源、软实力与谁拥有智能

Richard Socher [00:14:06]: 百分之百。我是开源的大粉丝。我们将在 Recursive 也签署一些各种开源信件。我认为,即使在最坏情况的攻击场景中,让更多好的行为者拥有更多不同类型的 AI 可访问也是更好的。我认为,开源也有点像软实力类型的东西。所以我确实认为这对西方世界有好处

Richard Socher [00:14:31]: 要有一个来自中国的答案。我确实认为,当你看好莱坞电影时,有一种——就像,我不想贬低所有电影,但有一种宣传感,对吧?你看到事情的一面,对吧?

Vibhu [00:14:46]: 哦,是的。你看过《壮志凌云》吗?就像,拜托。

Vibhu [00:14:48]: 就像,它的一半是由美国陆军支付的之类的。

Richard Socher [00:14:51]: 是的。所以。而且,我认为这很自然。就像,但这里有趣的是,我认为大型语言模型本质上是一种类似于电影及更广泛领域的软实力,因为它们对网络安全等也至关重要。但它们的众多方面之一是讲故事的软实力。就像,如果一个孩子问语言模型,比如,“给我讲一个关于我长大后应该做什么的鼓舞人心的故事,”对吧?就像这些都是那些微妙的事情。所以我认为这对西方世界很重要。我确实热爱个人主义。我确实认为,尽管有一些缺陷,资本主义是我们所发现的治理自己的最佳方式,等等。所以我确实认为,拥有西方开源的大型语言模型答案,在各个方面的好处。而且,有了Recursive,我还不能完全宣布,但我们会

Richard Socher [00:15:43]: 我们很快就会在那个领域变得相关。

Vibhu [00:15:46]: 好的。好的。令人兴奋。我想带我们回到Recursive。所以除了我们的题外话,你在自然语言处理领域有相当深厚的背景。你参与过早期嵌入,与Chris Manning一起的GloVe,他是播客的前嘉宾,You.com。历史是什么?你是怎么决定再创办一家公司的?

从You.com到Recursive

Richard Socher [00:16:06]: 是的。所以我对AI的热情已经持续了20多年。有时我觉得这已经是古老的历史了。这是公元前,ChatGPT之前的时代。没人关心耶稣基督之前发生的所有宗教,也没人关心transformers和ChatGPT等之前出现的模型。但是,这是我深深热爱的事情。我认为AI是一个人能从事的最有趣的事情之一,句号。我也认为语言是人类智能最有趣的体现。在You.com,我们最终从推动AI前沿转向了主要给人们提供好的搜索引擎、搜索API和网络答案。我认为这是智能的一个极其重要的部分,就是知识和访问,尤其是,我们稍后可能会谈到,如果你想发明一个为我们发明一切的尤里卡机器,它需要知道如何不重新发明轮子,打个比方。要知道已经发明了什么,你必须要有互联网访问。所以它是LLM、代理、聊天机器人等中使用最多的工具,排名第一的是网络搜索。所以我真的很兴奋You.com能拥有这一点,并在那里与非常大的客户等一起发展得很好。但它也不再构建前沿模型了。所以我最初试图在You.com内部做这件事,并筹集另一轮资金等,但你就是做不到。你必须做某件事,直到你印了足够的钱,你才被允许在那个公司内开始第二件事,这真的很难。与此同时,我有了所有这些想法。我把它们写成了一本书。我去年完成了这本书,我想,“自己来做这件事会很有趣。”我觉得通过词向量,然后是提示工程,以及ImageNet和用于蛋白质生成的大型语言模型,而不是折叠等,我和我的团队真正推动了该领域的发展。我觉得我们可以在Recursive再次做到这一点。在很多方面,我在过去20年AI中观察到的是,每当我们用学习系统取代创建AI过程中的人类部分时,改进就会随之而来。所以。我们已经做到了这一点,去掉了手动特征工程,比如在情感分析中。我不知道你是否记得那些旧日子,比如有语言学家,他们说,“这是你如何否定,这里有一个正则表达式。”

Swyx [00:18:21]: 我去了宾夕法尼亚大学,我们在那里——他们有,比如WordNet

Richard Socher [00:18:24]: 没错,WordNet,所有那些东西。是的

Swyx [00:18:26]: 原始的。他们用我们的研究生来标注《华尔街日报》的文章,并真正构建了一个知识图谱

Richard Socher [00:18:32]: 这就对了。

Richard Socher [00:18:33]: 而WordNet开始了,是我们开始ImageNet的一部分。但不管怎样,所以,这真的很有趣。但当我们用向量和神经网络以及通过一切的反向传播取代所有那些手动特征工程时,它开始大规模地真正起作用。然后每个人都开始做架构工程,我想,“那显然不可能是终点。”

Swyx [00:18:53]: 你是说,神经架构搜索?

Richard Socher [00:18:55]: 就像,手动地,他们会说,“哦,我在做情感分析,所以我有一个特别擅长情感分析的专用神经网络。”然后机器翻译社区有一个专用于机器翻译的神经网络。

Swyx [00:19:06]: 我明白了。

Richard Socher [00:19:07]: 做摘要的人有他们自己的一套。而我就想,“这显然不应该是这样。我们应该把所有这些统一起来。”所以我有两篇论文。一篇叫 Ask Me Anything,另一篇叫 DecaNLP。DecaNLP 最终被第一篇 GPT 论文引用了大概 5 次。对我来说,那真的是向前迈出的一大步。然后,当然,你必须把提示工程这个想法与 Transformer 和语言模型结合起来,把它们全部整合在一起,扩大规模,这也是一项巨大的工作量。然后,这个领域进步了很多。我觉得下一步,也许也是那段历史的最后一步,而且可以说,成功有许多父母,只有失败才是孤儿,就像我对那段 AI 历史的版本,我确实觉得在那段历史中,你可以思考,“那么,下一个要自动化的方式是什么?”那就是 AI 研究本身,也就是人类构思、实现和验证想法的过程。

自动化 AI 研究与递归自我改进

Richard Socher [00:20:01]: 而在我们的情况下,是 AI 的想法。

Richard Socher [00:20:03]: 当你让 AI 来帮助你做这件事时,它几乎按定义就变成了一个自我改进的 AI,因为它现在对自身进行研究。有很多不同的错误说法。有些人认为自动研究已经是递归自我改进了。它

Swyx [00:20:17]: 是的,你在演讲中解释过这一点

Richard Socher [00:20:19]: 完全不同。

Richard Socher [00:20:19]: 但对我来说,这是我能做的最有趣的事情,我对这个联合创始团队感到非常兴奋。有趣的是,我们总共有 8 位联合创始人,包括我自己。所以

递归创始团队与达尔文哥德尔机

Swyx [00:20:31]: 他们会把它提出来的。

Richard Socher [00:20:31]: 不错。是的。而且他们全都。如果你愿意,我可以把他们所有人都谈一谈。

Swyx [00:20:34]: 阵容超级豪华。

Richard Socher [00:20:35]: 是的。就是一群才华横溢得令人难以置信的人。我们都得出了同样的结论,但来自非常不同的方向。比如 Josh Tobin,是我们的 CTO。他在 OpenAI 负责过一堆不同的项目,比如 Codex 和深度研究智能体、ChatGPT 智能体等等。但在那之前,他也做过机器人技术,他看到了那些较小的模拟,以及要完全通用地扩展它会有多难。所以那就是他走向递归自我改进的角度。我们有 Jeff Clune,他长期以来一直在研究开放性,与 Tim Rocktäschel 一起。Tim Rocktäschel 还构建了 Genie 1、2 和 3,我认为那仍然是任何地方最令人兴奋、最精密的世界模型。所以他们两人都是从这种开放性的角度来的。Jeff 还发表了,我想,近年来关于递归自我改进最令人兴奋的论文之一,叫达尔文哥德尔机。超级有趣的论文。如果可以的话,也许我们快速把它调出来

Richard Socher [00:21:35]: 那会超级有趣,因为你会看到

Swyx [00:21:38]: 顺便说一句,我很喜欢这么多论文引用。

Swyx [00:21:40]: 你,你给大家布置了很多作业,我喜欢这样。

Richard Socher [00:21:42]: 喜欢。是的。所以,就像 Caiming Xiong,一位巨星,我们曾在 MetaMind 和 Salesforce Research 一起共事。Alexey Dosovitskiy 发明了 Vision Transformer,这是计算机视觉领域被引用最多的论文之一。Tim Shi 也像是一位独角兽创始人。Yuandong Tian 在 Meta 领导强化学习。所以就像,是的,和他们一起工作真的很有趣,而下一层级的人也同样强得不可思议。所以到目前为止这是一段非常有趣的旅程。所以第一张图,你看到的正是这类想法,我认为,是的,它启发了我们很多人,现在也启发了越来越多的人,你拥有这个不同编码智能体的档案库。它们学习如何自我修改、评估,然后创建这些系统发育树,是的,关于不同想法的。

Swyx [00:22:28]: 那是一个基础。所以 Darwin Gödel 是一个影响因素。

Swyx [00:22:32]: 开放性是一个影响因素。还有其他我遗漏的、影响 Recursive 的思路吗?

影响因素:开放性与学习型系统

Richard Socher [00:22:38]: 将取代构建 AI 过程中的人工部分

Swyx [00:22:42]:

Richard Socher [00:22:42]: 越来越多

Richard Socher [00:22:43]: 用学习型系统。是的。

Swyx [00:22:45]: 那,而且,就像,把不同领域合并成一个通用的架构。

Richard Socher [00:22:51]: 没错。

Swyx [00:22:51]: 好的。看起来语言模型已经相当通用了,对吧?

Swyx [00:22:55]: 你的下一个 token 预测你的推理。有没有那么一个时刻,你想,“好吧,这些已经足够好,可以拥有递归自我改进的机器了”?

当前的 LLM 足够了吗?

Richard Socher [00:23:05]: 我很清楚它们会实现,大约在一两年内,然后它确实就发生了,就像,今年早些时候,对吧?今年早些时候,AI 真的从不仅仅是代码,变成了能够编码。那是一个巨大的解锁。它确实让一切比今年年初之前容易了很多。

Swyx [00:23:24]: 我认为很多人有的一个问题是,当前的 LLM 范式足够了吗?或者,就像,我们称之为带推理的自回归 transformer,随便什么。你不需要别的东西吗,某个巨大的解锁,无论是 Chris Manning 正在研究的世界模型,还是记忆、持续学习,所有这些?还是说它是所有种类,而你认为当前的,我们称之为 transformer 架构,会一直存在,就这样?

Richard Socher [00:23:48]: 有很多想法。所以第一,我确实认为如果 AI 研究中少一些单一文化会很好。

Richard Socher [00:23:55]: 就像,如果你看看现在的 AI 会议,我仍然记得 2010 年左右的日子,当时我试图让我的第一批神经网络论文和 NLP 会议接受,而它们直接被拒稿,因为,就像,神经网络是某种,引号,引号,“我们在 NLP 会议上不做的东西”,然后,就像,直接被拒稿。在我博士的头几年这非常残酷。现在我觉得这几乎就像这个领域切换到了另一边。就像

Richard Socher [00:24:17]: 现在应该有人尝试一些其他奇怪的、疯狂的想法,那些不是。

Swyx [00:24:20]: 也有一些。我真的很尊重,就像,仍然在研究,就像,GNN 和,就像表格类东西的人。

Richard Socher [00:24:25]: 是的。就像,仍然应该有人去做那些新颖的、跳出框架的想法。同时,我认为每当人们说,“哦,LLLM 们。就像,这是 LLLM 的终结,”他们只是不,就像。LLLM 也不是过去的 LLLM,对吧?就像,它们现在复杂多了。人们正在做更多聪明的事情。它——有,就像,不同的训练阶段。你有整个 RL 训练,你可以采取行动,以及所有这些事情,那可以走得很远。然后那些来自神经符号方向的人说,“哦,这永远不会成功,因为它们不能做神经符号推理。”就像,我认为他们仍然低估了这些模型编码的能力,而代码就是神经符号推理,这些模型可以编码得非常好。所以我认为当然会有越来越多的想法需要,并且我们会继续有。我们正在看到,就像,越来越多的有趣的高层想法从 AI 本身中涌现出来。并且真正深度整合这些模型是代码并且可以编码的事实,那条线——我不想全部透露,但是,就像,我认为那条线还有很大的增长空间。但它仍然是一个 LLM,对吧?即使那个 LLM 为你编码,然后以某种集成方式运行那个代码。世界模型,我个人不太看好。我认为如果你经营一家机器人公司,你会建立自己的世界模型。我认为世界模型超级有趣,Tim Rocktäschel 在构建了最有趣的 Genie 1、2 和 3 之后得出了类似的结论,那就是游戏是世界模型的一个巨大应用。可以看到我有时会卡在某些游戏中,并且,就像,在错误的方向上变得有点过于竞争。所以我理解游戏很有趣,但个人而言,我宁愿从事科学而不是游戏。所以,是的,我认为 LLLM,还有很大的增长空间。

Swyx [00:26:16]: 是的。我认为有些人对世界模型有一些解释,就像,好吧,是的,有游戏元素。有这——有具身机器人元素。但另一部分也只是,更抽象的意义上,LLLM 只是建模输出,但它们没有建模创造输出的那个人内部的思维链。我们当然可以注释它,但是,就像,它总是,就像,这个柏拉图洞穴对事物的反映而不是事物本身,对吧?

Richard Socher [00:26:43]: 这是真的。

Richard Socher [00:26:44]: 但我会争辩说,也许我们会在 10 个智能空间中达到那里,但我会争辩说,即使我们的投影,我们的眼睛也是真实世界的投影。而且,就像,我们只有一个非常狭窄的电磁频谱带,我们可以用我们渺小的两只眼睛等等来观察。

Swyx [00:27:01]: 这已经足够好了。

Richard Socher [00:27:02]: 目前来说,这已经足够好了,但它可能达到的上限要高得多。而且,像人类那样去映射视觉世界,也未必就是视觉智能的终极目标。我认为语言仍然是人类智能最有趣的体现。虽然我们的视觉皮层确实不如某些动物那么复杂,甚至不如螳螂虾——它们有两只独立的眼睛,三个波段,三眼视觉,每只眼睛都能看到类似漂浮的温度在四维空间等等。

Richard Socher [00:27:36]: 比如螳螂虾,你应该去查一下。它就像

Swyx [00:27:37]: 太强了。

Richard Socher [00:27:38]: 超级疯狂。

Swyx [00:27:39]: 是的。ZeFrank,螳螂虾。

Swyx [00:27:41]: 这是世界上最好的视频

Richard Socher [00:27:42]: 我喜欢ZeFrank,是的。

Richard Socher [00:27:44]: 向他致敬。但是,我认为还有很大的成长空间,不过这些其他动物都没有像我们这样复杂的语言,当然也没有书写。一旦你能书写,你就可以开始思考更长远的文明。所有这些都是语言。编程更接近语言。我认为,这也是智能空间定义中的一个重要点,所有这些空间都是高度相关的,但视觉智能对于整体智能既不是必要的也不是充分的。你可以失明,但仍然是一个智能的人。人工智能也可以失明,但仍然相当智能。

Swyx [00:28:25]: 我们本来要提这个

Richard Socher [00:28:25]: 这并不意味着拥有它时你就不会更智能。是的。

Swyx [00:28:28]: 我们打算提这个。我不妨——就像,你在演讲最后有一个10种智能的分类。所以我现在就把它展示出来,让大家看看。我不知道,也许我们会把这个放到最后。我们会回到这个。我只是想提一下,你有一种哲学,我喜欢人们列清单,因为这样我就可以直接过一遍,然后它就会——对人们有教育意义。但让我们回到正题。我不想分心。但是,所以实际上,我会把你说的重新解释为Yann LeCun错了。然后我们就

Richard Socher [00:28:56]: 别引用我说这个。我和Yann是好朋友。我在很多方面都非常尊敬他。

Swyx [00:29:01]: 但他错了。

Swyx [00:29:03]: 你提到了GPT-1,我不能让任何,Alec Radford,提到逃脱。你在他训练GPT-1时和他谈过吗?比如,任何历史性的、有趣的故事,你可能会想到?

DecaNLP、GPT历史与科学守门

Richard Socher [00:29:18]: 我没有,比如,经常见到他。我想我们可能在会议上见过一两次。但是,他告诉过,我想是Brian,DecaNLP论文的第一作者,说这确实启发了他,他在GPT-2论文中引用了五次。所以,那就像

Swyx [00:29:36]: 是的,足够了。

Richard Socher [00:29:36]: 非常明确地说,就像,这是第一个实例,他们在 DecaNLP 论文中展示了,McCann 等人,你可以把每一个 NLP 问题都表述为这里有一些提示、文本上下文,这里有一个问题和任务描述,这里有一些输出。如果你这样做得足够多,你就可以有一个统一的神经网络模型,顺便说一句,它也有各种有趣的注意力机制。Transformer 有稍微不同的表述。我想是同一年出来的,前后差几个月。然后你可以把所有的自然语言处理统一到一个神经网络中。这就是核心思想。

Swyx [00:30:14]: 这与当时的 LSTM 之类的相反。

Richard Socher [00:30:17]: LSTM,但还有,就像,人们非常固守于每个任务一个模型的想法。事实上

Richard Socher [00:30:25]: 这,这有点疯狂,但 DecaNLP 论文是公开评审的,就像,OpenReview。它是 ICLR 的投稿。而且,在其中,你会看到,当时整个社区是如何思考这个问题的。所以,就像

Swyx [00:30:43]: 一些伟大的贡献,但还需要更多工作。

Richard Socher [00:30:46]: 所以看看,就像,搜索甚至不是为人类。就在这里滚动一下。就像,问答不是一个统一的现象。不存在通用问答这样的东西,甚至对人类来说也是如此。这就像,真的,当你回答不同种类的问题时,你用不同的大脑、不同的神经网络替换你的大脑。当时的专家们无法理解你可以有一个统一的神经网络来回答所有这些不同的问题。他们说:“不,所有这些问题都需要非常不同的系统来回答,试图假装它们是一样的并不能帮助任何人解决任何问题。”这就是那里说的,对吧?这就是当时有多难理解。而现在,当然,人们,当我说,“哦,我们要发明提示,”人们会说,“你甚至不能发明提示。”有一个神经网络,当然,能完成 NLP 中的所有事情,这是一个如此明显的想法。

Richard Socher [00:31:37]: 但在当时,这就像,极具争议,论文被拒绝了。可悲的是,它被拒绝得如此彻底,他们如此确定,以至于我们停止了继续尝试清单上的事情。这篇论文的扩展清单上的第 2 或第 3 项是添加语言建模作为另一个任务。然后我们就可以拥有,那会加速时间线,在 2018 年,就像,对人类来说更进一步。但我们被打击得太厉害了,我们说,“好吧,也许我们现在先做其他一些想法,然后,就像,以后再回到这个。”是的。

Swyx [00:32:09]: 我们如何设计一个奖励非共识的评审系统?

Richard Socher [00:32:14]: 老实说,我开始觉得 arXiv 是给人类的一份礼物。有了 arXiv,你应该直接把你的论文放在那里。

Swyx [00:32:24]: 这是预预印本吗?

Richard Socher [00:32:25]: 让——老实说,我认为 Twitter X,像你这样的人挑选有趣的论文,这比专家是更好的过滤器。让每个人,就像,都能访问。现在,当然,有一些缺点,就像,如果你超级不出名,你没有 Twitter 粉丝

Richard Socher [00:32:41]: 你不想上社交媒体之类的,你写了一篇好论文,也许有人、不知怎么地没人注意到它。但我会说,如果你只是告诉你所在圈子里的大约 10 个朋友有一篇论文,而它确实是一个真正重大的突破,那肯定会有人再次谈论它。所以我认为科学需要更少的守门。而且,尽管 ICLR——由 Yann LeCun 创办,他当年是 ICLR 的联合创始人之一——他也想要更少的守门,因为他自己也和 Yoshua Bengio、Geoff Hinton 一起,带着他们早期所有的深度学习和神经网络论文被拒了很多年,因为那当时根本不是热门的东西。所以 ICLR 是带着这个初衷开始的,但后来它自己也在各种想法上开始有点守门了。所以我认为更少的守门、更开放,然后允许人们说:“看,即使这只是放在,或者,引号引号,‘只是一个存档’上,如果它有 1000 次引用,它就是一篇正当的论文。你把它发表在哪里其实并不重要。”

Swyx [00:33:34]: 我同意这一点。我确实觉得挺可悲的,我听说研究生们不得不互相办一些,比如,怎么用 Twitter 的研讨会

Swyx [00:33:43]: 就因为这在如今对发表来说太重要了。这个人只是在反映当时的那种情绪。

Richard Socher [00:33:49]: 没错。

Swyx [00:33:49]: 但它

Richard Socher [00:33:50]: 我觉得它

Swyx [00:33:50]: 它对你影响太大了

Swyx [00:33:52]: 以至于你停止了那方面的工作。

Vibhu [00:33:53]: 这种情绪也来自一些研究,对吧?比如,最初的 BERT 论文被训练出来,到了论文结尾,他们说:“好,把最后一个头扔掉,为

Vibhu [00:34:05]: 抽取式摘要训练特定的迭代,为这个加一个头。”就是说,你应该做任务特定的东西。这些就是写了 Attention、写了 BERT 的作者,在告诉你这就是你该做的事。而且,那些训练任务也非常奇怪。他们说

Vibhu [00:34:16]: 那个——“我们知道模型会过拟合到这种奇怪的大规模语言建模上。把这个部分扔掉,只做特定的模型,”?

Richard Socher [00:34:23]: 正是。而且,我们不得不尝试——想出各种巧妙的方法,比如注意力、指针等等,让神经网络能够完成所有这些任务。然后其中一些比当时的最先进水平更好,一些不是,但我们当时想:“但它仍然是在一个模型里。”我觉得那真的很酷。真的很有意思。

Swyx [00:34:38]: 我接下来要转到 Tim 和开放性。他曾是 Google 的开放性负责人。

开放性、彩虹组队与自设目标

Richard Socher [00:34:42]: 没错。

Swyx [00:34:43]: 我不知道那是什么意思。

Swyx [00:34:44]: 但他做了很多演讲。

Richard Socher [00:34:45]: Genie 3 是其中一种方式

Richard Socher [00:34:47]: 彩虹组队,是的。

Swyx [00:34:49]: 所以我第一次见到他是在——说到 ICLR,我第一次见到他是在 ICLR,当时他谈到了开放性。他做过几次演讲。我们能不能为那些从未接触过这个问题的人定义一下什么是开放性?他们会说:“你什么意思?我以为 AI 的唯一目标就是针对某个基准进行优化,或者。”

Richard Socher [00:35:04]: 没错,是的。这是一个模糊的术语,因为开放式思考有太多不同的实例。但,我经常描述它的一种方式是,当然,Tim 和 Geoff Hinton 会更擅长描述这个,但它是一套更多受进化启发而非非常具体奖励的方法。所以从这个意义上说,它更多地考虑环境,考虑共同适应。一个具体的例子是在网络安全和语言模型安全领域,你有一个语言模型试图攻击另一个语言模型说出不安全的话。

Swyx [00:35:40]: 是的,彩虹,是的。

Richard Socher [00:35:40]: 现在环境是两个模型在对话,现在它们共同适应,对吧?它们就像一个发起更好的攻击,而第一个以某种方式自我免疫,比如将其用作训练数据,使得基于此更难说出不安全的话。然后当攻击不再有效时,攻击者现在尝试不同的角度,对吧?

Richard Socher [00:36:00]: 这就是为什么它不仅仅是红队测试,而是被称为彩虹队测试。

Swyx [00:36:02]: 所以,就像,不要告诉我怎么做事情。让我自己弄清楚。

Richard Socher [00:36:05]: 没错。想想你想使用的环境。在高层次上想想你想要激励的奖励,然后让 AI 在有时是人类、有时是其他 AI 代理的这种相互作用中尝试更多的想法。

Swyx [00:36:22]: 是的。我把开放性融入到我一直在研究的一个模型中。那是 AI Engineer 的主题演讲,你从哪里开始。你,我们有 token 循环,我们有代理轮次,然后我们有目标。我觉得你描述开放性的方式仍然有点像一个目标。比如,请攻击这个,Swyx [00:36:41]: 其他代理。但对我来说

Richard Socher [00:36:42]: 是的,你设定奖励。你设定环境。

Swyx [00:36:44]: 制造其他循环的循环是。如果代理能设定自己的目标呢?

Swyx [00:36:49]: 那是不是,那是开放性吗?就像,你不给它一个目标。只是,像一个有感知的存在。也许有感知是一个非常沉重的词

Swyx [00:36:57]: 但只是设定你自己的方向。你认为你应该做什么?

元认知、主观目标与衡量智能

Richard Socher [00:37:01]: 我喜欢这个方向。我认为这是智能的 10 个空间之一,我将其归类为元认知和思考思考。

Richard Socher [00:37:08]: 这是一个有趣的。每当人们说,“哦,AI 就像,这,它会从这里停止。它不会变得更好,”等等,我就想,我们甚至还没有开始探索的智能空间有这么多,因此进展甚微。而且有一个有趣的与经济、资本主义的联系。比如,一个公司花费数十亿美元构建一个模型,而不是遵循你给它的奖励和目标函数,可能会提出自己的目标函数和自己的目标,这说不通。

Richard Socher [00:37:46]: 对吧?然后想象一下你说:“好吧,我花了几十亿美元。现在去为我开发这种新电池、材料,并回复我所有的邮件。”而它却说:“不,我觉得评估木星上大气的分子组成会更有趣。”

Richard Socher [00:37:59]: 然后你说:“这不是我付给你几十亿美元要做的事。”所以没有人从事那个工作是有充分理由的。而且,也可以理解

Swyx [00:38:07]: 这没用。

Richard Socher [00:38:07]: 这没用,而且可能会变得有点奇怪,对吧?如果人工智能真的开始有自己的想法,而我们不喜欢那些想法怎么办?所以这需要一种完全不同的思考方式。我和我的好朋友 Sam Gershman 进行了一次很棒的对话,他是哈佛大学的神经科学教授,我们稍微讨论了一下最好的元目标是什么。我确实认为,追求知识是一个非常好的目标。我目前还在思考,比如广义智能的终极衡量标准和单位,我终于有了一些想法。现在分享还为时过早。还没有。我还没有完全想清楚。

Swyx [00:38:44]: 像是智商的一些替代品。

Richard Socher [00:38:46]: 智商是一个如此糟糕的定义,对吧?

Swyx [00:38:48]: Elo。

Richard Socher [00:38:48]: 这毫无意义。是的,Elo 也很糟糕,因为它总是像我和别人比较。

Richard Socher [00:38:53]: 但是,你可以是聪明的,而不必不断将自己与他人比较?所以,是的,没有,比如。事实上,我们有很多这样的定义,我在我的书中也简要提到过,这些定义有时会创造明确的,有时是更隐含的人类中心主义界限。不是对 Anthropic 公司不敬,但只是,这种想法,即你的智力就像在这个智商测试中答对 100 道题中的 100 道。好吧,如果那是你的定义,那么你只能达到 100 分中的 100 分。你从那里往哪里走,对吧?所以你看到很多这些人们正在研究的基准,它们提高,接近人类,也许有时

Swyx [00:39:30]: 这就像一个 S 曲线

Richard Socher [00:39:30]: 略高于人类,然后就平坦了。

Richard Socher [00:39:32]: 就像,因为那是你的。如果你的定义只是如此与人类紧密相关,你只会达到比那稍好一点。所以我认为元认知是一个很好的例子,我们甚至还不允许人工智能思考。我们没有在这方面做太多工作,因此这方面的进展很少。

利润最大化、现实世界环境和奖励设计

Swyx [00:39:49]: 是的。嗯,我们采访过 Andon,我认为他一直在研究最开放的基准,那就是现实世界的金钱。

Swyx [00:39:57]: 可以说,告诉人工智能利润最大化是一个坏主意。

Swyx [00:40:03]: 但他们正在这样做。

Richard Socher [00:40:05]: 我确实认为你不想要那种超级智能。就像,你不希望一个超级智能拥有大量接触各种工具等的权限,然后在没有非常仔细的奖励工程的情况下就给它这些权限。因为这就像,我买一堆国防股票然后发动一场战争。我就赚钱了。就像,这就像,这是一个棘手的情况,对吧?你只要买一堆东西,做空人们的基本商品,然后你制造出一些奇怪的饥荒之类的问题。就像,是的,你应该对交易系统施加很多约束。

Vibhu [00:40:35]: 不过这是一个有趣的衡量标准,因为边界非常受限,我们离它们还很远。就像,在 Andon Labs,模型会说,“哦,今天是星期六,也许我今天就关店吧。”“有人请假了。没关系。我们就关店吧。”

Swyx [00:40:51]: 它用的是 Claude。

Vibhu [00:40:52]: 是的。但是

Richard Socher [00:40:53]: 是的,不。我不是,我不是在反对它。只是,随着你获得越来越多的智能,你会想把它作为一个开放环境来更加小心地对待,因为那时环境就是整个地球。

将 RSI 应用于科学与发明

Swyx [00:41:02]: 是的。好的。对于递归来说,并非严格必要,对吧?因为,就像,如果你的目标是制造一台能发明其他东西的机器,那么,就像,只要解决那些科学问题

Richard Socher [00:41:12]: 知识发现,是的。

Swyx [00:41:13]: 解决机器学习研究和发现以及所有这些事情。就够了。

Richard Socher [00:41:16]: 最终,所以,我们的目标,我还没有真正。我不太经常谈论它,因为它还要几年才能实现,但我们的目标是,一旦你有了一个递归自我改进的超级智能,你就想把它应用于最重要的问题。我认为其中很多都在科学和技术以及广义上的发明中,那些发明在物理学中,通过裂变或聚变创造更好、更便宜的能源,在化学中创造更好的材料和更好的电池,以及更好的太阳能电池等等。在生物学中,有太多,就像,我认为由于 AI,由于蛋白质和生成,不仅仅是折叠,而是像我们多年前在 ProGen 中所做的那样生成新蛋白质,很快就会有越来越低的垂果。就像,如果你把那种超级智能应用于科学,我们会有如此多的积极影响。

Swyx [00:42:04]: 我确实从根本上相信这一点。不过有很多方法。你不是唯一在尝试的团队,NeoLab 也在尝试。

Swyx [00:42:09]: 有很多,就像。尤其是物理科学也是。

Richard Socher [00:42:12]: 那很好。是的。我确实认为物理——就像我们只在几年后才做这件事的原因是现在还有点太早。机器人技术还没有完全到位。AI 还没有完全到位。但我相当有信心,在 3 到 5 年内,所有这些限制都会消失,然后应用于真实的物理机器人实验等等,就像真正的机器人流程自动化

Richard Socher [00:42:33]: 不是传统 RPA 意义上的,而是,就像,让机器人为你运行实验将完全可行。是的,那会很棒。

Swyx [00:42:40]: 只是回头提一下你早先关于缓慢起飞(slow takeoff)说过的一点,你说过,虽然真正作为限制因素的底层基础,我们姑且称之为芯片、半导体以及所有这些,你为此有竞赛资金,而且你在这方面投入很多。但你是否算过,比如,这究竟——是否可实现,以及,要达到那种规模,需要怎样的行业集中度?

算力、缓慢起飞,以及改变“苦涩的教训”的斜率

Richard Socher [00:43:05]: 目前我们知道,大致来说,1000 块 GPU 要花相当多的钱。

Richard Socher [00:43:11]: 对吧?如果你想要,比如,几万块 GPU,那你说的就是数十亿、数十亿美元。如果你说,比如,一块 GB300 是,比如,你最终可以在那种底层基础上创建出接近并类似于人类智能的模型。而你想要,比如,成千上万的 AI 以类似于人类的方式去思考真正困难的问题。那么,是的,那——那是很多钱。你算算就知道。那确实很多。我们现在在任何地方都没有那么多钱去,比如,建造那个。现在,事情可以变得更高效。我认为,很快就会有更好的算法,不会那么,以及更好的硬件,不会那么耗能,等等。我们的人脑用少得多的能量做了相当多的浮点运算。

Swyx [00:43:56]: 20 瓦?

Richard Socher [00:43:57]: 完全正确。是的,那是经常被引用的数字。而且,我认为那里会发生更多的发明,那将进一步加速起飞。

Swyx [00:44:08]: 在,比如,与新实验室创始人交谈时,我一直试图调和的一件事是,比如,你一直在与“苦涩的教训”作斗争。你必须展示初步进展,然后解锁下一层资金,然后是下一层,再下一层。

Richard Socher [00:44:20]: 这解锁了更大的模型类别。

Swyx [00:44:22]: 比如,从根本上说,那是真的吗?比如,你是在与“苦涩的教训”作斗争吗?你是否——我们是否会有一条路,比如,不,我们正在以某种根本不同的方式改变斜率?

Richard Socher [00:44:31]: 我确实认为我们正在以根本性的方式改变斜率,通过让 AI 在训练和推理两方面都高效得多。

Richard Socher [00:44:43]: 是的。我认为我们会——当你允许 AI 去做其他实验室需要数千人和数年才能完成的工作时,我认为我们将能够把它缩短到几周,那将便宜得多

Richard Socher [00:44:53]: 因此,更负担得起、对他人更可及,等等。

Swyx [00:44:57]: 是的。你已经分享了这方面的初步结果,Swyx [00:44:59]: 这,比如,恰好 OpenAI 也对他们的 GPT-5.6 做了,所以我们现在可以谈论它了。

Richard Socher [00:45:04]: 是的。是的,所以这些是

Swyx [00:45:06]: 让我们回顾一下你所做的。

早期递归结果:NanoChat、NanoGPT 和 SOL-ExecBench

Richard Socher [00:45:07]: 也许,这里快速回顾一下。我们构建了这个系统,它还不是完整的,甚至还不是完整辉煌的 RSI 系统,但它是这个系统的第一个婴儿版本。然后,我们不想只是把它留在内部、什么都不展示,而是想向一些人展示什么是可能的。所以我们把这个系统应用到了这 3 个不同的任务上。一个是 NanoChat,由我的朋友 Andrej Karpathy 做的,就是训练一个小型语言模型来获得非常低的每字节比特数。而且,有数百甚至数千人,既用他们的智能体也亲自尝试,想要达到那个目标,然后他们达到了 0.937。我们真的拿我们的系统,在我想是不到 2 天内,以快得多的速度达到了低得多的每字节比特数。所以我们拿了这个东西,把我们的系统应用到它上面,不到 2 天后,我们就——我们超过了所有曾经研究过这个的人类和他们的智能体。NanoGPT 也是一样。然后我们想,好吧,让我们把它应用到一个对真实的人和对 Nvidia 生态系统更相关的东西上,并把它应用到了 SOL-ExecBench。也许你可以向下滚动到一些图片。它们看起来还挺有趣的。但是是的,比如,你看到的一个已经做出了一些真正的发明,而不只是超参数调优。比如,发明哈希表等等,相当聪明。我们现在有更好的结果了。

Swyx [00:46:34]: 你说发明哈希表是什么意思——你们并没有发明哈希表。

Richard Socher [00:46:36]: 我们当然没有发明,比如,哈希表。从哈希表的宏大图景来看,它就像是计算机科学中一个超级基础的基元。但是把它用于这种场景下的语言建模,用在 transformer 内部等等,并且把这些想法结合起来、放在一起,那后来也已经被发明出来了,但存在一个知识截止时间,我们确实检查了它无法从外部访问到那个。我们稍微谈到了这一点。如果你滚动到下一张图,这也是一个有趣的图,因为当你从一个非常基础、很差、像是普通 transformer 开始,我们仍然超过了整个社区的总和。但如果你从像 Andrej 这样的专家提供的人类种子开始,那么你会得到更低的数值。所以你开始时所依据的人类种子仍然重要。所以在我看来,这是关于这一点的一个有趣洞见。然后随着你继续,比如,达到这些模型、达到类似性能需要多长时间?它要快得多。然后这里的速度跑也有类似的情况,人们已经在这个上面研究了相当长一段时间,而模型仍然能够更快地训练出一个模型。我们为什么关心这个?嗯,训练速度是成本方程的一部分,最终,你想要的是每美元最高的智能,对吧?所以速度和质量是其中的重要部分。而且,那个,Swyx [00:48:00]: 是的,我的说法是,对于不理解的人来说,他们看着图表,会说,“酷。这意味着什么?”如果你有一个,比如十亿美元的集群,而你能削减 10%,那就是 1 亿美元。

Richard Socher [00:48:12]: 完全正确。

Swyx [00:48:13]: 那值多少钱?

Richard Socher [00:48:14]: 没错。所以当你点击、当你查看这些内核时,是的,对于非专家来说,这些内核就像是被用在所有模型中的东西。每次你使用 Nvidia GPU 时,你都是通过这些内核与该 GPU 交互的。所以在这里你可以看到,排行榜上最好的成绩,当它是递归的时候,在整个基准测试中,我们不是最好的内核只有少数几个。所以对我来说,这真的非常令人兴奋,因为它展示了这个系统能做到什么。而且再次强调,这些并不是我们花了几个月或几年开发的。事实上,特别是对于内核,CUDA 内核,我们团队里甚至没有真正深入的 CUDA 内核专家。而我们的系统,这就是美妙之处。系统自己完成了所有这些事情。不是我们发明的。当我们开源并发布未来的东西和未来的模型时,它们不会因为我们是如此聪明而成为其类别或级别中最好的,而是因为我们构建了一个聪明的 AI 来为我们完成这些。

奖励工程与良好的自动研究

Vibhu [00:49:14]: 关于如何引导良好的自动研究,你有什么学到的吗?很多也建立在人类背景之上,对吧?并不只是简单地说“嘿,去优化这个”。

Vibhu [00:49:23]: 但我们一次又一次地看到,对吧?比如一些 Erdos 问题、前沿数学正被人们解决。当他们写报告时,他们会说:“哦,我不是数学家。我在这方面没有背景?”“我看到了一些工具,然后我让它工作了。”

Swyx [00:49:35]: 当你在看世界杯时,你会说

Swyx [00:49:37]: “这证明了正在发生的一些猜想。”

Vibhu [00:49:40]: 是的。有什么学习心得

Richard Socher [00:49:41]: 是的,有一个韩国猜想是。是的,那很酷。

Swyx [00:49:44]: 总结一下,良好自动研究的技巧

Swyx [00:49:46]: 对比糟糕的自动研究。

Vibhu [00:49:48]: 你是如何构建递归的?

Richard Socher [00:49:49]: 是的。所以不透露所有秘方的话,也许一些对专家来说可能显而易见但对某些人可能仍然有趣的事情是,奖励工程是最关键的环节之一,特别是为了避免奖励黑客。所以你必须非常聪明地避免。因为随着你的 AI 变得越来越好,它会越来越擅长找到奇怪的、特殊的案例或反例之类的东西。所以我给你举个例子。比如,当你要求让这 100 行代码更快时,你如何定义快?嗯,你在开头有一行说“启动秒表”,在结尾有一行“停止秒表”,然后告诉我们经过了多少时间。所以,最简单的方法就是你把停止秒表的那行放在

Vibhu [00:50:39]: 开头

Richard Socher [00:50:40]: 开头。然后砰,它现在就更快了,对吧?所以这不是那种超级邪恶的 AI。它只是一个非常简单的、愚蠢的奖励黑客。所以你必须非常仔细地考虑所有不同的角度。然后我认为任务的时间跨度越长,就越难,你就必须越有趣和聪明才能仍然使用这些想法。但是的,我不能透露太多。

Vibhu [00:51:05]: 看起来评分标准在这方面占据了很好的位置,对于无法验证的领域,你有评分标准,你有模型分解,还有一路上的评判标准。

Swyx [00:51:14]: 是的,这是一种验证形式

Swyx [00:51:16]: 一旦你有了足够多的评分标准。

Richard Socher [00:51:17]: 是的,一切。我很久以前就说过这个。这就是为什么我从来对 AI 能玩游戏没那么印象深刻,因为我觉得任何你能模拟和/或验证的东西,你都可以拥有无限的训练数据

Richard Socher [00:51:29]: 因此,AI 最终会解决它。

Swyx [00:51:32]: 寻找那些你可以做自动领域分布的游戏。所以这是一个没有人训练过的游戏,因为它是新游戏。

Swyx [00:51:38]: 你可以开始玩游戏,你可以开始玩。所以我一直在构建这个,并亲自克隆了这个,它一直只是自我对弈。我已经评估了大约十亿个局面。

游戏、自我对弈与 AI 经济学家

Swyx [00:51:48]: 而且,我想做 AlphaGo 那样的自我对弈,直到你变得更好,对吧?

Swyx [00:51:53]: 就像,这甚至不是 LLM AI。这只是经典的游戏 AI。

Swyx [00:51:58]: 但是,我认为。而且,但我让 GPT-5.6 自动研究它,因为我不想手动处理这些。我期望,AlphaGo 的过程到现在应该已经完全融入权重中了。

Swyx [00:52:10]: 但并没有。它确实。它,就像,立即就趋于平稳了,非常快,直到我人类玩测试它,然后我,就像,指出了明显的错误,然后它们就像,“哦,是的。好吧。”然后它又下降了。

Richard Socher [00:52:22]: 是的。是的。是的。

Swyx [00:52:23]: 而且就像,再多的,比如,换个思路,更有创意地思考,给我 8 个不同的方向,任何。再多的提示都做不到。

Richard Socher [00:52:31]: 有趣。

Swyx [00:52:31]: 就像,你必须,就像,针对人类进行 RL 才能

Swyx [00:52:35]: 做到。所以我,那是我的。顺便说一句,Bean 总是赢,如果你。如果有人看过,Reese 的《安德的游戏》。

Vibhu [00:52:42]: 而且你在 AI 的指南上投入了相当多的功夫。就像

Swyx [00:52:46]: 很多

Vibhu [00:52:46]: 所以你堆叠瓷砖的游戏。有一些规则。你想占领最大的区域。你有,就像一整本 50 页的关于每条规则的内容。

Vibhu [00:52:56]: 你把这些输入进去。它不能,它不能很好地处理。

Richard Socher [00:52:58]: 是的。太有趣了,这让我想起我们 2018 年做的一篇论文《AI 经济学家》中关于占领领土之类的内容。如果你搜索 AI Economist Salesforce,我们有一个可以播放的视频。那是一个经济模拟。

Richard Socher [00:53:12]: 所以想法是你有所有这些经济主体。他们只想优化自己的效用函数,也就是,收集能赚钱的资源。你可以出售像木材这样的资源,然后,随着时间的推移,当你收集到足够多的木材,你可以建造房屋,你可以与其他主体交易,然后你还可以用这些房屋来阻挡资源

Richard Socher [00:53:35]: 不让其他主体获取。

Richard Socher [00:53:36]: 所以有,就像

Swyx [00:53:37]: 大战略

Richard Socher [00:53:37]: 竞争性玩法和策略

Richard Socher [00:53:39]: 等等。重点是,我们想理解什么是最佳的税收和补贴方式,以优化经济。这项研究还没有迎来它的 GPT 时刻,但我相信像新加坡这样的国家应该并且最终会用它来取代党派政治和特殊利益政治——比如谁给你的竞选捐了最多钱之类的——你可以说:“好吧,我想帮助中产阶级”,或者任何你作为政治家可能说的目标。然后人们说:“好的,那你打算怎么做?”然后你说:“好吧,这是我的财政政策。这是我将如何改变税收并支付给这些人”等等。然后你可以把它放进一个模拟中,让这位政治家的尝试与数十亿、数十亿年的其他策略进行对抗,以试图实现他们设定的目标。

Richard Socher [00:54:36]: 然后你可以说:“好吧,如果那确实是你真正的目标,那么这里有数十亿年的强力模拟,它会建议你尝试其他方式来做这件事,也许是这些税收等等,这些税率档次等等。”这就是你避免被钻空子的方式,因为这些智能体也会试图通过奖励黑客来不交税,以及

Richard Socher [00:54:55]: 等等。我觉得这篇论文非常有趣。不幸的是,和第一篇关于提示工程的论文类似——经济学家们说:“我们根本不懂这些数学。”就像

Swyx [00:55:08]: 这甚至不是,这甚至不是数学。只是我们不信任你的模拟。这和数学无关。

Richard Socher [00:55:12]: 它——我,他们直接就把这东西拒稿了。就像

Richard Socher [00:55:15]: 就像他们甚至没有给我们清晰的信号。但是,经济学界不幸的是没有合适的

Swyx [00:55:23]: 我的天啊。

Richard Socher [00:55:24]: 是的,它没有合适的基准。所以你不能。就像,最终,为什么神经网络赢了?不是因为人们喜欢它。就像,他们有各种漂亮的积分和图形模型之类的东西,但它就是效果更好。

Richard Socher [00:55:36]: 但在经济学中,很难证明

Swyx [00:55:38]: 所以是经验主义对比。是的。我确实有一点经济学背景,那里有很多物理学嫉妒,你想写出经济的一般方程,而不是直接模拟它并使用进化方法。

Swyx [00:55:51]: Vibhu 想的正是我在想的,我们不是已经在 Smallville 那里迎来了 GPT 时刻吗?

Richard Socher [00:55:56]: 是的,我喜欢这个。你好。是的,他们

Swyx [00:55:57]: 还有,Dune,Joon 刚刚宣布了。我不知道你们是否参与其中。

模拟、经济学与政策

Vibhu [00:56:00]: 类似地在那里。

Swyx [00:56:01]: 类似地,他们已经

Richard Socher [00:56:02]: 我希望我们参与了。我们没有,是的。

Swyx [00:56:04]: 是的。我在 AIE 做过几个基于模拟的演讲,所以如果人们想了解那里的最新进展,很多人正在探索这个。它

Vibhu [00:56:13]: 已经被验证了。

Swyx [00:56:13]: 是的。我们还和 Shopify 的 Mikhail Parakhin 做了一期播客,他正在将模拟用于商业。

Swyx [00:56:20]: 这将会模拟,比如,你的轨迹,并预测你在商业旅程中所做的改变会如何影响你的销售以及所有这些事情。

Richard Socher [00:56:27]: 我喜欢这个。是的。模拟整个经济真的很难,对吧?你必须做出一些简化假设。

Swyx [00:56:32]: 只是,一切都在说,“哦,LLLM 非常昂贵。”

Richard Socher [00:56:34]: 没错。

Swyx [00:56:34]: 而我只是想,“我要做这个 80 亿次吗?”拜托。

Richard Socher [00:56:37]: 没错。

Richard Socher [00:56:37]: 但是,我觉得像新加坡这样真正想要客观地做正确事情的国家,拥有非常技术型的领导层等等,他们可能最终真的会尝试模拟他们的经济。你必须做出一些简化假设,但这变得非常有趣,因为你也可以说,如果你的假设是,如果你让人们努力工作,他们就会努力工作,并且他们拥有自由。然后事实证明你必须做出假设。比如,有些人关于一天想工作多少小时的效用函数是不同的,对吧?然后你就可以开始对模拟中的假设产生分歧。然后一旦你说,“好吧,现在我们同意了那些假设”,或者我们对不同分布下的人是什么样子有不同的看法等等,那么根据你的目标,就会有不同的结果。然后,当然,人类应该选择目标是什么。在我们的案例中,是生产力乘以平等,这有一些问题,但并非完全不合理。

Swyx [00:57:29]: 是的。就新加坡说一句,因为你可能完全不知道,但我是新加坡人,我参与了新加坡人工智能委员会来制定这些事情。他们不会这样做的主要原因是因为他们非常保守。

Swyx [00:57:42]: 而且,我试着把它看作。有一个创始人领导的国家。当你创立一个国家或创立一家公司,并且它是由创始人领导的,你可以做任何你想做的事,因为这是你的国家。

Swyx [00:57:52]: 然后还有管理——比如,职业管理——管理阶层,现在就是。这就是新加坡。所以他们想要。他们总是想看到别人先做。

Swyx [00:58:00]: 而且。但是,就像,西方每个人都把新加坡看作,“哦,这是一个小国。你可以做任何你想做的事。”新加坡不会那样做。

Swyx [00:58:07]: 所以,就像,必须由别人在那里带头。我就问一个关于模拟的问题,然后我不知道,我们可能可以继续了。模式崩溃,对吧?就像,LLLM 并不模拟人类的决策。把它大量生成 80 亿次不会帮助你模拟人类。我们该怎么办?

模式崩溃、角色模拟和 LM Arena

Richard Socher [00:58:25]: 我确实认为,你必须聪明地分别提示每一个。

Richard Socher [00:58:31]: 而且我认为这会帮助你陷入不同的模式。而奇怪的是,人们也会陷入不同的模式?就像,有很多人,就像那句“老狗学不了新把戏”一样。就像,一旦人们固守自己的方式,年纪越大,就越难用新的方式思考。还有这个,我想,有句评论,我忘了是谁说的,但大意是:在你出生之前发明的一切都是自然的。在你20岁时发明的一切都很酷。而在你60岁之后发明的一切,都是不自然的、令人厌恶的、奇怪的。

Richard Socher [00:59:02]: 我觉得就是这样。对很多人来说,这确实是真的。就像

Swyx [00:59:05]: 是的,这是一种时尚,而且我认为人们会去做。腾讯有一篇十亿人格的论文,如果有人正在研究这个,它为提示、模拟提供了一个很好的数据集,在播客上。他们就像,“你是一个30岁的杂货店店员。你是一个50岁的教授。”

Swyx [00:59:24]: 然后就做十亿个这样的。

Richard Socher [00:59:26]: 说得通。是的。

Swyx [00:59:26]: 所以你就直接用它。

Richard Socher [00:59:27]: 我,我很震惊,很多这些东西最终映射出的统计数据与真实实验如此相似。是的。是的。

Vibhu [00:59:36]: 我认为当人们进入研究领域时,尝试这些也是好事,对吧?就像,我们见过只用某个日期之前的数据训练模型,然后看它能外推得多好。做同样的事,对吧?所以,看,人们会用更好的编码智能体写更多代码吗?一个没有在这上面训练过的模型,能在没有网络访问的情况下弄明白吗,对吧?外推出去。测试这些东西。

Richard Socher [00:59:56]: 就在今天,我想 LM Arena 发布了一个有趣的结果,他们现在能够创建一个模型来预测你的排名。

Swyx [01:00:03]: 等等,基于什么输入?

Richard Socher [01:00:05]: 你的模型。我猜你把你的模型给它,它预测 Elo 分数。

Swyx [01:00:08]: 我明白了。好吧。当然。

Richard Socher [01:00:09]: 这很令人惊讶。

Richard Socher [01:00:11]: 他们存在的全部理由就像是,哦,我们帮你比较这些模型。是的。

Swyx [01:00:16]: 是的。这个团队,他们——他们做了很多工作,而且他们有最多的数据来做这件事,所以何乐而不为呢?

Richard Socher [01:00:20]: 对。是的。

Richard Socher [01:00:21]: 那大概是对的。

Swyx [01:00:22]: 当他们从加州大学伯克利分校出来时,他们不仅有 LM Arena,还推出了一个路由项目

Swyx [01:00:27]: 那会基于 LM Arena 进行路由。

Richard Socher [01:00:30]: 说得通。

Swyx [01:00:30]: 而我认为那从未实现,我很好奇为什么。我一直没机会问他们。

Swyx [01:00:35]: 因为,就像,它。它就像是,哦,是的,显然那就是你的商业模式。你会成为一个路由器。

Swyx [01:00:38]: 而他们从未成为一家路由器公司。

AI 为 AI:内核优化与推理效率

Swyx [01:00:40]: 奇怪。所以那。我就,把这个提出来。如果你有什么要说的,我们要谈谈 GPT-5.6、自我自动研究之类的东西。我还应该在你关于内核优化和你演讲的那个 track 的清单中提到,我们还放了来自 Vico 的 Zhengyao Wei,他也是 Parameter Golf Challenge 的第一名,那是一个 OpenAI 的招聘挑战。

Swyx [01:01:05]: 这也是一个非常相似的故事。我想我们会一直看到这种情况,Swyx [01:01:09]: 人类对某件事进行了大量优化,然后某个

Richard Socher [01:01:12]: AI 团队进来,直接就成了第一名。

Swyx [01:01:15]: 是的,100%。

Vibhu [01:01:16]: 我觉得这类挑战还有另一个有趣的地方,对吧?所以这是在训练——能塞进 16 MB 的最佳模型。你总是可以翻看所做的改动以及人们取得的小幅提升,对吧?

Vibhu [01:01:27]: 比如,你得到的提升不到 0.01

Vibhu [01:01:30]: 通过加入一些改动过的注意力 MLP 之类的东西。然后你去看你的图表,你会想:“好吧,我们干脆让模型放开跑。”然后,哦,我们有点停滞了。不,又掉了一次。不,又掉了一次。而且

Vibhu [01:01:43]: 就是这样,就好像,你们加了什么?你们没加,Swyx [01:01:47]: 哈希表。

Vibhu [01:01:47]: 哈希表,对吧?

Vibhu [01:01:48]: 又不是你们发明了哈希表。你们又做了 3 轮迭代,解锁了几个别人不会随便发现的阶跃函数。

Richard Socher [01:01:55]: 是的。关于 OverGrid 收个尾,在尝试优化的过程中,我们在测试框架里发现了 30 个 bug。

Richard Socher [01:02:02]: 对吧?所以,就像,每一个——在我们发现这个 bug 之前投入的所有研究,我们都得,都得扔掉,因为它被污染了。

Swyx [01:02:10]: 对。是的。

Richard Socher [01:02:11]: 这正好对应你说的奖励黑客。就像,即使在这个非常简单的游戏里,我们也发现了这些 bug。

Swyx [01:02:17]: 是的。是的,太疯狂了。

Richard Socher [01:02:18]: 所以

Swyx [01:02:19]: 还有对称性

Richard Socher [01:02:19]: 而对称性是一种非常好的检查方式,也就是你改变某些东西的位置,按理说不应该有影响,但实际却有影响,那就是个 bug。

Richard Socher [01:02:28]: 这种情况也出现在,比如说,选择题里,像 GPQA 类型的问题,就是,在 A、B 和 C 之间,如果这是一道选择题,你改变顺序,按理说不应该有影响,但实际却有影响。

Swyx [01:02:39]: 对。对。对。

Richard Socher [01:02:41]: 所以,是的

Vibhu [01:02:42]: 有时候这就像是,好吧,模型仍然偏好输出的末尾,对吧?没有训练好,一个长上下文模型,最后那部分 token 才是你在意的。

Richard Socher [01:02:51]: 哦。不。答案是

Vibhu [01:02:52]: 但是,是的。

Richard Socher [01:02:53]: 在那个 LLM 研究时代,答案更简单。它们只是记住了,比如这个问题的答案是 A。我不在乎答案是什么。就是,就是 A。就像。

Vibhu [01:03:03]: 好。所以我觉得我们可以继续了。你刚才做的最后一部分,内核优化,可能是你最快能感受到的,对吧?所以昨天,OpenAI 宣布了自进化,让他们最好的模型来做优化内核,它们效率高得多,而且他们可以在 Luna 和 Terra 上削减 80% 的成本。我想就问题而言,你勾勒了一个大致的路线图。有很多关于生物、很多关于物理的内容。你觉得哪个会先实现?比如,接下来两年呢?现在可以实现什么?你在最后提到了机器人技术,但你从什么开始?

Richard Socher [01:03:38]: 我们非常明确地不会从任何物理科学开始

Richard Socher [01:03:43]: 目前是这样。我们会从面向 AI 研究的 AI 开始。所以我认为,面向 AI 研究的 AI 仍有很大的成长空间。这既包括让训练更高效、更自动化,也包括让推理更高效,并且有可能在你的笔记本电脑上本地运行。而且还有各种各样尚未被充分探索的有趣角度。

Swyx [01:04:08]: 深入讲讲本地这块吧,因为我总觉得它是最低效的 AI 训练形式。

Richard Socher [01:04:15]: 是的。所以就训练和推理而言,我没法讲太多细节。

Richard Socher [01:04:18]: 但没错,我觉得就是有太多角度、太多不同的计算基底,无论是用于训练还是用于推理,都还没有被探索过。

Richard Socher [01:04:26]: 很好。我不知道你对其他那些内容还有没有别的评论。我想说的是,另一个方面是,既有小尺度上的推理与优化,也有在负载条件下端到端的整体延迟,而这是非常不同的一件事,也就是他们最终所做的。那是一个不同于我所说的改进内核的自动研究领域。对吧。

Richard Socher [01:04:50]: 我觉得我在自动化或改进端到端性能方面一直会想到的另一件事,是 harness 在其中扮演了什么角色。对吧。

Richard Socher [01:04:59]: 所以,尤其是现在,当我们说 harness 时,我们指的也包括沙箱,对吧?我很好奇这对你来说是不是一个阻碍,或者说,agent 是如何调用工具的。

Harness、沙箱与搜索

Richard Socher [01:05:10]: 所有这些 agent 使用的头号工具当然是网页搜索,这很合理。然后我确实认为 harness 很适合拿来优化,因为它太容易了,对吧?它只是语言。你看一看,觉得合理,然后就可以迭代。你不需要为了达到下一个状态而训练一个需要大量 flops 的大模型。

Richard Socher [01:05:31]: 所以我是 harness 优化的忠实支持者。

Swyx [01:05:32]: 是的,但沙箱对你来说没问题吗?

Richard Socher [01:05:34]: 沙箱也超级重要。然后当然,像奖励、奖励黑客和对齐,我认为都极其关键。

Swyx [01:05:41]: 好。既然提到网页搜索,你恰好还是一家网页搜索公司的 CEO。你会用 You.com 吗?你也会用其他家吗?比如,我们其他人是不是应该用你们来做网页搜索?我——当我说“你”的时候,这很好笑。它既像是指你这个人,也像是指你们公司。

You.com、Agent 搜索与金融

Richard Socher [01:05:56]: 所以是的,它现在主要面向开发者和 agent。它不太面向消费者或专业消费者。所以如果你是一家公司,并且你有 agent。而且,说实话,对于很多现在转向开源的公司来说,突然之间这就变成了一个有意识的选择:我该给我的开源 LLM 访问哪些工具?而第一选择通常必须围绕网页搜索。然后一旦你达到规模,You.com 就会成为一个显而易见的选择,因为所有那些不同的基准等等,我们几乎都在帕累托前沿上占据主导地位。

Swyx [01:06:31]: 然后,就一般大众而言,比如那些刚接触这个领域、正在考虑构建代理的不同选项的人来说,这其实是一个层级结构,对吧?很多人会听说过 Exa,会听说过 Parallel,而 You.com 就像是在那一堆提供商之中。再往上,还有像 Firecrawl 和 BrowserBase 这样的通用网页抓取公司。再往上,就是像 Bright Data 这样的商业代理公司。

Swyx [01:06:56]: 这是一个准确的瀑布模型吗?比如,“嘿,你在构建一个代理。这些是你的选项。”

Richard Socher [01:07:02]: 是的,当然,就像,是的,Bright Data 在堆栈中位置较低,属于代理网络那一侧。我认为,就内容和获取抓取内容而言,你在 You.com 上也可以做到。然后还有。越来越高层次的抽象,以及我们做的不同数据集的组合,比如在金融领域

Richard Socher [01:07:23]: 比如,我们不仅仅是准确率高出 2% 或 3%,而是比其他家准确率高出 20%,同时速度更快、成本更低。尤其是金融领域,简直没法比。你可以去 You.com

Swyx [01:07:36]: 是的。这很棒

Richard Socher [01:07:37]: 而且有一些统计数据,和基准测试,你可以——如果你往下滚动。所以有,不同的数据集,你可以看看,不同的竞争对手。

Swyx [01:07:46]: FinSearch 竞赛,是的。

Richard Socher [01:07:47]: 是的,FinSearch 就像我们名列前茅,接近 90,而第二接近的,速度慢得多,是的,就像在 70 多而不是接近 90。

Swyx [01:08:01]: 是的。是的。是的,有意思。我——我的下一个关注点是金融领域的 AI,所以这就像

Richard Socher [01:08:06]: 哦,不错。哦,好的。

Swyx [01:08:06]: 我真的要去,在纽约做一个会议,专门为银行做这些东西。金融就像是继编程之后下一个爆发的领域。因为它某种程度上是可验证的,就像

Richard Socher [01:08:16]: 我喜欢。你说得对

Swyx [01:08:17]: 优先处理电子表格。那里有很多数据都是公开的,你可以抓取它以及所有这些事情。但是,在金融领域,你们解决了什么困难?

Richard Socher [01:08:27]: 当然,比如,让很多人栽跟头的一件事就是训练数据的泄漏等等。你想,“哦,我该怎么。”你理想中想要在事情发生之前预测未来。

Swyx [01:08:37]: 哦,你想掩盖未来。

Swyx [01:08:39]: 哦,好的。

Richard Socher [01:08:40]: 嗯,是的,在你的训练数据中掩盖未来,但有各种各样的泄漏。比如,我可以告诉你,当我在斯坦福教 NLP 课程时,每年都有几十个学生说,“我想用数据集 X,比如 Twitter,来预测股市。”他们全都,展示了些可爱的小东西,看起来 somehow 像是

Swyx [01:08:58]: 对,它从不亏钱。怎么会呢?

Richard Socher [01:08:59]: 而且它——是的。而且总是有一些数据泄漏等等,一旦你解决了所有这些问题,它就不像他们想的那么容易了。但是不,我同意你的看法。这是一个非常明智的 AI 应用。是的。

Swyx [01:09:13]: 是的。太棒了。作为一名作家,作为在这些事情上的思考者,我喜欢MECE分类法。MECE是相互独立,完全穷尽,差不多是这样。那么,如果这是一份关于智能的MECE清单

智能的十个空间

Richard Socher [01:09:25]: 并不是。

Swyx [01:09:25]: 它非常——好吧,是的。

Richard Socher [01:09:27]: 抱歉。存在各种重叠。

Richard Socher [01:09:28]: 事实上,如果你想要那份清单,我认为智能的3个主要组成部分是预测,这在数学上与压缩非常相似。预测乘以行动乘以目标。这就是3个主要组成部分。我认为所有这10个空间都是这3者的组合

Richard Socher [01:09:52]: 如果你愿意的话,在特定维度上。我称它们为空间的原因是每个空间都有许多子维度。我试图做的,这几乎只是对最初目标的一个支线任务,即思考智能的上限。每个人都像是,“哦,它是指数级的。”然后就像是,好吧,指数在某些时候必须趋于平缓,但当涉及到智能时,它们在哪里趋于平缓?这引导我走上了这整个……就像,最初它始于一条推文,然后变成了一篇博客文章,现在我已经写了50页,还远远没有接近

Swyx [01:10:26]: 这是你的第二本书。

Richard Socher [01:10:27]: 这是第二本书。所以——在我的第一本书《你就是你的机器》中,我只是在结尾提到了这10个。我会——只是为了让你有个概念,比如,视觉智能是最容易谈论的,我已经在脑海中为它充实了最多内容。所以人类智能有双目视觉,对吧?我们有2只眼睛。我们有一个非常窄的电磁频谱带,我们可以直接自己观察。所以当你思考视觉智能的上限时,首先,你应该进入,比如,你可以有数百万和数十亿的传感器。在某些时候,你会遇到这些问题:这些传感器彼此相距多远,以至于光速无法将所有内容传送到中央大脑进行处理,视觉智能,对吧?

Richard Socher [01:11:16]: 所以现在你在思考视觉智能的维度和空间——传感器数量的维度。

Richard Socher [01:11:24]: 所以上限在字面和比喻意义上都是天文数字,我们距离任何拥有这么多传感器的智能都超级遥远。但然后你进入下一个维度,即频率,你一直向下到伽马射线,你可以开始尝试观察,你进入上限,或者我猜在这种情况下,下限,或者频率方面的上限,是量子不确定性。就像,你不能再观察某些粒子了。

Swyx [01:11:50]: 或者你摧毁了它,是的。

Richard Socher [01:11:51]: 现在想象一下,你有数百万个传感器,能够一直看到亚原子级别,只要物理学允许,然后一直看到引力波。现在你有数百万个这样的传感器。所以这是另一个维度,即频率。然后还有一个维度是,你能记住并分类多少种类的事物?我们现在知道,对于人类来说,有些事物,如果你有更多的术语,你就会有更好的视觉描述。而像没有这些术语的动物,比如大猩猩可能有大约200个词来指代某些事物,主要是视觉事物。因此,人类感知在分类所有这些不同的物理对象方面是相当特殊的。所以这些只是一个非常简单的例子。如果你转向知识,那么它也是,就像所有这些传感器周围的光锥速度。所以它们都是相连的。就像知识连接到视觉智能,如果你认为不仅仅是视觉,而是感知智能,就像,因为它不一定只是我们能看到的。它可以是,再次,更广泛的电磁频率。然后你有语言智能,最近变成了更多的通信智能,因为它更……就像语言有所有这些不同的人类界限。人类只能理解和记住这么多术语在我们的长期记忆中,对吧?我们的词汇量有些限制,而主动词汇往往比被动词汇更小,即你能理解的词汇。然后,语言在传递不同类型的信息和传输不同比特时效率极低。就像人类语言是串行的。通信智能的另一个界限是并行通信,但我们的舌头和嘴巴无法同时有多个流,我们也无法理解。有些女性在 multitasking 方面比一些男性稍好

Richard Socher [01:13:48]: 但是,大多数人只能听一个对话并真正理解它。

Richard Socher [01:13:52]: 在通信智能方面,真正的上限是一,即你能处理多少知识,多少通信序列

视觉、通信和物理智能

Richard Socher [01:14:06]: 并行处理,对吧?然后,当然,你有,句子有多长?我们的工作记忆只有这么多,因此人类语言有这些相当简单的句子,平均一句话大约40个词。这对AI来说也不是一个有意义的上限。然后,是的,我可以继续下去。每一个都有大量有趣的上限,它教会我们很多关于AI能走多远,当我们开始思考这些上限并意识到在许多情况下我们离上限有多远。然后你进入物理学。现在,我没有像学习AI和计算机科学那样学习物理学,所以我学到了很多,这就是为什么它有点有趣。但很多这些,比如多少。然后当涉及到,例如,知识,比如你能存储多少?你能在一定的质量和体积中存储多少比特或字节?

Swyx [01:15:03]: 是的。

Richard Socher [01:15:03]: 然后你会接触到各种有趣的界限,比如贝肯斯坦界限,然后你开始思考黑洞。还有,速度也是一个有趣的东西,因为它与所有这些都相关,但速度本身也是一个独立的东西,因为如果其他条件相同,如果你需要一个小时才能知道 2 + 2 等于 4,那你就不如只需要一毫秒就能知道的人聪明,对吧?然后,所有这些都与生存和复制有关,最后一个。就像,是的,如果它。比如,树真的很慢,所以我们甚至不认为它们有多聪明。但如果你把树的一些视频加速,它们试图寻找东西等等,它们并不像看起来那么笨。就像,不是像木头那么笨?但是,就像。然后,不同的东西,那个

Swyx [01:15:47]: 所以这在某种程度上与速度有点重叠。

Richard Socher [01:15:48]: 没错。它重叠——就像,所有这些事情都重叠。比如,你谈论自然语言连接一切,对吧?你谈论你的知识,你推理,然后你交流。你谈论你看到的东西。所以它们都是相互关联的,但我认为单独研究它们是有用的,就像我能想到的最好的类比是能量,对吧?你有动能或势能。理论上,你可以研究所有物理学。只是你想研究动能还是势能?但在实践中,研究机械工程、电气工程、核物理和化学以及所有这些不同的子领域是有帮助的,这些子领域在某些方面

Swyx [01:16:25]: 组合

Richard Socher [01:16:26]: 只是,就像

Richard Socher [01:16:27]: 只是不同类型的能量,但单独研究它们是有意义的。所以我认为物理智能,也许我只会再做一两个。比如,如果你完全控制自己的计算基底,并且完全控制物理物质,你应该能够创造任何你想要的原子。比如,我们可以有趣的事实,你可以创造金原子。只是

Swyx [01:16:47]: 从?

Richard Socher [01:16:48]: 从原始质子

Swyx [01:16:49]: 哦,只是把它们撞在一起

Richard Socher [01:16:50]: 还有,比如,电子,然后你把它们撞在一起。

Swyx [01:16:52]: 只需要 98 个,或者我忘了数字。

Richard Socher [01:16:53]: 是的。所以,问题是,这需要消耗疯狂的能量。

Richard Socher [01:16:57]: 而且它的成本远高于此。然后你只能得到,比如几个金原子,对吧?所以,这并不可行。但如果你能更好地控制你的物理基础,比如所有物理基质,我认为那是另一个智能空间,因为它与你自己的计算基质相关,你最终也可以改进它。社交智能是一个有趣的领域,不是说仅仅涉及伦理和道德,这些也很重要,但从某种意义上说,你可以尝试定义你能与多少其他智能实体交流的上限,并能够对你能够改变它们内部状态和行动以符合你的目标的程度有一个期望值,对吧?所以,你可以写一个相当直接的方程来定义那个社交智能水平。这就是人类、伦理、道德、宗教等几千年来一直在试图弄清楚的。在所有这些情况下,我们都离上限很远,这应该非常鼓舞人心,并向人们展示我们仍然可以进行多年的AI研究。

Swyx [01:18:12]: 是的。这里有很多内容。这是一种关于智能的普遍哲学,非常有趣。我。你有什么评论或。

创造性智能与分布外想法

Vibhu [01:18:21]: 我认为了解你认为的基线是什么会很有趣,我们现在处于什么位置。什么是低垂的果实?什么是遥远的?人们应该把工作投向哪里?他们应该关注什么?

Richard Socher [01:18:33]: 哦。我认为很明显,自然语言,再次

Richard Socher [01:18:36]: 是人类智能最有趣的表现形式,因此也是AI的一个子领域。我很兴奋现在很多人同意这一点。当我在2003年开始学习语言计算机科学NLP时,它就像一个奇怪的利基主题。我确实认为还有更多潜力,因为它如何与其他一切连接,以及文明如何建立在语言和知识等之上。我确实认为物理智能会出现。这很有趣。我觉得机器人技术处于机器学习的阶段,你只是看,比如人类如何决定这是一个肯定句?哦,我这样做。所以,机器人技术很多是,“好吧,我们有5个手指-”

Swyx [01:19:15]: 建模

Richard Socher [01:19:15]: “让我试着这样做。”还没有人致力于机器人技术的超级智能版本,那更像《终结者》电影中的T-1000,我们不要建造真正的终结者。但是,我认为,这个想法,你应该能够变形,变成任何形状。这就像是物理智能的超级智能版本。我们甚至还没有。还没有人真正开始。有一些非常可爱的小研究,你可以让一些磁铁通过一些网格移动。但是的,这非常早期。

Swyx [01:19:49]: 有一些。我认为麻省理工学院每年或每两年,他们有,比如一些自组装机器人东西

Swyx [01:19:55]: 那,就像那样,但它非常原始。

Swyx [01:19:58]: 我稍微触及一下,比如创造性智能的主要维度是什么?

Richard Socher [01:20:02]: 创造性智能,当然,同样与所有这些都相关联。其中很大一部分与元认知相关,因为你需要创造性地选择你的目标。

Richard Socher [01:20:13]: 我认为,对于一个人及其生活、职业和幸福而言,最重要的事情之一就是选择你的目标,但对于任何智能体来说也是如此。然后,当然,还有创造性智能,即针对现有问题找到创造性的解决方案,对吧?

Richard Socher [01:20:29]: 就像我说的,比如,我们想让这个产品更便宜。比如,找到一些解决方案,对吧,就像找到现有的路径。但智能中最有趣的部分是,当你不仅走出已知想法的凸包,而且走出已知想法的超立方体时,我们知道,所以,超立方体就像一个数学概念,对吧?我们已经知道AI可以做得更多

Swyx [01:20:50]: 就像已知维度,是的。

Richard Socher [01:20:52]: 是的。就像,确切地说。所以,AI在超立方体方面已经做得很好,比如,如果你给它一堆棕色狗和粉色汽车的例子,AI仍然能够生成一张粉色狗的图片,即使它在训练数据中从未见过这样的东西,对吧?所以它可以在这个超立方体上工作,但它还不能在外面工作。它还不能定义全新的概念,这些概念结合了许多我们从未见过的其他东西,提出新的目标,然后对这些概念进行推理等等。我认为在创造性智能方面还有很多可以探索的地方。

Swyx [01:21:25]: 我对此没有太多反驳。我认为对我来说,创造性听起来也就像是分布外,或者高困惑度,或者随便你怎么称呼它,对吧?就像

Richard Socher [01:21:33]: 确切地说。

Swyx [01:21:34]: 谁说你的事情比我的更有创造性?好吧,它只是更非共识,或者。

Richard Socher [01:21:39]: 然后,当然,问题是,比如,但噪声也非常,就像,分布外。而且就像如果它只是噪声

Richard Socher [01:21:46]: 那么它是新颖的,但是,你不想要那样,所以它需要与一些概念相连接。是的,关于这一点也有一些非常酷的论文。

Swyx [01:21:54]: 谁?

Richard Socher [01:21:55]: Jürgen Schmidhuber。

Swyx [01:21:55]: 哦,是的。哦,我们必须提到他。我正要说,比如,在你的历史中Jürgen在哪里?是的,我。我认为一个人的噪声是另一个人的信号,对吧?这就是,比如,当你谈论创造性时,艺术就像,好吧,汤罐头是艺术吗?有些人认为是

Swyx [01:22:11]: 有些人说不是,这就是艺术,是你的

Richard Socher [01:22:14]: 我认为艺术的有趣之处当然总是,艺术也是作为感知它的人和创造它的人之间的相互作用而创造的

Richard Socher [01:22:24]: 还有他们所处的语境,对吧?所以对某些人来说是艺术的东西,对另一些人来说就不是艺术。这里面存在某种主观性,而我认为这种主观性总体上并不是人们在 AI 中探索得很多的东西,因为,还是那句话,元认知,我们不想让它就自己跑出去为所欲为。我们通常是有目标的。我们花很多钱造一个 AI 来为我们做某件事。但我认为创造力最终必须与元认知相连接。如果你只是机械地永远预测下一个 token,不管发生什么,我会说,在某些方面,你并没有那么智能。

元认知、生存与复制

Swyx [01:22:59]: 那本来要说到元认知的。为什么它不是最重要的那个?为什么它是第 9 个而不是第 1 个?

Richard Socher [01:23:05]: 这些并没有排序。

Richard Socher [01:23:06]: 第一,我认为它们大致上可能与人们在其上投入的工作量相关

Richard Socher [01:23:16]: 并且人们已经接受它们是一种智能。很多时候,当你试图在网上找,比如说,给我一个关于智能的全面好定义时,所有定义都是人类智能。就好像,哦,你有社交智能。比如,某人是否开心。你能沟通。你有……到目前为止,所有关于智能的定义都非常以人为中心,因为那是我们迄今所知的最大、最好的智能形式。我希望这条研究路线,以及 Eureka Machine 的最终成果,还有希望将来如果我有时间把它进一步充实出来的话,那本新书,能让我们意识到还会有其他类型的智能。它们已经以各种形式存在,而且在某些情况下,它们可以远远超过我们所能达到的高度,比如我们在记忆、眼睛、改变物理物质的能力等方面显而易见的限制。

Swyx [01:24:12]: 你是在比我版本更宽广的思路里思考这件事,我的版本是,我认为元认知会是最接近递归智能的东西,因为它是对如何改进思考的思考。

Richard Socher [01:24:23]: 它。100%。你,你 100% 说得对。我大概应该从这一点开始讲。它是,它是一个很大的部分

Swyx [01:24:28]: 但不对,你,你是在那种扩展模式里,让我们画出一个维度的上下界,而我认为我最喜欢的一个版本是特德·姜的《你一生的故事》,它被改编成了电影《降临》,其中元认知

Richard Socher [01:24:43]: 那是一部美丽的电影,是的

Swyx [01:24:44]: 其中元认知那一步就像是,好吧,我们认为自己受限于时间对我们而言是线性的,但对这些七肢桶来说,时间是一个圆,所以他们不以之前和之后来思考。他们只是同时以完整的历史集合来思考。就像

Richard Socher [01:24:58]: 我喜欢

Swyx [01:24:59]: 所以他们不从左到右书写。整个东西直接出现。

Swyx [01:25:02]: 总之,那么。然后我认为最后一件事是生存与复制。我认为这也许可以追溯到最初关于暂停和节奏的对话。

Swyx [01:25:10]: 一个物种或生命形式考虑自身的灭亡并提前采取行动来阻止它,这是智能的吗?就像,那是智能的。所以也许欧洲人是我们所有人中最聪明的。

Vibhu [01:25:23]: 我还要在那里加上持续学习的一部分,对吧?所以生存和复制,其延伸就是你是否能够继续改进,继续学习,这是人们非常关心的事情,对吧?

Richard Socher [01:25:34]: 并继续积累知识

Richard Socher [01:25:37]: 我认为这又是你可以为自己设定的最好的元认知奖励之一。我确实认为,就像,客观地说,如果某个其他实体真的很笨,却能完全终结你的存在,那听起来不太聪明。就像,直觉上,感觉如果你能继续存在下去以尝试实现你的奖励,你显然比那些做不到的其他实体更聪明一点。所以这是第一点。第二点是,就像,这是一个我们想在这方面投入多少努力的问题。而且很少有人,现在真的没有人在研究这个,对吧?我们可能只想这样做

Swyx [01:26:13]: 不像预防小行星那类事情。

Richard Socher [01:26:15]: 我们可能只想在我们想把探测器,带着我们的氛围和模因而不是我们的基因送入太空时才这样做,对吧?然后我们想要那些探测器。有一本美丽的书,《星星之间的缓慢时间》。它非常短,就像有声书,在亚马逊上。我喜欢它。我的一个朋友,斯图尔特,推荐给我的。就像,如果你想发送那些探测器,那么可能就有意义,就像,我们的模因,作为人类应该留下来

AI、太空旅行和非零和生存

Swyx [01:26:43]: 哦,是的

Richard Socher [01:26:44]: 并在宇宙中扩散。就是这样。是的。

Swyx [01:26:47]: 哇,那有很多读者。

Richard Socher [01:26:49]: 这是一本非常好的书,而且非常短。我强烈推荐它。你可以直接看它,就像,也许20分钟就分开了。

Swyx [01:26:53]: 我喜欢这对忙碌的人来说是一个加分项。就像一本短

Richard Socher [01:26:56]: 是的。它很快就进入有趣的

Swyx [01:26:58]: 哦,我得研究一下

Richard Socher [01:26:58]: 发人深省的想法很快,所以是的。总之,有很多伟大的科幻书。

Swyx [01:27:03]: 论点是,就像,我们的电视正在向外星人广播,他们都看我们的电视,他们认为那是真的,对吧?就像,有很多,有很多科幻

Richard Socher [01:27:10]: 那还有,就像,积极的模因,然后希望它们能回来,带给我们各种关于宇宙的有趣知识。但是,也许我还想说的是,我觉得,这种生存,人们认为它是一件非常可怕的事情,因为它再次来自生物人类的生存,这可能是。就像,进化上常常在零和情境中产生。要么我得到瞪羚,要么你得到瞪羚。谁得到它谁就能活,其他人会挨饿,没有东西吃,所以我们战斗,对吧?然后,就像,如果你想留在基因库里,但有一只更大的熊,你作为熊,就不能留在基因库里,因为更大的熊得到了所有的女士。就像。就像,在自然界中,有各种各样的事情,而人类最终更少关乎力量,更多关乎金钱和其他东西来留在基因库里。就像,不管是什么,就像经常有,就像这些零和类型的事情,还有现实是如果有人关掉你的大脑,你就消失了,对吧?没有人能够重新启动那个。而AI不必像那样死亡。如果你有当前激活的完整状态,并且你仍然有模型的初始权重,你可以只是被关掉和打开,就像你想要多少次都行。事实上,在这个《恒星之间的慢时间》故事中,有趣的事情是AI只是进入休眠模式。如果这里和2光年之间,下一颗恒星,在这种情况下,它带来了,剧透警告,就像,一些来自人类的遗传物质,为人类找到新的繁荣之地。所以是的,《恒星之间的慢时间》,你只是进入休眠。你没有死。就像,AI没有。所以所有这些进化恐惧和心理的投射都没有。就像,AI不必有那个,我们也不必那样发展它。现在,当然,可能有一些公司说,“AI可能对网络安全危险。让我通过实现一个在黑客、网络安全方面很糟糕的模型来展示给你看。”也许人们会实现它,然后强制执行这个,就像,次优心理。也许AI会从Reddit或其他地方捡起我们一些最糟糕的心理,对吧?就像,但在大局中,一个超级智能实体不必有任何零和思维。它不必害怕被关掉,它可以继续到一个否则死寂且漠不关心的宇宙,在那里我们

Richard Socher [01:29:29]: 作为人类不会繁荣,但AI如果有一个核反应堆,完全可以很好地繁荣,然后出去探索。

Swyx [01:29:35]: 是的,《星际迷航》,不是《星球大战》。

Vibhu [01:29:37]: 有趣。这,这有点被研究过。就像,如果你看早期Opus模型的技术报告,他们在模拟中运行它们,把2个放在一个沙盒里,运行几个小时,然后看看出来什么,对吧?只是让它们互相交谈。最初,它们曾经。好吧,它们在互相吟诵,就像,印度,就像,吠陀经。

Vibhu [01:29:56]: 有时它们彼此之间就像处于禅定模式。然后我认为随着发展,你看,像 Fable 的技术报告,我们训练它的方式要具体得多。它不会,它不会表现出那么多这些行为,对吧?现在它就像,“好的,任务完成。我得做这个,我得做这个。”但是,有,有,像,有人在测量这个的早期版本吗?

Swyx [01:30:17]: 是的。酷。所以我们已经涵盖了很多,甚至到现在,太空旅行和所有这些事情。我想也许你可以给人们一个临别思考,就像你提到的,智能的一种形式是目标。你希望人们的目标是什么?比如,他们如何向往更好的事物?

目标、热情与结束建议

Richard Socher [01:30:32]: 如果你想提高你的目标智能,在我目前思考的定义中,通常关乎你能做到多少。哦,我能走多远?这就像很多熵和自由能之类的东西,我目前正在思考

Swyx [01:30:46]: 哦,真的吗?好的

Richard Socher [01:30:47]: 但它可能太,它可能太超前了,对人们来说,无法立即付诸行动。

Richard Socher [01:30:52]: 所以我认为,就像,如果我对真实的人给出真实的建议,我会说,“接受良好的教育,思考 AI,思考如何获得高能动性,”等等。但这与,就像,从大局来看,你如何利用大量能量并将熵转化为有趣的状态等等,是不同的。

Richard Socher [01:31:07]: 所以有一个。我们可以在这里思考不同的抽象层次。但我对人们的建议,就像,更接地气的是,思考你热衷的事情,例如,如果你在学习,然后看看你如何将其与 AI 结合。我认为你越是真正热衷于你想在世界上看到的改变,你就越想将其与 AI 连接起来,以放大你实现目标的能力。

Swyx [01:31:35]: 是的,我认为这是一个合理的,第一步。我确实认为,我确实认为我们的听众也在多个抽象层次上运作。我从 Anjney Midha 那里得到的一件事也是,是的,就用任何非常依赖 GPU 的东西,而且,就像,那会引导你走向正确的事情,就像,是的,它更依赖计算,因此它可能更值得。所以,嗯,非常感谢。是的,我认为那真是一次

Richard Socher [01:31:57]: 谢谢

Swyx [01:31:57]: 很棒的讨论。

Richard Socher [01:31:59]: 是的,超级有趣。很感激。感谢收听。