本月早些时候,世界模型公司 Runway 推出了 GWM Worlds 2,这是一个研究预览版,能够“将高保真视频和音频生成转化为实时交互式模拟”。Runway 将其称为“自回归扩散”模型;其中自回归描述了它如何随时间生成内容。
其中一个新功能尤其引起了我们的注意:WorldPrompt,一种提议的输入格式,用于指定生成的世界及其中的动作。它允许你固定模拟环境的某些方面——包括第一帧——然后创建一系列带时间戳的事件。这些事件或动作甚至可以实时提示。
为了理解 WorldPrompt 的意义,我们采访了 Runway 的 CTO Kamil Sindi,以及其生成视频和多模态 AI 的首席研究科学家 Robin Kahlow。我们还获得了 Runway 联合创始人兼联合 CEO Anastasis Germanidis 的独家评论,这些评论来自 swyx 和 Vibhu 对他进行的一档播客节目。
谁在构建实时交互式世界模型?
首先,提供一些关于能够实时生成交互式视频和音频的世界模型的背景信息。
据报道,Runway 的估值为 53 亿美元,这是基于其最近在 2 月份进行的 3.15 亿美元融资。其首个发布版本 GWM Worlds 于去年 12 月推出。
除了 Runway,该领域还有其他几个值得注意的项目:Google DeepMind 的 Genie 3(同样以 720p 和 24 fps 生成)、Odyssey-2 Pro 以及 World Labs 的 RTFM(实时帧模型)。我们在下表中总结了它们的差异:
鉴于实时视频和音频生成的复杂性和巨大的延迟需求(我们将在下文深入探讨),上述所有项目都有局限性。例如,Google 指出 Genie 3“目前可以支持几分钟的连续交互,而不是持续数小时。”
但正如我们对 Runway 的采访所表明的,真正的进展正在发生。
WorldPrompt 的核心思想
WorldPrompt 是 GWM Worlds 2 中的一个新功能,有助于将 Runway 与其竞争对手区分开来。你可以把它看作角色、摄像机和环境的控制层。正如 Kahlow 所说,这是一种“控制世界中所有不同主体”的方式——类似于电脑游戏。
“比如,如果某个地方有一个 NPC [非玩家角色],NPC 可能会走到你面前说些什么。所以你可以用这种模型实现同样的事情,你可以对场景中的一切进行非常详细的控制。”
顾名思义,WorldPrompt 是一种提示机制——不是编程语言。因此,与 Minecraft 或 Roblox 等虚拟世界游戏不同,GWM Worlds 2 不提供脚本功能或控制状态的能力。但正如 Sindi 指出的,这也有其强大之处。
“你可以按需创建可提示的世界,视频和音频同步,跨越所有这些不同的领域和环境。这不是遥远的未来假设,”他说。
但提示世界模型也有局限性。我们询问了模型在遵循指令方面的可靠性,例如创建重力法则或角色的某种能力?
“是的,所以这是一个研究预览版,”Kahlow 回答说。“所以它当然不完美,仍然存在缺陷。这真的取决于动作的难度。我想说移动相当可靠。”
Sindi 补充说,更多的训练加上数据和模型的扩展正在带来“更好的遵循”。
视频模型如何成为实时运行时
尽管 GWM Worlds 2 目前存在局限——尤其是与 Minecraft 或 Roblox 这类预先设计且可脚本化的世界相比——但像 Runway 这样的世界模型的真正前景在于,它们最终将催生完全自生成、实时的游戏和体验。正如 Kahlow 提醒我们的,这是一个极其困难的工程问题。
“有两个挑战。一是让模型不要一次性生成整个片段。相反,你希望它在你看的时候逐帧生成。另一个挑战是让生成速度足够快,以便实时播放。”
GWM Worlds 2 流程的高层视图
GWM Worlds 2 提供实时交互世界,以连续 720p 视频流传输,帧率为每秒 24 帧(fps),音频为 48,000 Hz。
Runway 实现这一点的第一步是将其基础音视频生成模型微调到新的 WorldPrompt 格式,使模型能够遵循该格式。然后对模型进行后训练,使其自回归生成。
“之后,我们通过蒸馏方法使其实现实时,”Kahlow 补充道。
联合首席执行官 Anastasis Germanidis 在我们与他的播客中提供了更多技术细节。他告诉我们,这个过程始于“双向扩散,基本上一次性生成整个视频,并[使其]自回归。”这允许模型“一次生成一帧或几帧。”
自回归因果扩散与传统视频模型对比;图片来自 Runway
Germanidis 描述了两种可能的蒸馏形式以实现实时:将较大模型蒸馏为较小模型,或减少其扩散步骤。作为一个一般示例,他说模型可能从大约 50 个去噪步骤减少到 4 个,会有一些质量损失,但结果可能相当。
实时生成的挑战
Germanidis 承认,在生成实时交互视频方面存在问题。
“自回归模型最大的挑战是误差累积,”他说。“你将生成的帧反馈给模型以生成下一帧,如果有任何小误差,它们会随时间累积。”
Sindi 告诉我们,处理内容的“无限生成”也存在挑战。
“围绕保留什么上下文、丢弃什么不重要内容,存在所有这些挑战。因此,我们必须考虑所有这些优化,以免耗尽 GPU 内存。”
另一个当前局限是长期记忆。“模型没有完美的记忆,”Kahlow 说。“这仍然是一个开放的研究问题。”
因果性与正确性
虽然性能是 Runway 目前的主要挑战,但其世界模型在用户采取不同行动时也必须产生合理的后果。
Germanidis 以模拟足球为例;他指出,在线视频训练数据中成功的进球比失败的射门尝试更多,因此视频模型可能更令人信服地渲染前者。
“如果我采取这个行动 versus 这个行动,你希望它生成同样逼真的结果,”他告诉我们。“我认为,这就是视频模型和世界模型之间的巨大差距:反事实生成的理念。”
Sindi 告诉我们,交互越复杂,评估就越困难。
“如果你有这种多提示、多角色、多场景的[环境],你如何真正理解什么是因果关系,什么不是?”
为了解决这个问题,Runway 有一些自动化的可验证测试。但由于 GWM Worlds 2 是一个研究预览版,Kahlow 指出,自己进行测试也是可取的——“尝试你的模型,看看哪些地方不行,这非常重要。”
不仅仅是游戏——还有智能体用例
游戏是 Runway 所构建内容的明显用例,但还有其他用例。Kahlow 提到了机器人技术——例如使用模拟环境来测试机器人的工作方式。
另一个更引人入胜的用例是使用它来大规模测试智能体。
“如果你有一个像 GWM Worlds 这样的合适模型,拥有数千个模拟环境的挑战性就小得多,”Kahlow 说。
但智能体如何知道世界中发生了什么变化——是否有它可以读取的结构化状态,还是它只是消费和理解生成的视频和音频?
“所以这里没有结构化状态,”Kahlow 回答说。“它只是观察你在现实生活中可能观察到的同样东西,只是[在这种情况下]来自摄像头。”
Sindi 指出,GWM Worlds 还可以用于“为智能体生成合成数据”。
最后,Germanidis 提出,有可能将这些世界模型与推理模型一起使用。
“你可能使用一些推理[来]规划场景,然后将其传递给实际生成像素的扩散头。”
00:05:17 Runway 的起源与对生成视频的押注
00:12:23 Stable Diffusion 的故事
00:18:44 Gen-2、可控性与周末黑客
00:23:02 从视频生成到世界模型
00:28:03 从世界学习,而不仅仅是语言
00:35:04 Sora、Runway 的生存危机与 Gen-3
00:39:39 为什么实时视频不可避免
00:43:06 界面世界模型:无代码软件
00:50:25 全神经操作系统
00:55:11 机器人技术的世界模型
01:02:32 机器人策略与世界行动模型
01:07:47 清醒梦测试
01:11:41 视频智能体与全能模型
01:23:12 艺术家、AI 与创意工作流
01:27:14 物理 AI 与世界模型的未来
文字记录
介绍:Runway、创意 AI 与早期论点
Swyx [00:00:00]:好的,我们在这里与来自 Runway 的 Anastassios 一起,我和 Vibhu 在演播室。欢迎。
Anastasis [00:00:08]:很高兴来到这里。
Swyx [00:00:09]:祝贺你在 Runway 取得的所有成功和进展。你们正在世界各地开设办事处。你刚开始时预见到这一点了吗?
Anastasis [00:00:16]:不完全是。我认为即使在我们开始时,我们也有这个想法,这更多是一个时间问题,而不是是否会发生的问题,我们看到了 2016 年、2017 年的早期生成模型,并只是推断,假设分辨率、质量随时间可预测地提高。会有那么一个点,大多数内容将被生成,这也许是 Runway 的初始论点,即由于这些生成模型,我们将需要重新思考创意工具是如何制作的。随着我们构建生成模型背后的研究,后来变得清楚的是,它们的有用性远远超出了这一点。
Anastasis 的背景:艺术、模拟与机器学习
Swyx [00:00:57]:现在有了那些真实世界的东西,还有我们稍后会聊到的世界模型,这一点就更明显了。我只是有点好奇,你是如何从 Zocdoc 和计算机视觉这样的背景,走到 Runway 的。带我们回到你和 Chris,以及创始团队里其他人早期的那几次对话吧。
Anastasis [00:01:14]:我一直在这两个世界之间穿梭。一边是我有自己的艺术实践。我想有很长一段时间,我都在做很多互动艺术。而另一边,我在创业公司工作,在不同的公司做过机器学习工程师、后端工程师。我一直对编码和计算感兴趣,尤其对模拟感兴趣,也把它带回到了我早期的艺术创作中。与此同时,我感兴趣的是
Swyx [00:01:43]:个人网站上有几个,对吧?
Anastasis [00:01:44]:是的。
Swyx [00:01:45]:有没有哪个是我们应该翻出来的?以防有什么东西,就像。我就是喜欢追忆往事。
Anastasis [00:01:50]:好的。
Swyx [00:01:50]:好,这是什么?
Anastasis [00:01:51]:这是我在 2015 年做的一个项目,我做了这个软件,它会在画廊空间里给人们提供语音指令。所以它会协调人与人之间的互动。它会先给你一个身份,比如你是一名建筑师,你 30 岁,你喜欢运动。然后它会把你和另一个人配对,你们就有了这种完全生成的互动。当时语言模型还没那么成熟,所以它是模板和一些马尔可夫链生成文本的混合体,它会完全模拟画廊空间里每个人之间的这些闲聊对话。所以我一方面一直对生成模型,以及当时正在进行的早期机器学习工作非常着迷。但与此同时,还有另一条独立的线索,就是模拟,以及它意味着什么。比如,通过创建这些关于人类互动和行为的非常简单的模型,我们能了解到关于人类的什么?
早期生成艺术:pix2pix、GAN 与恐怖谷
Vibhu [00:02:56]:那些提示词,或者那个 30 岁的设定之类的,是你生成的吗?是你生成的吗?你是怎么,你是怎么
Anastasis [00:03:03]:没错。所以程序会直接生成那些,从。是的,很多都是疯狂填词(Mad Libs)风格的,就是
Vibhu [00:03:10]:是的
Anastasis [00:03:10]:你有不同职业的列表,不同,Vibhu [00:03:14]:爱好的
Anastasis [00:03:15]:性格类型的列表,不同年龄的列表,诸如此类。然后它就会把这些东西组合在一起。然后也许我们下一个要讲的项目是《恐怖谷》(Uncanny Valley),《恐怖之路》(Uncanny Road),那是
Swyx [00:03:27]:GAN
Anastasis [00:03:27]:我们最早与我的两位联合创始人之一 Chris 一起构建的项目之一。这个项目采用了 pix2pixHD,这是 NVIDIA 在 2016 年或 2017 年发布的早期图像到图像模型之一。这个模型会接收场景的语义图,然后生成逼真的、我们姑且称之为输出。非常早期的阶段,所以输出保真度不是很高,但我认为它是第一个能够生成 1K 分辨率的图像生成模型。而且它完全是在自动驾驶数据集上训练的。因此它支持的语义类别仅限于你在路上会遇到的东西。所以会是行人、交通标志,Vibhu [00:04:16]:红绿灯
Anastasis [00:04:17]:自行车、红绿灯。所以这是我们最早的迹象之一,我们构建了这个,人们制作了所有这些,比如,非常超现实的图像,是的,一百万加一百万行人或一百万交通标志,或者,像,巨大的人类。这表明你可以拿一个在非常无聊的数据集上训练的模型,本质上,就像,在路上不会发生那么多有趣的事情,然后你可以重新利用它,走向非常分布外,做出在艺术上引人注目的东西。这就是 Runway 论点的总结,某种程度上,你可以拿同样的生成模型,如果你从另一个方向看它们,如果你围绕它们构建有趣的工具,并把它们交给艺术家,他们会做出你意想不到的事情。
Vibhu [00:05:02]:非常酷。我喜欢它的用户体验。你只是得到一个空白画布,尝试任何东西,做任何事情。然后另一个,就像,你看到每个人都戴着有线耳机?就像,那是一个迹象,它非常
Anastasis [00:05:16]:苹果
Vibhu [00:05:17]:是的
Anastasis [00:05:17]:苹果,你的版本。
Vibhu [00:05:17]:原始广告。是的。带我们到今天。你在 Runway 已经做了七年。我们是怎么走到这一步的?就像,我们如何从驾驶模拟器数据走到这一切?你覆盖了整个生成媒体栈?
从创意工具到研究实验室
Anastasis [00:05:33]:有趣的是,我们几乎回到了,我们,我们完整循环了。我们,我们现在正在将我们的模型和超越创意工具应用到现实世界场景中。但这是一个,这是一个漫长的旅程。很早我们就意识到 Runway 的第一个版本是一种轻松使用当时所有开源模型的方式,比如 pix2pix 等。并把它们交给艺术家。最初的想法是,如果你不是机器学习工程师,那些模型太难使用了。就像,当你把它们交给艺术家时会发生什么?很快,我们意识到我们需要在 Runway 内部建立一个研究组织,这大概发生在第一年。而且,那里的很多任务授权是。当时的图像生成模型,当时的视频生成模型,或者当时几乎没有视频生成,但它们还没有达到可以产品化并带入创意工作流程工具的程度。所以我们需要推动研究的前沿。所以也许 Runway 的前四年,研究几乎是在背景中进行的,直到 2022 年有一个时刻,随着潜在扩散,随着 DALL-E 2,那里有一个阶跃函数变化,你们可能记得那个时候。
Swyx [00:06:49]: 我进入这个领域是因为潜在扩散和Stable Diffusion。
Anastasis [00:06:54]: 是的。
Swyx [00:06:54]: 因为我当时想,“哇,这不仅可行,而且可以在消费级硬件上实现。”
Anastasis [00:07:01]: 没错,是的。
Vibhu [00:07:01]: 我认为变化也是巨大的。比如,我学过pix2pix。那是在机器学习入门时,TensorFlow、Jupyter、Google Colab笔记本就像这样,然后随着扩散模型等技术的出现,突然出现了阶跃函数式的变化。自那以后还有其他类似的变化吗?比如,早期扩散模型发展到今天,有明确的例子。关键技术研究还有其他变化吗?
绿幕、转描和早期Runway
Anastasis [00:07:26]: 在2018年我们开始和2022年之间?
Vibhu [00:07:29]: 是的。
Anastasis [00:07:29]: 我们在Runway早期做的工作之一是解决分割问题,图像和视频分割。这是一个非常重要的问题,因为大多数视觉特效本质上涉及分离
Swyx [00:07:42]: 转描
Anastasis [00:07:42]: 主体。是的,转描。极其手工的过程。没人喜欢做这个。所以Runway早期很多工作是构建这个工具。它被称为绿幕,在很长一段时间里,这是人们使用Runway的主要用途。它最终被用于《瞬息全宇宙》和其他一些高知名度电影和系列中。但本质上,Runway在很长一段时间内是一个后期制作工具,直到潜在扩散和Gen-1、Gen-2出现。
Swyx [00:08:12]: 酷。让我们,让我们越过那个时刻。你已经走了很长的路。然后你开始发布自己的模型。也许也描述一下那段旅程。
扩展视频模型和对1000个A100的赌注
Anastasis [00:08:20]: 是的,所以我们来到另一个点,是的,在2022年中期,当时很明显我们在相当小的计算规模上进行研究,并且很明显缩放定律会像应用于语言生成一样应用于图像和视频生成。所以我们做了一个大赌注,我认为当时,我们签署了建立1000个A100集群的协议,当时我们是B轮创业公司。那几乎是一个,可能有点不理性的决定,但我们真的相信,如果我们大规模训练视频模型,我们最终会得到一个很棒的模型。当时,目标或者我们在2022年秋季设定了目标,即视频的潜在扩散、Stable Diffusion时刻是什么样子?当时最好的模型叫做CogVideo。它是早期的视频模型之一。分辨率非常256乘256,质量非常不高。所以我们决定建立这个集群,我们将投资于构建我们自己的视频模型。在训练Gen-1时,很明显很难完全达到。我们想构建文本到视频,但很明显,一个更容易的起点是从视频到视频开始。因为当你有一个更强的条件时,重新风格化现有视频比从头生成视频更容易。所以我们首先在2023年1月发布了Gen-1。是的。
Vibhu [00:10:04]: 老实说,这只是一个有趣的视觉播客。比如,如果我们能看到2023年2月,当时的状态是什么?
Gen-1:视频到视频和深度条件
Anastasis [00:10:10]: 这很有意思,因为当你看到那些结果时,你会觉得这太不可思议了,这几乎就像是图像生成或视频生成的问题已经解决了。但几年后回头看,你会发现,对于这些模型,你很快就会习惯那些结果。但在我们刚开始看到那些结果的时候,感觉相当不可思议,还有你能达到的质量水平。所以,Gen-1 是一个深度条件视频模型,所以它会将……它会接收一个输入视频,它会预测……它会首先将其转换为深度图,然后我们用潜在扩散模型生成像素。
Swyx [00:11:01]: 是的,非常有效。
Vibhu [00:11:02]: 是的。我没意识到那篇博客文章会这么分散注意力。抱歉。
Anastasis [00:11:05]: 是的,但我在 Gen-1 上最喜欢的例子之一是,如果你调到模式三或模式二,有一个故事板用例,人们会制作
Vibhu [00:11:18]: 哦
Anastasis [00:11:18]: 会
Vibhu [00:11:20]: 你可以摆弄
Anastasis [00:11:20]: 用书或盒子搭建一个城市,然后用手机拍摄视频,然后将其转换为照片般逼真的输出。这些模型开始被用于故事板以及真正……然后如果你调到模式四,比如,将无纹理的 3D 场景转换为照片般逼真的输出。所以我们早期看到了很多用例,熟悉的人,强大的 VFX 编辑会直接用 Blender 渲染,然后用 Gen-1 转换,或者在 Unity 中创建场景,然后捕获其视频,然后转换、重新风格化。所以我仍然认为视频到视频很强大。我想我们最近也有一个视频到视频模型,我最喜欢的使用这些模型的方式之一基本上是利用它们,将真实视频作为初始灵感,然后转换为不同的风格或不同的输出。
Stable Diffusion、Stability AI 和开源
Swyx [00:12:23]: 但我想我们会进入 Runway 的其余部分,并让大家了解今天的最新情况。我确实想涵盖,让我们称之为 Stable Diffusion 争议,或者 Stability AI 发生了什么,随便吧。我认为故事有两面。我认为其中一部分是正常的事情,比如人们加入和离开公司,但现在的回顾是什么,既然已经过去几年了?
Anastasis [00:12:49]: 是的,这是一个非常长的故事。我想它会
Swyx [00:12:53]: 我记得你写了一篇很长的文章。
Anastasis [00:12:56]: 我们可能会花整整一个小时来更详细地讨论。但本质上,有潜在扩散论文,我想那是在 2021 年底。然后 Patrick Esser,他是潜在扩散背后的研究人员之一,当时他在 Runway 工作,他与 Robin Rumbach 和其他几个人在 CompVis 合作构建了潜在扩散,那是一个实验室
Swyx [00:13:26]: 像一个研究小组,是的。
Anastasis [00:13:27]: 而在发布了早期的潜在扩散模型之后,他们,基本上他们的目标是继续研究该模型的各个版本,扩大其规模,纳入新数据,纳入新任务。而 Stable Diffusion 是同一个模型,但用更多的算力进行训练,然后还加上了一些额外的技巧,比如无分类器引导的论文在某个时候出现了,我想是在 2022 年初。而那
Swyx [00:13:52]: 那算是一个很大的提示词改进。
Anastasis [00:13:55]: 是的。
Swyx [00:13:55]:?
Anastasis [00:13:56]: 那改善了结果。它是在更好的数据上训练的,比如 LAION 的美学子集,但它实际上还是同样的底层架构。然后有了那次大规模训练运行,那是在 Stability 的集群上进行的。Stability 资助了那次运行。回顾那段经历,我认为构建和训练那个模型的工作已经完成了。那是一个研究项目。它是作为潜在扩散工作的延续的一部分来做的。然后,我认为那个模型变得非常成功,而且,我认为有那些。我认为由于它的成功,其他公司试图为它找到商业化路径。但对我们来说,非常重要的是我们努力确保我们。它本来就是一个开源研究项目,所以我们决定应该继续发布它的版本,因为那正是 Stable Diffusion 最初的目标,而这导致了 Stable Diffusion 1.5 的发布。那里可能有那么一天,有一点沟通不畅,但最终在几个小时内就很快解决了。所以是的,有过
Swyx [00:15:12]: 好吧
Anastasis [00:15:12]: 不太好
Swyx [00:15:13]: 我只是想。你必须
Anastasis [00:15:15]: 是的。
Swyx [00:15:15]: 你是那段历程中的主要参与者之一,所以能听到来自源头的说法,比如到底发生了什么,这很好。是的。
Anastasis [00:15:22]: 是的。我认为这一切,这一切现在都过去了
Swyx [00:15:26]: 是的
Anastasis [00:15:26]: 我会说。而且,就像,两家公司,Stability 走了自己的路,Runway 走了自己的路。
Swyx [00:15:32]: 是的。仍然有。詹姆斯·卡梅隆正在支持新的 Stability,不管他们在和好莱坞制片厂做什么。
Anastasis [00:15:38]: 对。
Swyx [00:15:38]: 我不知道他们在做什么。我认为有一件事让我印象深刻,而且我很乐意继续往下聊,那就是回到那个时候,比如说 2021 年、2022 年,有一个你参与其中的社区正在研究所有这些事情,对吧?而且,就像我和当时活跃的每个人交谈时一样,似乎相当明显的是,总会有人完成那次英雄式的训练运行,从而产出 Stable Diffusion。所以,就像,我想问题是,就像,你当时有,你做了投资。你有先见之明。这样说是否准确,就像,那反映了当时人们的想法?还是说当时仍然非常像是,“好吧,我们会把它当作后期制作工具之类的。我不知道。”?就像,我们当时处在那种情绪中的什么位置,也许你可以回想一下,当时那个社区是什么样的?
早期创意 AI 社区
Anastasis [00:16:28]: 我怀念并深情地回想那些早年时光,大约从2018年到2022年,因为正如你所说,那是一个非常小的社区,人们非常确信这将会是一件大事。当时,任何人……因为圈子如此之小,每个加入这个圈子并与之一起做项目的人都会立刻走红。所以就像
Swyx [00:16:55]: 而你并不知道他们是谁,对吧?他们只是GitHub或Hugging Face上的某个名字。
Anastasis [00:16:59]: 没错,是的。所以我记得创意AI最早的重大病毒式传播时刻之一,是神经风格迁移论文
Swyx [00:17:09]: 嗯
Anastasis [00:17:09]: 那个
Swyx [00:17:10]: 是“做梦”那个吗?
Anastasis [00:17:11]: 我想它叫神经风格迁移。
Swyx [00:17:14]: 好的。
Anastasis [00:17:14]: 还有Deep Dream,小狗切片
Swyx [00:17:16]: 是的
Anastasis [00:17:16]: 那也非常酷。但是,是的,有一个项目,Jim Kogan,他是Runway的早期顾问之一,也是那些
Swyx [00:17:25]: 营销人员
Anastasis [00:17:26]: 大型创意AI人士,他实际上只是展示了一段自己乘坐纽约地铁、经过威廉斯堡大桥的视频,然后用我认为是梵高或某位画家的风格进行了风格化。那在当时,就像,太酷了,它病毒式传播,对人们来说完全是一个启示,你可以用生成模型做到这一点。而那只是,不到……大概是10年前。所以,就像,这表明了事情发展得有多快。
Vibhu [00:18:02]: 这相当疯狂。就像,从那时起,你在技术栈的每个层面都有人。你有开发者、创意人员、艺术家、爱好者。你有每个人都在使用它。对于那些早期尝试的人,他们会记得使用常规扩散模型有多难,对吧?就像现在,你可以使用你最喜欢的ChatGPT图像生成或其他什么,给一句话,得到漂亮的输出。但扩散模型就像,整个超高清、4K、高分辨率。就像,提示这些东西是非常不同的。你在工具方面学到的任何东西,比如从你们现在提供的产品中,所以像创意人员、开发者,你真的把研究带给了每个人使用。有什么有趣的事情可以分享吗?
从Gen-2到可控视频生成
Anastasis [00:18:44]: 我们必须为视频扩散模型构建整个模型服务基础设施。当时没有其他现成的东西,因为我们的 Gen-2 是市场上第一个文本到视频模型,我想。所以随着时间的推移,我们学到了很多东西。我认为最大的一个教训是,我们很早就清楚地认识到,文本到视频不会是最终答案。就像,人们想要比这多得多的控制,所以我们很快就在这些模型之上投资于控制构建。你如何使用相机轨迹作为控制?你如何使用初始输入帧作为控制?所以这对我们来说是一个非常早期的学习。对于文本到视频,Gen-2 在视频模型质量上是一个惊人的阶跃式改进,但它更多地被用于探索性用途,因为没有什么可以 grounding 它。没有你可以引入的参考。没有。你无法真正控制相机运动。你无法控制物体运动。所以第一年,也就是 2023 年,真的都是关于我们可以用哪些有趣的方式来条件化这些模型?而且很多只是在基础模型之上进行后训练轮次,以弄清楚人们想要如何控制它们?所以就有了快速连续的,我们称之为 Motion Brush,你可以画箭头并指定场景中物体应该移动到哪里。
Vibhu [00:20:09]: 那太酷了。
Anastasis [00:20:09]: 还有相机控制,你可以直接描述你希望相机在场景中如何移动。而且因为我们在 Runway 的大部分历史中都与电影制作人合作,我们立即得到了这些反馈,并决定这值得投资。所以控制能力成为了一个重要的主题,我认为,在我们构建这些模型的早期就开始了。一件我还没有太多谈论的有趣事情是 Gen-2 是如何从 Gen-1 诞生的。所以这有点奇怪,因为我们在 Gen-1 发布两个月后就宣布了 Gen-2,而且
Gen-2 如何从周末黑客项目诞生
Vibhu [00:20:43]: 我们正在加速。
Anastasis [00:20:44]: 那是在 Gen-1 甚至普遍可用之前。但 Gen-1 是一个深度到视频模型,所以它会取一个深度图并将其转换为 RGB。我们无法让文本或图像到视频直接工作,这就是为什么我们从深度到视频开始。但是,我们讨论过,好吧,我们需要在接下来的六个月里投资于文本到视频,也许增加计算规模或模型规模,比如训练一个更大的模型。我有一个周末项目的想法,那就是,如果我取一个从文本输入开始并转换为深度图的模型,然后使用 Gen-1 将深度图转换为 RGB 会怎样?
Vibhu [00:21:29]: 它可能会工作。
Anastasis [00:21:30]: 所以 Gen-2 就是这样。
Vibhu [00:21:32]: 哦。黑客马拉松管道。
Swyx [00:21:35]: 周末黑客马拉松管道。
Anastasis [00:21:36]: 是的。
Vibhu [00:21:37]: 但它看起来不错。
Anastasis [00:21:38]:而且效果相当不错。如果你知道它有这样的两阶段流水线,在某些情况下你能看出视频的结构看起来有点不对劲,因为你必须先生成深度图,然后才能生成输出视频。但它确实奏效了,并且让我们能够很快地把这个功能带给我们的用户。但现在有趣的是,人们又回过头来采用这种近乎两阶段的方法。比如,如果你看看几个月前推出的 Reve 文生图模型,它有一个规划器模型,会在把内容输入扩散 Transformer 之前先生成边界框。
Swyx [00:22:19]:是的,Ideogram 也是同一天。
Anastasis [00:22:22]:对。
Swyx [00:22:22]:我记得当时觉得很奇怪,两家在同一天推出了完全相同的创新。
Anastasis [00:22:26]:我觉得这是个很小的圈子。
Swyx [00:22:28]:我就想,这完全是巧合,对吧?
Anastasis [00:22:32]:人们会交流。所以是的,这种方法确实有它的道理。而且现在,每一个在生产环境中使用的视频生成模型,底层都使用了一套复杂的提示词补全流水线。我觉得这已经不是什么秘密了。
Swyx [00:22:48]:人类太不擅长写提示词了。
提示词重写、镜头控制,以及世界模型的种子
Vibhu [00:22:51]:我觉得这是普遍现象。
Anastasis [00:22:51]:是的。
Vibhu [00:22:52]:但没错,我觉得就连最初的 Sora 那篇博客文章都告诉过你,在你输入之后发生的事情就是重写你的提示词。它会对你想要的内容做出更详细的描述。
Anastasis [00:23:02]:完全正确。而且在此之前还有 DALL-E 3 的论文,那是第一次公开描述合成字幕和非常详细的字幕效果非常好这一事实。然后 Sora 在此基础上进一步发展。是的,那是 2023 年。我们为 Gen-2 发布了一系列更新,比如镜头控制、运动画笔。镜头控制有一些非常有趣的地方,因为那是你第一次感觉到,你不是在创建视频,你是在创建一段短视频,你是在一个世界里穿行。我认为镜头控制可能是我们围绕世界模型的一些想法的种子,真正打开了那个研究方向。我们意识到,正是这个时代以及 Gen-1 和 Gen-2 这一系列模型,真正向我们自己证明了,是的,这就是
Swyx [00:23:56]:酷。
Anastasis [00:23:57]: 所以这不是最初的摄像机控制。这是在 Gen-3 之上更新的摄像机控制。但没错,我认为它让这些模型对电影制作人来说变得可用了,我会这么说。所以摄像机控制非常受欢迎。然后我们意识到,看待这些模型有两种方式:一种是你只是内容创作机器,另一种是你。当你预测视频时,为了预测得好,你需要以越来越强的能力模拟世界。如果缩放定律适用于视频,就像它们适用于语言模型一样,那么随着我们增加投入这些模型的计算量,它们将能够越来越准确和可预测地模拟物理、模拟人类动作和动态。这就是我们关于世界模型工作的论点,我们成立了这个研究小组,专注于世界模型,以及如何将我们正在构建的视频生成模型转变为更广泛的东西,不仅在内容创作之外也有用。
Swyx [00:25:04]: 那大概是什么时候?
Anastasis [00:25:06]: 是的,那是在
Swyx [00:25:06]: 哦
Anastasis [00:25:07]: 2023 年底。
Vibhu [00:25:08]: 有趣。就像,我认为,很多人一直在说,很多视频生成模型公司这些天都转向了世界模型,但像 2023 年,你就在发布了。一个
世界模型:从视频生成到模拟
Swyx [00:25:21]: 这是否是转向还有待商榷。
Vibhu [00:25:23]: 是的。
Swyx [00:25:23]: 就像,可以说
Vibhu [00:25:24]: 是的
Swyx [00:25:24]: 那本来就是你一直必须做的,对吧?
Anastasis [00:25:26]: 在某种程度上是一种扩展
Vibhu [00:25:28]: 是的
Anastasis [00:25:28]: 应用的扩展
Vibhu [00:25:29]: 是的
Anastasis [00:25:29]: 随着模型变得更强大。
Vibhu [00:25:31]: 早期的迹象,看起来你们最初拥有的模型,人们会说它非常不遵循苦涩教训,对吧?你在添加、重写提示,你有所有这些一次性的东西,但那只是当时的技术状态,而未来正如你所说,你可以扩展它,我们可以扩展到世界模型。
Anastasis [00:25:50]: 是的。所以它就变成了。如果你看看 Gen-2 的输出
Vibhu [00:25:56]: 是的
Anastasis [00:25:56]: 并非如此。我认为人们并没有明显意识到这会扩展成为世界的通用模拟器。比如,当时的移动非常有限,保真度或分辨率很低,人体解剖上有明显的错误,有各种各样的限制。但当时只是,这个想法就是那只是 GPT-2,而 GPT-2 几乎无法生成连贯的句子。类似地,Gen-2 几乎无法创建连贯的视频,但如果你扩大规模,你就会。没有理由它不能以某种方式工作。我认为那就是。那一直是 Runway 的心态,就像这种外推,比如,即使我们在 2018 年开始时,你看看当时的结果,你需要更多地看趋势,比如我们在 2018 年的位置与第一个 GAN 出现时的位置相比,那是在 2014 年或 2015 年。你从 32x32 的人脸图像开始,然后到 2018 年,你可以生成 1K 分辨率的街道图像。世界模型也是如此,非常早期的迹象表明有更大的东西。
Swyx [00:27:08]: 是的。我想说,就像它正在扩散进入焦点。就像,如果你看看我们年复一年的可见输出,它本身看起来就像一个扩散过程。
Anastasis [00:27:17]: 是的。
Vibhu [00:27:17]: 特别是观看早期的,比如旧的博客文章,你真的能看到那种不连贯,细节。
Anastasis [00:27:24]: 是的。就像人类文明从随机噪声开始然后
Vibhu [00:27:27]: 是的
Anastasis [00:27:27]: 去噪成
Swyx [00:27:28]: 是的。就运行一百年。
Anastasis [00:27:30]: 文明。
Swyx [00:27:30]: 是的。
Vibhu [00:27:31]: 这就是你如何走上正轨,你仍然在加噪,对吧?
Swyx [00:27:34]: 是的。我喜欢你们在六月宣布时表达的方式,那就是,哦,你们有一个视频文章。“人类思维不再是 AI 的中心。我们的世界才是。”对吧?那就是,让我们称之为过去五年的基于 LLM 的 AI 非常像是在试图模仿人类偏好和人类言语。但现在那,就像,大部分解决了。我认为那是,就像你文章的一些背景,你也是在那时写的。现在就像焦点在于准确建模世界。
视频的缩放定律以及为什么预测像素很重要
Anastasis [00:28:03]:没错,是的。所以我们看待这个问题的方式是,DeepMind 最初的那个使命宣言,即解决智能,然后用它来解决其他所有问题。但我认为从其他所有问题出发可能也很有价值,就像从……世界上有太多的复杂性和细节,以至于……很难直接从人类对世界的描述中学习。就像,我们假设语言模型从人类所写的关于世界的一切中学习,就像我们自己在二十年代的理解一样。有太多我们不知道的东西,太多现有文本没有捕捉到的东西,关于世界的低层动态,比如我们没有详细描述。如果我让你描述,比如,你怎么系鞋带,用语言描述是非常困难的,但演示起来却非常明显。所以我认为一直有……而且有更多的 X 悖论,就像我们不断低估人类潜意识中做的那些事情所涉及的所有复杂性,我们甚至不一定总有词语来描述它们。所以在我看来,模拟世界、模拟物理、模拟世界的动态一直被低估了,相比之下,我们过于强调那些容易谈论的事情。但世界上有所有这些复杂性和丰富性,如果我们只是尝试直接在那些观察数据上训练,而不是在人们如何描述世界上训练,我们就会学到一些否则不会知道的新东西。
Swyx [00:29:54]:你认为当前的架构范式没问题?你不需要像 JEPA 那样的另一层,就像另一位著名的纽约 AI 领袖会说的那样?
Anastasis [00:30:05]:我们是一个非常务实的研究实验室。如果我们有证据表明一种方法比我们采用的方法更好,我们会毫不犹豫地采用它。我们只是没有看到任何迹象表明视频预测本身无法扩展。即使你现在看,不仅是我们的工作,还有别人的工作,你在机器人技术中看到一些最有前途的工作,从视频预测模型开始,然后例如将它们适应于动作模型。所以很少有证据表明你需要别的东西,你的时间最好花在新颖的架构改变上,而不是改进数据和改进,以及扩展当前方法。所以,我们没有任何迹象表明……那个,有一个反驳论点,我想几天前 Yann LeCun 发了一条推文,说理解世界的动态与生成可爱的视频非常不同。
Swyx [00:31:05]:而你的回答是不,它们是一回事。
Anastasis [00:31:07]:是的,它们是一回事。
Swyx [00:31:08]:我的猫视频和理解物理是一回事。
Anastasis [00:31:11]:对,因为如果你想生成。视频模型可以作弊,比如,你可以给出一系列连续的场景镜头,而不需要模拟困难的物理。有各种不同的方式可以掩盖模型的缺陷,重要的是不要被当前视频模型的表现所迷惑。很容易挑选一些例子,然后认为视频模型比实际更先进。所以我们需要做更多的工作来改进这些模型。但在我看来,这和语言非常相似,就像我们……从勉强连贯的句子,到能与人类对话的东西,再到能自主运行一天、创建整个代码库的东西。主要区别在于,沿途有一些架构改进,但主要因素是规模。所以视频也是同样的赌注,我们没有迹象表明这正在饱和。比如,我们有用来衡量这些模型物理性能的基准,我们看到随着模型规模的扩大,这些基准可预测地改善。所以有。如果你想谷歌一下,Physics-IQ,就是其中一个基准,它衡量模型在固体力学、流体动力学或光学方面的表现如何。
Vibhu [00:32:32]:我很好奇你是否看到了任何涌现,任何关于这方面的缩放定律。
Swyx [00:32:37]:是的,他说有一个缩放定律,对吧?
Anastasis [00:32:39]:没错。
Vibhu [00:32:40]:是的,Anastasis [00:32:40]:所以那些模型,那些基准的工作方式是,你……研究人员去捕捉了一些代表不同物理现象的视频,然后你可以取第一帧,然后通过图像到视频模型,然后生成一个展示接下来应该发生什么的展开。所以你有,一个悬挂在天花板上的球,然后你用它作为输入,然后你模型预测球应该如何落到地上。这衡量了。我们有对物理的直观理解。我知道,你可以想象如果我 dropping 这个瓶子会发生什么。所以它衡量的是那些模型同样的直观物理理解,我们已经在不同的模型规模上测量了这一点,我们看到,以及计算规模,我们看到 Physics IQ 的分数可预测地提高。还有其他技巧和技术可以进一步提高分数,但即使仅靠规模也有助于模型学习更好的物理。
Swyx [00:33:40]:我对 Yann LeCun 的主要同情是,柏拉图的洞穴寓言,对吧?就像,你,你,就像,在一个事物的输出上学习,而不是事物的内部过程,而且非常嘈杂。而且,如果你能观察事物的内部就好了。观察人类思维的内部很难,但你可以很好地观察,或者至少我们有一整个科学和物理分支,我们忽略了如何建模物理、运动、重力和其他相互作用。而我们只是,就像,扔掉所有这些,只是说只是扩展数据,这非常符合无监督学习的教训,但感觉不对。这是主要想法。
Anastasis [00:34:21]:我认为机器学习的历史,总的来说,感觉不对。
Swyx [00:34:25]:是的。这是一个苦涩的教训,对吧?是的。这是,这是,这是对此的简单答案。
Vibhu [00:34:29]: 我猜,你能扩展多少?所以,就像,即使在,比如说,视频生成方面,就像,有视频理解的一面。视频生成,我们还会不会有这样的工具,就像,我想生成两个小时、二十个小时?有一种基础设施的方式可以批量处理并拼接在一起,但是,就像,我们只是继续扩展吗?我们只是继续大规模地保持长生成的一致性,所有这些?而且,就像,把它和我们现在的处境联系起来,从我们看 Runway 2 到 4.5
Gen-3、Sora 和 Runway 的扩展拐点
Anastasis [00:34:58]: 是的。
Vibhu [00:34:58]: 就像,从技术上讲,到今天我们已经取得了哪些进步,然后你认为事情还会往哪里发展?
Anastasis [00:35:04]: 所以答案的一部分肯定是规模。那就是。我们在 Gen-3 上大规模地学到了这个教训。所以 Gen-3 是我们第二年发布的模型,就像在 2024 年。那是在 Sora 发布几个月后。所以是的,它的诞生也有一个有趣的故事。Gen-3 对我们来说,是第一次我们真正需要构建。我们不得不在几个月内学会语言模型世界在两三年内学到的所有教训。Sora 最大的变化之一是使用扩散变换器而不是卷积网络。所以很多早期的潜在扩散模型,扩散模型部分都是卷积网络。扩散变换器论文在 2023 年的某个时候出现,它展示了图像扩散变换器的缩放定律。那时我们意识到,我们需要投资于模型并行的基础设施,以真正将训练扩展到超过几十亿参数的模型。我们花了大概 2023 年秋天的大部分时间构建分布式训练的基础设施。我们在尝试扩展图像和视频扩散变换器时有很多错误的开始和很多失败。那时,2024 年 2 月,Sora 出来了,结果
Anastasis [00:36:35]: 比 Gen-2 能产生的要好得多。Twitter 上有很多关于 Runway 的议论。Runway 完了。就像,Runway 不可能赶上。如果你还记得,OpenAI 在早期二十-感觉非常,就像它是
Swyx [00:36:56]: 到月球
Anastasis [00:36:57]:现在它是一个强大的对手,但在那个时候,他们正处于巅峰状态。没有人能接近他们。也许 Gemini 只是 Gemini 的第一个版本刚刚发布。所以当 OpenAI 推出 Sora 时,质量有了巨大的飞跃,这让我在几个小时内产生了存在危机。但是,我认为 Runway 的惊人之处在于,我想我们已经成立了八年,这在 AI 领域几乎是恐龙了,我们不得不学习、快速适应,并在团队中建立我们原本没有的技能。所以,如果你问任何人在 Runway 最喜欢的时刻是什么,那就是在那段时间,我们在三个月内推动自己做出了比 Sora 更好的模型。我们将模型规模、模型大小和训练计算量扩大了 10 倍。我们弄清楚了模型并行。我们对此毫无专业知识。然后我们在那个夏天推出了 Gen-3。所以我认为那是公司的一个重大转折点,研究组织迅速成长,我们真正开始认真追求通用世界模型的愿景,我想是在 Gen-3 发布之后。
Swyx [00:38:12]:是的。这就是构建时的惊人之处。没有现成的堆栈。你必须自己发明一切。你必须完全全栈。现在我认为有像 Fal 这样的推理专家可以帮助模型服务,我想你们也和他们合作。但是,是的,就像它一样。但在当时,它只是。思考当 Sora 出现并且人们质疑你的公司是否应该继续存在时你会做什么,这非常有趣。
蒸馏、Turbo 模型和实时视频
Anastasis [00:38:41]:是的。而且,没有,没有扩散模型的 VLM。就像,我们必须构建整个模型服务基础设施并使事情高效。在我们发布 Gen-3 几个月后,我们发布了 Turbo 版本,我认为这是第一个生产中的步进蒸馏模型。
Swyx [00:38:56]:那也是我们报道过的一个趋势。是的。
Anastasis [00:38:59]:所以这使我们能够以更大的规模服务这些模型,因为我认为 Gen-3 的第一个版本服务起来相当昂贵。
Swyx [00:39:09]:我认为一致性模型、Lightning 和 Turbo 等所有这些东西的趋势不知何故并没有真正持续下去。我不知道你对此有什么反思。因为当时,我想,“好吧,一切都应该从蒸馏模型开始,然后你可以升级,”对吧?它。你更大的模型只是变成了花哨的升级器,但就像你应该总是用更小、更快的模型起草,对吧?因为你可以很快得到它,就像近乎实时一样。
Anastasis [00:39:39]:是的。我不会那么肯定地说它没有留存下来。我认为,它很可能会。有很多步蒸馏模型正在生产环境中被积极使用。与非蒸馏模型相比,质量上仍有差距。但在我看来,我们仍然。与语言模型相比有两到三年的滞后。所以那些东西,所以只是时间问题,会有更好的蒸馏技术。我们使用。现在我们有一个实时模型核心角色,我认为这是实时视频模型最大的部署,那是一个步蒸馏模型,并且正在被积极使用。与通用视频模型相比,这是一个非常具体的用例。所以这是一个
Swyx [00:40:27]:顺便说一句,非常酷。
Anastasis [00:40:27]:这是虚拟形象的东西,对吧?
Swyx [00:40:28]:一致性,角色。
Anastasis [00:40:30]:是的。所以这是一个会说话的虚拟形象模型。我们能够。我们对其进行了极致的优化,它以24 FPS生成,并且是一个步蒸馏自回归视频模型。所以如果我们看我们的世界模型方向,其中很大一部分是从一次性生成整个视频的双向扩散开始,并使其成为自回归展示。所以你一次生成一帧或几帧。所以要让管道达到实时模型,有很多工作要做。首先你需要将其变成因果自回归模型,然后你只需将其变成。你需要做一些额外的步蒸馏才能使其实时。我认为那部分才刚刚开始。如果两年后我们不主要使用实时模型,我会非常惊讶。对我来说,实时视频生成是不可避免的,它有更好的用户体验,服务成本更低,而且基础模型和实时模型之间的质量差距只会随着我们找到更好的蒸馏技术而缩小。我们在内部在蒸馏时保持基础模型质量方面取得了很大进展。
Swyx [00:41:49]:这其中有多少是可转移的?所以是同一个基础模型吗?比如如果你在整个序列上进行扩散,并将其转换为步自回归蒸馏,这就像蒸馏,你仍然需要训练两者,你可以使用相同的基础和转换器?从常规模型到技术层面上的实时模型,这个过程是什么样的?
Anastasis [00:42:11]:所以扩散模型的好处是你有两个蒸馏轴。所以有。你可以蒸馏到一个更小的模型,这类似于你在LLM中所做的,或者你可以从采取更少步骤、更少扩散步骤的角度进行蒸馏。所以你可以拿一个在五十步中生成的模型,在四步中生成,并达到,你会有一些性能下降,但很多时候你会得到可比的输出。所以你甚至可以拿大型前沿模型,用步蒸馏来蒸馏它,并达到实时性能,这就是我们所看到的。所以,根据用例,在某些情况下我们可能也会用更小的模型来服务,但在很多用例中,我们只是使用
Swyx [00:42:56]:步蒸馏
Anastasis [00:42:56]:前沿模型,我们能够使其实时工作。
Swyx [00:42:59]:我认为这可能是切换到他的笔记本电脑来展示你正在做的一些实时东西的好时机。
界面世界模型和神经软件
Anastasis [00:43:06]:这是我们最近做的一项研究更新之一。我们一直在努力将我们的通用世界模型应用到不同的场景中。我们认为其中非常有吸引力的一个应用,是将通用世界模型本质上用作一种接口,一种通往软件的通用接口。这是我们世界模型的一个版本,叫做接口世界模型。其理念是,它本质上取代了软件应用的前端。它直接渲染界面的像素,并被训练来预测在你点击或与界面进行其他交互后会发生什么。所以这全是像素。没有 HTML、CSS、React 来驱动这个界面。这直接是我们实时视频生成模型的输出,并且它直接接收点击作为输入。
Swyx [00:44:09]:还有拖拽,点击并拖拽。
Anastasis [00:44:12]:对。所以它支持
Swyx [00:44:13]:哦。
Anastasis [00:44:14]:是的,点击。它支持拖拽。它还支持滚动。令人惊叹的是,你可以在提示中有效地描述你希望不同元素如何表现,比如你希望不同元素的行为是什么。所以这几乎就像你可以将界面从标记语言描述(比如 HTML 界面)转变过来,转而只需描述界面。如果我按下这个按钮,我期望发生这个。如果我按下这个按钮,应该发生那个。我们相信,这对于原型设计、对于测试不同交互的感觉都很有用。你还可以为其添加音频。所以它是一个视频音频生成模型。因此,你本质上可以描述点击的视觉结果应该是什么,以及如果有音效的话,会发出什么声音。我们相信,这将是一种更加灵活的构建软件的方式。直接渲染。为什么还要生成生成像素的代码?直接生成像素就好了。
Anastasis [00:45:18]:这是端到端哲学应用于前端。
Anastasis [00:45:25]:所以我们认为有几个有趣的用例。你可以在其之上构建创意工具。
Anastasis [00:45:32]:我们认为,对于任何涉及大量探索的用例,或者像是教育类用例——你想学习一个新概念,想要一些可视化,以及开放式探索——我们认为这是一种非常强大的方法。你可以想象,新的设计形式、工业设计软件可能会因这些模型而出现。而且这一切都是实时生成的。因此,你可以构建许多有趣的相机过渡和交互形式,这些用其他方式很难实现。我们评估这一点的一种方法是,如果你尝试仅通过提示 Claude 来生成相同的界面,比如,“这是我用 Figma 或在其他地方创建的界面的图像参考。创建这个特定的交互,”在这个例子中,就是向上拖动那个对象。除了速度更慢之外,仅靠 LLM 也很难捕捉某些交互。所以,我们认为这很可能成为未来许多软件创建的方式。另一个额外的好处是,个性化可能通过这些模型更容易实现。比如,你可以根据访问界面的用户尝试不同的提示。你可以更轻松地通过提示工程让界面使用更大的文字以提高可访问性,或者如果你有特定的审美偏好,也可以进行调整。所以我们对这种方法非常兴奋。现在还处于早期阶段,我认为我们还需要让它更具成本效益,以服务这些模型,因为运行实时视频模型与纯粹渲染 HTML 相比,计算需求要高得多。但我们确实看到了这种方法在构建前端界面方面的巨大潜力。
Swyx [00:47:47]:我们之前在 Flipbook 中与 Ethan Hara 的 Groq 视频那一集里讨论过类似的东西。是的,我认为它在视觉上非常吸引人。我认为它可能非常适合教育,但听起来确实很昂贵。不过,我认为它的昂贵程度是有上限的,对吧?比如,推理成本会随时间下降。你会找到优化它的方法。实际上,当它暂停时,你不会收到人类输入。你不需要生成任何东西,对吧?所以。
Anastasis [00:48:14]:是的,你也可以。比如,在这种情况下,你有环境运动,所以屏幕的某些部分可能会。如果你,比如说你想去巴黎,然后你得到这个允许你探索的界面。
Swyx [00:48:29]:人们在行走。是的。
Anastasis [00:48:29]:你有人们在行走,或者类似的事情发生。但是,这,这并不。是的,它让它更昂贵,因为你需要一直运行模型。也许你有一些循环机制,这样你就不需要那样做。但所有这些事情,我认为都是我们需要弄清楚的。
迈向全神经操作系统
Swyx [00:48:44]:是的。
Anastasis [00:48:44]:我认为我们的首要考虑是,让我们明确地找到一些用例,在这些用例中,与传统界面相比,这种交互明显更具吸引力。然后,让它变得更具成本效益只是时间问题。
Swyx [00:48:58]:是的。当涉及到人们在行走时,我认为对我来说最有意义的方法是 Nick。
Anastasis [00:49:04]:Nick。
Swyx [00:49:04]:哦,天哪。我老是搞错他们的名字。是 Chris Manning 和 Fanny Yan。不知道你听说过他们没有,他们……映射到某个游戏引擎。我想是 Unity 之类的,或者 Godot。然后你可以在那后面编写一些 NPC 行为并据此训练。而在这里,你几乎可以想象任何你想要的东西。就像,那是一个 UI,对吧?而且感觉,我想,更可控一些,去创建一个可交互的软件世界模型,因为我们有很多这样的例子,你可以在那上面做你那些花哨的 RL 环境的东西,比扩展到具身和真实世界的物理用例要容易。但这是一个很好的第一步。
Vibhu [00:49:43]:或者,有相反的情况,你有,比如,一个 B 模型,三个 50 亿参数的语言模型。它变得太小了,它们只是在预测,比如,鱼在移动。
Swyx [00:49:53]:小模型现在都是 120B 了,所以。
Vibhu [00:49:57]:超迷你设备上。
Vibhu [00:49:58]:但是,不,我认为它,就像,它让人看清了全局,至少对我来说汽车那个例子,就像,应用,对吧?做那个的工作量,当然,你每年只做一个车型年,但应用这个,也是节省成本,不用手动做所有这些,对吧?所以它也打开了很多可能性。我很好奇如果你把这个扩展到两三年,你觉得事情会进一步走向何方?
Anastasis [00:50:25]:实际上,像界面世界模型这样的东西的最终游戏是,你有一个,完全神经的操作系统。所以我认为,Andrej Karpathy 很久以前写过这个。但是,它,你,我认为对我来说,它有点,有点奇怪,我们有,例如,与今天的 LLM 交互,你有这个 LLM 可以和你谈论任何事情。它可以,你可以把对话引向任何方向。你可以,它非常通用,所以它可以解决所有那些不同的任务,但你通过一个非常僵硬的界面与它交互。所以对我来说,只是时间问题,界面本身变得可学习,成为整个循环的一部分,就像,你不仅仅是在交付。你是在端到端地交付一个应用,这意味着你在交付语言模型,但你也在交付渲染和像素,那也是可学习的组件。应用的概念可能不一定。我认为我们需要为软件找出新的抽象。应用的概念来自于这个想法,你需要,单独的代码库来描述,来,为,为每个单独的工具和每个单独的应用提供动力。但你可能想到更统一的东西,如果你。如果你有一个,视频模型,随着你的进行生成界面。所以它可以从 LLM 获取上下文,并允许你结合传统上存在于不同应用中的不同功能。所以这是一种,有效地端到端解决软件的方式。我们也看到这是训练计算机使用代理的强大方式。所以这是,一种看待这个的方式。总的来说,对于世界模型,有那两个方向。一个是给人类的世界模型,一个是给
Swyx [00:52:24]:代理
Anastasis [00:52:24]:训练代理。
Swyx [00:52:25]:是的。
Anastasis [00:52:25]:因此,对于我们所做的每一个新的世界模型工作,这两种用途都变得可能。所以这是一个强大的合成数据生成器,用于训练计算机使用模型。它可以成为一个实时的强化学习环境,你可以用它来对计算机使用智能体进行在线强化学习,并且你可以获得各种各样的不同交互、不同类型的界面,这些都是即时生成的,以提高你的智能体变得多么鲁棒。所以对于我们正在为机器人用例开发的世界模型来说,也是如此。
长上下文、错误累积与自回归视频
Swyx [00:53:02]:有没有一个你正在等待的研究突破,能够解锁你真正想要追求的下一组用例?
Anastasis [00:53:10]:长上下文是非常重要的一个,所以能够长时间保持一致性,而这取决于用例。例如,对于我们的角色模型,或者对于界面世界模型,维持长时间的交互会话更容易。如果你进入更开放式的世界,在其中导航并采取任意行动,那么你可以生成内容的上下文和持续时间会更快地受到限制。
Swyx [00:53:40]:是的。
Anastasis [00:53:40]:所以我们看到更多的退化和错误累积发生。所以自回归模型最大的挑战是错误累积,即你把生成的帧反馈回模型以生成下一帧。如果存在任何小错误,它们会随着时间累积。这不是一个新问题。这也是大语言模型存在的问题,而我们已经看到现在能够生成非常长的输出。所以这是一个已解决的问题,但它肯定仍然是一个挑战。
Swyx [00:54:08]:是的。那么最先进的技术是什么?所以对于 Grok 来说,视频的上下文大概是 10 到 20 秒。
Anastasis [00:54:16]:对于我们的角色模型,我们能够自回归地生成长达 30 分钟的视频。
Swyx [00:54:21]:是的。但那只是针对虚拟形象。
Anastasis [00:54:24]:是的。所以如果我们看 GWM Worlds,它更像是我们的开放式世界探索模型,它大约是几分钟的量级,是的,所以
Swyx [00:54:35]:可能对人来说足够了,因为无论如何你都得切到下一个场景,对吧?
Anastasis [00:54:40]:是的,如果你每隔几分钟就得重新开始,那并不是理想的游戏体验。所以我认为。但是,我认为它。是的,对于某些类型的游戏体验,你可以绕过它。理想情况下,你能够永远生成下去,而且它不会退化。我认为我们达到那一步只是时间问题。
Swyx [00:54:59]:是的。Genie 大概只有,最多一分钟?
Anastasis [00:55:01]:对。是的。
Vibhu [00:55:02]:这是你的。你做了一个关于机器人技术的研究。不过我想我也只有你的 Runway Robotics 页面。这个更好吗?
GWM 机器人技术与仿真到现实评估
Anastasis [00:55:11]:所以去年我们发布了 Gen-4.5,那是我们最新的基础模型。正如我提到的,我们一直在世界模型方面做所有这些工作,而我们对世界模型的方法在很大程度上就是:如何把一个双向扩散模型变成自回归的,并让它接受动作?所以它不再是你观看的视频,而变成了一个你可以踏入的模拟,你可以一路控制每一步。你可以探索反事实,比如如果我采取这个动作会怎样,对比如果我采取那个动作会怎样。而 GWM-1 就是我们在 Gen-4.5 之上构建的世界模型。所以我们在 Gen-4.5 之上做了所有这些自回归以及类似蒸馏、自回归,然后是步蒸馏。而我们在 GWM-1 上看到的最大用例之一是在机器人领域。我们喜欢说的一点是,随着我们扩展视频模型,我们意外地仅仅通过扩展视频模型,就创造出了一个最先进的机器人模型。所以我们在去年年中的某个时候意识到,机器人实验室来找我们,要求使用视频模型来生成合成数据,要求我们对我们的视频模型进行后训练,使其在机器人领域表现良好,这样他们就可以用这些模型来生成变体。那是我们看到的第一个用例。然后越来越清楚的是,这些模型不仅仅在生成用于训练机器人策略的合成数据方面有用。它们作为模拟器也会非常有用。这意味着你可以在线使用视频模型来测试你的机器人动作模型表现如何。所以你可以采取一个动作,然后在世界模型中得到该动作的结果,然后像这样继续这个循环,形成闭环模拟。你可以用它来评估你的机器人模型表现如何。而我认为,如果你想构建一个模拟器,你需要解决的最大问题就是建立真实世界的相关性:如果你在世界模型中采取一个动作,如果你在真实世界中采取同样的动作,你会得到相似的结果。所以这就是我们今年早些时候所做的一些工作的目标。所以如果你点开第一个链接。所以那本质上是想为我们的世界模型建立真实到模拟的相关性,这样如果你在世界模型内做一系列动作,并且你在真实世界中做同样的动作,你会得到相似的结果。我们拿我们的 GWM-1 模型,使用了一些基准数据,有一个叫 Roborina 的基准,它非常常用于评估不同动作模型的表现如何。我们在我们的世界模型内使用相同的场景、设置和具身形态,并测量动作模型在世界模型内与在真实世界中表现如何的相关性。我们看到,我们可以在我们的世界模型与现实之间获得非常好的相关性。这意味着,如果你想评估你的机器人策略表现如何,你可以在模拟中更快地扩展评估,而不必用实际的物理硬件来做。所以那是我们的模型可能在机器人领域相当有用的第一个迹象。而且我们看到,随着我们与机器人实验室合作,这成为了第一个用例,他们可以以一种融入其训练流程的方式使用视频模型。
Vibhu [00:58:40]:我能问一下什么
Anastasis [00:58:41]:是的
Vibhu [00:58:41]:差距是从四点五到解决那个问题?所以仿真到现实的差距一直是个问题,对吧?你在视频数据上训练一个机器人模型,它无法泛化到现实世界,而仿真也有问题。所以看起来你解决了它,但怎么做到的?
Anastasis [00:58:56]:是的。所以模拟器的一个大问题是,如果你试图模拟刚性物体,比如如果你能非常准确地描述物体的物理特性,那么它就能很好地工作,然后你就能使用 Isaac Sim 或 MuJoCo 或某个传统模拟器。但对于更复杂的交互,比如布料,或者像光滑表面,以及你希望通过操作来解决的所有复杂性,用一个解决操作任务的动作模型,要为每一个这样的环境和每一个这样的任务构建模拟版本、构建那个环境的数字孪生,是非常困难且非常耗时的。而有了世界模型,你只需要提供第一帧,然后你就可以在第一帧内展开策略。所以,我们将其与那些需要对环境进行 3D 扫描、然后对每个单独物体进行 3D 扫描才能将其带入仿真的方法进行比较。而有了世界模型,你只需要拍一张环境的照片,然后就能测试你的策略表现如何。我们在机器人领域的总体论点是,有些公司正在利用大量遥操作数据来训练机器人动作模型。现在有些公司正在使用 humie 数据,这本质上是人类的第一人称视角视频,其中人类使用机器人外骨骼来执行不同的操作任务。还有些公司专注于第一人称视角数据,也就是在某人头上绑一个 GoPro,然后捕捉他们执行任务的过程。我们认为,所有这些都是训练机器人模型的绝佳数据来源,但最丰富的视频数据来源是第三人称视频数据。而且,我们人类是如何学习执行不同任务的?很多是通过观察他人执行这些任务。我们不是从第一人称学习的。我们确实会做一些试错,来学习不同的东西,但归根结底,我们在世界上学会做的很多事情,都是通过观察别人做来学会的。这就是当你预训练一个视频模型时,你本质上在做的事情。它是大量第三人称视频素材,记录人们在世界上执行不同任务,人们做运动,人们做家务。我们的主要论点是,视频预训练一旦完成,你就可以用少得多的实际机器人数据,将模型适配到机器人用例中变得有用。所以你需要的遥操作数据要少得多,而遥操作数据非常难以扩展。即使你看第一人称视角数据,它相比需要实际硬件的遥操作数据更容易扩展一些,为什么第三人称视频是强大的机器人预训练来源
Anastasis [01:01:55]:与世界上存在的第三人称视频数据相比,这类数据在数量级上仍然少了三个小时。因此我们的论点是,一般来说,最丰富的数据来源最终会胜出。第三人称视频数据预训练是模型的正确起点,尤其是当你希望模型能够泛化,并能够处理新环境、新任务以及训练期间未曾见过的事物时。这就是为什么我们认为我们的模型在机器人场景中特别有用的动机,而且我们也已经看到情况确实如此。
Swyx [01:02:32]:你提到了预训练。所以也许可以理解为第三人称预训练,第一人称SFT?是否有可以引入的课程安排?
Anastasis [01:02:41]:正是如此。所以如果我们看GWM Worlds,也就是GWM,那么就是GWM Robotics。所以在机器人领域,数字化上,它从Gen-4.5开始。
Vibhu [01:02:49]:是同一个视频扩散主干,对吧?
面向机器人具身的训练后世界模型
Anastasis [01:02:53]:正是,是的。所以你从基础视频模型开始,也就是你用来生成猫、狗和其他有趣内容的那个模型,然后你在非常少量的机器人数据小时数上进行微调。所以这大约是数百小时的数量级,相比之下,如果你要预训练一个机器人模型,当前的预训练会达到十万小时甚至数百万小时的数据。而你能够快速获得相当好的性能,因为模型利用了它在预训练中学到的关于世界、物理、人类动态以及人们关心的任务的一切。最终,你希望这些模型能够泛化。你不希望它只能执行训练中一直在做的任务。而预训练视频数据集所带来的动作和环境多样性,远远大于你现实中能够手动捕捉到的内容。
Vibhu [01:03:54]:训练后阶段的规模看起来如何?比如,你还想继续做吗,是大约百分之九十的计算在常规视频扩散模型中,然后大幅扩展,还是说我们希望不同任务使用不同的机器人模型,或者只是一个基础非常好的世界模型也能应用于机器人?
Anastasis [01:04:14]:所以目前,我们正在为特定具身进行模型训练后,这些具身是我们为特定合作伙伴准备的。所以如果他们有一个特定的单臂机器人、双臂机器人或人形机器人,我们会在他们的特定数据集上对我们的GWM机器人模型进行训练后。随着时间推移,我们看到GWM的不同变体正在统一。比如,我预计,如果一年后或两年后,你会有一个单一的世界模型,它可以模拟操作任务,可以模拟导航,而很多游戏世界模型都是导航世界模型。你在空间中移动,它也会模拟人类行为。所以那就是角色模型。因此,不是拥有三个不同的模型,而是拥有一个单一模型能够做到。理想情况下,你能够模拟身处世界中的感觉。你在环境中移动。你可能在执行不同任务。你在与其他人交谈。而这会通过同一个、单一的实时视频模型生成来实现。
Vibhu [01:05:17]:你觉得你能解决自动驾驶吗?所以,如果你在模拟器里学开车,你就有一个世界模型。你的机器人是车,可以操纵这么多轴。你离那样的东西还有多远?
世界动作模型、自动驾驶与学习策略
Anastasis [01:05:31]:所以世界模型
Vibhu [01:05:32]:或者一个非常好的ADAS系统?
Anastasis [01:05:33]:世界模型目前确实被应用于自动驾驶研究,主要用于评估用例,但我们的重点更多在机器人操作上。我们在自动驾驶、世界模型方面也做了一些工作。但是,是的,我们确实认为世界模型和视频模型是模拟器以及策略和动作模型的最佳起点。所以,这是另一方面,一旦你有了一个很棒的世界模型,那么你只需添加一个动作头,它也能预测动作。一种思考方式是,如果你取一个带有机械臂的场景的起始帧,然后你提示模型,生成机械臂拿起物体的画面,如果它生成了足够准确的视频,那么它也应该能够生成机械臂执行相同动作所需的确切3D姿态。所以这就是现在流行的术语“世界动作模型”的方向,即你从视频模型开始,然后添加一个动作头来预测动作,本质上它就变成了一个策略。
Swyx [01:06:43]:我也印象深刻的一件事是训练这类模型需要多少数据。你可能无法确切说出多少,但就像,最初的扩散模型,据我所知,甚至开源的中国模型,数据量并不算多。这不令人惊讶吗?
Anastasis [01:07:02]:你把多少数据定义为什么?
Swyx [01:07:05]:是的,它就是进来,出去。令牌数还相关吗?
Anastasis [01:07:09]:所以这有点复杂,而且,Swyx [01:07:11]:就是千兆字节,对吧?
Anastasis [01:07:13]:是的,多少小时的视频,对吧?
Swyx [01:07:15]:是的。是的。我觉得有趣的是,语言模型中的令牌与参数数量的比例,也许它们领先三年之类的,似乎比视频模型高得多,尽管从技术上讲,视频每比特包含更多信息。我不知道这是否直观,或者也许只是有很多,比如像素到下一个像素之间的变异性并不那么高。所以,也许只是有很多重复的信息。
扩展视频数据与清醒梦测试
Anastasis [01:07:47]:我的回答是,现在还非常早期。就像,训练视频模型将比
Swyx [01:07:55]:是的
Anastasis [01:07:55]:目前扩展得远得多,你将拥有比当前模型能做的更远的能力。所以一个我喜欢用的思想实验,它几乎就像视频模型的图灵测试,或者世界模型的图灵测试,我称之为清醒梦测试。就是你有
Swyx [01:08:14]:你是说真正的人做清醒梦?
Anastasis [01:08:17]:它来自这个想法
Swyx [01:08:18]:Lucid rains,对吧?
Vibhu [01:08:19]:清醒梦是告诉你在做梦时
Swyx [01:08:22]:是的。
Anastasis [01:08:23]:是的,没错。所以清醒梦是当你意识到你
Swyx [01:08:25]:在梦中
Anastasis [01:08:26]:在梦里,然后你
Vibhu [01:08:28]:随意操控
Anastasis [01:08:28]:能够控制发生的事情
Swyx [01:08:30]:不,还有一个做推理的人叫 Lucid Rains。对。或者量化
Anastasis [01:08:33]:非常多产的人。对。所以假设你有一个 VR 头显,你在一个房间里,你戴着 VR 头显,而那个 VR 头显——今天大多数 VR 头显都有透视模式,所以你可以直接看到你面前世界里的东西,或者你可以在 VR 头显里渲染一些东西。会有那么一个时刻,那些交互式实时视频模型变得足够好,你戴着这个头显,你在同一个房间里,你四处走动,你有点——你在和物体互动。你能够在那房间里自由移动,做——和任何物体互动。到最后,有人问你:“你刚才是在用透视模式,还是——还是这是渲染或生成的画面?”如果你无法确定你在和世界互动、四处移动时看到的东西是生成的,还是透视模式、只是你面前正在发生的事情,那就表明这些模型已经变得足够好了。而我们还没有——我们离那还很远。其中很大一部分就是真正很好地模拟动力学和反事实这个想法。比如,如果你让一个视频模型生成一个人进球对比一个人没进球,它在进球上会做得更好,因为训练分布存在偏差。一个人成功进球的视频要多得多。但如果你有一个交互式模型,你希望它能够生成反事实。比如,如果我采取这个动作对比那个动作,你希望它生成同样逼真的结果。所以我认为,这就是视频模型和世界模型之间的巨大差距,即反事实生成这个想法。而如果你想要一个用于机器人技术的出色模型,你希望非常好地模拟失败,因为无论你是用它来评估,还是将来把它用在在线强化学习循环中,你都希望模型能够尝试、失败并改进。所以为了做到这一点,你需要能够模拟事情失败。
Swyx [01:10:42]:这是唯一一个你有太多成功例子而没有足够坏例子的领域。生成失败应该很容易。
Vibhu [01:10:51]:说来奇怪,我觉得早期的图像视频模型并不擅长做到人类逼真,对吧?比如,你看到很多高分辨率 4K 的、像专业摄影那样的东西,但不只是日常生活,像普通照片,对吧?一切看起来都像是专业生成的,像专业照片,而不只是普通的、像桌上乱糟糟的线缆那样。
Swyx [01:11:13]:好,所以有——有这些东西。我们还谈到的一件事是你们有的、你们发布的视频智能体。我想,传统的、我们称之为前沿的、像自回归 LLM 那样的东西,如何融入这一切?它们在驱动你们的机器人模型,还是在驱动其他的、你们的视频智能体、生产,任何你看到自回归和扩散重叠的地方,我们姑且这么说?
反事实、失败数据和世界模型评估
Anastasis [01:11:41]:是的,所以在所有这些不同的用例中,harness 都非常重要。我们有一个视频 agent,它本质上是一个 LLM,非常擅长使用各种不同的工具——图像模型、视频模型——并帮助你端到端地创建项目。所以,在传统的广告流程中,你通常会有一个 brief,从它开始,然后生成一些故事板,再生成视频。视频 agent 或者说 runway agent 会帮助你完成整个过程,它还会帮你分析效果数据。例如,这个广告相比那个广告表现如何,然后基于这些经验为我生成更多内容,弄清楚该生成什么。我们认为 harness 是这条 pipeline 中非常重要的一环。正如我提到的,所有的视频制作、所有的生产级视频模型都会用到某种 prompt completion,我们预期这会变得越来越复杂,你会在使用 diffusion transformer 之前生成更长、更详细的描述。我确实认为最终会越来越统一到 omni 模型,你端到端地训练模型,既能做自回归文本预测,也能做 diffusion。所以你在预测下一个 token,你可能会对场景做一些推理和规划,然后把它传给生成像素的 diffusion head。
视频 Agent、Harness 与 Omni 模型
Swyx [01:13:10]:是的。我觉得目前可能只有 Gemini 和 Qwen 做到了。我不确定哪些中国模型是 omni 的,但确实,这不是一个非常普及的模态,我想。
Vibhu [01:13:25]:仔细想想,这是一个很有意思的用例,对吧?因为你不仅要在语言模型推理那里结束,diffusion 已经生成了,你不必在那里输出。你可以把那个输出再喂回同一个模型,再次推理改进,它自己就能做很多循环。我想问题在于,我们需要那样吗,还是我们只需要 agent scaffold,在模型外部做?在模型内部做有很大的好处吗?
Anastasis [01:13:54]:我觉得总体上有一个趋势,就是某件事先由 harness 来做,然后它变成模型的一部分,对吧?所以你有 chain of thought prompting,你不得不写这种超级详细的 system prompt 来
Swyx [01:14:07]:是的,一步一步
Anastasis [01:14:08]:得到输出。而现在模型在给你答案之前会自己生成推理轨迹。在视频模型中也类似,早期很多视频模型是单镜头视频模型,你必须用某种 orchestrator 来并行生成多个镜头,然后把它变成实际的视频。
Swyx [01:14:28]:或者在 ComfyUI 里,就是所有这些节点。
Anastasis [01:14:31]:是的,就像意大利面式的工作流。现在你有了多镜头视频生成,可以直接生成多个镜头。这样做有一个好处,因为这样视频模型就能学到一些东西。要生成好单个镜头,你需要弄清楚很多关于世界的事情。要生成好多镜头视频,你还需要一些视频剪辑的直觉。比如,你需要弄清楚镜头的正确节奏。而且,LLM 在这方面并不擅长。它们不是很好的视频剪辑师。如果你让一个 LLM 拿一些视频然后自动剪辑成一个视频,会让人感觉很不自然。所以我认为 LLM 目前还不太擅长做视频剪辑。我认为端到端地学习这一点是有好处的。所以我预计,训练通常就是那些你最终需要 harness 来做的事情会被注入到模型本身中,然后你端到端地学习它。
从 Harness 到端到端学习的视频剪辑
Swyx [01:15:33]:你觉得你需要雇佣那些既能做工程又能做研究的艺术家来注入这种品味,还是你有驻场艺术家来提炼这些?
Anastasis [01:15:44]:我们有一个庞大的创意团队,非常积极地参与这些模型的训练,在每一个环节都是如此。还有,你如何为视频添加字幕,以便尽可能详细地捕捉到电影摄影、美学、镜头方向等方面所需的东西,这样在推理时你就能通过模型引出这些?我们的创意团队还做了大量的评估,比如,什么构成了这些模型输出的可用视频。所以他们非常深入地参与了整个过程的每一个部分。我认为这是 Runway 的一个特别之处,就是创意人员和研究人员并肩坐在一起,共同构建我们下一代模型。我认为这对我们公司的运作方式来说是非常重要的一部分。
Swyx [01:16:37]:是的。不过从某种意义上说,你只能纽约做到这一点。
Vibhu [01:16:40]:这是
Swyx [01:16:40]:也许,你们有其他办公室,但是,我试图从你们是一家大型纽约公司这一事实中寻找一些诗意的意义。
Anastasis [01:16:49]:作为纽约公司有几个方面。有所有那些不同行业的交汇,比如媒体、广告,就像
Swyx [01:16:57]:是的,这非常广告。
Anastasis [01:16:59]:艺术场景就是纽约。不是说旧金山有什么不好,但是,那里有更多的事情在发生。有那个成分,而且我认为我们也受益于作为局外人,以稍微不同的方式思考事情,比如不处于同一个蜂群思维中,Swyx [01:17:19]:BВС
Anastasis [01:17:19]:ASI,湾区,以及,花时间走到今天这一步。比如,有意识地建立、发展团队,并引进那些,是的,既在创意方面也在工程研究方面的人。纽约有大量优秀人才,所以这并没有真正成为问题。
创意品味、艺术家反馈和 Runway 的纽约优势
Swyx [01:17:41]:恭喜一切。你们在招聘什么?人们应该期待 Runway 未来的什么?
Anastasis [01:17:49]:我们正在全面招聘。我认为这可能是Runway历史上开放职位最多的一次。我们的研究团队正在大幅扩张。所以,如果你对视频模型感兴趣,如果你对世界模型感兴趣,如果你尤其对机器人技术感兴趣,机器人团队,我们正在招聘机器人领域的职位,涵盖软件、硬件和研究。所以一定要联系我们。
Swyx [01:18:13]:而且,很多人没有直接的机器人背景,但如果他们想在机器人领域有所作为,应该具备什么?
Anastasis [01:18:21]:所以理想情况下,有一些学习策略的经验,会
Swyx [01:18:26]:就是强化学习
Anastasis [01:18:27]:对机器人技术有好处。但我们倾向于招聘通才,这是一种理念,而且,喜欢学习非常快的人。但在未来几个月,我们肯定在寻找一些在机器人领域有经验或专业知识的人。然后我们正在大幅扩展市场推广团队。目前,围绕视频模型,有广泛、非常活跃的企业采用正在发生,我们真的在努力回应所有的需求。
Swyx [01:19:00]:是的。太好了。你想谈谈开源机器人相关的东西吗?
Vibhu [01:19:04]:当然。那只是我们的一些随记。
Vibhu [01:19:07]:NVIDIA推出了Cosmo。我想这很有趣。所以,你是AI实验室的创始成员,致力于在物理AI中构建开源世界模型。- 这里还有什么要谈的是开放研究吗?
Anastasis [01:19:20]:最重要的是,正如我提到的,虽然模型仍处于早期阶段,就像我们仍然可以进一步扩展这些模型,还有更多的进步和我们可以弄清楚的事情,以及如何进一步改进这些模型。我认为,其中一些研究在公开场合进行是很重要的,并弄清楚不同公司聚集在一起将一些研究带入公开和开源的激励是什么。因此,Cosmos Coalition是我们与NVIDIA共同发起的一项倡议,旨在将一些研究作为开源。这可能意味着开放权重模型的发布。这可能意味着衡量物理和人们在构建世界模型时关心的事情的基准。这可能意味着基础设施。所以真的,我们如何发展世界模型的生态系统,并使它对一个刚刚起步、对世界模型感到兴奋的开发者、研究人员来说更容易为该领域做出贡献。
招聘、机器人技术和企业采用
Swyx [01:20:19]:我认为有一定程度的,这也是我们对中国世界模型发布的回应吗,或者这不是考虑的一部分?
Anastasis [01:20:29]:我确实认为,对于NVIDIA模型来说,这很重要,如果你看看视频模型的排行榜,我会说现在前十、前二十的大多数模型都是中国模型。只有少数公司从美国或西方进入了排行榜。
Swyx [01:20:50]:是的。我们在图像方面做得更好,但在视频方面我们非常落后,对吧?
Anastasis [01:20:53]:所以我认为,作为一个社区,我们更广泛地投资以确保我们能够拥有有竞争力的模型,这绝对很重要
Swyx [01:21:02]:是的
Anastasis [01:21:02]:在外面。
Swyx [01:21:03]:但为什么我们不能直接从它们那里蒸馏呢?
Anastasis [01:21:06]:我不确定那是不是最好的长期
Swyx [01:21:08]:不会提到他们不会
Anastasis [01:21:09]:你受限于你能达到的性能。这,这几乎有点悲观
Cosmos Coalition 与开放世界模型研究
Swyx [01:21:14]:就像
Anastasis [01:21:14]:认为你可以变得更好的观点。你可以
Swyx [01:21:17]:这是免费的数据。这,你不妨也这么做。就像如果他们,他们在文本语言方面这么做,他们不妨也在视频方面反过来这么做。
Anastasis [01:21:25]:是的,我确实认为我们,我们目前非常有能力训练出很棒的模型
Swyx [01:21:29]:好的
Anastasis [01:21:30]:无需蒸馏。是的。
Swyx [01:21:32]:是的。
Vibhu [01:21:32]:那么关于基准测试和评估你有什么想说的吗?就像,我感觉我听到的是很多人真的很喜欢视频和图像模型的竞技场,客户之类的也是。他们只想要排行榜上最好的,而且他们提到竞技场的频率似乎比语言模型多得多。但关于基准测试有什么要说的吗,缺少什么?当这两者看起来都非常超写实时,普通人如何比较?除此之外,除了我们确实谈过的像机器人模拟、物理之类的,还有什么要说的吗?
Anastasis [01:22:05]:我认为在某些方面恰恰相反。我认为人们,一般来说是创意工作者、艺术家和营销人员,以及其他像使用我们平台的人,我认为他们较少依赖竞技场分数。而且,用一堆不同的模型生成然后从视觉上比较结果实在太容易了。就像图像和视频模型的一个好处是你可以立即用眼睛看出从美学角度什么感觉好。就像任何伪影、这些模型物理方面的任何问题,你都可以立即看出来。所以,我会说,作为人类来评估这些模型比评估语言模型更容易,在语言模型中你有那些非常复杂的数学和编程以及测试,我认为人类评估并区分模型在某一时刻的性能要困难得多。所以我认为在实践中,人们只是用同一个提示词在一堆不同的模型上测试,看看结果是什么样子。而现在在 Runway,你可以使用我们的模型,也可以使用第三方模型。所以,这,这非常容易做到。
基准测试、竞技场,以及创意工作者如何评估模型
Swyx [01:23:12]:太棒了。我们将以 AI Runway AI 峰会结束。最后一个社会问题,我猜,我不知道这算不算一个问题,就是,你处于艺术家和创意工作者与 AI 之间的张力之中。那个社区里很多人讨厌 AI。Runway 社区里的人不介意使用工具。它只是另一支画笔。但是,你看到这种情绪是如何变化的?
Anastasis [01:23:37]:我们的观点,是的,它只是另一个分支,画笔。它只是另一台相机。它,它是一长代工具中最新的一种。
Swyx [01:23:46]:艺术中的技术。
Anastasis [01:23:47]:技术。
Swyx [01:23:47]:是的。
Anastasis [01:23:47]:艺术与技术一直在共同演进。我认为过去几个月发生了相当显著的转变,而且它来了。其中一些你可以从许多公众人物公开支持 AI 中看到,比如在戛纳,你看到几位导演表态支持 AI。我们的电影节请到了朗·霍华德。还有马丁·斯科塞斯也在采用 AI 模型。所以每天都有更多这样的故事出现,比如某位知名人物公开支持 AI。在我看来,这只是个时间问题——这些模型正变得越来越不再神秘。我还想说一个可能有点争议的观点:最初人们对这些模型的反应之所以可能比实际需要的更激烈,其中一个原因是“文本到视频”这个概念——你只给出一段文字描述,就能得到一整段视频。
艺术家、AI 与创作工作流的演进
Anastasis [01:24:48]:是的,存在一种误解。你可以用它生成我们的长片电影,但如今的模型会接收大量参考。它们——它们是非常可控的。我认为当人们看到一个允许、提供许多自由度和控制力的工具时,他们的反应会不同。它是生成式模型这一点变得没那么重要,更重要的是你可以把它引导到你想要的方向。所以,我认为当人们看到建立在这些模型之上的复杂工作流时,当他们看到你可以引导它们的各种方式,而且现在用一些最新模型最多可以提供五十个参考时,对话就变得有点不一样了,因为它感觉更像是一个
Swyx [01:25:34]:故事板
Anastasis [01:25:35]:工具
Swyx [01:25:35]:是的
Anastasis [01:25:35]:而不是像一个神奇的存在,替你搞定整部电影。
Vibhu [01:25:43]:关于这个领域的人的工作流变化,有什么观察吗?比如,至少工程领域有很多人,他们的预期已经改变了。我效率提升了十倍、百倍,能完成的事情多得多。同样地,你在为创意工作者做开发工具。这方面有什么观察吗?比如有些人不想采用,有些人想采用。有什么想说的吗?
Anastasis [01:26:08]:是的。所以我认为,就人们关心什么而言,我看到我们经历了几个阶段。我们从一个阶段开始,那时人们主要追求的是质量。随着我们扩展那些模型,质量大幅提升。这仍然是人们关心的东西,但现在它是在可控性之外的——能够用参考、用不同种类的输入、用故事板来引导那些模型。而现在我的感觉是,人们会越来越关心延迟。随着那些模型变得更好,快速迭代的能力变得更加重要。而且,如果你能用单个提示几乎即时地生成十个不同的输出,你就能比以前快得多地探索。你会获得过去那些创意工具所特有的某种魔力,比如 Photoshop 是即时的。而在生成式模型中我们失去了一些这样的东西。你要等两分钟才能拿回一段视频,我认为我们现在要把它带回来一些,用
Vibhu [01:27:08]:实时
Anastasis [01:27:08]:实时模型。
Vibhu [01:27:09]:是的。令人兴奋。而且
延迟、实时生成与创意工具的未来
Swyx [01:27:11]:令人兴奋。我们要宣传的最后一件事是这个,Runway
Vibhu [01:27:14]:峰会
Swyx [01:27:14]:峰会。你们终于在旧金山办这个了?
Anastasis [01:27:18]:是的。所以,我们对此非常兴奋。这是在九月三十日的晚些时候,我们要办一场峰会,主要聚焦于物理高保真和实时视频生成。我们有来自 NVIDIA、Physical Intelligence、Botco、DeepMind 的嘉宾。是的,我觉得这会是一系列非常有趣的对话。我们尽量让这些讨论小组真正具有技术性,引出真正有实质内容的讨论,并希望能有一些有趣的分歧和有趣的辩论。而且,是的,有票可买。希望人们能来参加。
Swyx [01:27:56]:既然你提到了,人们应该思考或你预期会有哪些分歧和辩论?
Anastasis [01:28:04]:所以是像这样的东西,现在机器人领域有一场辩论,就是 VLA 与世界动作模型之争。
Runway AI 峰会与大型世界模型辩论
Swyx [01:28:11]:好的。
Anastasis [01:28:11]:所以有些实验室真的押注于这两个方向之一。还有比如,训练机器人模型的最佳数据来源是什么?
Swyx [01:28:21]:就是我们谈过的第三方、第一方。
Anastasis [01:28:24]:是的。还有,有些人真的相信进一步扩展遥操作数据,而另一些人则相信利用更大规模的视频数据。所以,这些就是其中一些。然后还有,世界模型方面的辩论,是直接预测像素,还是像 JEPA 那样的东西,还是更基于 3D 的、基于 3D 的方法。所以我觉得我们在世界模型方面正处于一个好时机,因为关于什么是最好的长期方向,那种活跃的辩论仍在进行。我非常强烈地认为,直接预测像素的视频,以及扩展视频生成模型,是正确的路径。但是,我认为研究人员之间正在发生很多有趣的辩论,比如,什么才是最好的前进道路。
Swyx [01:29:09]:有趣的是,这一切都集中在,我们姑且称之为策略层和数据模型层。物理层面是完全解决了吗?比如所有传感器、所有执行器,所有这些。我们需要的一切都有了吗?
Anastasis [01:29:23]:我也不认为那个问题解决了。
Anastasis [01:29:25]:这绝对是,Vibhu [01:29:27]:不同的问题。
Swyx [01:29:28]:这,这就像
Anastasis [01:29:29]:是的
Swyx [01:29:29]:我想梦想所有这些事情,然后我,我买一个机器人,或者我买,我试着自己组装一个,我甚至没法让电机,正常运转。对吧?就像,你在处理非常敏感的设备,涉及电压、功率,还有热量以及所有这些你抽象掉的东西。我们坐在这里,谈论软件,谈论模型,但是,实际上你也必须处理那类事情。
Anastasis [01:29:56]:是的。而且,我认为我,我,我总体上也不反对像我们所见的那样,把其他模态纳入我们的模型。
多模态、ImageBind 与最大主义世界模型
Swyx [01:30:04]:是的。
Anastasis [01:30:05]:最简单的情况是它们可以同时生成视频和音频。所以它们可以生成 RGB,也可以生成声音和音频。但我的——我写过这方面的文章,就像世界模型的极致版本是什么样子,就是你把来自宇宙的越来越多的模态纳入进来,同时你也在不同尺度的观测数据上训练模型。
Swyx [01:30:28]:X 光。
Anastasis [01:30:29]:所以,是的,Vibhu [01:30:30]:你有一篇很好的文章,大家应该读一读,关于
Anastasis [01:30:33]:是的。是的
Vibhu [01:30:33]:真实世界。
Swyx [01:30:33]:不,Meta 发布了一个模型,好像是六种模态合一,对吧?
Vibhu [01:30:37]:是的。
Swyx [01:30:37]:我忘了那东西叫什么名字了,但好像是,对,好吧,深度是其中之一,但深度在某种意义上是 RGB 的一种变换。
Vibhu [01:30:45]:ImageBind。
Swyx [01:30:45]:ImageBind,对。
Vibhu [01:30:45]:是的。
Swyx [01:30:46]:还有哪些模态?他们有热成像?
Vibhu [01:30:47]:音频、深度、热成像、文本,Swyx [01:30:51]:不管 IMU 是什么。
Swyx [01:30:52]:我确实觉得,你不如干脆做紫外线。你不如干脆做,就随便什么你觉得可以的模态,因为对模型来说都是数据。
Anastasis [01:31:01]:是的。而且,一个大的赌注也是所有这些模态之间存在迁移。
Swyx [01:31:05]:是的。是的。
Anastasis [01:31:05]:所以我最喜欢的一个例子,现在来说已经相当老了,是有一个 Stable Diffusion 的微调版本,叫做 Riffusion,它是
Swyx [01:31:14]:那个音乐的那个。是的。
Anastasis [01:31:15]:是的,就是在频谱图上微调 Stable Diffusion。
Swyx [01:31:18]:频谱图。
Anastasis [01:31:18]:然后它变成了一个相当有能力的音乐生成器。对吧?所以可能存在空间模式,如果我们谈论视频的话,就是时空模式,它们在不同尺度和不同模态下涌现出来。所以模型在某种程度上做了元学习,使得如果你从一个只在图像上训练的模型开始,然后训练它去预测音频,会比从头只在音频上训练学得更快。还有一些其他有趣的例子。所以有一个叫 The Well 的项目。它是一个物理和数值模拟的数据集,涵盖物理、生物以及一堆其他领域。所以它本质上是跨越非常不同的空间和时间尺度的不同物理系统,从类似天体物理到低层次的原子级相互作用。我们已经看到——我们在这个上面做了一些工作,我们已经看到我们可以拿我们的视频模型,其中真实世界的视频看起来完全不像这些,你可以在那些数值模拟上微调它,就把它们当作 RGB 帧来处理。你就能比从头训练更快地获得合理的性能。
Anastasis [01:32:36]:是的。
Vibhu [01:32:36]:我觉得我们在各种语言上也看到了这一点,其中
Swyx [01:32:38]:是的,DeepSeek-OCR 也是。
Vibhu [01:32:40]:是的,DeepSeek-OCR。
Swyx [01:32:41]:就像,你不必对文本进行分词。你可以直接把它们作为图像扔进去。
Vibhu [01:32:44]:在那个基础预训练阶段会发生很多事情。就像很久以前有一种争论,人们说:“哦,人类有那么多感官表征,对吧?嗅觉、触觉。”模型还有整整两种我们甚至没有数据的模态。这就好比,好吧,你拿一个空气质量传感器,你可以试试这些东西,但仅仅是在基础训练器上就发生了那么多事情,以至于你从这些小东西里得不到那么多收获。
科学数据、跨模态迁移与全模态模型
Anastasis [01:33:10]:是的,完全正确。我认为它解决的就是数据稀缺问题。
Vibhu [01:33:13]:是的。
Anastasis [01:33:13]:所以你没有那么多。你有那么多可用的视频数据,但你没有,比如说,嗅觉数据
Vibhu [01:33:21]:很酷的一点是它反过来也成立,对吧?所以如果你想做物理,比如你想测量这个,或者你想让一个扩散模型处理音频,它的迁移效果非常好。所以就像在你的情况里,为机器人技术做的那一点点后训练,能让一个视频模型把它的基本原理用到另一个领域。所以我们也可以把这应用到其他东西上。
Anastasis [01:33:40]:是的。如果我们看看,比如你如何让那些模型在科学领域更有用,如果你看看 AlphaFold,他们拥有所有这些非常。由于数据,它需要被训练的数据量有限,它是一个非常精细调校的架构,专门用来解决蛋白质结构预测。但如果你把所有这些不同的科学数据来源汇集起来,把它们统一到一个单一模型之下,我觉得这是一种方法,可以帮助我们通过利用从一个模态或一组数据到另一个模态或另一组数据的所有学习成果,来解决科学领域中各种新型问题。所以这个方向还处于非常早期的阶段,但我确实认为那最终就是模拟世界的终极目标所在。你不只是在用 RGB。你把 RGB 当作一个起点,但你可以纳入越来越多宇宙的模态,并利用从一个模态学习到另一个模态所发生的迁移。
Vibhu [01:34:42]:我想接着问的是,全模态的缺点是什么?比如,为什么不是所有东西都是全模态模型?还有,为什么不是现在,以及为什么。你会从语言主干或图像视频主干开始,然后从那里走向全模态吗?这有影响吗?
Anastasis [01:34:57]:是的。我们需要一步一步来。我们需要先解决机器人技术,然后我们才能进入
Swyx [01:35:02]:现在就把一切解决掉。
Anastasis [01:35:05]:是的。我确实认为,对于那些全模态模型,需要进行大量开放式研究。当你把多种模态引入一个单一模型来进行预测时,有很多事情需要仔细考虑。但我认为,我预期这些是可以解决的。
结语:电影节与 AI 视频的未来
Swyx [01:35:23]:太棒了。你非常慷慨地付出了你的时间。祝贺你取得的所有成功,而且,是的,我很期待,AI 峰会,或者说物理 AI 峰会。
Anastasis [01:35:32]:是的,谢谢邀请我。
Swyx [01:35:33]:而且,是的,如果电影节在城里举办,人们应该去看看,对吧?
Anastasis [01:35:37]:是的。
Swyx [01:35:37]:是的。你会在各地巡展。
Anastasis [01:35:39]:是的。明年我们可能会那么做。所以我们每年五月或六月举办电影节
Swyx [01:35:45]:是的。
Anastasis [01:35:45]:我们上一场是在纽约、洛杉矶、东京,还有在 AI Engineer 办的,Swyx [01:35:52]:是的
Anastasis [01:35:53]:有道理。
Swyx [01:35:53]:是的。是的。
Anastasis [01:35:54]:所以,希望明年能在更多地方办。
Swyx [01:35:57]:不,我觉得总有一天,你会主持 AI 视频界的奥斯卡,而且我觉得人们应该把这件事非常当回事,把它当作一种可以从事的潜在职业。
Anastasis [01:36:07]:AI 视频界的奥斯卡会叫奥斯卡。
Swyx [01:36:10]:好吧。好吧。谢谢。
Anastasis [01:36:14]:谢谢。
关于本集的讨论
Latent Space:AI Engineer 播客
由 AI 工程师打造、为 AI 工程师而生的播客!2025 年,超过 1000 万读者和听众来到 Latent Space,收听有关 Software 3.0 的新闻、论文和访谈。
我们直接对话推动前沿的创始人、构建者和思想者,报道基础模型如何改变代码生成、多模态、AI 智能体、GPU 基础设施等各个领域。我们力求既为你提供对当下热点的权威解读,也为你带来对接下来 3 个月你将使用的技术的入门介绍!我们发布来自 OpenAI、Anthropic、Gemini、Meta(Soumith Chintala)、Sierra(Bret Taylor)、tiny(George Hotz)、Databricks/MosaicML(Jon Frankle)、Modular(Chris Lattner)、Answer.ai(Jeremy Howard)等的独家新闻和访谈。
完整节目笔记始终发布在 https://latent.space
赞助与商务咨询:[email protected]
由 AI 工程师打造、为 AI 工程师而生的播客!2025 年,超过 1000 万读者和听众来到 Latent Space,收听有关 Software 3.0 的新闻、论文和访谈。
我们直接对话推动前沿的创始人、构建者和思想者,报道基础模型如何改变代码生成、多模态、AI 智能体、GPU 基础设施等各个领域。我们力求既为你提供对当下热点的权威解读,也为你带来对接下来 3 个月你将使用的技术的入门介绍!我们发布来自 OpenAI、Anthropic、Gemini、Meta(Soumith Chintala)、Sierra(Bret Taylor)、tiny(George Hotz)、Databricks/MosaicML(Jon Frankle)、Modular(Chris Lattner)、Answer.ai(Jeremy Howard)等的独家新闻和访谈。
完整节目笔记始终发布在 https://latent.space
赞助与商务咨询:[email protected]
