返回 文章 学习 CMS 文章

Google 多智能体框架实现连贯长视频生成

Google 用多智能体编排层将长视频生成转化为全局优化与世界状态跟踪问题,显著提升多镜头叙事一致性。

多智能体长视频生成视频扩散模型视觉连续性
成长分 / 100 75 综合收获、行动、留存与影响

Google 多智能体框架实现连贯长视频生成
为什么值得读了解 Google 如何将长视频生成从线性提示链重构为全局优化问题,突破身份漂移和级联故障瓶颈。

掌握 Co-Director、CANVAS、A²RD、VQQA 四个框架各自解决的具体问题与协作方式。

关键洞察
  1. 现有线性智能体流水线因独立手工提示词导致语义漂移和级联故障,早期错误会传播并破坏长时程一致性。
  2. Co-Director 将视频叙事形式化为全局优化问题,用多臂老虎机在创意策略、叙事模式、美学原型三个维度搜索最优配置。
  3. CANVAS 通过维护角色、地点和物体的结构化表示与持久化视觉记忆,显式规划多镜头视觉连续性。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:16319

2026年9月24日

Yale Song 和 Yiwen Song,Google 研究科学家

我们提出了一种统一的多智能体框架,能够自主生成时间上一致的长篇视频叙事,克服了当前线性 AI 流水线中的身份漂移和级联故障问题。

视频扩散模型的最新进展展示了卓越的高保真生成能力,模型能够在几秒内渲染出逼真的场景。然而,尽管扩散模型能生成高保真的视频片段,将其转化为连贯的长篇叙事引擎仍然充满挑战。

大多数现有的智能体流水线通过链式模块来自动化这一过程,但由于独立、手工设计的提示词,它们会遭受语义漂移(角色服饰或场景在镜头间的细微变化)和级联故障(例如,上游资产伪影破坏下游视频合成)的困扰。由于早期错误会传播并破坏长时程一致性,该过程通常需要大量人工干预。从结构上看,这反映了经典的信用分配问题,因为终端故障难以追溯到具体的提示词。此外,现有方法还存在特征漂移(实体和环境无意中逐渐变化)或内容崩溃(叙事无法有意义地推进)的问题。

今天,我们介绍了关于 AI 视频联合导演的研究,这是一个统一的、多智能体框架,明确规划多镜头叙事中的视觉连续性。该框架作为构建在 Gemini 和 Veo 之上的编排层,原生继承了 SynthID 水印等安全机制。通过将长视频生成视为全局优化和世界状态跟踪问题,我们开发了一套框架——Co-Director(将在 COLM 2026 上发表)、CANVAS(将在 EMNLP 2026 上发表)、A²RD 和 VQQA——这些框架通过自动化重复的编排任务(从多模型提示和镜头链接到闭环视觉优化),将高层次的人类创意规范转化为执行。

我们将这些框架设计为响应式的创意伙伴,抽象掉维护视觉连续性的负担,让用户能够专注于叙事艺术。该架构通过将质量建模为测试时目标,将创意合成与一致性解耦。在综合评估中,我们的框架在多镜头叙事一致性和角色持久性方面表现出显著提升,成功生成长达数分钟的视频,同时减轻了视觉漂移和流水线错误传播。

为了解决长时程视频的多方面问题,我们将研究分解为四个基础支柱,每个支柱针对生成流水线中的特定瓶颈。

为确保整段视频的语义连贯性,我们提出了 AI 视频联合导演,这是一个分层多智能体框架,将视频叙事形式化为一个全局优化问题。我们不再依赖僵化的线性提示链,而是引入分层参数化:一个多臂老虎机(MAB)在全局层面识别有前景的创意方向。

这将创作过程形式化为在探索新颖叙事策略与利用有效创意配置之间寻找最优平衡的搜索过程。系统采样抽象的创意轨迹——例如将信息型策略与小品式叙事模式以及特定美学原型相结合——并将这些轨迹动态注入子智能体的系统提示中。这种自上而下的引导保证了整个流水线在统一愿景下运作。由于我们的 AI 视频联合导演框架作为编排层运行,它通过将这些结构化提示直接馈入基础 Gemini 和 Veo 模型来实现这一愿景(尽管其模型无关的架构允许它置于任何基础生成模型之上)。该架构确保所有生成的图像、视频和音频天然带有原生安全保护,包括 SynthID 水印。在生产环节,还可以对最终视频应用额外的安全分类器,以防止单独安全的片段之间出现意外的上下文交互。

该流水线通过两个相互连接的循环执行全局优化:战略引导与多阶段制作。首先,编排智能体(Orchestrator Agent)使用 MAB 算法评估输入,以在三个维度上选择创意配置:(1) 创意策略(意图),(2) 叙事模式(故事结构),以及 (3) 美学原型(视觉基调与摄影风格)。该配置驱动制作层级。前期制作智能体(Pre-Production Agent)将逐场景的故事梗概与视觉素材综合为统一的故事板。随后,制作智能体(Production Agent)使用专门的子智能体将该故事板转化为具体的视听媒体:关键帧智能体(Keyframe Agent)锚定角色与场景视觉,视频智能体(Video Agent)添加运动,音频智能体(Audio Agent)叠加匹配的旁白与配乐。

最后,一个多模态 LLM(MLLM)评审器(Judge)在三个指定维度上对剪辑成片进行评判,将分解式奖励信号反馈给 MAB,以在连续的生成循环中迭代优化选择。

AI 视频联合导演多智能体流水线。上:* 编排智能体利用 MAB 在分解式创意动作空间中导航。* 下:* 前期制作智能体综合创意简报、故事梗概与视觉素材,建立一致的故事板,制作智能体将其转化为同步的关键帧、视频片段与音频。MLLM 评审器评估最终视频以生成分解式奖励信号,该信号被传播回 MAB,以在优化循环中迭代优化创意配置。*

即便使用统一的脚本,生成长序列镜头也常常导致角色漂移和环境不稳定。为解决这一问题,我们提出了通过视觉智能体分镜实现连续性感知叙事(CANVAS),这是一个多智能体框架,能够在多镜头叙事中显式地规划视觉连续性。

CANVAS 通过维护角色、地点和物体状态的结构化表示来强制保持一致性,并随着叙事的发展而演进。它作为构建在 Gemini 之上的编排层,依赖于持久化的视觉记忆。通过从记忆中检索视觉锚点或在需要时初始化新的锚点,CANVAS 确保在同一场景内的平滑过渡。这种显式的世界状态建模确保了角色在重新出现时保持其身份,环境在再次访问时保留其空间结构。

为了直观地看到这些效果,下图展示了一个多镜头的博物馆盗窃序列,将 CANVAS 与代表性基线进行对比:使用底层基础模型(Gemini-3.1-Pro)的直接生成,以及另一种多智能体框架(AutoStudio)。图底部的提示词突出了反复出现的元素——例如小偷、展厅和宝石——这些元素必须保持相同的视觉特征。请注意每种方法如何处理连续过渡(例如角色的服装)与非连续过渡(例如镜头绕行后返回主厅)。仅使用 Gemini-3.1-Pro 生成会表现出道具不一致(文物发生变化)和背景漂移(房间布局偏移),显示了无引导生成的局限性。AutoStudio 在镜头切换时也会退化,导致角色漂移(小偷的帽子消失)和背景不一致。相比之下,CANVAS 的持久化视觉记忆确保了角色、空间几何和物体状态在整个叙事中保持完美一致。

在 HardContinuityBench 的博物馆盗窃序列上的视觉分镜对比,将 CANVAS 与 AutoStudio* 和 Gemini-3.1-Pro 基线进行对照。*

为了将分镜转化为实际长达数分钟的视频,我们开发了 A²RD,一种智能体自回归视频生成架构。A²RD 采用逐段生成,并辅以多模态视频记忆来跟踪片段上下文和动态。

对于每个片段,它在检索-合成-精炼-更新的循环中运行。该循环的一个关键部分是智能体如何自适应地确定片段生成模式。它在外推——允许自然的叙事推进——和插值之间平滑切换,后者将片段锚定到现有实体和环境。这有效地平衡了故事向前推进的需求与保持场景物理现实性的必要性。

为测试这一系统,下方这段十分钟的影片展示了一次长时程生成,它要求在长达数分钟的时间跨度内保持连贯的叙事推进。该视频凸显了系统如何在两种运行模式之间动态切换:利用外推将情节推向新的叙事节拍,利用插值将回归的角色与环境锚定到其原始设定。标准视频生成器会遭受严重的视觉衰减——角色发生变异、场景发生形变——而 A²RD 持续查询其多模态视频记忆,以从开场镜头到最后一帧维持角色身份、服装细节与结构几何。

长时程视频,展示 A²RD 在连续十分钟时长内维持严格视觉一致性与叙事推进的能力。

最后,我们需要一种让系统自主识别并修复视觉伪影的方法。现有的测试时优化方法通常要么计算开销高昂,要么需要白盒访问模型内部。为解决这一问题,我们开发了视频质量问答(VQQA),一个统一的多智能体框架,可泛化到多样的输入模态与视频生成任务。

VQQA 动态生成针对特定提示词量身定制的视觉问题,并将由此得到的视觉语言模型(VLM)评判用作语义梯度(提供自然语言的方向性反馈以引导迭代精炼,类似于反向传播中的数值梯度)。这以人类可解释、可操作的反馈取代了传统的被动评估指标。随后,系统可通过自然语言接口执行一个高效、迭代的反馈循环(模型生成视频,通过视觉问题对其进行评估,并基于评判精炼文本提示词)。为防止这一精炼过程中的语义漂移,VQQA 采用了一种全局选择机制:并非盲目采用最终迭代的输出,而是由一个全局 VLM 评分器将优化轨迹中生成的每一个视频与原始、未经编辑的提示词进行对照评估。系统随后选出得分最高的候选,确保局部修正不会损害更广泛的上下文。

在实践中,VQQA 作为黑盒提示词优化器运行,而非像素级编辑器。它不直接修改像素,而是迭代精炼文本提示词,以纠正诸如属性绑定错误或角色属性不一致之类的高层构图缺陷。这一更新后的提示词引导生成器在其潜空间中采样一条新路径。在下方示例中,VQQA 并未对原始帧进行遮罩或覆盖绘制;相反,它通过将逼真的聚酯薄膜气球纹理渲染到严格的立方体几何上,解决了模型的材质绑定难题,并通过让小提琴手与钢琴手在镜头切换间始终锚定于各自的乐器,修复了演奏中途混乱的乐器更换。

解决属性绑定错误。* 提示词:“一个长方体气球飘过圆形窗户,阳光透过玻璃窗格照射进来。” 原始生成(左)通过渲染一个僵硬、无纹理的立方体,未能捕捉到气球的属性,而 VQQA(右)成功强制实现了预期的长方体形状,同时保持了充气气球的纹理和材质特性。通过利用迭代视觉反馈,优化后的提示词引导生成器渲染出一个轮廓分明、带有边缘和接缝的盒状聚酯薄膜气球,平稳地飘过阳光照射的窗户。*

解决时间不一致性。* 提示词:“小提琴家和钢琴家以和谐的二重奏表演吸引观众。” 原始生成(左)在镜头切换时出现严重的连续性断裂,最初显示一位女钢琴家和一位男小提琴家,但切换后突然描绘成这位女性在拉小提琴。VQQA(右)在整个表演过程中保持严格的语义一致性,使女钢琴家和男小提琴家始终与各自的乐器绑定。*

为了严格评估我们的框架,我们开发了三个专门的基准测试,旨在模拟专业视频制作中的挑战。

我们的评估表明,与现有视频生成架构相比,性能有可衡量的提升。通过探索创意策略搜索空间,AI 视频联合导演在 GenAD-Bench 上达到了 81.4 的峰值质量分数,并在 ViStoryBench 上增强了故事一致性。CANVAS 利用结构化视觉记忆来缓解场景漂移,在 ST-Bench 和 HardContinuityBench 上,在场景重现方面产生了显著的连续性提升。对于长时间时间动态,A²RD 最小化布局漂移,以在 VBench-Long 和 LVBench-C 上的连续多分钟运行中提高角色和环境一致性。最后,VQQA 的闭环提示优化解决了物理和构图不一致问题,在 T2V-CompBench、VBench2 和 VBench-I2V 上带来了显著的绝对质量提升。有关我们的模型架构、训练配置和基线评估的全面详细信息,请查阅各篇论文。

这些框架代表着朝着为创作者解锁连贯、长视野视觉叙事迈出的基础性一步。随着我们继续完善这些智能体架构,我们正在探索如何整合人在回路的工作流程。我们的最终目标不是取代人类叙事,而是通过抽象掉时间一致性和世界状态跟踪的繁琐复杂性来赋能创作者,确保他们始终掌控创意方向和叙事设计。

这项工作得以完成,离不开 Google 各研究团队的不懈努力。我们要感谢 Andrew Pan、Brett Slatkin、Burak Gokturk、Carina Claassen、Daniel Vlasic、Do Xuan Long、Ishani Mondal、Jasmine Leon、Jingyun Liu、Joe Timmons、Jordan Boyd-Graber、Khanh G. LeViet、Kuang Su、Long T Le、Mihir Parmar、Min-Yen Kan、Nathan Hodson、Nick Losier、Palash Goyal、Rhyard Zhu、Sebastian Ko、Scott Penberthy、Yan Xu、Yang Li、Ye Jin、Zack Chomyn 和 Tomas Pfister,感谢他们为这一系列研究做出的宝贵贡献。