Google Research 提出用于连贯长视频生成的 AI video co-director 框架
Automating coherent long-form video generation
Google Research 介绍了一套用于连贯长视频生成的研究框架,以 AI video co-director 统一协调 Gemini 和 Veo 上的多智能体视频叙事流程。
文章将长视频一致性拆成规划、记忆与闭环优化问题,可为多镜头生成工作流提供结构化参考。
视频扩散领域的最新进展展现了卓越的高保真生成能力,模型可以在数秒内渲染出逼真的场景。然而,尽管扩散模型能够生成高保真视频片段,将其转化为连贯的长篇叙事引擎仍然具有挑战性。
大多数现有的代理式流水线通过链式模块自动化这一过程,但由于独立的、手工编写的提示词,它们会遭遇语义漂移(角色服装或场景在镜头之间发生细微变化)和级联故障(例如,上游素材伪影破坏下游视频合成)。由于早期错误会传播并破坏长程一致性,这一过程往往需要大量人工干预。从结构角度看,这反映了经典的信用分配问题,因为终端故障很难追溯到具体提示词。此外,现有方法还存在特征漂移,即实体和环境逐渐发生非有意的变化,或内容坍塌,即叙事无法有意义地推进。
今天,我们介绍我们关于 AI 视频联合导演的研究:这是一个统一的多代理框架,能够在多镜头叙事中显式规划视觉连续性。该框架构建在 Gemini 和 Veo 之上的编排层中,因此原生继承了诸如 SynthID 水印之类的安全机制。通过将长篇生成视为全局优化和世界状态跟踪问题,我们开发了一套框架——Co-Director(将发表于 COLM 2026)、CANVAS(将发表于 EMNLP 2026)、A²RD 和 VQQA——它们通过自动化重复性的编排任务,将高层次的人类创意规范转化为可执行内容,这些任务涵盖多模型提示、镜头衔接以及闭环视觉优化。
我们设计这些框架,使其充当响应式创意伙伴,抽象掉维持视觉连续性的负担,让用户能够专注于叙事艺术。该架构通过将质量建模为测试时目标,将创意合成与一致性解耦。在全面评估中,我们的框架在多镜头叙事一致性和角色持续性方面表现出显著提升,成功生成了数分钟长的视频,同时缓解了视觉漂移和流水线错误传播。
工作原理
为了解决长程视频这一多方面问题,我们将研究拆解为四个基础支柱,每个支柱都针对生成流水线中的一个特定瓶颈。
1. 用 AI 视频联合导演编排创意意图
为确保整段视频的语义连贯性,我们提出了 AI 视频联合导演,这是一个分层多代理框架,将视频叙事形式化为全局优化问题。我们并不依赖僵硬的线性提示词链,而是引入分层参数化:由一个多臂老虎机(MAB)在全局识别有前景的创意方向。
这将创作过程形式化为在探索新颖叙事策略与利用有效创意配置之间寻求最佳平衡的过程。该系统会抽样抽象的创意轨迹——例如将信息型策略与片段式叙事模式以及特定美学原型相结合——并将其动态注入子智能体的系统提示词中。这种自上而下的引导确保整个流水线在统一愿景下运行。由于我们的 AI 视频联合导演框架作为一个编排层运行,它通过将这些结构化提示词直接输入基础 Gemini 和 Veo 模型来实现这一愿景(尽管其模型无关架构允许它搭建在任何基础生成模型之上)。这种架构确保所有生成的图像、视频和音频都天然带有原生安全保护,包括 SynthID 水印。在生产中,还可以对最终视频应用额外的安全分类器,以防范各个安全片段之间发生意外的上下文交互。
该流水线通过两个相互连接的循环执行全局优化:战略引导和多阶段制作。首先,编排器智能体使用 MAB 算法评估输入,以在三个维度上选择创意配置:(1) 创意策略(意图),(2) 叙事模式(故事结构),以及 (3) 美学原型(视觉基调和摄影风格)。这一配置驱动制作层级。前期制作智能体将简要的逐场景故事线和视觉资产综合成统一的故事板。随后,制作智能体使用专门的子智能体将该故事板转化为具体的视听媒体:关键帧智能体锚定角色和场景视觉,视频智能体添加运动,音频智能体叠加匹配的旁白和配乐。
最后,一个多模态 LLM(MLLM)评审会从三个指定维度对编译后的剪辑进行评判,并将分解后的奖励信号反馈给 MAB,以便在连续的生成循环中迭代地改进和优化选择。
2. 使用 CANVAS 进行视觉故事板制作
即使有统一的脚本,生成长序列镜头也常常会导致角色漂移和环境不稳定。为了解决这一问题,我们引入了通过视觉智能体故事板实现的连续性感知叙事(CANVAS),这是一个多智能体框架,可在多镜头叙事中显式规划视觉连续性。
CANVAS 通过在叙事演进过程中维护角色、地点和物体状态的结构化表示来强制实现连贯性。它构建为 Gemini 之上的编排层,依赖于持久的视觉记忆。通过从记忆中检索视觉锚点,或在需要时初始化新的视觉锚点,CANVAS 确保在同一场景内实现平滑过渡。这种显式的世界状态建模确保角色在再次出现时保持其身份,环境在被重新访问时保留其空间结构。
为了直观展示这些能力,下图展示了一个多镜头的博物馆盗窃序列,将 CANVAS 与具有代表性的基线方法进行了比较:使用底层基础模型(Gemini-3.1-Pro)直接生成,以及一种替代性的多智能体框架(AutoStudio)。图底部的提示词突出显示了反复出现的元素——例如小偷、展厅和宝石——这些元素必须保持相同的视觉特征。请注意每种方法如何处理连续转场(例如角色的服装)与非连续转场(例如镜头在绕开一段后返回主大厅时)。仅使用 Gemini-3.1-Pro 生成会出现道具不一致(文物发生变化)和背景漂移(房间布局改变),显示出无引导生成的局限性。AutoStudio 在镜头切换之间也会退化,导致角色漂移(小偷的帽子消失)和背景不一致。相比之下,CANVAS 的持久视觉记忆确保角色、空间几何结构和物体状态在整个叙事中都保持完全连贯。
3. 使用 A²RD 扩展时间动态
为了将故事板转化为实际长度达数分钟的视频,我们开发了 A²RD,这是一种智能体式自回归视频生成架构。A²RD 采用逐段生成,并由多模态视频记忆增强,该记忆会跟踪各片段的上下文和动态。
对于每个片段,它以“检索—合成—优化—更新”的循环运行。这个循环的关键部分在于智能体如何自适应地确定片段生成模式。它会在外推与插值之间平滑切换:外推用于实现自然的叙事推进,而插值则将片段锚定到现有实体和环境。这有效平衡了故事向前推进的需求与维持场景物理现实性的必要性。
为了测试该系统,下方的十分钟影片展示了一次长篇生成,这要求在数分钟的时间间隔中保持一致的叙事推进。该视频突出展示了系统如何在两种运行模式之间动态切换:使用外推将情节推进到新的叙事节点,并使用插值将回归的角色和环境锚定到其原始设计。标准视频生成器会遭受严重的视觉衰减——角色发生变异、地点发生变形——而 A²RD 会持续查询其多模态视频记忆,从开场镜头到最后一帧都保持角色身份、服装细节和结构几何的一致性。
4. 使用 VQQA 进行闭环优化
最后,我们需要一种方法,让系统能够自主识别并修复视觉伪影。现有的测试时优化方法通常要么计算成本高昂,要么需要对白盒模型内部进行访问。为解决这一问题,我们开发了 Video Quality Question Answering(VQQA),这是一个统一的多智能体框架,可泛化到多种输入模态和视频生成任务。
VQQA 会动态生成针对特定提示量身定制的视觉问题,并将由此产生的 视觉-语言模型(VLM)评议用作语义梯度(提供自然语言形式的方向性反馈,以指导迭代优化,类似于反向传播中的数值梯度)。这用人类可理解、可执行的反馈取代了传统的被动评估指标。随后,系统可以通过自然语言界面执行一个高效的迭代反馈循环(模型生成视频,通过视觉问题对其进行评估,并根据评议优化文本提示)。为防止在这一优化过程中出现语义漂移,VQQA 采用了 全局选择机制:它不是盲目采用最后一次迭代的输出,而是由一个全局 VLM 评分器根据原始、未编辑的提示,对优化轨迹中生成的每个视频进行评估。然后系统选择得分最高的候选项,确保局部修正不会损害更广泛的上下文。
在实践中,VQQA 更像是一个黑盒提示优化器,而不是像素级编辑器。它不会直接修改像素,而是迭代优化文本提示,以纠正高层次的构图缺陷,例如属性绑定错误或角色属性不一致。这个更新后的提示会引导生成器在其潜在空间中采样一条新路径。在下面的示例中,VQQA 并不会对原始帧进行遮罩或覆盖绘制;相反,它通过在严格的长方体几何形状上渲染逼真的聚酯薄膜气球纹理,解决了模型在材质绑定上的困难,并通过让小提琴手和钢琴家在不同镜头中始终固定于各自的乐器,修复了表演中途混乱的乐器变化问题。
关键结果与基准
为了严格评估我们的框架,我们开发了三个专门的基准,旨在模拟专业视频制作中的挑战。
- GenAD-Bench:采用人在回路流程,将 Gemini 3 Pro 与专门的图像模型配对,用于构建 50 个虚构品牌,每个品牌包含四种不同产品。在 400 个独特场景中,它测试精确的营销约束,而不依赖版权冲突或训练先验。
- HardContinuityBench:旨在评估空间和环境连续性。该基准使用复杂的 GPT-5.2 多镜头叙事分镜生成,通过场景再次出现之间的巨大间隔、演员频繁更换服装和配饰,以及交互式道具的复杂状态变化来挑战模型。
- LVBench-C:针对长时程时间动态。该数据集包含 120 个纯文本场景,分为不断演变的角色状态、变化的对象属性和渐进式环境揭示,并维持严格的间隔规则:关键视觉资产必须消失至少 10 个片段后,才能带着符合现实且由叙事驱动的变化重新出现。
我们的评估表明,相较于现有视频生成架构,我们取得了可衡量的性能提升。通过探索创意策略搜索空间,AI 视频联合导演在 GenAD-Bench 上达到 81.4 的峰值质量得分,并在 ViStoryBench 上增强了故事一致性。CANVAS 利用结构化视觉记忆来缓解场景漂移,在 ST-Bench 和 HardContinuityBench 上的场景再次出现时带来了显著的连续性提升。对于长时段时间动态,A²RD 可最大限度减少布局漂移,从而在连续数分钟的运行中提升角色和环境一致性,相关评估基于 VBench-Long 和 LVBench-C。最后,VQQA 的闭环提示优化解决了物理和构图不一致问题,在 T2V-CompBench、VBench2 和 VBench-I2V 上实现了显著的绝对质量提升。有关我们的模型架构、训练配置和基线评估的完整细节,请参阅各篇论文。
未来方向
这些框架代表着朝着为创作者解锁连贯、长跨度视觉叙事迈出的基础性一步。随着我们继续完善这些智能体架构,我们正在探索如何整合人在回路中的工作流。我们的最终目标不是取代人类叙事,而是通过抽象掉时间一致性和世界状态跟踪中繁琐的复杂性来赋能创作者,确保他们始终掌控创意方向和叙事设计。
致谢
这项工作得以完成,离不开 Google 更广泛研究团队的共同努力。我们要感谢 Andrew Pan、Brett Slatkin、Burak Gokturk、Carina Claassen、Daniel Vlasic、Do Xuan Long、Ishani Mondal、Jasmine Leon、Jingyun Liu、Joe Timmons、Jordan Boyd-Graber、Khanh G. LeViet、Kuang Su、Long T Le、Mihir Parmar、Min-Yen Kan、Nathan Hodson、Nick Losier、Palash Goyal、Rhyard Zhu、Sebastian Ko、Scott Penberthy、Yan Xu、Yang Li、Ye Jin、Zack Chomyn 和 Tomas Pfister 为这一系列研究作出的宝贵贡献。
来源:Google Research · research.google