传统的指令式视频编辑,大多建立在“原地编辑”假设上:输入一段固定时长的视频,模型逐帧对齐源视频,再完成风格或内容修改。这种方式适合静态片段,却难以处理开放式视频流,例如持续进行的直播游戏画面,或仍在拍摄中的镜头运动。InfinityEdit关注的正是后一类问题:模型根据已经出现的前一段视频和编辑请求,生成能够接续当前流的下一段视频;随着新的编辑指令到来,这个过程不断重复。

从片段编辑到持续编辑

论文将这一任务称为“无限视频编辑”。它与普通视频重绘的关键区别,不是简单延长输出时长,而是要求生成结果同时满足两点:一方面,下一段画面必须是前一段的可信延续,而不是对已有帧进行逐帧改写;另一方面,当多个编辑指令连续到来时,生成质量仍应保持稳定。也就是说,模型需要处理时间上的连续性,以及编辑效果随过程累积带来的影响。

为研究这一设定,作者首先设计了一个无限视频编辑的数据采集流程,并基于收集到的数据训练 InfinityEdit。它被定义为一种轻量级编辑适配器,用于为流式视频生成器增加持续编辑能力。材料没有说明数据规模、训练成本或具体评测结果,因此目前更适合把它理解为面向新任务的模型适配方案,而不是一套已经被充分量化验证的通用系统。

三类注意力模块协同工作

InfinityEdit包含三个注意力模块。历史交叉注意力使用输入帧指导去噪过程,帮助模型参考已经出现的视觉内容;时间因果自注意力限制时间信息只能从较早帧流向较晚帧,以维护流式生成中的先后关系;编辑交叉注意力则把编辑请求注入生成过程,使下一段视频能够响应当前指令。三者分别对应历史条件、时间因果和编辑控制,共同服务于连续生成。

我的判断

InfinityEdit的价值在于,它把视频编辑的对象从固定文件扩展到持续到来的内容流,问题定义更贴近直播、长镜头和交互式视觉生成等场景。轻量适配器的设计也显示出一种工程取向:尽量复用已有的流式视频生成器,而不是重新构建完整模型。不过,开放式生成对长期一致性和误差累积的要求很高,论文摘要并未给出稳定性、可扩展时长或复杂指令组合方面的具体结果。因此,它目前更像是一个值得关注的任务设定与适配方向,实际适用边界仍需结合完整实验验证。