ElasticTTT 研究的是视频编辑里一个很具体的失控点:模型为了记住源视频,最后反而不听新的编辑指令,也守不住未编辑区域。论文把它拆成「条件塌缩」和「空间纠缠」两种失败。1
论文给出的修补分三处:训练时用 Target Distribution Regularization 给目标加入零均值扰动,避免模型把源视频压成一个单点;推理时用 Contrastive CFG 拉开源指令和目标指令;局部编辑时用 Asynchronous Noise Scheduling,让修改区和保留区沿不同噪声轨迹采样。1
对创作者来说,验收视频编辑不能只看「改完像不像」。还要看新指令有没有真正改变目标对象,未编辑区域是否保持动作、背景和镜头连续性,以及连续修改几轮后是否仍然可控。论文页面标注为 Technical report,它展示的是方法与实验,不等于已经有可直接使用的剪辑软件。1




Comments
Sign in to comment.