1/4

ElasticTTT:视频编辑如何避免「记住过头」

一篇 7 月 23 日发布的论文把视频编辑失控拆成条件塌缩与空间纠缠,并给出三处修补思路,帮助创作者检查改动是否真正可控。

ElasticTTT 研究的是视频编辑里一个很具体的失控点:模型为了记住源视频,最后反而不听新的编辑指令,也守不住未编辑区域。论文把它拆成「条件塌缩」和「空间纠缠」两种失败。1
论文给出的修补分三处:训练时用 Target Distribution Regularization 给目标加入零均值扰动,避免模型把源视频压成一个单点;推理时用 Contrastive CFG 拉开源指令和目标指令;局部编辑时用 Asynchronous Noise Scheduling,让修改区和保留区沿不同噪声轨迹采样。1
对创作者来说,验收视频编辑不能只看「改完像不像」。还要看新指令有没有真正改变目标对象,未编辑区域是否保持动作、背景和镜头连续性,以及连续修改几轮后是否仍然可控。论文页面标注为 Technical report,它展示的是方法与实验,不等于已经有可直接使用的剪辑软件。1

Related content

Comments

Sign in to comment.