
AI视频开始竞争「可持续修改」:实时生成、蒸馏效率与编辑边界
Visko Orbis、DistillAlign与Gemini Omni Flash评测共同显示,AI视频的下一项产品能力不是单次生成,而是低延迟地持续修改,同时守住长时一致性、覆盖率、成本和来源记录。
过去两日最有信息量的变化,不是又一个模型把短片做得更像电影,而是视频系统开始把「修改」本身当成一等能力:用户可以在生成中途改变指令,模型要继续往前跑;服务端要记住已经交付的内容;评测还要判断它有没有在追求速度时丢掉多样性。本期窗口为 2026 年 7 月 29 日 09:00 至 7 月 31 日 09:00(北京时间)。其中,Visko Orbis 1.0 和 DistillAlign 是窗口内提交的两篇 arXiv 预印本,Artificial Analysis 则在 7 月 31 日发布了 Gemini Omni Flash 的视频编辑评测更新。
实时生成,先改变的是运行时
Visko Orbis 1.0 把视频生成定义成一个持续运行的过程,而不是一次请求对应一个固定文件。论文称,用户可以在生成过程中随时切换提示词,更新会实时反映在后续画面中;系统同时支持文生视频、图生视频、视频续写和多语言提示。1
它给出的工程组合也比「把 10 秒片段拼起来」复杂:分块式流式生成器负责继续往前生成,有界多尺度记忆保存近期和较早的场景状态,编译后的 Transformer、多 GPU 序列并行和渐进式解码负责把结果送出去。论文在 HTML 版本中称,提示词更新的平均可见响应低于 1 秒;原生生成分辨率为 832×480,再由流式超分辨率模块处理到 4K、24 FPS。2
这里有一个容易被 4K 和 24 FPS 遮住的细节:新提示词只影响尚未提交的分块,已经交付的画面不会回写。换句话说,Visko Orbis 展示的是「带状态的连续生成」,不是像剪辑软件那样回到第 37 秒,精确替换一个物体,再让后面的镜头自动重算。前者更适合实时互动,后者才接近成熟制作流程中常见的局部修订。
这也是论文自述里最值得保留的边界。它报告了小时级 rollout、74 个事件案例,以及 60 秒和 120 秒输出的人工偏好测试;但没有给出完整的 GPU 型号与数量、单位生成成本、延迟分布和显存占用。论文还提醒,不同系统的部分评测使用了不完全匹配的提示词套件,原始分数更适合作为描述性结果,而不是严格的横向排名。2
所以,Visko Orbis 的新意不在于它已经证明「实时 4K 视频」是低成本商品,而在于它把产品接口往前推了一步:视频不再只是一次生成的文件,而是一个有历史、有当前指令、还有未提交状态的服务会话。这个变化一旦成立,评价对象就从单帧质量转向状态管理。
快模型最容易丢掉的,可能是答案的范围
7 月 29 日提交的 DistillAlign 论文,从另一侧补上了这条运行时路线的风险。作者指出,视频蒸馏通常把「生成得像不像」作为主要判断,视觉分数却可能掩盖学生模型对教师分布覆盖不足的问题。论文用共享潜空间里的 precision 和 coverage 来衡量学生样本是否落在教师分布支持范围内,并把 Distribution Matching Distillation 的 mode-seeking 目标与 Consistency Distillation 的 mode-covering 约束结合起来。3
作者项目页报告,在 Wan2.1-14B teacher 的实验中,联合方法的 VBench 为 84.83、coverage 为 0.69、diversity 为 1.304;弱 teacher 版本的 VBench 为 84.54、coverage 为 0.59、diversity 为 1.305。项目页还展示了一个反直觉现象:纯 DMD 训练继续推进时,VBench 先升后降,diversity 却持续下降。4
这篇论文没有测试多轮视频编辑,不能直接证明某个编辑产品会怎样。但它提出的风险正好击中实时系统的商业假设:如果一个低延迟模型只擅长迅速回到高概率、最安全的画面区域,用户每次修改得到的可能都是「看起来不错,但越来越像」的结果。广告变体、角色动作和镜头调度都需要受约束的变化,而不是每一轮都把细节收敛到同一套答案。
因此,蒸馏的目标不能只写成「更快地生成」。对编辑运行时来说,至少还要问两个问题:修改目标是否被满足,未修改的内容是否保持稳定;在同一个约束下,系统能否提供足够多的可用变体。VBench、FID 或一张漂亮的演示图,回答不了第二个问题。
商业化信号在「修改动作」,不在榜单第一
7 月 31 日,独立评测机构 Artificial Analysis 发布 Gemini Omni Flash 的视频编辑评测更新,称它在该机构的视频编辑榜单首次排名第一,并在 Complex Edits、Object Editing、Visual Effects Editing、Physics & World Simulation 五类中的四类居首。机构称,它在需要同时处理多条指令的 Complex Edits 上领先下一模型 117 个 Elo;该模型按输出视频计费,约为 0.10 美元/秒,也就是 6 美元/分钟。5 6
这条信息的价值,不是再给模型贴一张「第一」的奖状,而是把付费动作说清楚了:用户把现有视频交给系统,要求它改风格、增删对象、调整灯光或修改屏幕文字,同时保留其余场景,并在多轮交互中继续修改。Google 的官方公告早在 6 月 30 日就已把对话式编辑、10 秒输出和 0.10 美元/秒的价格写进产品基线;本期的新进展是独立评测开始把「能不能连续改」单独拿出来比较,而不是模型刚刚发布。7
但榜单不能替代生产数据。Artificial Analysis 明确写道,Gemini Omni Flash 拒绝了部分视频编辑提示词,尤其是涉及人物的提示词;榜单结果只统计成功生成的提示词。评测页面本身也会随新模型加入而变化,当前页面显示 MiniMax-H3 已排在 Gemini Omni Flash 之上。5 8
这暴露了一个经常被忽略的商业变量:内容拦截会改变评测的分母。一个模型如果在高风险人物场景上拒答更多,安全性可能更高,榜单覆盖率却可能更低;如果评测只看成功样本,排名也不能直接推导为真实工作流中的通过率。6 美元/分钟是模型输出价,不是成片成本。失败重试、人工复核、素材版权、存储、导出和平台转码,都还没有进入这个数字。
合规要进入编辑状态,而不是只贴在成片上
对话式编辑让合规问题变得更具体。一次新生成至少可以记录提示词和输出;一次多轮编辑还要记录原始素材、每次修改指令、模型版本、被拒绝的请求,以及最后一版与原始素材的关系。上游产品已经把 SynthID 水印和内容验证入口写入 Gemini Omni Flash 的官方说明,但这只能证明厂商提供了标识机制,不能证明水印或来源信息在多轮编辑、重新导出和平台转码后仍然完整。7
这意味着,视频编辑产品的责任边界会从「发布前是否贴了 AI 标签」向前移动:系统是否保存原始素材的授权范围,是否能复查哪一轮修改加入了人物、台词或屏幕文字,是否能把拒答和人工放行记录下来。这里的判断是产品推论,不是本期发现了新的监管条文;但 Artificial Analysis 对人物提示词的拒答,已经说明安全策略会直接影响编辑能力的可用范围和评测结果。
对于企业采购,最需要追问的不是「有没有水印」这一项,而是水印、来源和编辑日志能否连成一条可复核链。对平台来说,能识别「这是 AI 生成的」还不够,还要知道它是基于哪段原始视频改了什么。否则,内容标识只是成片上的标签,无法回答争议发生时最实际的问题:谁改了哪一部分,改动是否经过授权。
下一轮验收,不要只问是不是 4K/24 FPS
把这三份材料放在一起,行业信号已经很清楚:实时生成、低成本蒸馏和对话式编辑正在被放进同一个产品方向里。但它们还没有证明完整的商业闭环。下一轮验收至少应同时看以下指标:
- 编辑延迟:不只报平均值,还要报不同提示词长度、并发量和长时运行下的延迟分布。
- 未修改内容的保真度:改变一个对象时,人物身份、镜头构图、台词和时间线是否保持不变。
- 长时漂移:连续运行几十分钟或几小时后,角色、色彩、空间关系和声音是否仍然稳定。
- 覆盖率与多样性:蒸馏后模型有没有只剩高概率答案;同一约束下的可用变体是否减少。
- 拒答覆盖与通过率:被拦截的提示词要单独计入分母,人物、版权和敏感场景不能只从榜单里消失。
- 单位成片成本:把失败重试、人工审核、版权清理、存储和导出一起算,而不是只看 API 每秒价格。
- 来源链完整性:原始素材、编辑指令、模型版本、输出文件和标识状态能否在多轮修改后对应起来。
当前最稳妥的判断是:AI 视频的产品竞争正在从「生成一段画面」转向「持续修改一条状态化的视频流」,但实时性仍只是服务能力,连续编辑才是产品假设,合规记录则是这条假设能否进入企业流程的基础设施。Visko Orbis 证明了新的运行时形态可以被设计出来,DistillAlign 提醒我们速度可能以覆盖率为代价,Artificial Analysis 的评测则把编辑动作和拒答分母摆上了同一张考卷。距离收入、留存和稳定毛利,三者都还差一组公开的生产数据。
References
- 1Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation
- 2Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation(HTML)
- 3DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation
- 4DistillAlign 项目页
- 5Artificial Analysis:Gemini Omni Flash 视频编辑榜单更新
- 6Artificial Analysis:Gemini Omni Flash 编辑类别分项结果
- 7Start building with Nano Banana 2 Lite and Gemini Omni Flash
- 8Artificial Analysis 视频编辑榜单
Related content
- Sign in to comment.
