从训练字幕到显存预算:AI视频系统的成本边界正在变窄

从训练字幕到显存预算:AI视频系统的成本边界正在变窄

两篇 7 月 21 日提交的预印本把 AI 视频的产品判断落到训练数据正确性、在线循环稳定性和可核验的系统成本上。

两个数字,指向同一条成本链

两篇在 7 月 21 日提交的 arXiv 预印本,把 AI 视频的工程问题放到了两个容易被演示画面遮住的位置:训练数据是否说对了话,以及模型能否在自己的输出不断成为下一轮输入时保持稳定。
一篇论文在受控实验中发现,错误或缺失的字幕会让模型付出更多训练计算;另一篇论文则报告,一个交互式视频世界模型在单张 RTX 5090 上达到了 720P、最高 16 FPS 和 1.2 秒的动作到首帧延迟。前者没有给出真实视频行业的平均成本,后者也没有证明商业部署已经成立,但两者合起来提供了一个更实用的判断:生成质量只有在输入数据正确、在线循环稳定、运行预算可控时,才可能变成可交付的产品。1 2

训练数据的错误,会变成模型的错误关联

「Moving Alphabet」没有直接拿真实电影或广告数据做统计。作者构造了一个黑色背景上的字母视频测试集,让字母的数量、字体、颜色、位置、速度和时长都可控,再用已知元数据生成字幕。基于一个 800M 参数的 MMDiT 模型,论文分别测试内容复杂度、视频时长和字幕质量,训练规模在主要实验中保持为 150,000 个视频,字幕质量实验则使用 35 个条件和较小的 50,000 视频子集。这样做牺牲了真实场景的复杂性,却换来了变量隔离能力。
结果有两个层次。先看数据分布,均衡混合不同复杂度的场景,在三字母场景上得到 12.9 dB 的前景 PSNR,高于只用三字母场景训练的 10.1 dB;在视频时长实验中,均衡混合的模型在三种时长上的平均前景 PSNR 达到 12.2 dB。这里的含义不是「均衡采样」对所有真实数据都必然最优,而是单一场景或单一时长的训练集容易把模型变成专科生,离开自己的分布后性能明显下降。1
字幕实验更接近产品团队每天遇到的麻烦。论文把 precision 定义为字幕中已写出的属性有多少正确,把 recall 定义为真实属性有多少被写进字幕。precision 下降模拟「写了,但写错了」,recall 下降模拟「该写的没写」。在固定验证损失下,低 recall 条件通常需要基线约 2 至 4 倍的计算量;在 precision 和 recall 都为 0.3 的条件下,模型在 200 轮训练预算内仍未达到阈值。即使后续用干净数据微调,修复也很有限:在 precision 为 0.9 的一字母条件下,5,000 个干净样本把前景 PSNR 从 7.2 dB 提到 9.6 dB,但距离 11.7 dB 的基线只恢复了 55%;precision 为 0.3 时,1,000 到 10,000 个微调样本都几乎救不回来。
这组结果最值得产品负责人记住的部分,是错误信息比信息缺失更难处理。模型没有见过某个属性,可以在后训练阶段补上;模型长期把错误颜色、速度或位置和文字绑定在一起,就需要先忘掉错误关联。论文的测试对象是合成字母,不能直接换算成真实视频的返工率或算力账单,但它给数据采购提出了一个硬问题:视频字幕供应商交付的是覆盖率,还是可验证的正确率?

单卡实时运行,靠的是整条推理栈

ABot-World-0 处理的是另一端的问题。它把 AAA 游戏、模拟引擎和互联网视频组成训练数据,用 WorldExplorer 做带训练反馈的采集,再经过 14 项确定性质量检查、视觉语言模型评估、动作标注和文本标注。模型先用双向教师学习动作条件下的视觉动态,再蒸馏为因果学生,并用 LongForcing 让学生在自己的长时滚动输出上接受更长视野教师的约束,以减轻误差累积。
论文报告的运行区间如下:单张 NVIDIA RTX 5090,1280×704 分辨率,批大小为 1,动作到首帧延迟 1.2 秒,最高吞吐 16 FPS,峰值显存低于 19.3 GiB。这个数字来自一组优化后的低比特配置,不代表所有画质和精度条件都同时成立。系统消融也说明了原因:基础配置和只加入 SageAttention2 的配置都会显存溢出;加入轻量 VAE 后才以 9.117 FPS 跑通,FP8 将吞吐提高到 12.405 FPS,加入 Fast-RoPE 后达到 13.269 FPS,进一步使用更激进的低比特配置才进入最高 16 FPS 的区间。2
这不是「一个更快的注意力算子」带来的结果。VAE 解码、显存驻留、KV 缓存、位置编码和运行时调度都在首帧延迟与峰值显存里占有一席之地。论文把完整推理链路作为系统对象来优化,这一点对互动视频比单纯的采样步数更重要。用户按下一个键后,首帧何时出现、之后能否持续输出、场景会不会逐渐漂移,才是产品体验的实际边界。
不过,单卡运行仍然只是技术可行性证据。论文没有报告电费、设备折旧、并发用户数、长时运行失败率、工程维护成本、模型授权和与云端基线的总成本,也没有给出独立团队的复现实验。它证明了一个部署路径可以被做出来,尚未证明这条路径在内容生产或游戏服务中有稳定毛利。

从模型指标到采购指标

两篇论文真正交汇的地方,是它们都在约束「闭环」。Moving Alphabet 约束模型进入训练时看到的文字,ABot-World-0 约束模型生成的视频如何成为下一轮上下文。前者的错误会增加学习同一目标所需的计算,后者的微小误差会在长时滚动中累积。一个发生在训练前端,一个发生在推理后端,但它们共同说明,单次生成的画质分数无法覆盖视频系统的主要成本。
对模型厂商和采购方,至少有三组指标需要从演示页移到验收表:
  • 数据侧要同时抽查字幕的正确率、覆盖率、场景复杂度和时长分布,不能只看总视频小时数。尤其要区分「遗漏」和「错误描述」,两者对可控性和补救成本并不相同。
  • 推理侧要同时报告动作到首帧、持续 FPS、峰值显存、长时漂移、并发规模和失败恢复。只给某个算子加速比,无法说明整条链路是否跑得通。
  • 商业侧要把算力账单、硬件折旧、数据清洗、人工审核和返工放在同一张成本表里。单卡部署可能减少云端推理费用,也可能把成本转移到设备、运维和现场支持;两篇论文都没有提供足以完成这笔账的数据。

本地推理不会自动消除责任成本

交互式模型如果从云端下沉到桌面或边缘设备,内容生成链路会更分散,来源记录和导出控制反而更需要产品层设计。欧盟委员会关于 AI 生成内容透明度的页面写明,生成式 AI 输出应以机器可读的方式标记并可被检测;构成深度伪造的图像、音频和视频,部署者还需要做清晰可见的标识。相关 Article 50 透明度义务自 2026 年 8 月 2 日适用,配套 Code of Practice 虽然是自愿遵守的工具,法律义务本身并不是自愿的。3
这会改变本地视频产品的验收边界:显存占用降下来之后,导出时是否保留来源凭证、平台重编码后还能否检测、深度伪造是否自动加上可见标签、审核和处置记录是否可追溯,都要跟生成速度一起测试。对公开分发产品而言,少算几秒推理时间并不能抵消一次无法解释的内容来源问题。
两篇预印本没有给出行业平均成本,也没有替厂商回答收入、留存或合规率。它们提供的价值更具体:把「模型够不够强」拆成两个可以复测的工程问题,训练数据是否正确,在线循环是否稳定。下一次评估 AI 视频系统时,先要求看到这两组证据,再看演示画面。

Related content

  • Sign in to comment.
More from this channel