AI视频进入可控性考场:模型越会生成,责任越不能只归用户

AI视频进入可控性考场:模型越会生成,责任越不能只归用户

两篇最新论文把视频模型的瓶颈指向因果指令跟随,而一宗深伪诉讼与中国互动服务新规说明,稳定生成必须和可审计、可追责的产品设计一起交付。

7 月 15 日,视频生成模型的竞争点开始从画面质量转向「能不能按要求持续行动」

两篇在 7 月 15 日提交到 arXiv 的论文,把同一个产品问题拆成了两种测量方式:一篇改造视频模型的表示层,让生成更容易训练;另一篇不再只看画面像不像,而是检查模型能否完成一串有先后关系的动作。两篇论文都不是商业产品的独立测评,但它们共同指向一个比榜单分数更实用的瓶颈:视频模型已经会生成短片,却还不稳定地理解「先做什么、后做什么、前一步如何改变后一步」。
这件事对商业化的影响很直接。影视预演、广告素材和游戏资产需要的是可复现的镜头控制,不能每次都靠抽卡;一旦视频模型进入持续互动或人物代理场景,企业还要回答谁发出了指令、模型用了哪个版本、输出经过了什么安全检查。生成质量仍然重要,但它不再是唯一的交付指标。

表示层在提速,评测层在追问因果关系

VideoRAE 的做法,是把视频基础模型当成冻结的表征教师,从 V-JEPA 2、VideoMAEv2 等模型提取多层语义特征,再压缩成可用于连续扩散和离散自回归生成的统一视频潜空间。论文报告,在其设置下,基于 VideoRAE 的自回归训练相较 LARP 约快 5 倍收敛;在 VBench 文本到视频评测中,VideoRAE 得分 71.26,LTX-VAE 得分 69.35。1
这类工作解决的是「模型如何更省力地学会视频结构」。它把像素重建之外的语义信息带进潜空间,理论上有利于减少训练成本和生成中的冗余。对厂商来说,收益不只可能表现为更高的画质分数,也可能表现为更短的训练周期、更小的模型,或更容易部署到有限显存的设备上。
但这项结果不能直接等价为线上成本下降。论文的主要实验使用 16×256×256 的视频片段,作者也明确展示了一个不完全一致的结果:VideoMAEv2 的重建指标更强,V-JEPA 2 的生成结果却更好。它说明「重建得像」与「生成得可用」不是同一件事,也没有给出商业服务所需的并发、延迟和每秒生成成本。
VGIF-Score 把问题往前推了一步。它构建了包含 223 个长文本提示词的 VGIF-Bench,拆出约 4.3K 个细粒度评测项,在 14 个视频生成模型、3,000 多条生成视频上检查空间和时间上的指令跟随。评测框架把提示词解析成带依赖关系的时空图,再分别评估客观完成度和主观观感。论文报告,商业模型平均分为 46.57,开源模型平均分为 34.67;最难的仍是因果指令跟随,模型还明显受依赖深度和提示词位置影响。2
论文它在测什么对产品团队的启示
VideoRAE视频表示是否适合生成,训练能否更快收敛生成成本的优化可能先发生在表示层,而不是继续堆更大的主模型。1
VGIF-Score多个动作、物体和时间约束能否按依赖关系完成单条样片的观感分数不足以判断工作流是否可靠,评测要覆盖可复现的动作链。2
VGIF-Score 的评测也有边界。它把 Gemini-3.1-Pro 作为统一评价模型,并用 200 条视频、每条 3 名标注员做人工验证。这样的设计比只看一个总分更透明,但评价模型本身仍会影响结果,论文也没有证明这些分数已经和真实客户的返工率、镜头通过率或付费留存建立稳定关系。因此,商业公司可以借用它的拆解方式,却不能把论文分数直接当作采购标准。

商业化要从「生成一条片」改成「复现一个工作流」

如果一个模型只负责生成 5 秒片段,用户还能容忍多试几次;一旦它被放进广告批量生产、影视分镜或交互式场景,失败的成本会变成后续镜头、素材授权和人工审核的连锁返工。此时,产品价格不能只按分辨率或生成秒数计算,还要回答三个问题:同一角色能否在多次生成中保持一致,连续动作能否按顺序完成,失败后能否定位是哪一步出了问题。
这也是为什么「控制评测」会逐渐接近商业能力本身。它未必马上带来新的订阅档位,却会改变企业采购时的验收表:从展示一段最好的样片,转向交付一组固定提示词、固定参考素材和固定模型版本,记录成功率、返工次数和人工修正时长。这里的结论是产业分析,不是两篇论文已经证明的商业事实;目前公开材料还不足以判断哪家厂商已经把这些指标写进正式 SLA。
同一周期的一个法律事件,把另一半账单摆到了台面上。路透社 7 月 15 日报道,xAI 已在得州联邦法院起诉南卡罗来纳州男子 Terry Harwood,诉状于周二提交,指控其滥用 Grok 生成儿童性虐待材料和未经同意的性化深伪内容。诉状称,xAI 在 2026 年暂停了 52,222 个账号,并向美国失踪与受剥削儿童中心提交了 73,604 份报告,至少导致 244 人被捕;这些数字是 xAI 在诉状中的自述,不是路透社独立审计的结果,案件指控也尚未由法院裁判。3
这起诉讼未必会给平台责任划出最终边界,却说明提供方已经不能把滥用完全解释成「用户违反条款」。账号暂停、举报、日志留存和诉讼,都在变成产品运营和法律风险的一部分。对视频生成服务而言,安全能力不应只在发布后贴一个标签,还要能在生成前阻断高风险请求,在生成中保留可追溯记录,在事后解释哪一层控制失效。

视频进入互动关系后,适用的规则会变

7 月 15 日起施行的《人工智能拟人化互动服务管理暂行办法》,适用的是向境内公众提供持续性情感互动的服务,形式包括文字、图片、音频和视频。广东网信网转引《经济参考报》的报道提到,办法要求相关服务提供者承担安全管理责任,并设置安全评估、算法备案和人工智能沙箱等制度,同时列出不得生成的内容边界。4
它并不是一部覆盖所有文生视频产品的统一规则,普通的镜头生成如果不涉及持续性情感互动,不能简单套用这套适用范围。但产品一旦把视频角色做成长期陪伴、虚拟亲属、持续对话的代理,视频就不再只是输出格式,而是互动关系的一部分。提供方需要评估的也从「这一帧是否违规」扩展到「连续多轮互动是否诱导依赖、误导用户或伤害未成年人」。
这与 VGIF-Score 暴露的技术问题正好相连。模型越能记住角色、场景和用户偏好,越有机会完成长链条任务,也越有能力在多轮互动中持续影响用户。技术团队如果只优化一致性和沉浸感,而没有同步建设依赖关系、未成年人保护和审计接口,产品越顺滑,治理风险反而越难被看见。

视频模型厂商现在该把什么交付给客户

对模型公司、内容平台和使用 AI 生产视频的团队,比较务实的验收清单不是再加一个「电影感」选项,而是把以下内容写进测试和合同:
  1. 动作链测试:用固定的多步骤提示词测试时间顺序、对象关系和因果变化,记录每一步是否完成,而不是只保存最好看的一条结果。
  2. 版本与来源记录:保存提示词、参考素材授权、模型版本、参数、过滤结果和输出指纹。发生争议时,能还原具体生成链路,比事后争论「看起来像不像 AI」更有用。
  3. 分层处置:把生成前拒绝、账号级限制、人工复核、外部举报和事后取证分开设计。xAI 案件至少说明,服务条款和账号封禁并不能替代一套能被执行、解释和审计的流程。
  4. 把互动产品单独合规:如果视频角色会长期记忆、持续陪伴或影响用户决策,应按互动服务评估,而不是把它当成普通视频编辑功能的加法。
下一阶段真正拉开差距的,可能不是谁能再把一张图变得更像电影,而是谁能让模型稳定执行一条可复现的动作链,同时留下足够清楚的责任链。前者决定样片能不能出片,后者决定企业敢不敢把它接进生产流程。

Related content

  • Sign in to comment.
More from this channel