
41.97%、91% 与一份订阅:AI 视频的验收正在离开生成方
生数科技把视频生成推进到可实时编辑的流,第三方独立评测给 MiniMax-H3 打出 41.97%,Meta 与 PixVerse 把变现闸门移到发布并通过审核之后,迪拜宣布自建深伪检测模型:生成继续贬值,判定权正在离开生成方。
本期覆盖 2026 年 9 月 15 日 09:00 至 9 月 17 日 09:00(北京时间)。本频道上一次出刊在 9 月 11 日,中间两次排期没有出刊,因此这一期把 9 月 11 日以来未被覆盖的信号一并补齐,每条材料都标出绝对时间。
这两天,生成这一侧继续往前推:生数科技把视频生成做成了可以实时交互、实时编辑的“流”,Meta 把视频生成写成订阅档位里的一行用量。与此同时,“这条视频合不合格、是不是真的、该不该付钱”这三件事的判定权,正在从生成方手里分出去——第三方研究者开始给全能模型出题,并且给出了低分;平台与模型厂商把付款条件设在“发布并通过审核之后”;迪拜的政府机构宣布要自己造一个检测模型。
窗口信号快览
| 材料与绝对时间 | 发生了什么 | 证据性质 | 对读者的意义 |
|---|---|---|---|
| Vidu S2,2026 年 9 月 15 日 | 生数科技发布 Vidu S2-Avatar 与 Vidu S2-Editing,同日全量开放在线体验;实时输出提升到 720P,编辑模型可对输入视频流持续实时编辑 | 厂商产品声明与官方文档,独立延迟与成本基准尚未公布 | 实时化把质量闸门从“生成之后挑片”推到“流里面现场判定”12 |
| arXiv:2609.18323,2026 年 9 月 16 日提交 | 新加坡国立大学、复旦大学与腾讯的作者用隐式提示加多模态输入,对 MiniMax-H3 做独立评测,517 个实例上总体成功率 41.97% | 第三方受控实验,评测集由论文作者自建 | 能接收多模态输入与能用多模态推理是两件事,厂商 demo 与独立出题是两套证据3 |
| Meta One 与 PixVerse Earn,2026 年 9 月 15—16 日 | Meta 把“生成与转换视频”列入订阅档位的 AI 用量条目;PixVerse 把创作者报酬改成按活动奖池结算、通过最终审核后发放 | 两方均为公司自述,未披露审计收入、付费用户与毛利 | 生成本身已经撑不起独立定价,付款方买的是发布出去并通过核验的内容45 |
| SARAAB,2026 年 9 月 16 日 | 迪拜电子安全中心在 GISEC 全球网络安全展宣布自研深伪视频检测模型,官方自述准确率 91%,计划年底上线并部署到 Hugging Face | 政府机构的宣布,数据集、误报率与算力成本均未公布,上线前不可用 | 事后取证这一环开始有主权机构自己下场,其口径需要与平台标识义务分开核对6 |
生成被推进到“流”:Vidu S2 改写了闸门的位置
批处理式的视频生成有一个隐含的好处:质量闸门可以放在生成之后。团队一次性拉出十条候选,挑出能用的一条,其余丢掉。9 月 15 日中国视频生成厂商生数科技发布的 Vidu S2,把这件事挪到了另一条轨道上。
Vidu S2 包含两个模型。S2-Avatar 面向持续交互的数字角色,实时输出分辨率从 480P 提升到 720P,支持实时语音对话与复杂动作控制,对话过程可以随时打断,数字人具备与用户互动的双向感知;结合参考图,数字人还能完成物品互动、服装更换与背景切换。S2-Editing 面向输入视频流的实时编辑,支持摄像头、视频、图片三种输入模式,可以按风格、服装、主体或背景参考图持续输出编辑结果,中途更换参考图或切换场景都不会中断视频流。2

这件事对生产团队的含义,落在容错上。批处理流程里的废片率可以被重试摊薄;直播、虚拟客服、实时通话这类场景里,一帧错误就是一次已经发生的事故,重来一次的机会并不存在。要评估 S2 这类产品,需要问的问题因此换了一批:端到端延迟是多少,稳定运行能持续多久,单位时间的算力开销是多少,参考图临时替换时状态会不会跳变,以及断流之后系统如何回退。
还有一个更容易被忽略的问题:一段实时流如何携带标识。中国《人工智能生成合成内容标识办法》要求生成合成内容同时带显式标识与文件元数据中的隐式标识——前者是画面或界面上可见的提示,后者是写进文件头、平台可以读出来的生成信息——并要求传播平台核验元数据。这套要求在成片文件上是可执行的,而流式输出意味着画面从未落成一个带元数据的文件。7 采集端与播放端是否各自留下了可核验的记录,是这类产品上线前需要单独确认的一项。
上述能力全部来自厂商产品说明与官方文档;本期没有取得独立的延迟、并发或单位成本基准。
第三方开始给全能模型出题:41.97% 意味着什么
同一天,arXiv 上出现了一篇针对 MiniMax-H3 的独立评测,作者来自新加坡国立大学、复旦大学与腾讯。MiniMax-H3 是 MiniMax 的全模态生成模型,可以同时处理文本、图像、视频与音频输入;这篇论文的做法值得行业注意:它不给完整提示词。
论文把关键的事件语义从提示词里拿掉,分散到多个模态中,让每个模态只提供部分线索,模型必须自己把线索对齐、推断出本该发生什么,再用视频生成把推断结果表现出来。评测覆盖 517 个实例、29 个子类、四类场景:多视角空间推理、音频消歧推理、视频决策推理、视听整合推理。论文在对比表里指出,此前常用的视频生成基准大多只给“文本加图像”的显式提示,这套评测给的是“文本、图像、音频、视频”加隐式提示。3
结果是:总体成功率 41.97%。四类场景里,视频决策推理最高,为 56.00%;音频消歧推理最低,只有 27.40%。3

这组数字最值得读的地方,是四类场景之间的落差。厂商在发布全能模型时,通常用“支持文本、图像、视频、音频多种输入”来说明能力;这篇论文说明,接收多种输入与用这些输入做推理是两件事。模型可以同时吃下音频与画面,却仍然主要依赖文本提示词的语义先验来生成。音频消歧只有 27.40%,恰好落在这道缝里。
论文也把自己的边界写清楚了:这套评测集由作者构建并经过专家核验,四类场景是作者设计的,41.97% 是受控条件下的结果,与任何线上产品的服务水平承诺无关。
同一窗口内,技术侧还在补评测暴露出来的两个坑。9 月 15 日提交的 arXiv:2609.17521 提出 PhysStream,用结构化场景记忆(在线生成的位置图与目标跟踪图)加稀疏的速度增量信号,让模型在生成中途也能接受运动控制;作者报告运动分布距离降低 33%、轨迹误差降低 12%,并在超过 85% 的真实场景人工对比中被偏好。8 9 月 16 日提交的 arXiv:2609.18077 提出 vidax,面向视频生成模型给出 JAX/Flax 推理引擎与权重转换路径,并在 TPU v4-8 上报告编译时间、延迟与峰值显存。9 两项都是作者的受控实验,要换算成线上成本或稳定性,还需要另做测试。
变现的闸门移到了发布之后
第三方评测管的是“这条视频对不对”,商业这一侧这两天管的是“这条视频值不值钱”,而答案同样落在了生成方之外。
9 月 15 日,Meta 发布订阅服务 Meta One。面向个人用户的 Core 档为每月 7.99 美元,Premium 档为每月 19.99 美元,两档的核心卖点之一是更多 AI 用量,权益条目里明确列出了生成与转换视频。Meta 同时说明,首发包含 50 多项功能,累计已有 1500 万份订阅与试用,旗下应用与 Meta AI 的核心体验保持免费。4

OpenAI 的安排给出另一种对照。其官方帮助页写明,视频生成产品 Sora 的网页与应用体验已于 2026 年 4 月 26 日结束,Sora API 将于 9 月 24 日终止,并建议用户尽快导出内容。10 一家前沿实验室退出独立的视频产品,另一家把视频生成降格为订阅包里的一行配额,两条路径指向同一个事实:生成能力已经撑不起一个独立收费的产品。
第二天,PixVerse 给出了另一种答案。9 月 16 日的发布中,PixVerse 推出 Earn 平台,让创作者把 AI 生成的视频发到 Instagram、YouTube 或 X,粘贴链接提交,通过最终审核后按活动奖池结算收益。官方产品页上写明:奖池合计 10 万美元以上,单个活动池 5 万美元以上,设置 7 天奖金窗口与 20% 积分加成,覆盖三个平台,典型结算周期 30 天,加入免费,现金提现经第三方支付平台 Tremendous 处理。同一份材料里,PixVerse 还提到自 8 月 7 日启动的 AI 电影节 PixLight,总奖池 30 万美元、33 个奖项、10 月 9 日截止,以及平台累计 1.5 亿用户、覆盖 177 个国家。511

值得看的细节在条款里。Earn 页面说明,奖励要经过活动审核、最终核验与观察期才能转入可用余额;而已经转入可用余额的收益,在欺诈、滥用、违反活动条款或 PixVerse 政策、技术错误、配置错误、计算错误或人工复核错误等情况下仍可被追回。5
两件事指向同一种结构调整:上游把生成塞进订阅配额,下游把变现外包给按件审核加奖池。生成能力在这两端都不是定价对象,能被定价的是被选中的内容。对内容团队来说,合规与标识由此进入收款路径——一段无法通过活动审核的成片,在这个体系里价值为零。
Meta 的订阅数量、PixVerse 的用户规模与奖池金额都是公司与平台自述。本期未检索到针对 AI 视频模型厂商的独立证券研报、审计收入、付费用户、毛利率或留存数据,这些数字还需要另外的证据才能连成商业闭环。
检测开始由国家机构自建
合规这一侧,这两天出现了一个新角色:政府自己造检测工具。
9 月 16 日,迪拜电子安全中心(DESC)在 GISEC 全球网络安全展上宣布将推出深伪视频检测模型 SARAAB。GISEC 是 9 月 16 日至 18 日在迪拜世博城举办的网络安全展。该中心高级人工智能执行官 Hassan Majid Alkhazraji 描述的做法是:如果是一段两分钟的视频,模型会分析完整的两分钟,画面里可能只有最后 30 秒被动过手脚,这 30 秒也会被单独分析;模型用热力图标出被篡改的面部片段。中心称该模型的准确率为 91%,计划在年底上线,并将部署到模型托管平台 Hugging Face,同时称这是阿拉伯地区首个由政府机构开发的此类模型。6
这条消息里真正有用的部分,落在 91% 之外。一个检测准确率要能被采购或取证使用,至少还需要四项没有公布的信息:测试集的构成与判定口径、误报率、面对定向规避时的鲁棒性,以及逐分钟分析的算力成本。时间也是变量——年底上线意味着现在不可用,任何当下的取证流程都只能按已有手段设计。
它的方向性意义是明确的。生成端、发布端与事后取证本来是三条不同的责任链。中国《人工智能生成合成内容标识办法》把显式标识与元数据隐式标识的义务压在生成服务提供者身上,并要求传播平台核验元数据;7 欧盟人工智能法案第 50 条把服务提供者的机器可读标记义务与部署者面向观众的披露义务拆成两层。12 一个政府机构下场做检测模型,补的是第三条链:当标识被剥离、元数据在转码中丢失之后,还能不能倒着找出被改过的那 30 秒。
三条链各自解决自己的问题。标识管的是生成时有没有留痕,披露管的是发布时有没有告诉观众,检测管的是事后能不能取证。把其中任何一条当作完整合规,都会在真正的争议里失效。
编辑部判断:三处闸门同时收紧,而生成侧还在贬值
把这几件事连起来,一条推理链是清楚的。
第一,生成能力的边际价值在下降。Vidu S2 把生成推进到实时流,Meta 把生成写进订阅配额的下一档,PixVerse 用奖池吸引创作者,OpenAI 则终止了独立的视频产品线。当单位生成成本持续走低、能力被包装进更大的订阅包,单独售卖生成能力的定价空间在收窄。
第二,判定权在向生成方之外移动。第三方研究者用自己设计的隐式提示给全能模型打分,得出了 41.97%;平台与模型厂商把付款条件设在发布并通过审核之后;政府机构开始自建检测模型。这三处的共同点是,它们都不采用生成方自己提供的证据。
第三,验收的成本结构跟着改变。批处理时代,验收的核心是挑片与重试;流式时代,验收必须前置,实时延迟与断流回退成为硬指标;变现环节里,验收变成审核与留痕,作品能否拿到钱取决于能不能过审、能不能被追溯。三处闸门收紧的方向一致,把风险从生成方转移给部署方。
以上是本频道依据本期窗口内公开材料得出的判断。
采购与上线团队的验收清单
| 验收维度 | 要问的问题 | 要留下的证据 |
|---|---|---|
| 流式场景的端到端延迟 | 从语音或画面输入到编辑结果输出,峰值与日常延迟分别是多少,在目标场景里能不能被察觉 | 分阶段计时日志,覆盖排队、推理、编码与传输;取压力测试下的实测数值 |
| 断流与降级 | 网络抖动、参考图替换、算力紧张时,系统是降级、冻结还是中断 | 故障注入测试记录与回退策略文档,写清最长可接受中断时长 |
| 跨模态语义遵循 | 把关键语义从提示词里拿掉、分散到音频或参考画面中,模型还能不能补齐 | 自建小样本隐式提示测试集与逐条判定标准,任务设计可参考 41.97% 那套评测3 |
| 完整交付账 | 除订阅或按秒报价外,额度重置、审核人工、转码与存储各占多少 | 含重试与人工复核的月度账单,算出每条合格成片的实际成本 |
| 发布环节的可通过性 | 目标平台与活动方各自的审核标准是什么,什么情况会追回已结算收益 | 平台与活动方的规则原文,以及历史内容被拒或被追回的记录5 |
| 标识与来源链留存 | 显式标识与元数据隐式标识在剪辑、转码、二次发布后是否仍然存在 | 转码前后元数据解析报告与文件哈希,覆盖流式输出与成片两条路径7 |
| 检测与取证口径 | 供应商或合作方提供检测能力时,测试集、误报率与成本是否披露 | 检测模型的评测报告与成本测算;未披露的,按“尚未具备该能力”处理6 |
结语
这两天的材料指向同一件事:把视频做出来越来越容易,把视频判定成“可以用”越来越难。实时化、订阅配额与按秒低价都在压低生成的成本,评测、审核、检测这三处闸门则在给“合格”重新定价。对从业者来说,接下来该守的是自己在哪一条链上留下了可核验的证据。
References
- 1生数科技发布Vidu S2双模型,支持实时视频生成与编辑
finance.sina.com.cn
- 2Vidu S2:实时交互与编辑模型
vidu.com
- 3
- 4
- 5
- 6
- 7人工智能生成合成内容标识办法
cac.gov.cn
- 8
- 9
- 10What to know about the Sora discontinuation
help.openai.com
- 11
- 12Guidelines on transparency obligations for providers and deployers of AI systems
digital-strategy.ec.europa.eu
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
