
AI视频进入双重竞赛:一边生成互动世界,一边修补信任标签
过去两日最值得关注的不是又一个模型榜单,而是 PixVerse 将 4.39 亿美元融资投向实时互动世界,以及 TikTok 发现标签本身并不能让用户更会识别合成内容;两件事合在一起,显示行业正在同时争夺生成运行时和内容信任入口。
先看结论
过去两日最值得关注的,不是又一个模型在排行榜上多拿了几分,而是 AI 视频公司开始把产品定义成「持续运行的世界」,平台则开始承认「给视频贴标签」并不足以让用户识别它。PixVerse 在 7 月 14 日宣布完成 C 轮扩展融资,累计金额 4.39 亿美元,并把下一阶段押在实时互动世界、游戏引擎和互动直播上;同一窗口里,TikTok 公开了更完整的 AIGC 标识与识别策略,但相关研究显示,小型覆盖式标签几乎没有改变用户相信或分享合成内容的行为。
这两条消息放在一起看,行业竞争正在同时转向两个更难的问题:模型能不能从一次性生成短片,变成可持续交互的运行时;内容平台能不能从「告诉用户这是 AI」走到「让用户知道这段内容为什么可信、哪里是重建、谁对它负责」。前一个问题决定商业上能不能形成高频使用,后一个问题决定这些内容能不能进入新闻、广告、教育和公共议题。
| 日期 | 公开进展 | 已确认的变化 | 不能直接推出的结论 |
|---|---|---|---|
| 7 月 13 至 14 日 | PixVerse 完成 C 轮扩展 | 累计融资 4.39 亿美元,估值超过 20 亿美元,资金将用于世界模型和全球客户拓展;公司还宣布把 R1 延伸到游戏和互动娱乐 | 融资和用户规模不等于已验证的付费收入,PixVerse 没有披露付费用户数 1 2 |
| 7 月 14 日 | Google DeepMind 重建 Pelé 的「失落进球」 | 使用 Veo、Gemini Omni 和 Nano Banana Pro,把替身演员的动作、历史球场和观众氛围合成为一段历史重建视频 | 成片是基于资料和表演的重建,不是找回了 1959 年的原始影像 3 |
| 7 月 13 至 14 日 | TikTok 扩大 AI 透明度与素养措施 | 官方称已标记超过 30 亿条 AIGC,并将测试针对 AI 垃圾内容账号的检测系统;研究报道显示,小型标签没有显著降低用户相信或分享合成内容的概率 | 标签的覆盖量不能代替用户理解和内容溯源,研究没有证明所有标识方式都无效 4 5 |
PixVerse 融资买的不是更多片段
PixVerse 的公告把产品方向说得很直:公司不再只把视频当成固定输出,而是把 R1 世界模型描述成一个会根据用户输入即时响应的连续互动流。7 月 14 日公布的 Game Engine 进一步把游戏规则与视觉表现拆开,用户用自然语言改变动作,世界在运行中实时变化;公司还宣布把这套实时世界模型用于互动直播,让 AI 角色响应观众输入。以上都是 PixVerse 的产品口径,不是外部性能测试结果。1
融资本身说明投资人愿意为这条路线下注。TechCrunch 报道称,PixVerse 完成 C 轮扩展后估值超过 20 亿美元,新增投资方包括阿里巴巴、Lollapalooza Capital、Ivy Capital、Grand Mount Capital、Eastern Bell Capital、Mirae Asset、蓝色光标和 CloudAlpha,老股东 iGlobe Partners 与 OCBC 旗下 Lion X Ventures 继续参与。公司计划用新资金拓展世界模型、覆盖更多地区,并增加研究与市场团队。2
这里的商业含义比「融资额很大」更具体。一次性短片的价值通常在生成完成时就结束,用户要不要再次使用,取决于下一条提示词;一个持续运行的互动世界则可以把生成成本放进游戏、直播、虚拟角色和社交体验里,争取让用户反复回来。模型公司的收入想象,也就从按秒或按次计费,扩展到内容服务、企业部署和互动产品分成。
但这仍然是商业假设,不是收入证明。TechCrunch 引述 PixVerse 称,其消费产品拥有超过 1.5 亿注册用户和超过 1500 万月活跃用户,同时明确写到公司没有披露付费用户数。公司还与投资方阿里巴巴达成视频生成能力部署协议,但文章没有给出合同金额、收入确认方式或部署规模。用户规模可以证明分发能力,不能单独证明世界模型已经找到稳定的付费场景。2
对同行来说,真正需要观察的不是「谁先宣布了世界模型」,而是三个可验证的结果:互动体验能否保持足够低的延迟,用户是否愿意在一次生成之外持续停留,企业客户是否会为可控、可审核的世界状态付费。没有这些指标,世界模型仍可能只是把视频生成的估值叙事换了一个更大的名词。
从生成画面到历史重建,事实边界变了
Google DeepMind 7 月 14 日发布的 Pelé「失落进球」案例,展示了另一条产品路线。团队重建的是 1959 年 8 月 2 日在 Rua Javari 球场发生、但没有留下影像的进球,使用了 Veo、Gemini Omni 和 Nano Banana Pro,并让替身演员的动作驱动生成结果,再对人物形象、球衣、球场环境和观众氛围进行处理。Google 把这套方法描述为 character replacement、environment restyling 和生成现场氛围。3
这类案例的价值不在于证明 AI 能「还原真相」。恰恰相反,它把「历史影像」和「基于资料的视觉重建」之间的边界推到了用户面前。成片可以帮助观众理解一个没有被拍下来的动作,但它仍然是由现场拍摄、演员表演、模型生成和人工选择共同完成的作品。Google 自己也承认,任何重建都无法替代当年现场球迷的体验。3
这会改变视频产品的合规要求。过去给一条生成短片标注「AI 制作」,已经能覆盖最基本的透明度问题;当模型开始重建历史人物、公共事件或新闻现场时,用户还需要知道:哪些部分来自史料,哪些部分来自演员或实拍,哪些动作是模型推断,谁对最终叙事负责。单一的「AI 生成」标签太粗,既解释不了证据链,也解释不了创作者做过什么选择。
换句话说,生成模型越像一个制作团队,内容凭证就越不能只记录「用了某个模型」。它至少要能帮助下游平台和观众区分原始素材、编辑步骤、重建范围和发布主体。否则,画面越逼真,误读成本越高。
30 亿条标签,为什么仍然不够
TikTok 在 7 月 10 日的官方公告中称,平台已经通过 Content Credentials、创作者主动标识和不可见水印,标记超过 30 亿条 AIGC;公司还宣布加入 C2PA Steering Committee,并将在应用内推出帮助用户识别 AI 内容的学习入口。TikTok 同时表示,将测试针对大量发布 AI 垃圾内容账号的检测系统,重点关注政治与时事、金融建议和医疗内容。4
这说明平台治理正在从单纯的「内容有没有标」转向「用户能不能理解」。但 7 月 13 日发布的一篇研究报道给出了不太乐观的提醒:The Dais 的研究测试了多种社交媒体 AI 内容标签后发现,小型覆盖式标签没有显著提高用户识别深度伪造的能力,也没有显著减少用户相信或分享合成内容的概率;研究中唯一显著降低接触的方式是全屏阻挡,但报道同时指出,主要平台没有采用这种方式。报道没有提供该研究的样本量、受试者构成和统计检验细节,因此它足以质疑「小标签有效」这一假设,却不足以替所有平台治理方案下结论。5
这里有一个常被混在一起的问题:标识的覆盖率,和标识对判断的帮助,不是同一个指标。平台可以给大量视频挂上标签,但如果标签太小、出现太快、没有解释来源,也没有告诉用户视频哪些部分被修改,用户看到的仍然只是一个模糊的「这可能是 AI」。
TikTok 的做法至少承认了这个缺口。官方公告提到,平台将投入超过 400 万美元推进 AI 素养项目,并与 NAMLE、Henry Ajder 等专家合作制作使用指南。教育、C2PA、不可见水印和自动检测被放进同一套方案,说明平台已经无法把真实性判断完全交给单一技术。4
对 AI 视频公司而言,这也是一条产品信号:合规能力不再只是上传前的审核接口,而会进入生成、编辑、发布和观看的整条链路。谁能把来源记录、编辑历史和风险提示做成创作者愿意使用、平台能够读取、观众看得懂的产品,谁才更接近企业和公共内容市场。
这一轮真正的分水岭
把 PixVerse、Google 和 TikTok 放在一起,行业变化可以压缩成三句话。
第一,技术竞争从「生成一段像不像真的视频」转向「能不能维持一个可交互、可控制、可重复进入的世界」。PixVerse 的融资和产品公告提供了资本与产品方向的信号,但还没有提供付费用户、收入或延迟等足以证明商业闭环的指标。
第二,视频模型的应用边界从虚构内容扩展到历史重建、公共记忆和实时互动。应用越靠近真实人物与真实事件,生成结果就越需要附带可解释的来源和制作记录。Google 的 Pelé 案例很好地说明了这条边界:它能让不可见的历史动作变得可视化,却不能把重建变成原始证据。3
接下来最值得盯的不是发布会上的「世界模型」或「高质量视频」几个字,而是三组实际结果:PixVerse 的新世界模型和 V 系列能否带来可重复的企业订单;Google 是否把重建内容的来源和创作步骤做成可见的产品能力;TikTok 的 AI 素养入口和检测系统能否让用户在相信、转发之前多做一次判断。前两组决定 AI 视频能否成为持续运行的产品,后一组决定这种产品能否在真实世界里被信任。
関連コンテンツ
- ログインするとコメントできます。
