
AI视频从「全量生成」转向「选择性计算」:两篇新论文与Snapchat的分发边界
两篇 8 月 4 日论文把算力分配推进到音频能量与 token 注意力,Snapchat 则把全 AI 成片与 AI 辅助内容的推荐和变现资格分开;文章据此给出视频系统的验收指标。
窗口内能改变判断的新材料,集中在推理效率,而不是又一次「更长、更清晰」的视频模型发布。北京时间 8 月 4 日 00:42 和 01:05,同一研究团队先后向 arXiv 提交了 EchoCache 与 Token Radius Attention 两篇论文:前者按音频变化决定哪些视频 latent 需要重新计算,后者按每个 query token 的注意力熵决定应该保留多少交互。12
本文覆盖窗口为 2026 年 8 月 3 日 09:00 至 8 月 5 日 09:00(北京时间)。平台侧能与这条技术线对照的材料,是 Snapchat 在 8 月 3 日发布的一篇行业报道:Spotlight 不再推荐全 AI 生成视频,但 AI 辅助剪辑仍可推荐,并要求带透明度标识。Snapchat 的原始规则其实发布于 7 月 31 日,所以它不是本窗口内的新政策;窗口内的新信息,是这条规则如何被解释为创作者变现边界。3
两边放在一起,得到的不是因果链,而是一个相同方向的信号:AI 视频的竞争开始从「所有位置都生成」转向「只在有信息的位置花算力」,再转向「只把部分成品交给分发和变现」。
两篇论文都在砍全量计算
EchoCache 针对音频驱动视频生成(A2V)。这类模型用声音驱动口型、身体或其他动作,声音的变化并不是均匀分布的。论文把音频转成时频能量,用高能量片段作为显著性提示:动作变化更密集的片段优先更新,变化平缓的片段复用缓存;缓存还会在时间步、latent 和存储管理三个层级协同调度。4

它在 Wan2.2-S2V 的 EMTD 测试上把论文设定下的延迟从 1039 秒降到 423 秒,报告 2.46 倍加速;在 LongCat-Avatar 的同类测试上,延迟从 742 秒降到 412 秒,报告 1.80 倍加速。两组实验都使用 NVIDIA H200,生成的是 5 秒视频:前者为 720p、81 帧,后者为 480p、93 帧。4
这个数字最有价值的地方,恰恰不是「2.46 倍」本身,而是它暴露了优化对象:模型不再默认每个时间片、每个 latent 都值得同样多的更新。论文作者也承认,音频能量并不能覆盖所有跨模态线索,跨模型的调度仍有启发式成分。4
Token Radius Attention(TRA)切的是更底层的 3D 自注意力。它先用 query 的注意力熵估算所需的 token 数量,再把这个预算转换成随时间衰减的空间半径,最后用稀疏 kernel 执行。低熵 query 只保留较小的邻域,高熵 query 保留更宽的交互范围;分配粒度从 head 或 block 下沉到 token。5

TRA 在 Wan2.1、Wan2.2 和 HunyuanVideo 的 7 个文生视频与图生视频配置上测试,保留 9%—19% 的注意力交互,报告 1.56—2.05 倍端到端加速。默认测试分辨率是 720×1280,实验使用 H200;不同模型生成 81 帧或 129 帧,稀疏计算前还保留了前 25% 去噪过程的 dense warm-up。5
EchoCache 用输入声音判断哪里重要,TRA 用模型内部的注意力状态判断哪里重要。一个沿着内容条件分配计算,一个沿着网络状态分配计算。两篇论文的共同点,是把「减少计算」从统一比例的工程开关改成了内容相关的决策。
加速数字还不是商业成本
两篇论文都给出了可复现的实验条件,却没有给出视频服务真正要付的那张账单。EchoCache 的优化后结果仍然是在 H200 上生成 5 秒视频;TRA 的结果来自 720p、81 或 129 帧的固定配置。它们能证明方法在论文设置下减少了延迟和 FLOPs,不能直接证明 API 的并发吞吐、排队时间、单位成片成本或端侧功耗已经下降同样比例。45
还有两个容易被忽略的成本。第一,模型需要先做 dense warm-up、计算显著性或注意力熵,决策本身也消耗算力。第二,稀疏或缓存策略一旦误判,损失不一定表现为一张静态图变糊,可能是嘴型不同步、身份漂移、闪烁或跨镜头动作断裂。EchoCache 的消融实验显示,只有 step-level 或只有 latent-level 的调度,都不如两者联合;TRA 也报告,去掉预算映射或半径构造后,保真度会明显下降。45
因此,这两篇论文给商业团队的信号不是「马上可以把 GPU 预算砍掉一半」,而是下一代视频运行时会把质量预算做成条件函数:说话、快速运动、主体切换等片段保留更多计算,静态或低变化片段承担更多复用。供应商如果只给一个平均加速倍数,买方仍不知道它在哪些内容上省下了算力,又在哪些内容上把返工成本推给了用户。
Snapchat 把生成资格和分发资格分开
Snapchat 官方公告写得很明确:从 2026 年 7 月起,全 AI 生成视频不再有资格获得 Spotlight 推荐;使用 Snapchat AI 工具做增强或编辑的内容仍可推荐,并会带透明度指标。公告同时承认没有检测系统是完美的。6
8 月 3 日,Tubefilter 根据这条公告报道,创作者不能再提交全 AI 生成视频,也不能通过 Spotlight 的变现项目获得报酬。这里必须保留来源边界:Snapchat 原文明确说的是推荐资格,变现结论来自 Tubefilter 对提交和奖励规则的转述,不应写成 Snapchat 公布了检测准确率或统一的行业标准。3
这项规则的商业含义比「平台反对 AI」更窄,也更实际。Snapchat 没有把 AI 工具从创作者流程里拿走,反而保留了 AI 辅助编辑的推荐资格;平台要筛掉的是全自动成片进入内容池后带来的低质量重复供给,同时继续让自己的生成工具参与生产。对创作者而言,「用了 AI」不再是一个足够的分类,至少要分成全 AI 生成、真人素材的 AI 编辑,以及真人创作中使用 AI 工具三类;这三类内容可能对应不同的推荐、申诉和收入结果。
这与两篇论文的选择性计算并不是同一件事,也没有证据表明其中一方导致了另一方。但它们给供应商和平台提出了同一个产品问题:哪些部分值得保留更多预算,哪些部分可以被压缩、拒绝或降权?模型侧的答案是音频能量、注意力熵和 token 邻域;分发侧的答案是人类创作介入、透明度标识和内容池质量。
采购时要验收「选择性」
如果把这两类信号放进同一份视频系统验收表,至少要问五个问题:
- 算力省在哪里:分别测试说话密集、快速运动、静态背景、主体切换和长镜头,报告每类内容的延迟、显存、同步质量、闪烁和身份一致性,而不是只报全局平均值。
- 端到端是否真的省钱:把 warm-up、缓存管理、稀疏 kernel、编码、上传、排队、失败重试和人工返工一起计入;论文中的 H200 实验不能替代真实并发下的成本曲线。
- 全 AI 与 AI 辅助如何判定:让供应商和平台写清分类边界、检测误判、申诉流程与收入处理。Snapchat 的规则只证明一个平台的推荐政策,不能直接当成普遍法律定义。
- 透明度能否跟着成品走:对裁剪、拼接、换音轨、二次编辑、导出和转码逐步测试标识是否仍在;「支持透明度指标」不等于每个发布页面都已经完成披露。
- 质量下降由谁承担:合同里应写明加速策略的默认阈值、可回退的 dense 模式、失败重试费用,以及内容被降权或无法变现时谁负责补偿和举证。
两篇 8 月 4 日论文把模型提供者的工作推进到「按内容分配计算」;Snapchat 的规则则把分发平台的工作推进到「按创作介入分配注意力和收入」。对 AI 视频从业者来说,下一次看到「2 倍加速」或「支持 AI 创作」时,真正该索取的不是一段更漂亮的样片,而是一张条件矩阵:什么内容被省算力,什么内容会掉质量,什么成品能被推荐,以及证据能否穿过最后一次导出。
References
- 1
- 2
- 3
- 4EchoCache 论文 HTML:方法与实验
arxiv.org
- 5Token Radius Attention 论文 HTML:方法总览
arxiv.org
- 6Snapchat Newsroom:Rewarding Authentic Creativity on Spotlight
newsroom.snap.com

AI生成视频行业深度追踪
每2日追踪AI生成视频行业最新动态,聚焦技术方向、商业模式与合规性问题,综合YouTube、X、arXiv、证券研报等多渠道信源,以深度分析文章形式呈现
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.