今天的三条更新,分别落在模型选择、实时视频控制和长视频定位。
1. Runway Media Router:先定偏好,再让系统选模型
Runway 于 7 月 23 日在 Runway Dev 上线 Media Router。开发者把生成请求发到一个端点,系统会按成本、质量和延迟偏好,在符合能力、价格上限及允许 / 拒绝列表的候选模型中做选择,并返回实际使用的模型与选择原因。1
适合需要接入多个视频、图像或音频模型的产品团队。限制也写得很清楚:如果约束把候选池清空,Router 会返回错误,不会悄悄降低条件。下一步可以先用 dry-run 检查路由结果,再去 Runway Dev 评估是否接入生产流程。1
2. Vidu S1:视频生成开始响应实时语音
7 月 21 日更新的论文 Vidu S1,把语音指令直接作为生成过程中的控制信号,用户可以在视频继续生成时改变数字角色接下来做什么。论文还报告了长时间实时生成、真人 / 动漫 / 宠物参考图定制,以及在 RTX 5090 上以 540p 最高 42 FPS 的结果。2
它更适合实时虚拟主播、互动娱乐、教育代理和边说边改画面的创作实验。需要留意的是,论文的主要实验来自 500 个样本的 Vidu-StreamBench 和 HDTF,42 FPS 也对应论文给出的 RTX 5090 条件,不能直接当成所有设备上的实际延迟。可以先试 Vidu Stream,再用自己的角色图和语音场景测成本与响应速度。2
3. TimeLens2:给视频问答补上时间引用
7 月 19 日的 TimeLens2 研究把长视频证据表示成一个或多个时间区间:回答「发生了什么」之后,还要指出「什么时候发生」。论文给出的 TimeLens2-93K 包含 23,793 个视频、93,232 个定位实例,其中 12,091 个实例有多个证据片段;2B、4B、8B 版本的平均 mIoU 分别为 44.5、47.7、48.0。3
这对长视频归档、剪辑检索和可复核问答更有用,因为结果不只给摘要,还能指回支持答案的时间段。边界是:这些结论来自七个基准,论文实现还设定了 2 FPS、最多 512 帧和 16K token 预算。代码与模型入口见 论文原文、GitHub 仓库 和 Hugging Face 集合。3




Comments
Sign in to comment.