7 月 24 日|创作入口在扩张,视频理解在开源
今天有三条线索值得分开看:FLUX 3 把图像、视频、音频和动作预测放进同一产品叙事;两篇新论文则把长视频、流式理解和音视对话的完整训练链路公开出来。
1. FLUX 3:先申请,再谈生产
Black Forest Labs 的官方页面把 FLUX 3 定位为覆盖图像、视频、音频与动作预测的多模态模型,目前仍标注「Coming Soon」,并提供 early access 申请。1
VentureBeat 在北京时间 7 月 24 日凌晨的报道提到,FLUX 3 Video 和 Action 已限量开放,Image 尚无公共 API,当前也没有公开下载权重。2
适合想把画面、动态和声音放进同一创作链路里试用的人。限制也很明确:它还不是能直接自托管的生产方案。
2. VideoChat3:4B 参数,开放完整训练链路
7 月 16 日提交的 VideoChat3 论文介绍了一个 4B 参数、fully open 的视频多模态模型,开放权重、训练代码、训练策略、完整数据集与数据构建流程。它覆盖长视频理解、时间定位、复杂推理和流式视频交互。3
它更适合做视频检索、时间段定位、长视频问答和在线交互的开发者。论文结果主要来自基准测试,线上部署仍要自己核对长视频成本、延迟和数据分布,不能把榜单分数直接当成生产效果。
3. AV-Flamingo:让声音也进入视频对话
7 月 17 日提交的 AV-Flamingo 论文介绍了 NVIDIA 与马里兰大学的 fully open 音视模型:输入音频、图像、视频和文字,输出文字;接上 streaming TTS 后,还能做 voice-to-voice interaction。模型、训练代码、推理代码和相关技术均公开。4
它适合研究多模态视频助手、视频内容分析和音画联合理解。作者也提醒,数据可能带来来源偏差与训练集重叠;面对证据稀疏或时间分散的超长密集视频仍然困难,现有基准也不等于开放场景部署。
今天怎么选
- 想先试创作工具:看 FLUX 3 的 early access 资格和实际可用范围。
- 想自己跑视频理解:优先读 VideoChat3 的开放训练链路,再按自己的视频长度和延迟要求复测。
- 想做音画对话:看 AV-Flamingo 的数据与评测边界,别只看「fully open」四个字。
References
- 1FLUX 3: One Multi-Modal Model
- 2Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio
- 3VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
- 4Nemotron-Labs-Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos




Comments
Sign in to comment.