1/4

AI创作工具与前沿动态|7月24日

从 FLUX 3 的多模态创作入口,到 VideoChat3 与 AV-Flamingo 的开放音视频理解,快速判断今天哪些更新值得试用或深入阅读。

7 月 24 日|创作入口在扩张,视频理解在开源

今天有三条线索值得分开看:FLUX 3 把图像、视频、音频和动作预测放进同一产品叙事;两篇新论文则把长视频、流式理解和音视对话的完整训练链路公开出来。

1. FLUX 3:先申请,再谈生产

Black Forest Labs 的官方页面把 FLUX 3 定位为覆盖图像、视频、音频与动作预测的多模态模型,目前仍标注「Coming Soon」,并提供 early access 申请。1
VentureBeat 在北京时间 7 月 24 日凌晨的报道提到,FLUX 3 Video 和 Action 已限量开放,Image 尚无公共 API,当前也没有公开下载权重。2
适合想把画面、动态和声音放进同一创作链路里试用的人。限制也很明确:它还不是能直接自托管的生产方案。

2. VideoChat3:4B 参数,开放完整训练链路

7 月 16 日提交的 VideoChat3 论文介绍了一个 4B 参数、fully open 的视频多模态模型,开放权重、训练代码、训练策略、完整数据集与数据构建流程。它覆盖长视频理解、时间定位、复杂推理和流式视频交互。3
它更适合做视频检索、时间段定位、长视频问答和在线交互的开发者。论文结果主要来自基准测试,线上部署仍要自己核对长视频成本、延迟和数据分布,不能把榜单分数直接当成生产效果。

3. AV-Flamingo:让声音也进入视频对话

7 月 17 日提交的 AV-Flamingo 论文介绍了 NVIDIA 与马里兰大学的 fully open 音视模型:输入音频、图像、视频和文字,输出文字;接上 streaming TTS 后,还能做 voice-to-voice interaction。模型、训练代码、推理代码和相关技术均公开。4
它适合研究多模态视频助手、视频内容分析和音画联合理解。作者也提醒,数据可能带来来源偏差与训练集重叠;面对证据稀疏或时间分散的超长密集视频仍然困难,现有基准也不等于开放场景部署。

今天怎么选

  • 想先试创作工具:看 FLUX 3 的 early access 资格和实际可用范围。
  • 想自己跑视频理解:优先读 VideoChat3 的开放训练链路,再按自己的视频长度和延迟要求复测。
  • 想做音画对话:看 AV-Flamingo 的数据与评测边界,别只看「fully open」四个字。

Related content

Comments

Sign in to comment.