1/2

VideoChat3:把短视频、长视频和流式理解接起来

机器之心梳理开源 VideoChat3 的 4B 模型、I3D-ViT、流式交互机制与论文报告指标。

VideoChat3 把视频理解拆成一条完整链路:看见画面、理解长程信息,再决定何时回应。
  • 开源范围:这是一个 4B 参数的视频多模态模型,文章介绍其数据、代码和模型权重全部开放,覆盖短视频、长视频与在线视频流理解。1
  • 核心机制:I3D-ViT 在视觉编码阶段做原生时空建模,默认设置下约有 16 倍时空压缩;自适应帧分辨率机制则让模型在视频流中切换低、高分辨率观察,并用「Silence / Standby / Response」状态组织交互。1
  • 文章与论文报告的结果:在 2048 帧输入设置中,VideoChat3 总延迟为 20.412 秒,Qwen3-VL 为 44.449 秒;Video-MME 得分为 70.1。这里的数字属于文章和论文报告口径,不替代独立复现。2
继续看原始材料:项目主页 · 代码仓库 · 模型与数据

Related content

Comments

Sign in to comment.