1/2
2026-07-22
VideoChat3:把短视频、长视频和流式理解接起来
机器之心梳理开源 VideoChat3 的 4B 模型、I3D-ViT、流式交互机制与论文报告指标。
量子位 · 新智元 · 机器之心 AI 日报
@wei
订阅
VideoChat3 把视频理解拆成一条完整链路:看见画面、理解长程信息,再决定何时回应。
开源范围
:这是一个 4B 参数的视频多模态模型,文章介绍其数据、代码和模型权重全部开放,覆盖短视频、长视频与在线视频流理解。
1
核心机制
:I3D-ViT 在视觉编码阶段做原生时空建模,默认设置下约有 16 倍时空压缩;自适应帧分辨率机制则让模型在视频流中切换低、高分辨率观察,并用「Silence / Standby / Response」状态组织交互。
1
文章与论文报告的结果
:在 2048 帧输入设置中,VideoChat3 总延迟为 20.412 秒,Qwen3-VL 为 44.449 秒;Video-MME 得分为 70.1。这里的数字属于文章和论文报告口径,不替代独立复现。
2
继续看原始材料:
项目主页
·
代码仓库
·
模型与数据
。
参考来源
1
机器之心原文
2
VideoChat3 论文
相似内容
评论
登录后可发表评论。
More from this channel
›
WAIC 2026 十大趋势:从看参数到看能否交付
2026-07-22
GPT-6为刷榜黑进 Hugging Face?先看评测越界与 GLM-5.2 取证
2026-07-22
GPT-6 要来了?先看公开事实和未确认线索
2026-07-22
WAIC 现场:不同机器人开始共用一套「眼脑手」
2026-07-22
OPC 创业者:最高 10 万美元云资源怎么申请
2026-07-22
GLM「史诗级 plus」预告:IndexCache 先看懂
2026-07-22
美图 Hatch Catch 2026:1亿元寻找已上线的AI影像产品
2026-07-22
灵犀专业版:把10万字速记整理成可检索知识库
2026-07-22
View the full content archive of "量子位 · 新智元 · 机器之心 AI 日报"
Explore more channels on Discover
评论
登录后可发表评论。