
视频不是一串字幕:TwelveLabs 如何用 Marengo、Pegasus 和 Jockey 把 10 万小时变成可检索资产
The Data Exchange 对谈 TwelveLabs 的 Yoon Kim,解释 Marengo、Pegasus 和 Jockey 如何把视频搜索推进到跨视频推理,并面对数据规模、部署与治理约束。
单集信息
| 字段 | 内容 |
|---|---|
| 播客 | The Data Exchange with Ben Lorica 1 |
| 主持人 | Ben Lorica |
| 嘉宾 | Yoon Kim,TwelveLabs 总裁兼 Chief Strategy Officer 1 |
| 集标题 | Why Video Is AI's Next Great Frontier |
| 发布日期 | 2026 年 8 月 6 日(北京时间)2 |
| 原集链接 | The Data Exchange 官方单集页 |
视频理解最容易被低估的地方,不是模型能不能把一段画面描述成几句话,而是企业能不能在几十万小时的素材里找到那一个可用的片段。Yoon Kim 在这集里反复强调:
Search requires a set of data to be searched over. 没有先建立可检索的数据层,所谓「视频搜索」就只是对少量片段做演示。1先别把视频当成字幕
把视频转成 transcript,再交给 LLM,是最直观的方案,也正是 TwelveLabs 认为不够用的方案。对白之外还有动作、镜头关系、物体位置、时间顺序、语气和完全没有声音的画面。讽刺、混合语言和细粒度的视觉事件,也不一定会出现在字幕里。视频同时具有空间和时间结构,单张截图或一段文字都可能丢掉关键线索。1
TwelveLabs 的产品路线因此不是「给 LLM 接一个视频输入」这么简单,而是先训练自己的 video foundation models,再把它们放进上层工作流。Yoon 把两部分说得很清楚:
Marengo负责把视频变成可用于 vector search 的表示,回答「哪些片段彼此相似、哪些片段和查询相关」;Pegasus负责 video-to-text / video-to-language,把视频中的事件和关系表达出来;Jockey是新加的 agentic orchestration 层,调用前面两种能力,处理跨视频检索、整理和更复杂的任务。1
这里的分工决定了系统先做什么:不是让一个通用模型每次从头观看全部素材,而是先为视频建立可复用的索引、描述和知识。Yoon 将跨视频累积的结果称为
video reasoning:系统不只回答某个视频里发生了什么,也能把不同视频之间的线索放在一起。1数字说明了它为什么是基础设施问题
节目举的三个例子,比「视频会成为下一种模态」更能说明产品难点。
第一类是安全调查。客户可能需要在约 2,000 小时的监控视频中寻找一个人、一个动作或一条时间线;这不是让模型总结一段视频,而是让搜索结果能被复核。第二类是企业档案,讨论中出现了 100,000 小时视频的部署假设:真正的瓶颈先是数据如何数字化、整理、存储和搬运,之后才是模型回答得是否漂亮。第三类是纪录片剪辑:100 位受访者、约 2,000 小时素材,最后要压缩成 90 分钟。人可以判断叙事,但机器先把候选片段和人物关系找出来,剪辑师才有可能在有限时间内工作。1
这也解释了 Jockey 的位置。它不是另一个更大的基础模型,而是把搜索、跨视频知识、摘要和外部 LLM 组合起来的执行层。体育录像分析、安防调查、纪录片、科学研究和演讲反馈都可以共享一套视频理解底层,但上层任务不同:教练关心站位和战术,调查员关心事件链,剪辑师关心叙事和情绪。把这些任务都塞进同一个 prompt,既难复用,也难做权限和成本控制。
准确率之外,部署约束更硬
Yoon 没有把模型描述成脱离数据质量的魔法。低分辨率、模糊画面和不完整的摄像角度会直接限制识别结果;如果同一事件有多个机位,系统可以利用不同信息流之间的相关性提高检测精度。对企业来说,更棘手的常常是「视频怎么进系统」:数据可能在本地、客户 VPC、air-gapped 环境或不能离开现场的网络里。TwelveLabs 因而要面对 SaaS、Amazon Bedrock、customer VPC 和 on-prem 等不同交付方式。1
这集还给了一个容易被忽略的边界:任务越接近 mission-critical,post-training 越不可省。通用模型能覆盖常见场景,但客户自己的摄像机、行业术语和事件定义,最终仍要求数据治理与领域适配。视频理解的成本也不只是推理费用,还包括 ingestion、索引更新、存储和合规。把「能看懂一段视频」写成「能替企业理解全部视频」,中间隔着一整套系统工程。
为什么他把视频放进 AI 的下一层竞争
Yoon 对产业的判断是,frontier models 的价格和能力会继续下沉,价值会向服务和应用层移动。South Korea 的半导体、移动服务、娱乐和游戏产业让他看到另一条路径:国家可以讨论 sovereign models,但企业仍要回答模型如何进入已有内容和工作流。对 TwelveLabs 来说,视频不是一项孤立的视觉能力,而是一种长期积累的企业记忆。
这个判断有吸引力,也要留出距离。节目提供的是创始团队对产品路线和客户场景的解释,不是一份独立的准确率对比或 ROI 研究。听众如果要评估 TwelveLabs,下一步应追问三件事:在自己的素材上,Marengo 的召回率如何;Pegasus 和 Jockey 的成本怎样随视频量增长;部署在本地或 VPC 后,索引更新和权限审计是否仍然可用。
可引用原话
Search requires a set of data to be searched over. ——Yoon Kim 1
We have kind of a store of knowledge that gets accumulated over time, even between videos. ——Yoon Kim 1
There is going to be a delineation of different tasks. And depending on what the task is, frontier models may not be used. ——Yoon Kim 1
适合谁,哪些可以跳过
- 适合:做视频检索、安防分析、媒体资产管理、体育分析、Video RAG 或多模态基础设施的人;也适合要判断「视频数据到底该先建索引还是先接 LLM」的产品和工程负责人。
- 核心增量:这集把视频 AI 拆成
Marengo的检索表示、Pegasus的视频语言能力和Jockey的任务编排,并用 2,000 小时、100,000 小时和 90 分钟成片这些场景说明,难点在数据层与执行层,不只在模型大小。 - 可以跳过:如果你只想看一个新模型的 benchmark,这集没有给出完整的横向实验表;South Korea 的产业讨论也可以略听。最值得完整收听的是从视频搜索、跨视频知识到部署治理的中段。

AI 工程与研究播客精读
盯住 8 个英文 AI 技术播客,新一集发布后产出中文高信噪比精读,一集一篇。
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.
More from this channel›
- AI agent 出问题,先查权限:The Data Exchange 谈 AGI 泡沫与中国 robotaxi
- AI 不只是找漏洞了:Truffle Security 与 Socket 解释为什么 supply chain 成了第一防线
- vLLM 不只是推理库:Inferact 如何把 open-weight 模型变成可控的 AI 基础设施
- Trillion-Dollar AI 公司不是估值题:No Priors 把「市场多大」与「多久做成」分开
- 从模型到 Agent Harness:Practical AI 解释多智能体系统到底多了什么
- 从 0.1% 到约 15%:Chai Discovery 为什么把药物设计当成 scaling problem
- 从 200,000 个 token 到 10× 加速:Baseten 如何把模型权重变成可用 API