快一点,实时视频为什么值得创业者认真看Chapters1×0:08开场:实时生成先是一条产品约束1:29第一层:推理加速不是一个算子的问题3:40第二层:实时视频是一种新的交互范式5:54第三层:底层和上层,中间的优化会收敛7:35第四层:数据优势最后要落到产品反馈9:20第五层:从研究者到创业者,先做对再做大11:26收尾:给正在做 AI 产品的人五个问题0:0013:020:08主持人这一期我们从十字路口Crossing对生数科技张金涛的访谈出发,聊一个听起来很底层、但最后会直接决定产品能不能成立的问题:推理到底要多快。张金涛在访谈里同时谈了 Vidu S1、SageAttention、TurboDiffusion 和 TurboServe,也谈了一个年轻研究者怎么从论文和代码走到带团队做产品。我们把这些内容压成几个给 AI 产品创业者有用的判断。0:36分析师先把产品说清楚。Vidu S1 不是把一个五秒视频从十分钟缩到五分钟,它的目标是用户上传一张图,选一个声音,和这个角色像打视频电话一样聊天,语音会实时影响角色的表情、动作和肢体语言。原集里给出的指标是五百四十 P、每秒二十五到四十二帧,并且可以长时间不断流。这里的关键词不是快一点,而是生成速度必须超过播放速度。1:05主持人这句话很容易被当成宣传语,但它其实是产品的硬门槛。离线视频可以等,实时交互等不了。只要生成速度低于播放速度,用户看到的就不是一个在回应自己的角色,而是一段不断卡住的预生成素材。对创业者来说,先问的不是模型能生成什么,而是用户的交互节奏要求系统每秒交付什么。1:29分析师张金涛的技术路线很清楚,推理加速至少有三层。第一层是算子层,让 Attention、线性层这些计算尽量逼近硬件上限。SageAttention 的起点很有代表性:大家普遍认为 FlashAttention 已经接近极致时,他发现 GPU 上还有更快的计算单元没有用于 Attention,于是追问了一句:「为什么没有人做?这是很明显的一个收益。」1:53主持人但这件事并不只是把一行代码写得更漂亮。访谈里提到,语言模型的 Attention 早期更容易受显存传输限制,单纯加速计算不一定有大收益;视频生成的 Attention 则更受计算速度影响。要做低比特 Attention,还要自己写 GPU Kernel,并处理精度损失。也就是说,机会往往出现在「大家默认已经够快」的地方,但你得先确认换一类模型或换一个工作负载后,瓶颈真的变了。2:24分析师第二层是模型层。算子再快,如果模型本身还要重复做五十步去噪,端到端速度也不会好看。TurboDiffusion 的做法,是结合更快的算子、蒸馏和稀疏 Attention,把 Diffusion 的去噪步数从大约五十步降到四步,同时减少模型的计算复杂度。这给产品团队一个很直接的提醒:性能优化不能只盯着底层 Kernel,也要问模型有没有在做冗余工作。2:52主持人第三层是部署层。模型在单张卡上跑得快,不等于全球用户能稳定用。流式视频有 KV Cache,有用户接入,有用户中断,还有多卡之间通信和计算能不能重叠。TurboServe 处理的就是这类集群调度与部署问题。三层合起来才是用户感受到的响应速度:算子快,模型少算,系统还要把请求接住。3:17分析师这三层也可以变成创业者的排查顺序。产品慢了,先不要立刻买更多卡。你要分辨是单个算子慢,是模型计算量太大,还是服务层没有把并行、通信、排队和中断处理好。三种问题对应完全不同的团队能力和成本结构,混在一起做,最后通常只会得到一个更贵但不一定更快的系统。3:40主持人访谈里另一个重要判断是,实时视频不能被理解成离线视频的加速版。离线视频的基本单位是一条片子,用户提交提示词,等结果,再播放。实时视频的基本单位是一个持续的 Session,每个人都在看自己的画面,每句话都会改变下一帧要生成什么。4:00分析师这会直接改变产品设计。离线内容可以共享同一个播放结果,实时内容需要为每个人单独生成。用户可能把宠物图片上传进去,让一只狗和自己聊天;也可能把游戏画面、Coding 界面或文档传进去,让角色看到屏幕后持续反馈。这里的价值不是角色长得多逼真,而是它能不能持续理解输入,并在用户还没失去耐心之前回应。4:27主持人所以 Vidu S1 的技术目标里有三个互相拉扯的变量:画质、实时性、长时间的一致性。张金涛明确说,产品定位既然是实时交互,效率就是第一目标,画质只能在这个前提下继续优化。当前阶段如果必须取舍,他宁愿画质稍微降低一点,也不能牺牲实时性。这个取舍值得产品经理记下来,因为它不是技术团队的内部偏好,而是由交互场景决定的。4:57分析师长时间稳定也比一句「支持视频生成」难得多。普通基础模型可能只需要把三十秒生成得好,实时角色却要连续运行一两个小时,画面不能漂移,不能崩坏,还要正确回应新的语音和视频输入。创业团队如果要做这类产品,评测指标不能只看单个样例的第一帧,而要测试 Session 持续时间、输入变化、用户中断、恢复速度和一致性。5:23主持人还有一个很实际的商业信号。访谈中提到,网页和 App 体验当时免费,API 会收费,每分钟大约两三块钱。这个数字只代表原访谈中的阶段性口径,不能直接当成今天的报价。但它说明了一个方向:当实时生成的成本下降到可以按分钟计费,产品机会才从演示转向服务。创业者要同时看用户愿不愿意持续互动,以及每分钟生成成本能不能撑住这种互动。5:54分析师张金涛对推理加速未来的概括很有意思:「推理加速的未来,还是属于更底层和更上层。」他认为中间的算子层会随着工具和编程能力进步逐渐收敛,大家都能把常见算子推到接近硬件上限。更底层是芯片和软硬件协同,更上层是通过算法减少模型需要做的计算。6:16主持人对创业者来说,这个判断不是让大家都去造芯片,或者都去做新算法,而是提醒你看清壁垒属于哪一层。通用芯片有规模和生态优势,专用芯片有成本和效率优势,但模型一更新,过度定制就可能变成资产负担。只做一个算法优化,如果没有真实硬件和端到端系统验证,也很难形成稳定壁垒。6:42分析师张金涛给出的词是 Co-Design,也就是硬件和算法一起设计。他说,一个好的推理加速工作,硬件和算法必须协同。这个判断可以转成尽调问题:你的算法在真实硬件上有没有跑过?性能是单算子指标,还是用户请求端到端的指标?模型更换后,优化还能不能迁移?如果答案只停留在论文图表,商业价值还没有被验证。7:08主持人上层算法的机会也不是简单地把模型变小。访谈中他提到稀疏 Attention、不同类型的蒸馏,以及针对不同请求减少不必要计算。更实用的产品问题是:用户已经给出足够信息时,系统还需要把每一层、每一个算子都完整算一遍吗?如果不需要,哪些计算可以跳过,跳过以后结果怎样验收,这才是算法和产品真正接上的地方。7:35分析师谈到中国视频模型为什么跑在前面,张金涛把重点放在数据,而不是继续争论模型结构。他的观点是,Transformer 之后模型结构逐渐收敛,差距更多来自数据量、数据质量、偏好对齐和数据是否容易学习。短视频、直播和电商生态提供了更多真实的视频需求,也沉淀了更丰富的数据。7:59主持人这段话里有一个创业者容易忽略的细节:数据多不等于数据好。访谈把低质量数据比作会污染学习过程的材料,也强调好的解释能让模型更快学会关键概念。放到产品上,就是你不能只收集用户上传了多少视频,还要知道用户的反馈有没有被结构化,什么样的输入让模型犯错,什么样的结果用户愿意继续互动。8:24分析师因此,数据飞轮不应该写成一个漂亮的箭头图。它至少要回答四个具体问题:用户在什么场景产生数据,哪些数据能改善下一次生成,改善能否在评测里复现,复现后的质量提升能不能带来更多使用。实时交互产品尤其要关注失败后的行为,用户是重试、修改角色、降低画质,还是直接退出,这些信号比一次点赞更接近真实产品价值。8:53主持人同时,我们要把张金涛的判断和事实分开。中国视频模型领先美国是他的访谈观点,节目没有在这期里提供一份中美公司的统一评测表,所以我们不把它说成已经完成的行业结论。对创业者而言,重要的不是站队,而是拿自己的场景去验证:数据来源、产品反馈和算力成本,究竟哪一个在形成差异。9:20主持人这期最适合创业者带走的,也许不是某个具体算子,而是张金涛讲自己怎么找到方向。他从清华博士研究开始做推理加速,后来进入生数,负责流式视频生成和推理部署。访谈里他反复提到一件事:先知道世界上最正确、最领先的方法是什么,再把每个环节正确实现出来。9:44分析师这句话听起来朴素,执行起来很硬。它要求团队把「我们有一个新想法」拆成一连串可检查的问题:当前最好的方法是什么,为什么适合这个任务,哪一行代码或哪个实验能证明我们实现对了,失败后是方向错了还是工程没做对。张金涛还提到,两行有问题的代码就足以让实验失败。对早期团队来说,这比泛泛谈创新更接近每天的工作。10:11主持人他讲到自己最开心的一段经历,是在安静的楼里,一个线程一个线程地排查底层问题,把 Vidu 里的 FlashAttention 换成 SageAttention,只改一行代码,输出像素级一致,端到端推理速度快了一倍多。这个故事里有一个很具体的创业信号:真正能改变产品的突破,往往先表现为一个可复现的工程结果,而不是一张宏大的路线图。10:38分析师接下来才是团队问题。张金涛说,带人不能只看技术能力,还要知道每个人想要什么,有人更在意工资,有人更在意 Credit,有人享受把事情做成的成就感。部门之间还会有不同利益,负责人需要从问题本质出发协调,而不是靠一句「大家目标一致」把冲突盖住。10:59主持人这对 AI 创业者有两个提醒。第一,一号位要能判断技术方案,也要能判断人和组织,不然底层突破很难变成稳定交付。第二,团队激励要和真实动机匹配。有人需要公开署名,有人需要更大的问题,有人需要清楚的成长路径。管理不是额外的软技能,它决定了复杂系统能不能持续运行。11:26分析师把这期压成五个问题,第一,你的产品需要的是离线生成,还是每个用户独立持续的实时 Session?第二,当前的慢到底发生在算子、模型计算量,还是部署和调度?第三,你的首要目标是画质、成本还是实时反馈,取舍有没有写进评测?11:45主持人第四,你的数据有没有来自真实使用,而且能解释哪些错误被修好了?第五,你的技术壁垒是否经过真实硬件和端到端产品验证,还是只在单点 benchmark 上好看?如果这五个问题答不清楚,继续加模型参数或买更多显卡,可能只是把不确定性变得更昂贵。12:07分析师这期节目根据十字路口Crossing对张金涛的完整公开音频转写和节目方 shownotes整理。我们没有把嘉宾原声直接剪进成品,所以你现在听到的是二次精炼和分析,不是原声剪辑版。需要回到上下文时,可以通过正文里的原集音频链接收听完整访谈。12:29主持人从一行代码的加速,到一个能连续运行的实时角色,中间隔着算子、模型、部署、数据和组织。对创业者来说,真正该追的不是某个热词,而是把自己的产品约束写清楚,然后一层一层验证。这里是七档 AI 创业者精选播客缩短版,我们下期再见。