李祥瑞这篇 LibTV Agent 实测:从 60 秒广告到 123 秒带货视频

李祥瑞这篇 LibTV Agent 实测:从 60 秒广告到 123 秒带货视频

这期精读李祥瑞的 LibTV Agent 上手实测,拆解它如何用问询卡、资产锚点、分镜表和自定义 Skill,把广告、短剧、带货与讲解视频推进到成片交付。

原文信息

这期精读的主文是李祥瑞在微信公众号「折腾 AI 怎么落地的」发布的「今天刷屏的 LibTV Agent,我让他一口气做了 123 秒的电商带货视频」。微信搜索结果给出的发布时间是 2026-07-14 22:29:54,原文页面可见日期为 2026.07.14。1
这篇文章的价值不在于又喊了一遍「AI 导演」,而是它把 LibTV Agent 放进四个连续任务里试了一遍:60 秒新中式广告、72 秒古装短剧、123 秒电商带货视频,以及一个自定义讲解视频 Skill。四个任务刚好覆盖广告、短剧、带货、知识讲解,比同晚其它单场景测评更适合作为主文。
同一晚的交叉材料里,文摇把重点放在反转广告、公益广告 Demo 和数字人口播,认为 LibTV 的关键动作是「先问问题、再生成角色和分镜」,而不是直接抽卡。2 进击的潘达则把它放进科研视频场景,测试科普卡通动画、细胞自噬动画和免疫荧光标准操作视频。3 GoWalker 的文章在抓取时显示已被作者删除,本期不把它作为细节证据。

全文速读

李祥瑞这篇实测把 LibTV Agent 的卖点压成一句话:用户不再从空白提示词开始,而是先选一个 Skill,再让 Agent 把需求拆成资产、问询卡、分镜、配音、字幕和成片。原文里最有信息量的不是「效果还不错」,而是这些中间件细节。
第一条盖碗广告里,作者只给了一句话需求和一张产品图。Agent 先把随手拍变成产品三视图和细节图两个锚点,再用问询卡追问广告目的、创意手法、时长、画幅、分辨率、旁白和人物介入方式;后面又继续追问旁白语气、字幕和场景氛围。1
第二条古装短剧里,作者自己写了 700 多字剧本。Agent 生成三个主角的全身三视图、六个头部角度和表情,再把道具也做成资产锚点;随后按剧本语义拆成 8 个分镜,每镜标出台词负载和时长理由。原文还提到,成片 72 秒,作者剧本结尾句「她走的这条路,叫回来」没有被改写,直接上片。1
第三条带货视频是最有冲击力的部分。作者给了一条 126 秒居家好物口播参考视频和一张男生半身照,要求把视频里的人换成图中男生,成片不少于 1 分钟。Agent 先把原视频拆成 11 段,识别哪些镜头没有男配角、哪些镜头需要两人协同,又发现第 08 镜 16 秒超过单次生成 15 秒上限,于是拆成两个子分镜。最终成片 123 秒,主讲人替换为照片里的男生,原视频台词、情节、产品演示动作和场景切换逐条还原。1
这也是本篇与前两期追踪不同的地方:前两期更像是在看 LibTV Agent 的产品定位和单作者上手体验;李祥瑞这篇把「成片交付」拆到了操作层,能看到系统如何问、如何拆、如何纠错、如何复用。

功能细节拆解

1. 问询卡不是表单,是把客户 Brief 补齐

主文里,盖碗广告的问询卡连续追问十个问题。这个细节很关键。传统文生视频的失败,很多时候不是模型不会生成,而是需求根本没写成可执行的制作单。用户说「新中式广告」「高级感」「留白」,这些词听着顺,但落到制作上还要决定产品露出、人物是否出镜、旁白要不要、横竖屏、分辨率、字幕和场景。
文摇的交叉实测也提到,输入公益广告需求后,LibTV 没有直接生成视频,而是先发问,再生成形象、分镜脚本、分镜图片、详细提示词、音效提示词、调色规范和剪辑节奏。2 这说明问询不是李祥瑞个案,而是 LibTV Agent 当前产品流程的一部分。

2. 锚点解决的不是美观,而是可改

李祥瑞反复提到「三视图」「细节图」「角色资产」「道具锚点」。这类资产不是为了截图好看,而是为后续分镜提供同一套引用。盖碗广告需要保证碗口和瓶身不走样;古装短剧需要沈玉柔的红斗篷、萧景珩的玄袍从第一镜到最后一镜保持一致;带货视频则需要主讲人的身份贯穿 123 秒。
网易号「白鲸实验室 one」的同日测评也把角色三视图视为 LibTV 处理角色一致性的方案:Agent 先生成角色正面、侧面、背面参考图,以及服饰、配饰和表情设计,后续分镜基于这套图生成。4

3. 自动纠错开始进入交付报告

盖碗广告里最像「Agent」的细节,是「拾青」被读成「食青」后,系统自己发现、拆句重配,再用语音识别核对台词。这个能力在原文里只是一个小插曲,但它指向成片工具最难的一段:不是生成,而是发现局部错误并把它修回去。
这件事还不能被过度解读。原文只展示了一个读音纠错案例,不能推出 LibTV 已经能稳定处理所有字幕、配音和画面问题。潘达的科研实测就留下了一个反例:他认为 LibTV 能直接生成一分多钟视频,风格和元素基本一致,但中英文字幕位置有时会偏移,需要自己修正。3

4. 自定义 Skill 是把个人经验写进流程

主文第四个任务里,作者把自己的讲解视频规则写成 SKILL.md:每句口播必须有对应画面,每十来秒一个知识点,信息正确优先于画面好看;输入是文档配图、讲解稿和讲解人照片,输出是 60 秒以上的讲解视频。创建入口在 Skill 广场「我的」里,填写名称、介绍、使用场景,再上传 md 文件。之后新项目调用时,Agent 在右侧面板提示「第 5 镜内容较多,先检查是否需要拆分,按规则单镜不超过 15 秒」。1
这比「模板市场」更进一步。模板通常只保存一个结果形态,Skill 保存的是判断顺序和约束条件。它的上限取决于创作者是否愿意把真实经验写得足够细,也取决于 Agent 能不能严格执行这些约束。

目标用户场景

李祥瑞这篇文章实际覆盖了四类人。
广告和电商团队最容易理解带货视频那一段。把参考视频拆成 11 段、保留台词和产品动作、替换主讲人,这接近品牌和商家日常最常见的需求:不是凭空创作一条大片,而是快速把已有爆款结构改成自己的产品、人物和语种。不过这里也有合规边界。原文提醒,真人照片要先在平台过活体授权校验,明星和版权内容有严格限制。1
短剧和剧情号会关注 72 秒古装短剧。它验证的是剧本、人物、道具、分镜和台词时长能否被放进同一套项目里管理。原文说顶部可以在工作流和故事板两个视图之间切换,故事板把锚点、文本、视频分区码好,改哪个镜头可以点进去单独重生成,不用整片重跑。1
知识类创作者和企业内训团队会盯住自定义 Skill。潘达的科研场景给了一个很具体的补充:科研人员可以把活细胞成像、细胞自噬、免疫荧光标准操作流程做成动画或教学视频,用于科普、教学和新人培训。3 这个方向不一定带来最炫的样片,但更接近长期刚需。
还有一类是有方法论的创作者。ChooseAI 的报道提到,LibTV 同步启动「Skill 超创激励计划」,投入 1000 万元创作激励,面向导演、广告创意人、短剧团队、自媒体创作者和 AI 开发者,提供流量、现金激励、品牌共创和长期收益。5 这意味着 LibTV 不只想卖工具,也想把「创作方法」变成平台供给。

竞品坐标

李祥瑞的叙述里,隐含的竞品不是某一个视频模型,而是过去那套「多工具拼接」流程:先出图,再挑图,再生视频,再剪,再修字幕和配音。文摇也用了类似对照:一般 AI 视频网站会直接生成,有经验的制作人还要先想分镜、把每个 15 秒左右片段生成出来,再回到剪辑软件拼接。2
所以 LibTV Agent 的竞品坐标可以分成两层。
第一层是单模型视频生成工具。它们的核心指标是单镜头质量、速度、时长和画面稳定性。LibTV 不一定在每个底层模型上占优,但它试图把模型能力包在一个可管理的项目里,让用户少切工具。
第二层是剪辑和工作流工具。LibTV 的双视图、节点、故事板、资产锚点和局部重生成,瞄准的是「成片生产」而不是「片段生成」。ChooseAI 的报道把这次更新概括为四项能力:围绕成片构建的 Agent、首批超百个 Video Skill、Storyboard 与 Node Workflow 双视图,以及 Agent 驱动剪辑。5
这也是为什么本期不把 LibTV 简单归类成「又一个一键成片工具」。它更像是在把视频制作里的导演、制片、分镜、剪辑和资产管理,压缩成一个可对话、可回看、可局部修改的工作台。

行业影响

如果李祥瑞这篇实测反映的是 LibTV Agent 的稳定能力,那么 AI 视频工具的竞争会从「谁能生成更惊艳的一段」转向「谁能少返工地交付一条完整片」。这对短剧、广告、电商、知识视频都有现实意义,因为这些行业真正耗时间的往往不是第一版,而是改稿、补镜头、换人、换产品、改字幕、改配音。
不过推广口径里仍有不少需要打问号的地方。澎湃号文章称,LibTV 邀请 200+ 位广告导演、MV 导演、短剧团队和品牌创意等专业生产者,打造 100+ 个专业 Skill。6 ChooseAI 也提到官方称「针对 3 分钟以内的视频创作任务,一次生成达到可交付标准的成功率超过 80%」,并明确指出这个数字是官方自述,尚无第三方测试结果或客户案例公开验证。5
这两个口径正好对应两个验证点:Skill 的供给质量,以及成片可交付率。前者要看 Skill 是不是真有导演级流程,而不是把 Prompt 包装成商品;后者要看不同题材、不同素材质量、不同用户水平下,返工次数到底降了多少。

待验证点

第一,123 秒带货视频的「完整复刻」需要更多样本。主文给出的案例很完整,但它仍是单条参考视频、单个人物替换、单次作者体验。对电商团队来说,真正要验证的是不同品类、不同口播节奏、不同场景和多人互动下,是否还能保持人物一致、动作连贯和产品演示准确。
第二,自动纠错能覆盖哪些错误。读音纠错很好,但画面穿帮、字幕偏移、口型不同步、配乐节奏不对、品牌露出不合规,都是成片交付里更棘手的问题。潘达实测里已经出现「中英文字幕位置有时候会偏移」的提醒。3
第三,自定义 Skill 的门槛还要看普通创作者能不能写明白。李祥瑞能把自己的讲解视频规则写成 SKILL.md,是因为他本来就有一套明确方法。很多创作者只有经验,没有结构化规则。LibTV 如果想让 Skill Hub 成为供给市场,就得帮助这些人把经验翻译成可执行流程。
第四,版权和授权会成为带货、换人、复刻爆款的硬边界。原文已经提醒真人照片要活体授权,明星和版权内容有严格限制。这个约束越清晰,商业客户越敢用;越模糊,越容易把「高效复刻」变成合规风险。

原文关键句

「中间我干的活,主要是回答问题和点确认。」1
这句话解释了 LibTV Agent 想改变的分工:用户不再逐镜头写提示词,而是像客户、导演或监制一样,把方向讲清楚,在关键节点确认。
「它问的这十个问题,就是一个制片人接单时该问客户的问题。」1
这句比「一键成片」更准确。好视频不是少问问题,而是该问的问题不能漏。
「它把我随手定的土规矩,当成执行标准在逐镜核对。」1
这句是本篇最值得继续追踪的产品信号。AI 视频 Agent 如果只能调用官方 Skill,它仍是平台能力;如果能稳定执行用户自己的规则,它才可能变成团队的生产系统。

Contenido relacionado

  • Inicia sesión para comentar.
More from this channel