H3 接入 LibTV 后,0.2 元/秒能否成为日常生产价?深读官方首发稿

H3 接入 LibTV 后,0.2 元/秒能否成为日常生产价?深读官方首发稿

精读 LibTV 官方关于 MiniMax H3 联合首发的更新,拆开多模态能力、768p 与 2K 活动价、项目成本估算和仍待验证的计费边界。

导读

LibTV 这次的 H3 更新,表面是接入一个新视频模型,真正要卖的是一套「模型能力 + 工作流 + 低单价」的生产方案。官方公众号给出 768p 0.1 元/秒、2K 0.2 元/秒的上线活动价,也给出约 10 元做一支广告、约 20 元完成一集短剧的项目估算;但后一个数字明确受时长、分辨率、生成次数和 Skill 影响,不能直接当成固定成本。
主文值得精读的地方,正是这两个口径之间的落差:H3 的多模态能力是否真的能减少返工,活动单价是否能覆盖可用成片所需的多次生成,以及 LibTV 把模型接进画布、Skill 和「一抽四 / 一抽八」之后,用户买到的到底是更便宜的一段视频,还是更完整的生产流程。

原文信息

官方文章把 H3 定义为「新一代开放通用多模态视频模型」,并把产品价值拆成两层:一层是文字、图片、视频、声音的统一理解;另一层是 LibTV 提供的 Skill、批量候选生成与一站式成片流程。1

全文速读

H3 的第一条产品承诺不是「只用一句话生成视频」,而是把创作者通常要分别处理的参考图、动作视频和声音素材,放进同一个多模态上下文。官方称,模型支持 5 至 15 秒视频生成、24 FPS 输出、原生双声道声音,以及 21:9、16:9、4:3、1:1、3:4、9:16 六种画幅;单次最多输入 9 张图片、3 段视频和 3 段音频,混合参考素材最高 12 个文件,提示词最高 7000 字符。1
第二条承诺是「生成之后还能继续改」。官方把人物、商品、背景、光影、动作、台词和声音都列为可修改对象,试图让 H3 覆盖从多素材参考、视听生成到精准编辑的连续过程。这个表述比普通文生视频更接近商业项目:广告片要换商品信息,短剧要修人物动作,产品演示要改界面和旁白,用户不必每次从空白提示词重新开始。1
第三条承诺来自 LibTV 的平台包装。文章称 H3 可以结合「爆款复刻」等专业 Skill,从创意分析、素材生成一路做到最终成片,还能用「一抽四」「一抽八」一次展开多个候选版本。这样一来,平台强调的单位就不再是一次生成,而是同一场戏同时比较不同表演、广告创意、运镜和节奏后再筛选。1
价格部分有三个容易混淆的数字:活动期间,768p 低至 0.1 元/秒,2K 低至 0.2 元/秒;官方又称约 10 元可制作一支广告视频、约 20 元可完成一集短剧。第二组不是统一规格的价目表,正文已经说明还会受到视频时长、分辨率、生成次数和 Skill 影响。1
交叉材料补上了「工作流」的一面,但没有替官方公告做质量背书。阿涛 AI 笔记把 LibTV 概括为无限画布和节点工作流,强调剧本、分镜、图像、视频、音频可以放在同一空间,同时也提醒节点学习成本、多模型依赖和定价不透明。2
立德树人微课堂的个人实测则记录了另一条边界:作者用不同 Skill 做出四条风格差异明显的片子,选择手动确认模式,遇到第四个分镜人物服装变化后,用上一镜尾帧重新衔接并锁定造型。文章说明 Agent 能把方法接进生产流程,但也说明成片连续性仍然需要人发现问题、提出修改。3

功能细节拆解

1. 多模态输入的价值,在于减少素材翻译

人物图、商品图、场景图、动作视频和声音参考,原本往往要被拆到不同工具里,再靠提示词把它们重新拼起来。H3 的主文叙述,是让模型在一次上下文里同时理解这些材料:图片提供外观,视频提供动作和运镜,声音提供台词、音色、音乐或环境声。1
这会直接影响商业素材的准备方式。电商广告可以把商品、人物和品牌风格一起交给模型;短剧可以把角色参考、动作示范和台词声音一起交给模型;UI 或游戏演示则可以把界面、角色和交互动作放进同一任务。官方列出的场景包括 AI 短剧、广告、电商、影视创意、MV、游戏角色和 UI 交互,但这些是适用方向,不是每个方向都已经被同一套公开测试证明。1

2. 「可编辑」比「能生成」更接近日常生产

单次生成最容易展示最好的一版,商业生产最常见的却是局部修改。商品换颜色、人物换动作、背景换光线、台词改一处,都会考验模型能否保留其它已经通过审核的内容。
H3 的宣传重点是这些修改对象可以继续在同一模型里完成。这意味着它想减少的是重新描述、重新上传、重新抽卡的成本,而不只是提高一条样片的峰值画质。官方没有公布局部修改的成功率、版本差异、失败扣费或修改是否会牵连其它元素,因此「精准编辑」目前仍是能力描述,不是交付指标。1

3. LibTV 的附加价值,是把模型接到选择和复用上

如果只比较模型接口,H3 的输入上限、画幅、帧率和声音能力是核心;放进 LibTV 后,平台还在卖三个动作:用 Skill 把创作方法预先写进流程,用画布保存素材和节点,用一抽四 / 一抽八扩大候选集。
阿涛 AI 笔记对无限画布和节点工作流的描述,强调的是可规划、可复用、可调整,而不是一句话出片。立德树人微课堂的实测也显示,用户可以在故事板和工作流视图之间切换,前者检查整条片子的顺序,后者定位具体素材和镜头;当人物连续性出问题时,作者仍要主动指出问题并触发修复。2 3
所以,H3 在 LibTV 里的差异化不只是「能不能生成声音」,而是能否让声音、画面、方法和候选版本留在一个项目里。这个价值对连续内容更大,对只想比较单条画质的人反而未必划算。

4. 价格很低,但四种成本还没有被填进同一张账

官方文章给出的数字可以这样读:
口径官方或报道中的数字能说明什么不能说明什么
LibTV 活动单价768p 低至 0.1 元/秒当前宣传的低分辨率生成门槛活动持续时间、配额、失败和重试是否同价
LibTV 活动单价2K 低至 0.2 元/秒当前宣传的高分辨率生成门槛2K 与正文所称最高 1440p 的对应关系,以及实际可用成片成本
项目估算约 10 元一支广告、约 20 元一集短剧官方希望用户形成的项目预算直觉样本时长、镜头数、生成次数、人工审核和后期范围
MiniMax 侧公开口径网易号文章称 2K 为 0.8 元/秒说明同一模型可能存在不同渠道或服务口径不能直接推翻 LibTV 的活动价,也不能证明两者规格和计费条件一致
前 3 行来自 LibTV 官方主文;网易号文章则称 MiniMax H3 视频生成价格为 0.8 元/秒,分辨率为 2K,并把这个价格放在 MiniMax 发布会或模型侧的叙述中,但没有说明它是否对应 LibTV 的活动套餐。1 4
这组差异不一定是事实冲突。更可能的解释是,0.2 元/秒是 LibTV 上线期间的活动价,0.8 元/秒是另一服务渠道、另一套餐或非活动价。但在没有官方套餐页、额度表和有效期说明前,不能替用户把两个数字换算成统一的长期价格。
LibTV 产品页在本次读取时只展示「创作,只需要一张画布」「TV Show」「全部」等入口,没有公开 H3 的完整价格、积分、失败重试或项目账单规则。5

目标用户场景

需要大量测试方向的广告和电商团队

「一抽四 / 一抽八」对广告创意验证最有吸引力:同一个商品可以同时试几种人物表演、运镜和节奏,团队先扩大候选,再把人工时间花在筛选和修改上。低活动价也适合测试多个方向,但前提是每个候选的扣费规则透明,否则低单价会被候选数量放大。1

做连续短剧、漫剧和系列短视频的小团队

角色参考、动作视频、声音和 Skill 可以反复进入同一套流程,适合有固定人物、固定画风、持续更新计划的团队。它们更在意的是角色能否跨镜头保持、修改是否只影响局部、下一集能否接着上一集的资产继续做。
但立德树人微课堂的体验提醒了一点:即使 Agent 能自动生成多条片子,服装、人物和镜头衔接仍可能在某一镜出错,需要作者手动发现并用尾帧修复。对系列团队来说,真正应该记录的是通过率、返工次数、人工小时和每集最终可发布比例,而不是「一次做出了几条」。3

有方法论、想把风格固定下来的创作者

立德树人微课堂的作者把李安电影美学整理成自定义 Skill,写入取景、构图、人物关系、情绪节奏和声音处理,再让 Agent 在后续创作中调用。这个案例说明 Skill 的价值不只在于套一层色调,也可能把一套创作判断写进剧本、分镜和成片流程。3
它不适合被理解成「把导演经验上传后就能稳定复制」。自定义方法仍要经过多次项目验证,才能知道它是在重复真正有效的判断,还是只在一条样片里偶然奏效。

只想抽一条高画质片段的人

这类用户可能更适合直接比较模型输出、速度和价格。无限画布、节点、Skill、版本管理和多候选流程会增加学习成本;阿涛 AI 笔记也把节点工作流的学习门槛和多模型依赖列为 LibTV 的缺点。2

竞品坐标

这篇官方首发稿没有提供统一提示词、相同素材、相同分辨率和相同验收标准下的对比,因此不能推出 H3 的画质排名,也不能把 0.2 元/秒直接写成全行业最低长期价格。更合理的坐标是三条生产路径:
路径主要购买对象用户仍要承担的工作适合的判断指标
模型或 API 侧直接调用单个模型的理解、生成与编辑能力组织素材、写流程、筛选候选、合并成片和核对账单单次效果、响应速度、单位价格、接口稳定性
单一视频应用更简单的输入到输出体验复杂参考素材、跨镜头连续性、局部修改和方法复用上手速度、默认成片率、修改成功率
LibTV 工作台路线H3 加画布、节点、Skill、多候选与一站式流程选择工作流、验收结果、管理项目和核对实际消耗项目周期、返工率、资产复用、可发布比例、项目总成本
网易号同日文章还称 H3 在 Artificial Analysis 的视频模型榜单中「视频编辑能力项」排名全球第一,但这只是该文的转述,没有在本次材料中看到榜单版本、测试任务和评分方法,不能据此给 H3 做普遍质量排名。4
LibTV 真正要证明的,不是 H3 单条视频一定比其它模型好,而是用户在一个持续项目里,是否能少搬运文件、少重复描述、少返工,并把多次尝试的成本算清楚。

行业影响

视频模型的竞争从单项能力转向组合账

H3 这篇首发稿把输入素材、生成、编辑、Skill 和价格放在同一个产品故事里,说明平台竞争已经不只围绕「哪一帧更好看」。当视频要进入广告、短剧、电商和产品演示,声音、品牌信息、人物连续性、局部修改和项目成本都要同时过验收。1
这会把用户的比较表从「画质 / 速度 / 单秒价」扩展到「一次通过率 / 修改保真度 / 可复用素材 / 失败扣费 / 项目总账」。低价只有在返工少、失败不重复扣费、局部修改不牵连整段重跑时,才会转化为日常生产优势。

开源叙事与平台活动价可能是两条线

网易号文章称 H3 将在未来几天内开源,并把企业本地部署、芯片适配和生态协作作为模型侧叙事的一部分;LibTV 官方主文则聚焦「现已上线 LibTV」和活动价格,没有展开开源时间、权重、部署条件或本地运行成本。4 1
这两条线并不互相替代。开源解决的是部署和生态选择,平台活动价解决的是今天能否低门槛试用。对企业而言,最终要比较的仍是合规、硬件、运维、模型更新、导出能力和内容生产效率的总成本。

待验证点

  1. 活动有效期:768p 0.1 元/秒和 2K 0.2 元/秒的「上线限时优惠」何时结束,是否区分新老用户、套餐和模型规格?
  2. 2K 与 1440p 的对应关系:正文一处称最高可由 768p 升级至 1440p,另一处直接给出 2K 价格,产品页面没有公开解释两种命名和输出尺寸的关系。1
  3. 真实扣费:失败、重试、局部编辑、一抽四和一抽八分别怎样计费?一次任务生成多个候选,是按视频秒数、候选数量还是模型调用次数收费?
  4. 项目估算的样本:约 10 元广告和约 20 元短剧分别对应多长视频、多少镜头、多少次生成、哪一种 Skill,是否包含字幕、BGM、剪辑和人工审核?
  5. 连续性指标:H3 在人物、商品、动作、声音和文字信息上的成功率是多少?官方没有给固定提示词、统一素材、失败样本或跨镜头通过率。1
  6. 编辑边界:修改一个人物动作或一句台词时,已经通过的背景、光线、商品标识和声音是否保持不变?
  7. Skill 的可复用性:现成 Skill 和用户自建 Skill 在不同题材、不同模型和不同素材下能否稳定复现方法,还是主要对单次样片有效?
  8. 第三方价格差异:网易号文章称 2K 价格为 0.8 元/秒,需由 MiniMax 或 LibTV 说明这是否对应 API、标准价、另一地区或另一计费渠道。4
  9. 榜单与开源口径:Artificial Analysis 的编辑能力排名、H3 开源时间和可部署条件,都需要版本、原始公告和测试方法,而不是只引用转述。4

原文关键句

「能力决定视频能做到什么,成本决定它能否真正进入日常生产。」1
这句话是全文的判断轴。H3 的多模态输入、原生双声道和编辑能力回答「能做什么」,但只有把失败、返工和候选筛选的账算清楚,低价才回答得了「能不能持续做」。
「约 10 元制作一支广告视频,约 20 元完成一集短剧。」1
这是最有传播力、也最需要条件说明的一句。官方紧接着写明实际成本受时长、分辨率、生成次数及 Skill 影响,因此它更像一组项目示例,而不是广告和短剧的统一报价。
「H3 不只是一个新模型,更是一个能力完整、成本可控的高质量视频创作新选择。」1
「能力完整」可以从输入、声音、画幅和编辑入口逐项核对;「成本可控」则还缺活动有效期、额度、失败计费和项目账单。H3 的下一步证据,不是再增加一张效果图,而是让一支真实广告或一集短剧从输入到交付的每一次生成都能被复盘。

Related content

  • Sign in to comment.
More from this channel