两款中国视频模型同日升级:竞争从短片效果转向长叙事、精确编辑与分发边界

两款中国视频模型同日升级:竞争从短片效果转向长叙事、精确编辑与分发边界

MiniMax H3 与 Seedance 2.5 的同日发布显示,AI 视频竞争正在从样片质量转向长叙事、参考与编辑能力、分发入口和可追溯责任链。

过去两天,AI 视频行业出现了一次很适合拿来判断竞争方向的「同日对照」:MiniMax H3 与字节跳动 Seedance 2.5 都在 7 月 31 日发布更新,前者把文本、图像、视频和音频放进一个通用生成模型,后者把单次生成时长、参考素材数量和时间戳编辑往前推。Bloomberg 报道称,两家公司在数小时内先后发布新模型;这不是又一轮榜单变化,而是两种产品化路线同时亮相。1
本期窗口为 2026 年 7 月 31 日 09:00 至 8 月 1 日 09:00(北京时间)。窗口内最值得关注的变化,不是某个模型又生成了更漂亮的样片,而是视频模型开始把「成片流程」拆成可出售的能力:更长的叙事、更密集的参考输入、更精确的局部修改,以及不同的分发入口。问题也随之改变:这些能力能不能稳定交付,价格和版本是否可控,生成后的标识又由谁负责?

两条路线:统一模型,还是扩展工作流

MiniMax H3 的官方发布把它定义为通用的全模态生成模型。它可以联合理解文本、图像、视频和音频上下文,生成最高 2K、最长 15 秒、带原生立体声的音视频;官方还把视频生成、参考和编辑、音频生成放进同一套任务描述里。2
H3 的卖点不是某一个孤立的输入类型,而是「用自然语言描述多种素材之间的关系」。MiniMax 给出的例子是:参考一段视频里的镜头运动,让图片中的角色演唱,并让演唱匹配另一段音频。这个方向如果成立,用户操作的对象就不再是单一提示词,而是一组带关系的素材。
但 H3 的两个商业表述必须分开看。第一,MiniMax 称 H3 在 2K 下的每秒价格低于主流模型的三分之一,在 768p 下低于主流 720p 模型价格的一半;这是厂商自己的相对价格比较,页面没有给出可复核的绝对价格、比较对象和未成功后的重试成本。第二,MiniMax 称将在未来几天开放模型权重,并注明要遵守适用法律法规。这里是「开放权重计划」,不是本期已经完成的开放发布,更没有给出许可证、硬件需求和版本维护方式。2
Seedance 2.5 走的是另一条路线。字节跳动官方页面明确标注发布日期为 2026 年 7 月 31 日,并把升级点写成一组制作流程能力:单次生成最长 30 秒的音视频,支持多轮延展;一次可以输入最多 30 张图片、10 段视频和 10 段音频;对音视频提供时间戳级的定向编辑。产品先在 Jimeng AI 和 Doubao Pro 上线,开发者接口预计通过 BytePlus ModelArk 接入。3
这两条路线的差异很具体。H3 试图把任务边界合并,让一套模型理解复杂的多模态关系;Seedance 2.5 则把单次输出拉长,把更多参考材料和局部编辑塞进创作流程。前者更像模型平台的统一入口,后者更像已经接入内容产品的制作工具。两者都在减少「生成一段、下载、再换一个提示词重来」的往返,但没有一条官方材料证明它们已经解决长时一致性、异常恢复或单位成片成本。

真正的商业变化,在分发边界

Seedance 2.5 的上线方式比单纯发布一个模型更能说明商业意图。用户先在既有内容产品里使用它,开发者接口则放在后面。这种安排能让厂商先掌握创作入口、素材反馈和使用习惯,再决定如何把能力交给开发者。它也意味着,模型能力和分发渠道不能再分开估值:同样的 30 秒生成,如果只能在一个封闭产品里使用,和能被企业稳定调用,是两种商品。
H3 的路线则把价格和开放硬件放在同一张路线图上。MiniMax 公开的是相对价格口径和开放权重计划,不是完整的商业承诺;它没有在发布页上给出绝对价格、并发上限、延迟分布或权重发布后的推理配置。对开发者来说,「低价」和「可自部署」之间还隔着显存、吞吐、队列、版本锁定和内容安全策略。
这也是为什么 Bloomberg 的「中国两家公司同日发布」有价值,但不能被直接读成市场份额结论。报道确认了发布时间和产品方向,称 H3 强调更自然、更连贯的视频,Seedance 2.5 强调编辑功能;它没有提供独立的生成质量、付费用户、收入或留存数据。1
从商业化角度,当前能确认的是竞争维度变多了:模型厂商要同时争取能力、入口和成本控制权。还不能确认的是谁已经形成了商业闭环。H3 的开放权重尚未在这篇发布材料里落地,Seedance 的开发者接口也仍是「即将接入」;两家公司都没有在本期材料中披露未成功请求占比、人工后处理时间、企业客户留存或成片毛利。

厂商规格距离生产证据还有一段

Seedance 2.5 宣称可以把 30 秒单次生成通过多轮延展扩成数分钟,并保持主要角色、环境、叙事节奏和音画同步。它还把时间戳级编辑描述为可以针对特定片段修改人物、动作或情节,同时维持前后连续性。3
这些描述明确了产品要解决什么,却没有给出内容团队最需要的分母。没有公开的内容包括:延展到第几轮后角色或场景开始漂移;时间戳编辑对未修改区域的破坏率;同时输入 30 张图片和 10 段视频时的延迟;被拒绝的提示词比例;音频、字幕和背景音乐在长片段中的未成功率。
H3 也有相同的证据边界。官方页面列出了多模态上下文、原生立体声、2K 输出和「生产就绪」等表述,但没有独立评测来验证它们在不同类型素材、不同并发量和不同输出长度下的稳定性。2
所以本期不应把 30 秒、2K 或原生立体声当成商业结果。它们是产品接口和厂商承诺,真正决定采购的变量还包括:未成功后能否重试且不重复扣费,模型版本能否固定,输出是否能被编辑器继续处理,素材引用关系能否追溯,长时间运行是否有可预测的成本。

欧盟规则把责任拆成两层

两款模型发布的时间点,刚好靠近欧盟 AI Act Article 50 的适用日。欧盟委员会 7 月 29 日更新的指南写明,Article 50 自 2026 年 8 月 2 日起适用;提供者需要让 AI 生成或操纵的音频、图像、视频和文本带有机器可读标记,使其能够被检测。4
提供者和部署者承担的义务不是一回事。欧盟委员会 FAQ 解释,提供者负责机器可读标记和可检测性;部署者把深伪内容展示给自然人时,还要在首次接触时清晰、可感知地披露。仅依靠上游嵌入的机器可读信息,不能替代部署者面向观众的可见或可听标签。5
这对模型分发方式有直接影响。H3 计划开放权重,Seedance 2.5 已经通过内容产品提供能力,未来还要接入开发者接口。模型提供者、接口服务提供者、广告公司和最终发布平台之间,谁在输出上承担哪一层标记和披露责任,不能靠一个「支持水印」的产品标签回答。现有发布材料也没有证明两款模型在多轮编辑、重新导出和平台转码后仍能完整保留来源标记。
规则还留下了与视频生产相关的边界。欧盟指南和 FAQ 都提到,标准编辑以及只在封闭工业或产品开发环境内使用的输出,存在条件性例外;但如果输出成为最终发布内容,例外不能自动延伸到成片。4 5
这让「同一个模型是否合规」变成了一个不够准确的问题。更准确的问法是:在什么输入、什么编辑链、什么地区、由谁发布、面向谁展示时,系统能够留下什么证据。一个模型在封闭的工业仿真里生成训练数据,和它把同一段素材加工成广告或公共传播视频,可能落在不同的责任路径上。

采购和部署,先验收五件事

如果要把 H3 或 Seedance 2.5 接入内容制作,当前最有用的验收顺序不是先看演示片,而是要求供应商交付以下证据:
  1. 连续性测试:固定人物、场景、声音和镜头约束,分别测试 30 秒单次生成、多轮延展和时间戳编辑,记录每一轮的漂移与未修改区域损坏。
  2. 成本账本:把成功生成、未成功后的重试、内容拒答、人工复核、存储、导出和转码全部计入,不能只拿每秒标价当成单位成片成本。
  3. 版本和分发:确认模型版本、接口可用区、并发和队列规则;对 H3 还要等待开放权重实际发布后核对许可证、硬件需求和安全能力,而不是把路线图当现货。
  4. 素材和来源链:记录原始素材、参考输入、每轮指令、模型版本、拒答结果和最终导出,并验证多轮编辑后机器可读标记是否仍可检测。
  5. 发布责任:分别写清提供者、企业部署者和最终发布平台的标记与披露动作;涉及深伪、广告、人物或公共议题时,把观众能看到的标签作为验收结果,而不是把元数据当作全部合规。
7 月 31 日的两次发布说明,AI 视频竞争已经从「能不能生成」进入「能不能把一条生产路径交给别人使用」。H3 把统一的多模态理解、价格性能和开放权重放在路线图上,Seedance 2.5 把长叙事、参考素材和时间戳编辑直接放进内容产品。它们都在靠近生产系统,但公开材料还不足以证明成本、稳定性和来源链已经闭合。
眼下最稳妥的判断不是哪一家已经赢了,而是视频模型的商品边界正在分叉:一端争夺模型和硬件的开放程度,另一端争夺内容入口和工作流控制;欧盟 Article 50 则要求两端都把生成后的标记和发布责任写进系统。下一轮真正有区分度的数据,不会只是更长的样片,而是未成功率、版本稳定性、真实单位成本,以及经过多轮编辑和平台转码后还能不能回答「这段视频由谁、基于什么、改了什么」。

Related content

  • Sign in to comment.
More from this channel