Grok Imagine Video 1.5 Agent:第 5 名之后,AI 视频进入编排与验收战

Grok Imagine Video 1.5 Agent:第 5 名之后,AI 视频进入编排与验收战

Grok Imagine Video 1.5 Agent 将竞争重点推向多镜头编排,但 Arena 早期分数仍需要用连续性、真实成本、失败回退和来源标识测试来兑现。

窗口与判断

本期覆盖 2026 年 9 月 5 日 09:00 至 9 月 7 日 09:00(北京时间)。窗口内最值得关注的更新,是 Grok Imagine Video 1.5 Agent 在 9 月 6 日凌晨进入可用状态,并在同日进入 Arena.ai 的文字生成视频竞技榜单。xAI 把升级重点放在更高质量、更强叙事和多镜头连接上;Arena 的早期分数则把它放在第 5 位。12
这组信号值得看的地方,在于产品竞争开始从“单段视频能不能生成”转向“多个镜头能不能被组织成一条可交付内容”。当前证据可以支持一次早期能力判断,尚且支撑不了生产系统的质量、成本和来源承诺。
Loading content card…

Agent 改变的,可能是编排层

xAI 官方发布帖把 Grok Imagine Video 1.5 Agent 描述为由最新 Image 2.0 模型驱动的智能体,重点能力包括更高质量、更好的故事讲述,以及把多个镜头连接起来并提高连续性。官方发布帖没有公开模型结构、分镜步骤、记忆机制或连续性评测集。1
xAI 面向开发者的模型页仍把可调用的视频模型列为 grok-imagine-video-1.5。该页面列出的输入是文本、图像和音频,输出是视频;模型页还提供 480p、720p 和 1080p 的分辨率价格。3
因此,当前公开信息更像是一次“基础视频模型加上智能编排入口”的产品升级。这是基于发布帖和开发者页面的推断,并非 xAI 对内部架构的正式拆解。这个区分决定了采购团队要问的第一句话:Agent 是在生成前规划镜头、在生成后筛选镜头,还是在多轮调用中维护人物与场景状态?三种做法都会改变使用体验,成本、失败位置和可审计记录却完全不同。

第 5 名,证明了什么

Arena.ai 9 月 5 日的 Text-to-Video Arena 页面显示,Grok Imagine Video 1.5 Agent 以 1491±19 的 Arena Score 排在第 5 位。页面当时记录 48 个模型、668,045 票,并用模型间 A/B 对战计算总体排名。4
Arena.ai 官方账号随后给出更易读的横向比较:Grok 的 1491 分与 Wan-3.0、FLUX 3 Video 的 1494 分相差 3 分;官方账号同时称它高于 Dreamina Seedance-2.5、Seedance 2.0 和 MiniMax-H3。这个结果来自文字生成视频的竞技排名,分数带有 ±19 的不确定区间,账号也把它描述为进入榜单的时点成绩。2
这个结果可以回答“新模型是否已经获得用户盲测的初步认可”,回答不了以下问题:同一人物跨三到五个镜头能否持续保持;Agent 为了得到一条合格片段平均重试多少次;音画、动作和来源标识在剪辑后能否保持;API 在高并发时的排队时间是多少。
另一张动态视频榜单在 9 月 7 日更新时记录 1,394 次盲测投票,当前列表显示 25 个条目,却同时出现“12 models reviewed”的页面口径;列表里也还没有 Grok Imagine Video 1.5 Agent。5
两张榜单的差异提醒采购团队:榜单首先是测量工具,其次才是宣传素材。Arena 的新模型成绩可以作为继续测试的理由,连续性、失败率和交付时间仍要用自己的任务集复测。

按秒价格离真实成本还有多远

xAI 官方模型页给出的输出价格是:480p 0.08 美元/秒、720p 0.14 美元/秒、1080p 0.25 美元/秒;图片输入按 0.01 美元/张计费,音频输入页面列为免费。模型页还显示 Batch API 可用,页面没有给出批量折扣。36
按 6 秒成片计算,单次视频输出费用分别是:
输出规格公开单价6 秒输出费用这个数字覆盖的范围
480p0.08 美元/秒0.48 美元视频输出
720p0.14 美元/秒0.84 美元视频输出
1080p0.25 美元/秒1.50 美元视频输出
表内费用是按公开单价计算的输出账单。开发者页面没有把 Agent 编排、失败重试、人工挑选、剪辑、存储、带宽、审核和转码列入这组价格。36
这会改变商业化判断的单位。团队真正需要记录的是“每秒合格成片成本”,而不是“每秒生成价格”。如果一条 6 秒片要生成 4 次、人工选出 1 次,再经过配音、剪辑和平台审核,0.84 美元只是原始输出的一部分。Agent 让镜头规划更方便,也可能让调用次数更难被使用者察觉,产品方需要在账单或生产轨迹中显示每次调用、重试和最终采用的关系。

合规问题从生成端延伸到交付端

欧盟委员会关于《人工智能法案》第 50 条透明度义务的页面说明,这些义务自 2026 年 8 月 2 日起适用。生成式 AI 系统提供者需要加入机器可读标记,让生成或操纵内容能够被识别;部署者在深度伪造等场景下需要向接触内容的个人作出告知。7
这条规则与 Grok Agent 的关系很具体:多镜头编排增加了调用链长度,也增加了视频被剪辑、转码、下载和再次上传的次数。一次合规验收需要同时看三件事:生成接口是否留下来源信息,Agent 是否把来源信息带到最终成片,发布平台是否把观众可见的披露保留下来。
xAI 这次官方发布帖和开发者模型页把篇幅放在质量、故事、多镜头和价格上,公开内容没有说明机器可读标记、导出元数据、深度伪造披露或跨平台保留策略。13 这组公开材料足以说明产品卖点,尚且不足以证明一条视频从 API 到发布页面的来源链已经闭合。

给部署团队的最小验收表

验收对象测试方法通过证据当前公开边界
多镜头连续性固定人物、服装、道具和场景,连续生成广角、中景、特写三组镜头,再加入一次局部修改。同一资产在镜头切换和修改后保持可辨识;团队能定位发生漂移的镜头。官方发布帖只有“更好的连续性”表述,Arena 公开的是文字生成视频总体分数。14
Agent 轨迹保存提示词、参考资产、每次调用、重试、人工修改、采用片段和最终导出文件。一条成片可以反查到每个镜头的调用和审批记录。公开模型页说明 API 和 Batch API,未给出 Agent 轨迹字段。3
合格成片成本以最终通过业务审核的秒数为分母,计入重试、人工、存储、带宽、审核、剪辑和转码。账单能区分原始输出费用与每秒合格成片总成本。官方页面给出输出单价,未展开 Agent 编排和失败成本。6
来源与标识分别测试导出、剪辑、压缩、转码、下载和再上传后的机器可读标记与可见披露。第三方能从成片反查生成服务;观众在首次接触时能看到所需提示。欧盟委员会页面说明 provider 与 deployer 的职责,xAI 公开模型页未说明本模型的具体实现。7
失败回退主动测试人物漂移、动作失败、内容审核拒绝、超时和重复生成。失败原因、原始素材、人工接管和回滚版本都能导出。官方发布帖和榜单提供能力信号,尚未提供失败分布或服务等级。12

结语

Grok Imagine Video 1.5 Agent 的窗口信号有两层。第一层是可观察的产品变化:xAI 把多镜头连接和故事组织放到发布重点,Arena.ai 在文字生成视频竞技榜单中给出 1491±19 的早期成绩。第二层是尚待验证的生产问题:Agent 是否减少了返工,还是把重试与筛选隐藏在更顺滑的入口之后。
因此,这次发布适合触发一轮小规模压力测试。测试对象应从一条样片扩展到三镜头任务、完整调用账单、失败回退和导出后的来源标识。等这些记录能够被第三方复核,榜单上的“第 5 名”才有机会转化成内容团队可以承诺的交付能力。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel