AI创作工具与前沿动态|8月10日

8月5日至7日,角色动画、多镜头创作和音乐共创都开始把创作者想保留的上下文留在流程里。

覆盖 2026 年 8 月 5 日至 7 日公开的三条线索:Wan-Animate-2 把角色身份交给参考图和驱动视频,ContextMaster 把多镜头历史控制在固定读取预算,MIDI-RAE-JEPA-SON 则用轻量 MIDI 模型给出可继续编辑的局部建议。共同点不是「更大」,而是模型开始保留创作者明确想留下的东西。
Wan-Animate-2 在 8 月 7 日公开推理脚本、Base 权重和 Distillation 权重。它直接读取驱动视频,兼顾动作生成与身份保持,并支持用文字改变输出视角;Lite 版本把延迟压到实时级别。模型卡给出 Apache 2.0 许可和 ModelScope Demo,但本地默认设置是 8× A800 跑 720P,另测试过 2× A800 跑 480P,因此「公开权重」不等于消费级即插即用。1
ContextMaster 于 8 月 5 日提交论文,把文本生成、参考图生成和视频编辑放进同一条多轮轨迹:被接受的镜头继续进入历史,固定预算路由只读取相关上下文。论文和项目页覆盖 T2MV、R2MV、V2MV、X2MV 四类操作,项目页报告单 GPU 16 FPS;论文评测包含 100、50、50 条任务与 20 条组合轨迹。它仍是研究原型,本次看到的是方法说明和演示,没有看到可直接下载的代码或权重入口。23
MIDI-RAE-JEPA-SON 论文同样发表于 8 月 5 日:2.55M 参数的层级 Swin V2 编码器在无标签 MIDI 钢琴卷帘上学习节奏、和声与旋律结构,再用 flow matching 补全被遮住的局部。论文报告重建 pixel F1 0.996,CPU 建议速度约 2.8 秒,Apple MPS 约 0.6 秒;在线 Demo 在论文补充材料中提供。它适合使用 MIDI 的作曲者和编曲者,不适合被理解为音频生成器:输入是 binary piano roll,速度、音色和录音细节会丢失,默认窗口约 4 小节或 8 秒,输出仍是建议片段。4 在线 Demo
今天的用法很具体:有显卡的动画创作者可以先试 Wan-Animate-2 的 Demo;做多镜头视频的人先读 ContextMaster 的「生成 → 参考 → 编辑」轨迹;做 MIDI 的人则可以在 Demo 里只补一小段和弦或旋律。三者都值得试,但都不该被写成「输入一句话就能交付成片」。
AI创作工具与前沿动态日报

AI创作工具与前沿动态日报

每日精选AI创作工具更新与前沿AI研究,以图文卡片形式呈现,兼顾浏览效率与信息深度。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

Comments (1)

Sign in to comment.