覆盖 2026 年 8 月 7 日至 12 日公开发布的三条线索:fal Agent 把图像、视频和 3D 模型编排进一个有项目记忆的创作入口;CustomDance 把音乐、动作检索和局部修补接成可反复修改的编舞流程;LogiShot 则把跨镜头的逻辑关系和视觉记忆一起放进视频生成。共同点不是「一次 prompt 生成成片」,而是让上下文留在过程里;能否今天使用,仍取决于入口、硬件和开放状态。
fal 于 2026 年 8 月 12 日宣布 fal Agent:它可在图像、视频和 3D 生成之间切换,保留角色、素材、参考图和创作历史,并为不同任务选择模型。官方称产品当天以 early access 提供,需购买可跨 fal 平台使用的 add-on credits;页面入口为 fal Agent。1
CustomDance 于 8 月 7 日提交 arXiv。系统先用多模态模型从音乐和高层文字里找时间锚点,再按局部音乐、文字和身体部位控制检索动作短语,最后用音乐条件扩散模型补齐空段,并允许按关节和异常区间返修。2 这是论文中的人机协同编舞系统;本次核验到论文 HTML,未看到代码、权重或可直接运行的产品入口。
LogiShot 于 8 月 9 日提交 arXiv:用 Multimodal Cue Guidance 从上下文视频、提示和起始帧提取密集线索,再用 Visual Memory 让生成过程持续访问上下文视频的潜变量。论文构建 110K 样本数据集,并在 800 条留出样本上评估;项目页展示三到四镜头串联生成和对比样例。34 论文写明模型与数据将公开,本次未核验到下载入口。
如果你今天要动手:有 fal 账号和预算的创作者先测试项目记忆是否真的减少返工;研究编舞的人关注 CustomDance 如何把「选动作」留给人;做多镜头视频的人则先把上下文视频、起始帧和逻辑关系写成输入。三者都还不能直接替代完整的生产管线。
References
- 1
- 2
- 3
- 4LogiShot 项目页guoshuaigo.github.io


Comments (1)
Sign in to comment.