1/4

AI创作工具与前沿动态|7月27日

从开放模型、4B图像生成栈到交互式长时视频,快速判断三条新线索能否马上试用。

7 月 27 日|三条新线索,从生成走向本地与交互

今天的共同点很具体:模型更小,采样更少,画面更可控。

1. Cosmos 3 Edge:开放模型,但不是在线编辑器

NVIDIA 于 7 月 20 日在 Hugging Face 发布 4B 的 Cosmos 3 Edge,并同步放出 Cosmos3-Super 的 4 步图生视频与文生图检查点。发布文章称,蒸馏版 I2V 在 7 月 23 日的 Artificial Analysis 开放权重榜单中排名第 1。1
它更适合有 NVIDIA GPU、想把图生视频或文生图接入本地工作流的开发者。Cosmos 3 Edge 的主线仍是机器人和物理 AI,不是面向普通创作者的成品应用;排行榜数字也是发布文章引用的外部评测。下一步可以先看 Cosmos3-Super-Image2Video-4Step 模型页,再核对显存和推理环境。

2. Mage-Flow:4B 的原生分辨率生成与编辑栈

Microsoft Mage Team 在 7 月 22 日的论文版本中报告 Mage-Flow:4B 的原生分辨率多模态扩散 Transformer,同时支持文生图和指令式图像编辑,输出尺寸从 512×512 到 2048×2048,论文还给出 4 步 Turbo 版本。2
论文在单张 A100 的对比设置中报告,1024² 图像 4 步生成约 0.59 秒、4 步编辑约 1.02 秒,峰值显存约 18–20 GB。2 这些数字不能直接当成消费级显卡体验;适合先读完整 benchmark、确认权重发布状态,再判断是否值得本地部署。

3. AlayaWorld:把视频做成可导航的世界

AlayaWorld 论文提出一个约 15B 的交互式长时视频世界模型:它按短视频块自回归生成 24 fps、540p 或 720p 画面,接收相机轨迹和可切换文字提示,并用视觉记忆减少长时间滚动中的漂移。论文称,蒸馏后每个视频块的推理从约 30 步降到 4 步。3
这条线适合互动视频、游戏世界原型和长时视频研究。项目提供了 演示主页代码仓库,但论文也明确写到:它主要依赖视觉观察、估计几何和视觉记忆,对物体状态、物理因果和长期任务结构的理解仍有限。先把它当研究底座,不要当真实物理模拟器。3
今天的区分很简单:Cosmos 先看模型卡,Mage-Flow 先看论文设置,AlayaWorld 先看演示和数据构成。

Related content

Comments

Sign in to comment.