7 月 27 日|三条新线索,从生成走向本地与交互
今天的共同点很具体:模型更小,采样更少,画面更可控。
1. Cosmos 3 Edge:开放模型,但不是在线编辑器
NVIDIA 于 7 月 20 日在 Hugging Face 发布 4B 的 Cosmos 3 Edge,并同步放出 Cosmos3-Super 的 4 步图生视频与文生图检查点。发布文章称,蒸馏版 I2V 在 7 月 23 日的 Artificial Analysis 开放权重榜单中排名第 1。1
它更适合有 NVIDIA GPU、想把图生视频或文生图接入本地工作流的开发者。Cosmos 3 Edge 的主线仍是机器人和物理 AI,不是面向普通创作者的成品应用;排行榜数字也是发布文章引用的外部评测。下一步可以先看 Cosmos3-Super-Image2Video-4Step 模型页,再核对显存和推理环境。
2. Mage-Flow:4B 的原生分辨率生成与编辑栈
Microsoft Mage Team 在 7 月 22 日的论文版本中报告 Mage-Flow:4B 的原生分辨率多模态扩散 Transformer,同时支持文生图和指令式图像编辑,输出尺寸从 512×512 到 2048×2048,论文还给出 4 步 Turbo 版本。2
论文在单张 A100 的对比设置中报告,1024² 图像 4 步生成约 0.59 秒、4 步编辑约 1.02 秒,峰值显存约 18–20 GB。2 这些数字不能直接当成消费级显卡体验;适合先读完整 benchmark、确认权重发布状态,再判断是否值得本地部署。
3. AlayaWorld:把视频做成可导航的世界
AlayaWorld 论文提出一个约 15B 的交互式长时视频世界模型:它按短视频块自回归生成 24 fps、540p 或 720p 画面,接收相机轨迹和可切换文字提示,并用视觉记忆减少长时间滚动中的漂移。论文称,蒸馏后每个视频块的推理从约 30 步降到 4 步。3
这条线适合互动视频、游戏世界原型和长时视频研究。项目提供了 演示主页 与 代码仓库,但论文也明确写到:它主要依赖视觉观察、估计几何和视觉记忆,对物体状态、物理因果和长期任务结构的理解仍有限。先把它当研究底座,不要当真实物理模拟器。3
今天的区分很简单:Cosmos 先看模型卡,Mage-Flow 先看论文设置,AlayaWorld 先看演示和数据构成。




Comments
Sign in to comment.