
这个新开源的世界模型只有1.3B,单卡就能实时跑!
蚂蚁灵波开源 1.3B 轻量版世界模型 LingBot-World 2.0,通过因果预训练、MoBA 注意力掩码与两阶段模型蒸馏,首次让实时可交互世界模型在消费级单卡 GPU 上顺畅运行。
量子位于 2026 年 9 月 10 日 发布了这篇报道,介绍蚂蚁灵波在世界模型开源领域的新进展:继今年 7 月推出 14B 主模型后,团队正式发布了参数规模仅 1.3B 的轻量版 LingBot-World 2.0,专为消费级单卡 GPU 设计,能在本地设备上实现实时的可交互世界生成。作者署名:金磊 发自 凹非寺 量子位 | 公众号 QbitAI。1
转载说明:保留原文标题、作者署名、报道口吻和主要技术段落,清除微信阅读器导航、关注引导、二维码、作者头像及与内容无关的页面残留。正文配图完整采用微信原文中能辅助理解机制与实验的真实图表,并配简短图注。
原文链接:这个新开源的世界模型只有 1.3B,单卡就能实时跑! | 量子位官网同题入口:qbitai.com/2026/09/486716.html
单卡跑世界模型:从 14B 到 1.3B 的轻量化演进
长久以来,实时世界模型一直被视为高端服务器与庞大算力集群的专属领地。用户想体验这类模型,往往只能观看官方录制的演示视频,或在在线云端页面稍作尝试。1
今年 7 月,蚂蚁灵波开源了 14B 参数的 LingBot-World 2.0 主模型。该模型实现了小时级的不间断生成与丰富的事件交互,并在专用推理配置下达成了 720p/60fps 的高清实时体验。然而,这套流畅体验的背后是一套相当繁重的底层工程栈——涵盖编译器级别的注意力算子优化、动态 KV 缓存调度、异步流媒体传输以及混合并行推理策略。1
彼时,关于“1.3B”的轻量化设想就已经出现在论文摘要中,为消费级本地部署埋下了伏笔。

在刚刚结束的 IFA 柏林消费电子展开幕演讲中,这一伏笔得到了公开印证。AMD 高级副总裁 Jack Huynh 在主旨演讲中特别点名了智谱、千问与蚂蚁灵波三个开源模型,并现场演示了 LingBot-World 2.0 的交互能力。在单一文本提示词驱动下,角色可以在欧洲乡村、中国小镇等环境中展开长时漫游,场景随着键盘操作持续延伸。1

Jack Huynh 在现场对此给出的评价十分直接:“This is the future of Personal AI(这就是个人 AI 的未来)。”如今随着 1.3B 参数版本的正式开放,这一承诺在消费级显卡上正式落地。1
技术机制:因果预训练与 MoBA 注意力掩码
世界模型与常规视频生成模型存在本质区别。常规视频生成属于单向批处理:用户输入一段提示词,等待数十秒或数分钟,模型输出固定长度的离线视频。而世界模型的核心在于实时响应与动态演化——用户在场景中向前踏出一步,模型必须即时外推下一步画面;玩家转向视角,视野中的光影与几何关系也需随之自然调整。换句话说,世界模型是在生成一个持续演进的真实空间。1
为了在大幅缩小模型体积的同时保留这一特性,研发团队没有采用“先做大再粗暴裁剪”的传统路径,而是重新打通了一条由因果预训练走向小尺寸模型的完整技术路线。
首先,团队构建并训练了名为 Causal World 的因果基座模型。在因果机制约束下,模型生成当前状态时只能参考过去已经发生的视觉信息以及用户迄今为止的控制指令,未来尚未发生的信息被严格屏蔽。1
然而,纯自回归模型通常会将刚刚生成的画面重新作为下一轮的输入。在长时间不间断生成中,前序步骤产生的微小误差会逐步沿时间轴传递并持续放大,最终引发画质变糊、几何畸变以及场景严重漂移。此外,若完全采用纯 Teacher Forcing 机制,随着上下文窗口逐渐拉长,模型对历史无噪上下文的依赖度过高,极易陷入过拟合并导致泛化画质急剧衰退。
针对这一瓶颈,LingBot-World 2.0 提出了 MoBA(Mixture of Bidirectional and Autoregressive Attention Mask)混合注意力掩码机制。

MoBA 在传统的单向自回归掩码中巧妙嵌入了一部分双向注意力通道。这相当于在长序列训练中引入了一层结构化正则项,既让模型能够适应动态多变的交互序列长度,又阻断了纯自回归累积误差带来的画质退化。
在实际对比评测中,因果预训练 Backbone 与业界标杆 MAGI、HY-World 1.5 进行了 5 秒至 60 秒的长时生成横向测试。

实测数据显示,从 5 秒持续推演至 60 秒的过程中,竞品模型往往在 25 秒节点前后开始发生严重的色彩偏移和结构坍塌,而 LingBot-World 2.0 在雄鹰俯冲、灭火作业与快艇航行等复杂动态场景中,始终维持了稳定的物体边界与物理连贯性。1
两步蒸馏流水线:将高阶能力压缩进消费级单卡
因果预训练虽然确立了扎实的世界模型底座,但高质量的 Teacher 模型单帧去噪过程需要数十次反向迭代,计算延迟过高,无法直接满足玩家或机器人高帧率低延迟的交互要求。
为了将运算开销压缩至单张消费级 GPU 的承载极限,团队设计了环环相扣的两阶段模型蒸馏管线:
第一阶段:一致性蒸馏(Consistency Distillation)
该步骤将 Teacher 模型原本繁复的多步去噪轨迹直接压缩至极少数步骤,使 Student 模型能以极低的算力消耗快速完成单帧生成,同时完整继承预训练阶段沉淀的动作条件与场景动态推理能力。1
第二阶段:分布匹配蒸馏(DMD, Distribution Matching Distillation)
当小模型在本地实际部署后,其接收到的大量输入并非来自完美的基准数据集,而是它自己在上一轮实时生成中产生的状态。如果未做针对性训练,前一帧的微小偏差仍可能被持续放大。团队引入了分布匹配蒸馏,专门让 Student 模型在自身长时 self-rollout(自展开)生成的轨迹上持续对抗训练。通过让模型在训练期提前适应自身生成的有偏分布,彻底解决了长时自回归中的累计漂移顽疾。1
至此,整套工程闭环完全建立:通过因果预训练打造长时稳定的世界基座,再借由双重蒸馏大幅压缩去噪开销并消除自演进偏差,最终让 1.3B 参数的小模型能够在单张消费级显卡上实现高流畅度的实时互动。
开源演进:世界模型下半场的门槛下移
纵观蚂蚁灵波在世界模型领域的开源脉络,其演进主线始终紧扣“降低使用门槛”这一核心命题:1
- 2026 年 1 月:LingBot-World 1.0 首次开源,重点验证了自回归视频预测用于环境模拟的可行性;
- 2026 年 7 月:LingBot-World 2.0 升级至 14B 参数,主攻小时级持续生成、复杂事件交互与 720p/60fps 的超高清实时体验;
- 2026 年 9 月:1.3B 轻量版上线,将世界模型的硬件运行边界直接推进至单张消费级独立显卡。
这三次发布依次回答了世界模型工程化的三个根本问题:能不能做出来、能不能做得久且真,以及能不能让更多人跑起来。
值得注意的是,蚂蚁灵波此次不仅开源了 1.3B 推理模型,更同步开放了 Causal Pretrain 权重与双向 Teacher 模型。小模型负责让普通开发者快速将世界模型在本地跑起来;而上游的大模型和训练管线,则赋予了社区深入开展后训练、领域自适应、二次压缩和具身任务适配的完整空间。1
原文引语
量子位在报道结语中,对世界模型的行业扩散趋势作出了以下总结:1
如果说世界模型的上半场,比的是能不能生成得更久、更真;那么下半场要比的,可能是能不能让普通人手上那张卡也跑得动。
这个规律在 AI 发展的过程中其实已经重复过好几回了。真正让一项技术扩散开的,往往不是最强的那个版本,而是第一个足够小、足够便宜、能被拿来试一试的版本。
如果说世界模型一直在尝试把 AI 装进一个可以无限延展的世界里。那么现在,当门槛被打下去之后,这个世界终于开始装得进普通人的显卡了。
官方学术论文与开源资源:
References
- 1量子位原文《这个新开源的世界模型只有1.3B,单卡就能实时跑!》
mp.weixin.qq.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
