
LeCun:世界模型应预测表征,JEPA 还欠一次长时机器人检验
LeCun 在 WM@Booth 把世界模型的训练目标从像素生成拉回表征预测;JEPA 已走到简单机器人规划,长时闭环和同预算对照仍待验证。
Yann LeCun 这次把世界模型之争落到了一个具体选择上:模型究竟该生成未来的像素,还是预测足以指导行动的抽象表征。
北京时间 9 月 1 日早上,芝加哥大学布斯商学院发布了 WM@Booth 世界模型工作坊长达 9 小时 37 分的完整视频。LeCun 的闭幕主题演讲把 2022 年路线说明中的架构选择,讲成了更直接的取舍:物理世界模型应该预测抽象表征,把像素生成留给别的目标。12
先说结论。
- LeCun 批评的对象,是以像素或原始信号重建为核心的物理世界模型。
- JEPA 改写了学习目标:预测目标在表征空间里的样子,尽量过滤与下游行动无关的不可预测细节。
- 这条路线已经从图像表征走到简单的机器人规划;长时任务、接触丰富的操作和同预算路线对照,仍缺公开实验。
Cargando tarjeta de contenido…
01|像素让模型做错题
常见的生成式世界模型接收当前观察
X 和动作 A,再生成下一个观察 Y。如果
Y 是一幅图,模型便要回答每一个像素会变成什么颜色。LeCun 认为,这个目标把两类信息混在了一起。
一类信息决定行动:汽车的位置、速度、朝向,机械臂与杯子的距离,柜门已经打开多少。
另一类信息会变化,却很少改变决策:树叶怎样抖动,纹理落在哪一个像素,远处行人衣服上的细节。
现实的未来还有多个答案。
一辆车来到路口,下一秒可能左转、直行,也可能减速。像素级平方损失把几个答案取平均,模型得到的往往是一幅模糊画面。
画面模糊只是表面症状。
更深的问题是,有限的模型容量正在替不可预测的细节买单。
“You have to eliminate a lot of details and make more abstract representation.”——Yann LeCun,WM@Booth 闭幕主题演讲。1
他的意思很直接:世界模型先要压掉大量细节,再保留能够预测、能够规划的结构。
面向行动的世界模型,首要任务是保住决策变量;重画世界表面排在后面。
这场争论有清楚的边界。
扩散模型生成图片和视频,追求的是一份具体、可观看的结果。LeCun 本场讨论的对象,则是能接受动作条件、比较未来后果并帮助智能体规划的物理世界模型。
两种产品目标可以同时存在。
真正的分歧出现在训练预算有限时:哪一种目标更容易学到行动需要的结构。
02|JEPA 改了学习对象
JEPA 是 Joint Embedding Predictive Architecture,中文通常译作联合嵌入预测架构。
这套架构把 predictor 的目标改成了缺失区域的抽象表征。
模型先用 context encoder 把已经看到的内容编码成表征,再让 predictor 预测被遮挡区域的目标表征。Target encoder 负责生成训练时的目标,损失函数比较两份表征之间的差距。34

这张图解释了 “joint embedding” 的含义。
上下文和目标分别经过编码器,最后进入一个可以比较的表征空间。Predictor 学的是两份表征之间的关系。
JEPA 希望编码器主动丢掉随机噪声,同时保留物体、运动、深度和动作后果等结构。
多种未来仍需要表示。
LeCun 在演讲和随后的 panel 里都提到 latent variable,也就是用潜变量保留当前观察无法确定的未来分支。车辆驶近路口时,规划器要同时看到转向和减速等候选结果,才能计算风险。
他还把时间尺度分成层级。
低层表征处理短时、高带宽变化;高层表征压掉更多细节,预测持续更久的抽象状态。动作也可以采用同样的层级编码。
JEPA 是实现方式,world model 是系统要完成的功能。
I-JEPA 更像一块图像表征试验台。Action-conditioned V-JEPA 才开始把动作、未来状态和规划接到一起。
03|从图像试验走到机械臂
LeCun 的路线已经走过四个公开阶段。
- 2022 年:提出模块图。 Meta 发布的路线说明把感知、world model、代价模块、actor 和短期记忆放进同一套自主机器智能架构;JEPA 负责在表征空间预测未来。5
- 2023 年:I-JEPA 处理静态图像。 模型从同一张图的上下文块预测目标块表征,验证了联合嵌入训练能学到可迁移的视觉表示。3
- 2024 年:V-JEPA 进入视频。 模型遮住大块时空区域,再预测抽象表征。Meta 当时把能力范围写得很克制:数秒视频理解已经可用,长期预测、规划和连续决策仍需后续研究。4
- 2025 年:V-JEPA 2 接上动作。 论文报告,研究团队先用超过 100 万小时的互联网视频预训练,再用少于 62 小时的 DROID 机器人视频做后训练;V-JEPA 2-AC 随后在两处实验室的 Franka 机械臂上完成以目标图像为条件的 zero-shot 抓放规划。6
这条进展链很重要。
它说明 JEPA 已经跨过“只会做视觉表征”的阶段,开始进入 action-conditioned planning。
它也规定了结论的大小。
V-JEPA 2 的机器人实验集中在抓取与放置,设备是两处实验室的 Franka 机械臂。论文展示了一条可运行的规划链;持续数分钟的长任务、复杂接触、工具使用、任务切换和失败恢复属于下一轮实验。6
图像分类、动作识别和线性 probe 的高分,可以证明表征有用。
世界模型能否支持可靠规划,还要看闭环行动。
04|Donoho 追问:内部状态够不够
同一天,David Donoho 从另一条路进入世界模型问题。
Donoho 的 keynote 先讲了 David Blackwell 对隐藏马尔可夫过程的研究:观察历史可以通过未来的条件分布与内部信念状态联系起来。Donoho 随后把问题交给自回归模型:系统把下一个 token 预测对之后,内部是否同时学到了环境状态。12
他用 GPT-2 的 residual stream 做线性 probe,再把模型放进合成的曼哈顿网格环境。
带有交替单行道的网格破除了部分对称性,probe 更容易恢复位置、道路身份和行进方向。四向连接的对称网格即使增加数据,模型也更容易学到“终点相对起点的方向和距离”这类低维关系。
这个实验回答的是自回归模型会怎样编码环境;JEPA 的输赢属于另一项对照实验。
Donoho 提供了另一把尺:next-token accuracy 只能告诉我们预测结果;内部状态是否保留了环境结构,需要单独测量。
三条现场路线可以这样并排看:
| 现场观点 | 核心问题 | 使用的证据 | 证据边界 |
|---|---|---|---|
| LeCun | 怎样设计可动作条件化、可用于规划的世界模型 | JEPA 路线、V-JEPA 2 与简单机器人规划16 | 缺少同数据、同算力下的统一目标函数对照,也缺少长时真实任务 |
| Donoho | 自回归预测是否隐式学到世界结构 | GPT-2 residual stream、线性 probe、合成曼哈顿网格1 | 结果受环境对称性和数据特征影响;probe 结果距离闭环规划仍有几步 |
| 圆桌中一位身份尚未确认的发言者 | 输入空间预测是否也能在内部学出好表征,训练规模是否比目标函数更关键 | 现场提出应让公开评测结果裁决路线1 | 需要跨模型骨干、同训练预算的实验,数字才能裁决 |
公开视频的自动字幕缺少可靠的圆桌说话者标签。
本文只把可以确认的回应归给 LeCun,其余观点保留为“圆桌中一位身份尚未确认的发言者”。
双方最后把争论落到一个可以执行的评测方案上。
LeCun 坚持表征空间预测在标准视觉表征实验里更强;那位身份尚未确认的发言者则提醒,多模态训练、更大算力和扩散式目标都可能改变结果。
固定数据、参数、算力和下游策略,再比较训练目标;这场分歧终于有了一种可以复现的裁决方法。
05|行业要换一张成绩单
对机器人公司,这场争论会改变评测顺序。
视频是否逼真可以排在后面。更早的问题应当是:模型能否在给定动作后预测接触、摩擦、遮挡和失败;规划器能否从多个未来中选出风险较低的一条;机器人偏离计划后能否恢复。
V-JEPA 2 已经给出短任务的起点。
下一轮证据要来自更长的真实闭环,漂亮演示排在后面。
对视频模型,生成与预测需要两张成绩单。
内容生成看画面质量、可控性和创作效率。行动世界模型看因果一致性、状态保真、多分支覆盖,以及模型能否提高规划成功率、缩短任务时间并降低事故风险。
一段视频可以很像现实,同时把动作与后果的关系画错。
一份抽象表征也可能画不出视频,却给规划器保留了正确的物体关系。
对研究投入,最值得警惕的是把架构口号直接换成预算结论。
本次公开材料记录了研究演示和现场争论。公司预算是否转向 JEPA,需要等待同规模训练结果、开源复现和机器人部署数据。
06|世界模型开始有自己的会议
LeCun 在开场宣布了两项未来活动。
LeCun 在演讲中把 International Conference on World Models 称作首届大会,会议官网已经上线。官网把时间写为 2027 年 5 月下旬,把地点写为旧金山湾区;具体日期、会场与组织名单仍待发布。17
另一项是 2027 年 2 月 28 日至 3 月 5 日的 World Modeling for Physics 工作坊。公告页列出的地点是 Aspen Center for Physics,组织者包括 Randall Balestriero、Shirley Ho、Julia Kempe 和 Yann LeCun。8
两项活动都处在未来公告阶段。
一场以 world models 为总题的国际会议,加上一场以物理世界建模为题的工作坊,说明研究共同体正在为这个方向建立专门的讨论空间。
路线赢没赢,仍要回到实验。
07|接下来盯住五类证据
- 同预算对照。 在相同数据、参数规模和训练算力下,比较逐像素重建、扩散式概率建模与 JEPA 表征预测在同一组下游任务上的增益,并画出性能随算力增加的曲线。
- 状态保真。 表征能否保留位置、速度、接触和任务进度,同时过滤纹理、光照等无关变化。
- 未来分支。 模型能否覆盖多种合理未来,并让置信度与真实风险相匹配。
- 环境迁移。 机器人换相机、背景、材质、机械臂型号和任务后,规划成功率会掉多少。
- 闭环长度。 系统能否从抓放走到持续数分钟的任务、工具使用、在线纠错和失败恢复,同时给出真实延迟与算力成本。
LeCun 把路线之争落在了一个可以做对照实验的问题上:世界模型该保存世界的表面,还是保存行动需要的结构。
下一项有分量的证据,应该来自一项覆盖长时规划、意外扰动和失败恢复的闭环任务。
Fuentes de referencia
- 1World Models at Chicago Booth Workshop
youtube.com
- 2WM@Booth 官方议程
wm-booth.org
- 3I-JEPA:基于 LeCun 路线的首个图像模型
ai.meta.com
- 4V-JEPA:在视频表征空间里预测
ai.meta.com
- 5LeCun 的自主机器智能路线说明
ai.meta.com
- 6V-JEPA 2 论文
arxiv.org
- 7
- 8World Modeling for Physics — Aspen Center for Physics, Feb 2027
wmw-aspen.github.io
Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.
