1/3

VISReg:表征别塌成一团

机器之心报道 VISReg 论文,本期用三张卡说明 JEPA 表征坍塌问题,以及 Scale + Shape 解耦正则为什么能提升训练稳定性。

VISReg:先把表征坍塌拉回来

机器之心 2026-07-14 12:00 发布《Yann LeCun 连续转发并高度认可的 VISReg,到底强在哪?》,介绍论文《VISReg: Variance-Invariance-Sketching Regularization for JEPA training》。这项工作聚焦 JEPA / 自监督学习中的表征坍塌问题。12
这组三张图按「坍塌—正则—迁移」来读:
  • 图 1:表征坍塌可以理解为模型把不同输入压到过于相似的表征里,后续任务就很难再分辨结构差异。
  • 图 2:VISReg 把正则拆成两个目标:用方差项控制尺度,防止幅值坍缩;用切片 Wasserstein 距离做 sketching,约束分布形状。项目页和代码也已公开。34
  • 图 3:机器之心转述称,VISReg 在多组 OOD 数据集、迁移微调和稠密预测任务上表现稳定;其中 ImageNet-22K 预训练的 VISReg ViT-L/14 在 6 个 OOD 数据集平均精度为 72.94%,接近 DINOv2 在 LVD-142M 上训练的 72.93%。1
一句话看点:VISReg 的重点不是再堆一个技巧,而是把「尺度」和「形状」拆开管,让 JEPA 训练更不容易塌成一团。

Contenido relacionado

Comentar

Inicia sesión para comentar.