LeCun连续转发,新作VISReg攻克JEPA世界模型「表征坍塌」核心难题
近日,图灵奖得主Yann LeCun连续转发并高度认可了一项名为VISReg的自监督学习新工作。该工作旨在攻克JEPA世界模型中长期存在的“表征坍塌”核心难题。表征坍塌是指模型倾向于将不同输入映射到相同或极少数向量上,导致学到的表征缺乏判别力。
传统方法多依赖复杂的启发式技巧来抑制坍塌,但训练脆弱且可解释性差。VISReg的解决思路是将正则化目标解耦为独立的“尺度”和“形状”两部分。尺度部分通过方差项防止表征幅值塌缩,并在塌缩时能保持稳定的梯度;形状部分则通过带停止梯度的归一化和切片Wasserstein距离,将表征的分布形状对齐到标准高斯分布,从而完整地约束高阶统计特性。
这种方法实现了尺度和形状的优化互不干扰,有效解决了前代方法SIGReg在塌缩时梯度消失、以及尺度与形状耦合的问题。VISReg实现简洁,计算复杂度低,且易于扩展到大规模训练。
实验表明,在未使用任何启发式技巧的情况下,VISReg在15个数据集(涵盖域内、分布外、医疗、天文等多领域)的综合评估中,表现优于或媲美DINO、MAE等7种主流方法。特别是在分布外泛化任务上,仅使用约十分之一的数据量,其性能便追平了使用十倍数据训练的DINOv2。此外,在迁移微调、低质量数据鲁棒性以及生成引导等任务上也显示出优势。
VISReg为自监督学习提供了一种更稳定、高效且泛化能力强的正则化方案,为构建更强大的JEPA世界模型奠定了基础。
marsbit2小时前