LeCun连续转发,新作VISReg攻克JEPA世界模型「表征坍塌」核心难题

marsbit发布于2026-07-28更新于2026-07-28

文章摘要

近日,图灵奖得主Yann LeCun连续转发并高度认可了一项名为VISReg的自监督学习新工作。该工作旨在攻克JEPA世界模型中长期存在的“表征坍塌”核心难题。表征坍塌是指模型倾向于将不同输入映射到相同或极少数向量上,导致学到的表征缺乏判别力。 传统方法多依赖复杂的启发式技巧来抑制坍塌,但训练脆弱且可解释性差。VISReg的解决思路是将正则化目标解耦为独立的“尺度”和“形状”两部分。尺度部分通过方差项防止表征幅值塌缩,并在塌缩时能保持稳定的梯度;形状部分则通过带停止梯度的归一化和切片Wasserstein距离,将表征的分布形状对齐到标准高斯分布,从而完整地约束高阶统计特性。 这种方法实现了尺度和形状的优化互不干扰,有效解决了前代方法SIGReg在塌缩时梯度消失、以及尺度与形状耦合的问题。VISReg实现简洁,计算复杂度低,且易于扩展到大规模训练。 实验表明,在未使用任何启发式技巧的情况下,VISReg在15个数据集(涵盖域内、分布外、医疗、天文等多领域)的综合评估中,表现优于或媲美DINO、MAE等7种主流方法。特别是在分布外泛化任务上,仅使用约十分之一的数据量,其性能便追平了使用十倍数据训练的DINOv2。此外,在迁移微调、低质量数据鲁棒性以及生成引导等任务上也显示出优势。 VISReg为自监督学习提供了一种更稳定、高效且泛化能力强的正则化方案,为构建更强大的JEPA世界模型奠定了基础。

JEPA世界模型的底层是Yann LeCun自2017年起持续倡导的自监督学习(Self-Supervised Learning, SSL)。

SSL 无需人工标注即可从海量数据中学习通用表征,但普遍面临一个核心难题——表征坍塌(representation collapse):模型倾向于把不同输入映射到相同或极少数几个向量上,看似完成了训练,实则未学到有判别力的表征。

为抑制坍塌,主流方法大多依赖一系列启发式技巧(EMA、教师-学生网络、停止梯度、冻结层等)。这些技巧使训练变得脆弱、难以调参,也削弱了方法的可解释性与可扩展性。

另一条路线是通过正则项直接约束表征分布。

LeCun团队提出的VICReg将学习目标拆为方差、不变性、协方差三项,用协方差约束各维度之间的相关性;但协方差仅刻画二阶统计量,无法区分「均值、方差相同,而分布形状迥异」的两种表征。

其后提出的SIGReg基于Cramér–Wold定理,用sketching技术将整个嵌入分布对齐到标准高斯,从而约束完整的分布形状。

然而SIGReg仍存在两个关键缺陷:

  • 坍塌时梯度消失:当表征开始坍塌时,SIGReg的梯度随之衰减——坍塌越严重、修正信号越弱,模型难以自行恢复;
  • 尺度与形状耦合:未将「幅度大小(尺度)」与「分布形态(形状)」两个独立属性分离,二者在优化中相互干扰,导致在长尾、低质量、低秩数据上适配性较差。

也就是说,在模型最需要梯度信号来逃离坍塌状态时,SIGReg的梯度恰恰趋近于消失。

这正是VISReg要解决的核心问题。

近日,自监督学习新工作VISReg(Variance-Invariance-Sketching Regularization)获图灵奖得主Yann LeCun连续转发并给予高度认可——他在转发时评价道「VICReg begat SIGReg which begat VISReg」(VICReg孕育了SIGReg,SIGReg又孕育了VISReg),一句话点明了这条正则化路线的技术传承。

能获得LeCun如此认可,VISReg究竟强在哪里?

答案在于:它精准命中了LeCun长期押注的JEPA世界模型的核心难题——表征坍塌(representation collapse)。

论文链接:https://arxiv.org/abs/2606.02572

代码 / 预训练权重:https://github.com/HaiyuWu/visreg

项目主页:https://haiyuwu.github.io/visreg/

VISReg将防止坍塌的正则项解耦为「尺度」与「形状」两个独立目标,在不依赖任何启发式训练技巧、也不依赖海量数据的前提下,于15个数据集上综合表现超过7种主流自监督学习方法;其中仅用约1/10的训练数据,即在分布外(OOD)基准上追平DINOv2。

图 2:不同正则方法在表征坍缩各阶段的梯度幅值‖∇L‖模拟。VISReg在坍缩状态下仍能保持强梯度,而SIGReg的梯度几近消失。

核心方法

VISReg对VICReg与SIGReg取长补短:保留VICReg的方差项来控制尺度,同时用基于切片Wasserstein距离(Sliced Wasserstein Distance, SWD)的 sketching 目标替代协方差项来控制形状,并通过停止梯度将二者彻底解耦。整个正则目标由三部分组成。

1.尺度正则(Scale Regularization)

第一部分约束每一维的方差,防止幅值坍缩:

其关键性质在于:当模型坍缩时,该项的梯度趋近于一个常数,从而保证模型能够稳定地恢复——这恰好弥补了SIGReg梯度消失的缺陷。

2.形状正则(Shape Regularization)

第二部分先归一化以消除尺度影响,再单独约束形状。关键的一步是带「停止梯度」(stop-gradient, sg)的归一化:

这里对标准差 σσ 施加停止梯度,使得形状损失的优化不会反过来改变尺度——这正是「尺度」与「形状」两个目标真正解耦、互不干扰的机理所在。

归一化之后,再用切片Wasserstein距离将分布的几何形状对齐到各向同性高斯:

其中

为标准高斯分位数,

为随机投影方向(即「切片 / sketching」)。

其理论依据是Cramér–Wold定理(论文Lemma 3.1):两个分布相等,当且仅当它们沿单位球面上所有方向的一维投影都相等。因此,只要把高维表征沿足够多的随机一维方向切片后逐一对齐到高斯,就等价于在高维空间对齐了整个分布——这使得可以用廉价的一维排序操作刻画完整的分布形状,而非仅仅二阶统计量。

3.合并目标

第三部分是一个将 batch 均值μ拉向原点的中心化损失

三个正则项按权重组合:

预测损失沿用 JEPA / LeJEPA 的不变性目标——让各视角(global + local,共V个)的嵌入

都向全局视角的均值

对齐:

最后用单一超参λ在预测与正则之间平衡,得到完整目标:

与VICReg的对比:VICReg同样将正则解耦为方差 + 协方差,但协方差只刻画二阶统计量;VISReg用基于切片Wasserstein的sketching目标完整刻画了分布形状,同时保留方差项做尺度控制——既保留了VICReg的灵活性,又获得了分布层面的严格性。

仅需约15行PyTorch代码

该正则目标在实现上非常轻量,核心逻辑只需约15行:

计算复杂度与扩展性

在计算与扩展性上,VISReg同样具备优势。其正则部分的计算复杂度为

(N为batch、D为维度、K为切片数),对所有扩展因子都是线性的;相比之下,VICReg的协方差项为

,随维度平方增长

在同等batch规模下,VISReg 在单块 H100 GPU 上的运行速度与显存占用均优于 SIGReg。

更重要的是,K个随机切片可以分摊到多块GPU上:在 M块 GPU 上每块各生成 K/M个切片,效果等价于单卡生成全部K个。

实验中,当单卡切片数不足时,改用8卡、每卡128个切片(合计1024),即可把与「单卡 1024 切片」之间的精度差距从约2.4%缩小到0.22%。这意味着扩大训练规模时 KK 可保持常数,几乎不增加单卡负担。

图:在固定K与D时,增加GPU数量带来的线性探测精度变化。当K不足(K = 1⁄4D)时,用8倍的GPU数量即可把精度补齐到K = 2D的水平——这使得在大规模训练中保持常数K成为可能。

实验结果

回到标题的问题——VISReg 到底强在哪里?研究团队在15个数据集(8个域内 + 6个分布外 + ADE20K稠密预测)上,将VISReg与MoCoV3、DINO、iBOT、I-JEPA、MAE、data2vec等7种主流自监督方法进行了对比,场景涵盖天文、医疗、遥感、纹理、花卉等。答案体现在从识别到分割、生成的多个维度上。

1.域内(In-Domain)线性探测

为保证比较公平,实验按是否使用启发式技巧分为两组。在不使用任何启发式技巧的一组中,VISReg领先:ViT-B/16的域内线性探测精度达75.7%,高于MAE(75.1%);ViT-L/14 进一步提升至77.0%,高于LeJEPA(75.6%)。与使用启发式技巧的iBOT、DINO 相比,VISReg 在常规数据集上仅略低,但在纹理数据集DTD上反超全部方法——这表明其跨域泛化能力源于方法本身,而非人工技巧的堆叠。

2.分布外(OOD)泛化:全面最优

分布外泛化是比域内精度更严格的检验:依赖启发式的方法常在 ImageNet 域内被充分调优,却未必能迁移到差异较大的新分布。研究团队在覆盖医疗(ChestXRay、RetinaMNIST、OrganAMNIST)、天文(Galaxy10)、遥感(AID)、纹理(DTD)的 6 个 OOD 数据集上评测,这些数据集与 ImageNet 训练域完全无关。结果显示,VISReg 在所有方法、所有骨干规模上都取得了最佳的平均 OOD 精度,甚至超过部分使用启发式技巧、且骨干更大的方法。

图4:平均 OOD 线性探测精度。VISReg 全面优于 iBOT、DINO、MoCoV3、I-JEPA、MAE、data2vec 等方法。

如图4所示,ViT-B/16 的 VISReg 平均 OOD 精度为 70.19%,ViT-L/14 为 70.63%,明显高于 MAE(67.85%),并优于 MoCoV3(69.46%)、DINO(69.56%)、I-JEPA(68.55%)等方法。

3.数据效率:以 1/10 数据比肩 DINOv2

将 VISReg(ViT-L/14)在 ImageNet-22K(约 1400 万张图像)上预训练后,其 6 个 OOD 数据集的平均精度达72.94%,与在10 倍规模的 LVD-142M(1.42 亿张图像)上训练的DINOv2(72.93%)基本持平。也就是说,VISReg 以约1/10 的数据达到了同等水平。(作为对照,同为 ViT-L/14、但仅用 ImageNet-1K 预训练的 VISReg 平均精度为 70.63%。)这说明其学到的表征具有很强的通用性。

图5:在 ImageNet-22K 上预训练的 VISReg,在 OOD 基准上比肩用 10 倍数据(LVD-142M)训练的 DINOv2。

4.迁移微调:全面超过 DINO

尽管 VISReg 在部分域内数据集上的线性探测精度略低于 DINO,但经过微调后,它在 CIFAR-10、CIFAR-100、Flowers、ImageNet-1K、Galaxy10 全部五个数据集上均超过 DINO 与有监督预训练——这表明其表征分布更均匀、冗余更低、可迁移性更强。

图:迁移学习对比。微调后,VISReg 在所有测试数据集(CIFAR-10、CIFAR-100、Flowers、ImageNet-1K、Galaxy10)上都优于 DINO 与有监督预训练。

5.稠密预测与生成引导

VISReg 的优势不局限于分类。在ADE20K 线性语义分割上(ViT-B/16),其 mIoU 为30.16,高于 DINO(29.40)与 MAE(23.60),仅次于 MoCoV3(31.69);在不使用任何启发式技巧的前提下,这一结果具有竞争力。论文亦坦言,稠密预测与最佳方法仍有差距,是后续优化的重点。

图 7:ADE20K 上的线性语义分割。在不使用任何启发式技巧的情况下,VISReg 取得了具有竞争力的 mIoU,仅次于 MoCoV3。

生成引导上(SiT-B/2,iREPA 框架,10 万步训练),由 VISReg 特征引导的生成在四项指标中的三项优于 DINO:gFID40.36(DINO 41.15)、Precision51.38(DINO 50.51)、Recall61.26(DINO 60.70),IS 基本持平(33.48 vs 33.47)。这说明 VISReg 学到的表征作为生成引导信号同样更优。

图8:使用 SiT-B/2、分别由 VISReg 与 DINO 特征引导的图像生成。VISReg 在多数指标上都提供了更好的引导(更低的 gFID、更高的 Precision 与 Recall)。

6.低质量数据上的鲁棒性

长尾分布(ImageNet-LT)与低秩(Galaxy10)等低质量数据集上,VISReg 能稳定地防止坍塌并学到有意义的表征,而 DINO 在缺乏精细调参时直接失败。

表 1:ImageNet-LT上的线性探测精度

表 2:Galaxy10 上的域内线性探测精度

结论

VISReg 表明:将表征正则解耦为「尺度」与「形状」两个独立组件,可以得到一种比现有方法更稳定、更高效、泛化性更强的自监督学习方法。

在不使用任何训练启发式技巧的前提下,它在图像识别、分割与生成引导等多个维度上取得了领先或接近领先的结果,并以约 1/10 的数据达到了 DINOv2 的 OOD 水平。这为 JEPA 世界模型长期存在的表征坍塌问题提供了一种新的正则化解法。

参考资料:

https://arxiv.org/abs/2606.02572

本文来自微信公众号“新智元”,作者:LRST

热门币种推荐

相关问答

QVISReg方法主要解决了自监督学习中的什么核心难题?

AVISReg主要解决了自监督学习(SSL)中‘表征坍塌’的核心难题。表征坍塌是指模型倾向于将不同的输入映射到相同或极少数几个向量上,导致学习到的表征缺乏判别力。

Q与VICReg和SIGReg相比,VISReg的核心创新点是什么?

AVISReg的核心创新点在于:它继承了VICReg的方差项来控制表征的‘尺度’,同时引入了基于切片Wasserstein距离(SWD)的sketching目标来约束表征的‘形状’,并通过‘停止梯度’技术将这两个目标彻底解耦,使其在优化中互不干扰。这解决了SIGReg在表征坍塌时梯度消失、以及尺度与形状耦合的问题。

Q在实验结果中,VISReg在哪些关键性能指标上表现突出?请列举至少三个。

A1. 分布外(OOD)泛化:在6个与训练域无关的OOD数据集上,VISReg的平均精度全面优于包括DINO、MAE在内的多种主流方法。 2. 数据效率:使用约1/10的训练数据(ImageNet-22K),其在OOD基准上的表现追平了使用10倍数据(LVD-142M)训练的DINOv2。 3. 迁移微调:经过微调后,在CIFAR-10、CIFAR-100等多个数据集上的分类准确率均超过DINO和有监督预训练模型。 4. 低质量数据鲁棒性:在ImageNet-LT(长尾分布)和Galaxy10(低秩数据)等低质量数据集上能稳定学习,而DINO等方法在缺乏精细调参时可能失败。

QVISReg的计算复杂度与VICReg相比有何优势?

AVISReg的正则项计算复杂度为O(N*D*K),其中N为批大小,D为特征维度,K为随机切片数量,对所有扩展因子(如D和K)是线性的。而VICReg的协方差项复杂度为O(N*D²),随特征维度D呈平方增长。因此,VISReg在计算上更高效,尤其在高维场景下。此外,其随机切片操作易于在多GPU间并行,扩展性更好。

QLeCun对VISReg的评价是什么?这反映了该工作在技术路线上的何种地位?

ALeCun在转发VISReg工作时评价道:“VICReg begat SIGReg which begat VISReg”(VICReg孕育了SIGReg,SIGReg又孕育了VISReg)。这句话简洁地指明了VISReg在技术谱系中的传承关系:它是在VICReg和SIGReg基础上的重要发展,标志着其在解决JEPA世界模型‘表征坍塌’这一核心难题的正则化路线上,是一个关键的迭代和进步。

你可能也喜欢

俄罗斯议员呼吁“避免使用Telegram代币”,正值杜罗夫面临指控之际

俄罗斯国家杜马信息政策委员会副主席安德烈·斯温佐夫建议民众停止购买加密货币Gram,并呼吁在俄罗斯通信监管局和联邦安全局(FSB)就“通过Telegram渠道进行金融交易”发表官方评论前保持谨慎。他重申了俄当局对Telegram创始人帕维尔·杜罗夫提出的要求:在俄罗斯设立办事处、将用户数据存储于该国境内以及与“特殊服务部门合作”。 斯温佐夫的声明是在俄方指控杜罗夫协助恐怖主义活动后作出的。联邦安全局称,Telegram未能删除被乌克兰特工部门、恐怖及极端组织用于策划破坏、恐怖活动、大规模谋杀及网络诈骗的“众多频道、聊天群组和机器人”,并称这些行为导致了包括妇女儿童在内的大量人员伤亡及数十亿美元的物质损失。 俄罗斯调查委员会进一步说明,针对杜罗夫的刑事案件与拥有超过1300万用户的交友聊天机器人“Divechik/Leo”有关,FSB指控乌克兰特工利用该机器人伪装成女性招募俄罗斯年轻人。目前被法国当局拘押的杜罗夫于二月底表示,俄当局已以其协助恐怖主义为由对其提起刑事诉讼。 今年六月,杜罗夫宣布将其2019年创立的加密项目Gram恢复原名,并由Telegram全面接管。在对杜罗夫的指控公布后,Gram价格短暂下跌,7月29日从1.45美元跌至日内低点1.38美元,随后24小时内回升至约1.42美元。但其价格仍远低于5月8日超过2.70美元的峰值,年内跌幅达14%。

cryptonews.ru28分钟前

俄罗斯议员呼吁“避免使用Telegram代币”,正值杜罗夫面临指控之际

cryptonews.ru28分钟前

涉足比特币挖矿与人工智能基础设施的公司股价飙升,开空头投机者蒙受损失

比特币挖矿与人工智能基础设施公司股票周四普遍大幅上涨,做空投机者面临亏损。Keel Infrastructure(前身为Bitfarms)领涨29.13%,Nebius Group、Cipher Digital、IREN Limited等数十家公司股价涨幅均超过20%。这一涨势部分归因于一家由前OpenAI研究员创立的对冲基金被迫清算其公开股票持仓,Citadel接盘了大部分头寸,缓解了市场卖压。同时,比特币价格回升至64,000美元上方,以及微软财报显示AI投资开始产生回报,也提振了市场情绪。 更深层的原因在于行业转型。随着比特币挖矿奖励减半和网络难度增加,许多上市挖矿公司正将其能源密集型设施改造为AI数据中心,利用其现有土地、变电站和供电合同优势。近期,Hut 8、IREN、Terawulf等公司相继宣布了价值数十亿美元的长期AI云服务或租赁合同。Keel Infrastructure、Nebius等公司也积极转向AI数字基础设施,并获得了例如英伟达等公司的投资。此外,Sandisk、美光(内存)、Bloom Energy(燃料电池)、Cerebras(AI芯片)等供应链企业也受益于AI基础设施的建设需求。 尽管市场情绪乐观,但这些公司仍面临资本开支、电力供应及AI长期需求等不确定性。能否将当前的能源合同转化为稳定的未来收入,将是其股价能否持续上涨的关键。

cryptonews.ru31分钟前

涉足比特币挖矿与人工智能基础设施的公司股价飙升,开空头投机者蒙受损失

cryptonews.ru31分钟前

分析专家:“比特币的再次下跌可能导致市场重启”

加密货币分析机构DeFi Report在其最新宏观经济分析中分享了关于比特币及风险资产未来的重要预测。该评估综合考虑了美联储利率政策、科技股降温以及宏观经济脆弱性,认为比特币潜在的最后一轮下跌可能重塑市场结构,为新一轮强劲牛市周期的开启奠定基础。 分析指出,尽管美国经济表面看似强劲,但债券市场和经济数据显示美联储加息进程尚未结束。美国2年期国债收益率较联邦基金利率高出约55个基点,表明市场已计入持续的通胀压力。虽然市场讨论年内可能还有两次加息,但需注意非农就业增长放缓、职位流动率下降、个人储蓄率降至3%以及住房建设量下降25%等显著脆弱性因素。 近期受人工智能热潮推动大幅上涨的纳斯达克指数已从峰值回落约8-9%,凸显出风险偏好下降和美元走强趋势。尽管比特币相较于股市表现出更强韧性,维持在约65,000美元水平,但有警告称,与整体风险资产抛售相关的“新一轮避险情绪”也可能波及加密货币市场。 分析师认为,加密市场已历经约10个月的熊市,由暂时性因素驱动的调整大部分已完成。但在宏观经济压力下,可能发生被称为“硬着陆”的最终投降式下跌。在此情境下,分析师预计比特币可能回撤至55,000美元水平,这将为“深度权衡”的买入提供机会。 分析师强调,若比特币跌至55,000美元,将彻底清除市场泡沫,为未来的长期上涨趋势打下坚实基础。 *本文不构成投资建议。

cryptonews.ru41分钟前

分析专家:“比特币的再次下跌可能导致市场重启”

cryptonews.ru41分钟前

交易

现货

热门文章

如何购买CORE

欢迎来到HTX.com!我们已经让购买Core DAO(CORE)变得简单而便捷。跟随我们的逐步指南,放心开始您的加密货币之旅。第一步:创建您的HTX账户使用您的电子邮件、手机号码注册一个免费账户在HTX上。体验无忧的注册过程并解锁所有平台功能。立即注册第二步:前往买币页面,选择您的支付方式信用卡/借记卡购买:使用您的Visa或Mastercard即时购买Core DAO(CORE)。余额购买:使用您HTX账户余额中的资金进行无缝交易。第三方购买:探索诸如Google Pay或Apple Pay等流行支付方法以增加便利性。C2C购买:在HTX平台上直接与其他用户交易。HTX场外交易台(OTC)购买:为大量交易者提供个性化服务和竞争性汇率。第三步:存储您的Core DAO(CORE)购买完您的Core DAO(CORE)后,将其存储在您的HTX账户钱包中。您也可以通过区块链转账将其发送到其他地方或者用于交易其他加密货币。第四步:交易Core DAO(CORE)在HTX的现货市场轻松交易Core DAO(CORE)。访问您的账户,选择您的交易对,执行您的交易,并实时监控。HTX为初学者和经验丰富的交易者提供了友好的用户体验。

1.4k人学过发布于 2024.05.09更新于 2026.06.02

如何购买CORE

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对CORE(CORE)币价的意见。

活动图片