LeCun transmite continuamente, la nueva obra VISReg resuelve el problema central del «colapso de representación» en los modelos mundiales JEPA

marsbit發佈於 2026-07-28更新於 2026-07-28

文章摘要

LeCun, premiado con el Turing, presenta VISReg, un avance en aprendizaje autosupervisado (SSL) que soluciona el colapso de representaciones, problema clave en los modelos de mundo JEPA. VISReg desacopla la regularización en componentes de "escala" y "forma", evitando la desaparición del gradiente durante el colapso. Sin técnicas heurísticas, supera a 7 métodos SSL en 15 conjuntos de datos. Con solo 1/10 de los datos, iguala a DINOv2 en generalización fuera de distribución (OOD) y supera a métodos como DINO en tareas de transferencia y segmentación. Ofrece una solución robusta, escalable y eficiente para el aprendizaje de representaciones.

La base de los modelos mundiales JEPA es el aprendizaje autosupervisado (Self-Supervised Learning, SSL) promovido continuamente por Yann LeCun desde 2017.

El SSL puede aprender representaciones generales a partir de grandes cantidades de datos sin necesidad de anotaciones manuales, pero se enfrenta universalmente a un problema central: el colapso de representación (representation collapse). El modelo tiende a mapear diferentes entradas a los mismos o muy pocos vectores, lo que parece completar el entrenamiento, pero en realidad no aprende representaciones discriminativas.

Para suprimir el colapso, los métodos principales dependen en gran medida de una serie de técnicas heurísticas (EMA, redes profesor-alumno, detención de gradiente, congelación de capas, etc.). Estas técnicas hacen que el entrenamiento sea frágil y difícil de ajustar, y también debilitan la interpretabilidad y escalabilidad del método.

Otra línea de investigación es restringir directamente la distribución de representación mediante términos de regularización.

El VICReg propuesto por el equipo de LeCun descompone el objetivo de aprendizaje en tres términos: varianza, invarianza y covarianza, utilizando la covarianza para restringir la correlación entre dimensiones; pero la covarianza solo captura estadísticas de segundo orden y no puede distinguir dos representaciones con «media y varianza idénticas, pero formas de distribución completamente diferentes».

El SIGReg propuesto posteriormente se basa en el teorema de Cramér–Wold, utilizando técnicas de sketching para alinear toda la distribución de embeddings con una Gaussiana estándar, restringiendo así la forma completa de la distribución.

Sin embargo, SIGReg todavía presenta dos defectos clave:

  • Desaparición del gradiente durante el colapso: cuando la representación comienza a colapsar, el gradiente de SIGReg se atenúa. Cuanto más grave sea el colapso, más débil será la señal de corrección, lo que dificulta que el modelo se recupere por sí mismo;
  • Acoplamiento de escala y forma: no separa los dos atributos independientes «magnitud (escala)» y «morfología de la distribución (forma)», lo que hace que interfieran entre sí durante la optimización, resultando en una peor adaptabilidad en datos de cola larga, de baja calidad o de bajo rango.

Es decir, cuando el modelo más necesita la señal de gradiente para escapar del estado de colapso, el gradiente de SIGReg tiende precisamente a desaparecer.

Este es precisamente el problema central que VISReg se propone resolver.

Recientemente, el nuevo trabajo de aprendizaje autosupervisado VISReg (Variance-Invariance-Sketching Regularization) ha sido compartido continuamente por el ganador del Premio Turing Yann LeCun, quien le otorgó un alto reconocimiento. En su publicación, comentó: «VICReg engendró SIGReg, que a su vez engendró VISReg», una frase que resume la herencia técnica de esta línea de regularización.

¿En qué radica la fortaleza de VISReg para obtener tal reconocimiento de LeCun?

La respuesta está en que apunta con precisión al problema central del modelo mundial JEPA, en el que LeCun ha apostado a largo plazo: el colapso de representación (representation collapse).

Enlace al artículo: https://arxiv.org/abs/2606.02572

Código / pesos preentrenados: https://github.com/HaiyuWu/visreg

Página del proyecto: https://haiyuwu.github.io/visreg/

VISReg desacopla el término de regularización para prevenir el colapso en dos objetivos independientes: «escala» y «forma». Sin depender de ninguna técnica heurística de entrenamiento ni de grandes cantidades de datos, supera a 7 métodos principales de aprendizaje autosupervisado en 15 conjuntos de datos; utilizando solo aproximadamente 1/10 de los datos de entrenamiento, iguala a DINOv2 en los benchmarks fuera de distribución (OOD).

Figura 2: Simulación de la magnitud del gradiente ‖∇L‖ en diferentes etapas de colapso de representación para varios métodos de regularización. VISReg mantiene un gradiente fuerte incluso en estado de colapso, mientras que el gradiente de SIGReg casi desaparece.

Método central

VISReg combina las fortalezas de VICReg y SIGReg: conserva el término de varianza de VICReg para controlar la escala, mientras reemplaza el término de covarianza por un objetivo basado en la distancia de Wasserstein por cortes (Sliced Wasserstein Distance, SWD) mediante sketching para controlar la forma, y desacopla completamente ambos mediante la detención del gradiente. El objetivo completo de regularización consta de tres partes.

1. Regularización de escala (Scale Regularization)

La primera parte restringe la varianza de cada dimensión para prevenir el colapso de amplitud:

Su propiedad clave es: cuando el modelo colapsa, el gradiente de este término tiende a una constante, garantizando así que el modelo pueda recuperarse de manera estable. Esto compensa precisamente el defecto de la desaparición del gradiente en SIGReg.

2. Regularización de forma (Shape Regularization)

La segunda parte primero normaliza para eliminar la influencia de la escala y luego restringe la forma por separado. Un paso clave es la normalización con «detención del gradiente» (stop-gradient, sg):

Aquí se aplica la detención del gradiente a la desviación estándar σ, de modo que la optimización de la pérdida de forma no altere retroactivamente la escala. Este es precisamente el mecanismo que permite un desacoplamiento real y sin interferencias entre los objetivos de «escala» y «forma».

Después de la normalización, se utiliza la distancia de Wasserstein por cortes para alinear la forma geométrica de la distribución con una Gaussiana isótropa:

Donde

es el cuantil de la Gaussiana estándar,

es la dirección de proyección aleatoria (es decir, «corte / sketching»).

Su base teórica es el teorema de Cramér–Wold (Lema 3.1 del artículo): dos distribuciones son iguales si y solo si todas sus proyecciones unidimensionales en todas las direcciones de la esfera unitaria son iguales. Por lo tanto, al cortar la representación de alta dimensión a lo largo de un número suficiente de direcciones unidimensionales aleatorias y alinearlas una por una con la Gaussiana, es equivalente a alinear toda la distribución en el espacio de alta dimensión. Esto permite caracterizar la forma completa de la distribución mediante operaciones baratas de ordenación unidimensional, en lugar de solo estadísticas de segundo orden.

3. Objetivo combinado

La tercera parte es una pérdida de centralización que acerca la media del batch μ al origen:

Los tres términos de regularización se combinan con pesos:

La pérdida de predicción sigue el objetivo de invariancia de JEPA / LeJEPA: alinear las incorporaciones de cada vista (global + local, V vistas en total)

hacia la media de la vista global

:

Finalmente, se utiliza un único hiperparámetro λ para equilibrar predicción y regularización, obteniendo el objetivo completo:

Comparación con VICReg: VICReg también desacopla la regularización en varianza + covarianza, pero la covarianza solo captura estadísticas de segundo orden; VISReg utiliza un objetivo de sketching basado en Wasserstein por cortes para caracterizar completamente la forma de la distribución, conservando al mismo tiempo el término de varianza para el control de escala, combinando así la flexibilidad de VICReg con el rigor a nivel de distribución.

Solo se requieren aproximadamente 15 líneas de código en PyTorch

La implementación de este objetivo de regularización es muy ligera; la lógica central solo requiere unas 15 líneas:

Complejidad computacional y escalabilidad

En cuanto a cálculo y escalabilidad, VISReg también tiene ventajas. La complejidad computacional de la parte de regularización es

(N es el tamaño del batch, D la dimensionalidad, K el número de cortes), lo que es lineal para todos los factores de escala; en comparación, el término de covarianza de VICReg es

, que crece con el cuadrado de la dimensionalidad.

Con el mismo tamaño de batch, la velocidad de ejecución y el uso de memoria de VISReg en una única GPU H100 son superiores a los de SIGReg.

Lo más importante es que los K cortes aleatorios se pueden repartir entre múltiples GPUs: en M GPUs, cada una genera K/M cortes, un efecto equivalente a generar todos los K cortes en una sola GPU.

En los experimentos, cuando el número de cortes por GPU era insuficiente, al usar 8 GPUs, cada una con 128 cortes (1024 en total), se redujo la brecha de precisión con respecto a «una sola GPU con 1024 cortes» de aproximadamente 2.4% a 0.22%. Esto significa que al ampliar la escala del entrenamiento, KK puede mantenerse constante, casi sin aumentar la carga por GPU.

Figura: Cambios en la precisión de la sonda lineal al aumentar el número de GPUs con K y D fijos. Cuando K es insuficiente (K = 1⁄4D), usar 8 veces más GPUs puede llevar la precisión al nivel de K = 2D, lo que hace posible mantener K constante en entrenamientos a gran escala.

Resultados experimentales

Volviendo a la pregunta del título: ¿dónde radica realmente la fortaleza de VISReg? El equipo de investigación comparó VISReg con 7 métodos principales de aprendizaje autosupervisado, como MoCoV3, DINO, iBOT, I-JEPA, MAE y data2vec, en 15 conjuntos de datos (8 dentro del dominio + 6 fuera de distribución + predicción densa ADE20K), abarcando astronomía, medicina, teledetección, texturas, flores, etc. La respuesta se manifiesta en múltiples dimensiones, desde reconocimiento hasta segmentación y generación.

1. Sonda lineal dentro del dominio (In-Domain Linear Probing)

Para garantizar una comparación justa, los experimentos se dividieron en dos grupos según el uso o no de técnicas heurísticas. En el grupo que no utiliza ninguna técnica heurística, VISReg lidera: la precisión de la sonda lineal dentro del dominio para ViT-B/16 alcanza 75.7%, superior a MAE (75.1%); ViT-L/14 aumenta aún más a 77.0%, superior a LeJEPA (75.6%). En comparación con iBOT y DINO, que utilizan técnicas heurísticas, VISReg es ligeramente inferior en conjuntos de datos convencionales, pero supera a todos los métodos en el conjunto de datos de texturas DTD, lo que indica que su capacidad de generalización entre dominios proviene del método en sí, no de la acumulación de trucos artificiales.

2. Generalización fuera de distribución (OOD): óptima en todos los aspectos

La generalización fuera de distribución es una prueba más estricta que la precisión dentro del dominio: los métodos que dependen de heurísticas suelen estar muy ajustados dentro del dominio de ImageNet, pero pueden no transferirse bien a nuevas distribuciones muy diferentes. El equipo evaluó en 6 conjuntos de datos OOD que cubren medicina (ChestXRay, RetinaMNIST, OrganAMNIST), astronomía (Galaxy10), teledetección (AID), texturas (DTD), totalmente independientes del dominio de entrenamiento de ImageNet. Los resultados muestran que VISReg logró la mejor precisión OOD promedio en todos los métodos y todos los tamaños de arquitectura, incluso superando a algunos métodos que utilizan técnicas heurísticas y tienen arquitecturas más grandes.

Figura 4: Precisión promedio de la sonda lineal OOD. VISReg supera ampliamente a iBOT, DINO, MoCoV3, I-JEPA, MAE, data2vec y otros métodos.

Como se muestra en la Figura 4, la precisión OOD promedio de VISReg con ViT-B/16 es 70.19%, y con ViT-L/14 es 70.63%, claramente superior a MAE (67.85%), y también superior a MoCoV3 (69.46%), DINO (69.56%), I-JEPA (68.55%) y otros métodos.

3. Eficiencia de datos: iguala a DINOv2 con aproximadamente 1/10 de los datos

Después de preentrenar VISReg (ViT-L/14) en ImageNet-22K (aproximadamente 14 millones de imágenes), su precisión promedio en los 6 conjuntos de datos OOD alcanza 72.94%, prácticamente igual a DINOv2 (72.93%), que fue entrenado en el conjunto LVD-142M (142 millones de imágenes), que es 10 veces más grande. Es decir, VISReg logra un nivel comparable utilizando aproximadamente 1/10 de los datos. (Como referencia, VISReg con ViT-L/14 preentrenado solo con ImageNet-1K tiene una precisión promedio de 70.63%). Esto indica que las representaciones que aprende son muy generalizables.

Figura 5: VISReg preentrenado en ImageNet-22K iguala a DINOv2, entrenado con 10 veces más datos (LVD-142M), en el benchmark OOD.

4. Ajuste fino por transferencia: supera completamente a DINO

Aunque la precisión de la sonda lineal de VISReg en algunos conjuntos de datos dentro del dominio es ligeramente inferior a la de DINO, después del ajuste fino, supera a DINO y al preentrenamiento supervisado en los cinco conjuntos de datos probados: CIFAR-10, CIFAR-100, Flowers, ImageNet-1K y Galaxy10. Esto indica que su distribución de representación es más uniforme, menos redundante y más transferible.

Figura: Comparación del aprendizaje por transferencia. Después del ajuste fino, VISReg supera a DINO y al preentrenamiento supervisado en todos los conjuntos de datos probados (CIFAR-10, CIFAR-100, Flowers, ImageNet-1K, Galaxy10).

5. Guía para predicción densa y generación

La ventaja de VISReg no se limita a la clasificación. En segmentación semántica lineal en ADE20K (ViT-B/16), su mIoU es 30.16, superior a DINO (29.40) y MAE (23.60), y solo ligeramente inferior a MoCoV3 (31.69). Sin usar ninguna técnica heurística, este resultado es competitivo. El artículo también reconoce que aún hay margen de mejora en predicción densa en comparación con los mejores métodos, siendo un punto de enfoque para la optimización posterior.

Figura 7: Segmentación semántica lineal en ADE20K. Sin usar ninguna técnica heurística, VISReg logra un mIoU competitivo, solo superado por MoCoV3.

En guía para generación (SiT-B/2, marco iREPA, 100k pasos de entrenamiento), la generación guiada por características de VISReg supera a la guiada por DINO en tres de cuatro métricas: gFID 40.36 (DINO 41.15), Precisión 51.38 (DINO 50.51), Recuperación 61.26 (DINO 60.70), y IS prácticamente igual (33.48 vs 33.47). Esto indica que las representaciones aprendidas por VISReg también son superiores como señal de guía para generación.

Figura 8: Generación de imágenes guiada por características de VISReg y DINO, utilizando SiT-B/2. VISReg proporciona una mejor guía en la mayoría de las métricas (menor gFID, mayor Precisión y Recuperación).

6. Robustez en datos de baja calidad

En conjuntos de datos de baja calidad como distribución de cola larga (ImageNet-LT) y bajo rango (Galaxy10), VISReg puede prevenir el colapso de manera estable y aprender representaciones significativas, mientras que DINO falla directamente sin un ajuste fino detallado.

Tabla 1: Precisión de la sonda lineal en ImageNet-LT.

Tabla 2: Precisión de la sonda lineal dentro del dominio en Galaxy10.

Conclusión

VISReg demuestra que al desacoplar la regularización de representación en dos componentes independientes: «escala» y «forma», se puede obtener un método de aprendizaje autosupervisado más estable, eficiente y con mayor capacidad de generalización que los métodos existentes.

Sin utilizar ninguna técnica heurística de entrenamiento, logra resultados líderes o cercanos al liderazgo en múltiples dimensiones, como reconocimiento de imágenes, segmentación y guía de generación, y alcanza el nivel OOD de DINOv2 con aproximadamente 1/10 de los datos. Esto proporciona una nueva solución de regularización para el problema de colapso de representación que ha existido durante mucho tiempo en los modelos mundiales JEPA.

Referencias:

https://arxiv.org/abs/2606.02572

Este artículo proviene del WeChat oficial "New Zhiyuan", autor: LRST

熱門幣種推薦

相關問答

Q¿Qué es el 'colapso de la representación' (representation collapse) en el contexto del aprendizaje autosupervisado (SSL)?

AEl colapso de la representación es un problema central en el aprendizaje autosupervisado (SSL) en el que el modelo tiende a asignar diferentes entradas al mismo vector o a unos pocos vectores similares. Aunque puede parecer que el entrenamiento se completa exitosamente, en realidad el modelo no aprende características discriminativas útiles.

Q¿Cuál es la principal contribución del método VISReg presentado en el artículo?

AVISReg (Variance-Invariance-Sketching Regularization) resuelve el problema del colapso de representación desacoplando el término de regularización en dos objetivos independientes: 'escala' (controlado por un término de varianza) y 'forma' (controlado por un objetivo basado en la distancia de Wasserstein por rebanadas). Esto evita la desaparición del gradiente durante el colapso y mejora la generalización y estabilidad del entrenamiento.

Q¿Cómo aborda VISReg las limitaciones de su predecesor, SIGReg?

ASIGReg tenía dos defectos clave: la desaparición del gradiente cuando comenzaba el colapso, y el acoplamiento entre escala y forma del aprendizaje. VISReg soluciona esto: 1) mantiene un término de varianza que proporciona un gradiente constante durante el colapso, y 2) utiliza un operador de 'stop-gradient' en la normalización para desacoplar completamente la optimización de la escala y la forma.

QSegún los resultados experimentales, ¿cómo se compara VISReg con otros métodos como DINOv2 en términos de eficiencia de datos?

AVISReg muestra una alta eficiencia en el uso de datos. Un modelo VISReg (ViT-L/14) entrenado con ImageNet-22K (aproximadamente 14 millones de imágenes) alcanzó un rendimiento promedio en conjuntos de datos fuera de distribución (OOD) de 72.94%, comparable al DINOv2 (72.93%) que fue entrenado con LVD-142M (142 millones de imágenes), es decir, utilizando solo alrededor de 1/10 de los datos.

Q¿Por qué es importante la regularización de la 'forma' mediante la distancia de Wasserstein por rebanadas (SWD) en VISReg?

ALa distancia de Wasserstein por rebanadas (SWD) permite caracterizar la forma completa de la distribución de las representaciones, no solo estadísticas de segundo orden como la covarianza. Basándose en el teorema de Cramér–Wold, alinea las proyecciones unidimensionales de las representaciones a una distribución gaussiana en múltiples direcciones aleatorias, asegurando así que la forma global de la distribución sea la deseada y evitando colapsos complejos.

你可能也喜歡

以太坊上形成了长达43天的质押队列:但专家认为,这并非真正的看涨信号

以太坊网络上因希望进行质押的验证者数量激增,形成了约250万枚ETH的激活队列,新参与者需等待约43天才能激活其代币。然而,Sygnum Bank的托管与质押部门负责人托马斯·布伦纳指出,这种漫长的等待不应被直接解读为强烈的看涨信号。 布伦纳表示,验证者队列的拥堵虽然反映了机构需求,但也受到以太坊协议技术特性的显著影响。他提到,自Dencun升级后,每日验证者吞吐量被限制在约57,600枚ETH,且这一限制在Pectra升级中并未提高。Pectra升级允许单个验证者最多持有2048枚ETH并支持自动复利功能,大型质押运营商可以向现有验证者追加ETH而非创建新验证者。但即便仅向现有验证者添加1枚ETH,该交易也会与新的质押者一同进入相同的激活队列。 因此,布伦纳认为,并非队列中的所有ETH都源自新投资者的需求,其中部分积累来自于已质押ETH的再分配、对现有验证者的补充以及复利过程。他指出,一个更重要的市场信号是提款队列几乎为空,这表明现有参与者正在维持其网络头寸,显示出真实的信心。 目前,以太坊网络上已质押约4120万枚ETH,约占流通总量的33.8%。布伦纳还强调,尽管ETH价格有所疲软,机构投资者并未放弃质押。许多机构将质押收益视为以太坊内在的基本特性,但机构参与的最大障碍之一仍是隐私问题。由于验证者地址、存款地址和提款交易在区块链上可被追踪,机构投资者对扩大其质押规模持谨慎态度,隐私问题仍是制约以太坊机构质押市场更快增长的主要障碍。

cryptonews.ru1 小時前

以太坊上形成了长达43天的质押队列:但专家认为,这并非真正的看涨信号

cryptonews.ru1 小時前

韩国银行公布代币化存款测试结果

韩国央行公布了其代币化存款测试结果。该试点项目涉及28家央行及国际金融机构,韩方参与者包括KB国民银行、NH农协银行、新韩银行、友利银行和韩亚银行。 测试显示,从支付指令到最终结算的整个过程平均耗时约1分20秒,其中最终结算平均需80秒。在测试中,参与者执行了30笔交易,覆盖17种不同场景,包括企业和银行间转账,并涉及韩元、美元和欧元等六种货币。交易总额约合99.5万美元。 央行表示,平台在整个测试期间运行稳定,尽管仅在部分连接现有银行基础设施的环境下运作。即使在支付网络和银行系统兼容性有限的情况下,代币化存款结算仍能无缝、快速、透明地完成。 此外,韩国央行还通过Project Agora平台,在NH农协银行和新韩银行之间完成了一笔2000万韩元(约1.389万美元)的内部转账测试。该交易涉及手动连接其批发型央行数字货币(CBDC)平台Project Hangang至央行现有网络,以验证兼容性。 同时,韩国KB国民银行与日本三菱日联金融集团(MUFG Bank)也完成了使用存款代币的支付测试。这些代币是银行在试点中发行的数字凭证,并非由央行直接发行。韩国央行计划继续测试存款代币支付。 去年,韩国当局曾承诺加强对韩元稳定币的监管,要求其发行必须获得韩国央行和金融服务委员会(FSC)的批准。

cryptonews.ru1 小時前

韩国银行公布代币化存款测试结果

cryptonews.ru1 小時前

交易

現貨

熱門文章

如何購買CORE

歡迎來到HTX.com!在這裡,購買Core DAO (CORE)變得簡單而便捷。跟隨我們的逐步指南,放心開始您的加密貨幣之旅。第一步:創建您的HTX帳戶使用您的 Email、手機號碼在HTX註冊一個免費帳戶。體驗無憂的註冊過程並解鎖所有平台功能。立即註冊第二步:前往買幣頁面,選擇您的支付方式信用卡/金融卡購買:使用您的Visa或Mastercard即時購買Core DAO (CORE)。餘額購買:使用您HTX帳戶餘額中的資金進行無縫交易。第三方購買:探索諸如Google Pay或Apple Pay等流行支付方式以增加便利性。C2C購買:在HTX平台上直接與其他用戶交易。HTX 場外交易 (OTC) 購買:為大量交易者提供個性化服務和競爭性匯率。第三步:存儲您的Core DAO (CORE)購買Core DAO (CORE)後,將其存儲在您的HTX帳戶中。您也可以透過區塊鏈轉帳將其發送到其他地址或者用於交易其他加密貨幣。第四步:交易Core DAO (CORE)在HTX的現貨市場輕鬆交易Core DAO (CORE)。前往您的帳戶,選擇交易對,執行交易,並即時監控。HTX為初學者和經驗豐富的交易者提供了友好的用戶體驗。

675 人學過發佈於 2024.12.13更新於 2026.06.02

如何購買CORE

相關討論

歡迎來到 HTX 社群。在這裡,您可以了解最新的平台發展動態並獲得專業的市場意見。 以下是用戶對 CORE (CORE)幣價的意見。

活动图片