В основе JEPA-моделей мира лежит самообучение (Self-Supervised Learning, SSL), которое Янн ЛеКун активно продвигает с 2017 года.
SSL позволяет изучать общие представления из огромных объемов данных без ручной разметки, но сталкивается с ключевой проблемой — коллапсом представлений (representation collapse): модель склонна отображать разные входные данные на один и тот же вектор или на очень небольшое их количество, что создает иллюзию успешного обучения, но на самом деле модель не извлекает дискриминативные признаки.
Для подавления коллапса большинство основных методов полагаются на ряд эвристических приемов (EMA, сети «учитель-ученик», остановка градиента, заморозка слоев и т.д.). Эти приемы делают обучение хрупким, сложным для настройки гиперпараметров, а также снижают интерпретируемость и масштабируемость метода.
Другой подход заключается в прямом ограничении распределения представлений с помощью регуляризации.
Предложенный командой ЛеКуна метод VICReg разделяет цель обучения на три компонента: дисперсия, инвариантность и ковариация, используя ковариацию для ограничения корреляций между измерениями; однако ковариация описывает лишь статистики второго порядка и не может различить два представления с «одинаковым средним и дисперсией, но совершенно разной формой распределения».
Последующий метод SIGReg основан на теореме Крамера-Волда, используя технику sketching для выравнивания всего распределения вложений к стандартному гауссовскому распределению, тем самым ограничивая полную форму распределения.
Однако SIGReg все еще имеет два ключевых недостатка:
- Исчезновение градиента при коллапсе: когда представления начинают коллапсировать, градиент SIGReg также затухает — чем сильнее коллапс, тем слабее корректирующий сигнал, и модель не может самостоятельно восстановиться;
- Связь масштаба и формы: не разделяет два независимых свойства — «величину (масштаб)» и «форму распределения (форму)», что приводит к их взаимному влиянию в процессе оптимизации и плохой адаптации к данным с длинным хвостом, низкого качества или низкого ранга.
То есть в тот момент, когда модель больше всего нуждается в градиентном сигнале, чтобы выйти из состояния коллапса, градиент SIGReg как раз стремится к нулю.
Именно эту ключевую проблему и призван решить VISReg.
Недавно новая работа по самообучению VISReg (Variance-Invariance-Sketching Regularization) получила активное распространение и высокую оценку лауреата премии Тьюринга Янна ЛеКуна — в своем репосте он отметил: «VICReg begat SIGReg which begat VISReg» (VICReg породил SIGReg, который, в свою очередь, породил VISReg), одной фразой обозначив преемственность этого направления регуляризации.

Что же такого сильного в VISReg, что он заслужил такое признание ЛеКуна?
Ответ заключается в том, что он точно поражает ключевую проблему JEPA-моделей мира, на которую ЛеКун делает ставку в долгосрочной перспективе, — коллапс представлений (representation collapse).

Ссылка на статью: https://arxiv.org/abs/2606.02572
Код / предобученные веса: https://github.com/HaiyuWu/visreg
Домашняя страница проекта: https://haiyuwu.github.io/visreg/
VISReg разделяет регуляризационный член, предотвращающий коллапс, на две независимые цели — «масштаб» и «форма». Без использования каких-либо эвристических приемов обучения и без опоры на огромные объемы данных, он превзошел 7 основных методов самообучения по совокупным результатам на 15 наборах данных; при этом, используя примерно 1/10 данных для обучения, он достиг паритета с DINOv2 на внедоменном (OOD) эталонном тесте.

Рис. 2: Моделирование величины градиента ‖∇L‖ для различных методов регуляризации на разных стадиях коллапса представлений. VISReg сохраняет сильный градиент даже в состоянии коллапса, в то время как градиент SIGReg почти исчезает.
Ключевой метод
VISReg сочетает сильные стороны VICReg и SIGReg: сохраняет дисперсионный член VICReg для контроля масштаба, одновременно заменяя ковариационный член целью на основе нарезанного расстояния Вассерштейна (Sliced Wasserstein Distance, SWD) и sketching для контроля формы, и полностью разделяет их с помощью остановки градиента. Общая регуляризационная цель состоит из трех частей.
1. Регуляризация масштаба (Scale Regularization)
Первая часть ограничивает дисперсию каждого измерения, предотвращая коллапс величины:

Его ключевое свойство заключается в том, что когда модель коллапсирует, градиент этого члена стремится к константе, что гарантирует стабильное восстановление модели — это как раз компенсирует недостаток исчезновения градиента у SIGReg.
2. Регуляризация формы (Shape Regularization)
Вторая часть сначала нормализует, чтобы устранить влияние масштаба, а затем отдельно ограничивает форму. Ключевым шагом является нормализация с применением «остановки градиента» (stop-gradient, sg):

Здесь остановка градиента применяется к стандартному отклонению σσ, чтобы оптимизация потерь формы не влияла обратно на масштаб — это именно тот механизм, который обеспечивает настоящее разделение и взаимную независимость целей «масштаба» и «формы».
После нормализации используется нарезанное расстояние Вассерштейна для выравнивания геометрической формы распределения к изотропному гауссовскому распределению:

где

— квантили стандартного гауссовского распределения,

— случайные направления проекции (т.е. «срезы / sketching»).
Теоретической основой является теорема Крамера-Волда (Лемма 3.1 статьи): два распределения равны тогда и только тогда, когда равны все их одномерные проекции вдоль всех направлений на единичной сфере. Таким образом, достаточно выровнять высокоразмерные представления вдоль достаточного количества случайных одномерных направлений к гауссовскому распределению, чтобы эквивалентно выровнять все распределение в высокоразмерном пространстве — это позволяет с помощью дешевой операции одномерной сортировки охарактеризовать полную форму распределения, а не только статистики второго порядка.
3. Объединенная цель
Третья часть — это центрирующая функция потерь, которая притягивает среднее по батчу μ к началу координат.

Три регуляризационных члена комбинируются с весами:

Функция потерь для прогнозирования использует цель инвариантности из JEPA / LeJEPA — выравнивание вложений каждого ракурса (global + local, всего V)

к среднему глобального ракурса

:

Наконец, с помощью единственного гиперпараметра λ достигается баланс между прогнозом и регуляризацией, формируя полную цель:

Сравнение с VICReg: VICReg также разделяет регуляризацию на дисперсию + ковариацию, но ковариация описывает только статистики второго порядка; VISReg использует цель sketching на основе нарезанного расстояния Вассерштейна для полного описания формы распределения, одновременно сохраняя дисперсионный член для контроля масштаба — сохраняя гибкость VICReg и приобретая строгость на уровне распределения.
Всего около 15 строк кода на PyTorch
Реализация этой регуляризационной цели очень легковесна, основная логика занимает всего около 15 строк:

Вычислительная сложность и масштабируемость
Что касается вычислений и масштабируемости, VISReg также имеет преимущества. Вычислительная сложность регуляризационной части составляет

(N — размер батча, D — размерность, K — количество срезов), что является линейным по всем масштабным факторам; для сравнения, ковариационный член VICReg равен

, что растет квадратично с размерностью.
При одинаковом размере батча, скорость работы и потребление памяти VISReg на одной GPU H100 превосходят SIGReg.
Что еще более важно, K случайных срезов можно распределить по нескольким GPU: на M GPU каждая генерирует K/M срезов, что эквивалентно генерации всех K срезов на одной карте.
В экспериментах, когда количества срезов на одной карте было недостаточно, использование 8 GPU, по 128 срезов на каждой (всего 1024), позволило сократить разрыв в точности с вариантом «одна GPU, 1024 среза» примерно с 2.4% до 0.22%. Это означает, что при увеличении масштаба обучения KK может оставаться константой, почти не увеличивая нагрузку на одну карту.

Рис.: Изменение точности линейного зондирования при увеличении количества GPU при фиксированных K и D. Когда K недостаточно (K = 1⁄4D), увеличение количества GPU в 8 раз позволяет довести точность до уровня K = 2D — это делает возможным сохранение константы K при крупномасштабном обучении.
Результаты экспериментов
Возвращаясь к вопросу из заголовка — в чем же сила VISReg? Исследовательская группа провела сравнение VISReg с 7 основными методами самообучения, такими как MoCoV3, DINO, iBOT, I-JEPA, MAE, data2vec, на 15 наборах данных (8 внутридоменных + 6 внедоменных + ADE20K для плотного прогнозирования), включающих сценарии астрономии, медицины, дистанционного зондирования, текстур, цветов и другие. Ответ проявляется в нескольких измерениях: от распознавания до сегментации и генерации.
1. Линейное зондирование внутри домена (In-Domain)
Для обеспечения честности сравнения, эксперименты были разделены на две группы в зависимости от использования эвристических приемов. В группе, не использующей никаких эвристических приемов, VISReg лидирует: точность линейного зондирования внутри домена для ViT-B/16 достигла 75.7%, что выше, чем у MAE (75.1%); ViT-L/14 показал еще лучший результат — 77.0%, превзойдя LeJEPA (75.6%). По сравнению с iBOT и DINO, использующими эвристические приемы, VISReg на обычных наборах данных немного уступает, но на наборе текстурных данных DTD превосходит все методы — это указывает на то, что его способность к обобщению между доменами проистекает из самого метода, а не из нагромождения искусственных приемов.
2. Внедоменное обобщение (OOD): Всестороннее превосходство
Внедоменное обобщение является более строгим тестом, чем точность внутри домена: методы, зависящие от эвристик, часто хорошо настраиваются на ImageNet внутри домена, но могут плохо переноситься на новые распределения с существенными отличиями. Исследовательская группа провела оценку на 6 OOD наборах данных, охватывающих медицину (ChestXRay, RetinaMNIST, OrganAMNIST), астрономию (Galaxy10), дистанционное зондирование (AID), текстуры (DTD). Эти наборы данных полностью не связаны с доменом обучения ImageNet. Результаты показали, что VISReg достигла наилучшей средней точности OOD среди всех методов и размеров моделей, даже превзойдя некоторые методы, использующие эвристические приемы и имеющие модели большего размера.

Рис. 4: Средняя точность линейного зондирования OOD. VISReg всесторонне превосходит iBOT, DINO, MoCoV3, I-JEPA, MAE, data2vec и другие методы.
Как показано на рис. 4, средняя точность OOD для VISReg (ViT-B/16) составила 70.19%, для ViT-L/14 — 70.63%, что заметно выше, чем у MAE (67.85%), и лучше, чем у MoCoV3 (69.46%), DINO (69.56%), I-JEPA (68.55%) и других методов.
3. Эффективность данных: 1/10 данных на уровне DINOv2
После предварительного обучения VISReg (ViT-L/14) на ImageNet-22K (около 14 миллионов изображений), его средняя точность на 6 OOD наборах данных достигла 72.94%, что практически соответствует DINOv2 (72.93%), обученному на в 10 раз большем наборе LVD-142M (142 миллиона изображений). Другими словами, VISReg достиг сопоставимого уровня, используя примерно 1/10 данных. (Для сравнения, средняя точность VISReg (ViT-L/14), обученного только на ImageNet-1K, составила 70.63%). Это говорит о высокой универсальности изучаемых им представлений.

Рис. 5: VISReg, предварительно обученный на ImageNet-22K, достигает паритета с DINOv2, обученным на 10 раз большем объеме данных (LVD-142M), на OOD-эталоне.
4. Трансферное обучение с тонкой настройкой: всестороннее превосходство над DINO
Хотя точность линейного зондирования VISReg на некоторых внутридоменных наборах данных немного ниже, чем у DINO, после тонкой настройки он превзошел DINO и обучение с учителем на всех пяти тестовых наборах данных: CIFAR-10, CIFAR-100, Flowers, ImageNet-1K, Galaxy10. Это указывает на то, что его распределение представлений более равномерное, менее избыточное и обладает лучшей переносимостью.

Рис.: Сравнение трансферного обучения. После тонкой настройки VISReg превзошел DINO и обучение с учителем на всех тестовых наборах данных (CIFAR-10, CIFAR-100, Flowers, ImageNet-1K, Galaxy10).
5. Плотное прогнозирование и управление генерацией
Преимущества VISReg не ограничиваются классификацией. В линейной семантической сегментации на ADE20K (ViT-B/16) его mIoU составил 30.16, что выше, чем у DINO (29.40) и MAE (23.60), и уступает только MoCoV3 (31.69); этот результат является конкурентоспособным, учитывая, что он достигнут без использования каких-либо эвристических приемов. В статье также признается, что в плотном прогнозировании все еще существует разрыв с лучшими методами, что является направлением для дальнейшей оптимизации.

Рис. 7: Линейная семантическая сегментация на ADE20K. Без использования эвристических приемов VISReg показал конкурентоспособный mIoU, уступая только MoCoV3.
В управлении генерацией (SiT-B/2, фреймворк iREPA, 100 тыс. шагов обучения), генерация, направляемая признаками VISReg, превзошла DINO по трем из четырех метрик: gFID 40.36 (DINO 41.15), Precision 51.38 (DINO 50.51), Recall 61.26 (DINO 60.70), IS примерно на том же уровне (33.48 vs 33.47). Это показывает, что представления, изученные VISReg, также являются более качественным сигналом для управления генерацией.

Рис. 8: Генерация изображений, направляемая признаками VISReg и DINO, с использованием SiT-B/2. VISReg обеспечивает лучшее управление по большинству метрик (более низкий gFID, более высокие Precision и Recall).
6. Устойчивость на данных низкого качества
На наборах данных низкого качества, таких как распределения с длинным хвостом (ImageNet-LT) и низкого ранга (Galaxy10), VISReg стабильно предотвращает коллапс и извлекает содержательные представления, в то время как DINO без тонкой настройки гиперпараметров терпит неудачу.

Таблица 1: Точность линейного зондирования на ImageNet-LT

Таблица 2: Точность линейного зондирования внутри домена на Galaxy10
Заключение
VISReg демонстрирует: разделение регуляризации представлений на два независимых компонента — «масштаб» и «форма» — позволяет получить более стабильный, эффективный и лучше обобщающийся метод самообучения по сравнению с существующими подходами.
Без использования каких-либо эвристических приемов обучения он достиг лидирующих или близких к лидирующим результатов в нескольких измерениях: распознавание изображений, сегментация и управление генерацией. Используя примерно 1/10 данных, он достиг уровня DINOv2 на OOD-тестах. Это предоставляет новое регуляризационное решение для давней проблемы коллапса представлений в JEPA-моделях мира.
Источники:
https://arxiv.org/abs/2606.02572
Эта статья из WeChat Official Account «新智元» (New Zhiyuan), автор: LRST






