В трансферном обучении "исходные данные" не обязательно должны быть изображениями, текстом или аудио.
Набор шума, случайно сэмплированного из гауссовского распределения и не имеющего никакой семантики, также может помочь модели лучше обучаться при небольшом количестве размеченных данных.
Эта работа называется полу-контролируемая адаптация к шуму (Semi-Supervised Noise Adaptation, SSNA), статья уже опубликована на ICML 2026.

Команда SSNA далее предложила фреймворк адаптации к шуму (Noise Adaptation Framework, NAF), который использует случайно сгенерированный шум для построения дискриминативной классовой структуры и переносит эту структуру на реальные целевые данные, тем самым улучшая эффективность обучения модели в сценариях с небольшим количеством размеченных данных.

△NAF проецирует шумовой домен и целевой домен в общее пространство репрезентаций и выравнивает их на уровне классов. Изображение из статьи.
В ситуации всего с 4 размеченными примерами на класс, на основе архитектуры ResNet-18, точность NAF на CIFAR-10, CIFAR-100, DTD-47 и Caltech-101 по сравнению с базовой моделью стандартного контролируемого обучения ERM (эмпирическая минимизация риска, Empirical Risk Minimization), использующей только размеченные примеры для обучения, повысилась на 12.35, 7.61, 4.38 и 2.74 процентных пункта соответственно. В настоящее время исходный код статьи открыт, подробности см. в конце.
Замена реального исходного домена шумом
Традиционное трансферное обучение обычно требует исходного домена с большим количеством меток. Но реальные исходные данные не всегда легко получить. Ограничения конфиденциальности, секретности и авторских прав могут сделать данные исходного домена недоступными для обмена. SSNA пытается убрать это предварительное условие: в исходном домене больше не размещаются реальные примеры, а вместо них используется шум, сгенерированный из простого вероятностного распределения.
Конкретный метод не сложен. Предполагая, что целевая задача содержит C классов, исследовательская группа сначала случайным образом сэмплирует вектор среднего для каждого класса в 1024-мерном пространстве и, используя единичную матрицу в качестве ковариации, конструирует C гауссовских распределений, а затем извлекает 50 шумовых векторов из каждого распределения. Шумовой домен и целевой домен используют один и тот же набор индексов классов, каждый шумовой класс заранее соответствует индексу целевого класса, но это соответствие само по себе не несет семантической информации.
Здесь нумерация сама по себе не имеет семантики. Шумовой класс 0 изначально не представляет "кошку", просто до начала обучения исследователи зафиксировали его соответствие определенному классу в целевом домене. То, что действительно переносится, — это не зрительные знания о кошках или собаках, а дискриминативная структура, сформированная в шумовом домене.
Шум одного класса сжимается вместе, шум разных классов раздвигается. Пока эта структура может быть выровнена с целевым доменом, она сможет предоставить реальным целевым примерам более четкие классификационные границы.
Небольшое количество меток все еще необходимо
Шум может заменить реальные исходные данные, но не может полностью заменить метки целевого домена. Причина проста: шум происходит из другого пространства, и индексы классов назначены искусственно. Модель должна использовать небольшое количество размеченных целевых примеров, чтобы понять, с каким реальным классом должен быть выровнен шумовой класс 0.
В статье, когда количество размеченных примеров на класс в CIFAR-100 снизили до 0, точность ERM и NAF составила всего 0.97% и 1.34% соответственно, что близко к случайному уровню. Как только предоставляется небольшое количество размеченных данных, NAF постоянно превосходит ERM.
Следовательно, вывод этой работы таков: В условиях полу-контролируемой классификации реальный исходный домен не обязательно является необходимым условием для достижения позитивного переноса.
NAF в основном делает три вещи
Ориентируясь на верхнюю границу обобщения, данную в статье, NAF разбивает цель обучения на три части.
Сначала хорошо изучить небольшое количество реальных меток
Кодировщик целевого домена отображает реальные примеры в общее пространство репрезентаций, классификатор использует небольшое количество размеченных примеров для расчета потерь на кросс-энтропии. Эта часть аналогична обычному контролируемому обучению и используется для установления связи между шумовыми классами и реальными классами.
Затем заставить шум формировать четкую классовую структуру
Проектор шума отвечает за отображение случайных векторов в то же самое пространство репрезентаций, а классификатор распознает этот шум в соответствии с предустановленными индексами классов. После обучения шум одного класса постепенно собирается вместе, а шум разных классов разделяется.
Наконец, выровнять обе стороны
NAF также вычисляет разницу распределений между шумовым доменом и целевым доменом. Модуль выравнивания распределений не ограничивает конкретную реализацию; в статье сравнивались различные варианты, и в итоге в экспериментах эмпирически использовался механизм отрицательного сходства доменов (Negative Domain Similarity, NDS) по умолчанию. NDS одновременно сравнивает глобальные средние и средние значения классов обоих доменов и использует косинусное сходство, чтобы сблизить их. Средние значения классов для неразмеченных целевых примеров итеративно оцениваются с помощью псевдометок, генерируемых моделью.
Всю цель можно записать как

. Здесь,

отвечает за классификацию небольшого количества реальных размеченных целевых примеров,

отвечает за классификацию шума,

отвечает за выравнивание распределений целевого домена и шумового домена. Верхняя граница обобщения, приведенная в статье, также соответствует этим трем пунктам: эмпирическая ошибка целевого домена, эмпирическая ошибка шумового домена и разница распределений двух доменов в общем пространстве репрезентаций.
От CIFAR до ImageNet, шум может принести выгоду
Основной эксперимент охватывает 8 визуальных наборов данных и 1 набор данных для классификации текстов. За исключением ImageNet-1K, в визуальных задачах использовалось 4 размеченных примера на класс, остальные обучающие примеры использовались как неразмеченные данные.
На ResNet-18, улучшение Top-1 у NAF по сравнению с ERM составило: CIFAR-10 +12.35, CIFAR-100 +7.61, DTD-47 +4.38, Caltech-101 +2.74 процентных пункта соответственно.

△
Точная классификация (fine-grained) также эффективна. При использовании ResNet-18, NAF на CUB-200, Oxford Flowers-102 и Stanford Cars-196 по сравнению с ERM повысила точность на 8.94, 5.51 и 7.74 процентных пункта соответственно.
В более масштабном ImageNet-1K исследовательская группа оставила 100 размеченных примеров на класс. NAF достигла точности 37.10%, что на 0.99 процентных пункта выше, чем у ERM. В текстовой задаче AG News-4 NAF с использованием BERT достигла 82.82%, что на 4.18 процентных пункта выше, чем 78.64% у ERM.
NAF также можно напрямую встраивать в существующие полу-контролируемые методы. В статье ее подключили к UDA, FixMatch, FlexMatch, DebiasMatch, DST, LERM и SA-FixMatch, и в целом все получили выгоду. Например, на результатах 20-раундового обучения на CIFAR-10, точность UDA и FixMatch после добавления NAF повысилась на 20.83 и 9.91 процентных пункта соответственно.
Полезен не "случайность", а структура
Почему шум может помочь? Абляционные эксперименты в статье указывают на один и тот же фактор: имеют ли классы разделимую структуру.
Команда сначала сжала шум всех классов в одну точку. Таким образом, шумовой домен полностью теряет дискриминативную структуру, и NAF не только не дает выигрыша, но и демонстрирует явный негативный перенос. Точность на CIFAR-10 упала с 58.15% у ERM до 33.34%, на CIFAR-100 — с 42.24% до 6.79%.
Напротив, при постепенном увеличении расстояния между центрами шумовых классов точность на CIFAR-100 повышалась с 43.80% до 49.78%. Это показывает, что чем легче различимы шумовые классы, тем более сильное структурное руководство они обычно могут предоставить.
Количество шума, напротив, не так критично. При увеличении количества шума на класс с 10 до 100 точность оставалась стабильной на уровне около 50%; при увеличении до 200 даже немного снизилась. На основании этого в статье делается вывод, что для оказания эффекта достаточно небольшого количества шума, если он может сформировать разделимую модель.

△
Исследовательская группа также упростила шумовой домен до одной центральной точки на класс. Независимо от того, был ли центр фиксированным или обучаемым, результаты были выше, чем у ERM; при этом обучаемый центр показал себя лучше фиксированного, но все же уступал полной NAF.
В эксперименте по переносу с Amazon на Caltech-10 реальные исходные данные в целом все еще имели небольшое преимущество, но шумовой исходный домен уже смог повысить точность с 83.51% у ERM примерно до 88–89%. Это также дает более реалистичную оценку: когда реальные исходные данные недоступны, синтетический шум может стать альтернативой с низкой стоимостью.
Он также отличается от обычного увеличения данных (data augmentation). Увеличение данных обычно выполняется вблизи реальных примеров с помощью поворота, обрезки, интерполяции или генерации; SSNA сначала конструирует независимый шумовой домен, а затем завершает междоменное выравнивание в пространстве репрезентаций.
Вывод: без семантики структуру все еще можно переносить
Эта работа дает новую, парадоксальную перспективу для трансферного обучения: то, что исходные данные могут помочь целевой задаче, не обязательно полностью зависит от их реальной семантики; классовая структура, сформированная в пространстве репрезентаций, также может стать переносимыми знаниями.
Именно это использует NAF, позволяя случайному шуму формировать дискриминативную структуру в общем пространстве репрезентаций, а затем, с помощью небольшого количества размеченных примеров, передавать ее реальным данным. Результаты экспериментов показывают, что даже если исходный домен не содержит реальных изображений, текста или аудио, при сохранении подходящей классовой структуры он все еще может оказывать положительное влияние на целевую задачу.
Другими словами, то, что переносится в трансферном обучении, возможно, не только "что говорят данные", но и "как данные организованы в пространстве репрезентаций". Это также открывает новое направление исследований для сценариев с ограниченной конфиденциальностью, чувствительными авторскими правами или труднодоступными реальными исходными данными.
Название статьи: Semi-Supervised Noise Adaptation: Transferring Knowledge from Noise Domain
Адрес статьи: https://arxiv.org/pdf/2606.00558
Адрес исходного кода: https://github.com/AIResearch-Group/SSNA
Видео-объяснение: https://www.bilibili.com/video/BV1UV7h61EvW/
Эта статья из WeChat официального аккаунта "量子位", автор: команда SSNA








