El "dominio fuente" en el aprendizaje por transferencia no tiene por qué ser necesariamente imágenes, texto o audio.
Un conjunto de ruido muestreado aleatoriamente de una distribución gaussiana, sin ningún significado semántico, también puede ayudar a que un modelo aprenda mejor con pocas anotaciones.
Este trabajo se denomina Adaptación de Ruido Semi-Supervisada (Semi-Supervised Noise Adaptation, SSNA), y el artículo ha sido publicado en ICML 2026.

El equipo de SSNA propuso además el Marco de Adaptación de Ruido (Noise Adaptation Framework, NAF), que utiliza ruido generado aleatoriamente para construir una estructura de categorías discriminativa y transfiere esta estructura a datos objetivo reales, mejorando así la eficacia del aprendizaje del modelo en escenarios con pocas anotaciones.

△NAF proyecta el dominio del ruido y el dominio objetivo en un espacio de representación compartido y los alinea a nivel de categoría. Imagen del artículo.
En un escenario con solo 4 muestras etiquetadas por clase, basándose en la red troncal ResNet-18, la precisión de NAF en CIFAR-10, CIFAR-100, DTD-47 y Caltech-101, en comparación con la línea de base de aprendizaje supervisado estándar ERM (Minimización del Riesgo Empírico, Empirical Risk Minimization) entrenada solo con muestras etiquetadas, mejoró en 12.35, 7.61, 4.38 y 2.74 puntos porcentuales respectivamente. Actualmente, el código del artículo ya está disponible en acceso abierto; los detalles se encuentran al final.
Sustituir el dominio fuente real por ruido
El aprendizaje por transferencia tradicional generalmente requiere un dominio fuente rico en etiquetas. Pero los datos fuente reales no siempre son fáciles de obtener. Las restricciones de privacidad, confidencialidad y derechos de autor pueden impedir que se compartan los datos del dominio fuente. SSNA intenta eliminar este requisito: el dominio fuente ya no contiene muestras reales, sino que se reemplaza por ruido generado a partir de distribuciones de probabilidad simples.
El método específico no es complejo. Suponiendo que la tarea objetivo contiene C categorías, el equipo de investigación primero muestrea aleatoriamente un vector medio para cada categoría en un espacio de 1024 dimensiones, utilizando la matriz identidad como covarianza, construyendo así C distribuciones gaussianas, y luego muestrea 50 vectores de ruido de cada distribución. El dominio del ruido y el dominio objetivo utilizan el mismo conjunto de índices de categoría. Cada categoría de ruido corresponde previamente a un índice de categoría objetivo, pero esta correspondencia en sí misma no contiene información semántica.
La numeración aquí no tiene significado semántico. La clase de ruido 0 no representa naturalmente "gato"; simplemente, antes de comenzar el entrenamiento, los investigadores la fijaron para que corresponda a una determinada clase en el dominio objetivo. Lo que realmente se transfiere no es el conocimiento visual de gatos o perros, sino la estructura discriminativa formada en el dominio del ruido.
El ruido de la misma categoría se agrupa, y el ruido de diferentes categorías se separa. Siempre que esta estructura pueda alinearse con el dominio objetivo, puede proporcionar límites de clasificación más claros para las muestras objetivo reales.
Siguen siendo necesarias algunas etiquetas
El ruido puede reemplazar los datos fuente reales, pero no puede reemplazar completamente las etiquetas del dominio objetivo. La razón es directa: el ruido proviene de otro espacio, y la numeración de categorías se asigna artificialmente. El modelo debe depender de un pequeño número de muestras objetivo ya etiquetadas para saber con qué clase real debe alinearse la clase de ruido 0.
En el artículo, cuando las muestras etiquetadas por clase en CIFAR-100 se redujeron a 0, la precisión de ERM y NAF fue solo del 0.97% y 1.34% respectivamente, ambas cercanas a un nivel aleatorio. Una vez que se proporcionaron algunas etiquetas, NAF superó continuamente a ERM.
Por lo tanto, la conclusión de este trabajo es: en el contexto de la clasificación semi-supervisada, el dominio fuente real puede no ser una condición necesaria para lograr una transferencia positiva.
NAF hace principalmente tres cosas
Basándose en el límite superior de generalización proporcionado en el artículo, NAF divide el objetivo de entrenamiento en tres partes.
Primero, aprender bien las pocas etiquetas reales
El codificador del dominio objetivo mapea las muestras reales al espacio de representación compartido, y el clasificador utiliza las pocas muestras etiquetadas para calcular la pérdida de entropía cruzada. Esta parte es consistente con el aprendizaje supervisado común y se utiliza para establecer un puente entre las clases de ruido y las clases reales.
Luego, hacer que el ruido forme una estructura de categoría clara
El proyector de ruido se encarga de mapear los vectores aleatorios al mismo espacio de representación, y el clasificador identifica este ruido de acuerdo con los números de clase predefinidos. Después del entrenamiento, el ruido de la misma clase se agrupa gradualmente, y el ruido de diferentes clases se separa entre sí.
Finalmente, alinear ambos lados
NAF también calcula la diferencia de distribución entre el dominio del ruido y el dominio objetivo. El módulo de alineación de distribución no limita la implementación específica; el artículo compara múltiples esquemas y finalmente adopta empíricamente la Similitud de Dominio Negativa (Negative Domain Similarity, NDS) como mecanismo predeterminado en los experimentos. NDS compara simultáneamente las medias globales y las medias por clase de ambos dominios, y utiliza la similitud del coseno para acercarlas. La media de clase de las muestras objetivo no etiquetadas se estima iterativamente mediante las etiquetas pseudo generadas por el modelo.
Todo el objetivo se puede escribir como

. Donde,

se encarga de la clasificación de las pocas muestras objetivo etiquetadas reales,

se encarga de la clasificación del ruido,

se encarga de la alineación de distribución entre el dominio objetivo y el dominio del ruido. El límite superior de generalización proporcionado en el artículo también corresponde a estos tres términos: error empírico del dominio objetivo, error empírico del dominio del ruido y la diferencia de distribución entre los dos dominios en el espacio de representación compartido.
Desde CIFAR hasta ImageNet, el ruido puede aportar beneficios
El experimento principal cubre 8 conjuntos de datos visuales y 1 conjunto de datos de clasificación de texto. Excepto ImageNet-1K, las tareas visuales utilizan 4 muestras etiquetadas por clase, y las muestras de entrenamiento restantes se utilizan como datos no etiquetados.
En ResNet-18, la mejora Top-1 de NAF en comparación con ERM fue: CIFAR-10 +12.35, CIFAR-100 +7.61, DTD-47 +4.38, Caltech-101 +2.74 puntos porcentuales.

△
También es eficaz para la clasificación de grano fino. Usando ResNet-18, NAF mejoró en 8.94, 5.51 y 7.74 puntos porcentuales en comparación con ERM en CUB-200, Oxford Flowers-102 y Stanford Cars-196 respectivamente.
En el conjunto de datos a mayor escala ImageNet-1K, el equipo de investigación retuvo 100 muestras etiquetadas por clase. NAF alcanzó una precisión del 37.10%, 0.99 puntos porcentuales más alta que ERM. En la tarea de texto AG News-4, NAF usando BERT alcanzó el 82.82%, 4.18 puntos porcentuales más alto que el 78.64% de ERM.
NAF también puede integrarse directamente en los métodos semi-supervisados existentes. El artículo lo incorporó en UDA, FixMatch, FlexMatch, DebiasMatch, DST, LERM y SA-FixMatch, obteniendo beneficios generales. Tomando como ejemplo los resultados de 20 rondas de entrenamiento en CIFAR-10, después de agregar NAF, la precisión de UDA y FixMatch mejoró en 20.83 y 9.91 puntos porcentuales respectivamente.
Lo realmente útil no es la "aleatoriedad", sino la estructura
¿Por qué el ruido puede ayudar? Los experimentos de ablación del artículo apuntan a un mismo factor: si las categorías tienen una estructura separable entre sí.
El equipo primero comprimió todo el ruido de todas las categorías en un solo punto. De esta manera, el dominio del ruido perdió completamente su estructura discriminativa, y NAF no solo no mostró beneficios, sino que incluso presentó una clara transferencia negativa. La precisión en CIFAR-10 cayó del 58.15% de ERM al 33.34%, y en CIFAR-100 cayó del 42.24% al 6.79%.
Por el contrario, cuando se aumentó gradualmente la distancia entre los centros de las categorías de ruido, la precisión en CIFAR-100 mejoró del 43.80% al 49.78%. Esto indica que cuanto más fácilmente distinguibles son las clases de ruido, más fuerte suele ser la guía estructural que pueden proporcionar.
La cantidad de ruido no es tan crítica. Cuando el ruido por clase aumentó de 10 a 100, la precisión se mantuvo estable en aproximadamente el 50%; incluso disminuyó ligeramente al aumentarlo a 200. El artículo concluye que, siempre que se pueda formar un patrón separable, una pequeña cantidad de ruido es suficiente para funcionar.

△
El equipo de investigación también simplificó el dominio del ruido a un solo punto central por clase. Tanto si el centro era fijo como si era aprendible, los resultados fueron superiores a ERM; entre ellos, el centro aprendible fue mejor que el fijo, pero aún inferior al NAF completo.
En los experimentos de transferencia de Amazon a Caltech-10, los datos fuente reales en general todavía tenían una ligera ventaja, pero el dominio fuente de ruido ya podía mejorar la precisión del 83.51% de ERM a aproximadamente entre el 88% y el 89%. Esto también proporciona un posicionamiento más realista: cuando los datos fuente reales no están disponibles, el ruido sintético puede convertirse en una alternativa de bajo costo.
También es diferente del aumento de datos común. El aumento de datos generalmente realiza rotaciones, recortes, interpolaciones o generación cerca de las muestras reales; SSNA primero construye un dominio de ruido independiente y luego completa la alineación entre dominios en el espacio de representación.
Resumen: incluso sin semántica, la estructura aún se puede transferir
Este trabajo proporciona una nueva perspectiva que parece contraintuitiva para el aprendizaje por transferencia: que los datos fuente puedan ayudar a la tarea objetivo puede no depender completamente de su significado semántico real; la estructura de categoría formada en el espacio de representación también puede convertirse en conocimiento transferible.
NAF aprovecha precisamente esto, haciendo que el ruido aleatorio forme una estructura discriminativa en el espacio de representación compartido y luego, con la ayuda de unas pocas muestras etiquetadas, la transfiera a los datos reales. Los resultados experimentales muestran que incluso si el dominio fuente no contiene imágenes, texto o audio reales, siempre que conserve una estructura de categoría adecuada, aún puede tener un efecto positivo en la tarea objetivo.
En otras palabras, lo que el aprendizaje por transferencia transfiere puede no ser solo "qué dicen los datos", sino también "cómo se organizan los datos en el espacio de representación". Esto también abre una nueva línea de investigación para escenarios con restricciones de privacidad, sensibilidad a los derechos de autor o dificultad para obtener datos fuente reales.
Título del artículo: Semi-Supervised Noise Adaptation: Transferring Knowledge from Noise Domain
Dirección del artículo: https://arxiv.org/pdf/2606.00558
Dirección del código fuente: https://github.com/AIResearch-Group/SSNA
Vídeo explicativo: https://www.bilibili.com/video/BV1UV7h61EvW/
Este artículo proviene de la cuenta pública de WeChat "Quantum Bit", autores: equipo SSNA






