El diseño heredado del Transformer recibe un golpe: tres artículos en COLM ponen en entredicho sus fundamentos

marsbitPublicado a 2026-08-17Actualizado a 2026-08-17

Resumen

Investigaciones recientes en la conferencia COLM 2026 cuestionan diseños fundamentales de la arquitectura Transformer, ampliamente aceptados. Tres estudios revelan deficiencias en configuraciones estándar. El primero, *Cracks in the Foundation*, analiza normalización QK, atención de ventana deslizante, GQA y longitud de contexto. Al combinar estos elementos en modelos de 7B-8B parámetros, el rendimiento en tareas de contexto largo (HELMET 32K) varió hasta un 47%. Combinaciones como GQA con atención deslizante causaron caídas significativas, y efectos como la normalización QK variaron según el modelo base. El segundo, *Lost in Backpropagation*, identifica una pérdida masiva de gradientes en la capa de proyección de salida. En modelos como GPT-2 y Llama 3, entre el 95% y 99% de la señal de retropropagación se pierde al atravesar esta capa, lo que perjudica la eficacia del entrenamiento. El tercero, *When Fewer Layers Break More Chains*, advierte sobre la poda de capas. Aunque mantiene el rendimiento en tareas de conocimiento, daña severamente la capacidad de razonamiento en cadena (ej., en problemas matemáticos AIME24). Técnicas como la ampliación durante la prueba dejan de funcionar, y el ajuste fino posterior no recupera plenamente las capacidades perdidas. En conjunto, estos trabajos sugieren que elecciones arquitectónicas estándar en los Transformers, raramente cuestionadas, pueden conllevar costes ocultos en capacidades específicas, señalando la necesidad de reevaluar ...

¿Han colapsado de repente muchas de las tecnologías clave del Transformer en una conferencia?

En COLM 2026, varios artículos apuntaron simultáneamente a lo mismo:

Esos diseños del Transformer que nadie cuestiona ya, en realidad no se sostienen.

El Transformer es la arquitectura por defecto de casi todos los modelos principales, y sus configuraciones son en su mayoría tomadas como dogma, rara vez se vuelven a verificar.

El resultado es que este conjunto de artículos ha vuelto a evaluar estas opciones por defecto desde diferentes ángulos.

Y las conclusiones a las que llegan diferentes personas son sorprendentemente consistentes: cada diseño estándar del Transformer paga un precio real en una dimensión que los sistemas de evaluación existentes no miden.

La grieta del contexto largo

El primer artículo se titula "Cracks in the Foundation" (Grietas en los fundamentos), de Ai2 y otras instituciones, y se centra en opciones arquitectónicas consideradas durante mucho tiempo como "estándar": la normalización QK, GQA, la atención por ventana deslizante y la longitud de contexto de preentrenamiento.

Los investigadores tomaron los valores utilizados en modelos reales como Llama 2, Llama 3, Qwen 3 y Olmo 3, hicieron combinaciones y entrenaron 26 modelos para comparar.

Estos modelos tenían entre 7B y 8B de parámetros, manteniendo constantes los datos, el tokenizador y el esquema de extensión de contexto, variando solo la arquitectura.

El equipo llamó a este grupo de modelos "OlmPool", todos preentrenados con 140B tokens, seguidos de un entrenamiento final de contexto largo con 10B tokens, consumiendo en total más de 170,000 horas GPU.

El resultado: en la evaluación HELMET 32K, los 26 modelos obtuvieron puntuaciones entre un máximo de 56.4 y un mínimo de 29.9, una diferencia de 26.5 puntos, lo que equivale a una diferencia relativa del 47%.

Con los mismos datos y una arquitectura similar en general, solo por cambiar cuatro interruptores, la puntuación puede variar tanto.

Cambiar un solo interruptor tiene poco impacto. Usar una longitud de contexto de 4096 o 8192 durante el preentrenamiento, o añadir atención por ventana deslizante, solo reduce la puntuación promedio uno o dos puntos.

Lo realmente crítico es la combinación de varias opciones. Una vez que SWA y GQA están en el mismo modelo, la puntuación promedio cae 9 puntos, mucho más que la suma de sus impactos individuales.

La peor combinación que el equipo encontró fue GQA, atención por ventana deslizante y normalización QK por cabeza, con una caída en la puntuación también mucho mayor que la suma de los efectos individuales.

Posteriormente descubrieron que simplemente contar cuántos "diseños perjudiciales" tiene un modelo puede predecir con precisión su rendimiento en contexto largo, más incluso que analizar su arquitectura detalladamente.

La normalización QK es la más contraintuitiva. Se añadió originalmente para hacer el entrenamiento más estable, y la industria básicamente la considera algo bueno.

Pero las mediciones del artículo muestran que al eliminar la normalización QK original y la normalización posterior de Olmo 3, y reemplazarlas por normalización previa, la puntuación HELMET aumenta en 6 puntos.

El mismo cambio aplicado a Llama 3 tiene el efecto contrario, perdiendo 3.8 puntos.

Una misma opción "estándar", en un modelo base diferente, puede dar resultados completamente opuestos.

Esta parte también midió un fenómeno contrario a la intuición de muchos: la "concentración de la atención", que se refiere a que el modelo enfoca una gran parte de su atención en los primeros tokens del contexto.

Este fenómeno siempre se ha considerado un mal hábito que desperdicia capacidad de cálculo, y muchos métodos nuevos se venden específicamente eliminándolo. Pero en estos modelos OlmPool, cuanto más pronunciado es el fenómeno de concentración de atención, mejor es el rendimiento en contexto largo.

La normalización QK precisamente debilita esta concentración, lo que podría ser la razón por la que perjudica la capacidad de contexto largo.

Los gradientes devorados

El segundo artículo se titula "Lost in Backpropagation" (Perdido en la retropropagación), de la Universidad de Cornell, y se centra en la última capa que usan casi todos los modelos de lenguaje: la capa de proyección de salida.

Cada vez que un modelo de lenguaje procesa un paso, calcula una secuencia de números que representa su comprensión del contexto actual; esta secuencia se llama estado oculto D.

Para predecir la siguiente palabra, el modelo debe convertir el estado oculto en una puntuación para cada palabra candidata en el vocabulario; cuantas palabras tenga el vocabulario, tantas puntuaciones debe generar.

Estas puntuaciones se llaman logits; cuanto más alta sea la puntuación, mayor será la probabilidad de que el modelo considere esa palabra como la siguiente.

El componente que hace esta conversión es la capa de salida, esencialmente una operación matricial.

El tamaño del vocabulario suele ser mucho mayor que la longitud del estado oculto; uno puede tener decenas de miles, el otro quizás solo unos pocos miles.

Esta disparidad de tamaño antes solo se veía como un problema, llamado "cuello de botella del softmax", que significa que un vocabulario mucho más grande que el estado oculto limita los tipos de distribución de la siguiente palabra que el modelo puede expresar.

Este artículo dice que la misma disparidad tiene otra implicación.

Durante la retropropagación, la señal de error debe pasar por la capa de salida para guiar el ajuste de los parámetros del modelo, y este proceso también se ve afectado por la disparidad.

En teoría, la señal de error contiene tanta información como el vocabulario antes de retropropagarse.

Pero la cantidad de información que la capa de salida puede retropropagar está limitada por su propia estructura, con un límite superior similar a la longitud del estado oculto, mucho menor que el vocabulario.

El artículo midió esta pérdida de información en modelos ya entrenados como GPT-2, Pythia, Llama 3, OLMo 2 y Qwen 3, proyectando la señal de error en el espacio nulo de los pesos de la capa de salida y viendo cuánto queda.

El resultado: en estos modelos, entre el 95% y el 99% de la norma del gradiente fue eliminada en este paso.

La señal restante tenía una similitud coseno de solo 0.1 a 0.2 con el gradiente original.

Más del noventa por ciento de la señal que debería retropropagarse es devorada en este paso, y la pequeña parte restante ni siquiera apunta en la dirección que debería.

Esta capa de salida es un paso inevitable en casi todos los modelos de lenguaje, nadie la considera un objeto que deba examinarse, pero en cada retropropagación, silenciosamente borra la mayor parte de la señal de entrenamiento que debería transmitirse.

Podar una capa, rompe la cadena de razonamiento

Otro artículo, titulado "When Fewer Layers Break More Chains" (Cuando menos capas rompen más cadenas), de la Universidad de Tubinga, habla de un método de compresión de modelos ya ampliamente utilizado: la poda de capas, que consiste en eliminar completamente ciertas capas del Transformer, reduciendo la profundidad del modelo para ahorrar cálculo.

La poda de capas es posible porque investigaciones previas han encontrado que algunas capas contribuyen muy poco al rendimiento general; eliminarlas y evaluar con pruebas convencionales de conocimiento muestra poca caída en la puntuación.

Eliminar un cuarto de las capas puede conservar más del 80% de la precisión original; resultados como estos han hecho de la poda de capas un método de eficiencia ampliamente aceptado.

Pero estas pruebas evalúan tareas de conocimiento, con respuestas cortas que pueden responderse correctamente basándose en lo que el modelo ha memorizado.

Este artículo evalúa otra capacidad: el razonamiento en cadena larga. El método utilizado es la "extensión durante la prueba", que básicamente permite al modelo pensar más tiempo, dándole más tokens para razonar, o generar varias respuestas y elegir la correcta. Normalmente, cuanto más piense o más intentos haga, mayor debería ser la precisión.

El artículo seleccionó dos modelos que ya poseen esta capacidad, s1.1-7B y Qwen3-8B, aplicó tres métodos principales de poda de capas para eliminar una o dos capas, y luego observó si estas dos formas de extensión seguían funcionando.

El resultado: en las pruebas de conocimiento, la caída en la puntuación fue efectivamente suave. Pero al cambiar a AIME24, con dificultad de competición matemática, s1.1-7B solo perdió una capa y su precisión cayó drásticamente; con dos capas podadas, cayó casi a cero.

Dar al modelo más tokens para pensar debería hacerlo razonar mejor, pero los modelos podados, cuanto más tiempo piensan, menos mejoran; la extensión durante la prueba básicamente deja de funcionar.

Los autores luego probaron si se podía recuperar mediante fine-tuning, utilizando fine-tuning LoRA y fine-tuning completo de parámetros para reentrenar los modelos podados.

Para el modelo con una capa podada, el fine-tuning fue casi inútil. Para el modelo con dos capas podadas, el fine-tuning recuperó parte de la puntuación, pero aún lejos del nivel anterior a la poda.

En resumen, este artículo quiere advertir que la poda de capas no es tan segura como parece.

Los objetos de estudio de los tres artículos son completamente diferentes: uno mira el contexto largo, otro los gradientes durante el entrenamiento, otro las cadenas de razonamiento.

Pero vistos juntos, se puede discernir un patrón común: los tres artículos se centran en diseños convencionales ya ampliamente adoptados por modelos principales, que rara vez se cuestionan.

Ahora, estas operaciones "convencionales" también están siendo reevaluadas.

Este artículo proviene del WeChat Official Account "QbitAI", autor: Seguimiento de Tecnología de Vanguardia

Preguntas relacionadas

Q¿En qué conferencia se presentaron las investigaciones que cuestionan ciertas decisiones de diseño del Transformer?

ALas investigaciones se presentaron en COLM 2026.

Q¿Qué cuatro elementos o decisiones de diseño fueron examinados en el primer artículo 'Cracks in the Foundation'?

ALos cuatro elementos examinados fueron: la normalización QK, la atención grupal de consulta (GQA), la atención de ventana deslizante (SWA) y la longitud del contexto de preentrenamiento.

QSegún el segundo artículo, 'Lost in Backpropagation', ¿qué porcentaje aproximado de la norma del gradiente se pierde al pasar por la capa de proyección de salida en modelos como GPT-2 y Llama 3?

ASe pierde entre el 95% y el 99% de la norma del gradiente al pasar por la capa de proyección de salida.

Q¿Qué capacidad específica se ve severamente afectada por la poda de capas, según el tercer artículo 'When Fewer Layers Break More Chains'?

ALa capacidad de razonamiento en cadena larga (como en problemas de nivel de competencia matemática) se ve severamente afectada, incluso cuando la poda apenas afecta las tareas de conocimiento.

Q¿Cuál fue el resultado contraintuitivo encontrado sobre la 'concentración de la atención' en los primeros tokens del contexto en el primer estudio?

AEncontraron que cuanto más pronunciada era la concentración de la atención en los primeros tokens del contexto, mejor era el rendimiento del modelo en tareas de contexto largo, lo que desafía la visión común de que este fenómeno es un desperdicio de capacidad de cálculo.

Lecturas Relacionadas

Pronóstico del precio de Cardano: ADA detiene la sangría tras nueve días bajistas, mientras la mayor actualización de Cardano alcanza un 96% de completitud

**Pronóstico del precio de Cardano (ADA): Rebote técnico y actualización clave al 96%** El precio de ADA se ha estabilizado, interrumpiendo una racha de nueve días de pérdidas tras encontrar soporte en el nivel de retroceso de Fibonacci del 0.382 en $0.1762. El activo cotiza alrededor de $0.1770, enfrentándose a resistencias cercanas en las medias móviles de 20 y 50 días. El siguiente objetivo alcista significativo es el nivel Fibonacci 0.618 en $0.1998, mientras que un fallo en el soporte actual podría llevar el precio hacia $0.1617. En el ámbito fundamental, el desarrollo más importante es el progreso de **Ouroboros Leios**, la próxima actualización de escalabilidad de Cardano, que ha alcanzado un **96% de preparación**. Está integrada en la hoja de ruta de la era **Dijkstra**, que se implementará en dos fases: la Fase 1 (Q4 2026) introducirá Leios para aumentar el rendimiento, y la Fase 2 (Q2 2027) agregará Ouroboros Peras para acelerar la finalidad de las transacciones. Sin embargo, una **votación de gobernanza** para confirmar al Comité Constitucional de Cardano está en riesgo de fracasar, ya que no alcanza los porcentajes de aprobación requeridos. Si no tiene éxito para el 1 de septiembre, podría paralizar propuestas de gobierno clave. El contexto macro muestra un **volumen de trading cripto en mínimos anuales**, lo que podría amplificar la volatilidad. Los minutos de la última reunión de la FED, previstos para esta semana, son el próximo catalizador a vigilar. En resumen, ADA se encuentra en un punto de inflexión técnico, con un soporte crítico probado, un progreso de desarrollo sólido, pero con incertidumbre en la gobernanza. La evolución en estos frentes definirá si el precio avanza hacia $0.1998 o retrocede hacia $0.1617.

cryptonews.ruHace 8 min(s)

Pronóstico del precio de Cardano: ADA detiene la sangría tras nueve días bajistas, mientras la mayor actualización de Cardano alcanza un 96% de completitud

cryptonews.ruHace 8 min(s)

Informe sobre el estado de la industria cripto para 2026 con la participación de Danielle LaBarbera, Vicepresidenta de Sumsub para Norteamérica

El informe "Estado de la Industria Cripto 2026", con la participación de Daniela LaBarbera, vicepresidenta de Sumsub para Norteamérica, describe el sector entrando en una "era de madurez reguladora". Marcada por nuevos marcos como las leyes CLARITY y GENIUS en EE.UU., esta etapa ofrece claridad pero exige mayores estándares operativos a las empresas. El fraude evoluciona hacia operaciones coordinadas con IA, como deepfakes e identidades sintéticas, requiriendo un enfoque de prevención basado en el ciclo de vida del cliente, más allá de la verificación inicial KYC. Solo el 23% de las empresas cumple plenamente con la "Travel Rule", enfrentando desafíos de coste, seguridad de datos y fragmentación normativa. Los stablecoins ganan relevancia, representando el 36% de las transacciones en 2025, impulsados por pagos transfronterizos, lo que aumenta los requisitos de cumplimiento. La solución principal presentada es una verificación adaptativa al riesgo, combinando señales de identidad, comportamiento, dispositivo y transacciones. Se observa una tendencia hacia la verificación sin documentos y la reutilización de identidades verificadas, mejorando la experiencia del usuario. La recomendación clave es integrar los controles de KYC, fraude, AML y monitoreo en una visión unificada del riesgo para cerrar brechas de cumplimiento y escalar con confianza.

cryptonews.ruHace 8 min(s)

Informe sobre el estado de la industria cripto para 2026 con la participación de Danielle LaBarbera, Vicepresidenta de Sumsub para Norteamérica

cryptonews.ruHace 8 min(s)

La independencia tecnológica de China: una guerra desde las máquinas de fotolitografía hasta las películas ABF

En agosto de 2026, la japonesa Ajinomoto notificó a sus clientes chinos un recorte del 30% en el suministro de película ABF, un material aislante esencial para los sustratos de chips de IA y CPU/GPU de alto rendimiento. Este material, un derivado descubierto en los años 70 durante la producción de glutamato monosódico (ajinomoto), está monopolizado en más del 95% por Ajinomoto. La medida generó pánico en la industria china, cuya tasa de localización de la película ABF es inferior al 5%. Este evento subraya una realidad crucial para la autonomía tecnológica de China: los cuellos de botella no solo están en equipos clave como las máquinas de litografía, sino también en materiales aparentemente menores pero vitales, como resinas, gases especiales o películas. En este contexto, en abril de 2026, Lotus Holdings, una empresa china conocida por producir ajinomoto, adquirió por 103 millones de yuanes el 51% de Shenzhen New Faith New Materials, una startup que desarrolla películas similares a la ABF. Esta movida simboliza un cambio profundo: la lucha por la independencia tecnológica ya no es solo para gigantes como Huawei o SMIC, sino un esfuerzo colectivo de toda la industria, desde los grandes actores hasta empresas de sectores tradicionales. China ha demostrado que los bloqueos pueden impulsar avances. Tras las sanciones de 2019, Huawei logró el regreso de sus chips Kirin; YMTC desarrolló memoria NAND de 294 capas; y SMIC avanzó en procesos de fabricación. La lógica es clara: la presión externa corta las rutas de dependencia, forzando a las empresas a innovar. China cuenta con la cadena de suministro más completa, el mayor mercado de aplicación y un modelo que combina planificación estatal y dinamismo de mercado. El recorte de Ajinomoto es un revés a corto plazo, pero a largo plazo podría actuar como catalizador, acelerando la ruptura del monopolio de la película ABF, tal como ocurrió en otros sectores. La inversión de Lotus no resolverá el problema de inmediato, pero compra una "entrada" a un campo crítico. El verdadero desafío será la paciencia y la persistencia para lograr un avance en una década, no en tres años. La autonomía tecnológica de China es una guerra sin humo que se libra desde las máquinas de litografía hasta la última capa de una película. Su éxito no dependerá de unos pocos logros brillantes, sino de rellenar uno a uno todos los nodos de la red de la cadena de suministro que pueden ser estrangulados. Es una marcha colectiva, sin final a la vista, por un camino lleno de obstáculos que no se puede abandonar.

marsbitHace 37 min(s)

La independencia tecnológica de China: una guerra desde las máquinas de fotolitografía hasta las películas ABF

marsbitHace 37 min(s)

Trading

Spot
活动图片