¿El algoritmo que entrena a toda IA, condenado a "muerte" por la propia IA?
Recientemente, dos investigadores de la Universidad de Tsinghua y de la Wharton School de la Universidad de Pensilvania publicaron un nuevo artículo que dio una conclusión esperada durante 40 años en la teoría de optimización:
Para que el descenso de gradiente alcance su máxima velocidad, solo ajustar el tamaño del paso no es suficiente.


Es la primera vez en la historia que se demuestra que, al diseñar solo la secuencia de tamaños de paso para el descenso de gradiente, existe un techo matemático infranqueable.
Y lo más importante: quien completó la demostración central no fue un humano, fue GPT-5.6 Sol Pro.
GPT-5.6 resolvió un problema sin respuesta durante 40 años
La historia es la siguiente.
Todos conocen el descenso de gradiente, desde GPT hasta Stable Diffusion y la conducción autónoma, todos funcionan sobre él. La velocidad de convergencia del descenso de gradiente estándar es O(1/T); después de T pasos, el error se reduce aproximadamente al orden de 1/T.
En 1983, Nesterov añadió momento al descenso de gradiente, llevándolo directamente a O(1/T^2). Con los mismos 1000 pasos, el error pasa de una milésima a una millonésima, una diferencia de tres órdenes de magnitud. Sigue siendo óptimo teóricamente hasta hoy.
Entonces surge una pregunta natural: sin añadir momento, sin cambiar la estructura, solo diseñando cuidadosamente el tamaño de cada paso, ¿se podría igualar a Nesterov?
Este problema estuvo pendiente durante 40 años. Hasta 2023, cuando Altschuler y Parrilo del MIT desarrollaron el "silver stepsize".
Esta secuencia de tamaños de paso no decrece gradualmente como las tradicionales, sino que varía mucho, mostrando una estructura fractal autosimilar. Con ella, el descenso de gradiente alcanzó O(T^{-1.2716}).

Entonces, ¿es este 1.2716 el límite final del ajuste puro de pasos, o solo el comienzo?
Recientemente, un dúo mentor-discípulo chino asumió este problema.
Jianhao Ma se incorporó en julio al Departamento de Ingeniería Industrial de la Universidad de Tsinghua, tiene un doctorado de la Universidad de Michigan, y obtuvo su puesto académico tras una posdoctorado en la Universidad de Pensilvania.
Su mentor posdoctoral, Yuxin Chen, es profesor nombrado de la Wharton School, doctorado en Stanford, se trasladó de Princeton a la Universidad de Pensilvania y ha recibido el premio SIAM al mejor artículo.


Antes, todos estaban haciendo sumas, diseñando secuencias de pasos más inteligentes, para ver cuánto podía aumentar la velocidad.
La idea de Ma y Chen fue, en cambio, demostrar que existe una línea que, sin importar cómo se diseñen los pasos, no se puede cruzar.
Para encontrar un buen conjunto de pasos, solo necesitas un ejemplo exitoso. Pero demostrar que "ninguna secuencia de pasos posible funciona" es decir "no" a infinitas posibilidades.
Después de reflexionar un tiempo, los dos le pasaron directamente el problema a GPT-5.6 Sol Pro, para que la IA lo intentara.

Concretamente, le dieron a GPT dos cosas.
Una era el objetivo de investigación: demostrar que el ajuste puro de pasos no puede alcanzar O(1/T^2). La otra era una estrategia de alto nivel llamada "resisting oracle" (oráculo de resistencia).
Su principio es: primero construir una trayectoria adversaria que ralentice al máximo el descenso de gradiente, luego encontrar una función convexa suave real, de modo que el camino recorrido por el descenso de gradiente en esta función sea precisamente este camino lento.
Una vez establecida la dirección, GPT-5.6 Sol Pro comenzó a trabajar.

La solución central que finalmente propuso fue una construcción geométrica.
Dada cualquier secuencia de tamaños de paso, primero selecciona los "pasos largos", es decir, aquellos cuyo tamaño supera el valor seguro estándar de 1/L. Luego, coloca un conjunto de puntos de anclaje mutuamente perpendiculares en un espacio de alta dimensión, cada uno correspondiente a un paso largo.
El descenso de gradiente se ve obligado a moverse en la misma dirección entre dos pasos largos, y al encontrar un paso largo, salta a una dirección completamente perpendicular. Toda la trayectoria se realiza con precisión mediante una función convexa suave llamada envolvente de Moreau, siendo estrictamente equivalente.
La clave de esta construcción es que está hecha a medida para tu secuencia de pasos. Sin importar cómo diseñes los pasos, puede construir una función correspondiente que te frene.
Pero la demostración no termina aquí.
La cota inferior final no puede depender del orden de aparición de los pasos largos; de lo contrario, la misma secuencia de pasos con una permutación diferente podría escapar.
GPT-5.6 encontró otra técnica de emparejamiento: ordenar los pasos largos por tamaño, construir un camino, dividirlo en grupos pares e impares para emparejar, eliminando completamente la dependencia temporal. Luego introdujo una función de Lyapunov para controlar el crecimiento global, combinada con un argumento de truncamiento, para reunir las restricciones locales en una cota inferior global.

Este conjunto de argumentos se formó completamente después de que Ma y Chen interactuaran repetidamente con GPT-5.6 Sol Pro, señalando fallas en la derivación, GPT las corrigiera y continuara, tras múltiples iteraciones.
En palabras del propio Ma, en la demostración central no hay ningún componente matemático no trivial que provenga de humanos.
En toda la demostración hay un parámetro clave sujeto simultáneamente a dos condiciones: el límite de emparejamiento da una cota inferior, el control del crecimiento da una cota superior.
Cuando el exponente de convergencia p disminuye, las dos restricciones se estrechan cada vez más. En p = √(2+√3) ≈ 1.9319, las dos líneas se tocan y el espacio de maniobra del parámetro se reduce a cero. Si se intenta ir más allá, la demostración se vuelve imposible.
La conclusión final de GPT-5.6 Sol Pro fue: para cualquier secuencia predeterminada de tamaños de paso no negativos, la cota inferior de la tasa de convergencia del descenso de gradiente es Ω(T^{-1.9319}).

El descenso de gradiente con ajuste puro de pasos, sin importar cuán ingeniosa sea la secuencia diseñada, nunca superará esta línea.
En otras palabras: para alcanzar la velocidad de convergencia más rápida, es necesario modificar la estructura del algoritmo.
Revisión final con Lean 4: cero 'sorry', cero 'admit'
¿Cómo asegurarse de que una demostración escrita por IA no es una alucinación?
Ma y Chen utilizaron el método de verificación más riguroso de las matemáticas: el demostrador de teoremas Lean 4.
Usaron Codex para transcribir paso a paso la demostración en lenguaje natural de GPT-5.6 Sol Pro a código Lean 4.
Este sistema de verificación formal revisa línea por línea cada paso de la derivación; cualquier salto lógico o falta de base hace que la compilación falle directamente.
Si un paso realmente no se puede probar, se puede insertar un 'sorry' o 'admit' para saltarlo temporalmente —significando "aún no he probado este paso".
La hoja de resultados final: cero 'sorry', cero 'admit'. No se saltó ni un solo paso.
El código está público en GitHub, con un archivo TRACEABILITY.md que relaciona línea por línea cada teorema del artículo con la demostración correspondiente en el código Lean. Quien quiera verificarlo puede compilarlo por sí mismo.
Dirección del proyecto: https://github.com/jianhaoma/gd-lower-bound-lean
Toda la cadena de verificación fue un relevo de tres partes. GPT-5.6 Sol Pro construyó la demostración, Codex la tradujo a Lean 4, el compilador la revisó línea por línea. Los humanos supervisaron todo el proceso.
No necesitas "confiar" en la IA, deja que el sistema formal decida.
La historia aún no termina
El alcance confirmado hasta ahora es este: 'silver stepsize' ya ha llevado el descenso de gradiente a T^{-1.2716}, y Ma y Chen demostraron que no se puede superar T^{-1.9319}.
Queda una brecha de 0.66 en el medio. ¿Dónde está el límite real?
El investigador de optimización Ben Grimmer, que ha estudiado este problema a largo plazo, declaró tras leer el artículo que "cree firmemente" que 1.2716 es el verdadero techo.
Si tiene razón, entonces 'silver stepsize' ya es el límite del ajuste puro de pasos, y la cota inferior de Ma y Chen aún tiene espacio para apretarse más.
Pero sin importar dónde caiga el límite real, este artículo ya ha dado el paso más crucial: solo ajustando pasos, el descenso de gradiente no puede alcanzar la puntuación perfecta. Esto ha pasado de ser una conjetura a un teorema.
Y quienes lograron este resultado fueron solo dos personas. Sin un equipo matemático, sin expertos en Lean, sin un presupuesto dedicado de computación, usando la versión comercial de GPT-5.6 Sol Pro a la que todos pueden acceder.
Si este modelo es replicable, cualquier investigador en el mundo con una buena pregunta podría hacer que la IA ejecute demostraciones por él.
Referencias:
https://arxiv.org/abs/2608.10418
Este artículo proviene del WeChat Official Account "AI启示录", autor: ASI启示录, editor: Moisés





