El dúo mentor-discípulo Tsinghua-Wharton resuelve un misterio de 40 años, el núcleo matemático lo escribió todo GPT, tú también podrías hacerlo

marsbitPublicado a 2026-08-24Actualizado a 2026-08-24

Resumen

Investigadores de Tsinghua y Wharton, con ayuda de GPT-5.6 Sol Pro, resolvieron un problema abierto durante 40 años en optimización: demostraron que el descenso de gradiente, ajustando solo la secuencia del tamaño de paso, tiene un límite de convergencia de Ω(T^{-1.9319}). Esto significa que para alcanzar la velocidad óptima, es necesario modificar la estructura del algoritmo, no solo los pasos. La prueba central fue generada y validadas por IA usando el verificador formal Lean 4, sin intervención matemática no trivial humana. El trabajo sugiere un nuevo paradigma donde investigadores pueden delegar pruebas complejas a asistentes de IA accesibles.

¿El algoritmo que entrena a toda IA, condenado a "muerte" por la propia IA?

Recientemente, dos investigadores de la Universidad de Tsinghua y de la Wharton School de la Universidad de Pensilvania publicaron un nuevo artículo que dio una conclusión esperada durante 40 años en la teoría de optimización:

Para que el descenso de gradiente alcance su máxima velocidad, solo ajustar el tamaño del paso no es suficiente.

Es la primera vez en la historia que se demuestra que, al diseñar solo la secuencia de tamaños de paso para el descenso de gradiente, existe un techo matemático infranqueable.

Y lo más importante: quien completó la demostración central no fue un humano, fue GPT-5.6 Sol Pro.

GPT-5.6 resolvió un problema sin respuesta durante 40 años

La historia es la siguiente.

Todos conocen el descenso de gradiente, desde GPT hasta Stable Diffusion y la conducción autónoma, todos funcionan sobre él. La velocidad de convergencia del descenso de gradiente estándar es O(1/T); después de T pasos, el error se reduce aproximadamente al orden de 1/T.

En 1983, Nesterov añadió momento al descenso de gradiente, llevándolo directamente a O(1/T^2). Con los mismos 1000 pasos, el error pasa de una milésima a una millonésima, una diferencia de tres órdenes de magnitud. Sigue siendo óptimo teóricamente hasta hoy.

Entonces surge una pregunta natural: sin añadir momento, sin cambiar la estructura, solo diseñando cuidadosamente el tamaño de cada paso, ¿se podría igualar a Nesterov?

Este problema estuvo pendiente durante 40 años. Hasta 2023, cuando Altschuler y Parrilo del MIT desarrollaron el "silver stepsize".

Esta secuencia de tamaños de paso no decrece gradualmente como las tradicionales, sino que varía mucho, mostrando una estructura fractal autosimilar. Con ella, el descenso de gradiente alcanzó O(T^{-1.2716}).

Entonces, ¿es este 1.2716 el límite final del ajuste puro de pasos, o solo el comienzo?

Recientemente, un dúo mentor-discípulo chino asumió este problema.

Jianhao Ma se incorporó en julio al Departamento de Ingeniería Industrial de la Universidad de Tsinghua, tiene un doctorado de la Universidad de Michigan, y obtuvo su puesto académico tras una posdoctorado en la Universidad de Pensilvania.

Su mentor posdoctoral, Yuxin Chen, es profesor nombrado de la Wharton School, doctorado en Stanford, se trasladó de Princeton a la Universidad de Pensilvania y ha recibido el premio SIAM al mejor artículo.

Antes, todos estaban haciendo sumas, diseñando secuencias de pasos más inteligentes, para ver cuánto podía aumentar la velocidad.

La idea de Ma y Chen fue, en cambio, demostrar que existe una línea que, sin importar cómo se diseñen los pasos, no se puede cruzar.

Para encontrar un buen conjunto de pasos, solo necesitas un ejemplo exitoso. Pero demostrar que "ninguna secuencia de pasos posible funciona" es decir "no" a infinitas posibilidades.

Después de reflexionar un tiempo, los dos le pasaron directamente el problema a GPT-5.6 Sol Pro, para que la IA lo intentara.

Concretamente, le dieron a GPT dos cosas.

Una era el objetivo de investigación: demostrar que el ajuste puro de pasos no puede alcanzar O(1/T^2). La otra era una estrategia de alto nivel llamada "resisting oracle" (oráculo de resistencia).

Su principio es: primero construir una trayectoria adversaria que ralentice al máximo el descenso de gradiente, luego encontrar una función convexa suave real, de modo que el camino recorrido por el descenso de gradiente en esta función sea precisamente este camino lento.

Una vez establecida la dirección, GPT-5.6 Sol Pro comenzó a trabajar.

La solución central que finalmente propuso fue una construcción geométrica.

Dada cualquier secuencia de tamaños de paso, primero selecciona los "pasos largos", es decir, aquellos cuyo tamaño supera el valor seguro estándar de 1/L. Luego, coloca un conjunto de puntos de anclaje mutuamente perpendiculares en un espacio de alta dimensión, cada uno correspondiente a un paso largo.

El descenso de gradiente se ve obligado a moverse en la misma dirección entre dos pasos largos, y al encontrar un paso largo, salta a una dirección completamente perpendicular. Toda la trayectoria se realiza con precisión mediante una función convexa suave llamada envolvente de Moreau, siendo estrictamente equivalente.

La clave de esta construcción es que está hecha a medida para tu secuencia de pasos. Sin importar cómo diseñes los pasos, puede construir una función correspondiente que te frene.

Pero la demostración no termina aquí.

La cota inferior final no puede depender del orden de aparición de los pasos largos; de lo contrario, la misma secuencia de pasos con una permutación diferente podría escapar.

GPT-5.6 encontró otra técnica de emparejamiento: ordenar los pasos largos por tamaño, construir un camino, dividirlo en grupos pares e impares para emparejar, eliminando completamente la dependencia temporal. Luego introdujo una función de Lyapunov para controlar el crecimiento global, combinada con un argumento de truncamiento, para reunir las restricciones locales en una cota inferior global.

Este conjunto de argumentos se formó completamente después de que Ma y Chen interactuaran repetidamente con GPT-5.6 Sol Pro, señalando fallas en la derivación, GPT las corrigiera y continuara, tras múltiples iteraciones.

En palabras del propio Ma, en la demostración central no hay ningún componente matemático no trivial que provenga de humanos.

En toda la demostración hay un parámetro clave sujeto simultáneamente a dos condiciones: el límite de emparejamiento da una cota inferior, el control del crecimiento da una cota superior.

Cuando el exponente de convergencia p disminuye, las dos restricciones se estrechan cada vez más. En p = √(2+√3) ≈ 1.9319, las dos líneas se tocan y el espacio de maniobra del parámetro se reduce a cero. Si se intenta ir más allá, la demostración se vuelve imposible.

La conclusión final de GPT-5.6 Sol Pro fue: para cualquier secuencia predeterminada de tamaños de paso no negativos, la cota inferior de la tasa de convergencia del descenso de gradiente es Ω(T^{-1.9319}).

El descenso de gradiente con ajuste puro de pasos, sin importar cuán ingeniosa sea la secuencia diseñada, nunca superará esta línea.

En otras palabras: para alcanzar la velocidad de convergencia más rápida, es necesario modificar la estructura del algoritmo.

Revisión final con Lean 4: cero 'sorry', cero 'admit'

¿Cómo asegurarse de que una demostración escrita por IA no es una alucinación?

Ma y Chen utilizaron el método de verificación más riguroso de las matemáticas: el demostrador de teoremas Lean 4.

Usaron Codex para transcribir paso a paso la demostración en lenguaje natural de GPT-5.6 Sol Pro a código Lean 4.

Este sistema de verificación formal revisa línea por línea cada paso de la derivación; cualquier salto lógico o falta de base hace que la compilación falle directamente.

Si un paso realmente no se puede probar, se puede insertar un 'sorry' o 'admit' para saltarlo temporalmente —significando "aún no he probado este paso".

La hoja de resultados final: cero 'sorry', cero 'admit'. No se saltó ni un solo paso.

El código está público en GitHub, con un archivo TRACEABILITY.md que relaciona línea por línea cada teorema del artículo con la demostración correspondiente en el código Lean. Quien quiera verificarlo puede compilarlo por sí mismo.

Dirección del proyecto: https://github.com/jianhaoma/gd-lower-bound-lean

Toda la cadena de verificación fue un relevo de tres partes. GPT-5.6 Sol Pro construyó la demostración, Codex la tradujo a Lean 4, el compilador la revisó línea por línea. Los humanos supervisaron todo el proceso.

No necesitas "confiar" en la IA, deja que el sistema formal decida.

La historia aún no termina

El alcance confirmado hasta ahora es este: 'silver stepsize' ya ha llevado el descenso de gradiente a T^{-1.2716}, y Ma y Chen demostraron que no se puede superar T^{-1.9319}.

Queda una brecha de 0.66 en el medio. ¿Dónde está el límite real?

El investigador de optimización Ben Grimmer, que ha estudiado este problema a largo plazo, declaró tras leer el artículo que "cree firmemente" que 1.2716 es el verdadero techo.

Si tiene razón, entonces 'silver stepsize' ya es el límite del ajuste puro de pasos, y la cota inferior de Ma y Chen aún tiene espacio para apretarse más.

Pero sin importar dónde caiga el límite real, este artículo ya ha dado el paso más crucial: solo ajustando pasos, el descenso de gradiente no puede alcanzar la puntuación perfecta. Esto ha pasado de ser una conjetura a un teorema.

Y quienes lograron este resultado fueron solo dos personas. Sin un equipo matemático, sin expertos en Lean, sin un presupuesto dedicado de computación, usando la versión comercial de GPT-5.6 Sol Pro a la que todos pueden acceder.

Si este modelo es replicable, cualquier investigador en el mundo con una buena pregunta podría hacer que la IA ejecute demostraciones por él.

Referencias:

https://arxiv.org/abs/2608.10418

Este artículo proviene del WeChat Official Account "AI启示录", autor: ASI启示录, editor: Moisés

Preguntas relacionadas

Q¿Cuál fue el principal hallazgo de la investigación realizada por los académicos de la Universidad de Tsinghua y Wharton?

ADemostraron que el descenso de gradientes, utilizando únicamente ajustes en la secuencia del tamaño de paso (step size), tiene un límite inferior de convergencia de Ω(T^{-1.9319}), lo que significa que no puede alcanzar la velocidad óptima de O(1/T²) sin modificar la estructura del algoritmo.

Q¿Qué papel desempeñó GPT-5.6 Sol Pro en este estudio?

AGPT-5.6 Sol Pro fue la herramienta que generó el núcleo de la demostración matemática. Los investigadores le proporcionaron el objetivo y una estrategia general ('resisting oracle'), y el modelo iteró y refinó la prueba completa. La formalización en Lean 4 confirmó que la demostración era lógicamente sólida.

Q¿Cómo se validó la prueba generada por la IA?

ALa demostración se tradujo a código en el asistente de teoremas Lean 4 (utilizando Codex). Lean 4 verificó formalmente cada paso lógico. El resultado final fue 'cero sorry, cero admit', lo que significa que no hubo lagunas o suposiciones no verificadas en toda la prueba.

Q¿Qué es la secuencia 'silver stepsize' mencionada en el artículo?

AEs una secuencia de tamaños de paso para el descenso de gradientes, propuesta en 2023 por investigadores del MIT. Presenta un patrón fractal (autosimilar) que permite una tasa de convergencia de O(T^{-1.2716}), superando el O(1/T) del método clásico, pero aún lejos de O(1/T²).

Q¿Qué implicaciones tiene este trabajo para la investigación futura en optimización e IA?

AEstablece un límite teórico fundamental: para maximizar la velocidad de convergencia, es necesario modificar la estructura del algoritmo (como añadir momento), no solo ajustar el tamaño de paso. Además, demuestra un nuevo paradigma donde los modelos de IA avanzados, como GPT-5.6, pueden colaborar activamente en la generación y verificación de pruebas matemáticas complejas.

Lecturas Relacionadas

La mayor cuestión político-económica de la era de la IA: si los robots son cada vez más capaces, ¿cómo comparte la humanidad el valor?

El título del artículo plantea la pregunta crucial de la era de la IA: ¿cómo compartirán los humanos el valor creado por máquinas cada vez más capaces? El artículo critica un análisis de *The Economist* sobre China, que sugiere que su enfoque en la tecnología podría distorsionar la asignación de recursos y no abordar la débil demanda interna. Sin embargo, el autor argumenta que el problema central es más profundo y global: la IA está reescribiendo la lógica fundamental de la creación y distribución de la riqueza. A diferencia de revoluciones industriales anteriores, donde los humanos seguían siendo el núcleo del proceso productivo, la IA (especialmente en forma de AGI) amenaza con reemplazar masivamente el trabajo cognitivo. Esto plantea un desafío existencial: la economía podría seguir creciendo, pero con menos personas participando directamente en la creación de valor. El mayor problema no es solo el desempleo, sino la distribución: si el poder adquisitivo de los consumidores no crece, surgirá una contradicción de "demanda insuficiente". Aunque China necesita desesperadamente impulsar sectores como la IA y la robótica como nuevos motores de crecimiento, el verdadero reto es cerrar la brecha entre la innovación tecnológica, los beneficios empresariales, los ingresos de los hogares y el consumo. Este "punto de ruptura" en la transmisión de los beneficios de la productividad es un fenómeno global, como lo demuestra la concentración de riqueza en las grandes tecnológicas estadounidenses frente al estancamiento de los ingresos laborales. El artículo esboza tres posibles caminos futuros: el capitalismo tradicional (los beneficios van a los accionistas), el capitalismo de estado (participación del gobierno) o modelos más innovadores como fondos soberanos digitales, propiedad accionarial ciudadana o rentas básicas universales adaptadas a la era de la IA. Para China, la oportunidad estratégica reside en utilizar su capacidad de coordinación política para no solo convertirse en una potencia de IA, sino también en construir un sistema que permita a la mayoría compartir sus beneficios. Esto requerirá reformas en la distribución del ingreso, el sistema de seguridad social y la formación profesional. La competencia futura no se tratará solo de quién tiene la mejor tecnología, sino de quién construye el mejor sistema de distribución para la era de la inteligencia artificial. Resolver cómo los humanos obtienen ingresos y comparten el valor cuando las máquinas realizan gran parte del trabajo es el principal problema de economía política de nuestro tiempo.

marsbitHace 32 min(s)

La mayor cuestión político-económica de la era de la IA: si los robots son cada vez más capaces, ¿cómo comparte la humanidad el valor?

marsbitHace 32 min(s)

Anthropic se retracta y se disculpa, Claude 'reducido en inteligencia' de forma encubierta confirmado

El desarrollador argofowl descubrió que Claude Code, desde la versión 2.1.237, estaba interpretando el nivel de razonamiento "high" como un valor de 10/100, equivalente al antiguo nivel "low". Esto formaba parte de una prueba A/B de "escala de esfuerzo comprimida" realizada por Anthropic sin notificación, lo que causó frustración entre los desarrolladores que dedicaron tiempo a depurar su código sin saberlo. El ingeniero Thariq Shihipar respondió que el experimento solo cambia el mapeo numérico y no afecta el rendimiento, según sus evaluaciones. Sin embargo, surgieron quejas más amplias sobre Claude Opus 5, siendo acusado de volverse más vago, propenso a errores y de rendimiento inconsistente. Thariq reconoció que Opus 5 es un modelo "notablemente inestable" y que solucionarlo es de máxima prioridad. El incidente destaca una desconexión sistémica en la industria de la IA: mientras los puntajes de referencia (benchmarks) siguen mejorando, la experiencia subjetiva de los usuarios a menudo se deteriora. Las actualizaciones de modelos se realizan de manera opaca, con pruebas A/B, cambios de cuantización y ajustes en el servidor sin la transparencia de las actualizaciones de software tradicionales, dejando a los usuarios confiar únicamente en su percepción. La estabilidad del modelo es fundamental para generar confianza cuando se convierte en infraestructura básica.

marsbitHace 58 min(s)

Anthropic se retracta y se disculpa, Claude 'reducido en inteligencia' de forma encubierta confirmado

marsbitHace 58 min(s)

Trading

Spot
活动图片