Con una sola hoja de papel, masticó un hueso duro que había requerido un artículo de 44 páginas en una revista top.
En 1991, la revista "Annals of Mathematics" publicó un artículo de 44 páginas.
Su autor era József Beck, un nombre conocido por todos en el mundo de las matemáticas combinatorias.
Es el proponente del teorema de Beck-Fiala, ganador del Premio Fulkerson en 1985, conferencista invitado al Congreso Internacional de Matemáticos de 1986 y uno de los fundadores de la teoría de las discrepancias.
El título del artículo era "Módulo de polinomios cero en el círculo unitario: un problema de Erdős", y resolvía el problema número 119 de la colección de problemas de Erdős (Erdős Problems).
Tomando una secuencia de números complejos en el círculo unitario como ceros y multiplicándolos para formar un polinomio, ¿puede garantizarse que el módulo máximo Mn de este polinomio en el círculo unitario supere n^c en infinitos valores de n?
Beck demostró que sí. Este problema era considerado uno de los más difíciles de resolver en aquella época.

La IA se ha llevado la recompensa de Erdős. El problema 119 originalmente planteaba tres preguntas, la tercera con una recompensa de 100 dólares, y ahora su estado ha cambiado a RESUELTO.
Treinta y cinco años después, ese artículo ha sido superado por una sola hoja de papel.
Quien dice esto es Thomas Bloom.
Es matemático, investigador de la Universidad de Manchester y también el creador y mantenedor del sitio web erdosproblems.com.
Este sitio web alberga más de 1000 problemas abiertos dejados por Erdős y es el primer lugar al que acuden los matemáticos de todo el mundo para seguir estos problemas.
Precisamente por eso, cada vez que una empresa de IA anuncia que "ha resuelto un problema de Erdős", debe pasar primero por su escrutinio.
Escribió en X:
Hasta ahora, GPT-5.6 Sol es el modelo nuevo más interesante matemáticamente que he visto. Todas las nuevas demostraciones enviadas a erdosproblems.com que he examinado en detalle son correctas y contienen algunas ideas interesantes.

Bloom también enfatizó que esto no se debe a que la IA haya utilizado herramientas más complejas, sino a que originalmente pensábamos que este problema era mucho más difícil de lo que realmente es.
El presidente de OpenAI, Greg Brockman, retuiteó esta publicación y comentó:
Siento que este es un momento decisivo para el avance de las matemáticas. Los avances científicos y médicos que realmente pueden mejorar la vida humana ahora se sienten muy cerca.

La IA se lleva la recompensa de 100 dólares de Erdős
Primero, aclaremos los antecedentes de este problema.
En 1957, Erdős planteó este problema en un artículo, formulando tres preguntas de una vez, sobre el módulo de polinomios con ceros en el círculo unitario.
Durante los siguientes cuarenta años, lo volvió a mencionar repetidamente en 1961, 1964, 1982, 1990 y 1997.
La primera pregunta fue resuelta por Wagner en 1980.
La segunda pregunta fue resuelta por Beck en 1991, demostrando que existe algún c>0 tal que max_{n≤N} M_n > N^c. Este es el artículo de 44 páginas en "Annals of Mathematics".

Este artículo de Beck fue publicado en "Annals of Mathematics", Volumen 134, Número 3, 1991.
La tercera pregunta tenía una recompensa de 100 dólares puesta por el propio Erdős, mencionada en un artículo suyo de 1997.
Ahora, quienes se han llevado la recompensa son GPT-5.6 y un matemático llamado Korsky. Usando solo una hoja de papel, resolvieron la pregunta que Beck no abordó.

Erdős planteó más de mil problemas a lo largo de su vida y ofreció recompensas de su propio bolsillo, que iban desde 25 hasta 10,000 dólares.
La evaluación de Bloom es: GPT, guiado por las indicaciones de Korsky, usó solo una página de técnicas elementales de análisis armónico para demostrar un resultado más fuerte que el del artículo de 44 páginas de Beck en "Annals".
El paso clave, como Bloom señaló más tarde en el foro de discusión: convolucionar una función no negativa y luego desplazarla en tiempo por 1 suaviza la expresión, facilitando la parte que antes era difícil de abordar.
Dijo que este enfoque de poner la norma de operador dentro de normas duales y productos internos para estimar es una de las estrategias más comunes en análisis.
No es una herramienta nueva, es una herramienta antigua aplicada en un lugar en el que nadie había pensado.

Bloom explicó que el artículo de Beck en "Annals" contiene muchas ideas importantes e interesantes, simplemente no eran necesarias para este problema. Añadió: Al menos para mí, esto es bastante sorprendente.
También mencionó un detalle: nadie calculó esa constante, probablemente es muy pequeña. El propio Beck no la calculó en su momento, y según su juicio, si esa constante valiera la pena mencionar, Beck la habría calculado.
Así que no es que la IA haya refutado una revista top, sino que descubrió un atajo que los humanos podrían no haber tomado.
Para los matemáticos, esto es mucho más estimulante que "la IA resolvió otro problema".
Resolver un problema solo agrega una herramienta más. Esta vez, la herramienta corrigió a quienes la usan.
Una persona se encogería de hombros y se iría; la IA probaría la siguiente
Si solo fuera este caso, sería a lo sumo un ejemplo aislado y elegante.
GPT-5.6 Sol Ultra se lanzó completamente el 9 de julio. El 10 de julio, OpenAI anunció que GPT-5.6 Sol Ultra había producido una demostración completa de la conjetura del Ciclo de Doble Cubierta (Cycle Double Cover).
Este problema fue planteado independientemente por Szekeres en 1973 y por Seymour en 1979, y estuvo abierto unos cincuenta años.
Al modelo se le asignaron 8 horas, pero en realidad usó menos de 1 hora, utilizando un método de 64 subagentes trabajando en paralelo. Tanto la indicación de entrada (prompt) como el PDF de la demostración se hicieron públicos.
Bloom fue la primera persona en dar una evaluación sustancial.
Dijo que es una demostración muy hermosa y luego dio tres adjetivos:
Corta. Elemental. Podría haberse descubierto en la década de 1980.
También señaló la razón subyacente: especula que en el paso clave hay un pequeño giro contra-intuitivo.
¿Cómo abordaría este problema un matemático humano?
Primero probaría el enfoque más natural, revisaría el álgebra lineal, encontraría que no funciona, luego se encogería de hombros, pensando "en realidad no esperaba que fuera tan fácil", y se iría.
Pero la IA no se desanima. Continuaría probando pequeñas variantes hasta que una funcione.
La fuerza de la IA radica en no detenerse por razones emocionales.
Mirando hacia atrás en abril de este año, GPT-5.4 Pro resolvió el problema Erdős 1196 en 80 minutos, usando la función de von Mangoldt.
Jared Lichtman de Oxford había pasado siete años en ese problema. Más tarde dijo que desde 1935, todos los que trabajaban en problemas de conjuntos primitivos se habían acostumbrado a la misma apertura, y esa apertura oscurecía una posibilidad técnica que había estado a la vista durante 90 años.
La evaluación de Terence Tao después de verlo fue aún más contundente: en las últimas décadas, los humanos se desviaron colectivamente desde el primer paso.
La intuición humana ciertamente no es un defecto. Todo lo contrario, es una herramienta de eficiencia: nos ahorra una enorme cantidad de intentos destinados al fracaso; sin ella, nadie podría llegar a la frontera del conocimiento en una vida limitada.
El costo es que ocasionalmente también ahorra el intento que no debería haberse ahorrado.
Quien dijo que GPT-5.6 es interesante, dijo otra cosa el año pasado
En octubre del año pasado, Bloom había desmentido públicamente a OpenAI.
En ese momento, el vicepresidente de OpenAI, Kevin Weil, retuiteó una publicación de Mark Sellke y escribió: GPT-5 acaba de encontrar soluciones a 10 problemas de Erdős previamente no resueltos, y progresó en otros 11, todos ellos abiertos durante décadas.

Bloom respondió con una frase que definió la situación: Un engaño dramático.
Dijo que estos problemas están marcados como "open" en el sitio web, lo que solo significa que él personalmente no conoce ningún artículo que los haya resuelto. Lo que GPT-5 hizo fue desenterrar la literatura que él desconocía.
Y encontrar literatura no equivale a crear una demostración.

La situación que siguió, muchos la recuerdan.
LeCun se sumó, insinuando que su propia bomba había explotado en sus manos. Hassabis fue más directo: Esto es muy embarazoso.

Weil eliminó la publicación.
El investigador de OpenAI, Sébastien Bubeck, finalmente admitió que solo habían encontrado soluciones ya existentes en la literatura.
Cuando OpenAI anunció en mayo de este año haber refutado una conjetura geométrica de Erdős de 1946, adjuntó simultáneamente en el anuncio las evaluaciones de Noga Alon, Melanie Wood y Thomas Bloom.
¿Se ha estancado la IA en matemáticas?
El debate bajo la publicación de Bloom también fue interesante.
Los escépticos estaban representados por el usuario qrdl: "La cadena de pensamiento (output) de la 5.6 es muy escasa, no hay progreso en el problema 677, y la evaluación CritPT en el lado de la física apenas ha cambiado en comparación con la 5.4".
Su conclusión: La IA se ha estancado en matemáticas.

El usuario qrdl publicó en el foro diciendo que CritPT apenas ha cambiado desde la 5.4, y que a menos que hayan encontrado una manera de inflar los puntos de referencia, los resultados simplemente son así.
La argumentación de qrdl no era emocional.
Considera que los modelos grandes son esencialmente generadores de tokens con pesos estáticos, y al hacer matemáticas, no crecen nuevas conexiones neuronales en tiempo real como lo hace un humano. Los saltos creativos reales requieren un cerebro elástico.
La percepción de qrdl es: Cada vez que abre una nueva sesión para atacar el 677, el modelo simplemente repite los mismos viejos enfoques que ya habían fallado.
Las réplicas llegaron rápidamente.
Nat Sothanaphan señaló que CritPT es una prueba de física, no un punto de referencia matemático. Usar solo su curva para demostrar que la IA se ha estancado en matemáticas es seleccionar datos que favorecen su posición.
Su contraprueba es: La 5.6 mostró mejoras sobre la 5.5 en una gran cantidad de evaluaciones, incluyendo FrontierMath.
Otro grupo es el pragmático, representado por el usuario old-bielefelder.

old-bielefelder informó que GPT-5.6 Sol pensó durante 14 minutos y revisó durante más de 9 minutos, mejorando el exponente de 0.72 de Pintz (2018) a 0.7195.
No es un cambio asombroso, pero ciertamente hubo movimiento. En palabras del propio old-bielefelder, fue "la primera tetada".
Como contraste, la noche anterior, GPT-5.5 estuvo lidiando con el mismo problema durante más de una hora y el 0.72 permaneció inmóvil.
Luego notificó el resultado directamente al propio Pintz.
La tercera voz también provino de Nat Sothanaphan, quien usó una expresión de Bloom: Las matemáticas modernas son una catedral gigantesca.
Llegar a la frontera misma de esta catedral consume mucha energía, y los modelos grandes ya pueden hacerlo con una eficiencia sobrehumana; los recientes avances provienen básicamente de esto. Para avanzar más, se necesita inteligencia fluida.
Algunos dicen que los modelos grandes no tienen inteligencia fluida, pero él cree que esto es incorrecto.
La mejora continua en la serie de evaluaciones ARC en los últimos años es evidencia. GPT-5.6 Sol obtuvo un 7.8% en el nivel máximo de razonamiento (Max). Este punto de referencia se lanzó en marzo de este año, y el mejor resultado inicial fue del 0.37%, mientras que los humanos se mantienen estables por encima del 90%.

Resultados oficiales verificados por ARC Prize. El rendimiento de GPT-5.6 Sol en ARC-AGI-3 aumenta drásticamente con el nivel de razonamiento: Low solo obtuvo 0.3%, Max obtuvo 7.8%.
Su explicación es: Los cimientos de la catedral son demasiado vastos, tan vastos que cubren completamente esa inteligencia fluida que está creciendo rápidamente. Así que si solo miras la magnitud del output, parece que no está pasando nada.
Pero el día que la inteligencia fluida comience a superar los cimientos, se volverá repentinamente visible.
Después de dos semanas de discusión, lo que realmente se "sacó a la luz" en este debate no fue "¿Puede la IA hacer matemáticas?", sino cómo definir la palabra "difícil".
En la historia de las matemáticas, aquellas entradas marcadas como "pendientes" registran en parte la dificultad intrínseca del problema, y en parte solo registran los límites de la paciencia humana.
En el pasado, estas dos cosas se mezclaban y nadie podía separarlas. Ahora, comenzamos a poder distinguirlas.
Que un problema haya permanecido sin resolver durante décadas puede no deberse a lo difícil que sea, sino a que nadie estuvo dispuesto a intentar la trigésima vez en ese camino.
¿Cuántos problemas más están bloqueados en realidad solo por la paciencia humana?
Referencias:
https://annals.math.princeton.edu/1991/134-3/p03
https://www.erdosproblems.com/forum/thread/AI%20Contributions
https://arcprize.org/results/openai-gpt-5-6-sol
Este artículo proviene del WeChat oficial account "新智元" (Nueva Era de la Inteligencia), autor: ASI启示录; editor: 元宇






