10 problemas matemáticos, 24 horas de inversión.
Este fin de semana, OpenAI y Anthropic, dos gigantes de la IA, se enfrentaron en la vanguardia de las matemáticas.
Primero, el 1 de agosto, el investigador de OpenAI Sébastien Bubeck anunció que su próximo modelo principal no revelado, Astra, había demostrado de una vez 10 resultados matemáticos de vanguardia, presentando 10 certificados de Lean y 10 revisiones detalladas de las ideas para cada problema.

No subestimen estos 10 problemas.
Sus principales conclusiones no habían avanzado en al menos 10 años, muchos llevaban décadas estancados, son problemas abiertos auténticos.

Aunque no son los enigmas más profundos de las matemáticas, cada uno es un hueso duro de roer.
Elliot Glazer, responsable de FrontierMath en Epoch AI, afirmó directamente: solo el artículo sobre grupos no sofisticados seguramente entraría en Annals of Mathematics, una revista de primer nivel reconocida por la comunidad matemática.
Al lanzar estos 10 problemas difíciles, el mundo de la IA estalló, alguien exclamó de inmediato "la singularidad matemática ha llegado".
Anthropic respondió rápidamente.
En menos de 24 horas, el investigador Levent Alpöge respondió bajo la publicación de Bubeck: "Lo hice a la mitad con Fable."

Luego agregó que lo que resolvió fueron los ítems 4, 5, 6, 7 y 8 de la lista de OpenAI, un total de 5 ítems.
Las condiciones experimentales, según Levent, fueron limpias: completamente autónomo, prompts genéricos, sin internet durante todo el proceso, y además agregó una capa de protección para evitar que las soluciones de OpenAI se filtraran al contexto.

Por supuesto, Levent aún no ha publicado los detalles completos de las demostraciones de Fable, dijo que los subiría.
Pero si se confirma, el peso de este asunto cambia:
OpenAI, usando el modelo no publicado Astra para ganar la primicia inicial, solo la mantuvo durante 24 horas. Y Fable, que está alcanzando, es un modelo que Anthropic hizo público hace tiempo y que cualquiera puede usar.
Una "primicia matemática" con una vida útil de solo 24 horas
El usuario Chubby retuiteó: "Fable, disponible públicamente, reproduce la mitad de los logros de Astra."

En los comentarios, alguien bromeó: visto así, ¿OpenAI solo ganó una primicia?
En el pasado, las disputas sobre la prioridad de un resultado matemático solían medirse en años.
Quién lo pensó primero, quién lo demostró primero, quién lo publicó primero, con largos procesos de envío, revisión y modificación en el medio.
Y ahora, Astra aún no se lanza oficialmente, y los resultados que anunció, en solo 24 horas, ya han sido igualados a la mitad por un modelo público.
El valor de la primicia sigue ahí, pero su vida útil se ha acortado enormemente.
Muchos usuarios ya están hablando de la "singularidad matemática", y los dos gigantes de la IA también están cerrando filas.
Detrás de los 2000 dólares, hay una cuenta aún más cara
OpenAI también lanzó un número: encontrar estas 10 soluciones costó menos de 2000 dólares.
Según el investigador Noam Brown, esto corresponde a los tokens necesarios para buscar estas soluciones, convertidos luego al precio de la API de Sol.

Es decir, este es solo el costo marginal de inferencia en el momento en que se ejecutaron con éxito las 10 soluciones.
Fuera de esto, está el propio entrenamiento y desarrollo de Astra, los problemas que se intentaron pero no tuvieron éxito, el tiempo humano para organizar los argumentos en un artículo de 249 páginas, el costo de formalizar cada demostración en Lean, y finalmente el costo de revisión por matemáticos externos.
Noam mismo admite que también intentaron otros problemas importantes, pero sin éxito, ninguno de los Problemas del Premio del Milenio se resolvió.
Aun así, 2000 dólares aún reducen el costo marginal de que una IA resuelva un problema de vanguardia al mínimo.
Incluso alguien bromeó, ¿OpenAI anunciará mañana otros 10 avances matemáticos, o esperará hasta la próxima semana para publicar 100 de una vez?

De "superarse mutuamente en rankings" a "verificarse mutuamente"
Que Fable rehaga el mismo conjunto de problemas de Astra es más interesante que un simple ranking.
Los rankings miden respuestas conocidas: el problema y la respuesta estándar están ahí, compitiendo por quién tiene la puntuación más alta.
Pero que dos modelos, en condiciones sin internet y con protección contra filtraciones, lleguen independientemente a la misma conclusión de vanguardia, mide algo completamente diferente: qué tan confiable es este resultado, si puede ser reproducido independientemente.
Esto se parece más a una revisión por pares.
Por ahora, Levent solo ha "hecho una declaración" en X, no ha publicado los PDF de esas 5 demostraciones, los prompts, los registros de ejecución completos, el costo en tokens o los certificados de Lean.
El usuario Haider cuestionó: incluso si es cierto, ¿por qué usar Fable para reproducir lo de Astra, en lugar de usarlo directamente para resolver nuevos problemas abiertos?

De hecho, Fable no solo se aprovecha del éxito de Astra, también resuelve nuevos problemas.
En julio, Levent usó Fable para dar un contraejemplo tridimensional de la conjetura de Jacobian; después, alguien escribió específicamente un material de verificación algebraica de 7 páginas, confirmando que ese mapeo explícito realmente refutaba la conjetura en tres dimensiones y superiores.
Logros que la gran mayoría no entiende, ¿quién los valida?
La importancia real de estos 10 logros es difícil de juzgar para la gran mayoría.
Ethan Mollick lo expresó claramente: para casi todos en la Tierra, esto no solo está fuera de nuestra capacidad, sino fuera de nuestra comprensión. Solo podemos confiar en que los matemáticos profesionales nos digan si es impresionante o no.

Código, imágenes, chat, las personas comunes aún pueden experimentar de primera mano dónde es fuerte la IA.
Pero la existencia de grupos no sofisticados, los contraejemplos de la conjetura de rigidez de Connes, el teorema de repetición paralela cuántica, estos solo los entienden un puñado de expertos.
Cuanto más avanza la capacidad de la IA hacia la frontera científica, menos puede confiar el público en la experiencia personal, y más en una larga cadena de confianza. Este estado de "ni siquiera poder asombrarse" está ocurriendo simultáneamente en cada vez más áreas.
El matemático Thomas Bloom recordó que estos resultados utilizan teorías matemáticas acumuladas durante siglos y sistemas formales construidos a mano por matemáticos, describirlo simplemente como "la IA reemplazó a los matemáticos" no es honesto.
El estándar que dio es: ¿esta demostración nos enseña algo nuevo sobre este problema?
Así que la verdadera pregunta es: cuando la IA pueda producir demostraciones matemáticas de vanguardia de manera barata y en masa, ¿con qué debemos medir realmente sus logros?
La respuesta tal vez no esté en su lado de producción, sino en el de validación: si una demostración puede ser leída, verificada y juzgada en su importancia, eso finalmente determinará su valor real.
La habilidad más escasa está pasando de "hacer demostraciones" a "entender y validar demostraciones".
Cuando la IA puede demostrar diez problemas difíciles de la noche a la mañana, la verdadera prueba acaba de comenzar: las demostraciones se fabrican cada vez más rápido, ¿nuestra verificación podrá seguirles el ritmo?
Referencias:
https://x.com/haider1/status/2083908869915611554
https://x.com/polynoamial/status/2083470822258467194
https://x.com/kimmonismus/status/2083950641978679363 https://x.com/Dr_Singularity/status/2083653287463571742
Este artículo es del WeChat público "新智元" (New Zhi Yuan), autor: ASI启示录





