OpenAI resuelve 10 problemas matemáticos difíciles y Fable 'reproduce' 5 en 24 horas

marsbitPublicado a 2026-08-05Actualizado a 2026-08-05

Resumen

Diez problemas matemáticos y 24 horas de revolución. Este fin de semana, OpenAI y Anthropic se enfrentaron en la vanguardia de las matemáticas. El 1 de agosto, el investigador de OpenAI Sébastien Bubeck anunció que Astra, su próximo modelo principal no revelado, había demostrado 10 logros matemáticos de vanguardia, con 10 certificados Lean y análisis detallados. Estos problemas eran desafíos abiertos, algunos estancados durante décadas. Elliot Glazer, responsable de FrontierMath en Epoch AI, señaló que solo el resultado sobre los grupos no sofisticados merecería la revista *Annals of Mathematics*. El anuncio generó gran revuelo, hasta que el investigador de Anthropic, Levent Alpöge, respondió en menos de 24 horas: "He completado la mitad con Fable". Afirmó haber resuelto 5 de los 10 problemas (números 4 a 8) usando Fable, un modelo ya público, bajo condiciones controladas y sin acceso a internet para evitar contaminación de las soluciones de OpenAI. Aunque aún no publicó los detalles completos, si se confirma, esto significa que la ventaja inicial de OpenAI duró solo un día. OpenAI indicó que el coste marginal de encontrar estas soluciones fue inferior a 2000 dólares en tokens, pero esto no incluye costes de entrenamiento, verificación o formalización. El hecho de que Fable, un modelo público, replicara la mitad de los resultados independientemente va más allá de un simple benchmark; se asemeja a una revisión por pares, probando la fiabilidad y reproducibilidad. La mayoría...

10 problemas matemáticos, 24 horas de inversión.

Este fin de semana, OpenAI y Anthropic, dos gigantes de la IA, se enfrentaron en la vanguardia de las matemáticas.

Primero, el 1 de agosto, el investigador de OpenAI Sébastien Bubeck anunció que su próximo modelo principal no revelado, Astra, había demostrado de una vez 10 resultados matemáticos de vanguardia, presentando 10 certificados de Lean y 10 revisiones detalladas de las ideas para cada problema.

No subestimen estos 10 problemas.

Sus principales conclusiones no habían avanzado en al menos 10 años, muchos llevaban décadas estancados, son problemas abiertos auténticos.

Aunque no son los enigmas más profundos de las matemáticas, cada uno es un hueso duro de roer.

Elliot Glazer, responsable de FrontierMath en Epoch AI, afirmó directamente: solo el artículo sobre grupos no sofisticados seguramente entraría en Annals of Mathematics, una revista de primer nivel reconocida por la comunidad matemática.

Al lanzar estos 10 problemas difíciles, el mundo de la IA estalló, alguien exclamó de inmediato "la singularidad matemática ha llegado".

Anthropic respondió rápidamente.

En menos de 24 horas, el investigador Levent Alpöge respondió bajo la publicación de Bubeck: "Lo hice a la mitad con Fable."

Luego agregó que lo que resolvió fueron los ítems 4, 5, 6, 7 y 8 de la lista de OpenAI, un total de 5 ítems.

Las condiciones experimentales, según Levent, fueron limpias: completamente autónomo, prompts genéricos, sin internet durante todo el proceso, y además agregó una capa de protección para evitar que las soluciones de OpenAI se filtraran al contexto.

Por supuesto, Levent aún no ha publicado los detalles completos de las demostraciones de Fable, dijo que los subiría.

Pero si se confirma, el peso de este asunto cambia:

OpenAI, usando el modelo no publicado Astra para ganar la primicia inicial, solo la mantuvo durante 24 horas. Y Fable, que está alcanzando, es un modelo que Anthropic hizo público hace tiempo y que cualquiera puede usar.

Una "primicia matemática" con una vida útil de solo 24 horas

El usuario Chubby retuiteó: "Fable, disponible públicamente, reproduce la mitad de los logros de Astra."

En los comentarios, alguien bromeó: visto así, ¿OpenAI solo ganó una primicia?

En el pasado, las disputas sobre la prioridad de un resultado matemático solían medirse en años.

Quién lo pensó primero, quién lo demostró primero, quién lo publicó primero, con largos procesos de envío, revisión y modificación en el medio.

Y ahora, Astra aún no se lanza oficialmente, y los resultados que anunció, en solo 24 horas, ya han sido igualados a la mitad por un modelo público.

El valor de la primicia sigue ahí, pero su vida útil se ha acortado enormemente.

Muchos usuarios ya están hablando de la "singularidad matemática", y los dos gigantes de la IA también están cerrando filas.

Detrás de los 2000 dólares, hay una cuenta aún más cara

OpenAI también lanzó un número: encontrar estas 10 soluciones costó menos de 2000 dólares.

Según el investigador Noam Brown, esto corresponde a los tokens necesarios para buscar estas soluciones, convertidos luego al precio de la API de Sol.

Es decir, este es solo el costo marginal de inferencia en el momento en que se ejecutaron con éxito las 10 soluciones.

Fuera de esto, está el propio entrenamiento y desarrollo de Astra, los problemas que se intentaron pero no tuvieron éxito, el tiempo humano para organizar los argumentos en un artículo de 249 páginas, el costo de formalizar cada demostración en Lean, y finalmente el costo de revisión por matemáticos externos.

Noam mismo admite que también intentaron otros problemas importantes, pero sin éxito, ninguno de los Problemas del Premio del Milenio se resolvió.

Aun así, 2000 dólares aún reducen el costo marginal de que una IA resuelva un problema de vanguardia al mínimo.

Incluso alguien bromeó, ¿OpenAI anunciará mañana otros 10 avances matemáticos, o esperará hasta la próxima semana para publicar 100 de una vez?

De "superarse mutuamente en rankings" a "verificarse mutuamente"

Que Fable rehaga el mismo conjunto de problemas de Astra es más interesante que un simple ranking.

Los rankings miden respuestas conocidas: el problema y la respuesta estándar están ahí, compitiendo por quién tiene la puntuación más alta.

Pero que dos modelos, en condiciones sin internet y con protección contra filtraciones, lleguen independientemente a la misma conclusión de vanguardia, mide algo completamente diferente: qué tan confiable es este resultado, si puede ser reproducido independientemente.

Esto se parece más a una revisión por pares.

Por ahora, Levent solo ha "hecho una declaración" en X, no ha publicado los PDF de esas 5 demostraciones, los prompts, los registros de ejecución completos, el costo en tokens o los certificados de Lean.

El usuario Haider cuestionó: incluso si es cierto, ¿por qué usar Fable para reproducir lo de Astra, en lugar de usarlo directamente para resolver nuevos problemas abiertos?

De hecho, Fable no solo se aprovecha del éxito de Astra, también resuelve nuevos problemas.

En julio, Levent usó Fable para dar un contraejemplo tridimensional de la conjetura de Jacobian; después, alguien escribió específicamente un material de verificación algebraica de 7 páginas, confirmando que ese mapeo explícito realmente refutaba la conjetura en tres dimensiones y superiores.

Logros que la gran mayoría no entiende, ¿quién los valida?

La importancia real de estos 10 logros es difícil de juzgar para la gran mayoría.

Ethan Mollick lo expresó claramente: para casi todos en la Tierra, esto no solo está fuera de nuestra capacidad, sino fuera de nuestra comprensión. Solo podemos confiar en que los matemáticos profesionales nos digan si es impresionante o no.

Código, imágenes, chat, las personas comunes aún pueden experimentar de primera mano dónde es fuerte la IA.

Pero la existencia de grupos no sofisticados, los contraejemplos de la conjetura de rigidez de Connes, el teorema de repetición paralela cuántica, estos solo los entienden un puñado de expertos.

Cuanto más avanza la capacidad de la IA hacia la frontera científica, menos puede confiar el público en la experiencia personal, y más en una larga cadena de confianza. Este estado de "ni siquiera poder asombrarse" está ocurriendo simultáneamente en cada vez más áreas.

El matemático Thomas Bloom recordó que estos resultados utilizan teorías matemáticas acumuladas durante siglos y sistemas formales construidos a mano por matemáticos, describirlo simplemente como "la IA reemplazó a los matemáticos" no es honesto.

El estándar que dio es: ¿esta demostración nos enseña algo nuevo sobre este problema?

Así que la verdadera pregunta es: cuando la IA pueda producir demostraciones matemáticas de vanguardia de manera barata y en masa, ¿con qué debemos medir realmente sus logros?

La respuesta tal vez no esté en su lado de producción, sino en el de validación: si una demostración puede ser leída, verificada y juzgada en su importancia, eso finalmente determinará su valor real.

La habilidad más escasa está pasando de "hacer demostraciones" a "entender y validar demostraciones".

Cuando la IA puede demostrar diez problemas difíciles de la noche a la mañana, la verdadera prueba acaba de comenzar: las demostraciones se fabrican cada vez más rápido, ¿nuestra verificación podrá seguirles el ritmo?

Referencias:

https://x.com/haider1/status/2083908869915611554

https://x.com/polynoamial/status/2083470822258467194

https://x.com/kimmonismus/status/2083950641978679363 https://x.com/Dr_Singularity/status/2083653287463571742

Este artículo es del WeChat público "新智元" (New Zhi Yuan), autor: ASI启示录

Preguntas relacionadas

Q¿Qué anunció OpenAI que generó gran impacto en la comunidad científica?

AEl investigador de OpenAI, Sébastien Bubeck, anunció que su modelo principal de próxima generación, Astra (aún no lanzado), había demostrado 10 logros matemáticos de vanguardia, proporcionando certificados Lean y revisiones paso a paso de cada problema.

Q¿Cómo reaccionó Anthropic al anuncio de OpenAI?

AEn menos de 24 horas, el investigador de Anthropic, Levent Alpöge, declaró que utilizó su modelo público Fable para completar de forma independiente 5 de los 10 problemas resueltos por Astra, específicamente los números 4, 5, 6, 7 y 8 de la lista.

QSegún el artículo, ¿qué cambia el hecho de que Fable, un modelo público, replique la mitad de los logros de Astra?

ALa ventaja del 'primer lanzamiento' o primicia de OpenAI se redujo a solo 24 horas. Esto acorta drásticamente el 'período de validez' de una primicia matemática, que tradicionalmente se medía en años durante los procesos de revisión y publicación.

Q¿Qué costo marginal estimó OpenAI para encontrar las soluciones a estos 10 problemas?

AOpenAI estimó que el costo marginal de encontrar estas soluciones fue de menos de 2000 dólares, calculado en función de los tokens utilizados y el precio de su API Sol. Sin embargo, esto no incluye costos de entrenamiento del modelo, tiempo humano, formalización en Lean o revisión externa.

QSegún el artículo, ¿hacia dónde se está desplazando la capacidad más escasa en el contexto de las demostraciones matemáticas generadas por IA?

ALa capacidad más escasa está pasando de 'producir demostraciones' a 'comprender y validar demostraciones'. Cuando la IA puede generar rápidamente demostraciones de problemas complejos, el verdadero desafío es si los humanos pueden verificar, entender y evaluar el valor real de esos resultados al mismo ritmo.

Lecturas Relacionadas

Gritando Comprar: ¿Por qué Goldman Sachs sigue siendo optimista sobre Samsung y SK Hynix?

A pesar de las recientes caídas en las acciones de Samsung Electronics y SK Hynix, Goldman Sachs mantiene su recomendación de compra. El informe destaca tres factores clave para un ciclo de memoria potencialmente más estable: la recuperación de la prima de precio del HBM para 2027, la expansión de acuerdos de suministro a largo plazo (LTA) y los bajos niveles de inventario. Se prevé que el precio promedio del HBM alcance unos 2,9 USD/Gb en 2027, recuperando su prima sobre la DRAM convencional, impulsado por una demanda de servidores AI que supera a la oferta y una mayor complejidad de fabricación. Los HBM podrían representar el 18% y 25% de los ingresos por DRAM de Samsung y Hynix para 2028. Los LTA, con duraciones de 3 a 5 años, cláusulas de precios mínimos y pagos por adelantado, cubrirían un 60-70% de la capacidad planificada de Samsung, proporcionando mayor visibilidad y estabilidad frente a la volatilidad cíclica pasada. Los inventarios de los proveedores se mantienen bajos (2-4 semanas), y la sólida demanda de SSD empresariales para AI compensa en parte la debilidad en dispositivos de consumo, reduciendo el riesgo de un exceso de oferta a corto plazo. Aunque persisten riesgos como una demanda AI inferior a lo esperado, Goldman Sachs argumenta que estos factores combinados podrían suavizar el ciclo y respaldar la valoración de las acciones.

marsbitHace 44 min(s)

Gritando Comprar: ¿Por qué Goldman Sachs sigue siendo optimista sobre Samsung y SK Hynix?

marsbitHace 44 min(s)

La plataforma coreana de precios de criptomonedas Kimpga integra la plataforma de datos global Web3 RootData, proporcionando puntuaciones de popularidad y crecimiento para proyectos de tokens

La plataforma coreana de información sobre criptomonedas Kimpga ha anunciado una colaboración de datos con RootData, una plataforma global de datos para proyectos Web3. Como resultado de esta integración, Kimpga incorporará el "RD Score" (Puntuación RD) en sus listados de mercados. Los usuarios podrán hacer clic en esta puntuación para acceder a una ventana con información detallada del proyecto, que incluye: * **RD Popularity Index** (Índice de Popularidad RD): Una métrica que cuantifica la atención del mercado hacia el proyecto. * **RD Growth Index** (Índice de Crecimiento RD): Un indicador que muestra las tendencias de desarrollo y crecimiento del proyecto. * **Datos fundamentales del proyecto**: Principales inversores, composición del equipo central y etiquetas de categorización del proyecto. Esta integración permite a los inversores acceder a información fundamental sobre los proyectos, como los equipos y respaldo financiero, directamente desde la interfaz de precios, sin necesidad de cambiar de plataforma. Jin Jae-yong, representante de Kimpga, destacó que esto ayuda a los usuarios a evaluar la solidez fundamental de un proyecto de manera más eficiente. Kimpga, con 10 millones de usuarios acumulados, es una de las principales plataformas de información del mercado coreano. Esta colaboración sigue a una anterior con APYWA para incorporar calificaciones de tokens, completando así la capa de información fundamental para apoyar las decisiones de inversión de los usuarios.

marsbitHace 46 min(s)

La plataforma coreana de precios de criptomonedas Kimpga integra la plataforma de datos global Web3 RootData, proporcionando puntuaciones de popularidad y crecimiento para proyectos de tokens

marsbitHace 46 min(s)

Fue el héroe de las dos grandes industrias de Shanghai, pero falleció en silencio con pesar

"Fue un héroe detrás de escena de dos industrias clave de Shanghái, pero falleció en silencio con pesar. Jiang Shangzhou, ex subdirector de la Comisión Económica de Shanghái, desempeñó un papel fundamental en el desarrollo de la industria de circuitos integrados y la aviación comercial en China. A pesar de sufrir cáncer de pulmón, impulsó ambiciosos planes: durante el período del X Plan Quinquenal, abogó por construir diez líneas de producción de obleas de 8 pulgadas en Shanghái, superando con creces las expectativas nacionales. Atrajo talentos como Zhang Rujing para fundar SMIC y Yin Zhiyao para establecer AMEC, sentando las bases para que Shanghái se convirtiera en el líder nacional en semiconductores. Paralelamente, como jefe del grupo de demostración de proyectos nacionales importantes, defendió durante tres años la inclusión del 'avión comercial grande' en el plan de desarrollo científico y tecnológico, allanando el camino para el proyecto C919. Aunque su visión a menudo se consideraba 'demasiado adelantada a su tiempo' y enfrentó desafíos en su carrera, su legado perdura. Hoy, Shanghái es el centro de la industria de chips de China, y el C919 es un símbolo de la fabricación avanzada del país. Jiang Shangzhou falleció en 2011 sin ver realizados sus sueños, pero su perspicacia estratégica y su espíritu práctico dejaron un impacto duradero en el futuro industrial de China."

marsbitHace 58 min(s)

Fue el héroe de las dos grandes industrias de Shanghai, pero falleció en silencio con pesar

marsbitHace 58 min(s)

El cambio del centro de ingresos de AMD hacia el centro de datos en 12 trimestres

Un informe de resultados del segundo trimestre mostró dos trayectorias opuestas en los ingresos de AMD. El negocio de centros de datos alcanzó 6,718 millones de dólares, un aumento interanual del 107%. Mientras tanto, la división de juegos obtuvo 779 millones, una caída del 31%. Esto plantea la pregunta: ¿está AMD trasladando recursos de los juegos a los centros de datos? Los datos de los últimos 12 trimestres ofrecen más detalles. En primer lugar, el crecimiento total de ingresos de AMD (de 7,685 a 11,536 millones en el trimestre) demuestra que la expansión es real y no un simple intercambio interno. Los centros de datos aportaron aproximadamente el 90% del aumento neto, mientras que la contracción en juegos fue menor en comparación. En segundo lugar, la proporción de ingresos de los centros de datos dentro de AMD ha cambiado estructuralmente, pasando del 27.6% al 58.2% del total en 12 trimestres. Cruzó la línea del 50% en el cuarto trimestre de 2025, convirtiéndose permanentemente en la división más grande. Este gráfico muestra un cambio en la estructura de ingresos, no necesariamente en la asignación interna de recursos como I+D o capacidad. Finalmente, al compararse con sus pares, la trayectoria de crecimiento de AMD en centros de datos es pronunciada (llegando a un índice de 155 en los últimos cuatro trimestres reportados), pero partiendo de una base mucho menor. Sus ingresos trimestrales (6,718 millones) son cercanos a los de Intel DCAI (6,262 millones), pero muy por debajo de los aproximadamente 75,200 millones de Nvidia. Las definiciones y períodos fiscales entre empresas no son idénticos, por lo que la comparación directa tiene limitaciones. En resumen, los datos confirman que los centros de datos son ahora el pilar principal de ingresos para AMD. La contracción en juegos ocurrió en el mismo período, pero las cifras públicas no son suficientes para probar una simple reasignación interna de recursos entre divisiones.

marsbitHace 1 hora(s)

El cambio del centro de ingresos de AMD hacia el centro de datos en 12 trimestres

marsbitHace 1 hora(s)

Trading

Spot
活动图片