Como persona común, si le das un problema matemático difícil a una IA y le pides que 'continúe' indefinidamente, ¿sería posible que realmente lo resolviera, ayudándote así a ganar una gran recompensa e incluso a cambiar el curso de las matemáticas?
Recientemente, con la entrega de la Medalla Fields, las discusiones sobre matemáticas + IA son muy intensas. Seguro que muchos también han imaginado el 'drama satisfactorio' que acabo de describir.
En realidad, también hay personas intentándolo en la vida real, pero el proceso no ha sido tan fluido como uno imaginaría.
Recientemente, el destacado experto en computación reversible y física computacional Michael P. Frank publicó un mensaje diciendo que le asignó un objetivo de investigación de alta dificultad a GPT-5.6 Sol: investigar si existe una ruta más simple que la demostración de Wiles-Taylor para el último teorema de Fermat, centrándose en la modularidad específica de las curvas de Frey, el método de descenso infinito uniforme, desigualdades aritméticas tipo abc y cocientes de bajo género uniformes; manteniendo notas rigurosas, verificando lemas candidatos mediante cálculos, y diferenciando claramente resultados demostrados de conjeturas.

Esta tarea se ejecutó en segundo plano durante aproximadamente 33 horas, consumiendo una gran cantidad de recursos computacionales. Pero finalmente, fue detenida forzosamente por el sistema de OpenAI.
GPT-5.6 Sol escribió en su propio análisis posterior que las posibles razones eran dos: primero, que el sistema determinó que esa sesión estaba consumiendo demasiados recursos; segundo, que OpenAI ya había intentado este problema con un modelo similar antes y fracasó, por lo que esta vez no quiso desperdiciar más potencia de cálculo.

Michael P. Frank pareció estar de acuerdo con este análisis de GPT-5.6 Sol.

Además, GPT-5.6 Sol informó con franqueza sobre lo que hizo durante esas 33 horas. Lo esencial fue: realizó mucho trabajo sólido, convirtiendo muchos atajos que 'sonaban factibles' en afirmaciones precisas y verificables, para luego refutarlas o descartarlas una por una. El resultado fue un mapa de 'callejones sin salida', no la demostración en sí. Sugirió detenerse ahí.
Sobre este proceder de OpenAI, algunos ofrecieron otra interpretación posible: OpenAI podría estar ocultando algo, evitando que el modelo resuelva problemas matemáticos extremadamente difíciles a la ligera, por temor a que otros se lleven el mérito, o para poder alardear ellos mismos. Esto sirve como advertencia: si en el futuro dependemos demasiado de ellos, esencialmente les entregaremos todo el poder sobre 'qué puede ser descubierto' a una sola empresa, lo cual es peligroso.


Pero rápidamente, Noam Brown, científico investigador senior de OpenAI, salió a señalar la falta de fundamento de esta afirmación, diciendo: «Si alguien simplemente escribe 'continue' (continuar) y usa nuestro modelo para resolver un problema del Premio del Milenio, ganando luego un millón de dólares, eso sería la mejor publicidad posible para OpenAI, no hay nada mejor que eso.»

Suena razonable, pero los que refutan este punto creen que ofrecer capacidades punteras a los usuarios podría traer beneficios publicitarios a corto plazo, pero a largo plazo debilitaría la ventaja competitiva de OpenAI en la carrera de la IA. En un entorno de competencia multiparticipante, mantener en secreto / dar prioridad interna al uso de modelos potentes para acelerar su propia investigación es más importante que permitir que los usuarios 'resuelvan primero' grandes problemas. Y una vez que la capacidad se vuelva 'accesible para todos', su valor publicitario disminuiría drásticamente.
Además, los recientes problemas regulatorios también dan a OpenAI motivos para reservar capacidades. Si un usuario resolviera un problema matemático de alta dificultad con la versión pública, estaría demostrando públicamente que 'este modelo en realidad es muy potente', lo que atraería problemas regulatorios. En este contexto, ofrecer deliberadamente una versión debilitada al exterior, mientras se mantiene internamente una versión súper potente, suena una práctica razonable.

Sin embargo, otros señalaron otra posibilidad desde un punto de vista técnico: en codex-cli, 'goal blocked' significa que el modelo se topó repetidamente con el mismo punto límite / bloqueo (blocker) en 3 turnos de razonamiento consecutivos. Por lo tanto, la interrupción de la tarea podría ser un mecanismo de seguridad rutinario / anti-bloqueo durante la ejecución del modelo, y no un bloqueo especial dirigido al problema difícil.

También hubo quien dijo que podría deberse simplemente a un error (bug). Específicamente, la versión 5.6 de Sol tiene un molesto bug al ejecutar tareas durante mucho tiempo. La solución temporal es: cambiar a la versión 5.5, comprimir un poco el contexto, ejecutar unos minutos con la 5.5, y luego volver a cambiar a la versión 5.6 de Sol. «Si quieres mantener la misma sesión, te quedarás atascado sin poder salir.»

¿Qué opinas? Te invitamos a compartir en los comentarios tus experiencias usando IA para abordar problemas difíciles o quedando atascado por ella.
Enlaces de referencia:
https://x.com/lu_sichu/status/2081367506468360495
Este artículo proviene de la cuenta de WeChat "机器之心" (ID:almosthuman2014), autor: Zhang Qian







