¡Esta vez Claude ha dejado la tabla de clasificación de programación de IA en un abismo!
En la clasificación de MirrorCode actualizada hace un momento, Claude Fable 5 volvió a encabezarla con una tasa de éxito absoluta del 64%.
¡GPT-5.6 Sol, que lo sigue de cerca, solo tiene un tercio de su puntuación!
GPT-5.5, que ocupa el cuarto lugar, está aún peor. No solo tiene un resultado del 10%, sino que incluso es frotado contra el suelo por su predecesor GPT-5.4.

Lo que es aún más sorprendente es que al usar lenguajes de alto recurso como Go, la tasa de resolución de Fable 5 es del 64%; al cambiarlo al lenguaje menos común Ada, el resultado sigue siendo tan alto como el 61%.
Hay que saber que, en el mundo del código abierto, el corpus de Python es aproximadamente 230 veces mayor que el de Ada.
Pero aquí, con Fable 5, el resultado solo bajó 3 puntos porcentuales.

Esto es interesante.
Si el modelo dependiera principalmente de memorizar la sintaxis y las formas comunes de escritura de los lenguajes populares, al cambiar a Ada, el resultado debería haber bajado.
Pero el resultado actual apunta a otra posibilidad:
El modelo más fuerte ya se ha liberado de la influencia del corpus específico y ha comenzado a aprender a construir un proyecto de software completo desde cero.
Atascado en la línea del 100% de aprobación, prueba límite de 100 mil millones de tokens
En concreto, MirrorCode completo contiene 25 programas objetivo, que cubren herramientas Unix, intérpretes, consultas de datos, bioinformática, criptografía y herramientas de compresión, entre otros campos.
Aquí, el modelo se coloca en un entorno aislado, sin internet, sin poder ver el código fuente del proyecto original, y sin poder descargar dependencias de terceros. Lo único que obtiene es documentación de alto nivel, una parte de las pruebas visibles y un programa original que puede invocar repetidamente.
A continuación, tiene que introducir constantemente datos en el programa original, observar la salida para adivinar la lógica interna, y luego poco a poco escribir un nuevo programa con el mismo comportamiento.
La última clasificación selecciona 15 objetivos Medium y Large de ella. Cada objetivo usa dos lenguajes de implementación, y cada lenguaje se ejecuta tres veces.
Además, la tasa de finalización de las pruebas visibles y las ocultas debe alcanzar el 100% para aprobar; ni el 99.9% vale.
Si se omite un solo caso límite, toda la ejecución sigue contándose como un fallo.

Para forzar al modelo a cubrir también los últimos huecos, MirrorCode aumentó el presupuesto por ejecución a 100 mil millones de tokens, permitiendo un tiempo de ejecución continuo de hasta 7 días.
La tarea de mayor costo en el artículo es aún más exagerada: el modelo se ejecutó continuamente durante 19 días, con un costo único de 2600 dólares.
Durante estos 19 días, el modelo ejecuta repetidamente el programa original, compara resultados, complementa funciones y vuelve a ejecutar las pruebas. Si hay un error, investiga la causa; si la salida no coincide, cambia la hipótesis; si una parte pasa, va tras el siguiente hueco.
Todo el proceso se asemeja más a una depuración que dura varios días, no a una sola generación.

El ejemplo de gotree es el más visual.
Esta herramienta de bioinformática originalmente tenía unas 16,000 líneas de código Go y más de 40 comandos.
Claude Opus 4.7 tardó 14 horas y 251 dólares, aprobó 2000 de las 2001 pruebas, con una tasa de finalización del 99.95%.
Aunque omitió un caso límite poco común sobre el manejo de comentarios de fecha, siendo detenido por la línea del 100% de MirrorCode, ya había comprimido el trabajo que originalmente se calculaba en semanas a unas pocas horas:
Epoch estima que, sin usar IA, un ingeniero humano necesitaría al menos de 2 a 17 semanas para completar la misma tarea.
En el desierto del corpus, Fable 5 solo perdió 3 puntos
El artículo de MirrorCode usó como referencia la mezcla de entrenamiento público de StarCoder.
En ella, Python representa aproximadamente el 8%, y Ada solo el 0.034%, siendo el primero unas 230 veces mayor que el segundo.

Por supuesto, no podemos saber cuánto código Ada han visto realmente los modelos cerrados. Pero tomando el ecosistema público como referencia, ya es suficientemente claro lo escaso que es Ada.
Este lenguaje aparece principalmente en sistemas aeroespaciales, de defensa y otros sistemas críticos para la seguridad. Tanto el tamaño de la comunidad, el número de tutoriales como los proyectos de código abierto, están lejos de poder compararse con Python, JavaScript o Go.
Y Fable 5 claramente no está traduciendo línea por línea el código Go a Ada.
Es más como si primero entendiera exactamente cómo funciona el programa original, y luego cambiara de lenguaje para recrear el mismo comportamiento.

En comparación, otros modelos no son tan estables.
GPT-5.6 Sol bajó del 24% al 19%, GPT-5.4 del 21% al 12%, y GPT-5.5 incluso del 17% al 5%. Al cambiar de lenguaje, la brecha se amplía inmediatamente.
Entregar todo el proyecto a la IA
Hoy en día, Cursor ya ha permitido que cientos de Agent colaboren durante casi una semana, escribiendo desde cero más de 1 millón de líneas de código de navegador distribuido en 1000 archivos.
Anthropic ha hecho que 16 Agent Claude se ejecuten en paralelo en casi 2000 sesiones, finalmente construyendo un compilador C de 100,000 líneas capaz de compilar el kernel de Linux 6.9.
En la muestra de usuarios individuales de Codex de OpenAI hasta mayo, el 70.2% había enviado al menos una tarea estimada en más de una hora de trabajo humano; el 25.6% había enviado tareas de más de ocho horas.
La unidad que la gente está entregando a la IA está pasando de ser un fragmento de código, un error, a una tarde, una semana, o incluso todo un proyecto.
El 64% de MirrorCode es precisamente una cuantificación de este "encargo a nivel de proyecto".
Indica que, siempre que el objetivo sea lo suficientemente claro y los resultados se puedan aceptar automáticamente, los modelos de vanguardia ya pueden completar de forma independiente una parte del software de mediano y gran tamaño.
Para cada persona que está entregando trabajo a la IA, el cambio ya está cerca:
Antes necesitabas vigilar cada línea de código que escribía; a continuación, es más probable que solo revises en los nodos clave si se ha desviado.
El código será cada vez más barato.
Y aquellos que puedan explicar claramente los problemas y verificar los resultados, serán cada vez más valiosos.
Referencias: https://epoch.ai/MirrorCode
Este artículo proviene del cuenta pública de WeChat "新智元" (Nueva Era de la Inteligencia), autor: Revelación ASI; editor: Moisés






