Justo ahora, Claude Fable 5, vuelve a quedar primero
Claude Fable 5 ha vuelto a encabezar la clasificación de MirrorCode, un exigente punto de referencia de programación de IA, con una tasa de éxito del 64%. Su rendimiento supera con creces el de otros modelos líderes como GPT-5.6 Sol (21%) y es notablemente consistente incluso con lenguajes de programación poco comunes como Ada, donde logra un 61%. Esto sugiere que el modelo ha superado la mera memorización de código y es capaz de comprender y reconstruir la lógica funcional de un programa desde cero.
La prueba MirrorCode es extremadamente rigurosa: los modelos deben recrear programas completos en entornos aislados, sin acceso a Internet o dependencias, basándose únicamente en documentación de alto nivel y pruebas parciales. Para aprobar, se requiere una coincidencia del 100% en todos los casos de prueba, visibles y ocultos, con un presupuesto de hasta 100 mil millones de tokens y plazos de hasta 19 días de ejecución continua.
Este avance señala un cambio hacia la delegación de proyectos completos a la IA. Empresas como Anthropic y OpenAI ya han demostrado que los modelos pueden colaborar en tareas a gran escala, como escribir un compilador de C o contribuir a proyectos de cientos de miles de líneas de código. El futuro parece dirigirse a un panorama donde la IA maneje la construcción sustancial de software, mientras que el rol humano se centra en definir problemas con claridad y validar los resultados clave.
marsbitAyer 08:34