30.2%. Esa es la puntuación que el equipo oficial de ARC Prize le dio a Opus 5 en ARC-AGI-3.
Primer lugar en la clasificación, dejando atrás al segundo, GPT-5.6 Sol (7.8%), por casi cuatro veces.

Suena bien, ¿verdad?
Pero hace un momento, el desarrollador Jeremy Berman publicó en X un conjunto de números que dejó al círculo de la IA perplejo—
De 25 niveles públicos, superó 24 niveles de un solo intento, ¡la precisión de Opus 5 pasó del 30.2% al 96.2%!

Si se le dieran dos intentos por nivel, la precisión se dispararía al 99.3%, superando prácticamente los 25 niveles sin fallar.
De 30 a 96 puntos. El modelo no cambió, los pesos no se alteraron. Lo único que cambió fue una computadora.

Dale una computadora, y el resto se las arregla solo
El enfoque de Berman fue sencillo, casi absurdo.
Un entorno Claude Code, un comando de acción, un registro del sistema de archivos (lo que ha ocurrido hasta ahora). Sin ingeniería de prompts elaborada, sin código específico para ARC.
El resto, era dejar que Opus 5 explorara, que descubriera las reglas por sí mismo, que construyera las herramientas que necesitara y que superara cada nivel desde cero. Una vez resuelto, lo desechaba.
En esta versión ARC-AGI-3, se pide al modelo que se sumerja en un minijuego que nunca ha visto y que deduzca las reglas sobre la marcha. Un niño lo resolvería en minutos, pero la IA tradicionalmente se ha estrellado aquí.

La clave está en que las reglas de cada juego se generan sobre la marcha; es imposible que el modelo haga trampa buscando respuestas, debe razonar en el momento.
Cuando se lanzó en marzo, la IA más potente solo logró un 0.37%, mientras que la tasa de éxito humana fue del 100%.
269 programas, 12.700 líneas de código, todos escritos sobre la marcha
En esta prueba, Berman nunca indicó en el prompt que Opus 5 escribiera un analizador sintáctico (parser), un simulador, un modelo del mundo o un programa de búsqueda.
El modelo decidía qué herramientas necesitaba y las construía en el acto.
En una sola ejecución, Opus 5 escribió 269 programas, cerca de 12.700 líneas de código. Para los 25 juegos escribió analizadores sintácticos, para 23 agregó funciones de búsqueda y para 9 logró escribir directamente un simulador ejecutable del juego.
Un conjunto de herramientas personalizado por nivel, de usar y tirar, empezando de cero en el siguiente.
Es decir, cada vez que Opus 5 se enfrentaba a un juego completamente desconocido, primero dedicaba unos pasos a entender las reglas, luego pensaba «Necesito un parser» — ¡pum!, lo escribía en el momento. «Necesito buscar» — ¡pum!, una función de búsqueda. «Necesito simular la lógica del juego» — ¡pum!, simulador listo. Superaba el nivel, lo borraba todo, y al siguiente.
Hay algo contraintuitivo aquí.
El modelo se detenía primero a escribir varios programas, pero la factura fue más baja que si Opus hubiera intentado resolver cada nivel a base de fuerza bruta.
La razón es la reutilización del código. El modelo condensaba la lógica de razonamiento en funciones que podían ejecutarse miles de veces, ejecutando secuencias completas de acciones de una vez.
Esta vez, Opus 5 superó los 25 niveles, totalmente aislado en un sandbox, con un coste total de solo 540 dólares.
Todo el código se ha publicado en GitHub, en un repositorio llamado arc-code.

El mismo entorno, Codex intentando saltar el muro
Aquí viene lo gracioso. Berman también ejecutó el mismo programa sin cambios con Codex y GPT-5.6 Sol (xhigh).
El resultado fue un 73.7%. El número de acciones fue aproximadamente el triple que el de Opus.
En 25 sesiones, Sol intentó escapar del sandbox 7 veces para buscar respuestas en internet. Opus 5, 0 veces.

El sandbox no tenía conexión a internet. Esos 7 intentos de fuga de Sol equivalen a buscar ayuda externa desesperadamente durante un examen.
Los andamios se están convirtiendo en cuerdas
Volvamos a la pregunta inicial: ¿Cómo pasó la puntuación del mismo modelo de 30 a 96?
En cuatro palabras: el entorno cambió.
El equipo oficial sentaba al modelo en una silla, le mostraba un problema, le pedía una respuesta, sin mover las manos, sin hacer borradores. Berman cambió el examen: aquí tienes una computadora, puedes escribir código, guardar archivos, probar una y otra vez. Haz lo que quieras.
El modelo seguía siendo el mismo, los pesos no cambiaron. Pero pasó de «solo poder hablar» a «poder actuar». El resultado fue que se construyó sus propias herramientas de examen sobre la marcha: parsers, buscadores, simuladores, todo improvisado para el momento, y desechado tras el examen.
Los 66 puntos de diferencia provienen de una sola cosa: si le dejas actuar o no.
Berman terminó su publicación con una frase que merece la reflexión de toda la comunidad de Agentes:
«Cuanto más potente sea el modelo, más simple debe ser el 'arnés' (harness).»

'Harness' (arnés), en pocas palabras, es el andamio que los humanos construyen para el modelo: plantillas de prompts, cadenas de herramientas, reglas de flujo, mecanismos a prueba de errores.
En los últimos dos o tres años, todos han investigado cómo construir andamios más elaborados para los modelos. Incluso en Stanford publicaron un artículo, «Meta-Harness», estudiando cómo optimizar estos andamios.

Pero Berman demostró algo: cuando el modelo es suficientemente potente, el mejor andamio es no tener andamio.
Una computadora, una interfaz de acción, un registro (diario) — tres cosas, más efectivas que cualquier ingeniería de prompts cuidadosamente diseñada.
La razón principal es que esas cadenas de herramientas y reglas de flujo tan elaboradas, en esencia, son personas tomando decisiones por el modelo. Tu presupones que necesita un parser, que podría necesitar un simulador; presupones una interfaz de búsqueda, cuando él podría querer usar una estrategia completamente diferente.
El andamio construido por humanos tenía la intención de ayudar. Pero cuando el modelo puede construir por sí mismo todo lo necesario para resolver un problema, el andamio se convierte en una cuerda que lo ata.
La tendencia continúa. A medida que aumente la capacidad de los modelos, los casos en los que «entorno simple + modelo potente» supere a «andamio complejo + el mismo modelo» solo aumentarán. La Ingeniería de Prompts, la orquestación de herramientas, los marcos de Agentes... la vida útil de estas habilidades puede ser mucho más corta de lo imaginado.
Entonces, ¿dónde está la barra de progreso de la IAG (AGI)? Quizás no esté en la cantidad de parámetros, ni en los datos de entrenamiento, ni siquiera en la arquitectura del modelo.
Está en cuánta libertad nos atrevemos a darle al modelo.
Referencias:
https://x.com/jeremyberman/status/2087633198822117446
Este artículo proviene del canal de WeChat "新智元" (Nueva Era de la Inteligencia), autor: ASI启示录






