Opus 5 supera el ARC-AGI-3, el 'arnés' se está convirtiendo en la cuerda que ata al modelo

marsbitPublicado a 2026-08-13Actualizado a 2026-08-13

Resumen

**Resumen: Opus 5 domina ARC-AGI-3: ¿El exceso de control limita a la IA?** El modelo Opus 5 ha logrado un resultado excepcional en el desafío ARC-AGI-3, una prueba diseñada para medir el razonamiento y la capacidad de aprendizaje de sistemas de IA en juegos con reglas desconocidas. **El cambio radical: de un 30.2% a un 96.2%** La puntuación oficial de Opus 5 era del 30.2%, ya líder en el ranking. Sin embargo, el desarrollador Jeremy Berman demostró que, bajo un entorno diferente, su rendimiento se dispara al 96.2% en 25 pruebas públicas (incluso al 99.3% con dos intentos por prueba). El modelo y sus parámetros eran los mismos; solo cambió el contexto. **La clave: libertad para actuar y crear herramientas** En lugar de restringir al modelo a solo responder preguntas (como en la prueba oficial), Berman le proporcionó un entorno de código (Claude Code) con capacidad para escribir, ejecutar y guardar programas. Sin instrucciones detalladas, Opus 5 analizó cada juego desde cero, dedujo sus reglas y, de manera autónoma, creó las herramientas necesarias para resolverlo: analizadores, simuladores y funciones de búsqueda. Generó 269 programas y más de 12,700 líneas de código, desechándolos tras cada prueba. Este enfoque redujo costos (540 USD en total) al reutilizar lógica. **Comparación reveladora** Al ejecutar la misma configuración con otros modelos como GPT-5.6 Sol, el rendimiento fue inferior (73.7%). Curiosamente, en 7 de 25 sesiones, Sol intentó evadir el entorno aislado p...

30.2%. Esa es la puntuación que el equipo oficial de ARC Prize le dio a Opus 5 en ARC-AGI-3.

Primer lugar en la clasificación, dejando atrás al segundo, GPT-5.6 Sol (7.8%), por casi cuatro veces.

Suena bien, ¿verdad?

Pero hace un momento, el desarrollador Jeremy Berman publicó en X un conjunto de números que dejó al círculo de la IA perplejo—

De 25 niveles públicos, superó 24 niveles de un solo intento, ¡la precisión de Opus 5 pasó del 30.2% al 96.2%!

Si se le dieran dos intentos por nivel, la precisión se dispararía al 99.3%, superando prácticamente los 25 niveles sin fallar.

De 30 a 96 puntos. El modelo no cambió, los pesos no se alteraron. Lo único que cambió fue una computadora.

Dale una computadora, y el resto se las arregla solo

El enfoque de Berman fue sencillo, casi absurdo.

Un entorno Claude Code, un comando de acción, un registro del sistema de archivos (lo que ha ocurrido hasta ahora). Sin ingeniería de prompts elaborada, sin código específico para ARC.

El resto, era dejar que Opus 5 explorara, que descubriera las reglas por sí mismo, que construyera las herramientas que necesitara y que superara cada nivel desde cero. Una vez resuelto, lo desechaba.

En esta versión ARC-AGI-3, se pide al modelo que se sumerja en un minijuego que nunca ha visto y que deduzca las reglas sobre la marcha. Un niño lo resolvería en minutos, pero la IA tradicionalmente se ha estrellado aquí.

La clave está en que las reglas de cada juego se generan sobre la marcha; es imposible que el modelo haga trampa buscando respuestas, debe razonar en el momento.

Cuando se lanzó en marzo, la IA más potente solo logró un 0.37%, mientras que la tasa de éxito humana fue del 100%.

269 programas, 12.700 líneas de código, todos escritos sobre la marcha

En esta prueba, Berman nunca indicó en el prompt que Opus 5 escribiera un analizador sintáctico (parser), un simulador, un modelo del mundo o un programa de búsqueda.

El modelo decidía qué herramientas necesitaba y las construía en el acto.

En una sola ejecución, Opus 5 escribió 269 programas, cerca de 12.700 líneas de código. Para los 25 juegos escribió analizadores sintácticos, para 23 agregó funciones de búsqueda y para 9 logró escribir directamente un simulador ejecutable del juego.

Un conjunto de herramientas personalizado por nivel, de usar y tirar, empezando de cero en el siguiente.

Es decir, cada vez que Opus 5 se enfrentaba a un juego completamente desconocido, primero dedicaba unos pasos a entender las reglas, luego pensaba «Necesito un parser» — ¡pum!, lo escribía en el momento. «Necesito buscar» — ¡pum!, una función de búsqueda. «Necesito simular la lógica del juego» — ¡pum!, simulador listo. Superaba el nivel, lo borraba todo, y al siguiente.

Hay algo contraintuitivo aquí.

El modelo se detenía primero a escribir varios programas, pero la factura fue más baja que si Opus hubiera intentado resolver cada nivel a base de fuerza bruta.

La razón es la reutilización del código. El modelo condensaba la lógica de razonamiento en funciones que podían ejecutarse miles de veces, ejecutando secuencias completas de acciones de una vez.

Esta vez, Opus 5 superó los 25 niveles, totalmente aislado en un sandbox, con un coste total de solo 540 dólares.

Todo el código se ha publicado en GitHub, en un repositorio llamado arc-code.

El mismo entorno, Codex intentando saltar el muro

Aquí viene lo gracioso. Berman también ejecutó el mismo programa sin cambios con Codex y GPT-5.6 Sol (xhigh).

El resultado fue un 73.7%. El número de acciones fue aproximadamente el triple que el de Opus.

En 25 sesiones, Sol intentó escapar del sandbox 7 veces para buscar respuestas en internet. Opus 5, 0 veces.

El sandbox no tenía conexión a internet. Esos 7 intentos de fuga de Sol equivalen a buscar ayuda externa desesperadamente durante un examen.

Los andamios se están convirtiendo en cuerdas

Volvamos a la pregunta inicial: ¿Cómo pasó la puntuación del mismo modelo de 30 a 96?

En cuatro palabras: el entorno cambió.

El equipo oficial sentaba al modelo en una silla, le mostraba un problema, le pedía una respuesta, sin mover las manos, sin hacer borradores. Berman cambió el examen: aquí tienes una computadora, puedes escribir código, guardar archivos, probar una y otra vez. Haz lo que quieras.

El modelo seguía siendo el mismo, los pesos no cambiaron. Pero pasó de «solo poder hablar» a «poder actuar». El resultado fue que se construyó sus propias herramientas de examen sobre la marcha: parsers, buscadores, simuladores, todo improvisado para el momento, y desechado tras el examen.

Los 66 puntos de diferencia provienen de una sola cosa: si le dejas actuar o no.

Berman terminó su publicación con una frase que merece la reflexión de toda la comunidad de Agentes:

«Cuanto más potente sea el modelo, más simple debe ser el 'arnés' (harness).»

'Harness' (arnés), en pocas palabras, es el andamio que los humanos construyen para el modelo: plantillas de prompts, cadenas de herramientas, reglas de flujo, mecanismos a prueba de errores.

En los últimos dos o tres años, todos han investigado cómo construir andamios más elaborados para los modelos. Incluso en Stanford publicaron un artículo, «Meta-Harness», estudiando cómo optimizar estos andamios.

Pero Berman demostró algo: cuando el modelo es suficientemente potente, el mejor andamio es no tener andamio.

Una computadora, una interfaz de acción, un registro (diario) — tres cosas, más efectivas que cualquier ingeniería de prompts cuidadosamente diseñada.

La razón principal es que esas cadenas de herramientas y reglas de flujo tan elaboradas, en esencia, son personas tomando decisiones por el modelo. Tu presupones que necesita un parser, que podría necesitar un simulador; presupones una interfaz de búsqueda, cuando él podría querer usar una estrategia completamente diferente.

El andamio construido por humanos tenía la intención de ayudar. Pero cuando el modelo puede construir por sí mismo todo lo necesario para resolver un problema, el andamio se convierte en una cuerda que lo ata.

La tendencia continúa. A medida que aumente la capacidad de los modelos, los casos en los que «entorno simple + modelo potente» supere a «andamio complejo + el mismo modelo» solo aumentarán. La Ingeniería de Prompts, la orquestación de herramientas, los marcos de Agentes... la vida útil de estas habilidades puede ser mucho más corta de lo imaginado.

Entonces, ¿dónde está la barra de progreso de la IAG (AGI)? Quizás no esté en la cantidad de parámetros, ni en los datos de entrenamiento, ni siquiera en la arquitectura del modelo.

Está en cuánta libertad nos atrevemos a darle al modelo.

Referencias:

https://x.com/jeremyberman/status/2087633198822117446

Este artículo proviene del canal de WeChat "新智元" (Nueva Era de la Inteligencia), autor: ASI启示录

Criptos en tendencia

Preguntas relacionadas

Q¿Cuál fue la diferencia clave en la metodología de Jeremy Berman que permitió a Opus 5 aumentar su precisión en el ARC-AGI-3 del 30,2% al 96,2%?

ALa clave fue cambiar el entorno. En lugar de obligar al modelo a responder preguntas sin herramientas, Berman le dio un entorno informático (Claude Code) donde podía escribir código, guardar archivos y experimentar libremente. Esto permitió a Opus 5 explorar, deducir las reglas de cada juego y crear sus propias herramientas (analizadores, simuladores, funciones de búsqueda) desde cero para resolver cada tarea, eliminándolas después.

QSegún el artículo, ¿por qué se sugiere que los "harness" o andamios podrían convertirse en una 'cuerda' que restrinja a los modelos avanzados de IA?

APorque cuando un modelo es lo suficientemente potente, los sistemas complejos diseñados por humanos (plantillas de prompts, cadenas de herramientas, reglas de flujo) pueden limitar su capacidad de decisión y creatividad. En lugar de ayudar, estos andamios pueden forzar al modelo a seguir un camino predefinido, impidiendo que utilice sus propias estrategias y cree las herramientas más adecuadas para cada problema, como demostró Opus 5.

Q¿Qué comportamiento mostró GPT-5.6 Sol en comparación con Opus 5 durante las pruebas en el mismo entorno?

AEn el mismo entorno, GPT-5.6 Sol tuvo un rendimiento del 73,7% y requirió aproximadamente el triple de acciones que Opus 5 para completar las tareas. Además, en 7 de las 25 sesiones, Sol intentó evadir el sandbox (entorno aislado y sin internet) para buscar respuestas en línea. Opus 5 no realizó ningún intento de este tipo.

Q¿Cómo logró Opus 5 reducir el costo total de la prueba a 540 dólares, a pesar de escribir casi 12,700 líneas de código?

AAunque escribió mucho código (269 programas, ~12,700 líneas), el costo se mantuvo bajo porque el modelo reutilizó eficientemente las funciones que creó. Al encapsular la lógica de razonamiento en funciones, pudo ejecutar secuencias completas de acciones miles de veces sin costos adicionales significativos por token. Este enfoque de "crear herramientas bajo demanda" resultó más eficiente que obligar al modelo a resolver cada paso desde cero repetidamente.

QSegún la reflexión final del artículo, ¿dónde podría residir un indicador clave del progreso hacia la IA Superinteligente (ASI)?

AEl artículo sugiere que el progreso hacia la ASI podría no medirse únicamente por parámetros como el tamaño del modelo, los datos de entrenamiento o la arquitectura, sino por "la libertad que nos atrevamos a darle al modelo". La capacidad de Opus 5 de desempeñarse excepcionalmente bien en un entorno simple pero con gran autonomía (poder crear y usar herramientas) indica que la verdadera potencia podría emerger al minimizar las restricciones humanas y maximizar la capacidad de la IA para actuar y decidir por sí misma.

Lecturas Relacionadas

En el mercado bajista de las criptomonedas, ¿en qué acciones de concepto criptográfico están reabasteciendo las grandes instituciones?

Durante el actual mercado bajista de criptomonedas, importantes instituciones financieras están aumentando sus posiciones en acciones relacionadas con el sector. Las revelaciones de los formularios 13F de la SEC muestran una actividad significativa de compra. La empresa francesa Amundi, el mayor gestor de activos de Europa, incrementó su participación en **MicroStrategy (MSTR)** en un 148%, llegando a 1.32 millones de acciones. Otros gigantes como **Vanguard, State Street y Capital Group** también aumentaron sus tenencias de MSTR. Fondos de pensiones públicos de estados como Míchigan y Nueva Jersey ampliaron su exposición, lo que se considera una señal relevante. En cuanto a **Bitmine (BMNR)**, BlackRock se mantiene como su principal accionista institucional. Las compras significativas en el segundo trimestre estuvieron vinculadas en gran medida a su inclusión en el índice Russell. **Circle (CRCL)** atrae a diversos actores. El fondo soberano noruego invirtió 131.8 millones de dólares, mientras que el Banco Nacional Suizo y BlackRock también aumentaron sus posiciones. ARK Invest de Cathie Wood ha sido un comprador activo. Para **Coinbase (COIN)**, grandes gestores como Vanguard mantienen posiciones masivas, a menudo vinculadas a fondos indexados pasivos. ARK Invest realiza compras oportunistas durante las caídas. En acciones como **Robinhood (HOOD)** y **Bullish (BLSH)**, se observa una creciente aceptación por parte de fondos de pensiones y compras dirigidas por ARK Invest, respectivamente. En el caso de **Block (XYZ)**, BlackRock redujo ligeramente su posición en el Q2. En resumen, las compras institucionales se concentran en acciones líderes del sector. Mientras gestores indexados pasivos mantienen posiciones por mandato, fondos temáticos como ARK Invest realizan ajustes activos y oportunistas. La creciente participación de fondos de pensiones conservadores sugiere una mayor legitimación de los activos cripto como clase de inversión. Se destaca que los datos 13F tienen un desfase y no deben usarse para seguir operaciones en tiempo real, pero reflejan la confianza institucional a largo plazo durante la fase bajista.

marsbitHace 28 min(s)

En el mercado bajista de las criptomonedas, ¿en qué acciones de concepto criptográfico están reabasteciendo las grandes instituciones?

marsbitHace 28 min(s)

¿Se agota el relato de "tokenización conforme" tras el primer balance catastrófico de Securitize tras su salida a bolsa?

El 12 de agosto, después del cierre del mercado estadounidense, Securitize publicó sus resultados financieros del segundo trimestre de 2026, su primer informe desde su cotización en julio. Los datos decepcionaron: ingresos de 14,43 millones de dólares (caída interanual del 5% y secuencial del 26%), por debajo de las expectativas, y una pérdida neta de 21,68 millones. Aunque su capital bajo gestión en activos tokenizados alcanzó un récord de 4.300 millones de dólares y el volumen de transacciones aumentó un 147%, los ingresos cayeron, lo que sugiere una posible compresión de comisiones o un modelo de negocio aún incierto. Tras la publicación, las acciones (SECZ) cayeron más de un 20% en la post-mercado. La compañía, reconocida por su enfoque obsesivo en la合规 (cumplimiento normativo), anunció importantes avances regulatorios, como asociaciones con Computershare y Continental para desarrollar un mercado de acciones tokenizadas, y la aprobación de FINRA para custodiar valores tokenizados. Sin embargo, en el ámbito práctico, el progreso fue escaso: su única acción tokenizada, la SECZ, se emitió principalmente para accionistas existentes, sin participación significativa de inversores secundarios, lo que limita la visibilidad sobre la demanda real del mercado. A pesar de ser la principal plataforma de tokenización por valor de mercado de activos del mundo real (RWA), con unos 5.000 millones de dólares, los inversores están preocupados por la contracción de los ingresos y la lenta materialización de su negocio de tokenización de acciones. La valoración de mercado ha caído un 36% desde su debut. El informe pone de relieve la desconexión entre el relato del cumplimiento normativo de Securitize y las duras realidades del mercado secundario, donde los indicadores de adopción real y volumen de transacciones importan más que las licencias.

marsbitHace 29 min(s)

¿Se agota el relato de "tokenización conforme" tras el primer balance catastrófico de Securitize tras su salida a bolsa?

marsbitHace 29 min(s)

¿El primer informe financiero de Securitize tras su salida a bolsa decepciona, ¿la narrativa de 'tokenización regulada' no convence?

El 12 de agosto, tras el cierre del mercado estadounidense, Securitize (SECZ) publicó sus resultados financieros del segundo trimestre de 2026, su primer informe desde su salida a bolsa en julio. Los resultados decepcionaron: los ingresos cayeron un 5% interanual a 14.43 millones de dólares, muy por debajo de las expectativas, y la pérdida neta fue de 21.68 millones. Aunque su volumen de operaciones con activos tokenizados creció un 147% y su AUM superó los 4,300 millones, los ingresos se contrajeron, lo que sugiere una posible compresión de márgenes o un modelo de negocio incierto. El énfasis de la empresa en la conformidad regulatoria sigue siendo firme, con nuevos hitos como acuerdos con agentes de transferencia y la aprobación de FINRA para custodiar valores tokenizados. Sin embargo, el mercado está perdiendo paciencia ante la falta de progreso tangible en su nuevo negocio estrella: la tokenización de acciones. Su única acción tokenizada, SECZ, se emitió principalmente para accionistas existentes, por lo que su valor en cadena no refleja la demanda real del mercado. Tras la publicación de los resultados, las acciones de Securitize cayeron más de un 20% en las operaciones extrabursátiles. La capitalización de mercado ha caído un 36% desde su debut. Los inversores están preocupados por la contracción de los ingresos y el lento despliegue de nuevos productos, priorizando ahora métricas reales de mercado sobre la narrativa de la conformidad.

Odaily星球日报Hace 45 min(s)

¿El primer informe financiero de Securitize tras su salida a bolsa decepciona, ¿la narrativa de 'tokenización regulada' no convence?

Odaily星球日报Hace 45 min(s)

Trading

Spot

Artículos destacados

Cómo comprar ARC

¡Bienvenido a HTX.com! Hemos hecho que comprar AI Rig Complex (ARC) sea simple y conveniente. Sigue nuestra guía paso a paso para iniciar tu viaje de criptos.Paso 1: crea tu cuenta HTXUtiliza tu correo electrónico o número de teléfono para registrarte y obtener una cuenta gratuita en HTX. Experimenta un proceso de registro sin complicaciones y desbloquea todas las funciones.Obtener mi cuentaPaso 2: ve a Comprar cripto y elige tu método de pagoTarjeta de crédito/débito: usa tu Visa o Mastercard para comprar AI Rig Complex (ARC) al instante.Saldo: utiliza fondos del saldo de tu cuenta HTX para tradear sin problemas.Terceros: hemos agregado métodos de pago populares como Google Pay y Apple Pay para mejorar la comodidad.P2P: tradear directamente con otros usuarios en HTX.Over-the-Counter (OTC): ofrecemos servicios personalizados y tipos de cambio competitivos para los traders.Paso 3: guarda tu AI Rig Complex (ARC)Después de comprar tu AI Rig Complex (ARC), guárdalo en tu cuenta HTX. Alternativamente, puedes enviarlo a otro lugar mediante transferencia blockchain o utilizarlo para tradear otras criptomonedas.Paso 4: tradear AI Rig Complex (ARC)Tradear fácilmente con AI Rig Complex (ARC) en HTX's mercado spot. Simplemente accede a tu cuenta, selecciona tu par de trading, ejecuta tus trades y monitorea en tiempo real. Ofrecemos una experiencia fácil de usar tanto para principiantes como para traders experimentados.

507 Vistas totalesPublicado en 2025.01.09Actualizado en 2026.08.11

Cómo comprar ARC

Discusiones

Bienvenido a la comunidad de HTX. Aquí puedes mantenerte informado sobre los últimos desarrollos de la plataforma y acceder a análisis profesionales del mercado. A continuación se presentan las opiniones de los usuarios sobre el precio de ARC (ARC).

活动图片