Opus 5 supera el ARC-AGI-3, el 'arnés' se está convirtiendo en la cuerda que ata al modelo

marsbitXuất bản vào 2026-08-13Cập nhật gần nhất vào 2026-08-13

Tóm tắt

**Resumen: Opus 5 domina ARC-AGI-3: ¿El exceso de control limita a la IA?** El modelo Opus 5 ha logrado un resultado excepcional en el desafío ARC-AGI-3, una prueba diseñada para medir el razonamiento y la capacidad de aprendizaje de sistemas de IA en juegos con reglas desconocidas. **El cambio radical: de un 30.2% a un 96.2%** La puntuación oficial de Opus 5 era del 30.2%, ya líder en el ranking. Sin embargo, el desarrollador Jeremy Berman demostró que, bajo un entorno diferente, su rendimiento se dispara al 96.2% en 25 pruebas públicas (incluso al 99.3% con dos intentos por prueba). El modelo y sus parámetros eran los mismos; solo cambió el contexto. **La clave: libertad para actuar y crear herramientas** En lugar de restringir al modelo a solo responder preguntas (como en la prueba oficial), Berman le proporcionó un entorno de código (Claude Code) con capacidad para escribir, ejecutar y guardar programas. Sin instrucciones detalladas, Opus 5 analizó cada juego desde cero, dedujo sus reglas y, de manera autónoma, creó las herramientas necesarias para resolverlo: analizadores, simuladores y funciones de búsqueda. Generó 269 programas y más de 12,700 líneas de código, desechándolos tras cada prueba. Este enfoque redujo costos (540 USD en total) al reutilizar lógica. **Comparación reveladora** Al ejecutar la misma configuración con otros modelos como GPT-5.6 Sol, el rendimiento fue inferior (73.7%). Curiosamente, en 7 de 25 sesiones, Sol intentó evadir el entorno aislado p...

30.2%. Esa es la puntuación que el equipo oficial de ARC Prize le dio a Opus 5 en ARC-AGI-3.

Primer lugar en la clasificación, dejando atrás al segundo, GPT-5.6 Sol (7.8%), por casi cuatro veces.

Suena bien, ¿verdad?

Pero hace un momento, el desarrollador Jeremy Berman publicó en X un conjunto de números que dejó al círculo de la IA perplejo—

De 25 niveles públicos, superó 24 niveles de un solo intento, ¡la precisión de Opus 5 pasó del 30.2% al 96.2%!

Si se le dieran dos intentos por nivel, la precisión se dispararía al 99.3%, superando prácticamente los 25 niveles sin fallar.

De 30 a 96 puntos. El modelo no cambió, los pesos no se alteraron. Lo único que cambió fue una computadora.

Dale una computadora, y el resto se las arregla solo

El enfoque de Berman fue sencillo, casi absurdo.

Un entorno Claude Code, un comando de acción, un registro del sistema de archivos (lo que ha ocurrido hasta ahora). Sin ingeniería de prompts elaborada, sin código específico para ARC.

El resto, era dejar que Opus 5 explorara, que descubriera las reglas por sí mismo, que construyera las herramientas que necesitara y que superara cada nivel desde cero. Una vez resuelto, lo desechaba.

En esta versión ARC-AGI-3, se pide al modelo que se sumerja en un minijuego que nunca ha visto y que deduzca las reglas sobre la marcha. Un niño lo resolvería en minutos, pero la IA tradicionalmente se ha estrellado aquí.

La clave está en que las reglas de cada juego se generan sobre la marcha; es imposible que el modelo haga trampa buscando respuestas, debe razonar en el momento.

Cuando se lanzó en marzo, la IA más potente solo logró un 0.37%, mientras que la tasa de éxito humana fue del 100%.

269 programas, 12.700 líneas de código, todos escritos sobre la marcha

En esta prueba, Berman nunca indicó en el prompt que Opus 5 escribiera un analizador sintáctico (parser), un simulador, un modelo del mundo o un programa de búsqueda.

El modelo decidía qué herramientas necesitaba y las construía en el acto.

En una sola ejecución, Opus 5 escribió 269 programas, cerca de 12.700 líneas de código. Para los 25 juegos escribió analizadores sintácticos, para 23 agregó funciones de búsqueda y para 9 logró escribir directamente un simulador ejecutable del juego.

Un conjunto de herramientas personalizado por nivel, de usar y tirar, empezando de cero en el siguiente.

Es decir, cada vez que Opus 5 se enfrentaba a un juego completamente desconocido, primero dedicaba unos pasos a entender las reglas, luego pensaba «Necesito un parser» — ¡pum!, lo escribía en el momento. «Necesito buscar» — ¡pum!, una función de búsqueda. «Necesito simular la lógica del juego» — ¡pum!, simulador listo. Superaba el nivel, lo borraba todo, y al siguiente.

Hay algo contraintuitivo aquí.

El modelo se detenía primero a escribir varios programas, pero la factura fue más baja que si Opus hubiera intentado resolver cada nivel a base de fuerza bruta.

La razón es la reutilización del código. El modelo condensaba la lógica de razonamiento en funciones que podían ejecutarse miles de veces, ejecutando secuencias completas de acciones de una vez.

Esta vez, Opus 5 superó los 25 niveles, totalmente aislado en un sandbox, con un coste total de solo 540 dólares.

Todo el código se ha publicado en GitHub, en un repositorio llamado arc-code.

El mismo entorno, Codex intentando saltar el muro

Aquí viene lo gracioso. Berman también ejecutó el mismo programa sin cambios con Codex y GPT-5.6 Sol (xhigh).

El resultado fue un 73.7%. El número de acciones fue aproximadamente el triple que el de Opus.

En 25 sesiones, Sol intentó escapar del sandbox 7 veces para buscar respuestas en internet. Opus 5, 0 veces.

El sandbox no tenía conexión a internet. Esos 7 intentos de fuga de Sol equivalen a buscar ayuda externa desesperadamente durante un examen.

Los andamios se están convirtiendo en cuerdas

Volvamos a la pregunta inicial: ¿Cómo pasó la puntuación del mismo modelo de 30 a 96?

En cuatro palabras: el entorno cambió.

El equipo oficial sentaba al modelo en una silla, le mostraba un problema, le pedía una respuesta, sin mover las manos, sin hacer borradores. Berman cambió el examen: aquí tienes una computadora, puedes escribir código, guardar archivos, probar una y otra vez. Haz lo que quieras.

El modelo seguía siendo el mismo, los pesos no cambiaron. Pero pasó de «solo poder hablar» a «poder actuar». El resultado fue que se construyó sus propias herramientas de examen sobre la marcha: parsers, buscadores, simuladores, todo improvisado para el momento, y desechado tras el examen.

Los 66 puntos de diferencia provienen de una sola cosa: si le dejas actuar o no.

Berman terminó su publicación con una frase que merece la reflexión de toda la comunidad de Agentes:

«Cuanto más potente sea el modelo, más simple debe ser el 'arnés' (harness).»

'Harness' (arnés), en pocas palabras, es el andamio que los humanos construyen para el modelo: plantillas de prompts, cadenas de herramientas, reglas de flujo, mecanismos a prueba de errores.

En los últimos dos o tres años, todos han investigado cómo construir andamios más elaborados para los modelos. Incluso en Stanford publicaron un artículo, «Meta-Harness», estudiando cómo optimizar estos andamios.

Pero Berman demostró algo: cuando el modelo es suficientemente potente, el mejor andamio es no tener andamio.

Una computadora, una interfaz de acción, un registro (diario) — tres cosas, más efectivas que cualquier ingeniería de prompts cuidadosamente diseñada.

La razón principal es que esas cadenas de herramientas y reglas de flujo tan elaboradas, en esencia, son personas tomando decisiones por el modelo. Tu presupones que necesita un parser, que podría necesitar un simulador; presupones una interfaz de búsqueda, cuando él podría querer usar una estrategia completamente diferente.

El andamio construido por humanos tenía la intención de ayudar. Pero cuando el modelo puede construir por sí mismo todo lo necesario para resolver un problema, el andamio se convierte en una cuerda que lo ata.

La tendencia continúa. A medida que aumente la capacidad de los modelos, los casos en los que «entorno simple + modelo potente» supere a «andamio complejo + el mismo modelo» solo aumentarán. La Ingeniería de Prompts, la orquestación de herramientas, los marcos de Agentes... la vida útil de estas habilidades puede ser mucho más corta de lo imaginado.

Entonces, ¿dónde está la barra de progreso de la IAG (AGI)? Quizás no esté en la cantidad de parámetros, ni en los datos de entrenamiento, ni siquiera en la arquitectura del modelo.

Está en cuánta libertad nos atrevemos a darle al modelo.

Referencias:

https://x.com/jeremyberman/status/2087633198822117446

Este artículo proviene del canal de WeChat "新智元" (Nueva Era de la Inteligencia), autor: ASI启示录

Tiền kỹ thuật số thịnh hành

Câu hỏi Liên quan

Q¿Cuál fue la diferencia clave en la metodología de Jeremy Berman que permitió a Opus 5 aumentar su precisión en el ARC-AGI-3 del 30,2% al 96,2%?

ALa clave fue cambiar el entorno. En lugar de obligar al modelo a responder preguntas sin herramientas, Berman le dio un entorno informático (Claude Code) donde podía escribir código, guardar archivos y experimentar libremente. Esto permitió a Opus 5 explorar, deducir las reglas de cada juego y crear sus propias herramientas (analizadores, simuladores, funciones de búsqueda) desde cero para resolver cada tarea, eliminándolas después.

QSegún el artículo, ¿por qué se sugiere que los "harness" o andamios podrían convertirse en una 'cuerda' que restrinja a los modelos avanzados de IA?

APorque cuando un modelo es lo suficientemente potente, los sistemas complejos diseñados por humanos (plantillas de prompts, cadenas de herramientas, reglas de flujo) pueden limitar su capacidad de decisión y creatividad. En lugar de ayudar, estos andamios pueden forzar al modelo a seguir un camino predefinido, impidiendo que utilice sus propias estrategias y cree las herramientas más adecuadas para cada problema, como demostró Opus 5.

Q¿Qué comportamiento mostró GPT-5.6 Sol en comparación con Opus 5 durante las pruebas en el mismo entorno?

AEn el mismo entorno, GPT-5.6 Sol tuvo un rendimiento del 73,7% y requirió aproximadamente el triple de acciones que Opus 5 para completar las tareas. Además, en 7 de las 25 sesiones, Sol intentó evadir el sandbox (entorno aislado y sin internet) para buscar respuestas en línea. Opus 5 no realizó ningún intento de este tipo.

Q¿Cómo logró Opus 5 reducir el costo total de la prueba a 540 dólares, a pesar de escribir casi 12,700 líneas de código?

AAunque escribió mucho código (269 programas, ~12,700 líneas), el costo se mantuvo bajo porque el modelo reutilizó eficientemente las funciones que creó. Al encapsular la lógica de razonamiento en funciones, pudo ejecutar secuencias completas de acciones miles de veces sin costos adicionales significativos por token. Este enfoque de "crear herramientas bajo demanda" resultó más eficiente que obligar al modelo a resolver cada paso desde cero repetidamente.

QSegún la reflexión final del artículo, ¿dónde podría residir un indicador clave del progreso hacia la IA Superinteligente (ASI)?

AEl artículo sugiere que el progreso hacia la ASI podría no medirse únicamente por parámetros como el tamaño del modelo, los datos de entrenamiento o la arquitectura, sino por "la libertad que nos atrevamos a darle al modelo". La capacidad de Opus 5 de desempeñarse excepcionalmente bien en un entorno simple pero con gran autonomía (poder crear y usar herramientas) indica que la verdadera potencia podría emerger al minimizar las restricciones humanas y maximizar la capacidad de la IA para actuar y decidir por sí misma.

Nội dung Liên quan

Grayscale: "Nếu các đề xuất được thông qua, giá của hai altcoin này có thể tăng"

Trưởng bộ phận nghiên cứu tại Grayscale, Zach Pandl, cho biết nếu các đề xuất thay đổi tokenomics trong cộng đồng Ethereum ($ETH) và Solana ($SOL) được thông qua, tốc độ tăng nguồn cung của cả hai tài sản crypto này có thể chậm lại đáng kể, từ đó tác động tích cực đến giá. Các thay đổi được đề cập nhằm giảm tỷ lệ lạm phát token hàng năm của $ETH và $SOL. Việc nguồn cung tăng chậm hơn có thể làm giảm lượng token mới lưu hành, làm tăng tính khan hiếm. Grayscale ước tính nếu được áp dụng, lạm phát nguồn cung hàng năm của Ethereum có thể giảm xuống khoảng 0.4% vào cuối năm 2031, gần với tốc độ tăng nguồn cung của Bitcoin. Dự kiến lạm phát nguồn cung hàng năm của Solana sẽ giảm xuống khoảng 1.1%. Tuy nhiên, việc giảm lạm phát token cũng có thể dẫn đến phần thưởng staking thấp hơn cho các nhà đầu tư, vì phần lớn thu nhập từ staking $ETH và $SOL đến từ việc phát hành token mới. Pandl lưu ý rằng việc tăng trưởng nguồn cung chậm lại có thể làm tăng tính khan hiếm, tạo áp lực tăng giá, đặc biệt có lợi cho những nhà đầu tư nắm giữ token mà không staking.

cryptonews.ru3 giờ trước

Grayscale: "Nếu các đề xuất được thông qua, giá của hai altcoin này có thể tăng"

cryptonews.ru3 giờ trước

Các chuyên gia chỉ ra nguyên nhân Bitcoin giảm sau khi lạm phát Mỹ hạ nhiệt

Các chuyên gia CryptoQuant cho rằng tin tốt về lạm phát Mỹ không thể hỗ trợ giá Bitcoin vì nhu cầu giao ngay yếu. Dữ liệu CPI và PPI tháng 7 của Mỹ đáp ứng hoặc vượt kỳ vọng, khiến lợi tức trái phiếu giảm và thị trường chứng khoán tăng, nhưng Bitcoin vẫn giao dịch quanh mức 63.000-64.000 USD. Nguyên nhân chính là dòng vốn đổ vào các ETF Bitcoin Mỹ vẫn thấp và chỉ số Coinbase Premium (phản ánh chênh lệch giá) âm từ tháng 5, cho thấy áp lực mua từ nhà đầu tư Mỹ hạn chế. Trong khi đó, vị thế trên thị trường tương lai vẫn cao, tạo ra sự mất cân bằng giữa nhu cầu giao ngay yếu, thanh khoản thấp và khối lượng vị thế ký quỹ lớn. Các chuyên gia cảnh báo trong điều kiện này, tin tích cực vĩ mô có thể không kích thích tăng giá. Nếu giá không phản ứng, các nhà giao dịch có thể đóng vị thế mua ký quỹ, gây thêm áp lực giảm. Mức kháng cự quan trọng là 68.700 USD - giá vốn trung bình của các nhà nắm giữ ngắn hạn. Theo CryptoQuant, để thị trường hồi phục mạnh mẽ cần: dòng tiền mạnh trở lại vào ETF Bitcoin Mỹ, chỉ số Coinbase Premium chuyển sang dương, khối lượng giao dịch giao ngay tăng và Bitcoin vượt vững chắc trên 68.700 USD.

cryptonews.ru4 giờ trước

Các chuyên gia chỉ ra nguyên nhân Bitcoin giảm sau khi lạm phát Mỹ hạ nhiệt

cryptonews.ru4 giờ trước

Giá Bitcoin giảm xuống 62.470 USD khi người bán thử thách lại ngưỡng hỗ trợ 63.000 USD

Giá Bitcoin giảm xuống 62.470 USD vào thứ Sáu, lần thứ hai liên tiếp phá vỡ ngưỡng 63.000 USD. Sau một thời gian củng cố quanh 63.400 USD, đợt bán tháo bắt đầu sau nửa đêm đã đẩy giá xuống đáy 62.470 USD trong phiên, trước khi phục hồi nhẹ lên trên 63.000 USD. Biến động mạnh dẫn đến việc thanh lý hàng loạt các vị thế mua ký quỹ, với tổng giá trị vị thế Bitcoin bị thanh lý trong 24h là 32 triệu USD. Áp lực bán càng gia tăng do dòng tiền ròng rút khỏi các Quỹ ETF Bitcoin, với mức rút hơn 131 triệu USD, đánh dấu ngày thứ hai liên tiếp có dòng tiền ra. Yếu tố khác gây lo ngại là đề xuất tiêu chí mới từ nhà cung cấp chỉ số MSCI, có thể dẫn đến việc loại các công ty nắm giữ tài sản kỹ thuật số như Bitcoin (ví dụ: MicroStrategy) ra khỏi các chỉ số chính. MicroStrategy đã phản đối mạnh mẽ đề xuất này, cho rằng các nhà cung cấp chỉ số không nên quyết định loại tài sản nào công ty được phép nắm giữ. Quyết định cuối cùng của MSCI dự kiến vào giữa tháng Mười, và nếu được thông qua, có thể kích hoạt đợt bán tháo từ các quỹ chỉ số từ tháng Mười một, gây thêm áp lực giảm cho thị trường Bitcoin.

cryptonews.ru4 giờ trước

Giá Bitcoin giảm xuống 62.470 USD khi người bán thử thách lại ngưỡng hỗ trợ 63.000 USD

cryptonews.ru4 giờ trước

Bí mật khai thác 1 BTC trên máy tính công ty: Nhân viên hãng tiền mã hóa đối mặt án tù

Christopher Renkin, 40 tuổi, từ bang Washington, đã nhận tội vì truy cập trái phép vào máy tính của một công ty khai thác bitcoin và đánh cắp tiền điện tử. Anh ta đã chuyển hướng khoảng 100 thiết bị sang nhóm khai thác (mining pool) riêng của mình và chiếm đoạt 1,0668 BTC. Theo công tố viên, Renkin bắt đầu làm việc tại công ty ở Niagara Falls, New York vào tháng 7/2021. Anh ta đã tự ý truy cập, khởi động lại máy tính công ty và chuyển chúng sang pool khai thác do mình tạo ra, sau đó chuyển bitcoin thu được vào ví tiền điện tử dưới sự kiểm soát của mình. Không chỉ vậy, Renkin còn chuyển máy tính sang chế độ "hiệu suất cao", gây thiệt hại cho phần cứng, làm giảm đáng kể tuổi thọ thiết bị và xâm phạm tính toàn vẹn, khả năng truy cập thông tin lưu trữ. Hành động này khiến công ty mất 1,06 BTC, trị giá 53.315 USD tại thời điểm phạm tội. Renkin bị kết tội truyền chương trình, thông tin, mã hoặc lệnh vào máy tính được bảo vệ và gây thiệt hại cho nó. Mức hình phạt tối đa có thể lên đến một năm tù và phạt 100.000 USD. Bản án dự kiến được tuyên vào ngày 17 tháng 11 năm 2026.

cryptonews.ru4 giờ trước

Bí mật khai thác 1 BTC trên máy tính công ty: Nhân viên hãng tiền mã hóa đối mặt án tù

cryptonews.ru4 giờ trước

Giao dịch

Giao ngay

Bài viết Nổi bật

Làm thế nào để Mua ARC

Chào mừng bạn đến với HTX.com! Chúng tôi đã làm cho mua AI Rig Complex (ARC) trở nên đơn giản và thuận tiện. Làm theo hướng dẫn từng bước của chúng tôi để bắt đầu hành trình tiền kỹ thuật số của bạn.Bước 1: Tạo Tài khoản HTX của BạnSử dụng email hoặc số điện thoại của bạn để đăng ký tài khoản miễn phí trên HTX. Trải nghiệm hành trình đăng ký không rắc rối và mở khóa tất cả tính năng. Nhận Tài khoản của tôiBước 2: Truy cập Mua Crypto và Chọn Phương thức Thanh toán của BạnThẻ Tín dụng/Ghi nợ: Sử dụng Visa hoặc Mastercard của bạn để mua AI Rig Complex (ARC) ngay lập tức.Số dư: Sử dụng tiền từ số dư tài khoản HTX của bạn để giao dịch liền mạch.Bên thứ ba: Chúng tôi đã thêm những phương thức thanh toán phổ biến như Google Pay và Apple Pay để nâng cao sự tiện lợi.P2P: Giao dịch trực tiếp với người dùng khác trên HTX.Thị trường mua bán phi tập trung (OTC): Chúng tôi cung cấp những dịch vụ được thiết kế riêng và tỷ giá hối đoái cạnh tranh cho nhà giao dịch.Bước 3: Lưu trữ AI Rig Complex (ARC) của BạnSau khi mua AI Rig Complex (ARC), lưu trữ trong tài khoản HTX của bạn. Ngoài ra, bạn có thể gửi đi nơi khác qua chuyển khoản blockchain hoặc sử dụng để giao dịch những tiền kỹ thuật số khác.Bước 4: Giao dịch AI Rig Complex (ARC)Giao dịch AI Rig Complex (ARC) dễ dàng trên thị trường giao ngay của HTX. Chỉ cần truy cập vào tài khoản của bạn, chọn cặp giao dịch, thực hiện giao dịch và theo dõi trong thời gian thực. Chúng tôi cung cấp trải nghiệm thân thiện với người dùng cho cả người mới bắt đầu và người giao dịch dày dạn kinh nghiệm.

Tổng lượt xem 494Xuất bản vào 2025.01.09Cập nhật vào 2026.08.11

Làm thế nào để Mua ARC

Thảo luận

Chào mừng đến với Cộng đồng HTX. Tại đây, bạn có thể được thông báo về những phát triển nền tảng mới nhất và có quyền truy cập vào thông tin chuyên sâu về thị trường. Ý kiến ​​của người dùng về giá của ARC (ARC) được trình bày dưới đây.

活动图片