NVIDIA arrasa en ARC-AGI-3 con su IA, el equipo chino resuelve 183 niveles de golpe

marsbitPublicado a 2026-08-24Actualizado a 2026-08-24

Resumen

NVIDIA ha logrado un hito en inteligencia artificial con su agente de codificación universal AVO, que ha obtenido una puntuación perfecta de 100.00 en el exigente benchmark ARC-AGI-3. El sistema completó las 183 tareas de 25 entornos diferentes utilizando solo 6624 pasos. ARC-AGI-3 es conocido por su alta dificultad: arroja a los agentes a juegos desconocidos sin reglas ni objetivos claros, obligándolos a explorar, interactuar y deducir la mecánica por sí mismos. Mientras que modelos de vanguardia como Claude Opus 5 solo alcanzan un 30.16% actuando solos, AVO, que utiliza el mismo modelo central, logró el 100% gracias a una arquitectura externa inteligente. La clave del éxito de AVO radica en dos componentes principales fuera del modelo de lenguaje: 1. **Memoria persistente:** Almacena el historial de intentos, resultados, análisis y procesos de razonamiento, evitando que el agente cometa los mismos errores cuando se reinicia el contexto. 2. **Un supervisor:** Monitorea la búsqueda de soluciones e interviene cuando el agente principal se estanca o repite acciones inútiles, redirigiendo la estrategia. Notablemente, AVO procesó los entornos visuales en puro texto, recibiendo una cuadrícula de 64x64 caracteres en lugar de imágenes. Originalmente, AVO fue diseñado no para juegos, sino para la optimización autónoma de *kernels* de GPU. En un experimento, optimizó un *kernel* de atención para B200 durante 7 días, superando las implementaciones de NVIDIA cuDNN y FlashAttention...

¡Acaba de ocurrir! El agente de programación general de NVIDIA, AVO, ¡ha obtenido la puntuación perfecta en ARC-AGI-3!

Completó los 183 niveles en 25 entornos de juego, utilizando solo 6624 pasos, y alcanzó un RHAE de 100.00.

Hay que tener en cuenta que ARC-AGI-3 es famoso por no jugar limpio. Lanza al agente a un juego extraño sin darle reglas ni objetivos; tiene que pulsar, observar y adivinar por sí mismo.

En algunos entornos puedes moverte arriba, abajo, izquierda, derecha, deambulando por pasillos, chocas contra un bloque azul-negro y toda la pantalla gira 90 grados; otros no te permiten moverte, solo hacer clic, usando clicks para cambiar cíclicamente el color de las casillas hasta formar el patrón objetivo.

Cada entorno tiene al menos seis niveles, y cuanto más avanzas, más duros se vuelven. Un nivel que se podía completar en cinco pasos en la primera fase, podría requerir cincuenta pasos en la sexta.

Y el agente solo tiene una cuadrícula de 64×64 y unas pocas teclas a su disposición.

Los modelos de vanguardia enfrentados directamente no logran superarlo.

El modelo utilizado por AVO esta vez fue Claude Opus 5. Pero si lo evalúas solo, su puntuación es solo del 30.16%, y aún así es el primero en el ranking oficial certificado.

ARC Prize analizó los registros de partidas de la generación anterior y resumió tres tipos de errores típicos.

  • Primero, entendía lo local pero no lo global.
  • Segundo, adaptaba mecanismos desconocidos a juegos familiares.
  • Tercero, superaba un nivel pero no aprendía.

El tercer tipo es el más crítico. Opus alguna vez completó el primer nivel de ka59 en solo 37 pasos, pero su comprensión del mecanismo de clic estaba equivocada desde el principio. Al llegar al segundo nivel, se aferraba a esa teoría errónea y finalmente se quedó atascado.

El enfoque de NVIDIA fue no tocar el modelo, solo agregar una capa externa a su alrededor.

Así, el mismo Claude Opus 5 pasó directamente de una puntuación de 30 a la puntuación perfecta.

Entonces, X estalló. Por un lado, se llenó de mensajes como "ARC-AGI-3 ha caído" y "es hora de escalar un nuevo ranking", y por otro, la gente exclamaba lo increíble que fue este movimiento de NVIDIA.

Con este impulso, el próximo salto a nivel de modelo podría no depender de esperar un nuevo modelo, sino de una actualización del 'harness' (arnés).

El salto a 100 puntos, desglosado en solo dos elementos

¿Qué instaló NVIDIA alrededor del modelo para llenar estos tres vacíos de una vez?

Al igual que los recientemente populares DeepSeek Harness y Codex Harness, AVO también gestiona aspectos externos al modelo.

Esto incluye qué contexto proporcionarle, qué herramientas darle, cómo almacenar estados, cómo recibir retroalimentación, qué hacer si se atasca y cómo continuar después de que el contexto se llene, entre otras cosas.

En términos concretos de mecanismos, lo que realmente marcó la diferencia fueron dos elementos.

El primero es la memoria persistente.

El punto más crítico en tareas de largo plazo es que el contexto se llena.

Una vez lleno, la memoria del modelo se reinicia. Todo lo probado antes, qué caminos no funcionaron, qué resultados arrojó el profiler, todo se pierde.

En la siguiente ronda, vuelve a caer en los mismos errores desde el principio.

AVO, por otro lado, almacena todo esto: versiones anteriores de implementación, resultados de cada evaluación, salidas del compilador y del analizador, y el proceso de razonamiento acumulado.

Después de un reinicio del contexto, el agente continúa desde el estado actual, en lugar de reconstruir toda la búsqueda desde cero.

El segundo es el supervisor.

El agente principal se encarga del trabajo, decidiendo por sí mismo qué observar, qué modificar, qué probar y qué enviar.

El supervisor no trabaja, solo vigila toda la trayectoria de búsqueda. Una vez que detecta un estancamiento en el progreso, o que el agente principal comienza a dar vueltas en círculos haciendo trabajo inútil repetidamente, interviene para redirigir al agente principal hacia otras estrategias.

Hay otro detalle.

AVO ejecutó ARC-AGI-3 utilizando exclusivamente modalidad de texto puro. Cada observación de fotograma alimentada al modelo era una cuadrícula de texto precisa de 64×64, ni una sola imagen, ni un solo token visual fue enviado.

Es decir, en un juego lleno de píxeles, el modelo nunca vio una imagen.

El mecanismo que hizo esto posible produjo la hoja de resultados: 6624 pasos para completar 183 niveles y un RHAE perfecto.

La conclusión de NVIDIA es que la capacidad de largo plazo nunca ha sido una característica exclusiva del modelo, sino el resultado de la combinación de todo el sistema.

La memoria determina qué elementos persisten hasta la siguiente ronda, las herramientas determinan qué acciones puede realizar el agente, y la retroalimentación le permite saber si se está equivocando.

Y cuando una hipótesis es refutada, la capacidad de retroceder y continuar trabajando determina si la tarea puede llevarse a cabo de manera sostenida.

Primero revolucionó a NVIDIA misma

Lo interesante es que AVO no fue creado para jugar. Su campo de batalla principal es la optimización de operadores de GPU.

El 25 de marzo de este año, NVIDIA subió un artículo a arXiv titulado "AVO: Agente de Operador de Variación para Búsqueda Evolutiva Autónoma".

Dirección del artículo: https://arxiv.org/abs/2603.24517

Dos palabras en el título son clave: búsqueda evolutiva y operador de variación.

La búsqueda evolutiva en sí no es compleja. Se tiene un conjunto de códigos candidatos, se modifican, se ejecutan, se conserva la versión más rápida y luego se continúa modificando, generación tras generación.

El responsable del paso de "modificar" en los algoritmos evolutivos se llama operador de variación. En el pasado estaba predefinido, los métodos de modificación los establecían los humanos de antemano; más tarde se utilizaron LLMs para modificarlo, pero solo generaban un fragmento de código por ejecución.

El enfoque de AVO fue reemplazar todo el operador de variación con un agente autónomo.

De esta manera, no solo puede consultar guías de programación CUDA y documentos de arquitectura PTX, ejecutar pruebas, leer perfiles, sino también diagnosticar fallos de corrección por sí mismo y luego decidir qué modificar en la siguiente versión.

El equipo lo implementó en B200 con la tarea de optimizar el kernel de atención, uno de los operadores más exigidos en Transformer. Luego lo dejaron funcionar solo.

AVO ejecutó de forma autónoma y continua durante 7 días, explorando más de 500 direcciones de optimización, y finalmente presentó 40 versiones válidas del kernel.

El kernel de atención multi-cabeza resultante fue hasta 3.5% más rápido que el cuDNN propietario de NVIDIA, y hasta 10.5% más rápido que la implementación de código abierto más avanzada, FlashAttention-4.

Luego trasladó este conjunto de optimizaciones al GQA, actualmente predominante en los grandes modelos. Esta vez, después de solo unos 30 minutos de ejecución autónoma, el nuevo kernel fue un 7.0% más rápido que cuDNN y un 9.3% más rápido que FlashAttention-4.

Escribir kernels CUDA manualmente siempre ha sido una de las tareas con mayor barrera de entrada en este ecosistema, y AVO fue el primero en superarla.

Y esos 25 juegos de ARC-AGI-3 se ejecutan con este mismo sistema.

Ajustar kernels y jugar pueden parecer dos cosas completamente distintas. Pero para NVIDIA, bajo la superficie ambas ejecutan el mismo ciclo.

El agente primero formula una hipótesis a partir de evidencia incompleta, actúa para probarla, observa los resultados, almacena estados útiles y luego refina su comprensión del problema. Si la hipótesis es incorrecta, retrocede y reconsidera, y luego continúa iterando.

En palabras de NVIDIA, lo que se puede transferir no es el conocimiento del dominio, sino el mecanismo que mantiene la autonomía en tareas de largo plazo.

Quienes lo crearon fueron un equipo de base china

Si observas la lista de autores del artículo de AVO, verás una serie de nombres muy conocidos.

Con 23 firmas, prácticamente se reunieron a las figuras clave de la infraestructura de aprendizaje profundo de código abierto de la última década.

Uno de los primeros autores, Bing Xu, es Distinguished Engineer de NVIDIA y autor de MXNet. Incluso antes, fue el cuarto autor del artículo original de GAN de 2014, junto con el autor final Yoshua Bengio, ambos afiliados a la Universidad de Montreal.

Tianqi Chen, autor de TVM y XGBoost, también está en la lista. La línea de TVM también conecta con Luis Ceze; ambos fundaron OctoAI, que NVIDIA adquirió en septiembre de 2024, y Ceze luego se unió a NVIDIA para continuar trabajando en compiladores de aprendizaje automático.

Además, está Zi Hao Ye, autor de FlashInfer, y Vinod Grover, veterano del compilador CUDA.

Al frente está Humphrey Shi, Vicepresidente de IA de Alto Rendimiento en NVIDIA y también profesor en Georgia Tech. El otro primer autor, Zhifan Ye, es actualmente estudiante de doctorado en Georgia Tech.

El blog de esta ocasión tiene cinco nombres, cuatro de ellos chinos: además de Humphrey Shi, están Terry Chen, Zhifan Ye y Yeyin Zhu; el restante es Jean-Francois Puget, dos veces Gran Maestro Kaggle de NVIDIA.

Una de las partes más interesantes proviene de un relato previo de Bing Xu en X.

Hace un año y medio, cuando él y Terry Chen comenzaron a trabajar en programación de agentes en NVIDIA, ninguno de los dos entendía la programación de GPU.

Precisamente por no entender, desde el primer día se centraron en crear un sistema completamente automático, sin intervención humana, y le dieron a este enfoque el nombre de "programación a ciegas".

Un año y medio después, este sistema que no depende de instrucciones humanas superó a los kernels optimizados por expertos humanos durante meses.

Al final, la cuenta siempre termina en las tarjetas gráficas de Jensen Huang

¿Por qué una empresa que vende tarjetas gráficas dedicaría un año y medio a crear un agente que no requiere intervención humana?

Porque esta capa externa (el 'harness') se puede aplicar a cualquier modelo.

AVO ya se ha ejecutado en múltiples modelos. En los mismos niveles, combinado con GPT-5.6 Sol tomó menos tiempo, mientras que con Opus 5 utilizó menos pasos.

NVIDIA no gana dinero vendiendo modelos, pero puede mantener el control sobre esta capa. Esto es consistente con su estrategia general de los últimos años.

En el lado del modelo, se opta por el código abierto. Nemotron 4, lanzado en agosto de este año, apunta a una escala de billones de parámetros, se espera completar el entrenamiento en otoño, y el modelo se regalará, recuperando el dinero a través de las GPU y el stack de software posteriores.

En el lado de la potencia de cálculo, los agentes de largo plazo son exactamente el tipo de carga que más desean. La evaluación de Jensen Huang en GTC este año fue que el punto de inflexión de la inferencia ya ha llegado. En los últimos dos años, la demanda de potencia de cálculo aumentó aproximadamente diez mil veces, mientras que el uso solo aumentó aproximadamente cien veces; la diferencia fue absorbida por la inferencia.

Así que no importa de quién sea el modelo. Mientras los agentes realicen tareas cada vez más largas y complejas, la cuenta finalmente terminará en sus tarjetas gráficas.

En cuanto a las tres palabras "100 puntos", actualmente se están devaluando rápidamente.

En marzo, nadie podía alcanzar ni 1 punto. Tycho obtuvo la puntuación perfecta a fines de julio, VISTA la consiguió nuevamente el 5 de agosto, y la de AVO ya es la tercera en seis semanas, y las tres están impulsadas por Claude Opus 5.

Pero lo logrado por AVO no se verá reducido por ello.

Una arquitectura creada para exprimir los últimos puntos porcentuales de FlashAttention en B200 se trasladó casi sin cambios a un juego de píxeles, y funcionó.

Solo se intercambiaron la interfaz de tarea y el método de evaluación; el ciclo central no se modificó en absoluto.

Como escribió NVIDIA al final de su blog: El modelo es importante, pero el modelo no lo es todo para un agente.

Referencias:

https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/

Este artículo proviene del WeChat Official Account "新智元", autor: ASI启示录, editor: 摩西

Criptos en tendencia

Preguntas relacionadas

Q¿Qué logró el agente de codificación general AVO de NVIDIA en ARC-AGI-3?

AAVO obtuvo una puntuación perfecta de 100.00 en ARC-AGI-3, completando las 183 fases en 6624 pasos.

Q¿Cuáles son los dos mecanismos clave que permitieron a AVO superar los errores típicos y obtener un puntaje perfecto?

ALos dos mecanismos clave son la memoria persistente (que almacena estados y resultados pasados para evitar reinicios) y un supervisor (que redirige al agente principal cuando detecta estancamiento o repeticiones inútiles).

Q¿Para qué tarea principal fue diseñado originalmente AVO, según el artículo?

AAVO fue diseñado originalmente para la optimización de operadores de GPU, específicamente para optimizar kernels de CUDA como los de atención en transformadores, logrando mejoras de rendimiento frente a implementaciones de referencia.

Q¿Qué característica notable del equipo de desarrollo de AVO se destaca en el artículo?

AEl equipo de desarrollo tiene una fuerte base de investigadores y ingenieros chinos, incluyendo a Bing Xu (coautor de GAN y creador de MXNet), Tianqi Chen (creador de TVM y XGBoost), y otros expertos clave en infraestructura de aprendizaje profundo.

QSegún el artículo, ¿por qué es estratégicamente importante para NVIDIA desarrollar un sistema de agentes autónomos de largo horizonte como AVO?

APorque NVIDIA no depende de vender modelos propios, sino que puede proporcionar la capa de infraestructura (el "arnés") que funciona con cualquier modelo. Los agentes que realizan tareas más largas y complejas aumentan la demanda de potencia de cálculo, lo que finalmente se traduce en más ventas de sus GPU.

Lecturas Relacionadas

Tesorería de EE.UU. podría usar un billón de dólares del TGA para comprar bonos, caen el petróleo y los rendimientos; el hardware de IA sigue hundiéndose con siete días consecutivos de pérdidas para NVIDIA; suben el oro, el dólar y Bitcoin

Los mercados financieros mostraron una marcada divergencia. Las acciones de hardware de IA sufrieron fuertes caídas, lideradas por Nvidia, que cayó por séptima sesión consecutiva, su racha más larga desde 2022, arrastrando al Nasdaq. Sectores como memoria y comunicación óptica fueron los más afectados. En contraste, el Dow Jones subió por segundo día, impulsado por sectores defensivos como financiero y consumo básico, con ganancias en acciones como JPMorgan y Walmart. Las grandes tecnológicas como Meta y Amazon también mostraron resistencia. En paralelo, se observó un movimiento de capital hacia activos refugio. El oro al contado subió un 1.05%, alcanzando un máximo en casi tres meses, y el bitcoin se acercó brevemente a los $80,000. Mientras tanto, los rendimientos de los bonos del Tesoro estadounidense y los precios del petróleo cayeron. Esto último ocurrió tras comentarios del Secretario del Tesoro, Beshear, que sugirieron posibles compras de bonos por hasta un billón de dólares utilizando fondos de la cuenta TGA. La semana se perfila como clave, con los resultados de Nvidia, el discurso del presidente de la Fed, Warsh, en Jackson Hole y la publicación de los datos del PCE central de julio, lo que podría amplificar la volatilidad del mercado.

华尔街日报Hace 51 min(s)

Tesorería de EE.UU. podría usar un billón de dólares del TGA para comprar bonos, caen el petróleo y los rendimientos; el hardware de IA sigue hundiéndose con siete días consecutivos de pérdidas para NVIDIA; suben el oro, el dólar y Bitcoin

华尔街日报Hace 51 min(s)

Bitcoin alcanza los $80 000: tres argumentos contra el mercado alcista

El bitcoin alcanzó los 80.000 dólares el 24 de agosto, mostrando un crecimiento del 38% desde su mínimo de 57.800 dólares en julio de 2026. Los analistas debaten si esto marca el inicio de un nuevo mercado alcista o es solo un repunte dentro de una tendencia bajista. El analista Rekt Capital señala tres argumentos en contra de un mercado alcista definitivo: 1. El posible fondo de julio se formó un 27% más rápido que en ciclos anteriores, pero solo se confirmará si no se alcanza un nuevo mínimo más bajo antes de finales de 2026. 2. Tras el rompimiento a la baja de una figura de "macro-triángulo", la caída actual (~30%) ha sido mucho menor que las caídas históricas (48-62%) tras rompimientos similares. 3. El precio no ha logrado superar la línea de tendencia bajista principal desde los máximos de 2025, lo que indica debilidad en los marcos temporales más largos. Rekt Capital calcula que la resistencia de la tendencia bajista está actualmente alrededor de 79.000 dólares. Un cierre mensual por debajo de esta línea podría abrir la puerta a una corrección. En el gráfico semanal, la resistencia se sitúa entre 74.500 y 83.500 dólares, con un soporte entre 62.500 y 68.500 dólares. Por otro lado, el bloguero Crypto Rover destaca dos niveles clave en el mapa de liquidaciones: posiciones cortas concentradas entre 80.000 y 90.000 dólares (que podrían impulsar el precio al liquidarse) y posiciones largas entre 48.000 y 60.000 dólares, actuando como "dos imanes" para el precio. El artículo también revisa previsiones pasadas de Rekt Capital, notando que, si bien acertó en la dirección del movimiento en 2025, subestimó su magnitud tanto en la recuperación de primavera como en la caída de otoño. En su análisis actual, mantiene una postura cautelosa a pesar del reciente repunte.

cryptonews.ruHace 1 hora(s)

Bitcoin alcanza los $80 000: tres argumentos contra el mercado alcista

cryptonews.ruHace 1 hora(s)

Trading

Spot

Artículos destacados

Cómo comprar ONE

¡Bienvenido a HTX.com! Hemos hecho que comprar Harmony (ONE) sea simple y conveniente. Sigue nuestra guía paso a paso para iniciar tu viaje de criptos.Paso 1: crea tu cuenta HTXUtiliza tu correo electrónico o número de teléfono para registrarte y obtener una cuenta gratuita en HTX. Experimenta un proceso de registro sin complicaciones y desbloquea todas las funciones.Obtener mi cuentaPaso 2: ve a Comprar cripto y elige tu método de pagoTarjeta de crédito/débito: usa tu Visa o Mastercard para comprar Harmony (ONE) al instante.Saldo: utiliza fondos del saldo de tu cuenta HTX para tradear sin problemas.Terceros: hemos agregado métodos de pago populares como Google Pay y Apple Pay para mejorar la comodidad.P2P: tradear directamente con otros usuarios en HTX.Over-the-Counter (OTC): ofrecemos servicios personalizados y tipos de cambio competitivos para los traders.Paso 3: guarda tu Harmony (ONE)Después de comprar tu Harmony (ONE), guárdalo en tu cuenta HTX. Alternativamente, puedes enviarlo a otro lugar mediante transferencia blockchain o utilizarlo para tradear otras criptomonedas.Paso 4: tradear Harmony (ONE)Tradear fácilmente con Harmony (ONE) en HTX's mercado spot. Simplemente accede a tu cuenta, selecciona tu par de trading, ejecuta tus trades y monitorea en tiempo real. Ofrecemos una experiencia fácil de usar tanto para principiantes como para traders experimentados.

864 Vistas totalesPublicado en 2024.12.12Actualizado en 2026.06.02

Cómo comprar ONE

Discusiones

Bienvenido a la comunidad de HTX. Aquí puedes mantenerte informado sobre los últimos desarrollos de la plataforma y acceder a análisis profesionales del mercado. A continuación se presentan las opiniones de los usuarios sobre el precio de ONE (ONE).

活动图片