NVIDIA arrasa en ARC-AGI-3 con su IA, el equipo chino resuelve 183 niveles de golpe

marsbitPublicado a 2026-08-24Actualizado a 2026-08-24

Resumen

NVIDIA ha logrado un hito en inteligencia artificial con su agente de codificación universal AVO, que ha obtenido una puntuación perfecta de 100.00 en el exigente benchmark ARC-AGI-3. El sistema completó las 183 tareas de 25 entornos diferentes utilizando solo 6624 pasos. ARC-AGI-3 es conocido por su alta dificultad: arroja a los agentes a juegos desconocidos sin reglas ni objetivos claros, obligándolos a explorar, interactuar y deducir la mecánica por sí mismos. Mientras que modelos de vanguardia como Claude Opus 5 solo alcanzan un 30.16% actuando solos, AVO, que utiliza el mismo modelo central, logró el 100% gracias a una arquitectura externa inteligente. La clave del éxito de AVO radica en dos componentes principales fuera del modelo de lenguaje: 1. **Memoria persistente:** Almacena el historial de intentos, resultados, análisis y procesos de razonamiento, evitando que el agente cometa los mismos errores cuando se reinicia el contexto. 2. **Un supervisor:** Monitorea la búsqueda de soluciones e interviene cuando el agente principal se estanca o repite acciones inútiles, redirigiendo la estrategia. Notablemente, AVO procesó los entornos visuales en puro texto, recibiendo una cuadrícula de 64x64 caracteres en lugar de imágenes. Originalmente, AVO fue diseñado no para juegos, sino para la optimización autónoma de *kernels* de GPU. En un experimento, optimizó un *kernel* de atención para B200 durante 7 días, superando las implementaciones de NVIDIA cuDNN y FlashAttention...

¡Acaba de ocurrir! El agente de programación general de NVIDIA, AVO, ¡ha obtenido la puntuación perfecta en ARC-AGI-3!

Completó los 183 niveles en 25 entornos de juego, utilizando solo 6624 pasos, y alcanzó un RHAE de 100.00.

Hay que tener en cuenta que ARC-AGI-3 es famoso por no jugar limpio. Lanza al agente a un juego extraño sin darle reglas ni objetivos; tiene que pulsar, observar y adivinar por sí mismo.

En algunos entornos puedes moverte arriba, abajo, izquierda, derecha, deambulando por pasillos, chocas contra un bloque azul-negro y toda la pantalla gira 90 grados; otros no te permiten moverte, solo hacer clic, usando clicks para cambiar cíclicamente el color de las casillas hasta formar el patrón objetivo.

Cada entorno tiene al menos seis niveles, y cuanto más avanzas, más duros se vuelven. Un nivel que se podía completar en cinco pasos en la primera fase, podría requerir cincuenta pasos en la sexta.

Y el agente solo tiene una cuadrícula de 64×64 y unas pocas teclas a su disposición.

Los modelos de vanguardia enfrentados directamente no logran superarlo.

El modelo utilizado por AVO esta vez fue Claude Opus 5. Pero si lo evalúas solo, su puntuación es solo del 30.16%, y aún así es el primero en el ranking oficial certificado.

ARC Prize analizó los registros de partidas de la generación anterior y resumió tres tipos de errores típicos.

  • Primero, entendía lo local pero no lo global.
  • Segundo, adaptaba mecanismos desconocidos a juegos familiares.
  • Tercero, superaba un nivel pero no aprendía.

El tercer tipo es el más crítico. Opus alguna vez completó el primer nivel de ka59 en solo 37 pasos, pero su comprensión del mecanismo de clic estaba equivocada desde el principio. Al llegar al segundo nivel, se aferraba a esa teoría errónea y finalmente se quedó atascado.

El enfoque de NVIDIA fue no tocar el modelo, solo agregar una capa externa a su alrededor.

Así, el mismo Claude Opus 5 pasó directamente de una puntuación de 30 a la puntuación perfecta.

Entonces, X estalló. Por un lado, se llenó de mensajes como "ARC-AGI-3 ha caído" y "es hora de escalar un nuevo ranking", y por otro, la gente exclamaba lo increíble que fue este movimiento de NVIDIA.

Con este impulso, el próximo salto a nivel de modelo podría no depender de esperar un nuevo modelo, sino de una actualización del 'harness' (arnés).

El salto a 100 puntos, desglosado en solo dos elementos

¿Qué instaló NVIDIA alrededor del modelo para llenar estos tres vacíos de una vez?

Al igual que los recientemente populares DeepSeek Harness y Codex Harness, AVO también gestiona aspectos externos al modelo.

Esto incluye qué contexto proporcionarle, qué herramientas darle, cómo almacenar estados, cómo recibir retroalimentación, qué hacer si se atasca y cómo continuar después de que el contexto se llene, entre otras cosas.

En términos concretos de mecanismos, lo que realmente marcó la diferencia fueron dos elementos.

El primero es la memoria persistente.

El punto más crítico en tareas de largo plazo es que el contexto se llena.

Una vez lleno, la memoria del modelo se reinicia. Todo lo probado antes, qué caminos no funcionaron, qué resultados arrojó el profiler, todo se pierde.

En la siguiente ronda, vuelve a caer en los mismos errores desde el principio.

AVO, por otro lado, almacena todo esto: versiones anteriores de implementación, resultados de cada evaluación, salidas del compilador y del analizador, y el proceso de razonamiento acumulado.

Después de un reinicio del contexto, el agente continúa desde el estado actual, en lugar de reconstruir toda la búsqueda desde cero.

El segundo es el supervisor.

El agente principal se encarga del trabajo, decidiendo por sí mismo qué observar, qué modificar, qué probar y qué enviar.

El supervisor no trabaja, solo vigila toda la trayectoria de búsqueda. Una vez que detecta un estancamiento en el progreso, o que el agente principal comienza a dar vueltas en círculos haciendo trabajo inútil repetidamente, interviene para redirigir al agente principal hacia otras estrategias.

Hay otro detalle.

AVO ejecutó ARC-AGI-3 utilizando exclusivamente modalidad de texto puro. Cada observación de fotograma alimentada al modelo era una cuadrícula de texto precisa de 64×64, ni una sola imagen, ni un solo token visual fue enviado.

Es decir, en un juego lleno de píxeles, el modelo nunca vio una imagen.

El mecanismo que hizo esto posible produjo la hoja de resultados: 6624 pasos para completar 183 niveles y un RHAE perfecto.

La conclusión de NVIDIA es que la capacidad de largo plazo nunca ha sido una característica exclusiva del modelo, sino el resultado de la combinación de todo el sistema.

La memoria determina qué elementos persisten hasta la siguiente ronda, las herramientas determinan qué acciones puede realizar el agente, y la retroalimentación le permite saber si se está equivocando.

Y cuando una hipótesis es refutada, la capacidad de retroceder y continuar trabajando determina si la tarea puede llevarse a cabo de manera sostenida.

Primero revolucionó a NVIDIA misma

Lo interesante es que AVO no fue creado para jugar. Su campo de batalla principal es la optimización de operadores de GPU.

El 25 de marzo de este año, NVIDIA subió un artículo a arXiv titulado "AVO: Agente de Operador de Variación para Búsqueda Evolutiva Autónoma".

Dirección del artículo: https://arxiv.org/abs/2603.24517

Dos palabras en el título son clave: búsqueda evolutiva y operador de variación.

La búsqueda evolutiva en sí no es compleja. Se tiene un conjunto de códigos candidatos, se modifican, se ejecutan, se conserva la versión más rápida y luego se continúa modificando, generación tras generación.

El responsable del paso de "modificar" en los algoritmos evolutivos se llama operador de variación. En el pasado estaba predefinido, los métodos de modificación los establecían los humanos de antemano; más tarde se utilizaron LLMs para modificarlo, pero solo generaban un fragmento de código por ejecución.

El enfoque de AVO fue reemplazar todo el operador de variación con un agente autónomo.

De esta manera, no solo puede consultar guías de programación CUDA y documentos de arquitectura PTX, ejecutar pruebas, leer perfiles, sino también diagnosticar fallos de corrección por sí mismo y luego decidir qué modificar en la siguiente versión.

El equipo lo implementó en B200 con la tarea de optimizar el kernel de atención, uno de los operadores más exigidos en Transformer. Luego lo dejaron funcionar solo.

AVO ejecutó de forma autónoma y continua durante 7 días, explorando más de 500 direcciones de optimización, y finalmente presentó 40 versiones válidas del kernel.

El kernel de atención multi-cabeza resultante fue hasta 3.5% más rápido que el cuDNN propietario de NVIDIA, y hasta 10.5% más rápido que la implementación de código abierto más avanzada, FlashAttention-4.

Luego trasladó este conjunto de optimizaciones al GQA, actualmente predominante en los grandes modelos. Esta vez, después de solo unos 30 minutos de ejecución autónoma, el nuevo kernel fue un 7.0% más rápido que cuDNN y un 9.3% más rápido que FlashAttention-4.

Escribir kernels CUDA manualmente siempre ha sido una de las tareas con mayor barrera de entrada en este ecosistema, y AVO fue el primero en superarla.

Y esos 25 juegos de ARC-AGI-3 se ejecutan con este mismo sistema.

Ajustar kernels y jugar pueden parecer dos cosas completamente distintas. Pero para NVIDIA, bajo la superficie ambas ejecutan el mismo ciclo.

El agente primero formula una hipótesis a partir de evidencia incompleta, actúa para probarla, observa los resultados, almacena estados útiles y luego refina su comprensión del problema. Si la hipótesis es incorrecta, retrocede y reconsidera, y luego continúa iterando.

En palabras de NVIDIA, lo que se puede transferir no es el conocimiento del dominio, sino el mecanismo que mantiene la autonomía en tareas de largo plazo.

Quienes lo crearon fueron un equipo de base china

Si observas la lista de autores del artículo de AVO, verás una serie de nombres muy conocidos.

Con 23 firmas, prácticamente se reunieron a las figuras clave de la infraestructura de aprendizaje profundo de código abierto de la última década.

Uno de los primeros autores, Bing Xu, es Distinguished Engineer de NVIDIA y autor de MXNet. Incluso antes, fue el cuarto autor del artículo original de GAN de 2014, junto con el autor final Yoshua Bengio, ambos afiliados a la Universidad de Montreal.

Tianqi Chen, autor de TVM y XGBoost, también está en la lista. La línea de TVM también conecta con Luis Ceze; ambos fundaron OctoAI, que NVIDIA adquirió en septiembre de 2024, y Ceze luego se unió a NVIDIA para continuar trabajando en compiladores de aprendizaje automático.

Además, está Zi Hao Ye, autor de FlashInfer, y Vinod Grover, veterano del compilador CUDA.

Al frente está Humphrey Shi, Vicepresidente de IA de Alto Rendimiento en NVIDIA y también profesor en Georgia Tech. El otro primer autor, Zhifan Ye, es actualmente estudiante de doctorado en Georgia Tech.

El blog de esta ocasión tiene cinco nombres, cuatro de ellos chinos: además de Humphrey Shi, están Terry Chen, Zhifan Ye y Yeyin Zhu; el restante es Jean-Francois Puget, dos veces Gran Maestro Kaggle de NVIDIA.

Una de las partes más interesantes proviene de un relato previo de Bing Xu en X.

Hace un año y medio, cuando él y Terry Chen comenzaron a trabajar en programación de agentes en NVIDIA, ninguno de los dos entendía la programación de GPU.

Precisamente por no entender, desde el primer día se centraron en crear un sistema completamente automático, sin intervención humana, y le dieron a este enfoque el nombre de "programación a ciegas".

Un año y medio después, este sistema que no depende de instrucciones humanas superó a los kernels optimizados por expertos humanos durante meses.

Al final, la cuenta siempre termina en las tarjetas gráficas de Jensen Huang

¿Por qué una empresa que vende tarjetas gráficas dedicaría un año y medio a crear un agente que no requiere intervención humana?

Porque esta capa externa (el 'harness') se puede aplicar a cualquier modelo.

AVO ya se ha ejecutado en múltiples modelos. En los mismos niveles, combinado con GPT-5.6 Sol tomó menos tiempo, mientras que con Opus 5 utilizó menos pasos.

NVIDIA no gana dinero vendiendo modelos, pero puede mantener el control sobre esta capa. Esto es consistente con su estrategia general de los últimos años.

En el lado del modelo, se opta por el código abierto. Nemotron 4, lanzado en agosto de este año, apunta a una escala de billones de parámetros, se espera completar el entrenamiento en otoño, y el modelo se regalará, recuperando el dinero a través de las GPU y el stack de software posteriores.

En el lado de la potencia de cálculo, los agentes de largo plazo son exactamente el tipo de carga que más desean. La evaluación de Jensen Huang en GTC este año fue que el punto de inflexión de la inferencia ya ha llegado. En los últimos dos años, la demanda de potencia de cálculo aumentó aproximadamente diez mil veces, mientras que el uso solo aumentó aproximadamente cien veces; la diferencia fue absorbida por la inferencia.

Así que no importa de quién sea el modelo. Mientras los agentes realicen tareas cada vez más largas y complejas, la cuenta finalmente terminará en sus tarjetas gráficas.

En cuanto a las tres palabras "100 puntos", actualmente se están devaluando rápidamente.

En marzo, nadie podía alcanzar ni 1 punto. Tycho obtuvo la puntuación perfecta a fines de julio, VISTA la consiguió nuevamente el 5 de agosto, y la de AVO ya es la tercera en seis semanas, y las tres están impulsadas por Claude Opus 5.

Pero lo logrado por AVO no se verá reducido por ello.

Una arquitectura creada para exprimir los últimos puntos porcentuales de FlashAttention en B200 se trasladó casi sin cambios a un juego de píxeles, y funcionó.

Solo se intercambiaron la interfaz de tarea y el método de evaluación; el ciclo central no se modificó en absoluto.

Como escribió NVIDIA al final de su blog: El modelo es importante, pero el modelo no lo es todo para un agente.

Referencias:

https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/

Este artículo proviene del WeChat Official Account "新智元", autor: ASI启示录, editor: 摩西

Criptos en tendencia

Preguntas relacionadas

Q¿Qué logró el agente de codificación general AVO de NVIDIA en ARC-AGI-3?

AAVO obtuvo una puntuación perfecta de 100.00 en ARC-AGI-3, completando las 183 fases en 6624 pasos.

Q¿Cuáles son los dos mecanismos clave que permitieron a AVO superar los errores típicos y obtener un puntaje perfecto?

ALos dos mecanismos clave son la memoria persistente (que almacena estados y resultados pasados para evitar reinicios) y un supervisor (que redirige al agente principal cuando detecta estancamiento o repeticiones inútiles).

Q¿Para qué tarea principal fue diseñado originalmente AVO, según el artículo?

AAVO fue diseñado originalmente para la optimización de operadores de GPU, específicamente para optimizar kernels de CUDA como los de atención en transformadores, logrando mejoras de rendimiento frente a implementaciones de referencia.

Q¿Qué característica notable del equipo de desarrollo de AVO se destaca en el artículo?

AEl equipo de desarrollo tiene una fuerte base de investigadores y ingenieros chinos, incluyendo a Bing Xu (coautor de GAN y creador de MXNet), Tianqi Chen (creador de TVM y XGBoost), y otros expertos clave en infraestructura de aprendizaje profundo.

QSegún el artículo, ¿por qué es estratégicamente importante para NVIDIA desarrollar un sistema de agentes autónomos de largo horizonte como AVO?

APorque NVIDIA no depende de vender modelos propios, sino que puede proporcionar la capa de infraestructura (el "arnés") que funciona con cualquier modelo. Los agentes que realizan tareas más largas y complejas aumentan la demanda de potencia de cálculo, lo que finalmente se traduce en más ventas de sus GPU.

Lecturas Relacionadas

Interpretación del informe de Goldman Sachs: El retorno para los accionistas de Samsung Electronics no cumple con las expectativas, la expansión del FCF respalda la recuperación de la valoración

El plan de retribución a accionistas de Samsung Electronics ha decepcionado las expectativas a corto plazo del mercado. Goldman Sachs mantiene su recomendación de compra para las acciones ordinarias, con un precio objetivo de 490.000 wones, destacando que la verdadera base para una revalorización es la expansión continua del flujo de caja libre (FCF) y un mecanismo de retorno estable, no el tamaño de un pago único. La firma estima un acumulado de 270 billones de wones en FCF entre 2024 y 2026. Aplicando una política de retorno del 50%, calcula un pago total de aproximadamente 135 billones, con cerca de 106 billones correspondientes a 2026, en la parte alta de la guía anunciada por la compañía (90-110 billones). Este retorno se inclinará más hacia dividendos, estimándose unos 76 billones en dividendos para 2026 y el resto mediante recompra y cancelación de acciones. Aunque el plan a corto plazo parece menos ambicioso que el de algunos competidores, Goldman Sachs proyecta un fuerte crecimiento del FCF en 2027 y 2028 (179 y 232 billones de wones, respectivamente), lo que elevaría sustancialmente la capacidad de retribución futura. La valoración actual, que cotiza a 1.7x y 1.2x el valor contable proyectado para 2027 y 2028, se considera atractiva. La historia de retorno a accionistas de Samsung se perfila así como una mejora estructural, no como un evento aislado.

marsbitHace 20 min(s)

Interpretación del informe de Goldman Sachs: El retorno para los accionistas de Samsung Electronics no cumple con las expectativas, la expansión del FCF respalda la recuperación de la valoración

marsbitHace 20 min(s)

Trading

Spot

Artículos destacados

Cómo comprar ONE

¡Bienvenido a HTX.com! Hemos hecho que comprar Harmony (ONE) sea simple y conveniente. Sigue nuestra guía paso a paso para iniciar tu viaje de criptos.Paso 1: crea tu cuenta HTXUtiliza tu correo electrónico o número de teléfono para registrarte y obtener una cuenta gratuita en HTX. Experimenta un proceso de registro sin complicaciones y desbloquea todas las funciones.Obtener mi cuentaPaso 2: ve a Comprar cripto y elige tu método de pagoTarjeta de crédito/débito: usa tu Visa o Mastercard para comprar Harmony (ONE) al instante.Saldo: utiliza fondos del saldo de tu cuenta HTX para tradear sin problemas.Terceros: hemos agregado métodos de pago populares como Google Pay y Apple Pay para mejorar la comodidad.P2P: tradear directamente con otros usuarios en HTX.Over-the-Counter (OTC): ofrecemos servicios personalizados y tipos de cambio competitivos para los traders.Paso 3: guarda tu Harmony (ONE)Después de comprar tu Harmony (ONE), guárdalo en tu cuenta HTX. Alternativamente, puedes enviarlo a otro lugar mediante transferencia blockchain o utilizarlo para tradear otras criptomonedas.Paso 4: tradear Harmony (ONE)Tradear fácilmente con Harmony (ONE) en HTX's mercado spot. Simplemente accede a tu cuenta, selecciona tu par de trading, ejecuta tus trades y monitorea en tiempo real. Ofrecemos una experiencia fácil de usar tanto para principiantes como para traders experimentados.

863 Vistas totalesPublicado en 2024.12.12Actualizado en 2026.06.02

Cómo comprar ONE

Discusiones

Bienvenido a la comunidad de HTX. Aquí puedes mantenerte informado sobre los últimos desarrollos de la plataforma y acceder a análisis profesionales del mercado. A continuación se presentan las opiniones de los usuarios sobre el precio de ONE (ONE).

活动图片