NVIDIA arrasa en ARC-AGI-3 con su IA, el equipo chino resuelve 183 niveles de golpe

marsbitPublié le 2026-08-24Dernière mise à jour le 2026-08-24

Résumé

NVIDIA ha logrado un hito en inteligencia artificial con su agente de codificación universal AVO, que ha obtenido una puntuación perfecta de 100.00 en el exigente benchmark ARC-AGI-3. El sistema completó las 183 tareas de 25 entornos diferentes utilizando solo 6624 pasos. ARC-AGI-3 es conocido por su alta dificultad: arroja a los agentes a juegos desconocidos sin reglas ni objetivos claros, obligándolos a explorar, interactuar y deducir la mecánica por sí mismos. Mientras que modelos de vanguardia como Claude Opus 5 solo alcanzan un 30.16% actuando solos, AVO, que utiliza el mismo modelo central, logró el 100% gracias a una arquitectura externa inteligente. La clave del éxito de AVO radica en dos componentes principales fuera del modelo de lenguaje: 1. **Memoria persistente:** Almacena el historial de intentos, resultados, análisis y procesos de razonamiento, evitando que el agente cometa los mismos errores cuando se reinicia el contexto. 2. **Un supervisor:** Monitorea la búsqueda de soluciones e interviene cuando el agente principal se estanca o repite acciones inútiles, redirigiendo la estrategia. Notablemente, AVO procesó los entornos visuales en puro texto, recibiendo una cuadrícula de 64x64 caracteres en lugar de imágenes. Originalmente, AVO fue diseñado no para juegos, sino para la optimización autónoma de *kernels* de GPU. En un experimento, optimizó un *kernel* de atención para B200 durante 7 días, superando las implementaciones de NVIDIA cuDNN y FlashAttention...

¡Acaba de ocurrir! El agente de programación general de NVIDIA, AVO, ¡ha obtenido la puntuación perfecta en ARC-AGI-3!

Completó los 183 niveles en 25 entornos de juego, utilizando solo 6624 pasos, y alcanzó un RHAE de 100.00.

Hay que tener en cuenta que ARC-AGI-3 es famoso por no jugar limpio. Lanza al agente a un juego extraño sin darle reglas ni objetivos; tiene que pulsar, observar y adivinar por sí mismo.

En algunos entornos puedes moverte arriba, abajo, izquierda, derecha, deambulando por pasillos, chocas contra un bloque azul-negro y toda la pantalla gira 90 grados; otros no te permiten moverte, solo hacer clic, usando clicks para cambiar cíclicamente el color de las casillas hasta formar el patrón objetivo.

Cada entorno tiene al menos seis niveles, y cuanto más avanzas, más duros se vuelven. Un nivel que se podía completar en cinco pasos en la primera fase, podría requerir cincuenta pasos en la sexta.

Y el agente solo tiene una cuadrícula de 64×64 y unas pocas teclas a su disposición.

Los modelos de vanguardia enfrentados directamente no logran superarlo.

El modelo utilizado por AVO esta vez fue Claude Opus 5. Pero si lo evalúas solo, su puntuación es solo del 30.16%, y aún así es el primero en el ranking oficial certificado.

ARC Prize analizó los registros de partidas de la generación anterior y resumió tres tipos de errores típicos.

  • Primero, entendía lo local pero no lo global.
  • Segundo, adaptaba mecanismos desconocidos a juegos familiares.
  • Tercero, superaba un nivel pero no aprendía.

El tercer tipo es el más crítico. Opus alguna vez completó el primer nivel de ka59 en solo 37 pasos, pero su comprensión del mecanismo de clic estaba equivocada desde el principio. Al llegar al segundo nivel, se aferraba a esa teoría errónea y finalmente se quedó atascado.

El enfoque de NVIDIA fue no tocar el modelo, solo agregar una capa externa a su alrededor.

Así, el mismo Claude Opus 5 pasó directamente de una puntuación de 30 a la puntuación perfecta.

Entonces, X estalló. Por un lado, se llenó de mensajes como "ARC-AGI-3 ha caído" y "es hora de escalar un nuevo ranking", y por otro, la gente exclamaba lo increíble que fue este movimiento de NVIDIA.

Con este impulso, el próximo salto a nivel de modelo podría no depender de esperar un nuevo modelo, sino de una actualización del 'harness' (arnés).

El salto a 100 puntos, desglosado en solo dos elementos

¿Qué instaló NVIDIA alrededor del modelo para llenar estos tres vacíos de una vez?

Al igual que los recientemente populares DeepSeek Harness y Codex Harness, AVO también gestiona aspectos externos al modelo.

Esto incluye qué contexto proporcionarle, qué herramientas darle, cómo almacenar estados, cómo recibir retroalimentación, qué hacer si se atasca y cómo continuar después de que el contexto se llene, entre otras cosas.

En términos concretos de mecanismos, lo que realmente marcó la diferencia fueron dos elementos.

El primero es la memoria persistente.

El punto más crítico en tareas de largo plazo es que el contexto se llena.

Una vez lleno, la memoria del modelo se reinicia. Todo lo probado antes, qué caminos no funcionaron, qué resultados arrojó el profiler, todo se pierde.

En la siguiente ronda, vuelve a caer en los mismos errores desde el principio.

AVO, por otro lado, almacena todo esto: versiones anteriores de implementación, resultados de cada evaluación, salidas del compilador y del analizador, y el proceso de razonamiento acumulado.

Después de un reinicio del contexto, el agente continúa desde el estado actual, en lugar de reconstruir toda la búsqueda desde cero.

El segundo es el supervisor.

El agente principal se encarga del trabajo, decidiendo por sí mismo qué observar, qué modificar, qué probar y qué enviar.

El supervisor no trabaja, solo vigila toda la trayectoria de búsqueda. Una vez que detecta un estancamiento en el progreso, o que el agente principal comienza a dar vueltas en círculos haciendo trabajo inútil repetidamente, interviene para redirigir al agente principal hacia otras estrategias.

Hay otro detalle.

AVO ejecutó ARC-AGI-3 utilizando exclusivamente modalidad de texto puro. Cada observación de fotograma alimentada al modelo era una cuadrícula de texto precisa de 64×64, ni una sola imagen, ni un solo token visual fue enviado.

Es decir, en un juego lleno de píxeles, el modelo nunca vio una imagen.

El mecanismo que hizo esto posible produjo la hoja de resultados: 6624 pasos para completar 183 niveles y un RHAE perfecto.

La conclusión de NVIDIA es que la capacidad de largo plazo nunca ha sido una característica exclusiva del modelo, sino el resultado de la combinación de todo el sistema.

La memoria determina qué elementos persisten hasta la siguiente ronda, las herramientas determinan qué acciones puede realizar el agente, y la retroalimentación le permite saber si se está equivocando.

Y cuando una hipótesis es refutada, la capacidad de retroceder y continuar trabajando determina si la tarea puede llevarse a cabo de manera sostenida.

Primero revolucionó a NVIDIA misma

Lo interesante es que AVO no fue creado para jugar. Su campo de batalla principal es la optimización de operadores de GPU.

El 25 de marzo de este año, NVIDIA subió un artículo a arXiv titulado "AVO: Agente de Operador de Variación para Búsqueda Evolutiva Autónoma".

Dirección del artículo: https://arxiv.org/abs/2603.24517

Dos palabras en el título son clave: búsqueda evolutiva y operador de variación.

La búsqueda evolutiva en sí no es compleja. Se tiene un conjunto de códigos candidatos, se modifican, se ejecutan, se conserva la versión más rápida y luego se continúa modificando, generación tras generación.

El responsable del paso de "modificar" en los algoritmos evolutivos se llama operador de variación. En el pasado estaba predefinido, los métodos de modificación los establecían los humanos de antemano; más tarde se utilizaron LLMs para modificarlo, pero solo generaban un fragmento de código por ejecución.

El enfoque de AVO fue reemplazar todo el operador de variación con un agente autónomo.

De esta manera, no solo puede consultar guías de programación CUDA y documentos de arquitectura PTX, ejecutar pruebas, leer perfiles, sino también diagnosticar fallos de corrección por sí mismo y luego decidir qué modificar en la siguiente versión.

El equipo lo implementó en B200 con la tarea de optimizar el kernel de atención, uno de los operadores más exigidos en Transformer. Luego lo dejaron funcionar solo.

AVO ejecutó de forma autónoma y continua durante 7 días, explorando más de 500 direcciones de optimización, y finalmente presentó 40 versiones válidas del kernel.

El kernel de atención multi-cabeza resultante fue hasta 3.5% más rápido que el cuDNN propietario de NVIDIA, y hasta 10.5% más rápido que la implementación de código abierto más avanzada, FlashAttention-4.

Luego trasladó este conjunto de optimizaciones al GQA, actualmente predominante en los grandes modelos. Esta vez, después de solo unos 30 minutos de ejecución autónoma, el nuevo kernel fue un 7.0% más rápido que cuDNN y un 9.3% más rápido que FlashAttention-4.

Escribir kernels CUDA manualmente siempre ha sido una de las tareas con mayor barrera de entrada en este ecosistema, y AVO fue el primero en superarla.

Y esos 25 juegos de ARC-AGI-3 se ejecutan con este mismo sistema.

Ajustar kernels y jugar pueden parecer dos cosas completamente distintas. Pero para NVIDIA, bajo la superficie ambas ejecutan el mismo ciclo.

El agente primero formula una hipótesis a partir de evidencia incompleta, actúa para probarla, observa los resultados, almacena estados útiles y luego refina su comprensión del problema. Si la hipótesis es incorrecta, retrocede y reconsidera, y luego continúa iterando.

En palabras de NVIDIA, lo que se puede transferir no es el conocimiento del dominio, sino el mecanismo que mantiene la autonomía en tareas de largo plazo.

Quienes lo crearon fueron un equipo de base china

Si observas la lista de autores del artículo de AVO, verás una serie de nombres muy conocidos.

Con 23 firmas, prácticamente se reunieron a las figuras clave de la infraestructura de aprendizaje profundo de código abierto de la última década.

Uno de los primeros autores, Bing Xu, es Distinguished Engineer de NVIDIA y autor de MXNet. Incluso antes, fue el cuarto autor del artículo original de GAN de 2014, junto con el autor final Yoshua Bengio, ambos afiliados a la Universidad de Montreal.

Tianqi Chen, autor de TVM y XGBoost, también está en la lista. La línea de TVM también conecta con Luis Ceze; ambos fundaron OctoAI, que NVIDIA adquirió en septiembre de 2024, y Ceze luego se unió a NVIDIA para continuar trabajando en compiladores de aprendizaje automático.

Además, está Zi Hao Ye, autor de FlashInfer, y Vinod Grover, veterano del compilador CUDA.

Al frente está Humphrey Shi, Vicepresidente de IA de Alto Rendimiento en NVIDIA y también profesor en Georgia Tech. El otro primer autor, Zhifan Ye, es actualmente estudiante de doctorado en Georgia Tech.

El blog de esta ocasión tiene cinco nombres, cuatro de ellos chinos: además de Humphrey Shi, están Terry Chen, Zhifan Ye y Yeyin Zhu; el restante es Jean-Francois Puget, dos veces Gran Maestro Kaggle de NVIDIA.

Una de las partes más interesantes proviene de un relato previo de Bing Xu en X.

Hace un año y medio, cuando él y Terry Chen comenzaron a trabajar en programación de agentes en NVIDIA, ninguno de los dos entendía la programación de GPU.

Precisamente por no entender, desde el primer día se centraron en crear un sistema completamente automático, sin intervención humana, y le dieron a este enfoque el nombre de "programación a ciegas".

Un año y medio después, este sistema que no depende de instrucciones humanas superó a los kernels optimizados por expertos humanos durante meses.

Al final, la cuenta siempre termina en las tarjetas gráficas de Jensen Huang

¿Por qué una empresa que vende tarjetas gráficas dedicaría un año y medio a crear un agente que no requiere intervención humana?

Porque esta capa externa (el 'harness') se puede aplicar a cualquier modelo.

AVO ya se ha ejecutado en múltiples modelos. En los mismos niveles, combinado con GPT-5.6 Sol tomó menos tiempo, mientras que con Opus 5 utilizó menos pasos.

NVIDIA no gana dinero vendiendo modelos, pero puede mantener el control sobre esta capa. Esto es consistente con su estrategia general de los últimos años.

En el lado del modelo, se opta por el código abierto. Nemotron 4, lanzado en agosto de este año, apunta a una escala de billones de parámetros, se espera completar el entrenamiento en otoño, y el modelo se regalará, recuperando el dinero a través de las GPU y el stack de software posteriores.

En el lado de la potencia de cálculo, los agentes de largo plazo son exactamente el tipo de carga que más desean. La evaluación de Jensen Huang en GTC este año fue que el punto de inflexión de la inferencia ya ha llegado. En los últimos dos años, la demanda de potencia de cálculo aumentó aproximadamente diez mil veces, mientras que el uso solo aumentó aproximadamente cien veces; la diferencia fue absorbida por la inferencia.

Así que no importa de quién sea el modelo. Mientras los agentes realicen tareas cada vez más largas y complejas, la cuenta finalmente terminará en sus tarjetas gráficas.

En cuanto a las tres palabras "100 puntos", actualmente se están devaluando rápidamente.

En marzo, nadie podía alcanzar ni 1 punto. Tycho obtuvo la puntuación perfecta a fines de julio, VISTA la consiguió nuevamente el 5 de agosto, y la de AVO ya es la tercera en seis semanas, y las tres están impulsadas por Claude Opus 5.

Pero lo logrado por AVO no se verá reducido por ello.

Una arquitectura creada para exprimir los últimos puntos porcentuales de FlashAttention en B200 se trasladó casi sin cambios a un juego de píxeles, y funcionó.

Solo se intercambiaron la interfaz de tarea y el método de evaluación; el ciclo central no se modificó en absoluto.

Como escribió NVIDIA al final de su blog: El modelo es importante, pero el modelo no lo es todo para un agente.

Referencias:

https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/

Este artículo proviene del WeChat Official Account "新智元", autor: ASI启示录, editor: 摩西

Cryptos en tendance

Questions liées

Q¿Qué logró el agente de codificación general AVO de NVIDIA en ARC-AGI-3?

AAVO obtuvo una puntuación perfecta de 100.00 en ARC-AGI-3, completando las 183 fases en 6624 pasos.

Q¿Cuáles son los dos mecanismos clave que permitieron a AVO superar los errores típicos y obtener un puntaje perfecto?

ALos dos mecanismos clave son la memoria persistente (que almacena estados y resultados pasados para evitar reinicios) y un supervisor (que redirige al agente principal cuando detecta estancamiento o repeticiones inútiles).

Q¿Para qué tarea principal fue diseñado originalmente AVO, según el artículo?

AAVO fue diseñado originalmente para la optimización de operadores de GPU, específicamente para optimizar kernels de CUDA como los de atención en transformadores, logrando mejoras de rendimiento frente a implementaciones de referencia.

Q¿Qué característica notable del equipo de desarrollo de AVO se destaca en el artículo?

AEl equipo de desarrollo tiene una fuerte base de investigadores y ingenieros chinos, incluyendo a Bing Xu (coautor de GAN y creador de MXNet), Tianqi Chen (creador de TVM y XGBoost), y otros expertos clave en infraestructura de aprendizaje profundo.

QSegún el artículo, ¿por qué es estratégicamente importante para NVIDIA desarrollar un sistema de agentes autónomos de largo horizonte como AVO?

APorque NVIDIA no depende de vender modelos propios, sino que puede proporcionar la capa de infraestructura (el "arnés") que funciona con cualquier modelo. Los agentes que realizan tareas más largas y complejas aumentan la demanda de potencia de cálculo, lo que finalmente se traduce en más ventas de sus GPU.

Lectures associées

La récente flambée du Bitcoin : est-ce une bénédiction ou un piège ?

Ces derniers jours, le Bitcoin a connu une hausse fulgurante, passant d'environ 63 000 à près de 80 000 dollars. Selon l'analyse de Glassnode, cette progression n'est pas uniquement due à une faible liquidité, mais est soutenue par un véritable afflux de capitaux. Des achats agressifs sur les marchés au comptant, une augmentation des volumes d'échange, un renforcement de la liquidité et une demande institutionnelle en sont les principaux moteurs. Les données du marché des produits dérivés indiquent un tournant vers des stratégies de gestion des risques plus agressives, avec un flux net d'achats significatif sur le marché des contrats perpétuels. Cependant, l'augmentation substantielle des positions ouvertes sur les contrats à terme révèle également une participation spéculative croissante et un recours accru à l'effet de levier. L'intérêt institutionnel se confirme, avec des volumes d'échange des ETF Bitcoin et des entrées nettes hebdomadaires dépassant largement les seuils historiques. Les données blockchain montrent une accélération de l'activité des utilisateurs et des transferts économiques, accompagnée d'une nette amélioration de la rentabilité. Les investisseurs réalisent davantage de profits. Toutefois, Glassnode tempère cet optimisme. Les indicateurs de « capital chaud » (capitaux à court terme sensibles aux prix) dépassent leurs fourchettes statistiques hautes, tandis que les entrées de capitaux à l'échelle macroéconomique restent limitées. La plateforme conclut que la hausse actuelle est davantage portée par l'activité des investisseurs à court terme, le positionnement tactique et l'appétit spéculatif, que par une accumulation de capital à long terme et soutenable.

cryptonews.ruIl y a 1 h

La récente flambée du Bitcoin : est-ce une bénédiction ou un piège ?

cryptonews.ruIl y a 1 h

Trading

Spot

Articles tendance

Comment acheter ONE

Bienvenue sur HTX.com ! Nous vous permettons d'acheter Harmony (ONE) de manière simple et pratique. Suivez notre guide étape par étape pour commencer votre parcours crypto.Étape 1 : Création de votre compte HTXUtilisez votre adresse e-mail ou votre numéro de téléphone pour ouvrir un compte sur HTX gratuitement. L'inscription se fait en toute simplicité et débloque toutes les fonctionnalités.Créer mon compteÉtape 2 : Choix du mode de paiement (rubrique Acheter des cryptosCarte de crédit/débit : utilisez votre carte Visa ou Mastercard pour acheter instantanément Harmony (ONE).Solde :utilisez les fonds du solde de votre compte HTX pour trader en toute simplicité.Prestataire tiers :pour accroître la commodité d'utilisation, nous avons ajouté des modes de paiement populaires tels que Google Pay et Apple Pay.P2P :tradez directement avec d'autres utilisateurs sur HTX.OTC (de gré à gré) : nous offrons des services personnalisés et des taux de change compétitifs aux traders.Étape 3 : stockage de vos Harmony (ONE)Après avoir acheté vos Harmony (ONE), stockez-les sur votre compte HTX. Vous pouvez également les envoyer ailleurs via un transfert sur la blockchain ou les utiliser pour trader d'autres cryptos.Étape 4 : tradez des Harmony (ONE)Tradez facilement Harmony (ONE) sur le marché Spot de HTX. Il vous suffit d'accéder à votre compte, de sélectionner la paire de trading, d'exécuter vos trades et de les suivre en temps réel. Nous offrons une expérience conviviale aux débutants comme aux traders chevronnés.

696 vues totalesPublié le 2024.12.12Mis à jour le 2026.06.02

Comment acheter ONE

Discussions

Bienvenue dans la Communauté HTX. Ici, vous pouvez vous tenir informé(e) des derniers développements de la plateforme et accéder à des analyses de marché professionnelles. Les opinions des utilisateurs sur le prix de ONE (ONE) sont présentées ci-dessous.

活动图片