NVIDIA arrasa en ARC-AGI-3 con su IA, el equipo chino resuelve 183 niveles de golpe

marsbitОпубліковано о 2026-08-24Востаннє оновлено о 2026-08-24

Анотація

NVIDIA ha logrado un hito en inteligencia artificial con su agente de codificación universal AVO, que ha obtenido una puntuación perfecta de 100.00 en el exigente benchmark ARC-AGI-3. El sistema completó las 183 tareas de 25 entornos diferentes utilizando solo 6624 pasos. ARC-AGI-3 es conocido por su alta dificultad: arroja a los agentes a juegos desconocidos sin reglas ni objetivos claros, obligándolos a explorar, interactuar y deducir la mecánica por sí mismos. Mientras que modelos de vanguardia como Claude Opus 5 solo alcanzan un 30.16% actuando solos, AVO, que utiliza el mismo modelo central, logró el 100% gracias a una arquitectura externa inteligente. La clave del éxito de AVO radica en dos componentes principales fuera del modelo de lenguaje: 1. **Memoria persistente:** Almacena el historial de intentos, resultados, análisis y procesos de razonamiento, evitando que el agente cometa los mismos errores cuando se reinicia el contexto. 2. **Un supervisor:** Monitorea la búsqueda de soluciones e interviene cuando el agente principal se estanca o repite acciones inútiles, redirigiendo la estrategia. Notablemente, AVO procesó los entornos visuales en puro texto, recibiendo una cuadrícula de 64x64 caracteres en lugar de imágenes. Originalmente, AVO fue diseñado no para juegos, sino para la optimización autónoma de *kernels* de GPU. En un experimento, optimizó un *kernel* de atención para B200 durante 7 días, superando las implementaciones de NVIDIA cuDNN y FlashAttention...

¡Acaba de ocurrir! El agente de programación general de NVIDIA, AVO, ¡ha obtenido la puntuación perfecta en ARC-AGI-3!

Completó los 183 niveles en 25 entornos de juego, utilizando solo 6624 pasos, y alcanzó un RHAE de 100.00.

Hay que tener en cuenta que ARC-AGI-3 es famoso por no jugar limpio. Lanza al agente a un juego extraño sin darle reglas ni objetivos; tiene que pulsar, observar y adivinar por sí mismo.

En algunos entornos puedes moverte arriba, abajo, izquierda, derecha, deambulando por pasillos, chocas contra un bloque azul-negro y toda la pantalla gira 90 grados; otros no te permiten moverte, solo hacer clic, usando clicks para cambiar cíclicamente el color de las casillas hasta formar el patrón objetivo.

Cada entorno tiene al menos seis niveles, y cuanto más avanzas, más duros se vuelven. Un nivel que se podía completar en cinco pasos en la primera fase, podría requerir cincuenta pasos en la sexta.

Y el agente solo tiene una cuadrícula de 64×64 y unas pocas teclas a su disposición.

Los modelos de vanguardia enfrentados directamente no logran superarlo.

El modelo utilizado por AVO esta vez fue Claude Opus 5. Pero si lo evalúas solo, su puntuación es solo del 30.16%, y aún así es el primero en el ranking oficial certificado.

ARC Prize analizó los registros de partidas de la generación anterior y resumió tres tipos de errores típicos.

  • Primero, entendía lo local pero no lo global.
  • Segundo, adaptaba mecanismos desconocidos a juegos familiares.
  • Tercero, superaba un nivel pero no aprendía.

El tercer tipo es el más crítico. Opus alguna vez completó el primer nivel de ka59 en solo 37 pasos, pero su comprensión del mecanismo de clic estaba equivocada desde el principio. Al llegar al segundo nivel, se aferraba a esa teoría errónea y finalmente se quedó atascado.

El enfoque de NVIDIA fue no tocar el modelo, solo agregar una capa externa a su alrededor.

Así, el mismo Claude Opus 5 pasó directamente de una puntuación de 30 a la puntuación perfecta.

Entonces, X estalló. Por un lado, se llenó de mensajes como "ARC-AGI-3 ha caído" y "es hora de escalar un nuevo ranking", y por otro, la gente exclamaba lo increíble que fue este movimiento de NVIDIA.

Con este impulso, el próximo salto a nivel de modelo podría no depender de esperar un nuevo modelo, sino de una actualización del 'harness' (arnés).

El salto a 100 puntos, desglosado en solo dos elementos

¿Qué instaló NVIDIA alrededor del modelo para llenar estos tres vacíos de una vez?

Al igual que los recientemente populares DeepSeek Harness y Codex Harness, AVO también gestiona aspectos externos al modelo.

Esto incluye qué contexto proporcionarle, qué herramientas darle, cómo almacenar estados, cómo recibir retroalimentación, qué hacer si se atasca y cómo continuar después de que el contexto se llene, entre otras cosas.

En términos concretos de mecanismos, lo que realmente marcó la diferencia fueron dos elementos.

El primero es la memoria persistente.

El punto más crítico en tareas de largo plazo es que el contexto se llena.

Una vez lleno, la memoria del modelo se reinicia. Todo lo probado antes, qué caminos no funcionaron, qué resultados arrojó el profiler, todo se pierde.

En la siguiente ronda, vuelve a caer en los mismos errores desde el principio.

AVO, por otro lado, almacena todo esto: versiones anteriores de implementación, resultados de cada evaluación, salidas del compilador y del analizador, y el proceso de razonamiento acumulado.

Después de un reinicio del contexto, el agente continúa desde el estado actual, en lugar de reconstruir toda la búsqueda desde cero.

El segundo es el supervisor.

El agente principal se encarga del trabajo, decidiendo por sí mismo qué observar, qué modificar, qué probar y qué enviar.

El supervisor no trabaja, solo vigila toda la trayectoria de búsqueda. Una vez que detecta un estancamiento en el progreso, o que el agente principal comienza a dar vueltas en círculos haciendo trabajo inútil repetidamente, interviene para redirigir al agente principal hacia otras estrategias.

Hay otro detalle.

AVO ejecutó ARC-AGI-3 utilizando exclusivamente modalidad de texto puro. Cada observación de fotograma alimentada al modelo era una cuadrícula de texto precisa de 64×64, ni una sola imagen, ni un solo token visual fue enviado.

Es decir, en un juego lleno de píxeles, el modelo nunca vio una imagen.

El mecanismo que hizo esto posible produjo la hoja de resultados: 6624 pasos para completar 183 niveles y un RHAE perfecto.

La conclusión de NVIDIA es que la capacidad de largo plazo nunca ha sido una característica exclusiva del modelo, sino el resultado de la combinación de todo el sistema.

La memoria determina qué elementos persisten hasta la siguiente ronda, las herramientas determinan qué acciones puede realizar el agente, y la retroalimentación le permite saber si se está equivocando.

Y cuando una hipótesis es refutada, la capacidad de retroceder y continuar trabajando determina si la tarea puede llevarse a cabo de manera sostenida.

Primero revolucionó a NVIDIA misma

Lo interesante es que AVO no fue creado para jugar. Su campo de batalla principal es la optimización de operadores de GPU.

El 25 de marzo de este año, NVIDIA subió un artículo a arXiv titulado "AVO: Agente de Operador de Variación para Búsqueda Evolutiva Autónoma".

Dirección del artículo: https://arxiv.org/abs/2603.24517

Dos palabras en el título son clave: búsqueda evolutiva y operador de variación.

La búsqueda evolutiva en sí no es compleja. Se tiene un conjunto de códigos candidatos, se modifican, se ejecutan, se conserva la versión más rápida y luego se continúa modificando, generación tras generación.

El responsable del paso de "modificar" en los algoritmos evolutivos se llama operador de variación. En el pasado estaba predefinido, los métodos de modificación los establecían los humanos de antemano; más tarde se utilizaron LLMs para modificarlo, pero solo generaban un fragmento de código por ejecución.

El enfoque de AVO fue reemplazar todo el operador de variación con un agente autónomo.

De esta manera, no solo puede consultar guías de programación CUDA y documentos de arquitectura PTX, ejecutar pruebas, leer perfiles, sino también diagnosticar fallos de corrección por sí mismo y luego decidir qué modificar en la siguiente versión.

El equipo lo implementó en B200 con la tarea de optimizar el kernel de atención, uno de los operadores más exigidos en Transformer. Luego lo dejaron funcionar solo.

AVO ejecutó de forma autónoma y continua durante 7 días, explorando más de 500 direcciones de optimización, y finalmente presentó 40 versiones válidas del kernel.

El kernel de atención multi-cabeza resultante fue hasta 3.5% más rápido que el cuDNN propietario de NVIDIA, y hasta 10.5% más rápido que la implementación de código abierto más avanzada, FlashAttention-4.

Luego trasladó este conjunto de optimizaciones al GQA, actualmente predominante en los grandes modelos. Esta vez, después de solo unos 30 minutos de ejecución autónoma, el nuevo kernel fue un 7.0% más rápido que cuDNN y un 9.3% más rápido que FlashAttention-4.

Escribir kernels CUDA manualmente siempre ha sido una de las tareas con mayor barrera de entrada en este ecosistema, y AVO fue el primero en superarla.

Y esos 25 juegos de ARC-AGI-3 se ejecutan con este mismo sistema.

Ajustar kernels y jugar pueden parecer dos cosas completamente distintas. Pero para NVIDIA, bajo la superficie ambas ejecutan el mismo ciclo.

El agente primero formula una hipótesis a partir de evidencia incompleta, actúa para probarla, observa los resultados, almacena estados útiles y luego refina su comprensión del problema. Si la hipótesis es incorrecta, retrocede y reconsidera, y luego continúa iterando.

En palabras de NVIDIA, lo que se puede transferir no es el conocimiento del dominio, sino el mecanismo que mantiene la autonomía en tareas de largo plazo.

Quienes lo crearon fueron un equipo de base china

Si observas la lista de autores del artículo de AVO, verás una serie de nombres muy conocidos.

Con 23 firmas, prácticamente se reunieron a las figuras clave de la infraestructura de aprendizaje profundo de código abierto de la última década.

Uno de los primeros autores, Bing Xu, es Distinguished Engineer de NVIDIA y autor de MXNet. Incluso antes, fue el cuarto autor del artículo original de GAN de 2014, junto con el autor final Yoshua Bengio, ambos afiliados a la Universidad de Montreal.

Tianqi Chen, autor de TVM y XGBoost, también está en la lista. La línea de TVM también conecta con Luis Ceze; ambos fundaron OctoAI, que NVIDIA adquirió en septiembre de 2024, y Ceze luego se unió a NVIDIA para continuar trabajando en compiladores de aprendizaje automático.

Además, está Zi Hao Ye, autor de FlashInfer, y Vinod Grover, veterano del compilador CUDA.

Al frente está Humphrey Shi, Vicepresidente de IA de Alto Rendimiento en NVIDIA y también profesor en Georgia Tech. El otro primer autor, Zhifan Ye, es actualmente estudiante de doctorado en Georgia Tech.

El blog de esta ocasión tiene cinco nombres, cuatro de ellos chinos: además de Humphrey Shi, están Terry Chen, Zhifan Ye y Yeyin Zhu; el restante es Jean-Francois Puget, dos veces Gran Maestro Kaggle de NVIDIA.

Una de las partes más interesantes proviene de un relato previo de Bing Xu en X.

Hace un año y medio, cuando él y Terry Chen comenzaron a trabajar en programación de agentes en NVIDIA, ninguno de los dos entendía la programación de GPU.

Precisamente por no entender, desde el primer día se centraron en crear un sistema completamente automático, sin intervención humana, y le dieron a este enfoque el nombre de "programación a ciegas".

Un año y medio después, este sistema que no depende de instrucciones humanas superó a los kernels optimizados por expertos humanos durante meses.

Al final, la cuenta siempre termina en las tarjetas gráficas de Jensen Huang

¿Por qué una empresa que vende tarjetas gráficas dedicaría un año y medio a crear un agente que no requiere intervención humana?

Porque esta capa externa (el 'harness') se puede aplicar a cualquier modelo.

AVO ya se ha ejecutado en múltiples modelos. En los mismos niveles, combinado con GPT-5.6 Sol tomó menos tiempo, mientras que con Opus 5 utilizó menos pasos.

NVIDIA no gana dinero vendiendo modelos, pero puede mantener el control sobre esta capa. Esto es consistente con su estrategia general de los últimos años.

En el lado del modelo, se opta por el código abierto. Nemotron 4, lanzado en agosto de este año, apunta a una escala de billones de parámetros, se espera completar el entrenamiento en otoño, y el modelo se regalará, recuperando el dinero a través de las GPU y el stack de software posteriores.

En el lado de la potencia de cálculo, los agentes de largo plazo son exactamente el tipo de carga que más desean. La evaluación de Jensen Huang en GTC este año fue que el punto de inflexión de la inferencia ya ha llegado. En los últimos dos años, la demanda de potencia de cálculo aumentó aproximadamente diez mil veces, mientras que el uso solo aumentó aproximadamente cien veces; la diferencia fue absorbida por la inferencia.

Así que no importa de quién sea el modelo. Mientras los agentes realicen tareas cada vez más largas y complejas, la cuenta finalmente terminará en sus tarjetas gráficas.

En cuanto a las tres palabras "100 puntos", actualmente se están devaluando rápidamente.

En marzo, nadie podía alcanzar ni 1 punto. Tycho obtuvo la puntuación perfecta a fines de julio, VISTA la consiguió nuevamente el 5 de agosto, y la de AVO ya es la tercera en seis semanas, y las tres están impulsadas por Claude Opus 5.

Pero lo logrado por AVO no se verá reducido por ello.

Una arquitectura creada para exprimir los últimos puntos porcentuales de FlashAttention en B200 se trasladó casi sin cambios a un juego de píxeles, y funcionó.

Solo se intercambiaron la interfaz de tarea y el método de evaluación; el ciclo central no se modificó en absoluto.

Como escribió NVIDIA al final de su blog: El modelo es importante, pero el modelo no lo es todo para un agente.

Referencias:

https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/

Este artículo proviene del WeChat Official Account "新智元", autor: ASI启示录, editor: 摩西

Трендові криптовалюти

Пов'язані питання

Q¿Qué logró el agente de codificación general AVO de NVIDIA en ARC-AGI-3?

AAVO obtuvo una puntuación perfecta de 100.00 en ARC-AGI-3, completando las 183 fases en 6624 pasos.

Q¿Cuáles son los dos mecanismos clave que permitieron a AVO superar los errores típicos y obtener un puntaje perfecto?

ALos dos mecanismos clave son la memoria persistente (que almacena estados y resultados pasados para evitar reinicios) y un supervisor (que redirige al agente principal cuando detecta estancamiento o repeticiones inútiles).

Q¿Para qué tarea principal fue diseñado originalmente AVO, según el artículo?

AAVO fue diseñado originalmente para la optimización de operadores de GPU, específicamente para optimizar kernels de CUDA como los de atención en transformadores, logrando mejoras de rendimiento frente a implementaciones de referencia.

Q¿Qué característica notable del equipo de desarrollo de AVO se destaca en el artículo?

AEl equipo de desarrollo tiene una fuerte base de investigadores y ingenieros chinos, incluyendo a Bing Xu (coautor de GAN y creador de MXNet), Tianqi Chen (creador de TVM y XGBoost), y otros expertos clave en infraestructura de aprendizaje profundo.

QSegún el artículo, ¿por qué es estratégicamente importante para NVIDIA desarrollar un sistema de agentes autónomos de largo horizonte como AVO?

APorque NVIDIA no depende de vender modelos propios, sino que puede proporcionar la capa de infraestructura (el "arnés") que funciona con cualquier modelo. Los agentes que realizan tareas más largas y complejas aumentan la demanda de potencia de cálculo, lo que finalmente se traduce en más ventas de sus GPU.

Пов'язані матеріали

Is Bitcoin's Recent Surge a Blessing or a Trap?

Bitcoin recently surged from around $63,000 to almost $80,000. According to Glassnode, this rally is not solely due to low liquidity but driven by real capital inflows. Key factors include aggressive spot market buying, increased trading volumes, improved market depth, and significant institutional demand, as evidenced by high volumes and inflows into spot Bitcoin ETFs. Derivatives market data shows investors adopting more aggressive risk management, with strong perpetual futures buying. However, a substantial increase in futures open interest points to heightened speculative activity and leverage use. On-chain metrics support the bullish activity, with growth in active addresses and asset-adjusted transfer volume, indicating accelerated user and economic activity within the network. Investor profitability has also improved significantly, with both unrealized and realized profits rising well above historical averages. This is shifting investor behavior toward profit-taking rather than loss-selling. However, Glassnode cautions that the current market structure is not yet fully based on long-term capital accumulation. It notes that "hot capital," representing short-term, price-sensitive funds, is elevated, while macroeconomic-scale capital inflows remain relatively limited. The rally appears to be supported more by active short-term investors, tactical positioning, and growing speculative appetite than by sustained, long-term accumulation.

cryptonews.ru1 год тому

Is Bitcoin's Recent Surge a Blessing or a Trap?

cryptonews.ru1 год тому

Bitcoin Reaches $80,000: Three Arguments Against a Bull Market

Bitcoin reached $80,000 on August 24, 2026, a 38% rise from its July low of $57,800. While this surge is notable, analyst Rekt Capital presents three arguments against it signaling a true bull market reversal, suggesting it may instead be a rally within a broader bear market. First, if July 2026 was the bear market bottom, its formation time was 27% shorter than historical averages, a conclusion only valid if no new lower low forms by year-end. Second, Bitcoin broke down from a macro triangle pattern in July, but the subsequent ~30% drop was significantly smaller than the 48-62% declines seen after similar breakdowns in past cycles. Third, and crucially, the price has failed to break the long-term descending trendline from early 2025 highs, meaning Bitcoin is still making lower highs on macro timeframes, indicating underlying weakness. Rekt Capital notes the dynamic trendline resistance is near $79,000 this month, dropping to ~$76,300 next month. A monthly close below it could open the door for a correction. On weekly charts, resistance sits at $74.5k-$83.5k, with support at $62.5k-$68.5k. Adding another perspective, Crypto Rover highlights two key liquidation levels on Bitcoin's heatmap: a cluster of short positions at $80k-$90k (which could fuel a squeeze higher) and a concentration of long positions at $48k-$60k, acting as competing price "magnets." The article contrasts Rekt Capital's current cautious stance with his past calls in 2025, noting he correctly identified market direction but underestimated the scale of both the subsequent spring rally and the following autumn/winter decline. His current analysis again emphasizes macro weakness despite the recent price rise.

cryptonews.ru2 год тому

Bitcoin Reaches $80,000: Three Arguments Against a Bull Market

cryptonews.ru2 год тому

Торгівля

Спот

Популярні статті

Як купити ONE

Ласкаво просимо до HTX.com! Ми зробили покупку Harmony (ONE) простою та зручною. Дотримуйтесь нашої покрокової інструкції, щоб розпочати свою криптовалютну подорож.Крок 1: Створіть обліковий запис на HTXВикористовуйте свою електронну пошту або номер телефону, щоб зареєструвати обліковий запис на HTX безплатно. Пройдіть безпроблемну реєстрацію й отримайте доступ до всіх функцій.ЗареєструватисьКрок 2: Перейдіть до розділу Купити крипту і виберіть спосіб оплатиКредитна/дебетова картка: використовуйте вашу картку Visa або Mastercard, щоб миттєво купити Harmony (ONE).Баланс: використовуйте кошти з балансу вашого рахунку HTX для безперешкодної торгівлі.Треті особи: ми додали популярні способи оплати, такі як Google Pay та Apple Pay, щоб підвищити зручність.P2P: Торгуйте безпосередньо з іншими користувачами на HTX.Позабіржова торгівля (OTC): ми пропонуємо індивідуальні послуги та конкурентні обмінні курси для трейдерів.Крок 3: Зберігайте свої Harmony (ONE)Після придбання Harmony (ONE) збережіть його у своєму обліковому записі на HTX. Крім того, ви можете відправити його в інше місце за допомогою блокчейн-переказу або використовувати його для торгівлі іншими криптовалютами.Крок 4: Торгівля Harmony (ONE)Легко торгуйте Harmony (ONE) на спотовому ринку HTX. Просто увійдіть до свого облікового запису, виберіть торгову пару, укладайте угоди та спостерігайте за ними в режимі реального часу. Ми пропонуємо зручний досвід як для початківців, так і для досвідчених трейдерів.

626 переглядів усьогоОпубліковано 2024.12.12Оновлено 2026.06.02

Як купити ONE

Обговорення

Ласкаво просимо до спільноти HTX. Тут ви можете бути в курсі останніх подій розвитку платформи та отримати доступ до професійної ринкової інформації. Нижче представлені думки користувачів щодо ціни ONE (ONE).

活动图片