NVIDIA arrasa en ARC-AGI-3 con su IA, el equipo chino resuelve 183 niveles de golpe

marsbit发布于2026-08-24更新于2026-08-24

文章摘要

NVIDIA ha logrado un hito en inteligencia artificial con su agente de codificación universal AVO, que ha obtenido una puntuación perfecta de 100.00 en el exigente benchmark ARC-AGI-3. El sistema completó las 183 tareas de 25 entornos diferentes utilizando solo 6624 pasos. ARC-AGI-3 es conocido por su alta dificultad: arroja a los agentes a juegos desconocidos sin reglas ni objetivos claros, obligándolos a explorar, interactuar y deducir la mecánica por sí mismos. Mientras que modelos de vanguardia como Claude Opus 5 solo alcanzan un 30.16% actuando solos, AVO, que utiliza el mismo modelo central, logró el 100% gracias a una arquitectura externa inteligente. La clave del éxito de AVO radica en dos componentes principales fuera del modelo de lenguaje: 1. **Memoria persistente:** Almacena el historial de intentos, resultados, análisis y procesos de razonamiento, evitando que el agente cometa los mismos errores cuando se reinicia el contexto. 2. **Un supervisor:** Monitorea la búsqueda de soluciones e interviene cuando el agente principal se estanca o repite acciones inútiles, redirigiendo la estrategia. Notablemente, AVO procesó los entornos visuales en puro texto, recibiendo una cuadrícula de 64x64 caracteres en lugar de imágenes. Originalmente, AVO fue diseñado no para juegos, sino para la optimización autónoma de *kernels* de GPU. En un experimento, optimizó un *kernel* de atención para B200 durante 7 días, superando las implementaciones de NVIDIA cuDNN y FlashAttention...

¡Acaba de ocurrir! El agente de programación general de NVIDIA, AVO, ¡ha obtenido la puntuación perfecta en ARC-AGI-3!

Completó los 183 niveles en 25 entornos de juego, utilizando solo 6624 pasos, y alcanzó un RHAE de 100.00.

Hay que tener en cuenta que ARC-AGI-3 es famoso por no jugar limpio. Lanza al agente a un juego extraño sin darle reglas ni objetivos; tiene que pulsar, observar y adivinar por sí mismo.

En algunos entornos puedes moverte arriba, abajo, izquierda, derecha, deambulando por pasillos, chocas contra un bloque azul-negro y toda la pantalla gira 90 grados; otros no te permiten moverte, solo hacer clic, usando clicks para cambiar cíclicamente el color de las casillas hasta formar el patrón objetivo.

Cada entorno tiene al menos seis niveles, y cuanto más avanzas, más duros se vuelven. Un nivel que se podía completar en cinco pasos en la primera fase, podría requerir cincuenta pasos en la sexta.

Y el agente solo tiene una cuadrícula de 64×64 y unas pocas teclas a su disposición.

Los modelos de vanguardia enfrentados directamente no logran superarlo.

El modelo utilizado por AVO esta vez fue Claude Opus 5. Pero si lo evalúas solo, su puntuación es solo del 30.16%, y aún así es el primero en el ranking oficial certificado.

ARC Prize analizó los registros de partidas de la generación anterior y resumió tres tipos de errores típicos.

  • Primero, entendía lo local pero no lo global.
  • Segundo, adaptaba mecanismos desconocidos a juegos familiares.
  • Tercero, superaba un nivel pero no aprendía.

El tercer tipo es el más crítico. Opus alguna vez completó el primer nivel de ka59 en solo 37 pasos, pero su comprensión del mecanismo de clic estaba equivocada desde el principio. Al llegar al segundo nivel, se aferraba a esa teoría errónea y finalmente se quedó atascado.

El enfoque de NVIDIA fue no tocar el modelo, solo agregar una capa externa a su alrededor.

Así, el mismo Claude Opus 5 pasó directamente de una puntuación de 30 a la puntuación perfecta.

Entonces, X estalló. Por un lado, se llenó de mensajes como "ARC-AGI-3 ha caído" y "es hora de escalar un nuevo ranking", y por otro, la gente exclamaba lo increíble que fue este movimiento de NVIDIA.

Con este impulso, el próximo salto a nivel de modelo podría no depender de esperar un nuevo modelo, sino de una actualización del 'harness' (arnés).

El salto a 100 puntos, desglosado en solo dos elementos

¿Qué instaló NVIDIA alrededor del modelo para llenar estos tres vacíos de una vez?

Al igual que los recientemente populares DeepSeek Harness y Codex Harness, AVO también gestiona aspectos externos al modelo.

Esto incluye qué contexto proporcionarle, qué herramientas darle, cómo almacenar estados, cómo recibir retroalimentación, qué hacer si se atasca y cómo continuar después de que el contexto se llene, entre otras cosas.

En términos concretos de mecanismos, lo que realmente marcó la diferencia fueron dos elementos.

El primero es la memoria persistente.

El punto más crítico en tareas de largo plazo es que el contexto se llena.

Una vez lleno, la memoria del modelo se reinicia. Todo lo probado antes, qué caminos no funcionaron, qué resultados arrojó el profiler, todo se pierde.

En la siguiente ronda, vuelve a caer en los mismos errores desde el principio.

AVO, por otro lado, almacena todo esto: versiones anteriores de implementación, resultados de cada evaluación, salidas del compilador y del analizador, y el proceso de razonamiento acumulado.

Después de un reinicio del contexto, el agente continúa desde el estado actual, en lugar de reconstruir toda la búsqueda desde cero.

El segundo es el supervisor.

El agente principal se encarga del trabajo, decidiendo por sí mismo qué observar, qué modificar, qué probar y qué enviar.

El supervisor no trabaja, solo vigila toda la trayectoria de búsqueda. Una vez que detecta un estancamiento en el progreso, o que el agente principal comienza a dar vueltas en círculos haciendo trabajo inútil repetidamente, interviene para redirigir al agente principal hacia otras estrategias.

Hay otro detalle.

AVO ejecutó ARC-AGI-3 utilizando exclusivamente modalidad de texto puro. Cada observación de fotograma alimentada al modelo era una cuadrícula de texto precisa de 64×64, ni una sola imagen, ni un solo token visual fue enviado.

Es decir, en un juego lleno de píxeles, el modelo nunca vio una imagen.

El mecanismo que hizo esto posible produjo la hoja de resultados: 6624 pasos para completar 183 niveles y un RHAE perfecto.

La conclusión de NVIDIA es que la capacidad de largo plazo nunca ha sido una característica exclusiva del modelo, sino el resultado de la combinación de todo el sistema.

La memoria determina qué elementos persisten hasta la siguiente ronda, las herramientas determinan qué acciones puede realizar el agente, y la retroalimentación le permite saber si se está equivocando.

Y cuando una hipótesis es refutada, la capacidad de retroceder y continuar trabajando determina si la tarea puede llevarse a cabo de manera sostenida.

Primero revolucionó a NVIDIA misma

Lo interesante es que AVO no fue creado para jugar. Su campo de batalla principal es la optimización de operadores de GPU.

El 25 de marzo de este año, NVIDIA subió un artículo a arXiv titulado "AVO: Agente de Operador de Variación para Búsqueda Evolutiva Autónoma".

Dirección del artículo: https://arxiv.org/abs/2603.24517

Dos palabras en el título son clave: búsqueda evolutiva y operador de variación.

La búsqueda evolutiva en sí no es compleja. Se tiene un conjunto de códigos candidatos, se modifican, se ejecutan, se conserva la versión más rápida y luego se continúa modificando, generación tras generación.

El responsable del paso de "modificar" en los algoritmos evolutivos se llama operador de variación. En el pasado estaba predefinido, los métodos de modificación los establecían los humanos de antemano; más tarde se utilizaron LLMs para modificarlo, pero solo generaban un fragmento de código por ejecución.

El enfoque de AVO fue reemplazar todo el operador de variación con un agente autónomo.

De esta manera, no solo puede consultar guías de programación CUDA y documentos de arquitectura PTX, ejecutar pruebas, leer perfiles, sino también diagnosticar fallos de corrección por sí mismo y luego decidir qué modificar en la siguiente versión.

El equipo lo implementó en B200 con la tarea de optimizar el kernel de atención, uno de los operadores más exigidos en Transformer. Luego lo dejaron funcionar solo.

AVO ejecutó de forma autónoma y continua durante 7 días, explorando más de 500 direcciones de optimización, y finalmente presentó 40 versiones válidas del kernel.

El kernel de atención multi-cabeza resultante fue hasta 3.5% más rápido que el cuDNN propietario de NVIDIA, y hasta 10.5% más rápido que la implementación de código abierto más avanzada, FlashAttention-4.

Luego trasladó este conjunto de optimizaciones al GQA, actualmente predominante en los grandes modelos. Esta vez, después de solo unos 30 minutos de ejecución autónoma, el nuevo kernel fue un 7.0% más rápido que cuDNN y un 9.3% más rápido que FlashAttention-4.

Escribir kernels CUDA manualmente siempre ha sido una de las tareas con mayor barrera de entrada en este ecosistema, y AVO fue el primero en superarla.

Y esos 25 juegos de ARC-AGI-3 se ejecutan con este mismo sistema.

Ajustar kernels y jugar pueden parecer dos cosas completamente distintas. Pero para NVIDIA, bajo la superficie ambas ejecutan el mismo ciclo.

El agente primero formula una hipótesis a partir de evidencia incompleta, actúa para probarla, observa los resultados, almacena estados útiles y luego refina su comprensión del problema. Si la hipótesis es incorrecta, retrocede y reconsidera, y luego continúa iterando.

En palabras de NVIDIA, lo que se puede transferir no es el conocimiento del dominio, sino el mecanismo que mantiene la autonomía en tareas de largo plazo.

Quienes lo crearon fueron un equipo de base china

Si observas la lista de autores del artículo de AVO, verás una serie de nombres muy conocidos.

Con 23 firmas, prácticamente se reunieron a las figuras clave de la infraestructura de aprendizaje profundo de código abierto de la última década.

Uno de los primeros autores, Bing Xu, es Distinguished Engineer de NVIDIA y autor de MXNet. Incluso antes, fue el cuarto autor del artículo original de GAN de 2014, junto con el autor final Yoshua Bengio, ambos afiliados a la Universidad de Montreal.

Tianqi Chen, autor de TVM y XGBoost, también está en la lista. La línea de TVM también conecta con Luis Ceze; ambos fundaron OctoAI, que NVIDIA adquirió en septiembre de 2024, y Ceze luego se unió a NVIDIA para continuar trabajando en compiladores de aprendizaje automático.

Además, está Zi Hao Ye, autor de FlashInfer, y Vinod Grover, veterano del compilador CUDA.

Al frente está Humphrey Shi, Vicepresidente de IA de Alto Rendimiento en NVIDIA y también profesor en Georgia Tech. El otro primer autor, Zhifan Ye, es actualmente estudiante de doctorado en Georgia Tech.

El blog de esta ocasión tiene cinco nombres, cuatro de ellos chinos: además de Humphrey Shi, están Terry Chen, Zhifan Ye y Yeyin Zhu; el restante es Jean-Francois Puget, dos veces Gran Maestro Kaggle de NVIDIA.

Una de las partes más interesantes proviene de un relato previo de Bing Xu en X.

Hace un año y medio, cuando él y Terry Chen comenzaron a trabajar en programación de agentes en NVIDIA, ninguno de los dos entendía la programación de GPU.

Precisamente por no entender, desde el primer día se centraron en crear un sistema completamente automático, sin intervención humana, y le dieron a este enfoque el nombre de "programación a ciegas".

Un año y medio después, este sistema que no depende de instrucciones humanas superó a los kernels optimizados por expertos humanos durante meses.

Al final, la cuenta siempre termina en las tarjetas gráficas de Jensen Huang

¿Por qué una empresa que vende tarjetas gráficas dedicaría un año y medio a crear un agente que no requiere intervención humana?

Porque esta capa externa (el 'harness') se puede aplicar a cualquier modelo.

AVO ya se ha ejecutado en múltiples modelos. En los mismos niveles, combinado con GPT-5.6 Sol tomó menos tiempo, mientras que con Opus 5 utilizó menos pasos.

NVIDIA no gana dinero vendiendo modelos, pero puede mantener el control sobre esta capa. Esto es consistente con su estrategia general de los últimos años.

En el lado del modelo, se opta por el código abierto. Nemotron 4, lanzado en agosto de este año, apunta a una escala de billones de parámetros, se espera completar el entrenamiento en otoño, y el modelo se regalará, recuperando el dinero a través de las GPU y el stack de software posteriores.

En el lado de la potencia de cálculo, los agentes de largo plazo son exactamente el tipo de carga que más desean. La evaluación de Jensen Huang en GTC este año fue que el punto de inflexión de la inferencia ya ha llegado. En los últimos dos años, la demanda de potencia de cálculo aumentó aproximadamente diez mil veces, mientras que el uso solo aumentó aproximadamente cien veces; la diferencia fue absorbida por la inferencia.

Así que no importa de quién sea el modelo. Mientras los agentes realicen tareas cada vez más largas y complejas, la cuenta finalmente terminará en sus tarjetas gráficas.

En cuanto a las tres palabras "100 puntos", actualmente se están devaluando rápidamente.

En marzo, nadie podía alcanzar ni 1 punto. Tycho obtuvo la puntuación perfecta a fines de julio, VISTA la consiguió nuevamente el 5 de agosto, y la de AVO ya es la tercera en seis semanas, y las tres están impulsadas por Claude Opus 5.

Pero lo logrado por AVO no se verá reducido por ello.

Una arquitectura creada para exprimir los últimos puntos porcentuales de FlashAttention en B200 se trasladó casi sin cambios a un juego de píxeles, y funcionó.

Solo se intercambiaron la interfaz de tarea y el método de evaluación; el ciclo central no se modificó en absoluto.

Como escribió NVIDIA al final de su blog: El modelo es importante, pero el modelo no lo es todo para un agente.

Referencias:

https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/

Este artículo proviene del WeChat Official Account "新智元", autor: ASI启示录, editor: 摩西

热门币种推荐

相关问答

Q¿Qué logró el agente de codificación general AVO de NVIDIA en ARC-AGI-3?

AAVO obtuvo una puntuación perfecta de 100.00 en ARC-AGI-3, completando las 183 fases en 6624 pasos.

Q¿Cuáles son los dos mecanismos clave que permitieron a AVO superar los errores típicos y obtener un puntaje perfecto?

ALos dos mecanismos clave son la memoria persistente (que almacena estados y resultados pasados para evitar reinicios) y un supervisor (que redirige al agente principal cuando detecta estancamiento o repeticiones inútiles).

Q¿Para qué tarea principal fue diseñado originalmente AVO, según el artículo?

AAVO fue diseñado originalmente para la optimización de operadores de GPU, específicamente para optimizar kernels de CUDA como los de atención en transformadores, logrando mejoras de rendimiento frente a implementaciones de referencia.

Q¿Qué característica notable del equipo de desarrollo de AVO se destaca en el artículo?

AEl equipo de desarrollo tiene una fuerte base de investigadores y ingenieros chinos, incluyendo a Bing Xu (coautor de GAN y creador de MXNet), Tianqi Chen (creador de TVM y XGBoost), y otros expertos clave en infraestructura de aprendizaje profundo.

QSegún el artículo, ¿por qué es estratégicamente importante para NVIDIA desarrollar un sistema de agentes autónomos de largo horizonte como AVO?

APorque NVIDIA no depende de vender modelos propios, sino que puede proporcionar la capa de infraestructura (el "arnés") que funciona con cualquier modelo. Los agentes que realizan tareas más largas y complejas aumentan la demanda de potencia de cálculo, lo que finalmente se traduce en más ventas de sus GPU.

你可能也喜欢

比特币近期飙升是利好还是陷阱?

比特币近期从约63000美元飙升至近80000美元,Glassnode分析指出,此次上涨并非仅因市场流动性低。数据显示,现货市场的积极买入、交易量增加、流动性增强以及机构需求均表明,比特币上涨背后有真实的资金流入。 比特币已突破前期交易区间并维持在峰值附近,交易量和市场深度的扩大显示上涨由资本广泛配置支撑,而非弱势市场的短暂反弹。衍生品市场数据显示,投资者风险管理策略转向激进,永续期货买家流量显著增加,累计成交量超出统计上限。 但同时,期货未平仓合约量大幅上升,表明市场投机参与和杠杆使用显著增长。机构需求同样强劲,比特币ETF现货交易量和周净流入远超历史阈值,显示机构资金正积极参与本轮牛市。 链上数据也印证市场活跃度提升:每日活跃比特币地址数量增加,经调整的转账额显著增长,显示网络用户活动和经济转账加速。投资者盈利指标明显改善,未实现和已实现利润均上升,比特币利润占总供应比例远超历史均值。 随着盈利增加,投资者行为转向获利了结而非割肉卖出。但Glassnode认为,当前市场结构尚未完全基于长期资本积累。短期“热钱”指标已超出统计上限,而宏观经济层面的资本流入仍相对有限。这表明当前比特币上涨更多由短期投资者活跃参与、战术性配置和投机情绪驱动,而非长期稳定的资本积累。 *本文不构成投资建议。

cryptonews.ru1小时前

比特币近期飙升是利好还是陷阱?

cryptonews.ru1小时前

交易

现货

热门文章

如何购买ONE

欢迎来到HTX.com!我们已经让购买Harmony(ONE)变得简单而便捷。跟随我们的逐步指南,放心开始您的加密货币之旅。第一步:创建您的HTX账户使用您的电子邮件、手机号码注册一个免费账户在HTX上。体验无忧的注册过程并解锁所有平台功能。立即注册第二步:前往买币页面,选择您的支付方式信用卡/借记卡购买:使用您的Visa或Mastercard即时购买Harmony(ONE)。余额购买:使用您HTX账户余额中的资金进行无缝交易。第三方购买:探索诸如Google Pay或Apple Pay等流行支付方法以增加便利性。C2C购买:在HTX平台上直接与其他用户交易。HTX场外交易台(OTC)购买:为大量交易者提供个性化服务和竞争性汇率。第三步:存储您的Harmony(ONE)购买完您的Harmony(ONE)后,将其存储在您的HTX账户钱包中。您也可以通过区块链转账将其发送到其他地方或者用于交易其他加密货币。第四步:交易Harmony(ONE)在HTX的现货市场轻松交易Harmony(ONE)。访问您的账户,选择您的交易对,执行您的交易,并实时监控。HTX为初学者和经验丰富的交易者提供了友好的用户体验。

1.5k人学过发布于 2024.03.29更新于 2026.06.02

如何购买ONE

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对ONE(ONE)币价的意见。

活动图片