NVIDIA arrasa en ARC-AGI-3 con su IA, el equipo chino resuelve 183 niveles de golpe
NVIDIA ha logrado un hito en inteligencia artificial con su agente de codificación universal AVO, que ha obtenido una puntuación perfecta de 100.00 en el exigente benchmark ARC-AGI-3. El sistema completó las 183 tareas de 25 entornos diferentes utilizando solo 6624 pasos.
ARC-AGI-3 es conocido por su alta dificultad: arroja a los agentes a juegos desconocidos sin reglas ni objetivos claros, obligándolos a explorar, interactuar y deducir la mecánica por sí mismos. Mientras que modelos de vanguardia como Claude Opus 5 solo alcanzan un 30.16% actuando solos, AVO, que utiliza el mismo modelo central, logró el 100% gracias a una arquitectura externa inteligente.
La clave del éxito de AVO radica en dos componentes principales fuera del modelo de lenguaje:
1. **Memoria persistente:** Almacena el historial de intentos, resultados, análisis y procesos de razonamiento, evitando que el agente cometa los mismos errores cuando se reinicia el contexto.
2. **Un supervisor:** Monitorea la búsqueda de soluciones e interviene cuando el agente principal se estanca o repite acciones inútiles, redirigiendo la estrategia.
Notablemente, AVO procesó los entornos visuales en puro texto, recibiendo una cuadrícula de 64x64 caracteres en lugar de imágenes.
Originalmente, AVO fue diseñado no para juegos, sino para la optimización autónoma de *kernels* de GPU. En un experimento, optimizó un *kernel* de atención para B200 durante 7 días, superando las implementaciones de NVIDIA cuDNN y FlashAttention-4 en velocidad. La misma arquitectura central se aplicó sin modificaciones a ARC-AGI-3, demostrando su capacidad para tareas de largo horizonte que requieren formulación de hipótesis, prueba, aprendizaje y adaptación.
El equipo detrás de AVO incluye a destacados investigadores e ingenieros, como Bing Xu (coautor de GAN, creador de MXNet), Tianqi Chen (creador de XGBoost y TVM) y Humphrey Shi, VP de IA de alto rendimiento en NVIDIA.
Este logro subraya la visión de NVIDIA: aunque los modelos centrales son cruciales, no son toda la solución. Arquitecturas de agente robustas que gestionen memoria, herramientas y retroalimentación son esenciales para la autonomía a largo plazo. Para NVIDIA, el valor reside en habilitar estas cargas de trabajo complejas, independientemente del modelo subyacente utilizado, impulsando así la demanda de su hardware y software.
marsbitHace 6 min(s)