Только что, универсальный кодирующий агент AVO от Nvidia набрал максимальный балл на ARC-AGI-3!
Он прошел все 183 уровня в 25 игровых средах, затратив всего 6624 шага, и получил RHAE 100.00.


ARC-AGI-3 известен своей безжалостностью. Он бросает агента в незнакомую игру, не давая правил и целей, и тому приходится действовать, смотреть и догадываться самостоятельно.
В одних средах можно перемещаться вверх-вниз-влево-вправо, бродить по коридорам, и при столкновении с сине-черным квадратом вся картинка поворачивается на 90 градусов; в других даже ходить нельзя, можно только нажимать, меняя цвет ячеек по циклу, чтобы получить целевую картинку.


В каждой среде как минимум шесть уровней, и каждый следующий сложнее предыдущего: если первый можно пройти за пять шагов, то на шестой может потребоваться пятьдесят.
А у агента в распоряжении только сетка 64×64 и несколько кнопок.
Передовые модели, которые пытаются прорваться напрямую, с этим не справляются.
Модель, которую использовал AVO, — Claude Opus 5. Но если отправить её на тест одну, результат составит всего 30.16%, и это уже первое место в официальном рейтинге.

ARC Prize разбирал записи прохождений предыдущего поколения и выделил три типичные ошибки.
- Первая: понял локально, но не понял глобально.
- Вторая: пытается приписать незнакомые механизмы знакомым играм.
- Третья: прошел уровень, но не научился.
Третий тип самый критичный. Opus однажды прошел первый уровень ka59 всего за 37 шагов, но его понимание механизма нажатий было ошибочным с самого начала. Попав на второй уровень, он упорствовал в своей ошибочной теории и в итоге застрял.


Подход Nvidia заключался в том, чтобы не трогать модель, а лишь добавить внешнюю оболочку.
Таким образом, тот же Claude Opus 5 поднял результат с 30 баллов до максимума.
В X поднялся переполох. С одной стороны, лента пестрит сообщениями «ARC-AGI-3 пал», «пора лезть на новый рейтинг», с другой — все восхищаются мощью Nvidia.
С такими темпами, следующий скачок на уровне модели, возможно, произойдет не с появлением новой модели, а с обновлением harness-системы.

Скачок до 100 баллов состоит всего из двух элементов
Что же Nvidia добавила к модели, чтобы разом заполнить все эти три пробела?
Как и недавно нашумевшие DeepSeek Harness и Codex Harness, AVO также управляет всем, что окружает модель.
Это включает в себя то, какой контекст ей давать, какие инструменты предоставлять, как сохранять состояние, как обрабатывать обратную связь, что делать при застое, и как продолжать работу после переполнения контекста.

В плане механизмов, реально работают две вещи.
Первое — постоянная память.
Самое сложное в длительных задачах — это переполнение контекста.
Как только это происходит, память модели обнуляется: всё, что было опробовано, какие пути оказались тупиковыми, результаты профилировщика — всё теряется.
В следующем раунде она снова наступает на те же грабли.
AVO же всё это сохраняет: предыдущие версии реализации, результаты каждого теста, выводы компилятора и анализатора, накопленные цепочки рассуждений.
После сброса контекста агент продолжает работу с текущего состояния, а не начинает поиск с нуля.
Второе — супервизор.
Основной агент занят работой: сам решает, что смотреть, что менять, что тестировать, что отправлять.
Супервизор не работает, а лишь наблюдает за всей цепочкой поиска. Как только он обнаруживает отсутствие прогресса или то, что агент начал ходить по кругу, совершая бесполезные действия, он вмешивается и направляет основного агента к другим стратегиям.
Есть ещё одна деталь.
AVO проходил ARC-AGI-3, используя исключительно текстовую модальность. Каждое наблюдение за кадром подавалось модели в виде точной текстовой сетки 64×64, без единого изображения, не было передано ни одного токена изображения.
Другими словами, в игре, где всё состоит из пикселей, модель ни разу не видела картинку.
Именно этот механизм принёс результат: 6624 шага на 183 уровня, RHAE — 100.00.

Вывод, который делает Nvidia: способность к длительным действиям никогда не была свойством одной лишь модели, это результат работы всей системы.
Память определяет, что перейдет в следующий раунд, инструменты определяют, какие действия может совершить агент, обратная связь позволяет понять, правильный ли путь выбран.
А когда предположение опровергается, возможность вернуться и продолжить работу определяет, сможет ли задача быть завершена.
Сначала он революционизирует саму Nvidia
Интересно, что AVO изначально создавался вовсе не для игр. Его основная область — оптимизация GPU-операторов.
25 марта этого года Nvidia загрузила на arXiv статью под названием «AVO: Агентные мутационные операторы для автономного эволюционного поиска».

Адрес статьи: https://arxiv.org/abs/2603.24517
В названии есть два ключевых слова: эволюционный поиск и мутационный оператор.
Эволюционный поиск сам по себе несложен. Есть набор кандидатных кодов, их нужно изменять, запускать, оставлять самый быстрый вариант, и продолжать изменять, двигаясь от поколения к поколению.
Часть, отвечающая за «изменение», в эволюционных алгоритмах называется мутационным оператором. Раньше он был жестко задан, способы изменения определялись человеком заранее; позже для изменений стали использовать LLM, но это тоже лишь одноразовая генерация кода.
AVO же превращает весь мутационный оператор в автономного агента.

Таким образом, он может изучать руководства по CUDA и документацию по архитектуре PTX, запускать тесты, читать результаты профилирования, самостоятельно диагностировать ошибки корректности и решать, что изменять в следующей версии.
Команда поставила его на B200 с задачей оптимизировать ядро внимания — один из самых интенсивно оптимизируемых операторов в Transformer. После этого они просто отпустили его.
AVO автономно работал 7 дней подряд, исследовал более 500 направлений оптимизации и в итоге представил 40 эффективных версий ядер.
Полученное ядро многоголового внимания оказалось быстрее собственного закрытого решения Nvidia cuDNN до 3.5% и быстрее самого передового открытого решения FlashAttention-4 до 10.5%.
Затем эта оптимизация была применена к GQA, которая сейчас является стандартом для больших моделей. На этот раз автономная работа заняла около 30 минут, и новое ядро оказалось быстрее cuDNN на 7.0% и FlashAttention-4 на 9.3%.
Ручное написание CUDA-ядер всегда было самой высокой планкой в этой экосистеме, и AVO первым её преодолел.


И те самые 25 игр ARC-AGI-3 были пройдены с использованием той же самой системы.
Оптимизация ядер и прохождение игр кажутся абсолютно разными задачами. Но, по мнению Nvidia, в их основе лежит один и тот же цикл.
Агент строит гипотезу на основе неполных данных, пробует её на практике, наблюдает результат, сохраняет полезное состояние и корректирует своё понимание проблемы. Если гипотеза ошибочна, он откатывается и переосмысливает. И так раунд за раундом.
Как говорят в самой Nvidia, переносится не предметное знание, а механизм, поддерживающий длительную автономную работу.
Создала его команда китайских специалистов
В списке авторов статьи об AVO можно увидеть множество знакомых имён.
23 подписи — это практически все ключевые фигуры в области открытой инфраструктуры глубокого обучения за последние десять лет.
Один из первых авторов, Бин Сюй, — Distinguished Engineer в Nvidia и создатель MXNet. Ещё раньше он был четвёртым автором оригинальной статьи о GAN 2014 года, подписанной вместе с последним автором Йошивой Бенджио из Монреальского университета.
В списке также есть Тяньци Чэнь, создатель TVM и XGBoost. Линия TVM связана и с Луисом Сесе: вместе они основали OctoAI, которую Nvidia приобрела в сентябре 2024 года, после чего Сесе присоединился к Nvidia, продолжая работу над компиляторами для машинного обучения.
Далее идут Е Цзыхао, автор FlashInfer, и Винод Гровер, ветеран компиляторов CUDA.
Руководит проектом Хамфри Ши, вице-президент Nvidia по высокопроизводительному ИИ и профессор Технологического института Джорджии. Другой первый автор, Чжифань Е, — докторант того же института.
В блоге указано пять имён, четверо из них — китайцы: Хамфри Ши, Терри Чэнь, Чжифань Е и Еинь Чжу. Пятый — Жан-Франсуа Пужет, двукратный гроссмейстер Kaggle от Nvidia.

Самая интересная часть — это рассказ самого Бина Сюя в X.
Полтора года назад, когда он и Терри Чэнь только начинали заниматься агентным программированием в Nvidia, они оба не разбирались в программировании для GPU.
Именно из-за этого незнания они с первого дня стремились создать полностью автоматическую систему, не требующую вмешательства человека, и даже дали этому подходу название — «слепое программирование».
Через полтора года эта система, не управляемая человеком, превзошла ядра, которые эксперты оптимизировали месяцами.

В конечном счете, всё сводится к видеокартам Дженсена
Зачем компании, продающей видеокарты, тратить полтора года на создание автономного агента, не требующего вмешательства человека?
Потому что эту оболочку можно использовать с любой моделью.
AVO уже работал с разными моделями. На тех же уровнях с GPT-5.6 Sol время было меньше, а с Opus 5 — меньше шагов.
Nvidia не зарабатывает на продаже моделей, но этот слой она может занять. Это соответствует её общей стратегии последних лет.
Сторона моделей развивается как открытая. Nemotron 4, запущенный в августе этого года, нацелен на масштаб в триллионы параметров, обучение планируется завершить осенью, модель будет распространяться бесплатно, а деньги будут зарабатываться на последующих GPU и программных стеках.
Со стороны вычислительных мощностей, долгосрочные агенты — именно та нагрузка, которая им нужна. Дженсен Хуан на GTC в этом году заявил, что переломный момент в инференсе уже наступил. За последние два года потребность в вычислениях выросла примерно в десять тысяч раз, а объем использования — всего в сто раз, и вся разница поглощена инференсом.
Поэтому неважно, чьи модели используются. Главное, чтобы задачи агентов становились длиннее и сложнее, — в итоге счёт всё равно будет выставляться за их видеокарты.
Что касается 100 баллов, то сейчас они действительно быстро девальвируются.
В марте ещё никто не мог набрать и 1 балла, Tycho в конце июля первым достиг максимума, VISTA 5 августа повторила это, а результат AVO — уже третий за шесть недель, и все три системы работают на Claude Opus 5.

Но достижение AVO от этого не обесценивается.
Архитектура, созданная для выжимания последних процентов производительности из FlashAttention на B200, была почти без изменений перенесена в пиксельную игру — и справилась.
Были заменены только интерфейс задачи и способ оценки, а основной цикл не изменился ни на строчку.
Как и написали в конце блога Nvidia, модель важна, но модель — не весь агент.
Источники:
https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
Эта статья из WeChat Official Account «Новая Эра ИИ», автор: ASI启示录, редактор: Моисей






