AI от Nvidia взрывает ARC-AGI-3, китайская команда сокрушает все 183 уровня одним махом

marsbitОпубликовано 2026-08-24Обновлено 2026-08-24

Введение

Компания NVIDIA представила универсального агента AVO, который достиг рекордного результата 100% (RHAE) на тесте ARC-AGI-3, решив все 183 задачи в 25 игровых средах за 6624 шага. Особенность теста — отсутствие правил и целей, агент должен самостоятельно изучать механику через взаимодействие. Несмотря на использование базовой модели Claude Opus 5 (самостоятельный результат которой — 30,16%), AVO добился полного успеха благодаря двум ключевым внешним механизмам: устойчивой памяти для сохранения контекста между сессиями и супервизору, который корректирует стратегию при зацикливании. Интересно, что AVO изначально создавался для автономной оптимизации GPU-ядер, превзойдя ручную оптимизацию (например, ускорив ядро внимания до 10,5% против FlashAttention-4). Система демонстрирует, что способность к долгосрочным автономным задачам зависит не только от модели ИИ, но и от архитектуры её взаимодействия с окружением. Проект разработан преимущественно командой исследователей китайского происхождения. Этот успех подчеркивает стратегию NVIDIA: создавать инфраструктуру для долгосрочных агентов, что стимулирует спрос на вычислительные мощности, независимо от используемой базовой модели ИИ.

Только что, универсальный кодирующий агент AVO от Nvidia набрал максимальный балл на ARC-AGI-3!

Он прошел все 183 уровня в 25 игровых средах, затратив всего 6624 шага, и получил RHAE 100.00.

ARC-AGI-3 известен своей безжалостностью. Он бросает агента в незнакомую игру, не давая правил и целей, и тому приходится действовать, смотреть и догадываться самостоятельно.

В одних средах можно перемещаться вверх-вниз-влево-вправо, бродить по коридорам, и при столкновении с сине-черным квадратом вся картинка поворачивается на 90 градусов; в других даже ходить нельзя, можно только нажимать, меняя цвет ячеек по циклу, чтобы получить целевую картинку.

В каждой среде как минимум шесть уровней, и каждый следующий сложнее предыдущего: если первый можно пройти за пять шагов, то на шестой может потребоваться пятьдесят.

А у агента в распоряжении только сетка 64×64 и несколько кнопок.

Передовые модели, которые пытаются прорваться напрямую, с этим не справляются.

Модель, которую использовал AVO, — Claude Opus 5. Но если отправить её на тест одну, результат составит всего 30.16%, и это уже первое место в официальном рейтинге.

ARC Prize разбирал записи прохождений предыдущего поколения и выделил три типичные ошибки.

  • Первая: понял локально, но не понял глобально.
  • Вторая: пытается приписать незнакомые механизмы знакомым играм.
  • Третья: прошел уровень, но не научился.

Третий тип самый критичный. Opus однажды прошел первый уровень ka59 всего за 37 шагов, но его понимание механизма нажатий было ошибочным с самого начала. Попав на второй уровень, он упорствовал в своей ошибочной теории и в итоге застрял.

Подход Nvidia заключался в том, чтобы не трогать модель, а лишь добавить внешнюю оболочку.

Таким образом, тот же Claude Opus 5 поднял результат с 30 баллов до максимума.

В X поднялся переполох. С одной стороны, лента пестрит сообщениями «ARC-AGI-3 пал», «пора лезть на новый рейтинг», с другой — все восхищаются мощью Nvidia.

С такими темпами, следующий скачок на уровне модели, возможно, произойдет не с появлением новой модели, а с обновлением harness-системы.

Скачок до 100 баллов состоит всего из двух элементов

Что же Nvidia добавила к модели, чтобы разом заполнить все эти три пробела?

Как и недавно нашумевшие DeepSeek Harness и Codex Harness, AVO также управляет всем, что окружает модель.

Это включает в себя то, какой контекст ей давать, какие инструменты предоставлять, как сохранять состояние, как обрабатывать обратную связь, что делать при застое, и как продолжать работу после переполнения контекста.

В плане механизмов, реально работают две вещи.

Первое — постоянная память.

Самое сложное в длительных задачах — это переполнение контекста.

Как только это происходит, память модели обнуляется: всё, что было опробовано, какие пути оказались тупиковыми, результаты профилировщика — всё теряется.

В следующем раунде она снова наступает на те же грабли.

AVO же всё это сохраняет: предыдущие версии реализации, результаты каждого теста, выводы компилятора и анализатора, накопленные цепочки рассуждений.

После сброса контекста агент продолжает работу с текущего состояния, а не начинает поиск с нуля.

Второе — супервизор.

Основной агент занят работой: сам решает, что смотреть, что менять, что тестировать, что отправлять.

Супервизор не работает, а лишь наблюдает за всей цепочкой поиска. Как только он обнаруживает отсутствие прогресса или то, что агент начал ходить по кругу, совершая бесполезные действия, он вмешивается и направляет основного агента к другим стратегиям.

Есть ещё одна деталь.

AVO проходил ARC-AGI-3, используя исключительно текстовую модальность. Каждое наблюдение за кадром подавалось модели в виде точной текстовой сетки 64×64, без единого изображения, не было передано ни одного токена изображения.

Другими словами, в игре, где всё состоит из пикселей, модель ни разу не видела картинку.

Именно этот механизм принёс результат: 6624 шага на 183 уровня, RHAE — 100.00.

Вывод, который делает Nvidia: способность к длительным действиям никогда не была свойством одной лишь модели, это результат работы всей системы.

Память определяет, что перейдет в следующий раунд, инструменты определяют, какие действия может совершить агент, обратная связь позволяет понять, правильный ли путь выбран.

А когда предположение опровергается, возможность вернуться и продолжить работу определяет, сможет ли задача быть завершена.

Сначала он революционизирует саму Nvidia

Интересно, что AVO изначально создавался вовсе не для игр. Его основная область — оптимизация GPU-операторов.

25 марта этого года Nvidia загрузила на arXiv статью под названием «AVO: Агентные мутационные операторы для автономного эволюционного поиска».

Адрес статьи: https://arxiv.org/abs/2603.24517

В названии есть два ключевых слова: эволюционный поиск и мутационный оператор.

Эволюционный поиск сам по себе несложен. Есть набор кандидатных кодов, их нужно изменять, запускать, оставлять самый быстрый вариант, и продолжать изменять, двигаясь от поколения к поколению.

Часть, отвечающая за «изменение», в эволюционных алгоритмах называется мутационным оператором. Раньше он был жестко задан, способы изменения определялись человеком заранее; позже для изменений стали использовать LLM, но это тоже лишь одноразовая генерация кода.

AVO же превращает весь мутационный оператор в автономного агента.

Таким образом, он может изучать руководства по CUDA и документацию по архитектуре PTX, запускать тесты, читать результаты профилирования, самостоятельно диагностировать ошибки корректности и решать, что изменять в следующей версии.

Команда поставила его на B200 с задачей оптимизировать ядро внимания — один из самых интенсивно оптимизируемых операторов в Transformer. После этого они просто отпустили его.

AVO автономно работал 7 дней подряд, исследовал более 500 направлений оптимизации и в итоге представил 40 эффективных версий ядер.

Полученное ядро многоголового внимания оказалось быстрее собственного закрытого решения Nvidia cuDNN до 3.5% и быстрее самого передового открытого решения FlashAttention-4 до 10.5%.

Затем эта оптимизация была применена к GQA, которая сейчас является стандартом для больших моделей. На этот раз автономная работа заняла около 30 минут, и новое ядро оказалось быстрее cuDNN на 7.0% и FlashAttention-4 на 9.3%.

Ручное написание CUDA-ядер всегда было самой высокой планкой в этой экосистеме, и AVO первым её преодолел.

И те самые 25 игр ARC-AGI-3 были пройдены с использованием той же самой системы.

Оптимизация ядер и прохождение игр кажутся абсолютно разными задачами. Но, по мнению Nvidia, в их основе лежит один и тот же цикл.

Агент строит гипотезу на основе неполных данных, пробует её на практике, наблюдает результат, сохраняет полезное состояние и корректирует своё понимание проблемы. Если гипотеза ошибочна, он откатывается и переосмысливает. И так раунд за раундом.

Как говорят в самой Nvidia, переносится не предметное знание, а механизм, поддерживающий длительную автономную работу.

Создала его команда китайских специалистов

В списке авторов статьи об AVO можно увидеть множество знакомых имён.

23 подписи — это практически все ключевые фигуры в области открытой инфраструктуры глубокого обучения за последние десять лет.

Один из первых авторов, Бин Сюй, — Distinguished Engineer в Nvidia и создатель MXNet. Ещё раньше он был четвёртым автором оригинальной статьи о GAN 2014 года, подписанной вместе с последним автором Йошивой Бенджио из Монреальского университета.

В списке также есть Тяньци Чэнь, создатель TVM и XGBoost. Линия TVM связана и с Луисом Сесе: вместе они основали OctoAI, которую Nvidia приобрела в сентябре 2024 года, после чего Сесе присоединился к Nvidia, продолжая работу над компиляторами для машинного обучения.

Далее идут Е Цзыхао, автор FlashInfer, и Винод Гровер, ветеран компиляторов CUDA.

Руководит проектом Хамфри Ши, вице-президент Nvidia по высокопроизводительному ИИ и профессор Технологического института Джорджии. Другой первый автор, Чжифань Е, — докторант того же института.

В блоге указано пять имён, четверо из них — китайцы: Хамфри Ши, Терри Чэнь, Чжифань Е и Еинь Чжу. Пятый — Жан-Франсуа Пужет, двукратный гроссмейстер Kaggle от Nvidia.

Самая интересная часть — это рассказ самого Бина Сюя в X.

Полтора года назад, когда он и Терри Чэнь только начинали заниматься агентным программированием в Nvidia, они оба не разбирались в программировании для GPU.

Именно из-за этого незнания они с первого дня стремились создать полностью автоматическую систему, не требующую вмешательства человека, и даже дали этому подходу название — «слепое программирование».

Через полтора года эта система, не управляемая человеком, превзошла ядра, которые эксперты оптимизировали месяцами.

В конечном счете, всё сводится к видеокартам Дженсена

Зачем компании, продающей видеокарты, тратить полтора года на создание автономного агента, не требующего вмешательства человека?

Потому что эту оболочку можно использовать с любой моделью.

AVO уже работал с разными моделями. На тех же уровнях с GPT-5.6 Sol время было меньше, а с Opus 5 — меньше шагов.

Nvidia не зарабатывает на продаже моделей, но этот слой она может занять. Это соответствует её общей стратегии последних лет.

Сторона моделей развивается как открытая. Nemotron 4, запущенный в августе этого года, нацелен на масштаб в триллионы параметров, обучение планируется завершить осенью, модель будет распространяться бесплатно, а деньги будут зарабатываться на последующих GPU и программных стеках.

Со стороны вычислительных мощностей, долгосрочные агенты — именно та нагрузка, которая им нужна. Дженсен Хуан на GTC в этом году заявил, что переломный момент в инференсе уже наступил. За последние два года потребность в вычислениях выросла примерно в десять тысяч раз, а объем использования — всего в сто раз, и вся разница поглощена инференсом.

Поэтому неважно, чьи модели используются. Главное, чтобы задачи агентов становились длиннее и сложнее, — в итоге счёт всё равно будет выставляться за их видеокарты.

Что касается 100 баллов, то сейчас они действительно быстро девальвируются.

В марте ещё никто не мог набрать и 1 балла, Tycho в конце июля первым достиг максимума, VISTA 5 августа повторила это, а результат AVO — уже третий за шесть недель, и все три системы работают на Claude Opus 5.

Но достижение AVO от этого не обесценивается.

Архитектура, созданная для выжимания последних процентов производительности из FlashAttention на B200, была почти без изменений перенесена в пиксельную игру — и справилась.

Были заменены только интерфейс задачи и способ оценки, а основной цикл не изменился ни на строчку.

Как и написали в конце блога Nvidia, модель важна, но модель — не весь агент.

Источники:

https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/

Эта статья из WeChat Official Account «Новая Эра ИИ», автор: ASI启示录, редактор: Моисей

Трендовые криптовалюты

Связанные с этим вопросы

QЧто такое AVO и какое достижение оно совершило в ARC-AGI-3?

AAVO - это автономный агент общего кодирования от NVIDIA. Он достиг максимального результата в 100% (RHAE) на тесте ARC-AGI-3, успешно пройдя все 183 уровня в 25 игровых средах за 6624 шага.

QКакова была производительность базовой модели Claude Opus 5 на ARC-AGI-3 без использования AVO?

AБез системы AVO модель Claude Opus 5 показала результат всего 30.16% на тесте ARC-AGI-3, что, тем не менее, было лучшим показателем в официальном рейтинге на тот момент.

QКакие два ключевых механизма в системе AVO позволили добиться такого скачка в производительности?

AДва ключевых механизма AVO: 1) Постоянная память, которая сохраняет историю проб, результаты, выводы компиляторов и процесс поиска, позволяя агенту продолжить с текущего состояния после сброса контекста. 2) Супервизор, который отслеживает траекторию поиска и перенаправляет основной агент при отсутствии прогресса или бесполезных повторениях.

QДля какой первоначальной задачи была создана система AVO, и какие результаты она показала?

AAVO была создана для автономной оптимизации GPU-операторов, в частности, ядер внимания для трансформеров. На задаче оптимизации ядра многоголового внимания на B200 за 7 дней автономной работы AVO создала ядро, которое на 3.5% быстрее собственного закрытого решения NVIDIA cuDNN и на 10.5% быстрее передового открытого решения FlashAttention-4.

QКто входил в команду разработчиков AVO и какова их связь с ключевыми проектами в области ИИ?

AКоманда разработчиков AVO в основном состоит из специалистов китайского происхождения, внесших вклад в фундаментальные проекты ИИ. Среди них: Бинг Сюй (соавтор оригинальной статьи GAN, создатель MXNet), Тяньци Чэнь (создатель TVM и XGBoost), Луис Сеза (сооснователь OctoAI, поглощенной NVIDIA), Цзыхао Е (создатель FlashInfer) и Винод Гровер (ветеран компиляторов CUDA). Руководил проектом Хамфри Ши, вице-президент NVIDIA по высокопроизводительному ИИ.

Похожее

«Криптопрезидент» Трамп продает акции Coinbase и Strategy

Управление по вопросам государственной этики США опубликовало июньский отчёт о сделках президента Дональда Трампа с ценными бумагами. Из более чем 1000 операций лишь семь касались криптокомпаний, и большинство из них были продажами. Так, акции Coinbase Global продавались трижды на общую сумму до $315 000, а затем была совершена одна покупка. Акции корпоративного держателя биткоина Strategy были проданы дважды, покупок не зафиксировано. Единственная покупка акций Robinhood составила до $15 000. Общий объём июньских сделок составил до $263,1 млн, и криптоинвестиции были лишь малой их частью. Это контрастирует с данными о личных доходах Трампа, где криптовалютные проекты в 2025 году принесли около $1,4 млрд, а также с его прошлой предвыборной риторикой, в которой он позиционировал себя как «криптопрезидента». Белый дом утверждает, что инвестициями управляют независимые организации и конфликта интересов нет. Наблюдатели отмечают расхождение между скромной биржевой активностью в криптосекторе и огромными доходами от цифровых активов, что может создавать лишь иллюзию диверсификации.

cryptonews.ru10 мин. назад

«Криптопрезидент» Трамп продает акции Coinbase и Strategy

cryptonews.ru10 мин. назад

Акции Circle подскочили почти на 17% за два дня: реальный рост, возможно, вызван не фундаментальными факторами

Акции компании Circle, эмитента стейблкоина USDC, выросли почти на 17% за два дня, во многом благодаря общему подъему на рынке криптовалют (рост биткойна выше $70 тыс.) и акций криптосектора. Несмотря на рост объема обращения USDC и операций в сети, рост выручки Circle замедлился, причем более 85% доходов по-прежнему приходится на процентный доход от резервных активов, который снижается вместе с падением ставок. Ключевым элементом долгосрочной стратегии Circle являются блокчейн Arc и платежная сеть CPN. Публичный мейннет Arc, запуск которого запланирован на 16 сентября, должен привлечь крупные институциональные партнерства (BlackRock, Visa, Mastercard, DTCC) и помочь компании диверсифицировать доходы за счет транзакционных, расчетных и программных услуг. Прогнозная оценка в $259 к 2030 году предполагает успешную коммерциализацию Arc и CPN, в то время как средняя целевая цена аналитиков на ближайшие 12 месяцев составляет около $101 доллара. Таким образом, недавний рост котировок в большей степени отражает улучшение рыночных настроений, а не фундаментальные изменения. Реальный успех платформенной трансформации Circle будет зависеть от способности Arc после запуска генерировать устойчивый коммерческий доход от реальных активов и транзакций.

marsbit14 мин. назад

Акции Circle подскочили почти на 17% за два дня: реальный рост, возможно, вызван не фундаментальными факторами

marsbit14 мин. назад

Рекордная неделя биткоина: рост более чем на $16 000 и прогнозы «самого сильного» цикла в истории

Биткоин установил рекордный недельный прирост в долларовом эквиваленте, подскочив с примерно $63 000 до $79 000 с 17 по 23 августа 2026 года. По словам CEO Strive Мэтта Коула, это был «взрывной» прорыв как против доллара, так и против золота. Он ожидает, что в период растущего спроса на дефицитные активы, такие как биткоин и золото, следующий рыночный цикл может стать самым сильным в истории. При этом возможны краткосрочные коррекции, которые, как ожидается, будут активно выкупаться. Аналитики отмечают несколько ключевых факторов и уровней. Доминик Джон из Zeus Research связывает рост с притоками в ETF и улучшением макроликвидности, видя ближайшую цель на уровне $80 000, а при благоприятных условиях — и $100 000. Рачел Лукас из BTC Markets указывает, что рекордный рост — результат сочетания факторов: закрытия шортов, спотового спроса и ситуации на рынке деривативов. Для оценки устойчивости ралли она советует следить за притоками в спотовые Bitcoin-ETF, а также за открытым интересом и ставками финансирования.

cryptonews.ru23 мин. назад

Рекордная неделя биткоина: рост более чем на $16 000 и прогнозы «самого сильного» цикла в истории

cryptonews.ru23 мин. назад

Торговля

Спот

Популярные статьи

Как купить ONE

Добро пожаловать на HTX.com! Мы сделали приобретение Harmony (ONE) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки Harmony (ONE).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение Harmony (ONE)После приобретения вами Harmony (ONE) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля Harmony (ONE)С легкостью торгуйте Harmony (ONE) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

1.0k просмотров всегоОпубликовано 2024.04.12Обновлено 2026.06.02

Как купить ONE

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на ONE (ONE) представлены ниже.

活动图片