AI от Nvidia взрывает ARC-AGI-3, китайская команда сокрушает все 183 уровня одним махом

marsbitОпубликовано 2026-08-24Обновлено 2026-08-24

Введение

Компания NVIDIA представила универсального агента AVO, который достиг рекордного результата 100% (RHAE) на тесте ARC-AGI-3, решив все 183 задачи в 25 игровых средах за 6624 шага. Особенность теста — отсутствие правил и целей, агент должен самостоятельно изучать механику через взаимодействие. Несмотря на использование базовой модели Claude Opus 5 (самостоятельный результат которой — 30,16%), AVO добился полного успеха благодаря двум ключевым внешним механизмам: устойчивой памяти для сохранения контекста между сессиями и супервизору, который корректирует стратегию при зацикливании. Интересно, что AVO изначально создавался для автономной оптимизации GPU-ядер, превзойдя ручную оптимизацию (например, ускорив ядро внимания до 10,5% против FlashAttention-4). Система демонстрирует, что способность к долгосрочным автономным задачам зависит не только от модели ИИ, но и от архитектуры её взаимодействия с окружением. Проект разработан преимущественно командой исследователей китайского происхождения. Этот успех подчеркивает стратегию NVIDIA: создавать инфраструктуру для долгосрочных агентов, что стимулирует спрос на вычислительные мощности, независимо от используемой базовой модели ИИ.

Только что, универсальный кодирующий агент AVO от Nvidia набрал максимальный балл на ARC-AGI-3!

Он прошел все 183 уровня в 25 игровых средах, затратив всего 6624 шага, и получил RHAE 100.00.

ARC-AGI-3 известен своей безжалостностью. Он бросает агента в незнакомую игру, не давая правил и целей, и тому приходится действовать, смотреть и догадываться самостоятельно.

В одних средах можно перемещаться вверх-вниз-влево-вправо, бродить по коридорам, и при столкновении с сине-черным квадратом вся картинка поворачивается на 90 градусов; в других даже ходить нельзя, можно только нажимать, меняя цвет ячеек по циклу, чтобы получить целевую картинку.

В каждой среде как минимум шесть уровней, и каждый следующий сложнее предыдущего: если первый можно пройти за пять шагов, то на шестой может потребоваться пятьдесят.

А у агента в распоряжении только сетка 64×64 и несколько кнопок.

Передовые модели, которые пытаются прорваться напрямую, с этим не справляются.

Модель, которую использовал AVO, — Claude Opus 5. Но если отправить её на тест одну, результат составит всего 30.16%, и это уже первое место в официальном рейтинге.

ARC Prize разбирал записи прохождений предыдущего поколения и выделил три типичные ошибки.

  • Первая: понял локально, но не понял глобально.
  • Вторая: пытается приписать незнакомые механизмы знакомым играм.
  • Третья: прошел уровень, но не научился.

Третий тип самый критичный. Opus однажды прошел первый уровень ka59 всего за 37 шагов, но его понимание механизма нажатий было ошибочным с самого начала. Попав на второй уровень, он упорствовал в своей ошибочной теории и в итоге застрял.

Подход Nvidia заключался в том, чтобы не трогать модель, а лишь добавить внешнюю оболочку.

Таким образом, тот же Claude Opus 5 поднял результат с 30 баллов до максимума.

В X поднялся переполох. С одной стороны, лента пестрит сообщениями «ARC-AGI-3 пал», «пора лезть на новый рейтинг», с другой — все восхищаются мощью Nvidia.

С такими темпами, следующий скачок на уровне модели, возможно, произойдет не с появлением новой модели, а с обновлением harness-системы.

Скачок до 100 баллов состоит всего из двух элементов

Что же Nvidia добавила к модели, чтобы разом заполнить все эти три пробела?

Как и недавно нашумевшие DeepSeek Harness и Codex Harness, AVO также управляет всем, что окружает модель.

Это включает в себя то, какой контекст ей давать, какие инструменты предоставлять, как сохранять состояние, как обрабатывать обратную связь, что делать при застое, и как продолжать работу после переполнения контекста.

В плане механизмов, реально работают две вещи.

Первое — постоянная память.

Самое сложное в длительных задачах — это переполнение контекста.

Как только это происходит, память модели обнуляется: всё, что было опробовано, какие пути оказались тупиковыми, результаты профилировщика — всё теряется.

В следующем раунде она снова наступает на те же грабли.

AVO же всё это сохраняет: предыдущие версии реализации, результаты каждого теста, выводы компилятора и анализатора, накопленные цепочки рассуждений.

После сброса контекста агент продолжает работу с текущего состояния, а не начинает поиск с нуля.

Второе — супервизор.

Основной агент занят работой: сам решает, что смотреть, что менять, что тестировать, что отправлять.

Супервизор не работает, а лишь наблюдает за всей цепочкой поиска. Как только он обнаруживает отсутствие прогресса или то, что агент начал ходить по кругу, совершая бесполезные действия, он вмешивается и направляет основного агента к другим стратегиям.

Есть ещё одна деталь.

AVO проходил ARC-AGI-3, используя исключительно текстовую модальность. Каждое наблюдение за кадром подавалось модели в виде точной текстовой сетки 64×64, без единого изображения, не было передано ни одного токена изображения.

Другими словами, в игре, где всё состоит из пикселей, модель ни разу не видела картинку.

Именно этот механизм принёс результат: 6624 шага на 183 уровня, RHAE — 100.00.

Вывод, который делает Nvidia: способность к длительным действиям никогда не была свойством одной лишь модели, это результат работы всей системы.

Память определяет, что перейдет в следующий раунд, инструменты определяют, какие действия может совершить агент, обратная связь позволяет понять, правильный ли путь выбран.

А когда предположение опровергается, возможность вернуться и продолжить работу определяет, сможет ли задача быть завершена.

Сначала он революционизирует саму Nvidia

Интересно, что AVO изначально создавался вовсе не для игр. Его основная область — оптимизация GPU-операторов.

25 марта этого года Nvidia загрузила на arXiv статью под названием «AVO: Агентные мутационные операторы для автономного эволюционного поиска».

Адрес статьи: https://arxiv.org/abs/2603.24517

В названии есть два ключевых слова: эволюционный поиск и мутационный оператор.

Эволюционный поиск сам по себе несложен. Есть набор кандидатных кодов, их нужно изменять, запускать, оставлять самый быстрый вариант, и продолжать изменять, двигаясь от поколения к поколению.

Часть, отвечающая за «изменение», в эволюционных алгоритмах называется мутационным оператором. Раньше он был жестко задан, способы изменения определялись человеком заранее; позже для изменений стали использовать LLM, но это тоже лишь одноразовая генерация кода.

AVO же превращает весь мутационный оператор в автономного агента.

Таким образом, он может изучать руководства по CUDA и документацию по архитектуре PTX, запускать тесты, читать результаты профилирования, самостоятельно диагностировать ошибки корректности и решать, что изменять в следующей версии.

Команда поставила его на B200 с задачей оптимизировать ядро внимания — один из самых интенсивно оптимизируемых операторов в Transformer. После этого они просто отпустили его.

AVO автономно работал 7 дней подряд, исследовал более 500 направлений оптимизации и в итоге представил 40 эффективных версий ядер.

Полученное ядро многоголового внимания оказалось быстрее собственного закрытого решения Nvidia cuDNN до 3.5% и быстрее самого передового открытого решения FlashAttention-4 до 10.5%.

Затем эта оптимизация была применена к GQA, которая сейчас является стандартом для больших моделей. На этот раз автономная работа заняла около 30 минут, и новое ядро оказалось быстрее cuDNN на 7.0% и FlashAttention-4 на 9.3%.

Ручное написание CUDA-ядер всегда было самой высокой планкой в этой экосистеме, и AVO первым её преодолел.

И те самые 25 игр ARC-AGI-3 были пройдены с использованием той же самой системы.

Оптимизация ядер и прохождение игр кажутся абсолютно разными задачами. Но, по мнению Nvidia, в их основе лежит один и тот же цикл.

Агент строит гипотезу на основе неполных данных, пробует её на практике, наблюдает результат, сохраняет полезное состояние и корректирует своё понимание проблемы. Если гипотеза ошибочна, он откатывается и переосмысливает. И так раунд за раундом.

Как говорят в самой Nvidia, переносится не предметное знание, а механизм, поддерживающий длительную автономную работу.

Создала его команда китайских специалистов

В списке авторов статьи об AVO можно увидеть множество знакомых имён.

23 подписи — это практически все ключевые фигуры в области открытой инфраструктуры глубокого обучения за последние десять лет.

Один из первых авторов, Бин Сюй, — Distinguished Engineer в Nvidia и создатель MXNet. Ещё раньше он был четвёртым автором оригинальной статьи о GAN 2014 года, подписанной вместе с последним автором Йошивой Бенджио из Монреальского университета.

В списке также есть Тяньци Чэнь, создатель TVM и XGBoost. Линия TVM связана и с Луисом Сесе: вместе они основали OctoAI, которую Nvidia приобрела в сентябре 2024 года, после чего Сесе присоединился к Nvidia, продолжая работу над компиляторами для машинного обучения.

Далее идут Е Цзыхао, автор FlashInfer, и Винод Гровер, ветеран компиляторов CUDA.

Руководит проектом Хамфри Ши, вице-президент Nvidia по высокопроизводительному ИИ и профессор Технологического института Джорджии. Другой первый автор, Чжифань Е, — докторант того же института.

В блоге указано пять имён, четверо из них — китайцы: Хамфри Ши, Терри Чэнь, Чжифань Е и Еинь Чжу. Пятый — Жан-Франсуа Пужет, двукратный гроссмейстер Kaggle от Nvidia.

Самая интересная часть — это рассказ самого Бина Сюя в X.

Полтора года назад, когда он и Терри Чэнь только начинали заниматься агентным программированием в Nvidia, они оба не разбирались в программировании для GPU.

Именно из-за этого незнания они с первого дня стремились создать полностью автоматическую систему, не требующую вмешательства человека, и даже дали этому подходу название — «слепое программирование».

Через полтора года эта система, не управляемая человеком, превзошла ядра, которые эксперты оптимизировали месяцами.

В конечном счете, всё сводится к видеокартам Дженсена

Зачем компании, продающей видеокарты, тратить полтора года на создание автономного агента, не требующего вмешательства человека?

Потому что эту оболочку можно использовать с любой моделью.

AVO уже работал с разными моделями. На тех же уровнях с GPT-5.6 Sol время было меньше, а с Opus 5 — меньше шагов.

Nvidia не зарабатывает на продаже моделей, но этот слой она может занять. Это соответствует её общей стратегии последних лет.

Сторона моделей развивается как открытая. Nemotron 4, запущенный в августе этого года, нацелен на масштаб в триллионы параметров, обучение планируется завершить осенью, модель будет распространяться бесплатно, а деньги будут зарабатываться на последующих GPU и программных стеках.

Со стороны вычислительных мощностей, долгосрочные агенты — именно та нагрузка, которая им нужна. Дженсен Хуан на GTC в этом году заявил, что переломный момент в инференсе уже наступил. За последние два года потребность в вычислениях выросла примерно в десять тысяч раз, а объем использования — всего в сто раз, и вся разница поглощена инференсом.

Поэтому неважно, чьи модели используются. Главное, чтобы задачи агентов становились длиннее и сложнее, — в итоге счёт всё равно будет выставляться за их видеокарты.

Что касается 100 баллов, то сейчас они действительно быстро девальвируются.

В марте ещё никто не мог набрать и 1 балла, Tycho в конце июля первым достиг максимума, VISTA 5 августа повторила это, а результат AVO — уже третий за шесть недель, и все три системы работают на Claude Opus 5.

Но достижение AVO от этого не обесценивается.

Архитектура, созданная для выжимания последних процентов производительности из FlashAttention на B200, была почти без изменений перенесена в пиксельную игру — и справилась.

Были заменены только интерфейс задачи и способ оценки, а основной цикл не изменился ни на строчку.

Как и написали в конце блога Nvidia, модель важна, но модель — не весь агент.

Источники:

https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/

Эта статья из WeChat Official Account «Новая Эра ИИ», автор: ASI启示录, редактор: Моисей

Трендовые криптовалюты

Связанные с этим вопросы

QЧто такое AVO и какое достижение оно совершило в ARC-AGI-3?

AAVO - это автономный агент общего кодирования от NVIDIA. Он достиг максимального результата в 100% (RHAE) на тесте ARC-AGI-3, успешно пройдя все 183 уровня в 25 игровых средах за 6624 шага.

QКакова была производительность базовой модели Claude Opus 5 на ARC-AGI-3 без использования AVO?

AБез системы AVO модель Claude Opus 5 показала результат всего 30.16% на тесте ARC-AGI-3, что, тем не менее, было лучшим показателем в официальном рейтинге на тот момент.

QКакие два ключевых механизма в системе AVO позволили добиться такого скачка в производительности?

AДва ключевых механизма AVO: 1) Постоянная память, которая сохраняет историю проб, результаты, выводы компиляторов и процесс поиска, позволяя агенту продолжить с текущего состояния после сброса контекста. 2) Супервизор, который отслеживает траекторию поиска и перенаправляет основной агент при отсутствии прогресса или бесполезных повторениях.

QДля какой первоначальной задачи была создана система AVO, и какие результаты она показала?

AAVO была создана для автономной оптимизации GPU-операторов, в частности, ядер внимания для трансформеров. На задаче оптимизации ядра многоголового внимания на B200 за 7 дней автономной работы AVO создала ядро, которое на 3.5% быстрее собственного закрытого решения NVIDIA cuDNN и на 10.5% быстрее передового открытого решения FlashAttention-4.

QКто входил в команду разработчиков AVO и какова их связь с ключевыми проектами в области ИИ?

AКоманда разработчиков AVO в основном состоит из специалистов китайского происхождения, внесших вклад в фундаментальные проекты ИИ. Среди них: Бинг Сюй (соавтор оригинальной статьи GAN, создатель MXNet), Тяньци Чэнь (создатель TVM и XGBoost), Луис Сеза (сооснователь OctoAI, поглощенной NVIDIA), Цзыхао Е (создатель FlashInfer) и Винод Гровер (ветеран компиляторов CUDA). Руководил проектом Хамфри Ши, вице-президент NVIDIA по высокопроизводительному ИИ.

Похожее

Ethereum обогнал по росту биткоин и обновил максимум с января

Эфириум (ETH) обогнал биткоин (BTC) по темпам роста, прибавив почти 3% за сутки и около 30% за неделю. Цена ETH достигла $2,54 тыс., обновив максимум за семь месяцев. Биткоин также продолжил рост, подорожав за сутки на 1,5% и за неделю на 22%, торгуясь около $77,3 тыс. Курс ETH к BTC поднялся до уровня конца января и составляет около 0,032 BTC за 1 ETH. Доходность Эфириума в третьем квартале превысила 55%, напоминая сильный рост в аналогичный период 2025 года. Standard Chartered прогнозирует достижение ценой ETH отметки $4 тыс. в этом году и $40 тыс. к концу десятилетия, связывая это с центральной ролью блокчейна Ethereum в развивающемся рынке DeFi. Сооснователь Ethereum Виталик Бутерин отметил вклад биткоин-сообщества в разработку технологий, которые потенциально могут быть использованы для масштабирования Эфириума.

cryptonews.ru10 мин. назад

Ethereum обогнал по росту биткоин и обновил максимум с января

cryptonews.ru10 мин. назад

Поступления в биткоин-ETF достигли $1,9 млрд за самую сильную неделю с октября 2025 года

По данным SoSoValue, приток средств в американские биткоин-ETF на спотовом рынке на прошлой неделе достиг 1,92 млрд долларов, что стало лучшим недельным показателем с октября 2025 года. Аналитик Нейт Герачи отметил, что спотовые ETF на эфир также привлекли около 700 млн долларов. Этот всплеск интереса совпал с ростом биткоина более чем на 20% за неделю, когда цена ненадолго превысила 79 000 долларов. Несмотря на недавний рост, с начала 2026 года чистый отток из биткоин-ETF в США составил около 2,91 млрд долларов. Самые значительные ежемесячные оттоки были зафиксированы в июне (4,51 млрд долларов), однако август, с притоком в 2,38 млрд долларов по состоянию на пятницу, стал лучшим месяцем по притоку средств в этом году. Фонд iShares Bitcoin Trust (IBIT) от BlackRock был главным драйвером прошлой недели, привлекшим около 1,33 млрд долларов за пять торговых дней подряд. Аналитик Bloomberg Эрик Балчунас охарактеризовал график ежедневных потоков IBIT как классический бычий сигнал — «паттерн Flipping the Bird». Отмечается, что предыдущий крупный приток в октябре 2025 года (3,42 млрд долларов) предшествовал обвалу рынка 10 октября, в результате которого было ликвидировано примерно 19 млрд долларов в leveraged-позициях. С тех пор цена биткоина упала примерно на 38% с отметок около 124 700 долларов.

cointelegraph12 мин. назад

Поступления в биткоин-ETF достигли $1,9 млрд за самую сильную неделю с октября 2025 года

cointelegraph12 мин. назад

Артур Хейс в десятитысячном интервью: ETH достигнет 30 000 долларов; FLOP превзойдет ETH

Артур Хейз, сооснователь BitMEX, в интервью обсуждает макроэкономические факторы, влияющие на крипторынок. Он связывает недавний рост рынка с увеличением ликвидности из-за действий Министерства финансов США по выкупу гособлигаций, что, по его мнению, повторяет сценарий 2008 года, ведущий к росту ценности биткоина. Хейз предсказывает, что BTC достигнет $126 000 к концу года, а ETH может подняться до $20 000–30 000, учитывая его отставание в текущем цикле. Также он критикует американский «Закон о ясности» (Clarity Act) как несущественный для реального развития криптоиндустрии. Основное внимание в беседе уделяется его новому проекту — Flop Network. Это блокчейн, предназначенный для экономики AI-агентов, где нативная монета FLOP напрямую привязана к вычислительной мощности (FLOPS — операции с плавающей запятой в секунду). Хейз анонсирует масштабный аирдроп 20% от 10-летнего предложения токенов для тестирования сети, подчёркивая отсутствие предпродаж и венчурного финансирования. Он верит, что если Flop Network станет стандартной валютой для AI-агентов, его капитализация сможет соперничать с биткоином.

Odaily星球日报14 мин. назад

Артур Хейс в десятитысячном интервью: ETH достигнет 30 000 долларов; FLOP превзойдет ETH

Odaily星球日报14 мин. назад

Отчет Goldman Sachs: Доходность акционеров Samsung Electronics ниже ожиданий, расширение FCF поддерживает восстановление стоимости

Аналитики Goldman Sachs в отчете от 23 августа отмечают, что программа вознаграждения акционеров Samsung Electronics, объявленная на 2026 год в диапазоне 90-110 трлн вон, оказалась ниже краткосрочных рыночных ожиданий (около 150 трлн вон). Однако ключевым драйвером восстановления оценки компании аналитики считают не разовый масштаб выплат, а устойчивое расширение свободного денежного потока (FCF) и стабильный механизм его возврата акционерам. Samsung не объявил о единовременных крупных выплатах, как, например, SK Hynix, но представил четкий поэтапный план. По расчетам Goldman Sachs, совокупный FCF компании за 2024-2026 гг. составит около 270 трлн вон, а общий объем возврата акционерам при 50% норме распределения — примерно 135 трлн вон. Выплаты в 2026 году, согласно прогнозам, достигнут около 106 трлн вон, причем в их структуре будет преобладать дивидендная составляющая. Аналитики ожидают значительного роста FCF в 2027-2028 гг., что позволит увеличить пул средств для акционеров до 179 трлн и 232 трлн вон соответственно, даже при сохранении текущей политики распределения 50% FCF. Это может приблизить или даже превысить уровень выплат конкурентов. Goldman Sachs сохраняет рекомендацию «Покупать» по обыкновенным акциям Samsung с целевой ценой 49 000 вон, что подразумевает потенциал роста в 74%. Текущая оценка выглядит привлекательной: коэффициент P/B на 2027 и 2028 годы прогнозируется на уровне 1,7x и 1,2x при рентабельности собственного капитала (ROE) 40-50%. Ключевыми рисками являются ухудшение ситуации на рынке памяти, снижение маржинальности смартфонов и потеря доли рынка OLED-панелей. Таким образом, история вознаграждения акционеров Samsung рассматривается аналитиками как структурное улучшение, основанное на устойчивом росте денежного потока, а не как разовое событие.

marsbit22 мин. назад

Отчет Goldman Sachs: Доходность акционеров Samsung Electronics ниже ожиданий, расширение FCF поддерживает восстановление стоимости

marsbit22 мин. назад

Торговля

Спот

Популярные статьи

Как купить ONE

Добро пожаловать на HTX.com! Мы сделали приобретение Harmony (ONE) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки Harmony (ONE).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение Harmony (ONE)После приобретения вами Harmony (ONE) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля Harmony (ONE)С легкостью торгуйте Harmony (ONE) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

1.0k просмотров всегоОпубликовано 2024.04.12Обновлено 2026.06.02

Как купить ONE

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на ONE (ONE) представлены ниже.

活动图片