Команда NVIDIA создала агента-программиста, который берет на себя эксперименты с реальными роботами, достигая успеха в 99% случаев

marsbitОпубликовано 2026-06-18Обновлено 2026-06-18

Введение

Проект ENPIRE от NVIDIA GEAR Labs впервые реализовал полностью автоматизированные исследования на реальном роботизированном оборудовании. Система, состоящая из восьми автономных кодирующих агентов Codex, управляет флотом роботов для решения сложных задач ловкости, таких как завязывание стяжек, сортировка булавок и установка GPU, с успешностью до 99%. Агенты работают автономно в замкнутом цикле: сброс среды, поиск в литературе, реализация идей, обучение стратегий, развертывание, валидация и итеративное улучшение кода, практически без вмешательства человека. Ключевые инсайты: создание автоматизированной среды сброса часто проще, чем сама задача. Система демонстрирует «физический закон масштабирования» — увеличение числа параллельных роботов (например, до 8) значительно ускоряет решение. Введены новые метрики: MRU (средняя загрузка роботов) и MTU (эффективность использования токенов агентами). Текущая загрузка роботов ниже 50%, что указывает на потенциал роста через оптимизацию скорости работы агентов. Цель — достичь полностью автономной работы лаборатории. Проект будет открыт, что позволит разработчикам создавать подобные системы.

Автоматизированные исследования на этот раз действительно вышли из песочницы кода в реальный физический мир.

Недавно Джим Фан, руководитель лаборатории NVIDIA GEAR, представил новый проект под названием ENPIRE. Это их первая реализация автоматизированных исследований на роботизированном оборудовании.

Они поместили 8 агентов Codex во флотилию роботов, выделили им вычислительные мощности GPU и достаточный бюджет токенов, поставив простую цель: как можно быстрее решать задачи, поддерживать роботов в занятом, но безопасном состоянии и не тратить вычислительные ресурсы впустую.

Далее человеческое вмешательство практически прекратилось. Агенты автономно управляли всем замкнутым циклом: автоматически сбрасывали сцены, искали литературу, реализовывали идеи и строили инфраструктуру, обучали и развертывали стратегии, проводили самопроверку, анализировали логи и улучшали код, постоянно итерационно повторяя этот процесс, пока в реальном оборудовании не удавалось надежно выполнить задачи, требующие высокой точности и ловкости, такие как завязывание кабельных стяжек, упорядочивание игл в коробке или установка GPU.

Они также наблюдали «закон масштабирования в физическом мире»: увеличение количества параллельно работающих роботов (например, с нескольких до 8) значительно ускоряло решение задач.

В настоящее время часть систем лаборатории уже реализует самоитерацию в течение всей ночи без вмешательства человека, и исследователям достаточно лишь просматривать отчеты по утрам.

Джим Фан заявил, что цель на будущее — позволить членам команды спокойно уходить в отпуск, и даже генеральный директор NVIDIA Дженсен Хуанг не будет замечать, что лаборатория продолжает работать автономно.

Проект ENPIRE планируется полностью открыть, и тогда обычные разработчики смогут построить у себя дома аналогичную систему автономных роботизированных исследований.

Адрес проекта: https://research.nvidia.com/labs/gear/enpire/

Архитектура системы ENPIRE: четыре модуля образуют замкнутый цикл

ENPIRE — это каркасная система, разработанная для агентов-кодеров, которая с помощью четырех ключевых модулей создает воспроизводимый цикл физической обратной связи: модуль среды (EN) отвечает за автоматический сброс и проверку, модуль улучшения стратегии (PI) запускает оптимизацию стратегии, модуль прогона (R) поддерживает оценку стратегии на одном или нескольких роботах параллельно, а модуль эволюции (E) позволяет агенту-кодеру анализировать логи, изучать литературу, улучшать инфраструктуру обучения и код алгоритмов для устранения режимов сбоев.

Эта замкнутая система превращает обучение роботов в реальном мире в контролируемый, управляемый агентом процесс оптимизации, что сводит к минимуму ручной труд и одновременно позволяет проводить честные сравнительные эксперименты между различными рецептами обучения и вариантами агентов.

Благодаря поддержке ENPIRE передовые агенты-программисты смогли автономно разрабатывать стратегии и достигать 99% успеха в выполнении сложных задач по ловкому манипулированию в реальном мире, таких как PushT, укладывание штифтов в коробку, обрезание кабельных стяжек ножом.

Ключевое наблюдение: сброс среды часто проще, чем выполнение самой задачи

Одним из ключевых наблюдений стало: для многих роботизированных задач сброс среды зачастую проще, чем выполнение самой задачи.

Поэтому подход ENPIRE заключается в том, чтобы сначала позволить агенту построить среду автоматического сброса с помощью Code-as-Policy. Во многих случаях такой сброс — это просто задача pick-and-place, которую может решить Cap-X.

Затем интеллектуальный агент пишет эвристическую функцию вознаграждения. Исследовательская команда помещает эту среду в песочницу и запускает агента для проведения автоматизированных исследований вокруг полученных баллов.

Это также перекликается с определением автоматизированных исследований по Карпати: здесь речь идет не о простой настройке гиперпараметра или изменении небольшого фрагмента кода. Агент будет исследовать различные парадигмы в интернете и переписывать все, что может повысить производительность, включая алгоритмы, цели обучения и даже загрузчики данных.

В задаче с укладкой штифтов один агент даже самостоятельно написал контроллер безопасности по силе контакта, превзойдя по эффективности простую настройку нескольких параметров обучения с подкреплением.

Новые метрики: MRU и MTU

Масштабируемость ENPIRE зависит от размера команды агентов и вычислительных ресурсов, но здесь по-настоящему дефицитным ресурсом являются не GPU, а время работы роботов.

Когда исследовательская группа предоставила агентам 8 роботов вместо 1, время, необходимое для достижения почти идеального результата в задаче с укладкой штифтов, сократилось с более чем 1,5 часов до примерно 40 минут. Эти агенты координировались через Git: делились кодом, отказывались от неперспективных идей и автономно выбирали лучшие результаты выполнения друг у друга.

Это указывает на более масштабное изменение: робототехнические исследования превращаются в работу по проектированию среды — созданию окружения, в котором агенты-программисты могут проводить автоматизированные исследования; алгоритмическая работа смещается на более высокий уровень, превращаясь в построение замкнутого цикла обратной связи, который агенты могут замыкать самостоятельно.

И этот цикл будет наращиваться по сложным процентам: навык, освоенный агентом сегодня, завтра станет строительным блоком для создания и сброса среды для более сложных задач. Способности будут самовоспроизводиться, порождая новые способности.

В этой парадигме реальным жестким ограничением является бюджет на взаимодействие с реальным миром.

Поэтому исследовательская группа предложила две метрики:

  • Средняя утилизация роботов (Mean Robot Utilization, MRU): доля времени, которое роботы фактически тратят на проведение экспериментов, от общего реального затраченного времени.
  • Средняя утилизация токенов (Mean Token Utilization, MTU): измеряет эффективность преобразования агентом токенов в исследовательский прогресс.

В их экспериментах MRU всегда была ниже 50%. То есть роботы половину времени простаивали, ожидая, пока агент подумает. Поэтому улучшение обвязки (harness) и более быстрые модели напрямую превращаются в практическую выгоду.

PushT — давно используемый бенчмарк для манипуляций роботов. Обычно для выполнения этой задачи требуется большое количество демонстрационных данных от человека и несколько часов обучения методом поведенческого клонирования.

Но они увидели, что Codex, Claude Code и Kimi Code с помощью одного эвристического метода на основе правил «решили» эту задачу менее чем за 2 часа: без использования нейронных сетей, без обучения и без каких-либо человеческих данных.

Чтобы больше людей смогли попробовать автоматизированные исследования в физическом мире у себя дома, они на основе набора SO-101 от @LeRobotHF + NVIDIA Jetson Thor разработали полноценную стековую систему. Эта система может выполнять задачу PushT.

Ссылки для справки:

https://x.com/_wenlixiao/status/2066913334994358342

https://x.com/DrJimFan/status/2066921736369766762

Статья из официального аккаунта WeChat «Машины и разум» (ID: almosthuman2014), автор: Ян Вэнь

Связанные с этим вопросы

QЧто такое проект ENPIRE и в чём его основное достижение?

AENPIRE — это проект NVIDIA GEAR Lab, впервые реализующий автоматизированные исследования на роботизированном оборудовании. Его основное достижение — успешное создание замкнутой системы, в которой агенты на основе кода (Codex Agent) автономно проводят исследования, включая поиск литературы, реализацию идей, обучение и развёртывание стратегий в реальном мире, достигая 99% успеха в выполнении сложных задач, таких как завязывание стяжек и сортировка булавок.

QКакие четыре ключевых модуля составляют архитектуру системы ENPIRE?

AАрхитектура системы ENPIRE состоит из четырёх ключевых модулей, образующих замкнутый цикл: модуль среды (EN, Environment), который отвечает за автоматический сброс и верификацию; модуль улучшения стратегии (PI, Policy Improvement), запускающий оптимизацию стратегий; модуль оценки (R, Rollout) для оценки стратегий на одном или нескольких роботах; и эволюционный модуль (E, Evolution), где кодирующие агенты анализируют логи, исследуют литературу и улучшают код для устранения ошибок.

QЧто означают новые метрики MRU и MTU, предложенные исследователями в проекте ENPIRE?

AMRU (Средняя утилизация робота) — это процент времени, в течение которого робот фактически выполняет эксперимент от общего затраченного времени, показывая, насколько эффективно используется аппаратное обеспечение. MTU (Средняя утилизация токенов) измеряет эффективность преобразования вычислительных ресурсов (токенов) в реальный прогресс исследования. Низкий MRU, например менее 50%, указывает на то, что роботы простаивают, ожидая вычислений агентов.

QКакое ключевое наблюдение было сделано относительно задач для роботов в проекте ENPIRE?

AКлючевое наблюдение заключается в том, что для многих задач роботов сброс среды (например, возврат предметов в исходное положение) зачастую оказывается проще, чем само выполнение задачи. Поэтому система ENPIRE сначала поручает агенту создать автоматизированный сброс среды (часто через простое действие «возьми и положи»), а затем уже фокусируется на решении основной задачи через автоматизированное исследование.

QКак увеличение количества параллельных роботов повлияло на скорость решения задач в эксперименте?

AИсследователи обнаружили «физический закон масштабирования»: увеличение количества параллельно работающих роботов (например, с одного до восьми) значительно ускоряет решение задач. В задаче сортировки булавок время достижения почти идеального результата сократилось с более чем 1,5 часов до примерно 40 минут благодаря параллельной работе нескольких агентов, которые координировались через Git, обмениваясь кодом и выбирая лучшие результаты.

Похожее

9,42 миллиона частных инвесторов бросились покупать акции Changxin Technology, кто же выиграл в лотерее?

Результаты размещения акций Changxin Technology привлекли огромное внимание инвесторов. Всего в онлайн-подписке для частных инвесторов участвовало около 9,4288 миллиона человек, было подано 816,92 миллиарда заявок на акции, сгенерировано примерно 7,7 миллиона выигрышных лотерейных номеров, а итоговая ставка онлайн-подписки составила около 0,4714%, что является рекордно высоким показателем для новых акций на рынке STAR. Из-за высокого спроса компания активировала механизм обратного перевода, увеличив количество акций, размещаемых онлайн, до 3,851 миллиарда. Среди институциональных инвесторов 285 организаций, управляющих 10907 счетами, подали заявки на сумму около 12,38 триллиона акций, получив в итоге 2,173 миллиарда акций при коэффициенте распределения около 0,1756%. Taikang Asset Management стал институциональным инвестором, получившим наибольшее распределение. Среди публичных фондов лидерами по объему размещения стали E Fund, Southern Fund и ICBC Credit Suisse. Основатель ведущей китайской компании в области больших моделей DeepSeek, Лян Вэньфэн, через свои хедж-фонды Ningbo幻方量化 и Zhejiang九章资产 получил самое большое распределение среди частных фондов — акций на общую сумму примерно 1,75 миллиарда юаней. Ожидается, что Changxin Technology официально выйдет на биржу 27 июля. По оценкам рынка, её стоимость после IPO может превысить 1 триллион юаней, а некоторые аналитики дают прогноз до 2-3 триллионов юаней. Однако недавняя коррекция на глобальном технологическом рынке может оказать определенное влияние на цену акций компании после листинга.

marsbit13 мин. назад

9,42 миллиона частных инвесторов бросились покупать акции Changxin Technology, кто же выиграл в лотерее?

marsbit13 мин. назад

Криптовалюта USCR стабилизируется на отметке $0,0022: Сможет ли мемкоин отыграть потери второго квартала?

Криптовалюта USCR, мемкоин, отслеживающий тему официальных крипторезервов США, пытается восстановиться после падения до двухмесячного минимума в $0.0022. В мае цена выросла на 65%, но в июне упала на 37%. Сейчас наблюдается потенциальный отскок, и если быкам удастся закрепиться выше ключевых скользящих средних, возможен рост до $0.0028 (уровень Фибоначчи) и далее до майского пика в $0.0036, что означает потенциал роста на 30-60%. Динамика USCR тесно связана с новостями о создании стратегического резерва биткойна в США. Майский рост совпал с увеличением вероятности этого события и внесением соответствующего законопроекта. Однако его рассмотрение застопорилось, а шансы на создание резерва к 2027 году, по данным Polymarket, упали до 18%, что давит на настроения. Несмотря на неопределённость, база держателей USCR остаётся значительной: 48 тысяч, сократившись лишь на 4 тысячи с начала 2026 года. Восстановление цены будет зависеть от позитивных новостей по законопроекту о биткойн-резерве.

ambcrypto33 мин. назад

Криптовалюта USCR стабилизируется на отметке $0,0022: Сможет ли мемкоин отыграть потери второго квартала?

ambcrypto33 мин. назад

«Богиня благотворительности» с 3 млн подписчиков целиком создана ИИ, поддельный детский дом, международный «фальшивый фонд» рухнул за одну ночь

**Шокирующий разоблачение: Астролябка «благотворительности» с 300 000 подписчиков оказалась масштабной аферой на основе ИИ** Австралийская инфлюенсерша Лили Джей, имевшая почти 3 миллиона подписчиков в Instagram, создала тщательно продуманную мошенническую схему под прикрытием своего «Фонда Лили Джей». Используя искусственный интеллект, она и ее команда генерировали фальшивые изображения и видео, изображающие строительство мечетей, раздачу хлеба в Газе и даже открытие детского дома в Уганде для привлечения пожертвований от преимущественно мусульманской аудитории. Расследование ABC News Verify выявило многочисленные подделки: видео с «открытием» детского дома полностью сгенерировано ИИ (включая детей, саму Лили и фонды), «награда» за гуманитарную деятельность оказалась фальшивкой с цифровым водяным знаком ИИ, а заявленные благотворительные проекты в Уганде и Газе не существуют. Фонд не зарегистрирован как официальная благотворительная организация, что позволяло избегать финансовой отчетности. После запросов ABC сайт фонда стал скрывать кнопки для пожертвований и предупреждения о своем неблаготворительном статусе для посетителей из Австралии, но оставил их для иностранных пользователей. Эксперты предупреждают, что эта афера — тревожный прецедент, демонстрирующий, как ИИ может эксплуатировать человеческое доверие и желание творить добро, создавая убедительные, но полностью вымышленные нарративы.

marsbit52 мин. назад

«Богиня благотворительности» с 3 млн подписчиков целиком создана ИИ, поддельный детский дом, международный «фальшивый фонд» рухнул за одну ночь

marsbit52 мин. назад

L2 «рекалибровка»: когда L1 становится собственным ролл-апом, каков финал Ethereum?

«L2 перекалибровка»: когда L1 становится собственным роллапом, каков финал Ethereum? Первоначально, роллапы (L2) рассматривались как основной путь масштабирования Ethereum, обеспечивая дешёвое и быстрое исполнение транзакций. Однако, с развитием самого L1 (повышение лимита газа, внедрение безсостоятельности и zkEVM) и объединением задач масштабирования, традиционное разделение между L1 как безопасным, но медленным «слоем урегулирования» и L2 как дешёвым «слоем исполнения» меняется. Вопрос теперь не только в увеличении пространства блоков, а в перераспределении ролей в системе с множеством исполняющих сред. Будущая роль L2 смещается от простого предоставления дешёвого газа к обеспечению уникальных функций, таких как оптимизация для конкретных приложений, приватность и гибкие модели управления. Таким образом, L2 станет скорее спектром исполняющих сред с разной степенью наследования безопасности Ethereum, чем единым техническим классом. Ключевой задачей становится решение фрагментации. Разделённая ликвидность и состояние пользователя ухудшают опыт. Усилия концентрируются на улучшении взаимодействия (интероперабельности) через системы на основе намерений (intents) и нативные протоколы, такие как Ethereum Interoperability Layer (EIL), чтобы Ethereum вновь «ощущался как единая цепь». Сокращение времени до финальности транзакций L1 также имеет решающее значение для доверия между цепями. Ещё более радикальная идея — с появлением систем доказательств (zkEVM) внутри L1 сама Ethereum может стать своего рода «собственным роллапом», где высокопроизводительные узлы исполняют транзакции, а валидаторы проверяют криптографические доказательства. Это размывает классические границы между слоями и открывает путь к архитектуре, где множество исполняющих доменов (специализированных L2) сосуществуют, разделяя общую безопасность, ликвидность и систему урегулирования Ethereum. В итоге, будущее Ethereum видится не как победа L1 над L2 или наоборот, а как экосистема взаимосвязанных исполняющих сред, которые, будучи «разобранными» для масштабирования, вновь объединяются в единое, безопасное и удобное для пользователя целое.

marsbit55 мин. назад

L2 «рекалибровка»: когда L1 становится собственным ролл-апом, каков финал Ethereum?

marsbit55 мин. назад

Grayscale подает первую заявку на спотовый ETF Worldcoin в SEC под тикером GWLD

Компания Grayscale Investments подала заявку в Комиссию по ценным бумагам и биржам США (SEC) на запуск биржевого фонда (ETF), ориентированного на криптовалюту Worldcoin (WLD), под тикером GWLD. Заявка подана в момент, когда WLD торгуется на исторически низких уровнях, но новость вызвала рост его цены более чем на 8%. В документах подчеркиваются потенциальные риски для инвесторов, включая высокую концентрацию токенов (около 90% предложения в руках 100 крупнейших кошельков) и плановую разблокировку токенов командами проекта до 2028 года, что может оказывать давление на курс. Также отмечены регуляторные вопросы, связанные с биометрическим сбором данных через сканирование сетчатки глаза в проекте Worldcoin. Несмотря на то, что запуск ETF на бирже запланирован только на конец 2026 года, Grayscale активно расширяет линейку регулируемых криптовалютных продуктов, стремясь укрепить свои позиции на зарождающемся рынке ETF.

TheNewsCrypto1 ч. назад

Grayscale подает первую заявку на спотовый ETF Worldcoin в SEC под тикером GWLD

TheNewsCrypto1 ч. назад

Торговля

Спот
活动图片