19 августа компания Unitree Technology официально вышла на листинг на научно-техническом инновационном рынке (STAR Market), открывшись по цене 1100 юаней за акцию, капитализация составила около 444,9 млрд юаней.
В тот же день Хуан Миньшань, дочь генерального директора NVIDIA Хуана Жэньсюня, прибыла в Пекин для посещения Всемирной конференции по робототехнике (WRC).

А уже на следующее утро по пекинскому времени кремниевая робототехническая компания Generalist AI выпустила новую базовую модель GEN-1.5.
Двумя месяцами ранее профессор Стэнфорда Ли Фэйфэй лично инвестировала в раунд финансирования Generalist AI на 4 миллиарда долларов. Ангельскими инвесторами этого же раунда выступили сооснователь Xiaomi Линь Бинь и основатель Zoom Эрик Юань. NVIDIA также является акционером. Умные деньги и умные люди одновременно устремились в одном направлении.
GEN-1.5 дал им причину для инвестиций: показать роботу 3-12-секундную демонстрацию действия, без дополнительного обучения или донастройки, он немедленно приступает к выполнению, средний показатель успеха по 10 задачам — 59%.

Раньше, чтобы научить робота откручивать крышку, инженерам требовалось три месяца программирования. Теперь все необходимые вложения — это трёхсекундная демонстрация и ноль строк кода.
Многие ведущие исследователи сравнивают этот момент с выпуском GPT-3 в 2020 году, полагая, что воплощённый интеллект переживает свой момент GPT-3.

Стратегии, которым не учили, возникают из предобучения
Самая поразительная для исследователей способность GEN-1.5 — не подражание, а импровизация.
Generalist AI провели эксперимент: используя 5 минут данных демонстрации человеком (с микроподстройкой всего на 1 шаг градиента), они научили робота сметать кирпичики в миску с помощью щётки, а затем заменили инструмент.
Дав ему банан, он использовал банан как щётку, чтобы смести кирпичики в миску — это не удивительно, форма и стратегия контакта банана схожи со щёткой.

Дав ему совок, он отказался от стратегии «сметания» и использовал другую руку, чтобы подтолкнуть кирпичики на совок, поднял совок и высыпал кирпичики в миску.

«Сметание» и «сгребание и высыпание» — это две совершенно разные последовательности контакта, и такой набор действий не был продемонстрирован в обучающих данных.
Generalist AI использовали поиск по ближайшим соседям на естественном языке, чтобы найти в предобучении около 1,89 млн сцен, но не обнаружили подобного использования совка.
Никто ни на каком этапе не говорил модели, что она должна так поступать.
Подобное импровизационное поведение неоднократно появлялось в тестах: миска была накрыта листом бумаги, модель сама сняла бумагу, прежде чем положить кирпичик, а иногда даже накрывала бумагой обратно, хотя в обучающих данных не было такой сцены.

Кубик LEGO прилип к кончику механического пальца, модель использовала другую руку, чтобы снять его.

В обучающих данных была продемонстрирована только вращение крышки банки одной рукой, модель в некоторых попытках спонтанно переключалась на работу двумя руками, используя совершенно другую стратегию захвата и вращения.

Модель, обученная только класть один кирпичик в одну миску, начала спонтанно сортировать несколько кирпичиков по цвету.
У всех этих способностей есть общий источник: масштабное предварительное обучение (претренинг).
GEN-1.5 непрерывно обучался более 8 месяцев, пройдя три этапа обучения.
Опубликованная Generalist AI кривая на валидационной выборке показывает, что «ошибка предсказания следующего действия» модели продолжает снижаться, и до сих пор не наблюдается признаков сходимости.
Используя терминологию области больших языковых моделей, это — Scaling Law (закон масштабирования) для воплощённого интеллекта: по мере увеличения масштаба данных физического взаимодействия и продолжительности обучения способность модели к обобщению продолжает усиливаться.
Контр-интуитивное открытие сделало эту тенденцию ещё более ясной: чем меньше шагов градиента при микроподстройке, тем сильнее способность к импровизации.
Объяснение Generalist AI таково: лёгкая микроподстройка оставляет модель ближе к широкой библиотеке поведения, накопленной в ходе предобучения, сохраняя больше «физического опыта», который можно задействовать.
10 шагов градиента изменили только 0,15% параметров модели.
Generalist AI говорит об этом так: это уже близко к «напоминанию модели о чём-то, что она уже почти знает».
GEN-1.5 также преодолел две пропасти, долгое время беспокоившие область робототехники.
Записать демонстрацию в симуляторе (хотя данные предобучения не содержат данных моделирования), поместить её в контекстное окно, и реальный робот напрямую выполняет задачу, обобщая её на разные манипуляторы и новые положения объектов.
В некоторых тестах человек прямо своими руками демонстрировал действие перед камерой робота, а затем робот воспроизводил задачу механической рукой.
Generalist AI заявляет, что все эти способности не являются результатом целенаправленного проектирования: нет специальных архитектурных изменений для облегчения контекстного обучения, нет циклов метаобучения, нет вспомогательных целевых функций обучения для поощрения импровизации.
Эти способности возникли самостоятельно в ходе масштабного предобучения на физических данных.
«Святой Грааль обучения манипуляциям»
Другие исследовательские группы ранее также демонстрировали аналогичные способности к контекстному обучению, но ограничивались лишь несколькими типами задач; новизна GEN-1.5 заключается в широте охвата; все результаты являются собственными отчётами Generalist AI и ещё не прошли независимую проверку.
Сами задачи представляют собой простые кратковременные манипуляции (откручивание крышки, расстёгивание молнии), что всё ещё далеко от длительных сложных задач в реальных сценариях.
GPT-3 был выпущен в июне 2020 года, от GPT-3 до ChatGPT прошло два с половиной года (да, именно два с половиной).
Текущее положение GEN-1.5 аналогично положению GPT-3 в 2020 году: способности сырые, но направление ясное, задачи простые, но тренд масштабирования (Scaling) очевиден.
Generalist AI в официальном блоге написали вдохновляющую фразу:
После определённого порога предобучения стоимость адаптации к новой задаче становится пренебрежимо малой.
Возникшее контекстное обучение, несколько секунд данных, или один шаг градиента плюс минута демонстрации — это уже не обучение под конкретную задачу в традиционном смысле, а скорее напоминание модели о чём-то, что она уже почти знает.

Если кривая масштабирования для воплощённого интеллекта действительно не демонстрирует признаков сходимости (Generalist AI говорит, что они этого ещё не видят), то ключевым ресурсом следующего этапа конкуренции становится тот, у кого достаточно данных физического взаимодействия, чтобы накормить этот движок.
Это точная копия сценария 2021 года, когда большие языковые модели вступили в борьбу за данные.
Научиться с одного просмотра: переломный момент, стоящий за цифрами 59% и 83%
В июне 2020 года OpenAI выпустила GPT-3.
Эта модель сделала то, чего раньше никто не мог: без переобучения, просто дав несколько примеров в диалоговом окне, она могла выполнить новую языковую задачу — дать примеры «красный→яблоко, жёлтый→банан» и спросить «зелёный→?», и она могла ответить «арбуз».
Эта способность называется in-context learning (обучение в контексте) и стала водоразделом для больших языковых моделей от «специализированного инструмента» до «универсальной платформы».
GEN-1.5 переносит то же самое в физический мир.
Generalist AI называют это Physical Prompting (физический промптинг).
Метод работы прост: реальная демонстрация действия (содержащая данные сенсоров и траекторию действий) помещается в 30-секундное контекстное окно памяти модели, оставшееся пространство используется для получения наблюдений за средой в реальном времени.
Модель немедленно пытается выполнить задачу, без каких-либо шагов обучения.
Здесь необходимо объяснить концепцию, крайне важную для понимания GEN-1.5: шаг градиента (gradient step).
В традиционном подходе обучение робота новой задаче требует десятков тысяч шагов градиентного спуска, каждый шаг — это небольшая настройка внутренних параметров модели, что обычно требует огромного количества данных и вычислительных мощностей.
Режим one-shot (один пример) в GEN-1.5 пропускает все шаги градиента, параметры модели остаются нетронутыми.
Generalist AI протестировали GEN-1.5 на 10 различных задачах манипулирования: откручивание крышки стеклянной банки, расстёгивание молнии на пенальце, вынимание денег из кошелька, складывание бумаги, складывание стаканов, переворачивание телефона, сметание кирпичиков щёткой, открытие обложки книги, вскрытие вакуумной упаковки, уборка мусора.
Результаты разделены на две группы:
one-shot (один просмотр, ноль шагов градиента): средний показатель успеха по 10 задачам — 59% (стандартное отклонение ±10%).
few-shot (мало примеров, 5 минут данных, около 50 демонстраций, 10 шагов градиента): средний показатель успеха — 83% (стандартное отклонение ±9%).

Для сравнения, цифры GPT-3 2020 года для языковых задач: one-shot — около 45%, few-shot (около 100 примеров) — около 65%.
Структура обеих групп цифр очень похожа.
Значение этих цифр можно понять так: до появления больших языковых моделей заставить ИИ выполнить новую языковую задачу (например, перевести незнакомый формат) требовало специального сбора данных, обучения новой модели, цикл занимал месяцы.
После GPT-3 это превратилось в «написание нескольких примеров в поле ввода», временные затраты сократились с месяцев до секунд.
GEN-1.5 сделал такое же сжатие в области физического манипулирования.
Раньше, чтобы научить робота откручивать крышку, требовалось, чтобы инженер программировал месяцами или давал десятки тысяч обучающих данных для тонкой настройки параметров.
Теперь достаточно 3-12-секундной демонстрации.
Generalist AI написали в официальном блоге: это меняет две вещи: скорость, с которой роботы становятся полезными (с месяцев до секунд), и то, кто может использовать роботов (с экспертов на любого человека).

Кипящая роботами неделя: листинг Unitree, открытие Конференции и Спартакиады
Время выпуска GEN-1.5 пришлось на самую насыщенную неделю для всей отрасли воплощённого интеллекта.
19 августа в Пекине, в районе Ичжуан, открылась Всемирная конференция по робототехнике (WRC), на которой было представлено более 300 компаний, свыше 2000 экспонатов, более 150 мировых премьер.
Через три дня, 22 августа, в Национальном конькобежном центре «Ледяная лента» стартовали Вторые Всемирные спартакиадные игры человекоподобных роботов — 666 команд с 2056 роботами приняли участие в 1301 соревновании по 51 дисциплине, количество команд выросло на 138% по сравнению с первыми Играми.
Впервые на Спартакиаде были установлены 21 соревнование на реальных сценариях, требующих от человекоподобных роботов выполнения длительных задач в реальных условиях, таких как фабрика, отель, домашнее обслуживание, тема «испытание роботов на рабочем месте» стала ключевой.
Только что вышедшая на биржу Unitree Technology в 2025 году выпустила более 5500 человекоподобных роботов, заняв первое место в мире по объёму поставок, выручка составила 1,7 млрд юаней, валовая прибыль — 60%, и DeepSeek также участвовала в стратегическом размещении.
Но в проспекте Unitree скрывается пара контрастных данных: темпы роста выручки в первом квартале 2026 года снизились с 332,64% в прошлом году до 68,49%, чистая прибыль после вычета чрезвычайных статей упала на 52,55% по сравнению с предыдущим годом. Основная причина замедления роста — значительное увеличение инвестиций в НИОКР.
То, за чем гонится Unitree, — это то, чего у неё ещё нет: большая модель воплощённого интеллекта.
«Новая позиция Про» в своём анализе («Проспект Unitree скрывает беспокойство о „сроке годности“ инженерного чуда») описал структурную дилемму, с которой сталкивается Unitree: Unitree создала корпус №1 в мире по объёму поставок, но «мозг отсутствует».
2026 год называют «годом листинга» для воплощённого интеллекта: более 20 компаний чётко обозначили планы по выходу на биржу, но движущей силой волны IPO во многом является финансовое давление.
Многие конкуренты зависят от раунда за раундом финансирования для поддержания работы, темпы НИОКР диктуются окнами финансирования.

Источник: LatePost «Денежная игра воплощённого интеллекта»
Основатель Unitree Ван Синсин на WRC публично заявил, что основным узким местом, ограничивающим развитие человекоподобных роботов, является большая модель воплощённого интеллекта, «ожидается, что в будущем, быстрее через два-три года, медленнее через пять-десять лет, возможно, удастся достичь момента ChatGPT для роботов».
Выпуск GEN-1.5 можно рассматривать как первый практический ответ на это суждение.
Закон масштабирования (Scaling Law) существует в области воплощённого интеллекта, масштабное предварительное обучение может сделать предельные затраты на адаптацию к новой задаче приближающимися к нулю.
Этот вывод имеет прямое промышленное значение для производителей платформ, таких как Unitree: как только универсальная модель на уровне «мозга» созреет, ценность платформы будет определяться тем, насколько быстро она сможет подключиться к этому мозгу, а не только аппаратными параметрами и объёмами поставок.
Бэкграунд команды Generalist AI полностью соответствует этому техническому пути.
Сооснователи Пит Флоренс и Энди Цзэн из команды робототехники Google DeepMind, Эндрю Бэрри из Boston Dynamics.

Слева направо: Пит Флоренс, Эндрю Бэрри, Энди Цзэн
Компания в июне 2026 года завершила раунд финансирования на 4 миллиарда долларов, возглавляемый Radical Ventures, с участием NVIDIA и Bezos Expeditions, оценка после инвестиций составила 20 миллиардов долларов.
Generalist AI в настоящее время ведёт переговоры о новом раунде финансирования с оценкой в 30 миллиардов долларов.
Гуру Кремниевой долины переживают долгожданный момент коллективного воодушевления
Этот релиз вызвал сильную реакцию в сообществе исследователей робототехники.
Сооснователь Пит Флоренс написал в X:
С тех пор как мы начали исследовать базовые модели для роботов, широкое одноразовое контекстное обучение было для меня самой ясной целью.
Теперь я вижу, как почти десятилетнее воображение становится реальностью.

Флоренс упомянул, что он и Энди Цзэн ещё на стадии аспирантуры обсуждали способность типа «Ctrl-C-Ctrl-V»: увидеть действие — робот может его скопировать. Но реализовать это было чрезвычайно сложно, потому что «мир, в который вы хотите вставить, всегда отличается от того мира, который вы скопировали».
Исследователь робототехники из Университета Карнеги-Меллона Крис Пакстон в X назвал GEN-1.5 «возможно, истинным моментом GPT» и написал:
Святой Грааль обучения манипуляциям, без сомнения, — это одноразовое обучение (one-shot learning).

https://x.com/chris_j_paxton/status/2090270734816092334

https://x.com/chris_j_paxton/status/2090210797125611972
Исследователь воплощённого интеллекта Северо-Восточного университета (США) Джимми Янг при репосте сказал:
Как исследователь воплощённого ИИ, это действительно особенный момент для этой области.

https://x.com/JimmyTYYang1/status/2090202923632366073
Комментарий технического директора по робототехнике NVIDIA Джима Фана дал углублённую техническую перспективу.
Он указал на два ключевых фактора возникающих способностей GEN-1.5:
Первый — естественно существующие в обучающих данных симметричные повторяющиеся паттерны действий, например, многократное закручивание винтов при сборке мебели, где второй винт является «образцом контекстного обучения» для первого;
Второй — действия по восстановлению после человеческих ошибок в данных, например, поднять упавшую вещь и продолжить, эта полная дуга «провал-восстановление-продолжение» позволяет модели естественно демонстрировать способность исправлять ошибки во время тестирования.
Джим Фан также отметил, что метод сбора данных UMI, используемый Generalist AI (когда человек напрямую надевает захваты робота и управляет), сохраняет «физическую интуицию» человека, тогда как традиционная телероботика через устройства VR приводит к значительной потере этой интуиции.

https://x.com/DrJimFan/status/2090465981240086992
Конечно, также прозвучала и холодная рациональная вода.
Джим Фан в комментариях к тому же твиту написал:
Демонстрации пока всё ещё слишком просты, чтобы делать окончательные выводы.

https://x.com/DrJimFan/status/2090469108764823587
Эта статья из официального аккаунта WeChat «Новые мудрецы» (新智元), автор: ASI Апокалипсис





