От кода к сознанию: Руководство на десять тысяч слов о том, как эволюционирует мозг робота

marsbitОпубликовано 2026-06-07Обновлено 2026-06-07

Введение

**От кода к познанию: Путеводитель по эволюции мозга роботов** Роботы прошли путь от предсказуемых машин, управляемых тщательно написанным кодом (ROS, классическое управление), к более адаптивным системам, основанным на ИИ. Переломным моментом стало появление больших языковых моделей (LLM), которые стали выступать в роли "планировщиков", переводящих команды на естественном языке в последовательность действий. Однако истинная революция — это модели "Vision-Language-Action" (VLA), такие как RT-2 от Google и OpenVLA. Они напрямую объединяют зрение, язык и движение в одной нейронной сети, генерируя команды для исполнительных механизмов. Самые современные человекоподобные роботы (например, от Figure AI и многих китайских стартапов) используют **двухсистемную архитектуру**: медленная, "размышляющая" модель (System 2) анализирует сцену и ставит цели, а быстрая, "реактивная" модель (System 1, а также рефлекторный System 0) управляет моторами в режиме реального времени. Вся критичная для безопасности обработка выполняется на борту (например, на чипах NVIDIA Jetson). Следующий гигантский шаг — **модели мира** (World Models), такие как NVIDIA Cosmos или DeepMind Genie. Эти системы предсказывают последствия действий, позволяя роботу "проигрывать" различные сценарии в уме, выбирать наилучший и избегать ошибок *перед* тем, как начать движение. Они обещают радикально улучшить восстановление после сбоев, обобщение и долгосрочное планирование. Экономика меняется: цены на "железо" падают (...

Автор: Matt White, главный глобальный технический директор по AI в Linux Foundation

Компиляция: Felix, PANews

Ван Синсин (генеральный директор Unitree Robotics) и Matt White

Несколько недель назад в Шанхае друг, путешествовавший со мной (умный, следящий за новостями и наблюдательный, но не сильно разбирающийся в робототехнике), за ужином задал вопрос, которого я ждал всю поездку.

«Те роботы-собаки, что бегают повсюду, человекоподобные роботы, исполняющие кунг-фу на демонстрационной сцене в офисе Unitree, и роботизированные руки, складывающие одежду, которые мы видели. Как они это делают? Они управляются большими языковыми моделями (LLM)? Как вообще это работает? Там есть какая-то языковая модель, управляющая их движениями?»

Отличный вопрос, и, если честно: в какой-то степени да, но настоящая история гораздо интереснее. Роботы, которых вы видите в соцсетях, — это не ChatGPT в металлической оболочке. Они работают на стеке технологий (многослойной системе, где различные ИИ работают вместе). За последние три года этот стек изменился больше, чем за предыдущие тридцать лет. Языковые модели — лишь часть его. Модели компьютерного зрения, модели действий, деревья поведения, классические контуры управления и новое семейство систем под названием «мировые модели» — тоже важные его составляющие. И, возможно, «мировые модели» — самое важное из всех этих достижений.

Это длинная статья. Она начнётся с самого начала, затем шаг за шагом расскажет о каждом крупном изменении и, наконец, достигнет нынешнего этапа: когда робот не просто реагирует на мир, но и воображает его.

Часть 1: Эпоха до LLM. Когда роботы были просто программным обеспечением

Десятилетиями создавать роботов означало писать много кода, и почти весь этот код не требовал обучения.

Классические промышленные роботы представляли собой башни, сложенные из тщательно спроектированных модулей. Например, оранжевые роборуки, сваривавшие шасси Toyota в 90-х, или BigDog от Boston Dynamics в начале 2000-х.

  • Восприятие: Фильтрация видеопотока с камер, выделение контуров, распознавание положения детали с помощью геометрического сопоставления.
  • Оценка состояния: Комбинация показаний энкодеров колёс, гироскопов и акселерометров (сенсорная интеграция) для определения положения и скорости робота.
  • Планирование: При заданной целевой позе вычисление пути без столкновений на известной карте с помощью алгоритмов вроде A* или RRT.
  • Управление: На самом нижнем уровне ПИД-регуляторы сотни и тысячи раз в секунду корректируют крутящий момент двигателей для следования по этому пути.

Эти слои обычно писались разными людьми в разных лабораториях и чрезвычайно тщательно склеивались. Поведение (например, «если чашка красная — возьми, иначе — жди») кодировалось как конечный автомат или дерево поведения: блок-схема, которую робот выполняет шаг за шагом.

Сильные стороны этого подхода очевидны. Он предсказуем, соответствует стандартам безопасности. Поэтому в вашем автомобиле работает эффективная АБС.

Слабые стороны столь же очевидны. Такой робот был умён только в сценариях, которые инженер мог предвидеть. Поместите его в новый цех, при новом освещении или с чашкой другого цвета — он сломается. У него почти нулевая обобщающая способность.

Часть 2: Машинное обучение незаметно входит в игру

В 2010-х годах глубокое обучение взялось за решение проблем слоя восприятия. Свёрточные нейронные сети (CNN), превзошедшие человека в задаче классификации изображений ImageNet, можно было дообучить для определения точек захвата на объекте, сегментации мебели в комнате или распознавания позы человека. Внезапно верхний слой стека, «восприятие», больше не нужно было проектировать вручную — его можно было обучать.

Затем обучение распространилось на слой «управления». Исследователи из Беркли, DeepMind и OpenAI показали, что обучение с подкреплением (позволяющее роботам-агентам пробовать миллионы раз в симуляции и закреплять эффективные действия) может порождать удивительно умелые походки, манипуляции объектами рукой (решение кубика Рубика одной рукой от OpenAI в 2019 году стало вехой) и стратегии движения, адаптирующиеся к разным поверхностям.

Другое параллельное направление — обучение с подражанием, часто называемое клонированием поведения: запись сотен попыток человека дистанционно управлять роботом для выполнения задачи, а затем обучение нейронной сети предсказывать, какое действие предпринял бы человек, основываясь на наблюдениях робота.

Ключевой момент: каждая обученная стратегия была слишком узкой. Обучите сеть поднимать красный кубик — она не будет знать, что делать с жёлтой чашкой. Обучите её ходить по траве — она упадёт на плитке. Обобщение оставалось нерешённой проблемой.

Стоит отметить появление в этот период базовой инфраструктуры, которая до сих пор лежит в основе почти всего: ROS, операционной системы для роботов (впервые выпущена в ноябре 2007 года). ROS — это не операционная система в смысле Windows или Linux, а каркас промежуточного ПО, универсальная система передачи данных для роботов. Она позволяет «узлам камеры», «узлам навигации», «узлам управления роборукой» и десяткам других узлов публиковать и подписываться на сообщения через общую шину.

Текущая версия ROS2 работает в основе подавляющего большинства исследовательских и коммерческих роботов по всему миру, от лабораторий Стэнфорда до китайских стартапов по созданию человекоподобных роботов. Когда говорят об «операционной системе» робота, почти всегда имеют в виду ROS2 и различные пакеты ПО для восприятия, планирования и управления, работающие поверх неё.

ROS2: Это не операционная система, а универсальный конвейер, позволяющий отдельным программам для роботов взаимодействовать друг с другом.

Часть 3: LLM входят в робототехнику

Затем появился ChatGPT.

Внезапно появилась такая вещь: LLM. Она может читать простые инструкции на английском, выполнять многошаговые рассуждения, писать код и вызывать функции. Робототехники почти сразу осознали, что это именно тот недостающий элемент, над которым они бились годами. Самая сложная часть заставить робота выполнять полезные задачи дома или в офисе — часто не управление двигателями, а взаимодействие человека с машиной: как человек говорит роботу, что делать, и как робот разбивает эту цель на элементарные действия, которые он уже умеет выполнять?

Первая волна работ по применению LLM к роботам рассматривала языковую модель как естественно-языковой компилятор поверх ROS. Шаблон был таким:

  1. Пользователь говорит на английском: «Принеси кофейную чашку со столешницы на кухне и поставь на мой стол.»

  2. LLM генерирует план, исходя из списка доступных роботу базовых навыков: это может быть последовательность вызовов функций, конечный автомат или дерево поведения, написанное на XML.

  3. Узлы ROS2 выполняют этот план шаг за шагом. Если шаг терпит неудачу, информация о ней передаётся обратно LLM для перепланирования.

Проект SayCan от Google 2022 года — очень чистая версия этой идеи: LLM предлагает навыки, отдельная «модель аффордансов» оценивает вероятность успеха каждого навыка в текущий момент, робот выбирает комбинацию навыков с наивысшим совокупным баллом. Открытые фреймворки вроде ROS-LLM, ROSGPT и ROSA (ведутся лабораторией Huawei Research) популяризировали эту модель.

Это был действительно значительный скачок. Внезапно вы могли сказать роботу «убери со стола, положи перерабатываемое в синюю корзину», и он предпринимал какие-то разумные действия. Но обратите внимание: здесь всё ещё оставались проблемы. Языковая модель всё ещё находилась на уровне планирования. Фактические команды движений по-прежнему генерировались нижними слоями тщательно спроектированных или узкообученных контроллеров. Языковая модель была лишь умным диспетчером, она не управляла движением.

Часть 4: Визуально-языковые-действенные модели (VLA). Когда мозг начинает управлять роботом

Робот Keenon XMAN-R1 достаёт лекарства с полок в автоматизированной аптеке компании Galbot в Пекине. Всего за 100 000 долларов.

Следующий скачок был сложнее и важнее. Исследователи задались более амбициозным вопросом: а что, если модель сможет не только планировать, но и непосредственно генерировать команды движения? Если подавать изображения с камеры и языковые инструкции прямо в нейронную сеть, и на выходе получать следующее движение сустава через миллисекунду?

Это и есть визуально-языковые-действенные модели (VLA). Сейчас это основная парадигма в области человекоподобных и четвероногих роботов.

Первой широко известной визуально-языковой робототехнической моделью стала RT-2 от Google DeepMind, представленная в 2023 году. Её изящество в том, что они взяли большую визуально-языковую модель (обученную для описания изображений и ответов на вопросы) и продолжили обучать её на демонстрационных данных роботов, но представляя действия робота как ещё один вид токенов для предсказания. Та же нейросеть, которая могла выводить «кот сидит на коврике», теперь может выводить последовательность токенов, кодирующих «переместить правую лапу на 3 см вперёд, сжать захват, поднять на 5 см». Рассуждения и действие происходят в одной модели.

Затем, в середине 2024 года, команда под руководством Стэнфорда выпустила OpenVLA — открытую VLA-модель с 7 миллиардами параметров, обученную на наборе данных Open X-Embodiment. Этот набор данных объединяет более миллиона обучающих эпизодов с 22 различными «телами» роботов от 21-й лаборатории. Это был первый раз, когда кто-либо, кроме Google, мог скачать общую модель для роботов и начать её дорабатывать. Это в одночасье изменило всю область.

Сегодня ведущие VLA немногочисленны, но быстро развиваются:

  • π0 и π0.5 от Physical Intelligence: отличная адаптивность к задачам.
  • NVIDIA Isaac GR00T N1.7: открытые веса, коммерческая лицензия, разработана специально для человекоподобных роботов, модель, которую сейчас дообучают на своих данных большинство китайских аппаратных компаний.
  • Helix и более новая Helix-02 от Figure AI: проприетарные, но важные с архитектурной точки зрения.
  • Genie Envisioner от AgiBot: платформа на основе китайской мировой модели.
  • SmolVLA, NORA, ACoT-VLA, CogACT: растущее изобилие VLA из академических кругов, исследующих разные направления дизайна.

Как работает VLA (без математики)

Можно представить VLA как объединение трёх входных потоков в один выходной.

Первый поток данных — визуальный. Данные с RGB-камер (иногда с датчиков глубины или лидаров), иногда тактильные датчики на кончиках пальцев обрабатываются визуальным кодировщиком (обычно трансформерной моделью вроде DINOv2 или SigLIP), который сжимает каждое изображение в несколько сотен «визуальных токенов», суммирующих то, что видит робот.

Второй поток — языковой. Ваша инструкция («передай мне отвёртку») преобразуется в токены, как в ChatGPT.

Эти два потока соединяются и подаются в «основу»-трансформер (часто небольшую открытую языковую модель вроде Qwen3 или Llama). Эта основа отвечает за рассуждения, объединяя то, что она видит, с тем, о чём её спрашивают.

Третий поток: действия — выходит с другой стороны. Здесь архитектурные решения начинают расходиться:

  • Дискретные токены действий: Модель напрямую генерирует токены, которые можно декодировать в углы суставов или положение захвата, подобно тому как ChatGPT генерирует слова. Просто, но при высокой частоте может давать дёрганные движения.
  • Диффузионные или flow-matching головы для действий: Отдельная миниатюрная сеть получает выход основы и сглаживает его, генерируя плавную траекторию позиций суставов, подобно тому как диффузионные модели генерируют изображения, только здесь генерируется движение. Так делает π0, что даёт более плавные и естественные движения.
  • Разбиение действий на чанки: Вместо предсказания одной следующей команды предсказывается набор команд на следующие полсекунды, что сглаживает рывки.

В модели VLA: два входных потока на вход, команды движения на выходе. Рассуждения и действие сливаются в одной сети.

Это и есть критический архитектурный сдвиг: рассуждения и действие больше не разделены. Обучить нейросеть распознавать чашку — это одновременно научить её, как её схватить. Именно эта связь позволяет VLA обобщать там, где их предшественники не могли.

Часть 5: Стратегия двух мозгов. Как LLM и VLA работают вместе

Вот деталь, которую редко объясняют в маркетинге. Лучшие на сегодня человекоподобные роботы работают не на одной системе VLA, а на двух моделях с разной скоростью, общающихся друг с другом. Это иногда называют архитектурой двух систем или Системы 1 / Системы 2, заимствуя психологическую модель Даниэля Канемана, которая предполагает, что у человека есть быстрый интуитивный мозг и медленный мозг обдумывания.

Helix от Figure AI сделала этот дизайн классическим, и теперь его (и его варианты) копируют повсеместно. Особенно важно, что дизайн NVIDIA GR00T N1.7 использует его, как и большинство китайских человекоподобных роботов. Структура такова:

  • Система 2 (S2): Медленный думающий мозг. Визуально-языковая модель с ~7 миллиардами параметров, работающая с частотой около 7–9 Гц (т.е. 7-9 раз в секунду). Её работа — наблюдать сцену, анализировать инструкцию, выполнять многошаговые рассуждения (например, «чашка за коробкой хлопьев; мне нужно сначала убрать коробку») и выдавать высокоуровневые намерения — обычно это набор сжатых внутренних векторов, а не сами слова.
  • Система 1 (S1): Быстрый реагирующий мозг. Гораздо меньшая (около 80 миллионов параметров) модель визуально-двигательной стратегии, работающая с частотой 200 Гц. Она получает вектор намерения от S2 плюс последние данные сенсоров и выводит непрерывные команды для суставов. Она не «думает» в реальном смысле, а просто реагирует.

Недавно Helix-02 от Figure добавила Систему 0 (S0). Она находится ниже двухмозговой системы и является слоем рефлексов, а не третьим когнитивным слоем. Это сеть с 10 миллионами параметров, работающая на частоте 1 кГц, которая обрабатывает балансировку и общую координацию тела, заменяя более 100 000 строк C++-кода для управления движением. Можно представлять S0 как приобретённый спинной мозг: она не рассуждает и не планирует, а просто поддерживает тело в вертикальном положении и координирует его, в то время как мышление происходит в двухмозговой системе выше.

Архитектура двух мозгов современного человекоподобного робота: Система 2 медленно думает, Система 1 быстро реагирует — а под ними Система 0 для рефлексов, поддержания баланса, тактильного контакта и общей координации тела.

Это разделение продиктовано физическими ограничениями. Если выдавать команды движения только раз в 200 мс (так быстро может работать большая VLA), движения робота будут вялыми, как под водой. Обновления команд движения должны происходить быстрее, чем естественные колебания управляемых ими суставов, что означает сотни и тысячи обновлений в секунду. Ни одна трансформерная модель с 7 миллиардами параметров не может работать так быстро на роботе с аккумулятором.

Таким образом, когнитивные задачи разделены: большая медленная модель думает; маленькая быстрая модель действует. Они общаются не на английском, а через выученные латентные векторы: медленная модель выдаёт абстрактную цель, а быстрая знает, как её интерпретировать.

Часть 6: Облако, периферийные вычисления и где размещать «мозг»

Где же происходят все эти вычисления?

Сегодня почти сформировался сильный, почти идеологический консенсус среди команд робототехников, что критические для безопасности контуры управления должны выполняться локально. По двум причинам:

Задержка. Время передачи туда-обратно по Wi-Fi или сотовой сети даже при оптимистичных оценках составляет 30-80 мс. Команды движения требуют обновления каждые 1-5 мс. С такой сетевой петлёй работать невозможно.

Надёжность. Роботы работают на заводах, складах, кухнях, в больницах. Сеть может отключиться в любой момент. Если робот встанет колом при обрыве Wi-Fi — это создаст угрозу безопасности.

Поэтому современное разделение примерно следующее:

На борту (локально), на модуле типа NVIDIA Jetson Thor или AGX Thor (~2000 TFLOPS, 128 ГБ памяти, потребление 40–130 Вт):

  • Всё S0/S1: балансировка, локомоция, управление точными движениями.
  • Сама VLA (Система 2), всё больше квантуемая до FP8 или FP4, чтобы вписаться в аппаратные ограничения. Сейчас модели от 2 до 7 миллиардов параметров могут работать на устройстве.
  • Восприятие, сенсорная интеграция и любые другие программы безопасности или мониторинга.

Облако или удалённый сервер (если есть):

  • Диалоговые интерфейсы («Эй, робот, что мне приготовить на ужин?»): Они могут терпеть задержку.
  • Кластерное обучение: тысячи роботов отправляют данные телеметрии обратно на сервер для объединения в следующую версию модели.
  • Крупномасштабное долгосрочное планирование, возможно, с использованием моделей нового поколения.
  • Панели оператора и мониторинг.

Кроме того, появляется промежуточный слой: локальные периферийные серверы на заводе или складе, которые общаются с кластером роботов по локальной сети с задержкой в несколько миллисекунд. Более крупные LLM могут размещаться на этом уровне для выполнения задач высокоуровневого планирования, не требующих управления отдельными роботами.

На этой предпосылке строится волна китайских человекоподобных роботов: Unitree, AgiBot, Xpeng IRON, Fourier, EngineAI. Их роботы оснащены бортовыми вычислениями (обычно Jetson, иногда китайскими чипами вроде Huawei Ascend), а облако используется для кластерного обучения и диалоговых интерфейсов, но не для контуров управления.

Где на самом деле работает мозг робота: безопасно-критические контуры работают локально, облако — для того, что может подождать.

Часть 7: Почему открытые модели стали молчаливым центром внимания

Если судить только по демонстрациям, можно подумать, что область контролируется горсткой хорошо финансируемых американских компаний. Но реальность сложнее. Скорость развития физического ИИ во многом определяется открытыми моделями, веса которых может скачать и дообучить любой.

Неполный, но знаменательный список:

  • OpenVLA (Стэнфорд): Первая открытая 7B-модель для роботов общего назначения.
  • NVIDIA Isaac GR00T (N1, N1.5, N1.7): Открытые веса будут выпущены, коммерческая лицензия — скоро. Обучена на десятках тысяч часов эгоцентричного видео от людей.
  • π0 от Physical Intelligence: Веса выпущены для исследований.
  • NVIDIA Cosmos: Фондовая модель открытого мира.
  • AgiBot World: Большой открытый набор данных от шанхайского стартапа с демонстрациями телероботизации человекоподобных роботов.
  • LeRobot от Hugging Face: Открытая библиотека, ставшая точкой сбора для всех вышеупомянутых платформ.
  • mimic-video от Mimic robotics: Открытая модель видео-действия с 10-кратной эффективностью выборки по сравнению с традиционными VLA.

Это важно по двум причинам. Во-первых, стартапам в робототехнике не нужно тратить десятки миллионов долларов на предварительное обучение базовой модели: они могут взять GR00T или π0 и дообучить их данными со своих роботов. Именно так и поступают Unitree, EngineAI, Booster, Galbot и десятки более мелких китайских компаний. Вот почему компания с несколькими сотнями сотрудников может выпускать человекоподобного робота, который ходит, говорит и складывает одежду: они стоят на плечах открытого технологического стека.

Во-вторых, открытые модели — единственный реалистичный путь к решению проблем безопасности. Если полностью закрытая модель работает внутри робота на заводском цеху и нет никакого понимания её логики рассуждений — это кошмар для регуляторов. Открытые модели позволяют аудиторам, исследователям и операторам реально проверять, чему был обучен робот.

Часть 8: Какие проблемы всё ещё не решены

Если вы видели достаточно демонстраций роботов, вы наверняка видели и много провалов. Нынешнее поколение роботов LLM+VLA действительно впечатляет, но у них есть явные ограничения. Вот их проблемы:

  • Восстановление в середине задачи. VLA справляются с неожиданными изменениями лучше любой предыдущей технологии. Но когда что-то действительно идёт не так (провал захвата, предмет покатился, кто-то зашёл в рабочую зону) — возвращение на правильный путь остаётся слабым местом. Робот будет слепо повторять неудачное действие.
  • Эффективность выборки. Обучение VLA с нуля требует десятков тысяч часов данных телероботизации. Человек учится пользоваться новым инструментом за минуты. Этот разрыв в эффективности огромен.
  • Обобщение между разными воплощениями. Модель, обученная на руке Franka в лаборатории Стэнфорда, не идеально переносится на человекоподобного робота Unitree на складе в Шэньчжэне. У них разная физика.
  • Долгосрочные задачи. Любое связное поведение, требующее более 30-60 секунд и включающее несколько подцелей, подвержено дрейфу цели. Задачи вроде «приготовь мне завтрак» по-прежнему недостижимы.
  • Физическая интуиция. VLA обучены на подражании, а не на понимании. Они не понимают принципа «если толкнуть чашку с водой, вода прольётся». Они видели примеры и предсказывают, что будет дальше, на основе сопоставления с образцом.
  • Пространственные рассуждения. Несмотря на мультимодальность, они удивительно слабы в задачах вроде «обходи препятствие, а не проходи сквозь него» или «сложи эти вещи так, чтобы они не упали».

Эта последняя группа слабостей побуждает область делать ставку на совершенно другой вид моделей.

Часть 9: Мировые модели

Представьте: что, если вместо обучения робота предсказывать действия, мы обучим его предсказывать последствия действий?

Мировая модель (World Model) — это нейронная сеть, которая предсказывает, как будет выглядеть мир в следующий момент, исходя из его текущего состояния (обычно видео или последовательности кадров) и предполагаемого действия. Грубо говоря, это обучаемый видеопрогнозирующий симулятор с «рулём». Вы показываете ему последнюю секунду с камеры и говорите «робот переместит руку на 10 см вперёд», и он генерирует реалистичный видеоролик, предсказывающий, что произойдёт в следующую секунду.

Почему это важно?

Потому что, имея мировую модель, робот может думать перед действием. Он может мысленно проработать три-четыре кандидатных действия, предсказать результат каждого, оценить их и выбрать лучший вариант. Всё это до того, как двинутся моторы. Именно так работает шахматный движок: он не запоминает ходы, а моделирует будущее. Этой способности никогда не было в физической робототехнике, потому что никогда не было достаточно точной модели для симуляции хаотичного реального мира.

Мировые модели позволяют роботу симулировать несколько возможных будущих сценариев, оценивать их и выбирать лучший вариант до того, как включатся моторы.

На что же похожа мировая модель в 2026 году?

Современные мировые модели разнообразны, но развиваются быстро. Вот некоторые из них:

  • NVIDIA Cosmos: Серия открытых фундаментальных моделей мира, включая Cosmos Predict 2.5 (генеративная модель), Cosmos Transfer 2.5 (управляемая модель симуляции), Cosmos Reason 2 (визуально-языковой «рассуждатель» для роботов) и новейший Cosmos Policy. Cosmos Policy идёт дальше, дообучивая мировую модель для прямого вывода действий управления. Cosmos обучается на десятках тысяч часов видеоданных (Cosmos Predict 2.5 — мировая модель в этой серии).
  • DeepMind Genie 3: Интерактивная мировая модель, которая генерирует полностью навигационные среды по текстовым подсказкам с частотой 24 кадра в секунду, стабильно работая в течение минут. Изначально создавалась для игровых сред.
  • Meta V-JEPA 2: Предварительно обучена на более чем миллионе часов видео из интернета, а затем кондиционирована действиями всего на 62 часах видео с роботов. Достигает 80% успеха при нулевом снимке в задачах захвата и размещения на реальных роборуках в разных лабораториях без какого-либо обучения конкретной задаче. Подход «JEPA» архитектурно отличается от других.
  • DeepMind Dreamer 4: Используя только офлайн-данные, без взаимодействия со средой, научилась собирать алмазы в Minecraft (задача на 20 000 шагов). Доказывает, что настоящее обучение с подкреплением в виртуальном мире возможно.
  • Genie Envisioner от AgiBot: Унифицированная платформа мировой модели из Китая, обученная на более чем 3000 часов видео работы человекоподобных роботов в реальном мире. Она может генерировать как предсказанные траектории, так и исполняемые последовательности действий. AgiBot использует NVIDIA Cosmos Predict 2 в качестве основы и дообучает на своих данных. Это как раз та модель «открытый стек + свои данные», описанная ранее.
  • Мировые модели Toyota Research на базе Cosmos: Для усиления данных телероботизации и навигации.

Шесть самых важных мировых моделей 2025-2026 годов, каждая из которых представляет разные представления о том, как машина должна изучать физику.

Часть 10: Альтернативные архитектуры. Потому что область ещё не устоялась

Нет единого способа построить мировую модель. Конкуренция архитектур — одна из самых интересных дискуссий в ИИ на сегодня, и она напрямую влияет на то, что смогут делать роботы в будущем. Три лагеря, за которыми стоит следить:

Диффузия видео на уровне пикселей (школа Cosmos/Sora): Использует диффузионные модели для предсказания фактических пикселей будущих кадров. Плюсы: служит генератором синтетических данных, может визуализировать совершенно новые демонстрации роботов, которые никогда не происходили. Минусы: вычислительно затратно, иногда нарушает физику, предсказывать пиксели, которые никогда не будут увидены, — это расточительно.

Архитектуры совместного предсказания вложений (Joint Embedding Predictive Architectures, JEPA) (школа ЛеКуна): Не предсказывает пиксели, а предсказывает абстрактное представление следующего кадра. Отбрасывает детали текстур, сохраняя только семантическую сущность того, что есть в сцене. Плюсы: эффективно, сосредоточено на том, что важно для действия. Минусы: сложнее в использовании. Эту область исследуют V-JEPA, V-JEPA 2 и новые гибриды JEPA-VLA.

Латентные мировые модели с действиями (школа Genie/Dreamer): Учится сжимать целые видео в латентный «язык действий», который захватывает структуру поведения, а затем обучает мировую модель предсказывать следующее латентное состояние, учитывая следующее латентное действие. Плюсы: позволяет обучаться на сетевых видео без действий, а затем добавить немного данных с реальных роботов. Минусы: латентные действия не интерпретируемы человеком, что усложняет анализ безопасности.

Пиксельная диффузия, JEPA и латентные действия: одинаковая цель, но совершенно разные способы построения мировой модели.

Часть 11: Как роботы на мировых моделях будут работать на практике

Если заглянуть на несколько лет вперёд, архитектура передового человекоподобного робота может выглядеть так:

VLA, оснащённая мировой моделью. Когда робот сталкивается с новой ситуацией, он выполняет что-то вроде следующего:

  • VLA предлагает несколько кандидатов для следующего действия (она всё ещё остаётся стратегией).
  • Мировая модель берёт каждый кандидатный план и симулирует 1-3 секунды воображаемого видео.
  • Модуль оценки (ценностная сеть) оценивает симулированные результаты: поднята ли чашка? Что-то упало? Заденет ли человека?
  • Робот выберет действие с наивысшим баллом и выполнит только его первую часть.
  • Реальные данные сенсоров возвращаются; цикл повторяется.

Это и есть прогнозное управление по модели (MPC), технология, которая годами используется для стабилизации ракет и дронов, но теперь с выученной мировой моделью вместо выведенных вручную уравнений физики. Её масштабируемость в том, что мировая модель предобучена на миллионах часов видео, а не потому, что кто-то написал уравнения Навье-Стокса для кухонной среды.

Выгоды нарастают:

  • Улучшение восстановления. Если захват срывается, мировая модель может смоделировать несколько корректирующих путей и выбрать наиболее перспективный.
  • Улучшенное обобщение. Мировая модель, обученная на сетевых видео, «видела» «физических явлений» на порядки больше, чем любой набор данных телероботизации.
  • Контролируемое долгосрочное планирование. Планировать в воображении, а не в реальности.
  • Сокращение разрыва между симуляцией и реальностью. Вместо того чтобы обучать на собственном симуляторе (например, Isaac Sim, физический движок Newton) и надеяться, что это перенесётся на реальное железо, теперь можно обучать на выученном симуляторе, который соответствует реальному видео. Поэтому разрыв меньше.
  • Взрыв синтетических данных. Мировая модель может генерировать миллионы различных траекторий роботов практически бесплатно, с разным освещением, материалами и конфигурациями объектов. Это решает одно из главных узких мест в области.

Кроме того, это даёт важное преимущество для безопасности. Робот, способный моделировать последствия действий, может отказаться выполнять опасные операции — не из-за правил, а потому что предвидит, что кто-то может пострадать в будущем.

Два способа движения: VLA реагирует на то, что видит; робот с мировой моделью думает, прежде чем двигаться.

Часть 12: Что ещё нужно знать

Проблема данных — это настоящая проблема: Все архитектурные инновации в мире ничего не стоят, если вы не можете накормить модель данными. Сейчас телероботизация (когда люди в VR-шлемах дистанционно управляют роботами как марионетками) — главное узкое место. Конкурентный ров робототехнической компании всё больше определяется её конвейером сбора данных, а не самой моделью. AgiBot уже построила склады, заполненные операторами. Закон масштабирования для ловкости NVIDIA GR00T N1.7 показывает, что больше видео от первого лица напрямую и предсказуемо улучшает ловкость роботов. Это также область, где у Китая есть структурное преимущество: более низкая стоимость труда для сбора данных, более терпимая среда для развёртывания и активная координация государством цепочек поставок.

Симуляция — это параллельная вселенная. NVIDIA Isaac Sim, новый открытый физический движок Newton (1.0 выйдет в апреле 2026) и платформа Omniverse позволяют компаниям обучать роботов в миллионах параллельных симуляционных сред, не развёртывая их в реальном мире. Большая часть того, что выглядит как «роботинтеллект», на самом деле выращивается в симуляции, а затем переносится на железо.

Экономика начинает работать. Unitree поставила около 5500 человекоподобных роботов в 2025 году и планирует 10-20 тысяч в 2026. Средняя цена упала с 85 000 до 25 000 долларов за два года. R1 от Unitree стоит 5900 долларов. Noetix Bumi выходит на рынок по цене 1400 долларов. Аппаратное обеспечение человекоподобных роботов приближается по цене к потребительской электронике, в то время как ИИ внутри них всё ещё отстаёт от демонстрационных образцов. Этот разрыв сократится, и когда это произойдёт, эффект масштаба будет заметен.

Режимы сбоев выглядят странно. Когда роботы на базе LLM ломаются, они делают это способами, недоступными традиционным роботам. Например, уверенно делают неверные вещи, «галлюцинируют» функции, зацикливаются в диалоге с собственным планировщиком. Сообщество традиционной робототехники относится к этому с изрядной долей скепсиса, и не без оснований, настаивая на том, что обучающиеся системы должны быть под наблюдением безопасности и ограничены в поведении. Самые надёжные развёрнутые на сегодня роботы — гибридные: мозг VLA помещён в клетку безопасности, написанную вручную.

Нарратив «момента ChatGPT» — полезная, но вводящая в заблуждение аналогия: Дженсен Хуанг постоянно говорит всем, что момент ChatGPT для роботов уже наступил. Он говорит это, потому что NVIDIA продаёт лопаты и кирки. Более честная версия: мы сейчас примерно в эпохе GPT-2 для физического ИИ. Он мощный, он может поразить; но недостаточно мощный, чтобы развёртывать его без присмотра. Он быстро итерируется, но не достиг точки взрывного вирусного распространения, а находится на медленной, но уверенной восходящей траектории.

Заключение

Эволюция четвероногих роботов Unitree (справа налево)

В демонстрации, которую я видел в офисе Unitree, пять человекоподобных роботов G1 исполняли боевые искусства — тщательно поставленную хореографию, с тонкой настройкой бортового VLA-контроллера и операторами телероботизации, обеспечивающими бесперебойную работу. В своей основе это не полностью автономно. Но весь конвейер: восприятие, планирование, управление движением — заменяется нейронными сетями. Через два года те же роботы смогут выполнить ту же хореографию без постановки, потому что они мысленно проработают её заранее и выберут лучшую версию.

Вся эволюция, описанная в этой статье: от рукописных контроллеров к машинному обучению восприятия, к LLM-планировщикам, к VLA, к двухсистемной архитектуре и, наконец, к мировым моделям — это по сути медленное перемещение того, где находится интеллект робота. Он начинался в умах инженеров, затем переместился в рукописный код, затем в слой восприятия, в планировщик, в стратегию. И теперь он, наконец, движется к модели, которая учится самому миру.

Каждый переход делает роботов более универсальными, более адаптируемыми, более полезными. Если переход к мировой модели сработает, он действительно даст роботам силу: достаточно большую, чтобы вопрос перестал быть «Что могут делать роботы?», а стал «Что мы должны позволять им делать?»

Рекомендуемая статья: Обзор более 30 компаний по производству человекоподобных роботов: кто выиграет в 2026 году?

Трендовые криптовалюты

Связанные с этим вопросы

QЧто такое визуально-языковые двигательные модели (VLA) и как они работают?

AВизуально-языковые двигательные модели (VLA) — это нейронные сети, которые напрямую генерируют команды для движений робота на основе визуального ввода (например, изображения с камер) и языковых инструкций. Они объединяют рассуждение и действие в одной модели. VLA обрабатывает визуальные данные через кодировщик (например, DINOv2), языковые инструкции токенизируются, а затем объединяются в Transformer-архитектуре. На выходе модель может предсказывать либо дискретные «токены действий», либо плавные траектории движений (например, с помощью диффузии или сопоставления потоков). Это позволяет роботам лучше обобщать задачи и адаптироваться к новым условиям.

QКакова архитектура «двух мозгов» (System 1 и System 2) в современных человекоподобных роботах?

AАрхитектура «двух мозгов» разделяет когнитивные функции на два уровня. System 2 («медленный мозг») — это большая модель VLA (например, на 7 миллиардов параметров), работающая с частотой 7–9 Гц. Она анализирует сцену, интерпретирует инструкции и выполняет многошаговые рассуждения, генерируя высокоуровневые намерения. System 1 («быстрый мозг») — это небольшая визомоторная модель (например, 80 миллионов параметров), работающая с частотой 200 Гц. Она получает векторы намерений от System 2 и текущие данные с датчиков, чтобы генерировать непрерывные команды для суставов. Такое разделение позволяет сочетать глубокое мышление с быстрой реакцией, необходимой для плавных движений.

QЧто такое «модели мира» (World Models) и почему они важны для робототехники?

AМодели мира — это нейронные сети, которые предсказывают будущее состояние мира на основе текущего состояния и планируемого действия робота. Они позволяют роботу «мыслить» перед действием: моделировать несколько возможных будущих сценариев, оценивать их и выбирать лучший вариант. Это улучшает способность к восстановлению после ошибок, обобщению задач и долгосрочному планированию. Ключевые примеры включают NVIDIA Cosmos, DeepMind Genie 3 и Meta V-JEPA 2. Такие модели также генерируют синтетические данные для обучения и сокращают разрыв между симуляцией и реальностью.

QПочему открытые (open-source) модели стали ключевым фактором в развитии робототехники?

AОткрытые модели (например, OpenVLA, NVIDIA Isaac GROOТ N1.7) позволяют стартапам и исследователям использовать готовые веса моделей и дообучать их на своих данных, экономя миллионы долларов на предварительном обучении. Это ускоряет инновации и демократизирует доступ к передовым технологиям. Например, китайские компании, такие как Unitree и AgiBot, активно используют такие модели. Кроме того, открытость способствует безопасности и аудиту: можно анализировать, как модель принимает решения, что критически важно для развертывания в реальных условиях.

QКаковы основные ограничения современных роботов на основе LLM и VLA?

AСовременные роботы на основе LLM и VLA сталкиваются с несколькими ключевыми ограничениями: 1) Восстановление после сбоев: они часто повторяют неудачные действия вместо адаптации. 2) Низкая эффективность данных: для обучения требуются тысячи часов данных, тогда как человеку достаточно минут. 3) Слабая обобщаемость между разными физическими платформами. 4) Трудности с долгосрочными задачами (более 30–60 секунд). 5) Отсутствие физического здравого смысла: модели действуют на основе шаблонов, а не глубокого понимания законов физики. 6) Ограниченные пространственные рассуждения, например, при обходе препятствий.

Похожее

13 бизнес-направлений достигли годового дохода свыше 100 миллионов долларов: Robinhood движется к «суперфинансовому приложению»

В отчете за второй квартал 2026 года американский онлайн-брокер Robinhood продемонстрировал рекордный рост. Чистая выручка достигла 1,308 млрд долларов, увеличившись на 32%, а чистая прибыль составила 561 млн долларов, что на 45% больше. Рост был обеспечен за счет нескольких направлений. Доход от торговых операций вырос на 44% до 776 млн долларов, при этом выручка от рынка прогнозов (контракты на события) увеличилась более чем в 10 раз, достигнув 156 млн долларов. Количество пользователей с пополненными счетами достигло 28,4 млн, а общие активы на платформе составили 369 млрд долларов. Подписчики платной услуги Robinhood Gold выросли на 39% до 4,8 млн. Компания заявила, что 13 ее бизнес-направлений, включая торговлю акциями, опционами, криптовалютами, подписку Gold и рынок прогнозов, теперь генерируют годовую выручку более 1 млрд долларов каждое. Robinhood трансформируется из простой торговой платформы в комплексную финансовую экосистему, включающую управление активами, платежи и новые технологии. Компания делает ставку на развитие рынка прогнозов, а также инвестирует в интеграцию искусственного интеллекта (функция Agentic Trading) и блокчейн-технологий (собственная сеть Robinhood Chain). Главная стратегическая цель — эволюционировать из "торговой платформы для розничных инвесторов" в "супер-финансовое приложение", предлагающее широкий спектр услуг от инвестиций и управления капиталом до цифровых активов.

Odaily星球日报13 мин. назад

13 бизнес-направлений достигли годового дохода свыше 100 миллионов долларов: Robinhood движется к «суперфинансовому приложению»

Odaily星球日报13 мин. назад

13 бизнес-направлений с годовым доходом более 1 миллиарда: Robinhood движется к «супер-финансовому приложению»

30 июля 2026 года американский онлайн-брокер Robinhood (HOOD) опубликовал финансовые результаты за второй квартал. Ключевые показатели: * **Чистая выручка:** $1,308 млрд (+32% год к году), исторический рекорд. * **Чистая прибыль:** $561 млн (+45%). * **Доходы от транзакций:** $776 млн (+44%), основной двигатель роста. * **Чистый процентный доход:** $389 млн (+9%). * **Активы на платформе:** $369 млрд (+32%). * **Клиенты с пополненным счетом:** 28,4 млн (+7%). * **Подписчики Robinhood Gold:** 4,8 млн (+39%). Основные драйверы роста: 1. **Взрывной рост рынка прогнозов:** Доход от "событийных контрактов" (предсказательных рынков) достиг $156 млн, увеличившись более чем в 10 раз благодаря запуску собственной платформы Rothera и событиям вроде Чемпионата мира. 2. **Диверсификация бизнеса:** У Robinhood теперь 13 продуктов с годовым доходом свыше $1 млрд каждый (торговля акциями/опционами, криптовалюты, подписка Gold, кредитные карты, рынок прогнозов и др.). Это снижает зависимость от комиссий за сделки. 3. **Инвестиции в будущее:** Компания развивает новые направления: * **AI:** Функция Agentic Trading позволяет автоматизировать сделки через ИИ-агентов. * **Блокчейн:** Запущена сеть Robinhood Chain (Ethereum L2) для активов реального мира (RWA) и Web3. **Общий тренд:** Robinhood трансформируется из платформы для розничных транзакций в многофункциональный "супер-финтех-сервис" или "супер-финансовое приложение", охватывающее торговлю, управление капиталом, платежи и цифровые активы. Цель — создать комплексную финансовую экосистему для пользователей.

marsbit14 мин. назад

13 бизнес-направлений с годовым доходом более 1 миллиарда: Robinhood движется к «супер-финансовому приложению»

marsbit14 мин. назад

Фонд Ethereum пополняет состав правления сооснователем SEAL 911 на фоне усиления внимания к приватности

Фонд Ethereum (EF) назначил Паскаля Кавераччио, также известного как «pcaversaccio», сооснователя и руководителя криптографической группы реагирования на угрозы безопасности SEAL 911, в свой совет директоров. Это назначение связано с углублением внимания организации к конфиденциальности и безопасности. Кавераччио, давний контрибьютор Ethereum и член Silviculture Society фонда, присоединился к совету на добровольной основе на первоначальный срок в один год. Он вошел в состав четырех человек вместе с президентом Аей Миягучи, сооснователем Ethereum Виталиком Бутериным и швейцарским юристом Патриком Шторхенеггером. Совет директоров определяет стратегическое видение фонда и следит за соответствием решений руководства его ценностям, выполняя функции «совета по безопасности» для защиты миссии EF как швейцарского фонда. Назначение происходит на фоне усиления роли конфиденциальности и безопасности в стратегии организации. В июне фонд назвал эти аспекты «неподлежащими обсуждению гарантиями протокола» и заявил, что его команда по разработке протокола будет работать над внедрением исследований, включая конфиденциальность на первом уровне (L1) и постквантовую безопасность, для сохранения самосуверенности Ethereum.

cointelegraph39 мин. назад

Фонд Ethereum пополняет состав правления сооснователем SEAL 911 на фоне усиления внимания к приватности

cointelegraph39 мин. назад

ФРС ночью сбрасывает "ястребиную бомбу": процентные ставки без изменений, внутренние разногласия беспрецедентны за последнее десятилетие

Федеральная резервная система США (ФРС) на заседании 29 июля оставила ключевую процентную ставку без изменений в диапазоне 3,5–3,75%. Это уже пятое подряд заседание в 2026 году, на котором ставка не менялась, что само по себе соответствовало ожиданиям рынка. Однако главной неожиданностью стало рекордное за последнее десятилетие внутреннее разногласие: три члена Федерального комитета по открытому рынку (FOMC) проголосовали за повышение ставки на 25 базисных пунктов. Это сигнализирует о сохраняющемся давлении в сторону ужесточения политики для борьбы с инфляцией, которая остается высокой уже более пяти лет. Председатель ФРС Кристофер Уолш занял жёсткую позицию, подчеркнув, что целевой показатель инфляции в 2% является «единственной красной линией» и не подлежит пересмотру. Он заявил, что если инфляция не снизится, повышение ставок станет необходимым. При этом Уолш объявил о существенном отходе от практики «пропередвижения» (форвардного руководства), призвав рынки самостоятельно ориентироваться на экономические данные. На рынках решение ФРС и риторика Уолша вызвали волатильность. Доходность 30-летних казначейских облигаций взлетела до максимума с 2007 года, превысив 5,2%. Индекс Dow Jones обвалился на 2,19%, показав худшее падение за 15 месяцев. Доллар ослаб, а золото кратковременно преодолело уровень в 4100 долларов за унцию.

marsbit40 мин. назад

ФРС ночью сбрасывает "ястребиную бомбу": процентные ставки без изменений, внутренние разногласия беспрецедентны за последнее десятилетие

marsbit40 мин. назад

Когда инвестиции в НИОКР догнали США, соревнование в области чипов между Китаем и США всё ещё измеряется деньгами?

Согласно последнему отчету Ассоциации полупроводниковой промышленности США (SIA), Китай в 2024 году по паритету покупательной способности (ППС) достиг уровня США по общим расходам на НИОКР, что превышает 1 триллион долларов. Однако при пересчете по рыночному курсу США сохраняют значительное преимущество. Китайские расходы в основном сосредоточены на экспериментальных разработках (81,2% в 2024 году), тогда как в США выше доля фундаментальных исследований (около 15%). В полупроводниковой отрасли американские компании в 2025 году потратили на НИОКР 76,8 млрд долларов (около 15% выручки), что подкреплено их глобальным лидерством и коммерческим циклом. Китай наращивает инвестиции, но сталкивается с проблемами масштаба и эффективности. Ключевые вызовы включают переход от объема финансирования к качеству его распределения, укрепление связи между фундаментальной наукой и инженерной реализацией, а также прохождение полного цикла валидации продукции клиентами для создания устойчивых конкурентных преимуществ.

marsbit1 ч. назад

Когда инвестиции в НИОКР догнали США, соревнование в области чипов между Китаем и США всё ещё измеряется деньгами?

marsbit1 ч. назад

Торговля

Спот

Популярные статьи

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

2025 год — год институциональных инвесторов, в будущем он будет доминировать в приложениях реального времени.

1.9k просмотров всегоОпубликовано 2025.12.16Обновлено 2025.12.16

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на AI (AI) представлены ниже.

活动图片