От кода к сознанию: Руководство на десять тысяч слов о том, как эволюционирует мозг робота

marsbitОпубликовано 2026-06-07Обновлено 2026-06-07

Введение

**От кода к познанию: Путеводитель по эволюции мозга роботов** Роботы прошли путь от предсказуемых машин, управляемых тщательно написанным кодом (ROS, классическое управление), к более адаптивным системам, основанным на ИИ. Переломным моментом стало появление больших языковых моделей (LLM), которые стали выступать в роли "планировщиков", переводящих команды на естественном языке в последовательность действий. Однако истинная революция — это модели "Vision-Language-Action" (VLA), такие как RT-2 от Google и OpenVLA. Они напрямую объединяют зрение, язык и движение в одной нейронной сети, генерируя команды для исполнительных механизмов. Самые современные человекоподобные роботы (например, от Figure AI и многих китайских стартапов) используют **двухсистемную архитектуру**: медленная, "размышляющая" модель (System 2) анализирует сцену и ставит цели, а быстрая, "реактивная" модель (System 1, а также рефлекторный System 0) управляет моторами в режиме реального времени. Вся критичная для безопасности обработка выполняется на борту (например, на чипах NVIDIA Jetson). Следующий гигантский шаг — **модели мира** (World Models), такие как NVIDIA Cosmos или DeepMind Genie. Эти системы предсказывают последствия действий, позволяя роботу "проигрывать" различные сценарии в уме, выбирать наилучший и избегать ошибок *перед* тем, как начать движение. Они обещают радикально улучшить восстановление после сбоев, обобщение и долгосрочное планирование. Экономика меняется: цены на "железо" падают (...

Автор: Matt White, главный глобальный технический директор по AI в Linux Foundation

Компиляция: Felix, PANews

Ван Синсин (генеральный директор Unitree Robotics) и Matt White

Несколько недель назад в Шанхае друг, путешествовавший со мной (умный, следящий за новостями и наблюдательный, но не сильно разбирающийся в робототехнике), за ужином задал вопрос, которого я ждал всю поездку.

«Те роботы-собаки, что бегают повсюду, человекоподобные роботы, исполняющие кунг-фу на демонстрационной сцене в офисе Unitree, и роботизированные руки, складывающие одежду, которые мы видели. Как они это делают? Они управляются большими языковыми моделями (LLM)? Как вообще это работает? Там есть какая-то языковая модель, управляющая их движениями?»

Отличный вопрос, и, если честно: в какой-то степени да, но настоящая история гораздо интереснее. Роботы, которых вы видите в соцсетях, — это не ChatGPT в металлической оболочке. Они работают на стеке технологий (многослойной системе, где различные ИИ работают вместе). За последние три года этот стек изменился больше, чем за предыдущие тридцать лет. Языковые модели — лишь часть его. Модели компьютерного зрения, модели действий, деревья поведения, классические контуры управления и новое семейство систем под названием «мировые модели» — тоже важные его составляющие. И, возможно, «мировые модели» — самое важное из всех этих достижений.

Это длинная статья. Она начнётся с самого начала, затем шаг за шагом расскажет о каждом крупном изменении и, наконец, достигнет нынешнего этапа: когда робот не просто реагирует на мир, но и воображает его.

Часть 1: Эпоха до LLM. Когда роботы были просто программным обеспечением

Десятилетиями создавать роботов означало писать много кода, и почти весь этот код не требовал обучения.

Классические промышленные роботы представляли собой башни, сложенные из тщательно спроектированных модулей. Например, оранжевые роборуки, сваривавшие шасси Toyota в 90-х, или BigDog от Boston Dynamics в начале 2000-х.

  • Восприятие: Фильтрация видеопотока с камер, выделение контуров, распознавание положения детали с помощью геометрического сопоставления.
  • Оценка состояния: Комбинация показаний энкодеров колёс, гироскопов и акселерометров (сенсорная интеграция) для определения положения и скорости робота.
  • Планирование: При заданной целевой позе вычисление пути без столкновений на известной карте с помощью алгоритмов вроде A* или RRT.
  • Управление: На самом нижнем уровне ПИД-регуляторы сотни и тысячи раз в секунду корректируют крутящий момент двигателей для следования по этому пути.

Эти слои обычно писались разными людьми в разных лабораториях и чрезвычайно тщательно склеивались. Поведение (например, «если чашка красная — возьми, иначе — жди») кодировалось как конечный автомат или дерево поведения: блок-схема, которую робот выполняет шаг за шагом.

Сильные стороны этого подхода очевидны. Он предсказуем, соответствует стандартам безопасности. Поэтому в вашем автомобиле работает эффективная АБС.

Слабые стороны столь же очевидны. Такой робот был умён только в сценариях, которые инженер мог предвидеть. Поместите его в новый цех, при новом освещении или с чашкой другого цвета — он сломается. У него почти нулевая обобщающая способность.

Часть 2: Машинное обучение незаметно входит в игру

В 2010-х годах глубокое обучение взялось за решение проблем слоя восприятия. Свёрточные нейронные сети (CNN), превзошедшие человека в задаче классификации изображений ImageNet, можно было дообучить для определения точек захвата на объекте, сегментации мебели в комнате или распознавания позы человека. Внезапно верхний слой стека, «восприятие», больше не нужно было проектировать вручную — его можно было обучать.

Затем обучение распространилось на слой «управления». Исследователи из Беркли, DeepMind и OpenAI показали, что обучение с подкреплением (позволяющее роботам-агентам пробовать миллионы раз в симуляции и закреплять эффективные действия) может порождать удивительно умелые походки, манипуляции объектами рукой (решение кубика Рубика одной рукой от OpenAI в 2019 году стало вехой) и стратегии движения, адаптирующиеся к разным поверхностям.

Другое параллельное направление — обучение с подражанием, часто называемое клонированием поведения: запись сотен попыток человека дистанционно управлять роботом для выполнения задачи, а затем обучение нейронной сети предсказывать, какое действие предпринял бы человек, основываясь на наблюдениях робота.

Ключевой момент: каждая обученная стратегия была слишком узкой. Обучите сеть поднимать красный кубик — она не будет знать, что делать с жёлтой чашкой. Обучите её ходить по траве — она упадёт на плитке. Обобщение оставалось нерешённой проблемой.

Стоит отметить появление в этот период базовой инфраструктуры, которая до сих пор лежит в основе почти всего: ROS, операционной системы для роботов (впервые выпущена в ноябре 2007 года). ROS — это не операционная система в смысле Windows или Linux, а каркас промежуточного ПО, универсальная система передачи данных для роботов. Она позволяет «узлам камеры», «узлам навигации», «узлам управления роборукой» и десяткам других узлов публиковать и подписываться на сообщения через общую шину.

Текущая версия ROS2 работает в основе подавляющего большинства исследовательских и коммерческих роботов по всему миру, от лабораторий Стэнфорда до китайских стартапов по созданию человекоподобных роботов. Когда говорят об «операционной системе» робота, почти всегда имеют в виду ROS2 и различные пакеты ПО для восприятия, планирования и управления, работающие поверх неё.

ROS2: Это не операционная система, а универсальный конвейер, позволяющий отдельным программам для роботов взаимодействовать друг с другом.

Часть 3: LLM входят в робототехнику

Затем появился ChatGPT.

Внезапно появилась такая вещь: LLM. Она может читать простые инструкции на английском, выполнять многошаговые рассуждения, писать код и вызывать функции. Робототехники почти сразу осознали, что это именно тот недостающий элемент, над которым они бились годами. Самая сложная часть заставить робота выполнять полезные задачи дома или в офисе — часто не управление двигателями, а взаимодействие человека с машиной: как человек говорит роботу, что делать, и как робот разбивает эту цель на элементарные действия, которые он уже умеет выполнять?

Первая волна работ по применению LLM к роботам рассматривала языковую модель как естественно-языковой компилятор поверх ROS. Шаблон был таким:

  1. Пользователь говорит на английском: «Принеси кофейную чашку со столешницы на кухне и поставь на мой стол.»

  2. LLM генерирует план, исходя из списка доступных роботу базовых навыков: это может быть последовательность вызовов функций, конечный автомат или дерево поведения, написанное на XML.

  3. Узлы ROS2 выполняют этот план шаг за шагом. Если шаг терпит неудачу, информация о ней передаётся обратно LLM для перепланирования.

Проект SayCan от Google 2022 года — очень чистая версия этой идеи: LLM предлагает навыки, отдельная «модель аффордансов» оценивает вероятность успеха каждого навыка в текущий момент, робот выбирает комбинацию навыков с наивысшим совокупным баллом. Открытые фреймворки вроде ROS-LLM, ROSGPT и ROSA (ведутся лабораторией Huawei Research) популяризировали эту модель.

Это был действительно значительный скачок. Внезапно вы могли сказать роботу «убери со стола, положи перерабатываемое в синюю корзину», и он предпринимал какие-то разумные действия. Но обратите внимание: здесь всё ещё оставались проблемы. Языковая модель всё ещё находилась на уровне планирования. Фактические команды движений по-прежнему генерировались нижними слоями тщательно спроектированных или узкообученных контроллеров. Языковая модель была лишь умным диспетчером, она не управляла движением.

Часть 4: Визуально-языковые-действенные модели (VLA). Когда мозг начинает управлять роботом

Робот Keenon XMAN-R1 достаёт лекарства с полок в автоматизированной аптеке компании Galbot в Пекине. Всего за 100 000 долларов.

Следующий скачок был сложнее и важнее. Исследователи задались более амбициозным вопросом: а что, если модель сможет не только планировать, но и непосредственно генерировать команды движения? Если подавать изображения с камеры и языковые инструкции прямо в нейронную сеть, и на выходе получать следующее движение сустава через миллисекунду?

Это и есть визуально-языковые-действенные модели (VLA). Сейчас это основная парадигма в области человекоподобных и четвероногих роботов.

Первой широко известной визуально-языковой робототехнической моделью стала RT-2 от Google DeepMind, представленная в 2023 году. Её изящество в том, что они взяли большую визуально-языковую модель (обученную для описания изображений и ответов на вопросы) и продолжили обучать её на демонстрационных данных роботов, но представляя действия робота как ещё один вид токенов для предсказания. Та же нейросеть, которая могла выводить «кот сидит на коврике», теперь может выводить последовательность токенов, кодирующих «переместить правую лапу на 3 см вперёд, сжать захват, поднять на 5 см». Рассуждения и действие происходят в одной модели.

Затем, в середине 2024 года, команда под руководством Стэнфорда выпустила OpenVLA — открытую VLA-модель с 7 миллиардами параметров, обученную на наборе данных Open X-Embodiment. Этот набор данных объединяет более миллиона обучающих эпизодов с 22 различными «телами» роботов от 21-й лаборатории. Это был первый раз, когда кто-либо, кроме Google, мог скачать общую модель для роботов и начать её дорабатывать. Это в одночасье изменило всю область.

Сегодня ведущие VLA немногочисленны, но быстро развиваются:

  • π0 и π0.5 от Physical Intelligence: отличная адаптивность к задачам.
  • NVIDIA Isaac GR00T N1.7: открытые веса, коммерческая лицензия, разработана специально для человекоподобных роботов, модель, которую сейчас дообучают на своих данных большинство китайских аппаратных компаний.
  • Helix и более новая Helix-02 от Figure AI: проприетарные, но важные с архитектурной точки зрения.
  • Genie Envisioner от AgiBot: платформа на основе китайской мировой модели.
  • SmolVLA, NORA, ACoT-VLA, CogACT: растущее изобилие VLA из академических кругов, исследующих разные направления дизайна.

Как работает VLA (без математики)

Можно представить VLA как объединение трёх входных потоков в один выходной.

Первый поток данных — визуальный. Данные с RGB-камер (иногда с датчиков глубины или лидаров), иногда тактильные датчики на кончиках пальцев обрабатываются визуальным кодировщиком (обычно трансформерной моделью вроде DINOv2 или SigLIP), который сжимает каждое изображение в несколько сотен «визуальных токенов», суммирующих то, что видит робот.

Второй поток — языковой. Ваша инструкция («передай мне отвёртку») преобразуется в токены, как в ChatGPT.

Эти два потока соединяются и подаются в «основу»-трансформер (часто небольшую открытую языковую модель вроде Qwen3 или Llama). Эта основа отвечает за рассуждения, объединяя то, что она видит, с тем, о чём её спрашивают.

Третий поток: действия — выходит с другой стороны. Здесь архитектурные решения начинают расходиться:

  • Дискретные токены действий: Модель напрямую генерирует токены, которые можно декодировать в углы суставов или положение захвата, подобно тому как ChatGPT генерирует слова. Просто, но при высокой частоте может давать дёрганные движения.
  • Диффузионные или flow-matching головы для действий: Отдельная миниатюрная сеть получает выход основы и сглаживает его, генерируя плавную траекторию позиций суставов, подобно тому как диффузионные модели генерируют изображения, только здесь генерируется движение. Так делает π0, что даёт более плавные и естественные движения.
  • Разбиение действий на чанки: Вместо предсказания одной следующей команды предсказывается набор команд на следующие полсекунды, что сглаживает рывки.

В модели VLA: два входных потока на вход, команды движения на выходе. Рассуждения и действие сливаются в одной сети.

Это и есть критический архитектурный сдвиг: рассуждения и действие больше не разделены. Обучить нейросеть распознавать чашку — это одновременно научить её, как её схватить. Именно эта связь позволяет VLA обобщать там, где их предшественники не могли.

Часть 5: Стратегия двух мозгов. Как LLM и VLA работают вместе

Вот деталь, которую редко объясняют в маркетинге. Лучшие на сегодня человекоподобные роботы работают не на одной системе VLA, а на двух моделях с разной скоростью, общающихся друг с другом. Это иногда называют архитектурой двух систем или Системы 1 / Системы 2, заимствуя психологическую модель Даниэля Канемана, которая предполагает, что у человека есть быстрый интуитивный мозг и медленный мозг обдумывания.

Helix от Figure AI сделала этот дизайн классическим, и теперь его (и его варианты) копируют повсеместно. Особенно важно, что дизайн NVIDIA GR00T N1.7 использует его, как и большинство китайских человекоподобных роботов. Структура такова:

  • Система 2 (S2): Медленный думающий мозг. Визуально-языковая модель с ~7 миллиардами параметров, работающая с частотой около 7–9 Гц (т.е. 7-9 раз в секунду). Её работа — наблюдать сцену, анализировать инструкцию, выполнять многошаговые рассуждения (например, «чашка за коробкой хлопьев; мне нужно сначала убрать коробку») и выдавать высокоуровневые намерения — обычно это набор сжатых внутренних векторов, а не сами слова.
  • Система 1 (S1): Быстрый реагирующий мозг. Гораздо меньшая (около 80 миллионов параметров) модель визуально-двигательной стратегии, работающая с частотой 200 Гц. Она получает вектор намерения от S2 плюс последние данные сенсоров и выводит непрерывные команды для суставов. Она не «думает» в реальном смысле, а просто реагирует.

Недавно Helix-02 от Figure добавила Систему 0 (S0). Она находится ниже двухмозговой системы и является слоем рефлексов, а не третьим когнитивным слоем. Это сеть с 10 миллионами параметров, работающая на частоте 1 кГц, которая обрабатывает балансировку и общую координацию тела, заменяя более 100 000 строк C++-кода для управления движением. Можно представлять S0 как приобретённый спинной мозг: она не рассуждает и не планирует, а просто поддерживает тело в вертикальном положении и координирует его, в то время как мышление происходит в двухмозговой системе выше.

Архитектура двух мозгов современного человекоподобного робота: Система 2 медленно думает, Система 1 быстро реагирует — а под ними Система 0 для рефлексов, поддержания баланса, тактильного контакта и общей координации тела.

Это разделение продиктовано физическими ограничениями. Если выдавать команды движения только раз в 200 мс (так быстро может работать большая VLA), движения робота будут вялыми, как под водой. Обновления команд движения должны происходить быстрее, чем естественные колебания управляемых ими суставов, что означает сотни и тысячи обновлений в секунду. Ни одна трансформерная модель с 7 миллиардами параметров не может работать так быстро на роботе с аккумулятором.

Таким образом, когнитивные задачи разделены: большая медленная модель думает; маленькая быстрая модель действует. Они общаются не на английском, а через выученные латентные векторы: медленная модель выдаёт абстрактную цель, а быстрая знает, как её интерпретировать.

Часть 6: Облако, периферийные вычисления и где размещать «мозг»

Где же происходят все эти вычисления?

Сегодня почти сформировался сильный, почти идеологический консенсус среди команд робототехников, что критические для безопасности контуры управления должны выполняться локально. По двум причинам:

Задержка. Время передачи туда-обратно по Wi-Fi или сотовой сети даже при оптимистичных оценках составляет 30-80 мс. Команды движения требуют обновления каждые 1-5 мс. С такой сетевой петлёй работать невозможно.

Надёжность. Роботы работают на заводах, складах, кухнях, в больницах. Сеть может отключиться в любой момент. Если робот встанет колом при обрыве Wi-Fi — это создаст угрозу безопасности.

Поэтому современное разделение примерно следующее:

На борту (локально), на модуле типа NVIDIA Jetson Thor или AGX Thor (~2000 TFLOPS, 128 ГБ памяти, потребление 40–130 Вт):

  • Всё S0/S1: балансировка, локомоция, управление точными движениями.
  • Сама VLA (Система 2), всё больше квантуемая до FP8 или FP4, чтобы вписаться в аппаратные ограничения. Сейчас модели от 2 до 7 миллиардов параметров могут работать на устройстве.
  • Восприятие, сенсорная интеграция и любые другие программы безопасности или мониторинга.

Облако или удалённый сервер (если есть):

  • Диалоговые интерфейсы («Эй, робот, что мне приготовить на ужин?»): Они могут терпеть задержку.
  • Кластерное обучение: тысячи роботов отправляют данные телеметрии обратно на сервер для объединения в следующую версию модели.
  • Крупномасштабное долгосрочное планирование, возможно, с использованием моделей нового поколения.
  • Панели оператора и мониторинг.

Кроме того, появляется промежуточный слой: локальные периферийные серверы на заводе или складе, которые общаются с кластером роботов по локальной сети с задержкой в несколько миллисекунд. Более крупные LLM могут размещаться на этом уровне для выполнения задач высокоуровневого планирования, не требующих управления отдельными роботами.

На этой предпосылке строится волна китайских человекоподобных роботов: Unitree, AgiBot, Xpeng IRON, Fourier, EngineAI. Их роботы оснащены бортовыми вычислениями (обычно Jetson, иногда китайскими чипами вроде Huawei Ascend), а облако используется для кластерного обучения и диалоговых интерфейсов, но не для контуров управления.

Где на самом деле работает мозг робота: безопасно-критические контуры работают локально, облако — для того, что может подождать.

Часть 7: Почему открытые модели стали молчаливым центром внимания

Если судить только по демонстрациям, можно подумать, что область контролируется горсткой хорошо финансируемых американских компаний. Но реальность сложнее. Скорость развития физического ИИ во многом определяется открытыми моделями, веса которых может скачать и дообучить любой.

Неполный, но знаменательный список:

  • OpenVLA (Стэнфорд): Первая открытая 7B-модель для роботов общего назначения.
  • NVIDIA Isaac GR00T (N1, N1.5, N1.7): Открытые веса будут выпущены, коммерческая лицензия — скоро. Обучена на десятках тысяч часов эгоцентричного видео от людей.
  • π0 от Physical Intelligence: Веса выпущены для исследований.
  • NVIDIA Cosmos: Фондовая модель открытого мира.
  • AgiBot World: Большой открытый набор данных от шанхайского стартапа с демонстрациями телероботизации человекоподобных роботов.
  • LeRobot от Hugging Face: Открытая библиотека, ставшая точкой сбора для всех вышеупомянутых платформ.
  • mimic-video от Mimic robotics: Открытая модель видео-действия с 10-кратной эффективностью выборки по сравнению с традиционными VLA.

Это важно по двум причинам. Во-первых, стартапам в робототехнике не нужно тратить десятки миллионов долларов на предварительное обучение базовой модели: они могут взять GR00T или π0 и дообучить их данными со своих роботов. Именно так и поступают Unitree, EngineAI, Booster, Galbot и десятки более мелких китайских компаний. Вот почему компания с несколькими сотнями сотрудников может выпускать человекоподобного робота, который ходит, говорит и складывает одежду: они стоят на плечах открытого технологического стека.

Во-вторых, открытые модели — единственный реалистичный путь к решению проблем безопасности. Если полностью закрытая модель работает внутри робота на заводском цеху и нет никакого понимания её логики рассуждений — это кошмар для регуляторов. Открытые модели позволяют аудиторам, исследователям и операторам реально проверять, чему был обучен робот.

Часть 8: Какие проблемы всё ещё не решены

Если вы видели достаточно демонстраций роботов, вы наверняка видели и много провалов. Нынешнее поколение роботов LLM+VLA действительно впечатляет, но у них есть явные ограничения. Вот их проблемы:

  • Восстановление в середине задачи. VLA справляются с неожиданными изменениями лучше любой предыдущей технологии. Но когда что-то действительно идёт не так (провал захвата, предмет покатился, кто-то зашёл в рабочую зону) — возвращение на правильный путь остаётся слабым местом. Робот будет слепо повторять неудачное действие.
  • Эффективность выборки. Обучение VLA с нуля требует десятков тысяч часов данных телероботизации. Человек учится пользоваться новым инструментом за минуты. Этот разрыв в эффективности огромен.
  • Обобщение между разными воплощениями. Модель, обученная на руке Franka в лаборатории Стэнфорда, не идеально переносится на человекоподобного робота Unitree на складе в Шэньчжэне. У них разная физика.
  • Долгосрочные задачи. Любое связное поведение, требующее более 30-60 секунд и включающее несколько подцелей, подвержено дрейфу цели. Задачи вроде «приготовь мне завтрак» по-прежнему недостижимы.
  • Физическая интуиция. VLA обучены на подражании, а не на понимании. Они не понимают принципа «если толкнуть чашку с водой, вода прольётся». Они видели примеры и предсказывают, что будет дальше, на основе сопоставления с образцом.
  • Пространственные рассуждения. Несмотря на мультимодальность, они удивительно слабы в задачах вроде «обходи препятствие, а не проходи сквозь него» или «сложи эти вещи так, чтобы они не упали».

Эта последняя группа слабостей побуждает область делать ставку на совершенно другой вид моделей.

Часть 9: Мировые модели

Представьте: что, если вместо обучения робота предсказывать действия, мы обучим его предсказывать последствия действий?

Мировая модель (World Model) — это нейронная сеть, которая предсказывает, как будет выглядеть мир в следующий момент, исходя из его текущего состояния (обычно видео или последовательности кадров) и предполагаемого действия. Грубо говоря, это обучаемый видеопрогнозирующий симулятор с «рулём». Вы показываете ему последнюю секунду с камеры и говорите «робот переместит руку на 10 см вперёд», и он генерирует реалистичный видеоролик, предсказывающий, что произойдёт в следующую секунду.

Почему это важно?

Потому что, имея мировую модель, робот может думать перед действием. Он может мысленно проработать три-четыре кандидатных действия, предсказать результат каждого, оценить их и выбрать лучший вариант. Всё это до того, как двинутся моторы. Именно так работает шахматный движок: он не запоминает ходы, а моделирует будущее. Этой способности никогда не было в физической робототехнике, потому что никогда не было достаточно точной модели для симуляции хаотичного реального мира.

Мировые модели позволяют роботу симулировать несколько возможных будущих сценариев, оценивать их и выбирать лучший вариант до того, как включатся моторы.

На что же похожа мировая модель в 2026 году?

Современные мировые модели разнообразны, но развиваются быстро. Вот некоторые из них:

  • NVIDIA Cosmos: Серия открытых фундаментальных моделей мира, включая Cosmos Predict 2.5 (генеративная модель), Cosmos Transfer 2.5 (управляемая модель симуляции), Cosmos Reason 2 (визуально-языковой «рассуждатель» для роботов) и новейший Cosmos Policy. Cosmos Policy идёт дальше, дообучивая мировую модель для прямого вывода действий управления. Cosmos обучается на десятках тысяч часов видеоданных (Cosmos Predict 2.5 — мировая модель в этой серии).
  • DeepMind Genie 3: Интерактивная мировая модель, которая генерирует полностью навигационные среды по текстовым подсказкам с частотой 24 кадра в секунду, стабильно работая в течение минут. Изначально создавалась для игровых сред.
  • Meta V-JEPA 2: Предварительно обучена на более чем миллионе часов видео из интернета, а затем кондиционирована действиями всего на 62 часах видео с роботов. Достигает 80% успеха при нулевом снимке в задачах захвата и размещения на реальных роборуках в разных лабораториях без какого-либо обучения конкретной задаче. Подход «JEPA» архитектурно отличается от других.
  • DeepMind Dreamer 4: Используя только офлайн-данные, без взаимодействия со средой, научилась собирать алмазы в Minecraft (задача на 20 000 шагов). Доказывает, что настоящее обучение с подкреплением в виртуальном мире возможно.
  • Genie Envisioner от AgiBot: Унифицированная платформа мировой модели из Китая, обученная на более чем 3000 часов видео работы человекоподобных роботов в реальном мире. Она может генерировать как предсказанные траектории, так и исполняемые последовательности действий. AgiBot использует NVIDIA Cosmos Predict 2 в качестве основы и дообучает на своих данных. Это как раз та модель «открытый стек + свои данные», описанная ранее.
  • Мировые модели Toyota Research на базе Cosmos: Для усиления данных телероботизации и навигации.

Шесть самых важных мировых моделей 2025-2026 годов, каждая из которых представляет разные представления о том, как машина должна изучать физику.

Часть 10: Альтернативные архитектуры. Потому что область ещё не устоялась

Нет единого способа построить мировую модель. Конкуренция архитектур — одна из самых интересных дискуссий в ИИ на сегодня, и она напрямую влияет на то, что смогут делать роботы в будущем. Три лагеря, за которыми стоит следить:

Диффузия видео на уровне пикселей (школа Cosmos/Sora): Использует диффузионные модели для предсказания фактических пикселей будущих кадров. Плюсы: служит генератором синтетических данных, может визуализировать совершенно новые демонстрации роботов, которые никогда не происходили. Минусы: вычислительно затратно, иногда нарушает физику, предсказывать пиксели, которые никогда не будут увидены, — это расточительно.

Архитектуры совместного предсказания вложений (Joint Embedding Predictive Architectures, JEPA) (школа ЛеКуна): Не предсказывает пиксели, а предсказывает абстрактное представление следующего кадра. Отбрасывает детали текстур, сохраняя только семантическую сущность того, что есть в сцене. Плюсы: эффективно, сосредоточено на том, что важно для действия. Минусы: сложнее в использовании. Эту область исследуют V-JEPA, V-JEPA 2 и новые гибриды JEPA-VLA.

Латентные мировые модели с действиями (школа Genie/Dreamer): Учится сжимать целые видео в латентный «язык действий», который захватывает структуру поведения, а затем обучает мировую модель предсказывать следующее латентное состояние, учитывая следующее латентное действие. Плюсы: позволяет обучаться на сетевых видео без действий, а затем добавить немного данных с реальных роботов. Минусы: латентные действия не интерпретируемы человеком, что усложняет анализ безопасности.

Пиксельная диффузия, JEPA и латентные действия: одинаковая цель, но совершенно разные способы построения мировой модели.

Часть 11: Как роботы на мировых моделях будут работать на практике

Если заглянуть на несколько лет вперёд, архитектура передового человекоподобного робота может выглядеть так:

VLA, оснащённая мировой моделью. Когда робот сталкивается с новой ситуацией, он выполняет что-то вроде следующего:

  • VLA предлагает несколько кандидатов для следующего действия (она всё ещё остаётся стратегией).
  • Мировая модель берёт каждый кандидатный план и симулирует 1-3 секунды воображаемого видео.
  • Модуль оценки (ценностная сеть) оценивает симулированные результаты: поднята ли чашка? Что-то упало? Заденет ли человека?
  • Робот выберет действие с наивысшим баллом и выполнит только его первую часть.
  • Реальные данные сенсоров возвращаются; цикл повторяется.

Это и есть прогнозное управление по модели (MPC), технология, которая годами используется для стабилизации ракет и дронов, но теперь с выученной мировой моделью вместо выведенных вручную уравнений физики. Её масштабируемость в том, что мировая модель предобучена на миллионах часов видео, а не потому, что кто-то написал уравнения Навье-Стокса для кухонной среды.

Выгоды нарастают:

  • Улучшение восстановления. Если захват срывается, мировая модель может смоделировать несколько корректирующих путей и выбрать наиболее перспективный.
  • Улучшенное обобщение. Мировая модель, обученная на сетевых видео, «видела» «физических явлений» на порядки больше, чем любой набор данных телероботизации.
  • Контролируемое долгосрочное планирование. Планировать в воображении, а не в реальности.
  • Сокращение разрыва между симуляцией и реальностью. Вместо того чтобы обучать на собственном симуляторе (например, Isaac Sim, физический движок Newton) и надеяться, что это перенесётся на реальное железо, теперь можно обучать на выученном симуляторе, который соответствует реальному видео. Поэтому разрыв меньше.
  • Взрыв синтетических данных. Мировая модель может генерировать миллионы различных траекторий роботов практически бесплатно, с разным освещением, материалами и конфигурациями объектов. Это решает одно из главных узких мест в области.

Кроме того, это даёт важное преимущество для безопасности. Робот, способный моделировать последствия действий, может отказаться выполнять опасные операции — не из-за правил, а потому что предвидит, что кто-то может пострадать в будущем.

Два способа движения: VLA реагирует на то, что видит; робот с мировой моделью думает, прежде чем двигаться.

Часть 12: Что ещё нужно знать

Проблема данных — это настоящая проблема: Все архитектурные инновации в мире ничего не стоят, если вы не можете накормить модель данными. Сейчас телероботизация (когда люди в VR-шлемах дистанционно управляют роботами как марионетками) — главное узкое место. Конкурентный ров робототехнической компании всё больше определяется её конвейером сбора данных, а не самой моделью. AgiBot уже построила склады, заполненные операторами. Закон масштабирования для ловкости NVIDIA GR00T N1.7 показывает, что больше видео от первого лица напрямую и предсказуемо улучшает ловкость роботов. Это также область, где у Китая есть структурное преимущество: более низкая стоимость труда для сбора данных, более терпимая среда для развёртывания и активная координация государством цепочек поставок.

Симуляция — это параллельная вселенная. NVIDIA Isaac Sim, новый открытый физический движок Newton (1.0 выйдет в апреле 2026) и платформа Omniverse позволяют компаниям обучать роботов в миллионах параллельных симуляционных сред, не развёртывая их в реальном мире. Большая часть того, что выглядит как «роботинтеллект», на самом деле выращивается в симуляции, а затем переносится на железо.

Экономика начинает работать. Unitree поставила около 5500 человекоподобных роботов в 2025 году и планирует 10-20 тысяч в 2026. Средняя цена упала с 85 000 до 25 000 долларов за два года. R1 от Unitree стоит 5900 долларов. Noetix Bumi выходит на рынок по цене 1400 долларов. Аппаратное обеспечение человекоподобных роботов приближается по цене к потребительской электронике, в то время как ИИ внутри них всё ещё отстаёт от демонстрационных образцов. Этот разрыв сократится, и когда это произойдёт, эффект масштаба будет заметен.

Режимы сбоев выглядят странно. Когда роботы на базе LLM ломаются, они делают это способами, недоступными традиционным роботам. Например, уверенно делают неверные вещи, «галлюцинируют» функции, зацикливаются в диалоге с собственным планировщиком. Сообщество традиционной робототехники относится к этому с изрядной долей скепсиса, и не без оснований, настаивая на том, что обучающиеся системы должны быть под наблюдением безопасности и ограничены в поведении. Самые надёжные развёрнутые на сегодня роботы — гибридные: мозг VLA помещён в клетку безопасности, написанную вручную.

Нарратив «момента ChatGPT» — полезная, но вводящая в заблуждение аналогия: Дженсен Хуанг постоянно говорит всем, что момент ChatGPT для роботов уже наступил. Он говорит это, потому что NVIDIA продаёт лопаты и кирки. Более честная версия: мы сейчас примерно в эпохе GPT-2 для физического ИИ. Он мощный, он может поразить; но недостаточно мощный, чтобы развёртывать его без присмотра. Он быстро итерируется, но не достиг точки взрывного вирусного распространения, а находится на медленной, но уверенной восходящей траектории.

Заключение

Эволюция четвероногих роботов Unitree (справа налево)

В демонстрации, которую я видел в офисе Unitree, пять человекоподобных роботов G1 исполняли боевые искусства — тщательно поставленную хореографию, с тонкой настройкой бортового VLA-контроллера и операторами телероботизации, обеспечивающими бесперебойную работу. В своей основе это не полностью автономно. Но весь конвейер: восприятие, планирование, управление движением — заменяется нейронными сетями. Через два года те же роботы смогут выполнить ту же хореографию без постановки, потому что они мысленно проработают её заранее и выберут лучшую версию.

Вся эволюция, описанная в этой статье: от рукописных контроллеров к машинному обучению восприятия, к LLM-планировщикам, к VLA, к двухсистемной архитектуре и, наконец, к мировым моделям — это по сути медленное перемещение того, где находится интеллект робота. Он начинался в умах инженеров, затем переместился в рукописный код, затем в слой восприятия, в планировщик, в стратегию. И теперь он, наконец, движется к модели, которая учится самому миру.

Каждый переход делает роботов более универсальными, более адаптируемыми, более полезными. Если переход к мировой модели сработает, он действительно даст роботам силу: достаточно большую, чтобы вопрос перестал быть «Что могут делать роботы?», а стал «Что мы должны позволять им делать?»

Рекомендуемая статья: Обзор более 30 компаний по производству человекоподобных роботов: кто выиграет в 2026 году?

Трендовые криптовалюты

Связанные с этим вопросы

QЧто такое визуально-языковые двигательные модели (VLA) и как они работают?

AВизуально-языковые двигательные модели (VLA) — это нейронные сети, которые напрямую генерируют команды для движений робота на основе визуального ввода (например, изображения с камер) и языковых инструкций. Они объединяют рассуждение и действие в одной модели. VLA обрабатывает визуальные данные через кодировщик (например, DINOv2), языковые инструкции токенизируются, а затем объединяются в Transformer-архитектуре. На выходе модель может предсказывать либо дискретные «токены действий», либо плавные траектории движений (например, с помощью диффузии или сопоставления потоков). Это позволяет роботам лучше обобщать задачи и адаптироваться к новым условиям.

QКакова архитектура «двух мозгов» (System 1 и System 2) в современных человекоподобных роботах?

AАрхитектура «двух мозгов» разделяет когнитивные функции на два уровня. System 2 («медленный мозг») — это большая модель VLA (например, на 7 миллиардов параметров), работающая с частотой 7–9 Гц. Она анализирует сцену, интерпретирует инструкции и выполняет многошаговые рассуждения, генерируя высокоуровневые намерения. System 1 («быстрый мозг») — это небольшая визомоторная модель (например, 80 миллионов параметров), работающая с частотой 200 Гц. Она получает векторы намерений от System 2 и текущие данные с датчиков, чтобы генерировать непрерывные команды для суставов. Такое разделение позволяет сочетать глубокое мышление с быстрой реакцией, необходимой для плавных движений.

QЧто такое «модели мира» (World Models) и почему они важны для робототехники?

AМодели мира — это нейронные сети, которые предсказывают будущее состояние мира на основе текущего состояния и планируемого действия робота. Они позволяют роботу «мыслить» перед действием: моделировать несколько возможных будущих сценариев, оценивать их и выбирать лучший вариант. Это улучшает способность к восстановлению после ошибок, обобщению задач и долгосрочному планированию. Ключевые примеры включают NVIDIA Cosmos, DeepMind Genie 3 и Meta V-JEPA 2. Такие модели также генерируют синтетические данные для обучения и сокращают разрыв между симуляцией и реальностью.

QПочему открытые (open-source) модели стали ключевым фактором в развитии робототехники?

AОткрытые модели (например, OpenVLA, NVIDIA Isaac GROOТ N1.7) позволяют стартапам и исследователям использовать готовые веса моделей и дообучать их на своих данных, экономя миллионы долларов на предварительном обучении. Это ускоряет инновации и демократизирует доступ к передовым технологиям. Например, китайские компании, такие как Unitree и AgiBot, активно используют такие модели. Кроме того, открытость способствует безопасности и аудиту: можно анализировать, как модель принимает решения, что критически важно для развертывания в реальных условиях.

QКаковы основные ограничения современных роботов на основе LLM и VLA?

AСовременные роботы на основе LLM и VLA сталкиваются с несколькими ключевыми ограничениями: 1) Восстановление после сбоев: они часто повторяют неудачные действия вместо адаптации. 2) Низкая эффективность данных: для обучения требуются тысячи часов данных, тогда как человеку достаточно минут. 3) Слабая обобщаемость между разными физическими платформами. 4) Трудности с долгосрочными задачами (более 30–60 секунд). 5) Отсутствие физического здравого смысла: модели действуют на основе шаблонов, а не глубокого понимания законов физики. 6) Ограниченные пространственные рассуждения, например, при обходе препятствий.

Похожее

Телесуфлёр из Белого дома "для внутреннего пользования" заработал на инсайдерской информации более $100 000

Белый дом раскрыл дело о внутренней торговле: помощник по суфлеру, работавший на Дональда Трампа, использовал инсайдерскую информацию для ставок на рынках предсказаний и заработал более 100 000 долларов. Габриэль Перес, помощник президента и технический советник, отвечавший за работу суфлера Трампа с 2016 года, имел доступ к черновикам речей до их публичного произнесения. Используя эти знания, он делал ставки на платформе Kalshi, предсказывая, какие конкретные слова или фразы упомянет Трамп в своих выступлениях. За три месяца, делая ставки на более чем десяток речей, включая обращение о положении страны, Перес получил прибыль в размере шестизначной суммы. Его деятельность была выявлена системами мониторинга Kalshi, которая заблокировала его средства и передала дело в Комиссию по торговле товарными фьючерсами (CFTC). В отличие от предыдущих аналогичных случаев с военным и инженером Google, против Переса не были выдвинуты уголовные обвинения. Согласно сообщениям, CFTC договорилась о урегулировании, по которому он вернет прибыль и прекратит такую деятельность. Трамп, назвав его действия «предосудительными», отстранил Переса от работы без сохранения зарплаты. Этот инцидент подчеркивает уязвимость рынков предсказаний, особенно категорий «упоминаний», для манипуляций со стороны инсайдеров. Ранее были случаи, когда сами ораторы (например, генеральный директор Coinbase) намеренно упоминали ключевые слова, чтобы повлиять на результаты рынка. В ответ Kalshi ужесточила правила, требуя от пользователей раскрывать место работы. Эксперты отмечают, что очистка рынков от инсайдерской торговли повышает соответствие нормам, но может отдалить их от идеи «мудрости толпы», приблизив к чистому азарту.

marsbit32 мин. назад

Телесуфлёр из Белого дома "для внутреннего пользования" заработал на инсайдерской информации более $100 000

marsbit32 мин. назад

«Домашний» оператор суфлёра Белого дома заработал более $100 тыс. на инсайдерских прогнозах

Недавно в Белом доме США произошел очередной скандал, связанный с инсайдерской торговлей. Габриэль Перес, сотрудник Белого дома, отвечавший за работу суфлера во время выступлений Дональда Трампа, использовал служебную информацию для получения прибыли на рынках предсказаний. Перес, который с 2016 года был одним из ближайших помощников Трампа и имел доступ к его подготовленным речам, в течение примерно трех месяцев делал ставки на то, какие конкретные слова или фразы президент упомянет в своих выступлениях. За это время ему удалось заработать более 100 тысяч долларов. Его деятельность была выявлена платформой предсказаний Kalshi, которая заблокировала его средства и передала информацию Комиссии по торговле товарными фьючерсами (CFTC). В результате Перес был отстранен от работы без сохранения зарплаты. Однако, в отличие от предыдущих аналогичных случаев со спецназовцем и инженером Google, против Переса не были выдвинуты уголовные обвинения. По данным источников, CFTC договорилась о мировом соглашении, согласно которому он должен вернуть прибыль и прекратить подобную деятельность. Этот инцидент высветил уязвимость рынков предсказаний, особенно категорий, связанных с упоминанием определенных слов («mention markets»), перед манипуляциями со стороны инсайдеров или самих ораторов. Ранее подобные манипуляции демонстрировали ведущий церемонии «Грэмми» и CEO Coinbase. В ответ платформы ужесточают контроль: Kalshi теперь требует от пользователей раскрывать место работы. Скандал с Пересом рассматривается как часть общего процесса очистки рынков предсказаний от инсайдерской торговли.

Odaily星球日报36 мин. назад

«Домашний» оператор суфлёра Белого дома заработал более $100 тыс. на инсайдерских прогнозах

Odaily星球日报36 мин. назад

Биткойн-майнинг-фермы превращаются в AI-фабрики

Биткойн-майнинг превращается в инфраструктуру для ИИ. Компании, ранее занимавшиеся майнингом, такие как Crusoe и CoreWeave, перепрофилируют свои центры обработки данных с криптовалют на искусственный интеллект. Их главный актив — не оборудование, а уже готовый доступ к большим объемам электроэнергии, земле и разрешениям на подключение к сетям, что критически важно для создания дата-центров под ИИ. На фоне снижения доходности от майнинга биткойнов и высокого спроса со стороны ИИ-компаний этот переход стал экономически оправданным. Крупные майнинговые компании, включая TeraWulf, Cipher Mining и IREN, уже заключили долгосрочные контракты на сотни миллиардов долларов с такими гигантами, как Anthropic, AWS и Microsoft. Люди и капитал из криптоиндустрии также активно перемещаются в сферу ИИ. Основатель OpenSea создал агрегатор ИИ-моделей OpenRouter, а бывший сотрудник Coinbase основал платформу для медиа-моделей Fal.ai. Крипто-капитал финансирует ИИ-инфраструктуру, как в случае с Voltage Park Джеда Маккалеба, и поддерживает эксперименты, такие как распределенная сеть для обучения моделей Psyche от Nous Research. Хотя успех не гарантирован, криптоиндустрия передает ИИ три ключевых ресурса: энергомощности, инженерные кадры и капитал, накопленный в предыдущем цикле.

链捕手47 мин. назад

Биткойн-майнинг-фермы превращаются в AI-фабрики

链捕手47 мин. назад

Криптоплатежи за пептиды с серого рынка выросли на 700% за год — Подробности

Согласно недавнему отчёту, в США наблюдается резкий рост использования криптовалют, в основном биткойна и стейблкоинов, для покупки пептидов на сером рынке. Эти соединения, продаваемые как средства для омоложения, наращивания мышц и похудения, часто находятся в правовой серой зоне. Из-за ужесточения банковских ограничений многие поставщики, особенно в Китае, начали принимать криптовалюты. По данным Chainalysis, в первом квартале 2026 года продавцы пептидов получили $32 млн в криптовалюте, что на 700% больше, чем годом ранее. Аналитики TRM Labs также отмечают подобный тренд. Эксперты подчёркивают, что современные покупатели — это часто обычные потребители, привлечённые доступностью и низкой ценой, а не участники теневых рынков. Этот всплеск использования криптовалют для кросс-бордерных платежей происходит на фоне общего снижения розничного участия на крипторынке в начале 2026 года.

ambcrypto1 ч. назад

Криптоплатежи за пептиды с серого рынка выросли на 700% за год — Подробности

ambcrypto1 ч. назад

human.tech запускает Clean SDK для приватных Web3-приложений

Компания human.tech представила Clean SDK — набор инструментов для разработки приложений в Web3, в которых по умолчанию соблюдаются конфиденциальность и прозрачная подотчетность. Этот комплект, выпущенный одновременно с версией 5 Aztec, предоставляет разработчикам готовые компоненты для внедрения в их приложения проверки личности с нулевым разглашением (zero-knowledge), скрининга санкционных списков и приватных транзакций, без необходимости самостоятельно работать с конфиденциальными пользовательскими данными или создавать инфраструктуру для соответствия нормативным требованиям. Clean SDK решает ключевую проблему Web3, сочетая приватность с подотчетностью. С помощью zero-knowledge доказательств и программируемой верификации приложения могут подтверждать легитимность пользователей и прохождение средств проверки на санкции, не раскрывая при этом личную информацию. Таким образом, разработчикам больше не нужно выбирать между конфиденциальностью пользователей и регуляторными требованиями. Первый продукт на основе SDK — приложение Shield (мост между Ethereum и Aztec), которое было запущено одновременно с ним. Shield позволяет пользователям и автономным агентам переводить активы в Aztec, сохраняя анонимность, но при этом криптографически доказывая, что за каждой операцией стоит уникальный реальный человек, а средства проверены. Аудит Nethermind в мае 2026 года подтвердил надежность смарт-контрактов Shield. Как отметил сооснователь human.tech Шади Эль Дамати, «приватность без подотчетности ведет к злоупотреблениям, а подотчетность без приватности превращается в слежку. Clean SDK устраняет этот ложный выбор». Комплект предлагает три основных метода верификации: скрининг санкций (Proof of Innocence), подтверждение личности человека (Proof of Personhood, в том числе через Human Passport) и верификация личности с нулевым разглашением для операций с высокой стоимостью (Proof of Clean Hands). Данные хранятся в зашифрованном виде вне блокчейна, а проверки происходят как при входе, так и при выходе средств. В целом, Clean SDK, предназначенный в первую очередь для разработчиков в экосистеме Aztec, призван стимулировать создание разнообразных приватных финансовых приложений и сервисов, которые обеспечивают видимую подотчетность с помощью криптографических доказательств, не требуя от разработчиков создания сложной инфраструктуры с нуля. Этот запуск отражает растущий спрос на институциональные решения, которые прозрачно балансируют между приватностью и соответствием требованиям.

TheNewsCrypto1 ч. назад

human.tech запускает Clean SDK для приватных Web3-приложений

TheNewsCrypto1 ч. назад

Торговля

Спот

Популярные статьи

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

2025 год — год институциональных инвесторов, в будущем он будет доминировать в приложениях реального времени.

1.9k просмотров всегоОпубликовано 2025.12.16Обновлено 2025.12.16

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на AI (AI) представлены ниже.

活动图片