Смотрю на выходных соцсети — один видеоролик меня поразил.
Робот управляет картингом на треке, входит в повороты, ускоряется, поворачивает руль — одним кадром.
Не ожидал, что наши роботы уже могут так лихо показывать трюки на картинговой трассе!

Стоп?
Это не похоже на то, что я видел на WRC!
На выставках роботы бегали, ещё были искры и молнии, а когда этот робот в видео успел тайком записаться на курсы вождения?
Он ведёт себя как настоящий гонщик: входит в повороты на скорости, ловко объезжает препятствия, проходит круг за кругом.
По сравнению с прежними демо, где роботы медленно подходят и наклоняются, чтобы что-то взять, робот в этом видео сам сел в машину, синхронизировал движения рук, глаз и ног и на полной скорости выполнил балансировку по нескольким точкам контакта и точное силовое управление.
Такая координация глаз, рук и ног у двуногого гуманоидного робота, выполнение тонких операций при высокоскоростном движении и сложных изменениях позы, — почти не встречалась в предыдущих демонстрациях человекоподобных роботов.
Это видео опубликовала компания Symbiosis Cognition.
Symbiosis Cognition занимается созданием сквозного интегрированного «мозга» для двуногих гуманоидных роботов, то есть базовой модели (foundation model).
Основатель Дин Пэнсян родился в 1996 году, остальные ключевые члены команды — все родившиеся после 2000 года, все в настоящее время учатся в аспирантуре, компания была основана всего два месяца назад.
Об этой, казалось бы, «не по теме» демонстрации Дин Пэнсян объясняет так:
Я хочу, чтобы робот был больше похож на человека, а не просто выполнял механические сервисные функции. Например, если человек может водить картинг, то и робот должен уметь.
Возникает вопрос: почему группа молодых людей, ещё не получивших дипломы, осмеливается взяться за самое сложное и передовое направление в воплощённом искусственном интеллекте (embodied AI)?
Ставка на самый трудный путь: от изучения иерархии к вызову сквозной модели (end-to-end)
Насколько ново это направление — модели сквозного обучения (end-to-end) для двуногих гуманоидных роботов?
Настолько ново, что на рынке не найти готовых специалистов.
По словам Дин Пэнсяна, это направление стало популярным лишь в последние пару лет, специалисты, разбирающиеся в технологии, всё ещё учатся в аспирантуре, им практически невозможно найти подходящих людей на рынке труда.
Выпускники много лет назад не успевают за ритмом, а те, кто не учился в аспирантуре, недостаточно глубоко понимают основы. Самые передовые прорывы находятся в руках именно этой группы ведущих аспирантов.
Команда Symbiosis Cognition — как раз такие молодые и передовые люди.
Они завоевали самые престижные академические награды Китая в области воплощённого ИИ — две премии Best Paper, и одна работа была номинирована на Best Paper Candidate; также они создали первую в Китае базовую модель воплощённого ИИ, набравшую более 2K звёзд на GitHub.
Что ещё важнее, они не последователи, пришедшие на волне хайпа, а одни из первых пионеров, исследовавших базовые модели воплощённого ИИ в Китае, и самые последовательные долгосрочные сторонники этого направления. Команда опубликовала в сумме более 40 статей на топ-конференциях, их техническая карта охватывает весь стек: восприятие, принятие решений, управление, данные и системы; серия отраслевых инноваций, от двухсистемной и облегчённой архитектуры до многоконфигурационной, — всё вышло из этой молодой команды.

Их суждение ясно: конечной и наиболее широко используемой в человеческой жизни формой робота будет двуногая;
Следуя пути развития автономного вождения и больших языковых моделей, сквозное обучение (end-to-end) — наиболее эффективная техническая парадигма.
Это суждение основано на их опыте исследований на переднем крае.
Ещё в декабре 2023 года Дин Пэнсян начал устанавливать «мозг» четвероногим роботам.
Как первый автор он выпустил QUAR-VLA — первую парадигму задач VLA (Vision-Language-Action) для четвероногих роботов, где верхнеуровневая модель (мозг) отвечает за понимание визуальной и языковой информации, а также намерения задачи, а затем передаёт решение нижнеуровневой двигательной системе (мозжечок) для выполнения.
Этот подход «мозг управляет решениями, мозжечок управляет выполнением движений», то есть иерархическая схема, до сих пор используется такими компаниями, как Figure.
В ходе последующих исследований он постепенно обнаружил проблему.
Он описывает иерархический подход как «теоретически осуществимый, но не самый элегантный вариант»:
Мозг и мозжечок работают сами по себе, для каждой новой задачи необходимо выполнять кастомизированную тонкую настройку выходных данных верхнего уровня, чтобы добиться хорошего результата.
На более глубоком уровне — это врождённый структурный недостаток.
Мозг и мозжечок обучаются отдельно, а при развёртывании соединяются; даже если каждая часть лучше, это не гарантирует оптимальность целого;
Каждый раз при передаче данных между уровнями возникает каскадная ошибка и потеря информации.
Дин Пэнсян считает, что «пока есть иерархия, посередине будет узкое место информации, такой дизайн интерфейса определяет, что иерархическая архитектура не способна по-настоящему масштабироваться (Scaling)».
Это суждение также основано на его долгосрочном наблюдении за развитием автономного вождения и больших моделей.
Раннее автономное вождение зависело от координации нескольких модулей: восприятия, прогнозирования, планирования, управления, позже начали исследовать возможность обучения модели способности вождения непосредственно на данных.

После перехода Tesla FSD на сквозное обучение (end-to-end) производительность значительно выросла.
По мнению Дин Пэнсяна, роботы, вероятно, пройдут аналогичную трансформацию: модель будет учиться на данных целостному процессу «восприятие — понимание — действие».
Его логика такова: начиная с 2023 года они уже неоднократно проходили иерархический путь, если судить, что будущее масштабирование данных в конечном итоге подтолкнёт системы к сквозному обучению, нет необходимости снова идти окольным путём.
Этот переход происходит как раз в 2026 году.
Gemini Robotics 2 от Google уже использует единую политику (policy) для объединения движений всего тела, от ног до кончиков пальцев, в одной модели;
Однако консенсус на топ-конференции RSS 2026 гласит, что единая сквозная модель (end-to-end) не может охватить сложную динамику всего тела, и иерархическая модульная схема является на данный момент оптимальным решением для внедрения.
Ставка Symbiosis Cognition на чистое сквозное обучение (pure end-to-end) — это более радикальный и менее проторённый путь.

Почему именно двуногие? Ответ Дин Пэнсяна — первичный принцип (first principles): здания, инструменты, среда в человеческом обществе все созданы в соответствии с человеческим телосложением.
Колёсные роботы могут работать только на производственных линиях и в магазинах, двуногие же могут выходить на улицу, подниматься и спускаться по лестницам, водить машину, а также выполнять различные задачи в разных сценариях.
Универсальность означает распределение затрат, к тому же двуногие роботы обладают антропоморфной привлекательностью.
Время также имеет ключевое значение. До апреля 2026 года для двуногих гуманоидов даже не было универсальной модели телеуправления (teleoperation), не было источника данных — нельзя было обучить базовую модель.
Только после того, как NVIDIA открыла исходный код Sonic, у отрасли появился фундамент для массового производства данных.
Это направление уже вышло из ранней стадии «хочется обучить, но нет данных», но ещё не созрело до полной конвергенции подходов. Symbiosis Cognition делает ставку именно на это промежуточное окно возможностей.
Технологический водораздел: другие изучают кинематику, они разбираются с динамикой
Сначала проясним водораздел: подавляющее большинство современных базовых моделей для роботов фактически изучают кинематику.
Кинематика касается перемещения из точки А в точку Б, куда движется рука, схватила ли она предмет; для манипулятора с фиксированным основанием это нормально, потому что он не упадёт.
Когда двуногий робот тянется, чтобы взять что-то, центр тяжести его тела одновременно меняется;
При наклоне, чтобы взять предмет, поясница должна наклониться вперёд, голеностопный сустав и ноги должны перераспределить усилие, чтобы сохранить равновесие;
Добавьте к этому трение, столкновения, инерцию и контакт — модель сталкивается уже с целостной динамикой тела.
По словам Дин Пэнсяна, у двуногого гуманоида g1 29 степеней свободы, что намного сложнее 7 степеней свободы у манипулятора.
Раньше роботы учили «траекторию движения», а гуманоидные роботы должны учиться «как тело действует в физическом мире».

Переход от кинематики к динамике, от выполнения задачи к сохранению устойчивости — это настоящий технологический водораздел для моделей двуногих роботов.
Это объясняет, почему Symbiosis Cognition доводит модель до уровня Joint Target, то есть целевых значений суставов.
В иерархической схеме мозг сначала выдаёт кинематические цели, затем нижестоящий мозжечок преобразует их в движения суставов;
Symbiosis Cognition убирает этот промежуточный этап, заставляя модель напрямую работать с состоянием тела, состоящим из десятков суставов.
Сразу возникает вопрос: убрав мозжечок, сможет ли робот сохранять устойчивость?

Только на имитационном обучении модель учится стандартным действиям, не видя различных неустойчивых состояний тела во время выполнения; столкнувшись с незнакомой ситуацией, она может сразу упасть.
Ей не хватает способности устоять после неудачи.
Ключевой подход Symbiosis Cognition — это механизм совместной оптимизации в двух областях: «моделирование поведения задачи — дистилляция двигательных априорных знаний».
Один путь оптимизации продолжает клонирование поведения, обеспечивая точность задачи и способность имитировать движения; другой путь, через DriftDistill, превращает накопленные базовым контроллером способности к устойчивости, сопротивлению возмущениям и восстановлению после сбоев (Failure Recovery) во внутренние двигательные априорные знания единой модели.
Это не простое сложение двух функций потерь (Loss), а интеграция двух типов способностей — «точно выполнять задачу» и «устойчиво управлять телом» — в одну модель, позволяя большой модели одновременно обрести интеллект задачи и интеллект тела.
Если DriftDistill сможет продолжить масштабироваться вместе с моделью и объёмом данных, он попытается решить более крупную проблему:
Помимо когнитивного масштабирования (Cognitive Scaling), может ли робот также масштабировать свои двигательные управляющие способности.
Дин Пэнсян называет этот модуль агрегации двигательных способностей Motion Expert (модель-эксперт по движению). В настоящее время её размер составляет около 1 млрд параметров (1B), и через дистилляцию она постоянно поглощает способности различных моделей управления движением.

Идём дальше: сквозной большой модели (end-to-end) ещё предстоит решить вопрос выходного усилия робота.
Многие современные робототехнические системы в основном управляют положением, но когда робот действительно войдёт в реальный мир, правильное положение не будет означать выполнение задачи.
Рука дотягивается до ручки ящика, но не знает, какое усилие приложить, — ящик всё равно не откроется; передавая что-то человеку, положение правильное, но чрезмерная сила также небезопасна.
Технический путь Symbiosis Cognition заключается в том, чтобы сначала использовать Force Expert в качестве эксперта по безопасному контакту, заставляя его учиться приложению усилия, податливости (compliance), импедансу и обратной связи от контакта, а затем постепенно интегрировать его через дистилляцию политики (policy distillation) в Motion Expert и, в конечном итоге, в сквозную модель (end-to-end model).
Положение определяет, может ли робот «попасть туда», сила определяет, может ли он действительно «хорошо выполнить задачу».
В этом также заключается смысл «модели физического мира всего тела» от Symbiosis: заставить модель понять, как тело воспринимает усилия, теряет равновесие, вступает в контакт, а затем напрямую превратить эти ограничения в действия.
Данные, эмерджентность и трезвый график
Когда начинается реальное обучение модели, первое, с чем сталкиваются, — это нехватка данных.
По состоянию на начало 2026 года во всём мире насчитывалось около 500 тысяч часов совместимых (compliant) данных о роботах, что менее чем в две десятитысячных от объёма данных для больших языковых моделей.
Загвоздка в том, что многие данные собираются при статичной работе, когда робот стоит на месте и работает в кабинке, что мало помогает в операциях, связанных с движением всего тела.
В блоге Symbiosis Cognition опубликовано около 10+ тысяч часов данных, несколько тысяч из них собраны самостоятельно.
Для модели координации всего тела действительно не хватает данных о сильно связанных операциях с движением всего тела из реальной жизни, таких как езда на велосипеде, вождение картинга, накачивание мяча и т.д.
Их решение — TrajBooster: извлечение концевых траекторий из манипуляторов или колёсных роботов, отслеживание этой траектории гуманоидным роботом в симуляции с сохранением равновесия, унификация действий из разных источников в одном пространстве, повторное использования определённого разнообразия задач манипулятора для обеспечения данных предварительного обучения с низкими затратами.
Говоря о способностях модели, Дин Пэнсян почти не использует слово «обобщение» (generalization).
По его словам, «это слово бессодержательно, как сказать, что человек хорош — пусто».
Ему нужно «эмерджентное поведение» (emergence): на уровне углов суставов, например, если модель обучается на данных ходьбы и прыжков, она сама комбинирует их в новый навык — бег — во время тестирования.
Потому что только на уровне суставов части двигательных способностей могут комбинироваться в совершенно новые действия.

Что касается графика, его оценка очень трезвая.
Он предполагает, что около ста тысяч часов данных — это скорее демонстрации лабораторного уровня, реальное масштабное коммерческое значение, вероятно, появится только после миллиона часов.
Сейчас в отрасли даже не сложился единый наиболее подходящий формат данных, конкурируют такие подходы, как электромиография (EMG), экзоскелеты, motion capture, Pico телеуправление и другие.
По его мнению, три самые сложные проблемы современных гуманоидных роботов: первая — как именно следует объединять восприятие и управление, вторая — какой тип данных использовать, и только третья — сам объём данных.
Дин Пэнсян надеется, что однажды архитектура модели робота, разработанная китайской командой, также сможет широко использоваться коллегами из Северной Америки.
Мы не хотим быть последователями (Follower), мы хотим вести за собой технологическое развитие.
Вернёмся к тому картингу.
За его полную скорость на поворотах отвечает группа молодых людей, которые ещё не окончили учёбу.
Их ставка — самое сложное и передовое направление в воплощённом ИИ.
Ставка на то, что сквозное обучение (end-to-end) в конечном итоге заменит иерархическое.
Отрасль ещё очень далека от того, чтобы можно было доказать, что конечный путь уже пройден; даже сам Дин Пэнсян признаёт, что вся индустрия базовых моделей для двуногих роботов ещё по-настоящему не конвергировала.
Но передовой характер стартапа иногда заключается не в том, чтобы сделать зрелое решение быстрее, а в том, может ли он раньше коллег увидеть следующую по-настоящему важную проблему и осмелиться начать её решать, когда ответ ещё не ясен.
Эта статья взята с официального аккаунта WeChat «QbitAI» (ID: QbitAI), автор: Цяо Бучи.





