Исследование команды из Университета Цинхуа, опубликованное в топ-журнале Science Robotics: за 22 года робота наконец научили играть в футбол

marsbitОпубликовано 2026-08-24Обновлено 2026-08-24

Введение

В августе 2026 года исследовательская группа профессора Чжао Минго из Университета Цинхуа совместно с компаниями ByteDance Seed и Китайским сельскохозяйственным университетом опубликовала статью в ведущем международном журнале Science Robotics. В работе представлена система обучения реактивным футбольным навыкам для человекоподобных роботов на основе зрения. Робот, используя только бортовую камеру, может в динамической среде находить мяч, преследовать его, корректировать походку и выполнять удары в разных направлениях. Исследование основано на 22-летней работе команды «Огненный бог» (火神) Цинхуа, участвующей в RoboCup. Задача состояла в решении проблемы интеграции восприятия, принятия решений и управления движением в условиях реальных помех и задержек. Команда предложила сквозную архитектуру обучения с подкреплением, объединяющую восприятие и управление. Ключевые элементы включают виртуальную систему восприятия, моделирующую реальные шумы и задержки, кодировщик-декодировщик для оценки состояния при временном исчезновении мяча из поля зрения, а также априорные двигательные модели для естественности движений. В симуляции и на реальном роботе (платформа Accelerated Evolution) система продемонстрировала высокую эффективность: успешность ударов с передней позиции составила 80-90%, время реакции сократилось до 64% по сравнению с традиционными системами, а робот научился адаптировать походку и генерировать сложные манёвры, такие как поворотный удар. Эта работа показывает прогресс в...

Топовые конференции могут проводиться каждый год, но попасть в этот журнал может не каждая лаборатория.

«Science Robotics» — признанный ведущий международный журнал в области робототехники, издаваемый под эгидой журнала «Science», его импакт-фактор стабильно занимает первое место в робототехнике. Публикация результатов в этом журнале означает, что исследование прошло строжайшее рецензирование экспертами в этой области и представляет самые передовые и прорывные технологические достижения на данный момент.

В августе этого года «Science Robotics» выпустил специальный тематический выпуск, посвященный человекоподобным роботам, объединивший последние исследовательские достижения в этой области со всего мира. Этот специальный выпуск включает всего три платформы компаний-разработчиков человекоподобных роботов со всего мира — Accelerated Evolution, Unitree, Boston Dynamics, что представляет собой передовой мировой ряд исследований в области человекоподобной робототехники.

В этом специальном выпуске команда профессора Чжао Минго из факультета автоматизации Университета Цинхуа совместно с ByteDance Seed и Китайским сельскохозяйственным университетом опубликовала статью под названием «Learning Vision-Driven Reactive Soccer Skills for Humanoid Robots» (Изучение визуально-управляемых реактивных футбольных навыков для человекоподобных роботов). В статье представлена обучающая структура для реактивных футбольных навыков, управляемых зрением, которая позволяет человекоподобному роботу, полагаясь только на бортовое зрение, в динамической среде непрерывно выполнять задачи: поиск мяча, преследование мяча, корректировка походки и удары в различных направлениях. Платформой для валидации в реальных условиях, на которой базируется это исследование, является человекоподобный робот от Accelerated Evolution.

Ссылка на статью: https://www.science.org/doi/10.1126/scirobotics.aed1152

Домашняя страница проекта: https://humanoid-kick.github.io/

Эта работа не ограничивается одним действием или отдельным показателем, она объединяет визуальное восприятие, оценку состояния, двуногую локомоцию и физический контакт в реальной футбольной задаче, а также проходит проверку на поле RoboCup, в постоянно меняющейся среде и в условиях реального противоборства.

Технологическая эстафета длиной в двадцать два года

В 2004 году Чжао Минго со студентами основал футбольную команду роботов «Хоушэнь» в Цинхуа. В следующем году они отправились на RoboCup с самостоятельно разработанными роботами. Первые роботы были высотой около 50 см, двигались медленно, и во время матчей требовался персонал для страховки от падений. В последующие более чем двадцать лет команда «Хоушэнь» участвовала почти каждый год, роботы постепенно «выросли» до метра и выше, научились самостоятельно вставать, быстро бегать и сильно бить по мячу.

Футбольное поле также стало долгосрочным испытательным полигоном для команды по проверке зрения, принятия решений, управления движением и общей надежности всей системы. Любая задержка в миллисекунды при визуальном распознавании, смещение точки опоры на сантиметры, направление, в котором робот с большей вероятностью промахивается, — все это непосредственно проявляется в реальном противоборстве. Команда возвращает проблемы в лабораторию, корректирует алгоритмы, и на следующем матче снова проводит валидацию. Этот цикл продолжался более двадцати лет.

Чжао Минго долгое время занимается исследованиями в области нейроморфных вычислений и управления роботами. Он участвовал в разработке нейроморфного чипа «Тяньцзи» и исследованиях беспилотного велосипеда, которые были опубликованы на обложке журнала «Nature» и вошли в десятку главных научных достижений Китая 2019 года. От нейроморфных вычислений до роботизированного футбола его всегда интересовало, как восприятие, оценка и действие могут непрерывно выполняться в одной системе.

С течением времени состав команды «Хоушэнь» обновлялся. Чэн Хао, основатель Accelerated Evolution, был третьим капитаном команды «Хоушэнь». После окончания Цинхуа, пройдя через испытания интернет-предпринимательства и накопив опыт, работая вице-президентом по продукту Feishu в ByteDance, в 2023 году этот не забывающий о роботах капитан решил начать заново, основав «Accelerated Evolution». Многие члены, которые когда-то бок о бок сражались в команде «Хоушэнь», также присоединились, и в качестве стартап-команды снова начали совместное путешествие в мир роботов. Первый автор статьи, Ван Юйши, принадлежит к новому поколению команды «Хоушэнь».

С основания команды «Хоушэнь» в 2004 году до публикации статьи в международном топ-журнале в 2026 году — это технологическая эстафета длиной в двадцать два года.

Научить робота видеть и реагировать в условиях шума

Эта статья пытается решить проблему, которая годами мучила научное сообщество: как человекоподобному роботу в реальной среде, полной шума, задержек и помех, достичь реакции «увидел — среагировал».

Когда человек бьет по мячу, зрение и действие происходят почти одновременно. Глаза следят за мячом, мозг оценивает расстояние и направление, тело постоянно корректирует центр тяжести и точку опоры. Даже если мяч ненадолго скрывается из виду, человек может предсказать, где он появится дальше, исходя из предыдущей траектории движения.

Роботу необходимо выполнить этот процесс с помощью камер, алгоритмов и управления суставами, но сложность гораздо выше. Изображение с камеры может размываться из-за резких движений, обнаружение цели сопровождается шумом и задержками, мяч может выйти из поля зрения или быть заблокирован. При этом двуногий робот должен еще сохранять равновесие и в течение десятков миллисекунд определять положение следующей точки опоры. Восприятие, локализация, принятие решений, движение и физический контакт сжимаются в одну непрерывную задачу; если любой этап замедлится, робот может промахнуться или упасть.

Традиционные подходы обычно разделяют этот процесс на несколько модулей. Система зрения распознает мяч и оценивает его положение, модуль принятия решений выбирает действие, контроллер движения затем управляет роботом для его выполнения. Этот метод удобен для отладки, но также легко приводит к каскадной передаче погрешностей и задержек, и стратегии, обученные в идеальной симуляции, в реальном мире могут демонстрировать заметное снижение производительности из-за освещения, шума, помех.

Команда Чжао Минго предложила единую структуру обучения с подкреплением «восприятие-движение». Ключевая идея заключается в сквозном обучении визуального восприятия и управления движением под одной оптимизационной целью.

Обзор системы управления роботом Accelerated Evolution, управляемой зрением.

Исследовательская группа сначала создала систему виртуального восприятия.

Они заставили реального робота наблюдать за мячом с разных расстояний и ракурсов, накопив около часа данных, затем сравнили их с реальными положениями, записанными системой захвата движения, получив таким образом характеристики восприятия, такие как шум позиционирования, частота успешного обнаружения, частота обновления и задержка.

Эти характеристики затем были перенесены в симуляцию. Чем дальше мяч, тем больше шум позиционирования; поле зрения камеры меняется в зависимости от позы головы робота. Даже если мяч находится в поле зрения, обнаружение может дать сбой из-за размытия движения и других причин. Система зрения обновляется с частотой около 25 Гц, средняя задержка составляет около 116 миллисекунд.

После кратковременного прерывания зрения контроллеру все еще необходимо продолжать оценивать положение и тенденцию движения мяча на основе предыдущей информации. Для этого в статье была разработана архитектура «кодировщик-декодировщик».

Стратегия считывает исторические наблюдения за последние 50 кадров, примерно за одну секунду, затем сжимает эту информацию в 64-мерное скрытое состояние. На этапе обучения декодировщик пытается восстановить реальное положение мяча и параметры динамики робота из скрытого состояния. Эта вспомогательная задача помогает стратегии выполнять шумоподавление зрения и позволяет ей продолжать оценивать положение цели после кратковременного исчезновения мяча.

Актор, отвечающий за вывод действий, может использовать только часть наблюдений, доступных реальному роботу, тогда как Критик на этапе обучения имеет доступ к полному состоянию среды симуляции, предоставляя дополнительную информацию для оптимизации стратегии. Декодировщик и Критик удаляются после развертывания на реальном аппарате.

Чтобы сделать движения более естественными, команда также внедрила априорные знания о движении (AMP) с использованием состязательного обучения. Данные для обучения включали около 76 секунд данных движения человека при ходьбе во всех направлениях и 30 секунд данных удара внутренней стороной стопы. Дискриминатор отвечает за оценку того, насколько действия робота близки к человеческим демонстрациям, а стратегия обучения с подкреплением продолжает оптимизироваться вокруг преследования мяча и забивания голов.

Ограничение зеркальной симметрии дополнительно помогло роботу освоить удары обеими ногами, избегая сходимости к ударам одной стороной. В конечном итоге поиск мяча, преследование, корректировка точки опоры и удар были объединены в одну стратегию, контроллер с частотой 50 Гц выдает команды позиционирования суставов.

Пять типов паттернов движения, сформированных стратегией, включая удары левой и правой ногой, движение прямо и повороты влево-вправо. Цветные траектории — действия, сгенерированные стратегией, серые точки — эталонные человеческие действия.

В процессе обучения также возникло множество автономных поведений.

Когда мяч приближается к краю поля зрения, робот активно поворачивает голову и корпус, чтобы вернуть мяч в поле зрения. Если мяч не найден у края поля, он обычно сначала поворачивается к центру поля, а затем расширяет область поиска.

Походка также меняется в зависимости от расстояния до мяча. На большом расстоянии робот использует более медленную частоту шагов, примерно 0.7–0.8 секунды на цикл походки, чтобы поддерживать стабильное наблюдение; приблизившись к мячу, цикл сокращается до 0.3–0.4 секунды, с помощью более коротких и быстрых шагов для точной настройки точки опоры.

Когда ворота находятся позади, стратегия даже генерирует вращательный удар крюком: робот поворачивается вокруг опорной ноги, а другая нога сбоку зацепляет мяч в сторону ворот, экономя время на перестановку.

Эти изменения в конечном итоге отразились и на экспериментальных данных.

В течение секунды перед ударом погрешность положения мяча в исходных визуальных наблюдениях составляла 0.344 метра, после оценки внутреннего состояния стратегии погрешность снизилась до 0.186 метра, что примерно на 46% меньше. В симуляции, когда визуальное обнаружение прерывалось на 0.3 секунды, успешность касания мяча роботом все еще превышала 90%, а процент голов — 50%. При стационарном мяче обученной стратегии обычно требуется около 1.5 секунды от старта до касания, тогда как традиционной системе, основанной на правилах, требуется около 2–5 секунд, максимальное снижение времени достигло 64%.

Сравнение обучаемой стратегии с современными стратегиями на основе правил в RoboCup. (A, B) Время, необходимое роботу для перехода от старта к касанию мяча под разными углами подхода, и максимальная угловая скорость в этом процессе. Робот изначально находится в состоянии покоя на расстоянии 1.5 метра от мяча. Затененная область обозначает стандартное отклонение, каждый направление тестировался 5 раз. (C, D) Типичные действия при ударе робота, управляемого стратегией на основе правил, вперед (0°) и назад (180°). (E, F) Обучаемая стратегия позволяет объединить приближение к мячу и удар в одно непрерывное действие.

В тестах на реальном аппарате успешность робота на позициях переднего плана составила 80–90%, на заднем плане — 60–70%, в процессе тестирования падений не было. При катящемся мяче, когда скорость мяча была ниже 0.5 метра в секунду, стратегия сохраняла успешность свыше 50%, тесты на реальном аппарате показали аналогичную тенденцию.

Подпись к рисунку: Реактивный удар по катящемуся мячу.

(A) Когда мяч катится поперек, робот быстро смещается в сторону и выполняет удар. Подраздел (i) показывает траекторию движения робота и мяча, а также соответствующий паттерн контакта ног с землей, подраздел (ii) показывает непрерывные действия робота.

(B) Когда мяч катится за робота, робот быстро разворачивается и бьет. (i) и (ii) показывают то же, что и в (A).

(C) Процент успешных ударов, процент голов и время до касания при разных скоростях мяча. Результаты симуляции представлены гистограммами, каждая скорость тестировалась 8192 раза; результаты на реальном аппарате отмечены треугольниками, каждая скорость тестировалась 10 раз. Погрешности показывают стандартное отклонение результатов тестов в симуляции.

Эта стратегия также была интегрирована как модуль двигательных навыков в полную соревновательную систему команды «Хоушэнь» из Цинхуа. В 2025 году команда «Хоушэнь» выиграла чемпионат в лиге человекоподобных роботов взрослой группы RoboCup и на Всемирных играх человекоподобных роботов, забив в сумме на двух турнирах 76 голов и пропустив всего 11. В 2026 году команда успешно защитила титул на соревнованиях RoboCup Large Size.

На пути к платформам воплощенного интеллекта следующего поколения

Возможность прямого развертывания обученной стратегии из симуляции на реальный аппарат зависит не только от алгоритма. Согласованность отклика суставов, стабильность цикла управления, способность сенсоров и вычислительных модулей выдавать результаты вовремя — все это влияет на конечную производительность. Любая погрешность на низком уровне может усилиться при высокоскоростном движении.

Эксперименты на реальном аппарате в статье проводились на платформе человекоподобного робота от Accelerated Evolution. В экспериментах не было специальных модификаций базовой платформы, информация о мяче поступала от бортовой камеры на голове, восприятие и управление выполнялись на бортовом вычислительном модуле. Это показывает, что серийно производимые отечественные человекоподобные роботы уже могут служить основой для передовых мировых исследований воплощенного интеллекта, позволяя исследователям сосредоточиться в основном на алгоритмах, а затем развертывать результаты обучения на реальном аппаратном обеспечении.

Таким образом, отношения между Accelerated Evolution и командой «Хоушэнь» расширились от преемственности кадров до технологической платформы.

В июле этого года Accelerated Evolution выпустила новое флагманское поколение платформы Booster T2, профессиональная версия оснащена чипом NVIDIA Thor, производительность на стороне устройства достигает 2070 TFLOPS, что делает ее платформой с наиболее передовой вычислительной мощностью в области двуногих человекоподобных роботов на данный момент. Сопутствующая среда Booster Studio объединяет симуляционное обучение, разработку алгоритмов и развертывание на реальном аппарате в одну среду разработки.

19 августа Booster T2 был официально представлен на Всемирной конференции по робототехнике, продемонстрировав дебют высокодинамичных движений. Три дня спустя 80 единиц Booster T2 на церемонии открытия Робототехнических игр выполнили бесцентровую автономную координацию, написав на земле BEIJING, эмблему Игр и значки трех дисциплин — без пультов дистанционного управления, без команд, 80 независимо принимающих решения «мозгов» достигли координации в один момент. Суммарная вычислительная мощность 80 роботов составила около 170 000 TFLOPS, образуя идущий вычислительный кластер.

Завершенный цикл восприятия на одном аппарате, координация и изменение построения множества аппаратов — все это зависит от одного и того же набора базовых возможностей: стабильная базовая платформа, вычисления в реальном времени на стороне устройства, точное управление движением. Границы возможностей продолжают расширяться по мере итераций платформы.

От ранних роботов высотой 50 см, которым нужна была поддержка, чтобы стоять, до сегодняшнего Booster T2, который автономно играет в футбол на поле в тысячу квадратных метров и выстраивается в колонны для надписей на церемонии открытия — накопленные за двадцать два года достижения теперь проявляются во все большем масштабе, а человекоподобные роботы постепенно переходят от «умения двигаться» к «пригодности к использованию», от действий одного аппарата к групповому взаимодействию.

Ссылка для справки: https://www.science.org/journal/scirobotics

Статья из WeChat Official Account «Машины, почти как люди» (ID:almosthuman2014), редактор: Ян Вэнь

Связанные с этим вопросы

QКакое главное достижение представлено в статье команды профессора Чжао Минго из Университета Цинхуа, опубликованной в «Science Robotics»?

AКоманда профессора Чжао Минго представила в статье структуру обучения зрительно-управляемым реактивным футбольным навыкам для гуманоидных роботов. Эта система позволяет роботу только с помощью бортового зрения в динамичной среде выполнять последовательные задачи: находить мяч, преследовать его, корректировать походку и бить по воротам в разных направлениях.

QКакой подход использовала команда исследователей для решения проблемы шума и задержек в реальной среде, и в чём его ключевая особенность?

AКоманда предложила унифицированную структуру обучения с подкреплением «восприятие-движение». Ключевая особенность заключается в сквозном обучении, при котором зрительное восприятие и двигательный контроль оптимизируются в рамках единой цели, что позволяет роботу эффективно реагировать в условиях шума, задержек и кратковременных помех обзора.

QКакую роль сыграла команда «Хошэнь» (Огненный бог) Университета Цинхуа в этом 22-летнем исследовании?

AКоманда «Хошэнь», основанная профессором Чжао Минго в 2004 году, стала долгосрочной экспериментальной площадкой для этого исследования. Участвуя в RoboCup, команда на протяжении более двух десятилетий последовательно проверяла и совершенствовала зрение, принятие решений, управление движением и надежность целой системы роботов, создавая основу для достижений, представленных в статье.

QНа каком робототехническом платформе были проведены реальные эксперименты, описанные в статье, и что это говорит о её возможностях?

AЭксперименты на реальном роботе были проведены на гуманоидной робототехнической платформе компании «Ускоряющая эволюция» (加速进化). Это демонстрирует, что серийно производимые в Китае гуманоидные роботы уже способны поддерживать передовые мировые исследования в области воплощенного интеллекта, позволяя ученым сосредоточиться на алгоритмах, а затем развертывать результаты обучения на реальном оборудовании.

QКакие улучшения в производительности были достигнуты с помощью нового подхода по сравнению с традиционными системами, основанными на правилах?

AНовый подход продемонстрировал значительные улучшения: время от старта до касания мяча сократилось на 64% по сравнению с традиционными системами на основе правил (примерно 1,5 секунды против 2-5 секунд). Кроме того, алгоритм снизил погрешность в определении местоположения мяча примерно на 46% (с 0,344 м до 0,186 м), а также обеспечил высокий процент успешных ударов (80-90% на переднем поле, 60-70% на заднем) без падений.

Похожее

Инвестиционная компания потеряла $2 млн после атаки криптопылью

Инвестиционная компания Bofur Capital потеряла 2 миллиона долларов в USDC из-за атаки "отравления адресов" (address poisoning). Мошенники заранее, за 20 часов до крупной транзакции компании, отправили на её кошелёк микроскопический перевод в 0.0002 USDC с адреса, который почти полностью совпадал по начальным и конечным символам с адресом законного контрагента компании. Предположительно, оператор кошелька скопировал из истории транзакций поддельный адрес и отправил на него 2 млн USDC, которые злоумышленники оперативно конвертировали в DAI. После обновления Fusaka в сети Ethereum количество подобных атак резко возросло. За последние три месяца число "криптопылевых" переводов USDT увеличилось на 612%. Исследование Etherscan за период до обновления (июль 2022 — июнь 2024) выявило около 17 миллионов попыток "отравления", от которых пострадали не менее 1.3 миллиона пользователей на общую сумму $79.3 млн. В сетях с низкими комиссиями, таких как BSC, подобные атаки происходят ещё чаще.

cryptonews.ru14 мин. назад

Инвестиционная компания потеряла $2 млн после атаки криптопылью

cryptonews.ru14 мин. назад

Besu устраняет уязвимости в 5 узлах: что нужно знать операторам

Разработчики клиента Ethereum Besu устранили пять уязвимостей, обнаруженных компанией Certik. Обновление безопасности версии 26.7.1 было выпущено 27 июля, а подробные уведомления опубликованы 14 августа. Такая задержка была преднамеренной, чтобы дать операторам узлов время на обновление до того, как детали уязвимостей станут общедоступными. Уязвимости, связанные с обработкой объявлений о блоках, буферизацией предложений консенсуса, подписками WebSocket и фильтрами JSON-RPC, могли привести к исчерпанию ресурсов узла и нарушению консенсуса. Они были выявлены в ходе самостоятельного исследования Certik с использованием методологии "Chain Scan". Чанг из Certik отметил, что, хотя экосистема движется к более формализованному тестированию, охват все еще неравномерен. Существующие методы часто недостаточно проверяют такие аспекты, как исчерпание ресурсов или асинхронные состояния гонки. Поэтому независимые исследования остаются критически важными для безопасности.

cryptonews.ru16 мин. назад

Besu устраняет уязвимости в 5 узлах: что нужно знать операторам

cryptonews.ru16 мин. назад

Взлом Term Finance: атакующий вывел $8,5 млн через уязвимость системы управления

Децентрализованный кредитный протокол Term Finance потерял $8,5 млн из-за эксплойта в механизме управления, без взлома смарт-контрактов. Злоумышленник, внеся лишь 0,5 ETH (0,017% доли), получил 90,66% голосов в системе Meta Vaults, поскольку большинство вкладчиков не конвертировало свои токены в голосующие. Воспользовавшись низким кворумом в 5%, атакующий создал и провел легитимное предложение, которое отключило семидневную задержку на вывод и перенаправило средства на его адрес. Предложение около шести суток было открыто в блокчейне, но не вызвало реакции. 23 августа 2026 года было выведено 2843 ETH и 1,68 млн USDC. Команда Term Labs отозвала роли DAO и навсегда закрыла Meta Vaults, оставив базовый протокол нетронутым. Инцидент высветил системные риски DeFi-управления при низкой активности пользователей и отделении права голоса от экономического участия.

cryptonews.ru16 мин. назад

Взлом Term Finance: атакующий вывел $8,5 млн через уязвимость системы управления

cryptonews.ru16 мин. назад

Торговля

Спот
活动图片