Робот учится действиям по видео: Беркли впервые реализовал полную цепочку от интернет-видео до реального развертывания на ловких руках

marsbitОпубликовано 2026-07-06Обновлено 2026-07-06

Введение

**Краткое содержание:** Исследователи из Калифорнийского университета в Беркли представили сквозной конвейер «Do as I Do», который впервые позволяет напрямую преобразовывать обычные монохромные RGB-видео с действиями человека в исполняемые траектории для антропоморфных роботизированных рук с последующим развертыванием на реальном оборудовании. **Ключевая проблема:** Существует огромный объем видеоданных (YouTube, наборы данных от первого лица), но их использование для обучения роботов затруднено. Основное препятствие — преобразование зашумленных 2D-видео в чистые 4D-траектории взаимодействия «рука-объект», пригодные для управления многопалой ловкой рукой. **Решение — двухэтапный конвейер:** 1. **Стабильная 4D-реконструкция:** Метод использует управляемую диффузию для отслеживания объекта на видео, фиксируя его форму на ключевом кадре и обеспечивая временную согласованность позы. Это превосходит предыдущие методы (например, FoundationPose) по устойчивости в реалистичных условиях. 2. **Робастное перенацеливание действий:** Улучшена оптимизационная основа (на базе SPIDER) для обработки зашумленных эталонных траекторий. Добавлены: а) совместная оптимизация позы и контакта, б) терпимость к несовершенному начальному состоянию, в) адаптивный выбор ключевых кадров. Это повысило успешность перенацеливания с 25% до 71%. **Результаты:** * Создано 500 проверенных траекторий, охватывающих 20 классов сложных действий (взбивание, перемешивание, забивание, намазывание и др.). * 10 д...

【Обзор】Используя только монохромное RGB-видео, Do as I Do преобразует повседневные человеческие действия в исполняемые траектории для Sharpa Wave, заполняя ключевое звено передачи данных от видео к роботам для антропоморфных ловких манипуляций.

Человек учится ловким действиям, как правило, начиная с «наблюдения».

Ребенок смотрит, как другие взбивают яйца, наливают воду, забивают гвозди, и постепенно учится этим действиям через подражание. Но с роботами всё иначе. Обучение современных роботов в основном основано на «действии», например, дорогостоящей телеоперации, большом количестве симуляций или сборе данных на реальных установках в тщательно подготовленных сценах.

На самом деле, данные, которые робот может «наблюдать», уже существуют. На YouTube, в наборах данных от первого лица и в сгенерированных видео содержится огромное количество материалов по взаимодействию человеческих рук с объектами. Истинное узкое место заключается не в отсутствии данных, а в возможности их преобразования: как превратить эти зашумленные монохромные RGB-видео в траектории действий, которые смогут выполнять многосоставные ловкие руки?

Команда UC Berkeley предложила сквозной процесс для решения этой проблемы. Исследовательская группа реализовала первую полную цепочку, способную генерировать траектории для реального исполнения ловкими руками из сетевых видео: сначала восстанавливается 4D-процесс взаимодействия рук и объектов из монохромного RGB-видео в реальных сценах, затем эти траектории взаимодействия перенаправляются на ловкие руки Sharpa Wave с 22 степенями свободы.

Ссылка на статью: https://arxiv.org/abs/2606.19333

Ссылка на проект: https://do-as-i-do.com/

Весь путь сгенерировал 500 проверенных траекторий для 20 типов манипулятивных действий и был развернут для 10 реальных задач на платформе с двумя манипуляторами UR3e и двумя ловкими руками Sharpa Wave с частотой управления 50 Гц.

Проблема: «Увидеть» ≠ «Сделать»

Чтобы масштабировать данные для ловких роботов, по-прежнему нельзя обойти три структурные проблемы:

Взаимодействие руки и объекта в монохромном RGB-видео по-прежнему сложно стабильно восстанавливать

Видео реальных сцен часто имеют проблемы с размытием движения, перекрытием, неоднозначностью глубины, а типы объектов также не фиксированы. Методы отслеживания, такие как FoundationPose, могут терять блокировку позы даже при небольшом размытии. А некоторые методы совместного восстановления больше зависят от лабораторной среды или могут обрабатывать только заранее заданные категории объектов.

Без стабильного 4D-восстановления взаимодействия руки и объекта человеческие видео сложно использовать в обучении роботов.

Зашумленные референсные траектории могут приводить к сбою перенаправления действий

Предыдущие методы перенаправления действий с учетом динамики, такие как SPIDER или методы отслеживания на основе обучения с подкреплением (RL), обычно предполагают, что на вход подаются чистые данные MoCap. Но на самом деле, референсные траектории, восстановленные из сетевых видео, могут быть не чистыми. Они могут иметь временную прерывистость, неправильные контактные отношения или даже содержать начальные состояния, физически невозможные.

Эти проблемы напрямую влияют на последующую оптимизацию. Эксперименты в статье показывают, что прямое использование методов оптимизации на основе выборки на таких зашумленных референсных траекториях может иметь уровень неудач до 75%.

Сама телеоперация трудно масштабируема

Телеоперация может предоставлять данные для реальных роботов, но она дорогостояща. Она зависит от профессиональных операторов, специального оборудования и требует сбора данных для каждой конкретной задачи. Только с помощью телеоперации сложно охватить все разнообразные действия даже в одном часе видео приготовления пищи человеком, не говоря уже о охвате огромного количества человеческих видео во всем интернете.

Таким образом, Do as I Do хочет ответить на вопрос: может ли робот, используя только монохромное RGB-видео, без предустановленного знания о захвате и без ограничения категорий жестких объектов, перейти от «увидеть» к «сделать»?

Решение

Процесс Do as I Do разделен на два этапа:

Этап 1: Стабилизация отслеживания объекта с помощью управляемой диффузии

SAM 3D может генерировать сетки объектов для одного кадра изображения. Но если обрабатывать каждый кадр независимо, результаты легко теряют стабильность, и трудно сохранить временную непрерывность.

Поэтому Do as I Do сначала выбирает опорный кадр и фиксирует форму объекта в этом кадре. В процессе денизинга потокового сопоставления в последующих кадрах система заставляет результат выборки позы текущего кадра приближаться к позе предыдущего кадра, что позволяет получить более непрерывную траекторию поз при сохранении единообразия формы объекта. Кроме того, система адаптивно корректирует позу на основе скорости вращения объекта, оцененной с помощью 2D-отслеживания точек. Это позволяет избежать чрезмерной жесткости отслеживания и уменьшить ошибочные перевороты.

В оценке методом сравнения с участием человека на 150 видео реальных сцен оценивающие в 67% образцов посчитали, что результаты отслеживания Do as I Do лучше, чем у FoundationPose. Во многих образцах несколько оценивающих дали согласованные суждения.

Этап 2: Робастное перенаправление действий для зашумленных референсных траекторий

Do as I Do, основываясь на фреймворке оптимизации с выборкой / MPPI SPIDER, дополнительно вводит три разработки для обработки зашумленных референсных траекторий, восстановленных из сетевых видео:

После внесения этих улучшений, Do as I Do повысил успешность перенаправления действий на зашумленных референсных траекториях реальных сцен с 25% до 71%.

Результаты экспериментов

Бенчмарк способности восстановления (SOTA)

Бенчмарк перенаправления действий

Источник данных для 500 проверенных траекторий

В итоге метод охватывает 20 типов манипулятивных действий. Эти действия не являются простыми взятием или размещением, а представляют собой более сложные операции, приближенные к повседневной жизни человека, включая размещение, взятие, протирание, намазывание, сжатие, глажение, нанесение кистью, вытирание пыли, копание, стирание, наливание, письмо, взбивание, перемешивание, протыкание, уплотнение, сверление, забивание молотком, резку и намазывание соуса.

Развертывание на реальной установке

Эти траектории не остаются только в симуляции. Исследовательская группа выбрала 10 репрезентативных действий и развернула их на платформе с двумя манипуляторами UR3e и двумя ловкими руками Sharpa Wave, выполнив их на реальной установке с частотой управления 50 Гц.

Развернутые действия охватывают объекты разной формы и различные способы захвата, включая захват тремя пальцами для письма, силовой захват, ладонный захват и параллельный разведенный захват.

Sharpa Wave имеет 22 степени свободы, размеры, близкие к человеческой руке, поэтому она больше подходит в качестве цели для переноса человеческих действий. Такие действия, как взбивание, перемешивание, забивание молотком, требуют координации обеих рук, что сложно реализовать с помощью традиционных параллельных захватов. Wave с частотой смены жестов более 4 Гц и усилием на кончиках пальцев до 50 Н выдерживает требования по силе и скорости для этих действий.

От восстановления, симуляции (MuJoCo Warp, 200 Гц) до реального развертывания исследовательская группа использовала Sharpa Wave в качестве целевой руки для перенаправления действий, перенося траектории операций из человеческих видео на этот прототип.

EgoScale также перенаправляет ключевые точки человеческой руки на эту руку, а CAIP проводит оценку и проверку на платформе Dexmate Vega+ с двумя Wave. Поскольку целевая рука ближе к человеческой, системе требуется преодолевать меньшую морфологическую разницу при переносе действий от человека к роботу.

Руководство по отбору: почему 95% сетевых видео все еще нельзя использовать напрямую

Для команд, желающих масштабно использовать данные человеческих видео, включая исследовательские группы в таких направлениях, как EgoScale, Do as I Do также дает очень практичное напоминание: видео не обязательно чем больше, тем лучше, так же важно уметь отбирать пригодные данные.

Исследовательская группа проанализировала 2000 10-секундных видеороликов из набора данных 100DOH (уже отфильтрованных по взаимодействию рук и объектов):

Результат очевиден: если не проводить предварительную обработку исходных видео, а напрямую передавать сетевые видео в обучение роботов, действительно пригодных данных может остаться лишь около одной двадцатой. Поэтому Do as I Do также суммирует ключевые моменты фильтрации данных: проверять, находятся ли рука и объект постоянно в кадре, подтверждать, не прерывается ли действие сменой кадров, исключать фрагменты со слишком большим движением камеры и идентифицировать случаи возможного сбоя SAM 3D. Для любой команды, желающей реализовать процесс «от человеческого видео до исполнения роботом» на ловких руках, этот процесс фильтрации станет неизбежным базовым этапом.

Заключение: Человеческие видео превращаются в данные для роботов

В течение долгого времени «Do as I Do» больше походило на идеал в области искусственного интеллекта (ИИ): заставить робота понимать человеческую демонстрацию и переносить эти действия на свое собственное тело. И это исследование UC Berkeley превращает эту идею в реальность: введя ссылку на видео, система может восстановить в нем процесс взаимодействия рук и объектов и преобразовать его в исполняемые траектории действий для Sharpa Wave.

В каком-то смысле самый большой в мире набор данных по действиям уже давно существует — он скрыт в видео, которые люди ежедневно снимают, загружают и делятся. Задача Do as I Do — преобразовать эти видео в траектории суставов с 22 степенями свободы, которые могут выполнять ловкие руки.

Наблюдать, восстанавливать, перенаправлять, а затем исполнять на реальном роботе.

Источники: https://do-as-i-do.com/

Статья из WeChat Official Account «Xin Zhi Yuan», редактор: LRST

Связанные с этим вопросы

QВ чём заключается основная идея исследования Do as I Do, проведённого командой UC Berkeley?

AИсследование Do as I Do предлагает сквозной процесс для преобразования повседневных действий человека, записанных на обычное однокамерное RGB-видео (например, из интернета), в исполнимые траектории движения для антропоморфной ловкой роботизированной руки Sharpa Wave. Это первая в своём роде полная цепочка от сетевого видео до развёртывания на реальном оборудовании.

QКакие три основные проблемы препятствуют масштабированию данных для ловкого манипулирования роботами, согласно статье?

AТри ключевые проблемы: 1) Сложность стабильной 4D-реконструкции взаимодействия рука-объект из зашумлённых однокамерных видео. 2) Неэффективность существующих методов перенаправления действий при работе с зашумлёнными референсными траекториями, полученными из видео. 3) Сложность масштабирования телетрансляции (управления человеком-оператором) для сбора данных из-за высокой стоимости и требований к оборудованию.

QКаковы ключевые улучшения метода Do as I Do на этапе перенаправления действий для работы с зашумлёнными траекториями?

AВ основе метода лежит фреймворк оптимизации SPIDER/MPPI, дополненный тремя элементами: 1) Регуляризация на основе контакта, которая применяет жёсткие ограничения только при реальном контакте, а не по всей траектории. 2) Использование виртуальных объектов для стабилизации начальной фазы движения. 3) Планирование с учётом трения, чтобы избежать скольжения объектов. Эти улучшения повысили успешность перенаправления с 25% до 71% на зашумлённых данных.

QКакие практические задачи смог выполнить робот с руками Sharpa Wave в реальном эксперименте?

AВ реальном эксперименте система, управляющая двумя манипуляторами UR3e с ловкими руками Sharpa Wave, успешно выполнила 10 задач с частотой управления 50 Гц. Среди задач были: написание, взбивание, перемешивание, забивание гвоздя и намазывание. Эти действия требуют различных типов захватов и координации обеих рук.

QПочему не все видеоролики из интернета можно сразу использовать для обучения роботов по методу Do as I Do?

AАнализ 2000 видеоклиптов показал, что только около 5% из них пригодны для непосредственного использования. Основные причины отсева: рука или объект выходят за кадр, резкие склейки или смена плана, чрезмерное движение камеры, а также случаи, когда модель SAM 3D не может стабильно сегментировать объект. Поэтому критически важным этапом является предварительный отбор и фильтрация видеоданных.

Похожее

Сэйлор сигнализирует: стратегия MicroStrategy ‘вернулась’ к покупке биткоинов

Микл Сэйлор из компании MicroStrategy сигнализировал в своем посте на платформе X (ранее Twitter), используя фразу "Мы вернулись", о вероятном возобновлении корпоративных закупок биткоинов. Исторически его загадочные предварительные сообщения часто предшествовали официальным объявлениям о покупках в начале недели. Если эта закономерность сохранится, то после летнего перерыва компания возобновит накопление биткоинов. За последние два месяца MicroStrategy приостановила регулярные еженедельные покупки биткоинов, сосредоточившись на укреплении баланса: стабилизации привилегированных акций, создании резерва в 5,1 млрд долларов США и формировании отдельного денежного пула в 1,59 млрд долларов за счет размещения обыкновенных акций. Эта пауза совпала со сложным рыночным периодом, когда крупнейшее в отрасли портфолио компании в биткоинах было в убытке. Однако недавний рост цены биткоина выше 80 000 долларов вернул позицию MicroStrategy в прибыльную зону. При средневзвешенной стоимости около 75 385 долларов за 840 447 биткоинов, компания впервые за несколько месяцев вновь показывает бумажную прибыль. Таким образом, заявление Сэйлора означает как операционную готовность развернуть накопленные средства в криптоактивы, так и психологический возврат к прибыльности и наступательной стратегии для крупнейшего корпоративного хранилища биткоинов.

cointelegraph23 мин. назад

Сэйлор сигнализирует: стратегия MicroStrategy ‘вернулась’ к покупке биткоинов

cointelegraph23 мин. назад

Крупнейший российский банк выступил с заявлением по поводу биткоина и эфириума

Крупнейший российский банк, Сбербанк, планирует расширить линейку кредитных продуктов, обеспеченных криптовалютами. Как сообщил зампред правления банка Анатолий Попов, помимо биткоина, в будущем в качестве залога могут приниматься Ethereum и стейблкоин Tether. В настоящее время у банка уже есть практический опыт работы с цифровыми активами. Реализация этих планов будет зависеть от развития нормативно-правовой базы в России. В частности, для использования Ethereum и Tether в качестве обеспечения потребуется разрешение Центрального банка России на их публичное обращение. После полного вступления в силу нового регулирования Сбербанк адаптирует свои существующие продукты и постепенно расширит спектр криптовалютных услуг.

cryptonews.ru1 ч. назад

Крупнейший российский банк выступил с заявлением по поводу биткоина и эфириума

cryptonews.ru1 ч. назад

Опытный аналитик заявил о наличии «скрытой медвежьей дивергенции» в биткоине!

Криптоаналитик Rekt Capital выявил на дневном графике биткоина формирование значительного технического сопротивления в районе $80 000, а также скрытую медвежью дивергенцию между ценой и индикатором RSI. Аналитик отмечает, что после падений в феврале и июне 2026 года, когда RSI опускался до уровней перепроданности, цена вновь возвращалась к $80 000. Однако в текущей ситуации наблюдается ключевое отличие: при повторном приближении к $80 000 цена формирует более низкий пик по сравнению с предыдущим максимумом, в то время как RSI, наоборот, демонстрирует более высокий пик. Такая дивергенция, когда цена делает более низкие максимумы, а RSI — более высокие, считается скрытой медвежьей и может сигнализировать об ослаблении восходящего импульса и потенциальном усилении давления продавцов. По мнению Rekt Capital, негативный технический прогноз будет действовать до тех пор, пока биткоин не преодолеет зону сопротивления около $80 000 и не сформирует новый, более высокий ценовой пик.

cryptonews.ru2 ч. назад

Опытный аналитик заявил о наличии «скрытой медвежьей дивергенции» в биткоине!

cryptonews.ru2 ч. назад

Пик бычьего цикла биткоина может быть обусловлен глобальным спросом на ETF

Основатель и генеральный директор аналитической платформы CryptoQuant Ки Ён Джу прогнозирует, что пик текущего бычьего цикла биткоина может быть обусловлен притоком институционального капитала и распространением спотовых биткоин-ETF за пределами США. Он отмечает, что после того, как американские ETF расширили регулируемый доступ к рынку, следующим драйвером роста может стать открытие аналогичных инвестиционных продуктов на международных рынках, где они пока недоступны или ограничены, как, например, в Южной Корее. Джу указывает, что пик цикла может наступить, когда доступ к биткоин-ETF станет массовым явлением для розничных инвесторов по всему миру. Параллельно с этим развивается финансовая инфраструктура, включающая токенизацию реальных активов (RWA) и рынки стейблкоинов, что обеспечивает ликвидность и новые каналы для институционального участия. Таким образом, следующая фаза роста биткоина, по его мнению, будет определяться глобальной институционализацией, улучшением доступа к инвестициям и развитием поддерживающей блокчейн-инфраструктуры.

cryptonews.ru3 ч. назад

Пик бычьего цикла биткоина может быть обусловлен глобальным спросом на ETF

cryptonews.ru3 ч. назад

«Спящие» биткоин-кошельки проснулись: за август переместили более 800 BTC

В августе 2026 года активизировались как минимум 13 долгосрочно неактивных биткоин-кошельков, бездействовавших от 12 до более чем 15 лет. С них было перемещено около 818 BTC на общую сумму свыше 60 млн долларов на момент транзакций. Крупнейший перевод составил 212 BTC (около 13,66 млн долларов) с адреса, не использовавшегося около 14 лет. Особенно высокая активность наблюдалась 22 августа, когда были перемещены 282,31 BTC, включая монеты, хранившиеся с 2011 года. Владельцы этих кошельков, купившие биткоины по цене около 12-15 долларов за монету, получили многомиллионную реализованную прибыль. Например, перемещение 40 BTC после более чем 14 лет бездействия принесло прибыль около 3,16 млн долларов. Данная активность последовала за аналогичным случаем в марте, когда китом было перемещено 2100 BTC после почти 14 лет простоя.

cryptonews.ru3 ч. назад

«Спящие» биткоин-кошельки проснулись: за август переместили более 800 BTC

cryptonews.ru3 ч. назад

Торговля

Спот
活动图片