Робот учится действиям по видео: Беркли впервые реализовал полную цепочку от интернет-видео до реального развертывания на ловких руках
**Краткое содержание:** Исследователи из Калифорнийского университета в Беркли представили сквозной конвейер «Do as I Do», который впервые позволяет напрямую преобразовывать обычные монохромные RGB-видео с действиями человека в исполняемые траектории для антропоморфных роботизированных рук с последующим развертыванием на реальном оборудовании.
**Ключевая проблема:** Существует огромный объем видеоданных (YouTube, наборы данных от первого лица), но их использование для обучения роботов затруднено. Основное препятствие — преобразование зашумленных 2D-видео в чистые 4D-траектории взаимодействия «рука-объект», пригодные для управления многопалой ловкой рукой.
**Решение — двухэтапный конвейер:**
1. **Стабильная 4D-реконструкция:** Метод использует управляемую диффузию для отслеживания объекта на видео, фиксируя его форму на ключевом кадре и обеспечивая временную согласованность позы. Это превосходит предыдущие методы (например, FoundationPose) по устойчивости в реалистичных условиях.
2. **Робастное перенацеливание действий:** Улучшена оптимизационная основа (на базе SPIDER) для обработки зашумленных эталонных траекторий. Добавлены: а) совместная оптимизация позы и контакта, б) терпимость к несовершенному начальному состоянию, в) адаптивный выбор ключевых кадров. Это повысило успешность перенацеливания с 25% до 71%.
**Результаты:**
* Создано 500 проверенных траекторий, охватывающих 20 классов сложных действий (взбивание, перемешивание, забивание, намазывание и др.).
* 10 действий были успешно развернуты в реальности на платформе с двумя манипуляторами UR3e и двумя ловкими руками Sharpa Wave (22 степени свободы) с частотой управления 50 Гц.
* Определены критерии фильтрации сетевых видео: только ~5% необработанных роликов пригодны для использования из-за проблем с кадрированием, движением камеры и т.д.
**Значение:** Работа впервые замыкает цепочку от случайного сетевого видео до физического выполнения действия роботом, открывая путь к масштабированию обучения роботов за счет использования огромных существующих видеоархивов человеческих действий.
marsbit07/06 07:20