Впервые: претренированная VLA для ловкого манипулирования на чисто человеческих видео успешно развертывается после тонкой настройки на небольшом количестве данных
Новаторский фреймворк VITRA от Microsoft Research Asia и Университета Цинхуа совершил прорыв в обучении роботов для ловких манипуляций. Ключевая инновация — полностью автоматизированный конвейер для преобразования неразмеченных видеозаписей реальных человеческих действий в структурированные данные, пригодные для обучения моделей «зрение-язык-действие» (VLA). Система извлекает 3D-траектории движения руки, сегментирует видео на атомарные действия и генерирует текстовые инструкции с помощью GPT-4.
На созданном масштабном наборе данных (1 млн сегментов, 26 млн кадров) была предобучена VLA-модель. Она демонстрирует впечатляющую способность к нулевому обучению (zero-shot), точно предсказывая движения руки в незнакомых условиях. Для развёртывания на реальном роботе (например, с манипулятором StarMove XHAND1) модели требуется лишь небольшая тонкая настройка на ограниченном наборе данных (~1.2 тыс. демонстраций), после чего она успешно выполняет сложные задачи: захват, перемещение, высыпание, подметание, показывая высокую степень обобщения для новых объектов и окружения.
Исследование подтверждает закон масштабирования: производительность модели стабильно растёт с увеличением объёма данных для предобучения. Этот подход открывает путь к созданию более универсальных и адаптивных роботов, способных учиться на обширных и разнообразных видеозаписях человеческой деятельности.
marsbit06/08 08:55