Реализация ловкости манипуляции на уровне человека долгое время оставалась одной из ключевых задач в области робототехники.
Хотя многозвенные ловкие руки на аппаратном уровне обладают потенциалом, схожим с человеческим, из-за высокой стоимости получения высококачественных данных о действиях роботов существующие модели "Видео-Язык-Действие" (VLA) значительно отстают от больших языковых моделей (LLM) и визуально-языковых моделей (VLM) по масштабу и разнообразию данных, что затрудняет их применение для сложных задач в реальном мире.
Новое исследование, проведенное совместно Microsoft Research Asia (MSRA) и Университетом Цинхуа в статье "Масштабируемое предварительное обучение модели Видео-Язык-Действие для роботизированного манипулирования с использованием видеозаписей реальной человеческой активности", предлагает инновационную архитектуру предварительного обучения VITRA для решения этой ключевой проблемы.

Основной вклад исследования заключается в предложении полностью автоматизированного решения, которое преобразует огромное количество немаркированных видеозаписей реальной человеческой активности в данные, полностью совместимые с форматом существующих данных для обучения V-L-A роботов.
Извлекая траектории 3D-движения рук из видео, выполняя сегментацию на элементарные действия и автоматически генерируя языковые инструкции, исследовательская группа создала сверхкрупномасштабный набор данных V-L-A для рук, содержащий 1 миллион сегментов и 26 миллионов кадров.
После предварительного обучения исключительно на данных человеческих видео модель продемонстрировала мощную способность предсказывать движения рук в режиме "zero-shot" в полностью неизвестной реальной среде.
После тонкой настройки на небольшом количестве реальных данных роботов модель смогла достичь высокого процента успеха в выполнении ловких операций на реальном роботе, продемонстрировав исключительную способность к обобщению для новых объектов и сред.
Далее приведены более подробные сведения.
Создание конвейера преобразования от человеческого видео к данным для робота
Ключевая проблема исследования заключается в том, как преодолеть огромный разрыв между неструктурированным человеческим видео и структурированными данными роботов, чтобы извлечь высококачественные метки действий и языковые инструкции, пригодные для предварительного обучения моделей VLA.
В исследовании построена целостная система из трех ключевых технологий, реализующая бесшовное преобразование от исходного видео к данным V-L-A.

△
3D-аннотация движений: точное восстановление траекторий руки и камеры
Восстановление точного 3D-движения руки из монохромного, некалиброванного видео с потенциально движущейся камеры является чрезвычайно сложной задачей.
В исследовании предложен метод отслеживания позы монохромной камеры и руки на основе новейших технологий 3D-компьютерного зрения:
Сначала определяется состояние камеры по оптическому потоку фона и оцениваются внутренние параметры камеры.
Затем с помощью SLAM на основе глубинного зрения и модели оценки глубины отслеживается поза камеры, а модель реконструкции руки используется для извлечения 3D-позы руки в пространстве камеры для каждого кадра (включая 6D-позу запястья и углы всех суставов).
Наконец, эта информация объединяется для получения 3D-траектории движения руки в мировом пространстве.
Этот метод не только обеспечивает высокоточные метки действий, но и закладывает основу для последующей сегментации действий и аннотации инструкций.
Атомарная сегментация действий: естественное разделение на основе локальных минимумов скорости
Существующие данные V-L-A для роботов обычно состоят из простых, коротких элементарных задач. Как точно сегментировать эти атомарные действия из длинных видео является сложной задачей.
Исследовательская группа черпала вдохновение в естественном ритме человеческих движений, предложив простой и эффективный алгоритм сегментации: разделение на основе локальных минимумов скорости движения руки в 3D-пространстве.
Во время перехода между действиями скорость движения человеческой руки обычно меняется, и локальные минимумы скорости часто указывают на смену действия.
Обнаруживая локальные минимумы скорости 3D-траектории запястья в мировом пространстве, этот метод может эффективно разделять длинные видео на короткие сегменты, содержащие одно элементарное действие, без необходимости какой-либо дополнительной ручной аннотации или выводов моделей.


Аннотация инструкций: точное описание действий на основе 3D-траектории
Чтобы генерировать точные языковые инструкции для сегментированных видеоклипов, исследовательская группа удачно объединила визуально-языковую модель (VLM) и 3D-траекторию руки.
Для каждого видеоклипа система равномерно выбирает 8 кадров изображения и проецирует/накладывает 3D-траекторию ладони на изображение.
Затем эти изображения с выделенной траекторией передаются в GPT-4 с подсказкой, чтобы он, учитывая содержание изображения и информацию о траектории, описал действие указанной руки в повелительном наклонении.
Эксперименты показали, что предоставление атомарных видеоклипов с наложенной 3D-траекторией руки значительно повышает точность генерации описаний действий GPT.
Реализация мощного zero-shot предсказания и обобщения в реальном мире
На основе автоматически созданного сверхкрупномасштабного набора данных V-L-A для человеческих рук исследовательская группа разработала и обучила модель VLA, специально предназначенную для ловкого манипулирования.

△
1. Архитектура модели: сочетание VLM и эксперта по диффузии действий
Эта модель VLA состоит из базовой сети VLM (PaliGemma-2) и эксперта по диффузии действий (Diffusion Transformer, DiT).
VLM принимает визуальные наблюдения, языковую инструкцию и информацию об угле обзора камеры (FoV), выдавая "когнитивный признак" (Cognition Feature).
Эксперт по диффузии действий принимает этот когнитивный признак, текущее состояние руки и зашумленный блок действий с маской, итеративно удаляя шум для предсказания будущей последовательности действий руки.
Для обработки быстрых движений человеческой руки и адаптации к данным коротких клипов модель использует механизм причинного внимания (Causal Attention) для удаления шума в действиях, гарантируя, что предсказание каждого шага действия зависит только от предыдущих действий, что эффективно устраняет негативные эффекты от нулевого заполнения (zero-padding).
2. Zero-shot предсказание движений руки: демонстрация удивительных способностей в неизвестных средах
В полностью неизвестных условиях реальной жизни предобученная модель продемонстрировала мощную способность zero-shot предсказания движений руки.

△
При оценке на задачах захвата и общего предсказания действий эта модель значительно превзошла модели, обученные на данных, собранных в лабораторных условиях (например, EgoDex), а также модели, обученные на исходных данных с человеческой аннотацией.
Это ясно доказывает, что предварительное обучение на огромных, разнообразных видеозаписях реальной жизни может значительно улучшить способность модели к обобщению для сложных сред и неизвестных объектов.
3. Ловкое манипулирование на реальном роботе: эффективное развертывание после тонкой настройки на небольшом количестве данных
Для развертывания на реальном роботе исследовательская группа выровняла пространство действий человеческой руки с пространством действий ловкой руки робота (например, робот Realman, оснащенный XHAND1 от Starhand).

△
Всего лишь тонкая настройка предобученной модели на небольшом количестве (около 1,2 тыс.) реальных данных телеробототехники позволила выполнять в реальном мире различные задачи ловкого манипулирования, включая захват, размещение, выливание и подметание.
Результаты экспериментов показали, что по сравнению с моделями, не прошедшими предварительное обучение на данных VLA человека, или моделями, предварительно обученными на других наборах данных (таких как OXE, EgoDex), данный метод достиг значительного улучшения в проценте успешного выполнения задач, особенно продемонстрировав выдающуюся устойчивость при встрече с невиданными ранее объектами и фоном.
Аппаратная основа для развертывания VITRA в реальном мире
То, что фреймворк VITRA может демонстрировать впечатляющую способность к обобщению на реальном роботе, помимо инноваций на алгоритмическом уровне, в значительной степени обусловлено мощной поддержкой базового оборудования —
первой в Китае полностью прямой приводной пятерной ловкой руки XHAND1 от Starhand, разработанной самостоятельно.
Фреймворк и аппаратные характеристики XHAND1 образуют идеальный синергетический эффект "программно-аппаратной интеграции", демонстрируя незаменимые преимущества для практического применения.

△
Высокоточный URDF и бесшовное сопряжение с пространством действий человеческой руки
Ключевым прорывом фреймворка VITRA является выравнивание пространства действий человеческой руки с пространством действий ловкой руки робота.

Официальная поставка XHAND1 включает модель URDF чрезвычайно высокой точности, которая не только точно описывает параметры движения и динамики, но и идеально отражает пространственное распределение суставов человеческой руки.
Такая поддержка модели на уровне "цифрового двойника" позволяет VITRA на этапе тонкой настройки точно отображать углы суставов человека на соответствующие суставы XHAND1, что значительно сокращает разрыв между человеческим видео и реальным оборудованием и обеспечивает эффективное развертывание предобученных стратегий на реальном оборудовании.
Полностью прямой привод и высокая частота отклика: идеальное выполнение сложных ловких операций
При выполнении сложных задач ловкого манипулирования, таких как выливание и подметание, роботу необходима исключительно высокая способность к динамическому отклику.
Архитектура полностью прямого привода (Direct-Drive), используемая в XHAND1, обеспечивает для этого алгоритма идеальную аппаратную основу.
Полностью прямой привод устраняет огромное трение, запаздывание и нелинейные помехи, присущие традиционным редукторам, обеспечивая сверхчувствительную способность к динамическому отклику. Это позволяет XHAND1 мгновенно и точно выполнять команды действий, выдаваемые моделью VITRA, безопасно манипулируя различными неизвестными объектами.
Богатый набор датчиков: резервирование пространства для будущего мультимодального восприятия
Хотя текущая модель VITRA в основном полагается на визуальный ввод, богатый набор датчиков (например, тактильные массивы высокого разрешения), установленный на XHAND1, оставляет широкое пространство для будущего мультимодального восприятия.
В сочетании с мощными аппаратными возможностями восприятия XHAND1 будущие модели VLA смогут дополнительно интегрировать тактильную обратную связь для обработки более тонких и сложных задач "походки пальцев" (Finger Gaits).
Закон масштабирования данных
Исследование также глубоко изучило влияние масштаба данных предварительного обучения на производительность модели.

△
Эксперименты показали, что с увеличением объема данных предварительного обучения ошибка модели в задачах zero-shot предсказания движений руки устойчиво снижается, а процент успеха в задачах манипулирования реальным роботом продолжает расти.
Такое явное поведение масштабирования (Scaling Behavior) указывает на то, что дальнейшее увеличение масштаба данных человеческих видео может непрерывно повышать производительность моделей VLA.
Это достижение знаменует собой ключевой прорыв в использовании неструктурированных человеческих видео для предварительного обучения моделей VLA для роботов.
Предоставив полностью автоматизированное решение для преобразования данных, это исследование значительно снизило порог получения высококачественных данных для обучения роботов, проложив путь для применения многозвенных ловких рук в более широком спектре реальных сложных сценариев и заложив прочный фундамент для продвижения к истинно обобщающему воплощенному интеллекту.
Ссылка на статью: https://arxiv.org/abs/2510.21571
Статья взята с официального аккаунта WeChat "量子位" (Qubit), автор: команда VITRA






