首次,纯人类视频预训练VLA灵巧操作,少量数据微调就能部署成功
微软亚洲研究院与清华大学合作提出创新预训练框架VITRA,首次实现仅使用纯人类视频数据对视觉-语言-动作(VLA)模型进行大规模预训练,并成功应用于机器人灵巧操作。
该研究核心是构建了一套自动化流程,将海量无标注的人类活动视频转化为可用于机器人训练的V-L-A数据。方法包括:从单目视频中精准恢复3D手部与相机运动轨迹;基于手部移动速度极小值进行原子级动作分割;结合视觉与轨迹信息,利用大模型自动生成语言指令。由此构建了包含百万片段、千万帧的超大规模数据集。
基于此数据集预训练的VLA模型,结合了视觉语言模型骨干与扩散动作预测器。模型在完全未见的真实环境中展现出强大的零样本手部动作预测能力。仅需使用约1.2千条真实机器人数据对预训练模型进行微调,即可在配备灵巧手(如星动XHAND1)的真实机器人上成功执行抓取、放置、倾倒等多种复杂操作任务,并对新物体、新环境表现出卓越的泛化能力和鲁棒性。
研究还验证了模型性能随预训练数据规模增加而提升的缩放定律。该工作为利用丰富易得的人类视频数据突破机器人训练数据瓶颈提供了新路径,推动了面向真实复杂场景的具身智能发展。
marsbit06/08 08:53