Robot aprende operaciones viendo videos: Berkeley logra por primera vez un enlace desde videos de Internet hasta la implementación en robots de manos hábiles reales
**Resumen: "Do as I Do" de UC Berkeley convierte vídeos humanos en instrucciones para robots**
El equipo de UC Berkeley presenta "Do as I Do", un flujo de trabajo pionero que permite a robots con manos diestras aprender a realizar tareas observando únicamente vídeos RGB monoculares de personas en entornos cotidianos.
**El problema:** Existen millones de vídeos de interacciones mano-objeto en Internet, pero su ruido, oclusiones y falta de información 3D los hacen inutilizables directamente para robots. Los métodos actuales de teleoperación o simulación no escalan.
**La solución:** El sistema aborda dos retos clave:
1. **Reconstrucción 4D robusta:** Utiliza un modelo de difusión guiado (basado en SAM 3D) para rastrear de forma estable la forma y pose de objetos no rígidos a lo largo del vídeo, superando métodos anteriores como FoundationPose.
2. **Redireccionamiento de acciones a ruido:** Adapta el optimizador MPPI/SPIDER para manejar trayectorias de referencia ruidosas extraídas de los vídeos, introduciendo suavizado temporal, ajuste de contacto y replanificación. Esto eleva la tasa de éxito del 25% al 71%.
**Resultados:** El método generó 500 trayectorias validadas para 20 acciones complejas (verter, batir, escribir, martillar, etc.). Diez de ellas se desplegaron con éxito en un robot real con dos brazos UR3e y dos manos diestras Sharpa Wave (22 DoF), controlado a 50Hz.
**Conclusión:** La investigación demuestra por primera vez un pipeline completo que convierte vídeos online en trayectorias ejecutables para manos robóticas diestras, superando una barrera crítica para el aprendizaje robótico a gran escala a partir de la vasta biblioteca visual humana.
marsbit07/06 07:23