Artículos Relacionados con Manipulación Móvil

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Manipulación Móvil", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

10.000 horas de datos humanos para entrenar el primer modelo de acción global implícita para la manipulación móvil de cuerpo completo del mundo

En los últimos dos años, la competencia en el campo de los robots humanoides se ha centrado cada vez más en las capacidades de los modelos, más allá del hardware. Para superar los desafíos de la escasez de datos costosos de demostración en robots reales, el ruido en la predicción visual pixelada y la falta de coordinación entre la movilidad y la manipulación, la empresa de inteligencia embebida Zhizai Wujie ha presentado **Being-M0.7**. Es el primer modelo de acción-mundo latente (Latent World-Action Model) a nivel mundial diseñado para la operación de manipulación móvil de cuerpo completo en robots humanoides. Entrenado previamente con más de **10,000 horas de datos multimodales centrados en el ser humano** y luego adaptado con una pequeña cantidad de datos de demostración en robots reales, el modelo utiliza una arquitectura **Mixture of Transformers (MoT)** que permite entrenar conjuntamente con datos emparejados (video-movimiento), solo video y solo movimiento, superando así la escasez de datos. Una representación de movimiento unificada y compacta (cabeza, manos, pies) cierra la brecha entre los datos de movimiento humano y el control del robot. Un **"experto en acción"** ligero traduce las predicciones del modelo a comandos de control específicos del robot, desacoplando la planificación de mundo de baja frecuencia del control de acciones de alta frecuencia. Being-M0.7 se ha validado en el robot humanoide Unitree G1 con varias tareas desafiantes: pescar un pez en una pecera (interacción con líquidos), recuperar un objeto usando un espejo (razonamiento espacial indirecto), transferir objetos entre cestas (tarea de larga duración) y transportar una caja esquivando obstáculos (navegación con carga y percepción obstruida). Estos demostraron su capacidad para generar y ajustar acciones coordinadas de cuerpo completo en tiempo real, basándose en la observación, la retroalimentación y la predicción de estados futuros en un espacio latente, en lugar de una costosa generación pixelada. Este enfoque, que sigue la línea validada previamente por el modelo de manipulación diestra **Being-H0.7**, prioriza que el modelo aprenda primero las dinámicas del mundo y el movimiento corporal a partir de vastos datos humanos, antes de adaptarse a un cuerpo robótico específico. Establece un paradigma de fusión multimodal escalable que podría ser clave para el avance hacia una inteligencia embebida más general, donde la comprensión del entorno y la predicción sean la base para una acción autónoma y competente en el mundo físico.

marsbit07/15 01:54

10.000 horas de datos humanos para entrenar el primer modelo de acción global implícita para la manipulación móvil de cuerpo completo del mundo

marsbit07/15 01:54

活动图片