Artículos Relacionados con Pretrenamiento

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Pretrenamiento", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

10.000 horas de datos humanos para entrenar el primer modelo de acción global implícita para la manipulación móvil de cuerpo completo del mundo

En los últimos dos años, la competencia en el campo de los robots humanoides se ha centrado cada vez más en las capacidades de los modelos, más allá del hardware. Para superar los desafíos de la escasez de datos costosos de demostración en robots reales, el ruido en la predicción visual pixelada y la falta de coordinación entre la movilidad y la manipulación, la empresa de inteligencia embebida Zhizai Wujie ha presentado **Being-M0.7**. Es el primer modelo de acción-mundo latente (Latent World-Action Model) a nivel mundial diseñado para la operación de manipulación móvil de cuerpo completo en robots humanoides. Entrenado previamente con más de **10,000 horas de datos multimodales centrados en el ser humano** y luego adaptado con una pequeña cantidad de datos de demostración en robots reales, el modelo utiliza una arquitectura **Mixture of Transformers (MoT)** que permite entrenar conjuntamente con datos emparejados (video-movimiento), solo video y solo movimiento, superando así la escasez de datos. Una representación de movimiento unificada y compacta (cabeza, manos, pies) cierra la brecha entre los datos de movimiento humano y el control del robot. Un **"experto en acción"** ligero traduce las predicciones del modelo a comandos de control específicos del robot, desacoplando la planificación de mundo de baja frecuencia del control de acciones de alta frecuencia. Being-M0.7 se ha validado en el robot humanoide Unitree G1 con varias tareas desafiantes: pescar un pez en una pecera (interacción con líquidos), recuperar un objeto usando un espejo (razonamiento espacial indirecto), transferir objetos entre cestas (tarea de larga duración) y transportar una caja esquivando obstáculos (navegación con carga y percepción obstruida). Estos demostraron su capacidad para generar y ajustar acciones coordinadas de cuerpo completo en tiempo real, basándose en la observación, la retroalimentación y la predicción de estados futuros en un espacio latente, en lugar de una costosa generación pixelada. Este enfoque, que sigue la línea validada previamente por el modelo de manipulación diestra **Being-H0.7**, prioriza que el modelo aprenda primero las dinámicas del mundo y el movimiento corporal a partir de vastos datos humanos, antes de adaptarse a un cuerpo robótico específico. Establece un paradigma de fusión multimodal escalable que podría ser clave para el avance hacia una inteligencia embebida más general, donde la comprensión del entorno y la predicción sean la base para una acción autónoma y competente en el mundo físico.

marsbit07/15 01:54

10.000 horas de datos humanos para entrenar el primer modelo de acción global implícita para la manipulación móvil de cuerpo completo del mundo

marsbit07/15 01:54

Karpathy lanza su última crítica: una frase silenció a todos los desarrolladores de Agent

Andrej Karpathy, destacado investigador de Anthropic, ha expresado una crítica contundente hacia el frenesí actual en el desarrollo de Agentes de IA. En una reciente presentación, afirmó que el mayor error en el campo es la prisa por forzar a los Agentes a realizar tareas sin comprender primero a fondo los modelos de lenguaje subyacentes. Basándose en su experiencia en un proyecto fallido de 2016, Karpathy subraya que la tecnología de entonces (como el aprendizaje por refuerzo) no estaba preparada, y que el enfoque correcto hubiera sido priorizar la investigación en modelos de lenguaje. Ofrece tres consejos clave: primero, centrarse en mejorar los modelos base antes que en las capacidades de los Agentes. Segundo, reconocer que crear un prototipo es fácil, pero desarrollar un producto viable puede llevar una década, como en los casos de la conducción autónoma o la realidad virtual. Tercero, los Agentes no son el producto en sí, sino que emergerán naturalmente una vez que se consolide la base. Karpathy también propone buscar inspiración en la neurociencia, analizando estructuras cerebrales como el hipocampo o los ganglios basales para comprender mejor la inteligencia. Finalmente, envía un mensaje alentador a desarrolladores independientes y emprendedores: en la frontera de las capacidades de los Agentes, son ellos, y no los grandes laboratorios como OpenAI o DeepMind, quienes llevan la delantera, ya que este es un territorio nuevo donde la agilidad y la experimentación valen más que la experiencia acumulada. Su crítica no es desalentar el trabajo en Agentes, sino instar a construir sobre cimientos sólidos para un progreso real y duradero.

marsbit07/06 02:36

Karpathy lanza su última crítica: una frase silenció a todos los desarrolladores de Agent

marsbit07/06 02:36

Por primera vez, un VLA puramente preentrenado con videos humanos logra una manipulación hábil, y un fino ajuste con pocos datos permite el despliegue exitoso

La investigación "Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos", presentada por Microsoft Asia Research (MSRA) y la Universidad de Tsinghua, introduce el marco **VITRA**. Este sistema convierte automáticamente grandes volúmenes de videos de actividades humanas sin etiquetar en datos estructurados para entrenar modelos **Visión-Lenguaje-Acción (VLA)** aplicables a robots. El proceso clave implica: 1) extraer trayectorias precisas de movimiento 3D de las manos desde video monocular, 2) segmentar los videos en acciones atómicas basándose en mínimos de velocidad, y 3) generar instrucciones lingüísticas precisas utilizando modelos de lenguaje como GPT-4, a las que se superponen las trayectorias 3D. Tras el preentrenamiento en un extenso conjunto de datos (1 millón de clips, 26 millones de fotogramas), el modelo VLA (que combina un modelo visual-lingüístico con un experto en acción basado en difusión) muestra una fuerte capacidad de **predicción de acciones en entornos nuevos y no vistos** (zero-shot). Para el despliegue en robots reales, el modelo se ajusta con una pequeña cantidad de datos de demostración robótica (~1.2K). Este enfoque logra una **alta tasa de éxito** en tareas de manipulación diestra (como agarrar, colocar, verter o barrer) y demuestra una **excelente capacidad de generalización** a objetos y fondos no vistos, superando significativamente a modelos entrenados únicamente con datos robóticos de laboratorio. El hardware, específicamente la mano robótica diestra **星动XHAND1** (con su modelo URDF de alta precisión y arquitectura de accionamiento directo), es fundamental para lograr una **alineación efectiva** del espacio de acción entre la mano humana y la robótica, permitiendo una implementación exitosa. Además, el estudio confirma una **ley de escalado**: un mayor volumen de datos de preentrenamiento mejora continuamente el rendimiento. Este trabajo allana el camino para una manipulación robótica más generalizada utilizando videos humanos no estructurados.

marsbit06/08 08:57

Por primera vez, un VLA puramente preentrenado con videos humanos logra una manipulación hábil, y un fino ajuste con pocos datos permite el despliegue exitoso

marsbit06/08 08:57

El exalumno post-00 de Tsinghua, Wang Guan, presenta otra innovación: revolucionando los modelos de preentrenamiento Transformer con 1/900 tokens y 1/432 de potencia computacional

El equipo de Wang Guan, egresado de la Universidad Tsinghua, ha presentado HRM-Text, un nuevo modelo de preentrenamiento que desafía el paradigma tradicional de los grandes modelos de lenguaje. Sustituyendo el Transformer estándar por un Modelo Recurrente Jerárquico (HRM) y utilizando un objetivo de entrenamiento directo en pares instrucción-respuesta, HRM-Text logra un rendimiento comparable a modelos de código abierto de 2B a 7B de parámetros, pero con una fracción mínima de los recursos. Concretamente, el modelo de 1B de parámetros se entrenó con solo 40B de tokens únicos, utilizando aproximadamente 100-900 veces menos tokens y 96-432 veces menos cómputo estimado que los modelos baseline estándar, a un costo cercano a los 1500 USD. Aún así, alcanzó puntuaciones destacadas en benchmarks clave: MMLU (60.7%), ARC-C (81.9%), DROP (82.2%), GSM8K (84.5%) y MATH (56.2%). La arquitectura HRM emplea módulos de actualización lenta (H) y rápida (L), permitiendo múltiples pasos recurrentes por token para aumentar la profundidad computacional sin agregar parámetros. Técnicas como MagicNorm y Warmup Deep Credit Assignment aseguraron la estabilidad del entrenamiento recurrente. Los experimentos muestran que HRM supera en eficiencia y estabilidad a Transformers de tamaño similar bajo un presupuesto computacional fijo. Las ablaciones confirman la contribución clave del objetivo de finalización de tareas y el enmascaramiento PrefixLM. El análisis sugiere que la estructura recurrente confiere una "profundidad efectiva" mayor. Las limitaciones incluyen una cobertura de conocimiento aún limitada por el corpus, la necesidad de mecanismos de tiempo de cómputo adaptativo, y desafíos de ingeniería para implementar PrefixLM en entornos de diálogo. El trabajo futuro explorará desacoplar el núcleo de razonamiento del almacenamiento de conocimientos y validar la escalabilidad a tamaños de modelo mayores.

marsbit05/26 03:19

El exalumno post-00 de Tsinghua, Wang Guan, presenta otra innovación: revolucionando los modelos de preentrenamiento Transformer con 1/900 tokens y 1/432 de potencia computacional

marsbit05/26 03:19

活动图片