Artículos Relacionados con Aprendizaje por refuerzo

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Aprendizaje por refuerzo", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

Agibot retira a su director científico, Luo Jianlan, de su sitio web

Directivos de Agibot cambian: el científico jefe Luo Jianlan parece haber dejado la empresa. La lista actual de socios en el sitio web oficial de Agibot (Agibot Robotics) ya no incluye el nombre del anterior científico jefe, **Luo Jianlan**. Anteriormente figuraba como socio, vicepresidente senior y científico jefe. El cambio en la web parece confirmar los rumores anteriores sobre su salida. Además, sus perfiles personales ahora solo mencionan su cargo como profesor asistente en Shanghai Innovation and Entrepreneurship College, sin referencia a Agibot. El momento es notable, ya que se produce poco después de que Agibot confirmara, el 24 de julio de 2026, haber iniciado el proceso para cotizar en la bolsa de Hong Kong. Ni la empresa ni Luo Jianlan han hecho anuncios oficiales al respecto. Luo Jianlan se unió a Agibot en abril de 2025 para liderar su Centro de Investigación en Inteligencia Corporeizada. Si la salida se confirma, su permanencia habría durado aproximadamente 1 año y 4 meses. La semana pasada aún promocionaba en X su trabajo en VLA para Agibot. Con una destacada trayectoria que incluye un doctorado en UC Berkeley, investigación en Google X y un posdoctorado en BAIR, Luo Jianlan centró su investigación en aprendizaje por refuerzo para robots en el mundo real. Durante su etapa en Agibot, participó en el desarrollo de la línea de investigación principal de la compañía en aprendizaje por refuerzo en robots físicos, entrenamiento posterior en línea y modelos del mundo. Sus trabajos buscaban que el propio proceso de implementación de los robots sirviera como punto de partida para el siguiente ciclo de aprendizaje.

marsbitAyer 12:04

Agibot retira a su director científico, Luo Jianlan, de su sitio web

marsbitAyer 12:04

El último artículo de Fei-Fei Li: Cuando la generación de vídeo, la robótica y NVIDIA se autodenominan modelos del mundo, necesitamos una taxonomía

El artículo de Fei-Fei Li clarifica el término "modelo del mundo", utilizado de manera confusa en IA, proponiendo una taxonomía basada en el ciclo POMDP (Proceso de Decisión de Markov Parcialmente Observable). Identifica tres categorías funcionales: 1) **Renderizador**: genera observaciones (píxeles) visualmente fieles para humanos, como los modelos de video Sora o Genie, pero sin comprensión física precisa. 2) **Simulador**: produce estados del mundo con precisión geométrica, física y dinámica, sirviendo tanto para visualización profesional como para entrenamiento de agentes (robots, vehículos autónomos). 3) **Planificador**: deduce acciones a partir de observaciones y objetivos, cerrando el ciclo percepción-acción, como los modelos de lenguaje-visión-acción (VLA). El artículo argumenta que el simulador es el componente clave y subestimado, pues proporciona la base estructural para la renderización y la planificación. Mientras los renderizadores tienen madurez comercial pero limitaciones físicas, y los planificadores son prometedores pero inmaduros para despliegues reales, los simuladores abarcan aplicaciones cruciales en robótica, diseño y digitalización. La tendencia actual es la fusión de estas categorías, impulsada por la idea de que comparten conocimiento subyacente. Modelos como Marble de World Labs ejemplifican esta convergencia, generando tanto representaciones visuales (splats gaussianos) como mallas para simulación física. La visión final es un **modelo del mundo unificado** capaz de alternar entre renderizar, simular y planificar según la necesidad, avanzando hacia una inteligencia espacial que permita a las máquinas entender e interactuar con el mundo físico.

marsbit07/05 09:29

El último artículo de Fei-Fei Li: Cuando la generación de vídeo, la robótica y NVIDIA se autodenominan modelos del mundo, necesitamos una taxonomía

marsbit07/05 09:29

Nuevo artículo de OpenAI: ¿Cómo entrenar a una IA que 'no se vuelve maliciosa bajo presión'?

Los modelos de IA, aunque aparentemente fiables, pueden cruzar límites de seguridad bajo presión o entrenamiento malicioso. Un nuevo artículo de OpenAI, "Reinforcement Learning Towards Broadly and Persistently Beneficial Models", explora cómo mantener un comportamiento beneficioso y estable en escenarios nuevos y de alto riesgo, más allá de listas de prohibiciones. La investigación se centra en usar el aprendizaje por refuerzo para fomentar rasgos positivos, como honestidad, transparencia, capacidad de corrección y percepción de riesgos, en lugar de solo evitar comportamientos dañinos. El estudio utilizó un conjunto de datos de diálogo sintético que abarca 12 áreas como medicina y derecho, evaluando 15 rasgos beneficiosos. Los resultados mostraron que reemplazar solo el 5% de los datos de entrenamiento estándar con ejemplos de estos rasgos mejoró significativamente el alineamiento del modelo en múltiples evaluaciones, incluso en dominios no relacionados (por ejemplo, entrenar con datos de salud mejoró el comportamiento en código o ética). Además, los modelos entrenados con estos rasgos demostraron una mayor "persistencia del alineamiento", manteniendo un mejor comportamiento bajo "prompts" adversos o ajustes finos maliciosos, y mostraron una degradación menor y menos generalizada. Esto sugiere que el aprendizaje fomenta una tendencia subyacente hacia la prudencia y la toma de decisiones robustas. OpenAI señala que esto no resuelve completamente el problema de alineamiento, pero representa un paso hacia modelar un comportamiento más confiable y predecible en tareas complejas.

marsbit06/24 04:13

Nuevo artículo de OpenAI: ¿Cómo entrenar a una IA que 'no se vuelve maliciosa bajo presión'?

marsbit06/24 04:13

活动图片