Artículos Relacionados con Modelo Mundial

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Modelo Mundial", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

10.000 horas de datos humanos para entrenar el primer modelo de acción global implícita para la manipulación móvil de cuerpo completo del mundo

En los últimos dos años, la competencia en el campo de los robots humanoides se ha centrado cada vez más en las capacidades de los modelos, más allá del hardware. Para superar los desafíos de la escasez de datos costosos de demostración en robots reales, el ruido en la predicción visual pixelada y la falta de coordinación entre la movilidad y la manipulación, la empresa de inteligencia embebida Zhizai Wujie ha presentado **Being-M0.7**. Es el primer modelo de acción-mundo latente (Latent World-Action Model) a nivel mundial diseñado para la operación de manipulación móvil de cuerpo completo en robots humanoides. Entrenado previamente con más de **10,000 horas de datos multimodales centrados en el ser humano** y luego adaptado con una pequeña cantidad de datos de demostración en robots reales, el modelo utiliza una arquitectura **Mixture of Transformers (MoT)** que permite entrenar conjuntamente con datos emparejados (video-movimiento), solo video y solo movimiento, superando así la escasez de datos. Una representación de movimiento unificada y compacta (cabeza, manos, pies) cierra la brecha entre los datos de movimiento humano y el control del robot. Un **"experto en acción"** ligero traduce las predicciones del modelo a comandos de control específicos del robot, desacoplando la planificación de mundo de baja frecuencia del control de acciones de alta frecuencia. Being-M0.7 se ha validado en el robot humanoide Unitree G1 con varias tareas desafiantes: pescar un pez en una pecera (interacción con líquidos), recuperar un objeto usando un espejo (razonamiento espacial indirecto), transferir objetos entre cestas (tarea de larga duración) y transportar una caja esquivando obstáculos (navegación con carga y percepción obstruida). Estos demostraron su capacidad para generar y ajustar acciones coordinadas de cuerpo completo en tiempo real, basándose en la observación, la retroalimentación y la predicción de estados futuros en un espacio latente, en lugar de una costosa generación pixelada. Este enfoque, que sigue la línea validada previamente por el modelo de manipulación diestra **Being-H0.7**, prioriza que el modelo aprenda primero las dinámicas del mundo y el movimiento corporal a partir de vastos datos humanos, antes de adaptarse a un cuerpo robótico específico. Establece un paradigma de fusión multimodal escalable que podría ser clave para el avance hacia una inteligencia embebida más general, donde la comprensión del entorno y la predicción sean la base para una acción autónoma y competente en el mundo físico.

marsbit07/15 01:54

10.000 horas de datos humanos para entrenar el primer modelo de acción global implícita para la manipulación móvil de cuerpo completo del mundo

marsbit07/15 01:54

Xingdong Jiyuan recauda 25.000 millones en dos meses, entrando el capital estatal

La empresa china de robótica corporal Starwise Century (星动纪元) ha completado recientemente una ronda de financiación de 10.000 millones de RMB, liderada por fondos estatales como China Reform Fund Management Corp. Esto eleva su financiación total a 25.000 millones de RMB en dos meses. Fundada en 2023 como una spin-off de la Universidad Tsinghua, la empresa se centra en la inteligencia artificial nativa, desarrollando capacidades integrales propias desde datos y modelos de IA hasta control, manos diestras y el robot completo. Starwise Century destaca por su investigación pionera en modelos mundiales para robótica y por su estrategia de "fortalecer el cerebro con las manos". Sus manos diestras totalmente accionadas directamente, como la XHAND 1, no solo son componentes clave sino también plataformas para recopilar datos de alta calidad del mundo físico, utilizados para entrenar sus modelos de IA como ERA-42. Esta mano es utilizada por múltiples empresas y universidades líderes a nivel mundial. La compañía ha logrado una implementación comercial significativa, especialmente en logística, trabajando con socios como SF Express y China Post en centros de clasificación donde los robots operan 24/7. También está activa en fabricación de alta gama (con Samsung, Lenovo) y servicios comerciales. Con un conjunto de datos extenso y único procedente de estas operaciones reales, Starwise Century busca establecer una ventaja competitiva sostenible en el campo de la robótica corporal, donde en 2026 se espera que la capacidad de cerrar el ciclo comercial sea un factor clave de diferenciación.

marsbit07/06 01:39

Xingdong Jiyuan recauda 25.000 millones en dos meses, entrando el capital estatal

marsbit07/06 01:39

Concepto de Modelos del Mundo para Principiantes: Una Historia que va de la Psicología al Campo Principal de la IA

El concepto de "modelo mundial" (World Model) es actualmente una idea candente pero confusa en el campo de la IA. Su objetivo central es dotar a la máquina de un "simulador mental" o "tablero de arena interno" que le permita prever y ensayar posibles escenarios futuros antes de actuar en el mundo real. Esto es crucial para aplicaciones como la conducción autónoma (simular condiciones extremas), la robótica (entrenar en entornos virtuales) o la generación de contenidos. El concepto tiene raíces profundas. El psicólogo Kenneth Craik (1943) propuso que la mente humana construye "modelos a pequeña escala" de la realidad para predecir eventos. En IA, pioneros como Marvin Minsky y, más recientemente, investigadores como David Ha y Jürgen Schmidhuber (2018) con su trabajo "Recurrent World Models", sentaron las bases modernas. Los principales investigadores tienen visiones distintas pero complementarias: * **Yann LeCun** (Meta) critica los modelos de lenguaje grandes y aboga por un modelo mundial que comprenda la física subyacente, a través de arquitecturas como JEPA, que predicen en un espacio de representación abstracto, no en píxeles. * **Fei-Fei Li** (Stanford, World Labs) propone una clasificación basada en el ciclo de acción-observación: **Renderizadores** (generan píxeles, como Sora), **Simuladores** (generan estados 3D/físicos precisos) y **Planificadores** (generan acciones). * **El laboratorio FIB de la Universidad de Tsinghua** simplifica la división en modelos para **entender** el mundo (apoyo a la decisión) y para **predecir** el futuro (generación). Grandes empresas están impulsando el campo con diferentes enfoques: * **OpenAI** con **Sora** lo presenta como un "simulador del mundo" basado en generación de vídeo. * **Google DeepMind** con **Genie 3** crea mundos 3D interactivos en tiempo real a partir de texto. * **NVIDIA** con **Cosmos** ofrece una "plataforma de modelo base mundial" para IA física y simulación. Técnicamente, coexisten tres rutas principales: 1. **"Pintar"**: Modelos generativos de vídeo (Sora, Genie 3). Ventaja: realismo visual. Desventaja: coherencia física débil. 2. **"Calcular mentalmente"**: Predicción en espacio de representación abstracta (JEPA). Ventaja: eficiente, aprende estructura. Desventaja: menos interpretable. 3. **"Construir con bloques"**: Generación de entornos 3D con propiedades físicas explícitas (Omniverse). Ventaja: preciso y editable. Desventaja: costoso, menos generalizable. Un desarrollo reciente es el **World Action Model (WAM)**, que integra la predicción del estado futuro y la generación de acciones en un único sistema, acercándose a una capacidad "unificada de conocimiento y acción" para robots. A nivel industrial, se está formando una estructura en tres capas: **1) Soporte base** (datos, potencia de cálculo, sensores), **2) Plataformas tecnológicas** (genéricas o verticales) y **3) Aplicaciones** (conducción autónoma, robótica, juegos, etc.). La conducción autónoma es actualmente la aplicación más madura. La falta de una definición única no es necesariamente negativa. Refleja una fase temprana y dinámica donde diferentes enfoques (compresión del mundo en píxeles, geometría 3D, reglas de comportamiento) están explorando en paralelo. El objetivo final, sin embargo, es convergente: dotar a las máquinas de un modelo interno del mundo que sea **deducible, repasable y generalizable**, para actuar de forma más segura y eficiente. La unificación conceptual llegará, pero la confusión actual es señal de que el "modelo mundial" se ha convertido en un campo de batalla principal para el futuro de la IA.

marsbit06/29 05:14

Concepto de Modelos del Mundo para Principiantes: Una Historia que va de la Psicología al Campo Principal de la IA

marsbit06/29 05:14

La primera certificación antiexplosiva nacional y el primer esquema mundial de 'Cerebro de Repostaje', ¿cómo lograron conquistar estos dos 'números uno'?

Según las estadísticas, la financiación en el campo de la inteligencia encarnada en China superó los 37.000 millones de yuanes este año. La tendencia clave actual es la implementación práctica. La exposición a entornos peligrosos, como estaciones de servicio y plantas químicas, requiere que los robots superen la primera barrera crítica: la certificación a prueba de explosiones. Esto implica requisitos de diseño estrictos a nivel de hardware para garantizar la seguridad intrínseca. La aplicación en estaciones de servicio enfrenta el desafío de la precisión en operaciones continuas de múltiples pasos, como abrir la tapa del depósito y manipular la manguera de combustible, con una tolerancia de solo unos pocos milímetros. Los escenarios de inspección en plantas requieren capacidades de patrulla autónoma, identificación de anomalías y respuesta inmediata durante largos períodos. Para abordar estos desafíos, se destaca un enfoque arquitectónico innovador impulsado por un modelo del mundo (H-GAR). En lugar de una arquitectura lineal tradicional, este sistema predice primero el estado visual objetivo final de la tarea. Luego, sintetiza fotogramas intermedios de transición guiados por ese objetivo y refina las acciones utilizando retroalimentación contextual visual y una memoria de acciones históricas. Este mecanismo permite al robot "imaginar" la trayectoria completa de la tarea y alinear sus acciones con el estado final deseado, reduciendo significativamente la desviación acumulativa en secuencias largas y complejas. La implementación en escenarios especiales requiere un acoplamiento profundo entre el "cerebro" de IA encarnada y el cuerpo robótico, junto con un espíritu de perseverancia a largo plazo. Los primeros en lograr este ciclo cerrado de cerebro-cuerpo-datos podrían obtener una ventaja competitiva crucial en la carrera por la comercialización de la inteligencia encarnada.

marsbit06/26 03:53

La primera certificación antiexplosiva nacional y el primer esquema mundial de 'Cerebro de Repostaje', ¿cómo lograron conquistar estos dos 'números uno'?

marsbit06/26 03:53

Un doctorado pos-95 se dedica al modelo mundial, FaceMind recauda decenas de millones de yuanes

FaceMind, una joven empresa de IA fundada por Lu Hongyuan, un doctor de 28 años, ha completado una ronda de financiación Pre-A de decenas de millones de yuanes. La inversión fue liderada por Star Connect Capital, con una participación adicional del antiguo accionista 360. La compañía, inicialmente centrada en modelos multimodales para dispositivos, ha girado su enfoque hacia el desarrollo de modelos mundiales (World Models). Estos modelos buscan predecir cambios en entornos, crucial para agentes de interfaz gráfica (GUI) e inteligencia embodada (robots). Lu Hongyuan, formado en Imperial College London y la Universidad China de Hong Kong, investigó problemas fundamentales de los LLM, como el manejo de palabras poco frecuentes. Su trabajo, incluido el "Adam's Law", llamó la atención de Anthropic. FaceMind desarrolla ahora un sistema de modelo mundial eficiente en parámetros, enfocado en predicciones de larga secuencia. Su producto "叠叠社" sirve como campo de prueba, generando comentarios en tiempo real basados en el contenido de la pantalla. Los inversores destacan la capacidad del equipo para la investigación fundamental y la ejecución técnica. FaceMind valida su tecnología en entornos de simulación, GUI y brazos robóticos reales, planeando ofrecer sus capacidades a fabricantes de robots, plataformas de contenido y proveedores de chips y cloud. Con esta financiación, la empresa intensificará la I+D y la validación en múltiples escenarios de su modelo mundial.

marsbit06/26 01:52

Un doctorado pos-95 se dedica al modelo mundial, FaceMind recauda decenas de millones de yuanes

marsbit06/26 01:52

Una guerra sin nombre unificado: El mapa de los Modelos de Mundo de los grandes fabricantes nacionales

**Resumen de las guerras por el modelo mundial: el panorama de las grandes tecnológicas chinas** El concepto de "modelo mundial" aún carece de una definición unificada, adoptando nombres como modelo base del mundo, IA física, o integrándose en sistemas de conducción autónoma o inteligencia corporeizada. Tras esta confusión nominal, la industria persigue un mismo objetivo: dotar a las máquinas de un entorno interno dinámico y simulable para predecir y ensayar acciones, reduciendo la dependencia de datos del mundo real y comprimiéndolo en un "motor de datos" generativo. Los gigantes tecnológicos y automotrices han convertido esto en una nueva arena de competición, relegando a startups con menos recursos de datos y cómputo. **1. Gigantes de Internet: Del mundo digital al físico** * **Alibaba** presenta una estrategia triple: **Qwen-AgentWorld** (entorno de simulación para agentes de IA basado en lenguaje), **HappyOyster** (generación de mundos virtuales interactivos) y **Qwen-RobotWorld** (cerebro de simulación para robótica e inteligencia corporeizada), cubriendo mundos lingüísticos, virtuales y físicos. * **Tencent** centra su **HY-World** en la generación y reconstrucción de entornos 3D editables, aprovechando sus fortalezas en videojuegos y escenarios sociales. * **ByteDance** desarrolla en secreto un modelo basado en la enorme base de datos de vídeos de TikTok/Douyin, con el objetivo de construir un gemelo digital que simule leyes físicas. * **Huawei** integra capacidades de modelo mundial en su **Pangu**, sirviendo como base de entrenamiento para su sistema de conducción autónoma ADS y robótica, sin comercializarlo como producto independiente. * **Baidu** embebe estas capacidades en su modelo de conducción autónoma **Apollo ADFM** y en el modelo multimodal **Ernie**, sin destacar el término "modelo mundial". **2. Fabricantes de automóviles: La escuela de conducción y el campo de pruebas** Para los automovilísticos, el modelo mundial es una herramienta práctica para entrenar y evaluar sistemas de conducción autónoma. * **NIO** fue pionero con su **NWM**, enfocado en la "reconstrucción imaginada" del espacio y la "deducción imaginada" del tiempo. Su versión 2.0 ya se implementa en flota. * **Li Auto** desarrolló **DrivingSphere**, un entorno de simulación 4D de alta fidelidad para generar escenarios complejos y probar el sistema en bucle cerrado. * **XPeng** presentó **X-World**, un "simulador del mundo real" para su VLA de segunda generación, expandiendo masivamente los escenarios de simulación. * **Geely** integra su **WAM (World Action Model)** en una arquitectura unificada para conducción, cabina y chasis. * **BYD** y **Great Wall** también avanzan en su desarrollo, siendo este último el primero en anunciar un sistema VLA+modelo mundial para producción en serie en 2026. **3. Proveedores de tecnología de conducción autónoma: El motor invisible** Firmas como **Momenta** (con su modelo **R7** ya en producción), **Horizon Robotics** (con **HorizonDrive** para generación de vídeo de larga duración y simulación), **Haomo.ai** (pionera con **DriveGPT**) y **DeepRoute** integran el modelo mundial como núcleo de sus plataformas de simulación y entrenamiento para sistemas de nivel L3/L4. **Conclusión: No es una moda, es una escalada** El modelo mundial representa la convergencia natural de los modelos de lenguaje, generación de vídeo y conducción autónoma en el mundo físico. Ha pasado de ser un experimento técnico a una infraestructura industrial crítica. La ventana de oportunidad para las startups se estrecha, ya que los gigantes, con sus vastos datos, capacidad de cómputo y canales de producción, están transformando rápidamente estos modelos en componentes operativos de sus productos y servicios. La cuestión clave ya no es quién tiene un modelo, sino **qué modelo entiende y simula verdaderamente el mundo para tomar decisiones útiles**.

marsbit06/25 06:58

Una guerra sin nombre unificado: El mapa de los Modelos de Mundo de los grandes fabricantes nacionales

marsbit06/25 06:58

Cuenta regresiva para GPT-5.6: Abandona la fantasía de la API única, incluso la iteración más rápida del poder de cómputo no puede competir con una sola regulación

A mediados de junio, tres eventos aparentemente inconexos —las restricciones regulatorias a Claude Fable 5, el lanzamiento en código abierto de GLM-5.2 y la filtración del lanzamiento inminente de GPT-5.6— marcan un punto de inflexión para la industria global de IA. Estos cambios reflejan una reconfiguración fundamental: la "disponibilidad" supera en importancia a la "vanguardia técnica", dando paso a un sistema dual de modelos cerrados controlados y de código abierto local. La retirada de Fable 72 horas después de su lanzamiento, por restricciones de exportación estadounidenses dirigidas a ciudadanos no estadounidenses, evidencia que el avance técnico ahora conlleva un riesgo regulatorio equivalente. Esto crea una vulnerabilidad para las empresas que dependen de APIs cerradas. Como contrapeso, el modelo de código abierto GLM-5.2 de Zhipu AI, compatible con plataformas de semiconductores locales y con un rendimiento cercano a los modelos cerrados líderes, ofrece una alternativa estable y de menor costo. Su despliegue local se convierte en una estrategia de redundancia crítica para la continuidad del negocio ante riesgos geopolíticos. Mientras tanto, OpenAI se prepara para lanzar GPT-5.6, desplazando su foco de la inteligencia lingüística a la "inteligencia espacial" o modelos mundiales, un campo que requiere una inmensa potencia de cálculo. Este movimiento busca establecer una nueva ventaja competitiva en simulaciones industriales, robótica y diseño 3D. En conclusión, la lógica de la cadena de suministro de modelos grandes ha cambiado. La evaluación crítica para las empresas ya no es solo el rendimiento, sino una combinación de capacidad técnica, cumplimiento normativo y estabilidad de acceso. Para los desarrolladores, depender exclusivamente de una API cerrada supone un riesgo inaceptable. Diseñar arquitecturas "agnósticas al modelo" que permitan cambiar rápidamente a alternativas locales y de código abierto se ha convertido en un requisito básico para garantizar la continuidad del negocio.

marsbit06/21 04:44

Cuenta regresiva para GPT-5.6: Abandona la fantasía de la API única, incluso la iteración más rápida del poder de cómputo no puede competir con una sola regulación

marsbit06/21 04:44

El legado inacabado de Jueying, DaXiao Robot busca rápidamente 'financiamiento'

Según la cuenta oficial de WeChat de Daxiao Robot, la compañía ha completado una nueva ronda de financiación con la participación de inversores como Dachen Caizhi, Shenzhen Capital Group y Shanghai Science and Technology Innovation Fund. Hasta la primera mitad de 2026, Daxiao Robot ha acumulado financiación por varios cientos de millones de dólares. Esta operación representa una nueva apuesta de SenseTime en el campo de la "IA física", tras el desarrollo independiente de su negocio de conducción autónoma, Jueying. Aunque Jueying colaboró con más de 30 fabricantes de automóviles, no logró una posición central en la cadena de suministro de conducción autónoma de gama alta. Daxiao Robot nace en un momento de auge de la IA encarnada. La financiación se destinará principalmente al desarrollo del "modelo mundial 3.0 Kaiwu", entrenamiento a gran escala, control de accionamiento directo en el dispositivo y soluciones comerciales integradas de hardware y software para sectores como el comercio minorista y la seguridad. Sin embargo, el camino es desafiante. Desarrollar un modelo mundial requiere enormes inversiones en potencia de cálculo, datos e ingeniería. Además, SenseTime, su matriz, acumula pérdidas desde 2018, por lo que Daxiao Robot necesita capital externo para sostener sus costosos proyectos de I+D y comercialización. Dirigida por Wang Xiaogang, cofundador de SenseTime, Daxiao Robot combina los recursos técnicos y de capital del grupo, pero también puede heredar su inercia organizativa. El sector de la IA encarnada sigue en una fase inicial, donde la agilidad de las startups jóvenes contrasta con el enfoque de SenseTime. La clave para Daxiao Robot será transformar su ventaja técnica en liderazgo comercial, evitando el camino de Jueying. Debe integrar rápidamente su modelo mundial, datos, control y aplicaciones para establecer una entrega estable y replicable. El capital le ha dado un buen comienzo, pero ahora debe demostrar que puede materializar el potencial industrial de la IA en un campo aún más complejo y costoso.

marsbit06/15 08:45

El legado inacabado de Jueying, DaXiao Robot busca rápidamente 'financiamiento'

marsbit06/15 08:45

活动图片