# Modèle Mondial Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Modèle Mondial", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

10000 heures de données humaines pour former le premier modèle d'action et de monde implicite pour la manipulation mobile complète du corps humain

Ces deux dernières années, la compétition dans le domaine des robots humanoïdes s'est déplacée des capacités matérielles vers les modèles d'intelligence. Alors que les démonstrations physiques impressionnent, le véritable défi réside dans la capacité des robots à comprendre l'environnement, prévoir les changements et coordonner des actions motrices complexes pour des tâches généralistes. Pour relever ce défi, la société d'intelligence incarnée Being Beyond a présenté **Being-M0.7**, présenté comme le premier **modèle d'action-monde latent (Latent WAM)** conçu pour la locomotion et la manipulation complètes des robots humanoïdes. Ce modèle innove en étendant les capacités des modèles de monde latent, habituellement appliqués à la manipulation, à la coordination mobile de tout le corps. La clé de Being-M0.7 réside dans son entraînement préalable sur plus de **10 000 heures de données multimodales centrées sur l'humain** (vidéos à la première personne, séquences de mouvement), suivies d'un ajustement avec une quantité limitée de données de démonstration sur robot réel. Cette approche contourne la rareté et le coût élevé des données robotiques. Techniquement, le modèle utilise une architecture **Vision-Motion Mixture of Transformers (MoT)**. Cette conception lui permet de traiter simultanément trois types de données : des paires vidéo-mouvement, des vidéos seules et des séquences de mouvement seules, maximisant ainsi l'utilisation des données disponibles. Il opère dans un **espace latent**, prédisant l'évolution future de l'environnement et les trajectoires de mouvement de manière couplée, ce qui est plus efficace que la prédiction pixel par pixel coûteuse en calcul. Pour unifier les données humaines et robotiques, l'équipe a développé une **représentation du mouvement unifiée et compacte**, alignée sur la perspective à la première personne et centrée sur la tête, les mains et les pieds, facilitant le transfert de connaissances. Les démonstrations sur le robot humanoïde Unitree G1 ont testé des tâches complexes nécessitant une compréhension physique et une coordination complète du corps : * **Pêcher un poisson dans un aquarium** : Interaction avec un liquide et des cibles dynamiques. * **Prendre un objet via un miroir** : Raisonnement spatial avec observation partielle. * **Déplacer et prendre des objets en se déplaçant** : Tâche à long terme avec coordination continue. * **Porter une boîte et éviter des obstacles** : Navigation avec charge et perception de l'environnement. Dans ces tests, Being-M0.7 a montré des performances compétitives par rapport à d'autres modèles de base, démontrant une capacité accrue à générer des actions corporelles coordonnées en fonction de la compréhension de la scène et des prédictions. Le processus de déploiement sur robot utilise un **"expert en action"** léger qui traduit les prédictions de haut niveau du modèle latent en commandes de contrôle spécifiques au robot, permettant un **planification mondiale à basse fréquence** couplée à un **contrôle d'action à haute fréquence**. En conclusion, Being-M0.7 représente une avancée significative vers des robots humanoïdes plus généraux. Son architecture MoT et son utilisation de vastes données humaines établissent un paradigme évolutif pour l'apprentissage incarné, où la compréhension du monde, apprise de l'expérience humaine, précède et guide l'action physique dans l'environnement réel.

marsbit07/15 01:55

10000 heures de données humaines pour former le premier modèle d'action et de monde implicite pour la manipulation mobile complète du corps humain

marsbit07/15 01:55

À l'instant, le premier modèle mondial ultra-haute fréquence est né, sans NVIDIA, fonçant à 50 images par seconde

Le premier modèle de monde « Flash World Model », MoWorld, développé par MoXin Tech et l'équipe académique du Pr Pan Yunhe de l'Université du Zhejiang, vient de briser une barrière majeure : la vitesse en temps réel. Alors que le secteur peinait souvent en dessous de 10 images par seconde (FPS), ce modèle atteint un rendu supérieur à 50 FPS, franchissant le seuil critique des 30 FPS nécessaire à l'immersion. Particulièrement notable, cette avancée s'appuie entièrement sur des NPU (unités de traitement neuronal) chinois, formant une boucle complète de développement, de la formation au déploiement, sans utiliser de GPU NVIDIA. Cette approche a permis de réduire les coûts d'inférence de 70% par rapport à des configurations GPU de taille similaire. MoWorld, un modèle de 14 milliards de paramètres de type Mixture of Experts (MoE), a été optimisé pour les NPU, avec des techniques comme l'attention parallèle ultra-dense et la quantification de précision dynamique. Il offre un contrôle fluide à 6 degrés de liberté pour une exploration immersive. Ses applications potentielles sont vastes : création de terrains d'entraînement virtuels haute fidélité pour la robotique et les véhicules autonomes, génération de mondes pour le divertissement interactif et les jeux, prévisualisation en temps réel pour la production cinématographique, et reconstruction 3D précise pour les jumeaux numériques. Ce projet démontre la viabilité d'une pile technologique nationale pour les modèles de monde et ouvre la voie à une adoption industrielle plus large grâce à ses performances en temps réel et ses coûts réduits. MoXin Tech a récemment levé plus d'un milliard de dollars auprès d'investisseurs stratégiques et de fonds de capital-risque.

marsbit07/08 04:19

À l'instant, le premier modèle mondial ultra-haute fréquence est né, sans NVIDIA, fonçant à 50 images par seconde

marsbit07/08 04:19

Star Dynamics lève 2,5 milliards en deux mois, les capitaux d'État rejoignent le mouvement

La startup chinoise de robotique « embodied AI » Xingdong Jiyuan a levé 10 milliards de yuans (environ 1,4 milliard de dollars) le 6 juillet, portant le total de ses financements à 25 milliards de yuans en deux mois. Ce tour de table, mené par des fonds d’État dont China Reform Holdings, marque un fort soutien institutionnel. Issue de l’Université Tsinghua et fondée en 2023 par Chen Jianyu, la société se distingue par sa stratégie « AI Native » et son approche pionnière des « modèles mondiaux » (world models) pour l’intelligence incarnée. Elle développe en interne une pile technologique complète, allant des algorithmes et des données jusqu’aux actionneurs et aux robots. Un élément clé de sa stratégie est le développement de mains robotisées hautes performances (série XHAND). Conçues pour collecter des données de haute qualité lors d’interactions physiques, elles alimentent l’entraînement des modèles d’IA de la société, créant ainsi une boucle vertueuse entre le matériel et l’intelligence. Sur le plan commercial, Xingdong Jiyuan a atteint un Product-Market Fit dans la logistique, avec des robots déployés chez des acteurs majeurs comme SF Express et China Post, fonctionnant 24h/24 pour le tri de colis. La société étend également ses applications à la fabrication haut de gamme (avec des partenaires comme Samsung, Lenovo) et aux services commerciaux. Avec une base de données étendue issue de scénarios réels et un écosystème d’investisseurs mêlant capitaux publics, financiers et industriels, la société vise à construire un avantage concurrentiel durable à l’ère où la mise à l’échelle commerciale et la supériorité technologique deviennent déterminantes dans le secteur de l’IA incarnée.

marsbit07/06 01:40

Star Dynamics lève 2,5 milliards en deux mois, les capitaux d'État rejoignent le mouvement

marsbit07/06 01:40

Introduction au Concept de Modèle du Monde : Une Histoire de la Psychologie à l'AI

Le concept de "modèle du monde" (World Model) est aujourd'hui central en IA, bien que sa définition reste floue. Il s'agit de doter les machines d'un "sandbox mental" interne, capable de prédire et de simuler les conséquences d'actions avant leur exécution réelle, à l'instar de la réflexion humaine. Cette capacité est cruciale pour des applications comme la conduite autonome, la robotique ou la création de contenus. L'idée puise ses racines dans les travaux du psychologue Kenneth Craik (1943) et a été reprise en IA par des pionniers comme Marvin Minsky. Le terme a été remis au goût du jour en 2018 par David Ha et Jürgen Schmidhuber. Aujourd'hui, les approches divergent. Des chercheurs comme Yann LeCun (avec son architecture JEPA) privilégient la prédiction en espace abstrait pour comprendre la physique. D'autres, comme Fei-Fei Li, proposent une taxonomie distinguant les modèles qui *rendent* (pixels), *simulent* (états physiques) ou *planifient* (actions). OpenAI (Sora), Google DeepMind (Genie 3) et NVIDIA (Cosmos) développent des "simulateurs du monde" génératifs basés sur des vidéos. Dans l'industrie, les acteurs chinois (Alibaba, Tencent, constructeurs automobiles) développent leurs propres solutions, souvent centrées sur des cas d'usage concrets comme la conduite autonome. Techniquement, trois voies coexistent : la génération de pixels (comme Sora), la prédiction en espace latent (comme JEPA), et la création d'environnements 3D paramétriques (comme Omniverse). La tendance est à leur convergence vers un modèle unifié. Un paradigme émergent en 2026 est le "World Action Model" (WAM), qui intègre directement la génération d'actions et la prédiction de l'état futur en un seul système, visant une meilleure "unité de la pensée et de l'action" pour les robots. Malgré la confusion des définitions, un consensus se dégage sur l'objectif final : créer pour les machines une représentation interne du monde, exploitable pour raisonner, planifier et agir de manière plus sûre et générale. Cette période de flou terminologique est typique des phases de rupture technologique et signale l'entrée du concept sur le champ de bataille principal de l'IA.

marsbit06/29 05:16

Introduction au Concept de Modèle du Monde : Une Histoire de la Psychologie à l'AI

marsbit06/29 05:16

Première certification antidéflagrante nationale, première solution mondiale de "cerveau de pompe à essence" : comment ont-ils obtenu ces deux "premières"

Cette année, le secteur de l'intelligence incarnée en Chine a attiré plus de 37 milliards de yuans de financement, marquant une année cruciale pour sa commercialisation. La question centrale est de savoir comment déployer cette technologie dans des environnements réels difficiles. Le premier défi majeur pour les robots dans des lieux comme les stations-service ou les usines pétrochimiques est l'obtention de la certification anti-déflagrante, exigeant une conception matérielle intrinsèquement sûre pour éviter tout risque d'étincelle. L'article examine deux scénarios d'application critiques. Dans les stations-service, le robot doit réaliser une longue séquence d'actions précises (ouvrir le bouchon, saisir et insérer le pistolet, etc.) avec une tolérance de quelques millimètres, tout en s'adaptant à différents modèles de véhicules. Pour la patrouille d'infrastructures, les défis sont l'autonomie prolongée, la détection d'anomalies et la réponse immédiate. Face à ces tâches complexes et séquentielles, l'architecture traditionnelle en pipeline montre ses limites. L'article présente une nouvelle approche fondée sur des modèles du monde, comme H-GAR (Hierarchical Goal-Aware Reasoning), qui permet au robot de prédire l'état final souhaité et de planifier rétroactivement les étapes intermédiaires. Ce mécanisme, combinant un module de synthèse d'observations conditionné par l'objectif et un module d'affinage d'actions, confère au robot une capacité de raisonnement prospectif ("voir trois pas à l'avance") pour aligner ses actions sur le but final, réduisant ainsi les erreurs cumulatives. L'entrée dans ces secteurs exige une approche à long terme et un couplage profond entre le "cerveau" (l'intelligence) et le "corps" (la plateforme robotique) dès la conception. Les acteurs maîtrisant cette boucle fermée "cerveau-corps-données" seront probablement les mieux placés pour réussir la commercialisation dans des environnements industriels exigeants.

marsbit06/26 03:53

Première certification antidéflagrante nationale, première solution mondiale de "cerveau de pompe à essence" : comment ont-ils obtenu ces deux "premières"

marsbit06/26 03:53

Un docteur né après 1995 se consacre au modèle mondial, FaceMind lève des dizaines de millions de yuans

La société d'IA FaceMind, dirigée par Lu Hongyuan, un docteur né après 1995, a levé des dizaines de millions de yuans en financement Pre-A auprès de Xinglian Capital, avec un suivi important de l'actionnaire existant 360. Fondée en 2023, FaceMind s'est d'abord concentrée sur les modèles multimodaux côté client avant de se tourner vers la recherche fondamentale sur les modèles du monde. Les travaux de l'équipe, notamment sur les problèmes des mots basse fréquence (SLoW) et la loi d'Adam, ont attiré l'attention, cette dernière étant même reprise par Anthropic. Le modèle du monde de FaceMind vise à prédire les changements dans un environnement, comme les interfaces graphiques ou pour la robotique incarnée. Leur produit "叠叠社" sert de banc d'essai précoce. Leur approche privilégie l'efficacité des paramètres et l'architecture itérative plutôt que la simple augmentation de l'échelle des modèles. Les investisseurs saluent les compétences de recherche fondamentale et d'exécution technique de l'équipe. FaceMind teste actuellement ses capacités dans divers scénarios (environnements de simulation, agents d'interface, bras robotiques) et prévoit de fournir des services complets aux fabricants de robots, plateformes de contenu et sociétés de puces/cloud. Avec ce financement, la jeune entreprise entend intensifier ses efforts de R&D sur les modèles du monde et leur validation dans de multiples applications, visant à devenir un acteur des futures infrastructures d'IA.

marsbit06/26 01:53

Un docteur né après 1995 se consacre au modèle mondial, FaceMind lève des dizaines de millions de yuans

marsbit06/26 01:53

La guerre sans nom unifié : la cartographie mondiale des modèles des grandes entreprises chinoises

Le terme « modèle du monde » n’a pas encore de désignation unique dans l'industrie. Chaque grand acteur développe sa propre version sous différents noms : modèle du monde, modèle physique d'IA, ou intégré dans des systèmes de conduite autonome, de VLA ou d'intelligence incarnée. L'objectif commun est de permettre aux machines de créer un environnement dynamique interne, simulable et rejouable, réduisant ainsi la dépendance aux données réelles et transformant le monde physique en un moteur de données génératif et infini. Les géants d'Internet comme Alibaba, Tencent, ByteDance, Huawei et Baidu explorent divers aspects, des mondes langagiers et virtuels aux reconstructions 3D et jumeaux numériques, souvent en lien avec leurs écosystèmes (jeux, réseaux sociaux, cloud). Les constructeurs automobiles (NIO, Li Auto, XPeng, Geely, etc.) l'utilisent comme un « simulateur de conduite » avancé pour générer des scénarios complexes, entraîner les systèmes de pilotage autonome et accélérer les itérations. Les fournisseurs de solutions de conduite autonome (Momenta, Horizon Robotics, Haomo.ai, etc.) en font un « moteur invisible » intégré à leurs plateformes, visant une validation massive et la future norme L4. Les startups, bien qu'agiles et innovantes, manquent souvent de données, de puissance de calcul et de débouchés industriels comparés aux grands groupes. Ces derniers transforment progressivement le modèle du monde d'un projet de R&D en une infrastructure opérationnelle au cœur de leurs produits (voitures, robots, jeux). La compétition évolue ainsi de « qui a un modèle » vers « dont le modèle comprend et simule réellement le monde physique de manière utile et déployable ». La course est désormais lancée pour maîtriser cette nouvelle couche fondamentale de l'intelligence artificielle.

marsbit06/25 06:59

La guerre sans nom unifié : la cartographie mondiale des modèles des grandes entreprises chinoises

marsbit06/25 06:59

Compte à rebours pour GPT-5.6 : Abandonnez l'illusion d'une API unique, même une évolution rapide du calcul ne résiste pas à une simple réglementation

Mi-juin 2026, trois événements majeurs (la restriction d'accès de Fable 5, l'open-sourcing de GLM-5.2, l'annonce imminente de GPT-5.6) marquent un tournant pour l'industrie de l'IA. La logique sous-jacente de la chaîne d'approvisionnement des grands modèles se réorganise. La disponibilité et la conformité surpassent désormais la simple avancée technique. Le cas de Fable 5, limité aux seuls citoyens américains pour des raisons de contrôle à l'export, prouve qu'une capacité technique de pointe peut être rendue inaccessible par la réglementation. En parallèle, le modèle open-source GLM-5.2 démontre des performances proches des leaders tout en réduisant drastiquement les coûts, offrant une alternative viable et stable pour les entreprises, notamment face aux risques géopolitiques. En réponse, les géants du modèle fermé comme OpenAI recentrent leurs efforts. Les fuites sur GPT-5.6 suggèrent un virage stratégique vers l'intelligence spatiale et les « modèles du monde », des domaines nécessitant d'immenses ressources en calcul, pour tenter de recréer un écart de génération dans des applications comme la simulation industrielle ou la robotique. La conclusion est claire : pour les développeurs d'applications, dépendre exclusivement d'une API propriétaire unique expose à des risques incontrôlables. Concevoir des architectures « agnostiques » au modèle, permettant de basculer rapidement entre solutions fermées et open-source locales, devient une condition essentielle à la continuité des activités. L'ère du choix unique basé uniquement sur la performance technique est révolue.

marsbit06/21 04:44

Compte à rebours pour GPT-5.6 : Abandonnez l'illusion d'une API unique, même une évolution rapide du calcul ne résiste pas à une simple réglementation

marsbit06/21 04:44

L'Ombre des Ombres n'est pas achevée, le robot DaXiao cherche rapidement des "financements"

Selon un article de WeChat, Dahiro Robotics, une entreprise liée à SenseTime, a levé plusieurs centaines de millions de dollars au premier semestre 2026 auprès d'investisseurs prestigieux. Ce financement soutient le développement de son « modèle du monde 3.0 » et de solutions intégrées matérielles-logicielles pour des robots dans la vente au détail, la sécurité et l'hôtellerie. L'article présente Dahiro comme le nouveau pari de SenseTime dans l'IA « physique », après l'expérience mitigée de son activité véhicules autonomes, Jueying. Bien que Jueying ait atteint une production de masse, elle n'a pas réussi à s'imposer comme un acteur clé face à la concurrence. Le défi de Dahiro est considérable. Le développement de modèles du monde, essentiels pour que les robots comprennent et agissent dans l'environnement physique, est extrêmement coûteux en calcul, données et ingénierie. Alors que SenseTime, toujours en période de réduction des pertes, ne peut financer seul cette aventure, cette levée de fonds externe est cruciale pour partager les coûts. Dirigée par Wang Xiaogang, cofondateur de SenseTime, Dahiro bénéficie des ressources du groupe mais doit aussi éviter sa lourdeur. Le secteur de l'IA incarnée est très concurrentiel, porté par de jeunes fondateurs. Pour réussir là où Jueying a peiné, Dahiro doit rapidement transformer ses avancées techniques en solutions commerciales viables et en revenus récurrents, dans une course où les capitaux se consomment rapidement.

marsbit06/15 08:45

L'Ombre des Ombres n'est pas achevée, le robot DaXiao cherche rapidement des "financements"

marsbit06/15 08:45

En trois mois, 35 milliards de yuans, les investisseurs se disputent l'"OpenAI du monde physique"

Une course effrénée des investisseurs s'engage vers l'AGI physique. La start-up chinoise Jijia Shijie (Excellent Vision) vient de boucler un financement de 3,5 milliards de yuans en seulement trois mois, portant sa valorisation à plus de 10 milliards. Dirigée par Huang Guan, un docteur de 30 ans de l'Université Tsinghua, l'entreprise attire un large éventail de fonds d'investissement nationaux et internationaux. La stratégie de Jijia Shijie repose sur un système en « double pyramide » combinant algorithmes et données, et centré sur un « modèle du monde » pour comprendre et interagir avec l'environnement physique. Ses modèles phares, GigaBrain et GigaWorld, ont obtenu des premières places dans des benchmarks mondiaux. La société vise le « moment GPT-3 » de l'AGI physique, où des capacités émergentes se manifesteront. Concrètement, Jijia Shijie déploie sa technologie sur deux fronts : grand public (robot domestique polyvalent « Shiguang S1 ») et industriel (robots « Maker » pour l'automatisation des usines et modèle de conduite autonome « DriveDreamer »). Ces déploiements génèrent des données et des revenus essentiels pour alimenter la boucle d'amélioration de ses modèles. L'objectif ultime est de dépasser l'AGI purement numérique pour créer une intelligence capable d'agir dans le monde physique, remodelant potentiellement les modes de production et la vie quotidienne. Les investisseurs parient que ce futur est proche.

marsbit06/15 01:36

En trois mois, 35 milliards de yuans, les investisseurs se disputent l'"OpenAI du monde physique"

marsbit06/15 01:36

活动图片