Qu'est-ce qu'un modèle du monde exactement ? Comment Lee Fei-Fei, Zhu Jun et d'autres l'interprètent-ils ?
En 2026, le terme « modèle du monde » reste l’un des concepts les moins consensuels en IA. Il désigne aussi bien des systèmes générant des vidéos continues que des environnements numériques interactifs ou des prédicteurs d’états dans un espace latent. Cette diversité rend difficile l’évaluation des capacités réelles de ces modèles.
Face à cette confusion, des chercheurs proposent des cadres pour clarifier ce qu’est un véritable modèle du monde. L’équipe de Fei-Fei Li les classe en « rendu, simulation et planification ». Yann LeCun défend l’apprentissage de structures prédictives dans un espace abstrait.
Le professeur Jun Zhu de l’université Tsinghua propose une vision unificatrice : un modèle du monde général doit posséder trois capacités clés – **compréhension, imagination et action** – formant une boucle fermée. Il détaille une feuille de route en cinq niveaux (L1 à L5) pour mesurer leur évolution, des mondes générés (L1) aux agents autonomes collaboratifs (L5).
Actuellement, la plupart des systèmes atteignent les niveaux L1 à L3. Le défi majeur réside dans l’intégration de deux sources de données : les vidéos internet (riches en connaissances mais sans actions) et les données robotiques (coûteuses mais liant action et résultat). Le laboratoire de Zhu explore cette dualité via des projets comme Vidu (génération vidéo interactive) et Motus (contrôle robotique), validant ainsi la même hypothèse sous-jacente dans les mondes numérique et physique.
L’architecture MoT (Mixture-of-Transformers) vise à unifier le traitement multimodal, permettant aux informations visuelles, linguistiques et motrices de mettre à jour conjointement l’état interne du modèle. Son évolution, Motus2, intègre en outre une boucle d’auto-amélioration où le robot évalue mentalement les conséquences de ses actions avant de les exécuter.
Cette approche, ancrée dans les travaux de long terme de Zhu sur l’apprentissage probabiliste et bayésien, représente une voie technologique distincte vers l’IA générale, complémentaire des approches centrées sur le langage.
En définitive, la course aux modèles du monde ne se jugera plus seulement à la qualité des démonstrations, mais à la capacité des systèmes à **comprendre, imaginer, agir et se corriger** en boucle face à un environnement dynamique, faisant ainsi évoluer le concept d’un simple outil de génération vers une base potentielle de l’intelligence générale.
marsbit09/11 03:11