# Pré-entraînement Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Pré-entraînement", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

10000 heures de données humaines pour former le premier modèle d'action et de monde implicite pour la manipulation mobile complète du corps humain

Ces deux dernières années, la compétition dans le domaine des robots humanoïdes s'est déplacée des capacités matérielles vers les modèles d'intelligence. Alors que les démonstrations physiques impressionnent, le véritable défi réside dans la capacité des robots à comprendre l'environnement, prévoir les changements et coordonner des actions motrices complexes pour des tâches généralistes. Pour relever ce défi, la société d'intelligence incarnée Being Beyond a présenté **Being-M0.7**, présenté comme le premier **modèle d'action-monde latent (Latent WAM)** conçu pour la locomotion et la manipulation complètes des robots humanoïdes. Ce modèle innove en étendant les capacités des modèles de monde latent, habituellement appliqués à la manipulation, à la coordination mobile de tout le corps. La clé de Being-M0.7 réside dans son entraînement préalable sur plus de **10 000 heures de données multimodales centrées sur l'humain** (vidéos à la première personne, séquences de mouvement), suivies d'un ajustement avec une quantité limitée de données de démonstration sur robot réel. Cette approche contourne la rareté et le coût élevé des données robotiques. Techniquement, le modèle utilise une architecture **Vision-Motion Mixture of Transformers (MoT)**. Cette conception lui permet de traiter simultanément trois types de données : des paires vidéo-mouvement, des vidéos seules et des séquences de mouvement seules, maximisant ainsi l'utilisation des données disponibles. Il opère dans un **espace latent**, prédisant l'évolution future de l'environnement et les trajectoires de mouvement de manière couplée, ce qui est plus efficace que la prédiction pixel par pixel coûteuse en calcul. Pour unifier les données humaines et robotiques, l'équipe a développé une **représentation du mouvement unifiée et compacte**, alignée sur la perspective à la première personne et centrée sur la tête, les mains et les pieds, facilitant le transfert de connaissances. Les démonstrations sur le robot humanoïde Unitree G1 ont testé des tâches complexes nécessitant une compréhension physique et une coordination complète du corps : * **Pêcher un poisson dans un aquarium** : Interaction avec un liquide et des cibles dynamiques. * **Prendre un objet via un miroir** : Raisonnement spatial avec observation partielle. * **Déplacer et prendre des objets en se déplaçant** : Tâche à long terme avec coordination continue. * **Porter une boîte et éviter des obstacles** : Navigation avec charge et perception de l'environnement. Dans ces tests, Being-M0.7 a montré des performances compétitives par rapport à d'autres modèles de base, démontrant une capacité accrue à générer des actions corporelles coordonnées en fonction de la compréhension de la scène et des prédictions. Le processus de déploiement sur robot utilise un **"expert en action"** léger qui traduit les prédictions de haut niveau du modèle latent en commandes de contrôle spécifiques au robot, permettant un **planification mondiale à basse fréquence** couplée à un **contrôle d'action à haute fréquence**. En conclusion, Being-M0.7 représente une avancée significative vers des robots humanoïdes plus généraux. Son architecture MoT et son utilisation de vastes données humaines établissent un paradigme évolutif pour l'apprentissage incarné, où la compréhension du monde, apprise de l'expérience humaine, précède et guide l'action physique dans l'environnement réel.

marsbit07/15 01:55

10000 heures de données humaines pour former le premier modèle d'action et de monde implicite pour la manipulation mobile complète du corps humain

marsbit07/15 01:55

Karpathy monte au créneau : une seule phrase réduit au silence tous les développeurs d'Agent

Andrej Karpathy, chercheur principal chez Anthropic, a récemment critiqué la tendance actuelle à développer rapidement des agents IA sans avoir d'abord maîtrisé les modèles de base sous-jacents. S'appuyant sur son expérience d'un projet avorté chez OpenAI en 2016, il souligne que les technologies de l'époque, comme l'apprentissage par renforcement, n'étaient pas prêtes. Aujourd'hui, il avertit que créer une démo d'agent est simple, mais en faire un produit viable peut prendre une décennie, comme l'ont montré les domaines de la conduite autonome et de la VR. Il conseille aux développeurs de se concentrer d'abord sur le renforcement des modèles de fondation (LLMs), affirmant que des agents robustes émergeront naturellement d'une base solide. Pour progresser, il suggère même de s'inspirer des neurosciences, en étudiant des structures cérébrales comme l'hippocampe ou le thalamus. Cependant, Karpathy offre aussi une lueur d'espoir aux startups et développeurs indépendants. Il estime que dans le domaine des agents, les grandes entreprises comme OpenAI n'ont pas d'avance décisive de plusieurs années. L'innovation la plus percutante viendra donc probablement de ceux qui sont agiles, expérimentent rapidement et sont prêts à s'engager sur le long terme. Son message central est clair : il ne faut pas négliger les fondamentaux pour courir après la mode éphémère des démonstrations.

marsbit07/06 02:36

Karpathy monte au créneau : une seule phrase réduit au silence tous les développeurs d'Agent

marsbit07/06 02:36

Première mondiale : un VLA pré-entraîné sur des vidéos humaines pures pour une manipulation habile, déployable après un finetuning avec peu de données

Pour la première fois, une étude démontre l'utilisation exclusive de vidéos humaines pour le pré-entraînement d'un modèle Vision-Langage-Action (VLA) destiné à la manipulation robotique dextre. Le cadre VITRA, développé par Microsoft Research Asie et l'Université Tsinghua, convertit automatiquement de vastes quantités de vidéos d'activités humaines non étiquetées en un ensemble de données V-L-A aligné, comprenant 1 million de clips. Le processus automatique repose sur trois piliers : l'annotation 3D des mouvements de la main, la segmentation des actions atomiques basée sur la vitesse, et la génération d'instructions linguistiques par un VLM (comme GPT-4) guidé par la trajectoire. Pré-entraîné sur ces données humaines diversifiées, le modèle VLA (combinant un VLM et un expert d'actions par diffusion) montre une forte capacité de prédiction d'actions en situation de zéro-shot dans des environnements inédits. Après un micro-ajout nécessitant seulement ~1.2k démonstrations robotiques réelles, il réussit à déployer sur un véritable robot (équipé de la main dextre StarMove XHAND1) des tâches complexes comme saisir, placer, verser ou balayer, avec un taux de réussite élevé et une robustesse remarquable face à de nouveaux objets et arrière-plans. Cette approche réduit considérablement le coût d'acquisition des données robotiques et ouvre la voie à des systèmes d'intelligence incarnée plus généralisables.

marsbit06/08 08:58

Première mondiale : un VLA pré-entraîné sur des vidéos humaines pures pour une manipulation habile, déployable après un finetuning avec peu de données

marsbit06/08 08:58

L'ancien élève de Tsinghua, Wang Guan, né dans les années 2000, présente une nouvelle création : Un modèle de pré-entraînement Transformer révolutionné avec 1/900 des tokens et 1/432 de la puissance de calcul

Des chercheurs dirigés par Wang Guan, alumni de Tsinghua, ont proposé HRM-Text, un modèle de pré-entraînement de langage efficace reposant sur un modèle récurrent hiérarchique (HRM) qui remplace le Transformer standard. Leur approche utilise une architecture à double échelle temporelle (modules lent H et rapide L) permettant des mises à jour récursives multiples par token, augmentant ainsi la profondeur de calcul sans ajouter de paramètres. L'objectif d'entraînement est également revu : au lieu d'un pré-entraînement autorégressif standard, le modèle est entraîné directement sur des paires instruction-réponse, avec une perte calculée uniquement sur la réponse et un masque PrefixLM. Les résultats sont remarquables en termes d'efficacité. Avec seulement 1 milliard de paramètres et 40 milliards de tokens uniques, pour un coût estimé à environ 1500 dollars, HRM-Text atteint des performances comparables à des modèles open source de 2B à 7B paramètres sur des benchmarks comme MMLU (60,7%), ARC-C (81,9%) et GSM8K (84,5%). Cela représente une réduction d'un facteur allant jusqu'à 900x des tokens d'entraînement et 432x de l'estimation de calcul par rapport aux modèles de référence. Les expériences montrent que HRM-Text surpasse des Transformers de taille similaire dans des conditions de FLOPs alignées, que l'objectif "tâche à accomplir" et le masque PrefixLM améliorent les performances, et que la structure récursive confère une profondeur effective plus importante. Les limites actuelles incluent la couverture des connaissances factuelles, liée à la taille réduite des données, le besoin potentiel d'un temps de calcul adaptatif pour réduire les coûts d'inférence, et des questions d'ingénierie pour le déploiement de PrefixLM. Les travaux futurs exploreront le découplage connaissance/raisonnement et la validation à plus grande échelle.

marsbit05/26 03:20

L'ancien élève de Tsinghua, Wang Guan, né dans les années 2000, présente une nouvelle création : Un modèle de pré-entraînement Transformer révolutionné avec 1/900 des tokens et 1/432 de la puissance de calcul

marsbit05/26 03:20

活动图片