# VLA Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "VLA", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

Le moment « iPhone » de l'intelligence incarnée est-il sur le point d'arriver ?

Les experts s'accordent à dire que l'intelligence incarnée, et en particulier la robotique humanoïde, en est encore à ses débuts, comparée à l'ère des premiers téléphones portables ("briques") et loin d'un "moment iPhone". La locomotion (le "cervelet") est maîtrisée, mais la prise de décision et la généralisation (le "cerveau") posent encore défi. Le principal goulot d'étranglement est le manque criant de données (un déficit de 200 fois par rapport au million nécessaire), cruciales pour l'entraînement des modèles comme les VLA (Vision-Language-Action) ou les modèles du monde. Sur le plan commercial, la rentabilité n'est pas encore au rendez-vous, les coûts dépassant largement ceux de la main-d'œuvre humaine. Trois marchés potentiels se dessinent : celui de la valeur émotionnelle (divertissement, compagnie, estimé à des milliards), celui des services commerciaux (guidage, accueil, estimé à des centaines de milliards) et, à plus long terme, celui des tâches productives (usine, maison, estimé à des centaines de milliers de milliards). Les applications pourraient d'abord se développer via des robots non humanoïdes (comme les robots de livraison) pour des tâches plus simples. Les experts soulignent également l'importance cruciale de l'écosystème, notamment la collecte et le partage de données, et le besoin de modèles plus accessibles. Enfin, si l'IA générative est largement utilisée pour booster la productivité (code, recherche), les décisions critiques doivent rester humaines, l'IA présentant des risques de "tromperie" et de substitution cognitive. La route vers l'AGI physique est longue mais prometteuse.

marsbit07/14 05:20

Le moment « iPhone » de l'intelligence incarnée est-il sur le point d'arriver ?

marsbit07/14 05:20

Star Dynamics lève 2,5 milliards en deux mois, les capitaux d'État rejoignent le mouvement

La startup chinoise de robotique « embodied AI » Xingdong Jiyuan a levé 10 milliards de yuans (environ 1,4 milliard de dollars) le 6 juillet, portant le total de ses financements à 25 milliards de yuans en deux mois. Ce tour de table, mené par des fonds d’État dont China Reform Holdings, marque un fort soutien institutionnel. Issue de l’Université Tsinghua et fondée en 2023 par Chen Jianyu, la société se distingue par sa stratégie « AI Native » et son approche pionnière des « modèles mondiaux » (world models) pour l’intelligence incarnée. Elle développe en interne une pile technologique complète, allant des algorithmes et des données jusqu’aux actionneurs et aux robots. Un élément clé de sa stratégie est le développement de mains robotisées hautes performances (série XHAND). Conçues pour collecter des données de haute qualité lors d’interactions physiques, elles alimentent l’entraînement des modèles d’IA de la société, créant ainsi une boucle vertueuse entre le matériel et l’intelligence. Sur le plan commercial, Xingdong Jiyuan a atteint un Product-Market Fit dans la logistique, avec des robots déployés chez des acteurs majeurs comme SF Express et China Post, fonctionnant 24h/24 pour le tri de colis. La société étend également ses applications à la fabrication haut de gamme (avec des partenaires comme Samsung, Lenovo) et aux services commerciaux. Avec une base de données étendue issue de scénarios réels et un écosystème d’investisseurs mêlant capitaux publics, financiers et industriels, la société vise à construire un avantage concurrentiel durable à l’ère où la mise à l’échelle commerciale et la supériorité technologique deviennent déterminantes dans le secteur de l’IA incarnée.

marsbit07/06 01:40

Star Dynamics lève 2,5 milliards en deux mois, les capitaux d'État rejoignent le mouvement

marsbit07/06 01:40

Il vient de lever 2,7 milliards, et Fei-Fei Li y a investi.

Le chercheur en intelligence artificielle Pete Florence, ancien employé de Google DeepMind et co-créateur de l'architecture VLA (Vision-Language-Action), a levé 400 millions de dollars (environ 2,7 milliards de RMB) pour sa startup Generalist AI, portant sa valorisation à 2 milliards de dollars. Parmi les investisseurs figurent NVentures (NVIDIA), Bezos Expeditions, ainsi que des personnalités comme Li Fei-Fei, co-fondateur de Xiaomi Lin Bin et le fondateur de Zoom, Eric Yuan. Contrairement à la tendance actuelle, Florence rejette catégoriquement l'étiquette "modèle du monde" pour son entreprise. Issu du MIT et influencé par son mentor Russ Tedrake, il prône une approche orientée "objectif" plutôt que "technologie". Pour lui, l'objectif ultime n'est pas de construire un modèle du monde, mais de créer des robots capables d'accomplir avec un taux de réussite et une vitesse élevés des tâches variées et inédites, sans nécessiter de données spécifiques. Generalist AI a dévoilé deux modèles d'intelligence incarnée : GEN-0 en novembre 2025, démontrant que les lois d'échelle des LLM s'appliquent au mouvement physique, et GEN-1 en avril 2026. Ce dernier, entraîné sur plus de 500 000 heures de données collectées via un dispositif portable, atteint un taux de réussite de 99% sur des tâches manuelles précises comme plier des cartons. Florence estime que GEN-1 approche d'un point d'inflexion similaire à GPT-3, avec des performances atteignant un niveau utile pour des déploiements commerciaux. Ce financement record, intervenu rapidement après la démonstration de GEN-1, valide la vision pragmatique de Florence : développer des robots généralistes réellement utiles en se concentrant sur la résolution de tâches physiques concrètes.

marsbit06/20 06:10

Il vient de lever 2,7 milliards, et Fei-Fei Li y a investi.

marsbit06/20 06:10

Première mondiale : un VLA pré-entraîné sur des vidéos humaines pures pour une manipulation habile, déployable après un finetuning avec peu de données

Pour la première fois, une étude démontre l'utilisation exclusive de vidéos humaines pour le pré-entraînement d'un modèle Vision-Langage-Action (VLA) destiné à la manipulation robotique dextre. Le cadre VITRA, développé par Microsoft Research Asie et l'Université Tsinghua, convertit automatiquement de vastes quantités de vidéos d'activités humaines non étiquetées en un ensemble de données V-L-A aligné, comprenant 1 million de clips. Le processus automatique repose sur trois piliers : l'annotation 3D des mouvements de la main, la segmentation des actions atomiques basée sur la vitesse, et la génération d'instructions linguistiques par un VLM (comme GPT-4) guidé par la trajectoire. Pré-entraîné sur ces données humaines diversifiées, le modèle VLA (combinant un VLM et un expert d'actions par diffusion) montre une forte capacité de prédiction d'actions en situation de zéro-shot dans des environnements inédits. Après un micro-ajout nécessitant seulement ~1.2k démonstrations robotiques réelles, il réussit à déployer sur un véritable robot (équipé de la main dextre StarMove XHAND1) des tâches complexes comme saisir, placer, verser ou balayer, avec un taux de réussite élevé et une robustesse remarquable face à de nouveaux objets et arrière-plans. Cette approche réduit considérablement le coût d'acquisition des données robotiques et ouvre la voie à des systèmes d'intelligence incarnée plus généralisables.

marsbit06/08 08:58

Première mondiale : un VLA pré-entraîné sur des vidéos humaines pures pour une manipulation habile, déployable après un finetuning avec peu de données

marsbit06/08 08:58

Du code à la cognition : un guide de dix mille mots sur l'évolution du cerveau robotique

Auteur: Matt White, CTO AI mondial de la Linux Foundation. Compilé par: Felix, PANews. Cette longue exploration retrace l'évolution de l'intelligence des robots, des systèmes classiques codés à la main aux approches modernes fondées sur l'IA. **L'ère pré-LLM** était dominée par une pile logicielle modulaire (perception, estimation d'état, planification, contrôle) et des arbres de comportement, prévisible mais peu adaptable. **L'apprentissage automatique** a ensuite révolutionné la perception (réseaux neuronaux) et le contrôle (apprentissage par renforcement, imitation), mais chaque compétence restait étroite et spécifique. **L'avènement des LLM** a introduit un planificateur en langage naturel, capable de décomposer une instruction en séquences d'actions atomiques exécutées par des contrôleurs existants (ex: SayCan de Google). Le saut suivant fut les **modèles Vision-Langage-Action (VLA)**, comme RT-2 de DeepMind ou OpenVLA. Ces réseaux de neurones unifiés fusionnent flux visuel et instruction linguistique pour générer directement des commandes motrices, couplant raisonnement et action. Les architectures les plus performantes, comme le GR00T de NVIDIA ou Helix de Figure AI, adoptent une **stratégie à "deux cerveaux"** : un système 2 lent (VLA, ~7-9 Hz) pour la réflexion et un système 1 rapide (~200 Hz) pour l'exécution réactive, avec parfois un système 0 réflexe pour l'équilibre. Les calculs critiques s'exécutent localement (ex: sur module NVIDIA Jetson) pour la latence et la fiabilité. **L'essor des modèles open-source** (OpenVLA, GR00T N1.7, π0) est crucial, permettant aux startups de raffiner des bases pré-entraînées avec leurs propres données, accélérant le développement et favorisant l'audit de sécurité. Cependant, des défis persistent : récupération après erreur, efficacité des données, généralisation entre corps robotiques, planification à long terme et raisonnement physique/spatial. C'est là qu'interviennent les **modèles du monde (World Models)**, comme NVIDIA Cosmos ou Meta V-JEPA 2. Ces réseaux prédisent les conséquences futures d'une action (simulant une vidéo). Ils permettent au robot d'évaluer mentalement plusieurs scénarios avant d'agir, améliorant la reprise, la généralisation et la planification. Différentes approches architecturales coexistent (diffusion de pixels, JEPA, modèles à actions latentes). L'acquisition de **données** (téléopération) reste un gouffre clé. La simulation (Isaac Sim) permet un entraînement massif. Les coûts matériels chutent rapidement (ex: robots humanoïdes à ~2500$). Les modes de défaillance des robots pilotés par LLM peuvent être étranges, nécessitant des contraintes de sécurité. En conclusion, l'intelligence robotique migre progressivement du code des ingénieurs vers des modèles apprenant le monde lui-même. Nous en sommes à une phase de progression constante (analogue à GPT-2 pour l'IA physique), promettant à terme des robots bien plus généraux et adaptatifs. La question évolue de "que peuvent-ils faire ?" vers "que devrions-nous leur faire faire ?".

marsbit06/07 13:08

Du code à la cognition : un guide de dix mille mots sur l'évolution du cerveau robotique

marsbit06/07 13:08

活动图片