Le 19 août, Unitree Technology a fait sonner la cloche à la Bourse de Chine (STAR Market), avec une ouverture à 1100 yuans par action et une capitalisation boursière d'environ 444,9 milliards de yuans.
Le même jour, la fille de Jensen Huang, PDG de Nvidia, Huang Minshan, s'est envolée pour Pékin pour visiter le WRC World Robot Conference.

Et le lendemain, à l'heure de Pékin, la société de robotique de la Silicon Valley Generalist AI a dévoilé son nouveau modèle de base GEN-1.5.
Il y a deux mois, la professeure de Stanford Fei-Fei Li venait d'investir personnellement dans le tour de table de 4 milliards de dollars de Generalist AI, aux côtés des business angels Bin Lin, co-fondateur de Xiaomi, et Eric Yuan, fondateur de Zoom. Nvidia est également actionnaire. L'argent intelligent et les esprits brillants convergent vers la même direction.
GEN-1.5 donne la raison de leurs investissements : montrer une démonstration d'action de 3 à 12 secondes à un robot, pas d'entraînement, pas de fine-tuning, exécution immédiate, taux de réussite moyen de 59% sur 10 tâches opérationnelles.

Auparavant, apprendre à un robot à dévisser un bouchon prenait trois mois de programmation à un ingénieur. Aujourd'hui, tout l'investissement requis est une démonstration de trois secondes, et zéro ligne de code.
Plusieurs chercheurs de premier plan comparent ce moment à la sortie de GPT-3 en 2020, estimant que l'intelligence incarnée atteint son moment GPT-3.

Des stratégies non enseignées émergent du pré-entraînement
La capacité de GEN-1.5 qui a le plus choqué les chercheurs n'est pas l'imitation, mais l'improvisation.
Generalist AI a mené une expérience : avec 5 minutes de données de démonstration humaine (fine-tuning de seulement 1 étape de gradient), apprendre à un robot à balayer des blocs de construction dans un bol avec une brosse, puis changer d'outil.
En lui donnant une banane, il utilise la banane comme une brosse, balayant les blocs dans le bol – ce n'est pas étrange, la forme de la banane et la stratégie de contact sont similaires à celles d'une brosse.

En lui donnant une pelle à poussière, il abandonne la stratégie de « balayage », pousse les blocs sur la pelle avec l'autre main, soulève la pelle et verse les blocs dans le bol.

« Balayer » et « pelleter et verser » sont deux séquences de contact complètement différentes, cette action n'a pas été enseignée dans les données d'entraînement.
Generalist AI a utilisé une recherche de voisinage le plus proche dans environ 1,89 million de scénarios de pré-entraînement et n'a trouvé aucun usage similaire de la pelle à poussière.
Personne n'a dit au modèle qu'il devrait faire cela à aucun stade.
Des comportements improvisés similaires sont apparus à plusieurs reprises lors des tests : le bol était recouvert d'un papier, le modèle a soulevé le papier puis placé les blocs, parfois il remettait même le papier, mais cette scène n'était pas dans les données d'entraînement.

Un bloc Lego collé au bout du doigt robotique, le modèle l'a détaché avec l'autre main.

Les données d'entraînement ne démontraient que la rotation d'un couvercle de boîte avec une main, le modèle est spontanément passé à une manipulation à deux mains dans certains essais, adoptant une stratégie de saisie et de rotation complètement différente.

Un modèle entraîné uniquement à placer un bloc dans un bol a commencé spontanément à trier plusieurs blocs par couleur.
Toutes ces capacités ont une origine commune : le pré-entraînement à grande échelle.
GEN-1.5 a été pré-entraîné continuellement pendant plus de 8 mois, traversant trois phases d'entraînement.
La courbe de l'ensemble de validation publiée par Generalist AI montre que l'« erreur de prédiction de l'action suivante » du modèle continue de diminuer, sans montrer de signe de convergence.
En utilisant la terminologie du domaine des grands modèles linguistiques, c'est la Loi d'échelle (Scaling Law) de l'intelligence incarnée : avec l'augmentation de l'échelle des données d'interaction physique et la prolongation du temps d'entraînement, la capacité de généralisation du modèle continue de s'améliorer.
Une découverte contre-intuitive rend cette piste encore plus claire : moins il y a d'étapes de gradient lors du fine-tuning, plus la capacité d'improvisation est forte.
L'explication de Generalist AI est qu'un fine-tuning léger rapproche le modèle de la vaste bibliothèque de comportements accumulés lors du pré-entraînement, conservant davantage d'« expérience physique » pouvant être invoquée.
10 étapes de gradient n'ont modifié que 0,15% des paramètres du modèle.
Selon Generalist AI : cela s'apparente déjà à « rappeler au modèle quelque chose qu'il sait presque déjà ».
GEN-1.5 franchit également deux fossés qui ont longtemps tourmenté le domaine de la robotique.
Enregistrer une démonstration dans un simulateur (bien que les données de pré-entraînement ne contiennent aucune donnée de simulation), l'insérer dans la fenêtre de contexte, le robot réel exécute directement la tâche, et peut généraliser à différentes pinces robotiques et à de nouvelles positions d'objets.
Dans certains tests, une personne a directement effectué une action avec ses mains devant la caméra du robot, et le robot a ensuite reproduit la tâche avec sa pince robotique.
Generalist AI indique que toutes ces capacités ne sont pas le résultat d'une conception délibérée : pas de modification d'architecture spécifique pour favoriser l'apprentissage en contexte, pas de boucle d'apprentissage méta, pas d'objectif d'entraînement auxiliaire encourageant l'improvisation.
Ces capacités sont apparues d'elles-mêmes lors du pré-entraînement sur des données physiques à grande échelle.
« Le Graal de l'apprentissage de la manipulation »
D'autres équipes de recherche avaient auparavant démontré des capacités similaires d'apprentissage en contexte, mais limitées à quelques types de tâches. La nouveauté de GEN-1.5 réside dans son étendue ; tous les résultats sont rapportés par Generalist AI lui-même et n'ont pas encore été vérifiés de manière indépendante.
Les tâches elles-mêmes sont des manipulations simples à courte portée (dévisser un bouchon, fermer une fermeture éclair), restant éloignées des tâches longues et complexes dans des scénarios réels.
GPT-3 a été publié en juin 2020, et il s'est écoulé deux ans et demi entre GPT-3 et ChatGPT (oui, deux ans et demi).
GEN-1.5 se situe actuellement dans une position similaire à celle de GPT-3 en 2020 : capacités brutes mais direction claire, tâches simples mais tendance d'échelle claire.
Generalist AI a écrit sur son blog officiel un passage réfléchi :
Après un certain seuil de pré-entraînement, le coût d'adaptation à une nouvelle tâche devient négligeable.
L'apprentissage en contexte émergeant, quelques secondes de données, ou une étape de gradient plus une minute de démonstration, ne constituent plus un entraînement spécifique à la tâche au sens traditionnel, mais s'apparentent davantage à rappeler au modèle quelque chose qu'il sait presque déjà.

Si la courbe d'échelle de l'intelligence incarnée ne montre vraiment aucun signe de convergence (Generalist AI dit ne pas encore l'avoir observé), alors la ressource centrale de la prochaine compétition devient qui possède suffisamment de données d'interaction physique pour alimenter ce moteur.
Cela ressemble au scénario de 2021 lorsque les grands modèles linguistiques sont entrés dans la bataille pour les données.
Apprendre en regardant une fois, le point d'inflexion derrière les chiffres 59% et 83%
En juin 2020, OpenAI publie GPT-3.
Ce modèle a fait quelque chose que personne n'avait réussi à l'époque : sans réentraînement, en donnant simplement quelques exemples dans la boîte de dialogue, il pouvait accomplir de nouvelles tâches linguistiques – donner un exemple « rouge→pomme, jaune→banane », puis demander « vert→? », il répondait « pastèque ».
Cette capacité s'appelle l'apprentissage en contexte (in-context learning), et c'est le point de basculement qui a transformé les grands modèles linguistiques d'« outils spécialisés » en « plateforme universelle ».
GEN-1.5 transpose la même chose dans le monde physique.
Generalist AI appelle cela l'« incitation physique » (Physical Prompting).
La méthode opératoire est directe : une démonstration d'action réelle (contenant des données de capteurs et une trajectoire d'action) est insérée dans la fenêtre de mémoire contextuelle de 30 secondes du modèle, l'espace restant est utilisé pour recevoir les observations environnementales en temps réel.
Le modèle tente immédiatement d'exécuter, sans aucune étape d'entraînement dans tout le processus.
Ici, il est nécessaire d'expliquer un concept crucial pour comprendre GEN-1.5 : l'étape de gradient (gradient step).
Dans l'approche traditionnelle, apprendre une nouvelle tâche à un robot nécessitait des dizaines de milliers d'étapes de descente de gradient, chaque étape étant un ajustement fin des paramètres internes du modèle – un processus nécessitant généralement beaucoup de données et de puissance de calcul.
Le mode one-shot (une seule démonstration) de GEN-1.5 saute toutes les étapes de gradient, les paramètres du modèle restent inchangés.
Generalist AI a testé les performances de GEN-1.5 sur 10 tâches de manipulation différentes : dévisser un couvercle de pot en verre, fermer une fermeture éclair de trousse, retirer de l'argent d'un portefeuille, plier du papier, empiler des tasses, retourner un téléphone, balayer des blocs avec une brosse, ouvrir une couverture de livre, déchirer un emballage sous vide, balayer des déchets.
Les résultats se divisent en deux groupes :
One-shot (regarder une fois, zéro étape de gradient) : taux de réussite moyen de 59% sur 10 tâches (écart-type ±10%).
Few-shot (peu d'exemples, 5 minutes de données, environ 50 démonstrations, 10 étapes de gradient) : taux de réussite moyen de 83% (écart-type ±9%).

Comparons avec les chiffres de GPT-3 en 2020 sur les tâches linguistiques : one-shot environ 45%, few-shot (environ 100 exemples) environ 65%.
La structure des deux groupes de chiffres est très similaire.
La signification de ces chiffres peut être interprétée ainsi : avant l'apparition des grands modèles linguistiques, faire accomplir une nouvelle tâche linguistique à une IA (par exemple traduire un format inconnu) nécessitait de collecter spécifiquement des données et d'entraîner un nouveau modèle, un cycle prenant des mois.
Après GPT-3, cela est devenu « écrire quelques exemples dans la zone de saisie », réduisant le coût temporel de plusieurs mois à quelques secondes.
GEN-1.5 fait la même compression dans le domaine de la manipulation physique.
Auparavant, apprendre à un robot à dévisser un bouchon nécessitait des mois de programmation par un ingénieur ou des dizaines de milliers de données d'entraînement pour ajuster les paramètres.
Maintenant, une démonstration de 3 à 12 secondes suffit.
Generalist AI écrit sur son blog officiel : Cela change deux choses : la vitesse à laquelle les robots deviennent utiles (de plusieurs mois à quelques secondes), et qui peut utiliser les robots (des experts à n'importe qui).

Une semaine frémissante pour la robotique : introduction en bourse d'Unitree, ouverture simultanée du WRC et des Jeux sportifs
La publication de GEN-1.5 intervient à un moment clé, au cours de la semaine la plus intense de toute l'industrie de l'intelligence incarnée.
À partir du 19 août, le WRC World Robot Conference a ouvert ses portes à Pékin Yizhuang, avec la présence de plus de 300 entreprises, plus de 2000 produits exposés et plus de 150 nouveaux produits mondiaux présentés en première.
Trois jours plus tard, le 22 août, les deuxièmes Jeux mondiaux de sports pour robots humanoïdes ont commencé au Centre national de patinage de vitesse « Ruban de glace » – 666 équipes avec 2056 robots ont participé à 1301 matchs dans 51 épreuves, le nombre d'équipes augmentant de 138% par rapport à la première édition.
Les Jeux ont introduit pour la première fois 21 épreuves en scénario, exigeant des robots humanoïdes d'accomplir des tâches à longue portée dans des environnements réels tels que des usines, des hôtels, des services domestiques, faisant des « tests de mise en situation réelle » le thème principal.
Unitree Technology, qui vient de faire sonner la cloche, a expédié plus de 5500 robots humanoïdes en 2025, se classant premier mondial, avec un chiffre d'affaires de 1,7 milliard de yuans et une marge brute de 60%, DeepSeek a également participé au placement stratégique.
Mais le prospectus d'introduction en bourse d'Unitree cache un ensemble de données contrastées : au premier trimestre 2026, le taux de croissance du chiffre d'affaires est passé de 332,64% à la même période l'année précédente à 68,49%, et le bénéfice net après déduction des éléments non récurrents a diminué de 52,55%. Le ralentissement de la croissance est principalement dû à une augmentation significative des investissements en R&D.
Ce que Unitree rattrape, c'est précisément ce qu'il ne possède pas encore : un grand modèle d'intelligence incarnée.
« XinlichangPro » (Nouvelle Position Pro) a écrit dans une analyse (« Dans le prospectus d'introduction en bourse d'Unitree Technology se cache l'anxiété concernant la « durée de validité » du miracle d'ingénierie ») sur le dilemme structurel auquel Unitree est confronté : Unitree a construit le corps le plus vendu au monde, mais le « cerveau est absent ».
2026 est appelée « l'année des introductions en bourse » pour l'intelligence incarnée, plus de 20 entreprises ayant clarifié leurs projets d'introduction en bourse, mais ce qui motive cette vague d'introductions est en grande partie la pression financière.
De nombreux concurrents dépendent d'un cycle de financement après l'autre pour maintenir leurs opérations, le rythme de R&D étant dicté par les fenêtres de financement.

Source : LatePost《Le jeu de l'argent de l'intelligence incarnée》
Le fondateur d'Unitree, Xingxing Wang, a déclaré publiquement lors du WRC que le principal goulot d'étranglement limitant le développement des robots humanoïdes est le grand modèle d'intelligence incarnée, « on prévoit qu'à l'avenir, rapidement dans deux à trois ans, lentement dans cinq à dix ans, le moment ChatGPT des robots pourrait être atteint ».
La publication de GEN-1.5 peut être considérée comme la première réponse empirique à ce jugement.
La Loi d'échelle existe dans le domaine de l'intelligence incarnée, le pré-entraînement à grande échelle peut faire tendre le coût marginal de l'adaptation à de nouvelles tâches vers zéro.
Cette conclusion a une implication industrielle directe pour les fabricants de corps comme Unitree : une fois que le modèle universel au niveau du cerveau arrive à maturité, la valeur du corps dépendra de la rapidité avec laquelle il pourra se connecter à ce cerveau, et pas seulement des paramètres matériels et du volume d'expédition.
L'équipe de Generalist AI est en parfaite cohérence avec cette voie technologique.
Les co-fondateurs Pete Florence et Andy Zeng viennent de l'équipe robotique de Google DeepMind, Andrew Barry vient de Boston Dynamics.

De gauche à droite : Pete Florence, Andrew Barry, Andy Zeng
L'entreprise a bouclé un financement de 4 milliards de dollars en juin 2026, dirigé par Radical Ventures, avec la participation de Nvidia et Bezos Expeditions, valorisant l'entreprise à 20 milliards de dollars après investissement.
Generalist AI est en pourparlers pour un nouveau tour de financement à une valorisation de 30 milliards de dollars.
Les grands noms de la Silicon Valley vivent un moment d'effervescence collective longtemps attendu
Cette annonce a suscité une réaction forte au sein de la communauté de recherche en robotique.
Le co-fondateur Pete Florence a écrit sur X :
Depuis que j'ai commencé à travailler sur les modèles de base pour la robotique, un large apprentissage en contexte en one-shot a toujours été l'objectif le plus clair dans mon esprit.
Maintenant, je vois près d'une décennie d'imagination devenir réalité.

Florence mentionne que lui et Andy Zeng discutaient déjà pendant leurs études supérieures d'une capacité de type « Ctrl-C-Ctrl-V » : voir une action, et le robot peut la copier – mais c'était extrêmement difficile à réaliser, car « le monde sur lequel vous voulez coller, et le monde que vous copiez, ne sont jamais les mêmes ».
Le chercheur en robotique de l'Université Carnegie Mellon, Chris Paxton, a qualifié GEN-1.5 sur X de « probablement le véritable moment GPT », et a écrit :
Le Graal de l'apprentissage de la manipulation, sans aucun doute, c'est l'apprentissage en one-shot.

https://x.com/chris_j_paxton/status/2090270734816092334

https://x.com/chris_j_paxton/status/2090210797125611972
Le chercheur en intelligence incarnée de l'Université Northeastern aux États-Unis, Jimmy Yang, a retweeté en disant :
En tant que chercheur en IA incarnée, c'est un moment vraiment spécial pour ce domaine.

https://x.com/JimmyTYYang1/status/2090202923632366073
Le commentaire du directeur technique de la robotique chez Nvidia, Jim Fan, offre une perspective technique approfondie.
Il souligne deux facteurs clés des capacités émergentes de GEN-1.5 :
Premièrement, les motifs d'actions répétées symétriques présents naturellement dans les données d'entraînement, par exemple visser des vis à plusieurs reprises lors de l'assemblage de meubles, la deuxième vis est un « exemple d'apprentissage en contexte » de la première ;
Deuxièmement, les actions de récupération après des erreurs humaines dans les données, par exemple ramasser un objet tombé et continuer, cet arc complet « échec-récupération-poursuite » permet au modèle de montrer naturellement une capacité d'autocorrection lors des tests.
Jim Fan note également que la méthode de collecte de données UMI utilisée par Generalist AI (l'humain opère directement en portant les pinces du robot) préserve « l'intuition physique » humaine, contrairement à la téléopération traditionnelle où le transit par des équipements VR fait perdre une grande partie de cette intuition.

https://x.com/DrJimFan/status/2090465981240086992
Bien sûr, les douches froides de la rationalité existent également.
Jim Fan a écrit dans la section des commentaires du même tweet :
Les démonstrations sont encore un peu trop simples actuellement, il est trop tôt pour tirer des conclusions.

https://x.com/DrJimFan/status/2090469108764823587
Cet article provient du compte WeChat officiel « New Zhiyuan » (Nouvelle méta-intelligence), auteur : ASI Apocalypse





