L'équipe NVIDIA permet à un Agent de programmation de prendre en charge des expériences robotiques réelles avec un taux de réussite de 99%

marsbitPublié le 2026-06-18Dernière mise à jour le 2026-06-18

Résumé

NVIDIA a dévoilé le projet ENPIRE, un système où des agents de programmation (Codex, Claude Code, Kimi Code) pilotent de manière autonome des recherches sur des robots physiques. Ce cadre repose sur quatre modules qui forment une boucle fermée : l'environnement, l'amélioration des stratégies, l'évaluation des déploiements et l'évolution par analyse des journaux. Les agents peuvent ainsi automatiser des tâches complexes comme serrer des attaches, ranger des épingles ou installer des GPU, en atteignant un taux de réussite de 99%. Une observation clé est qu'il est souvent plus facile de réinitialiser un environnement robotique que d'accomplir la tâche elle-même. Les agents commencent donc par créer des routines de réinitialisation automatique. L'équipe a constaté une "loi d'échelle physique" : augmenter le nombre de robots parallèles (par exemple, passer à 8) accélère considérablement la résolution des tâches. Le système fonctionne désormais toute la nuit sans intervention humaine. Deux nouvelles métriques sont proposées : le MRU (taux d'utilisation moyen des robots), souvent inférieur à 50%, et le MTU (taux d'utilisation moyen des tokens). Le projet, destiné à être open source, vise à permettre à quiconque de mettre en place un système similaire de recherche robotique autonome.

La recherche automatisée sort cette fois-ci véritablement de son bac à sable logiciel pour entrer dans le monde physique réel.

Récemment, Jim Fan, responsable du laboratoire GEAR de NVIDIA, a présenté un nouveau projet nommé ENPIRE. C'est la première fois qu'ils ont réalisé une recherche automatisée sur du matériel robotique.

Ils ont placé 8 Agents Codex dans une flotte de robots, leur attribuant une puissance de calcul GPU et un budget de token suffisants, avec pour seul objectif simple : résoudre la tâche le plus rapidement possible, maintenir les robots occupés tout en assurant leur sécurité, et ne pas gaspiller la puissance de calcul.

Ensuite, l'intervention humaine a été pratiquement supprimée. Les Agents ont piloté de manière autonome la boucle complète, comprenant la réinitialisation automatique des scènes, la recherche documentaire, la mise en œuvre d'idées et la construction d'infrastructures, l'entraînement et le déploiement de stratégies, l'auto-vérification, l'analyse des journaux et la modification du code, itérant ainsi jusqu'à l'accomplissement fiable de tâches de manipulation délicates et de haute précision sur du matériel réel, comme attacher des serre-câbles, ranger des épingles dans une boîte, ou installer des GPU.

Ils ont également observé une « loi d'échelle physique » : augmenter le nombre de robots en parallèle (par exemple, passer de quelques-uns à 8) accélère significativement la vitesse de résolution des tâches.

Actuellement, certains systèmes du laboratoire fonctionnent en itération autonome toute la nuit sans intervention humaine, les chercheurs n'ayant qu'à consulter les rapports le matin.

Jim Fan affirme que l'objectif futur est de permettre à l'équipe de partir en vacances l'esprit tranquille, et même que le PDG de NVIDIA, Jensen Huang, ne remarquerait pas que le laboratoire continue de fonctionner de manière autonome.

Le projet ENPIRE est prévu pour être entièrement open source, permettant ainsi à tout développeur de construire chez lui un système similaire de recherche robotique autonome.

Adresse du projet : https://research.nvidia.com/labs/gear/enpire/

Architecture du système ENPIRE : quatre modules formant une boucle

ENPIRE est un système-cadre conçu pour les Agents de codage, construisant une boucle de rétroaction physique reproductible grâce à quatre modules centraux : le module Environnement (EN) est responsable de la réinitialisation et de la validation automatiques, le module d'Amélioration de la Stratégie (PI) lance l'optimisation de la stratégie, le module de Déploiement (R) permet d'évaluer la stratégie sur un ou plusieurs robots en parallèle, et le module d'Évolution (E) permet à l'Agent de codage d'analyser les journaux, de consulter la littérature, d'améliorer l'infrastructure d'entraînement et le code algorithmique pour résoudre les modes d'échec.

Ce système en boucle fermée transforme l'apprentissage robotique dans le monde réel en un processus d'optimisation contrôlé et géré par des Agents, minimisant ainsi au maximum l'intervention humaine, tout en permettant de réaliser des expériences d'ablation équitables entre différentes recettes d'entraînement et variantes d'Agents.

Grâce à ENPIRE, des Agents de programmation de pointe peuvent développer de manière autonome des stratégies et atteindre un taux de réussite de 99% sur des tâches complexes de manipulation dans le monde réel, telles que PushT, ranger des épingles dans une boîte, ou utiliser un couteau pour couper des serre-câbles.

Observation clé : réinitialiser l'environnement est plus facile que d'accomplir la tâche elle-même

Une observation clé est la suivante : pour de nombreuses tâches robotiques, réinitialiser l'environnement est souvent plus facile que d'accomplir la tâche elle-même.

Par conséquent, l'approche d'ENPIRE consiste à laisser d'abord l'Agent construire un environnement de réinitialisation automatique via Code-as-Policy. Dans de nombreux cas, la réinitialisation est en fait une simple tâche de pick-and-place, résolvable par Cap-X.

Ensuite, l'agent intelligent écrit une fonction de récompense basée sur des règles heuristiques. L'équipe de recherche place ensuite cet environnement dans un sandbox et lance l'Agent pour mener une recherche automatisée autour du score.

Cela fait écho à la définition de Karpathy sur la recherche automatisée : ici, la recherche automatisée ne se limite pas à ajuster un hyperparamètre ou à modifier un petit bout de code. L'Agent explorera différents paradigmes sur Internet et réécrira tout ce qui peut améliorer les performances, y compris les algorithmes, les objectifs d'entraînement, et même le chargeur de données.

Pour la tâche de rangement des épingles, un Agent a même écrit seul un contrôleur de sécurité basé sur la force de contact, surpassant l'effet d'un simple ajustement de quelques paramètres d'apprentissage par renforcement.

Nouveaux indicateurs : MRU et MTU

La capacité d'extension d'ENPIRE dépend de la taille de l'équipe d'Agents et des ressources de calcul, mais ici, la ressource véritablement rare n'est pas le GPU, mais le temps robotique.

Lorsque l'équipe de recherche a fourni 8 robots aux Agents, au lieu d'un seul, le temps nécessaire pour atteindre une performance quasi parfaite sur la tâche de rangement des épingles est passé de plus de 1,5 heure à environ 40 minutes. Ces Agents se coordonnent via Git : partageant le code, abandonnant les idées non optimales, et sélectionnant de manière autonome les meilleurs résultats d'exécution les uns des autres.

Cela indique un changement plus important : la recherche robotique est en train de devenir un travail de conception d'environnement, consistant à construire pour les Agents de codage un environnement dans lequel ils peuvent mener une recherche automatisée ; le travail algorithmique se déplace vers une couche supérieure, se tournant vers la construction d'une boucle de rétroaction que les Agents peuvent refermer par eux-mêmes.

Et cette boucle s'accumule de manière exponentielle : une compétence acquise aujourd'hui par un Agent devient demain un module de base pour construire et réinitialiser des environnements pour des tâches plus difficiles. Les capacités engendrent de nouvelles capacités.

Dans ce paradigme, la véritable contrainte dure est le budget d'interaction avec le monde réel.

Par conséquent, l'équipe de recherche propose deux indicateurs :

  • Taux d'Utilisation Moyen des Robots (Mean Robot Utilization, MRU) : proportion du temps réel total pendant lequel les robots exécutent effectivement des expériences.
  • Taux d'Utilisation Moyen des Token (Mean Token Utilization, MTU) : mesure l'efficacité avec laquelle l'Agent convertit les token en progrès de recherche.

Dans leurs expériences, le MRU est toujours inférieur à 50%. Autrement dit, les robots sont à l'arrêt la moitié du temps, attendant que l'Agent réfléchisse. Par conséquent, un meilleur cadre de travail et des modèles plus rapides se traduiront directement en bénéfices réels.

PushT est un benchmark de manipulation robotique utilisé depuis longtemps. Habituellement, accomplir cette tâche nécessite beaucoup de données de démonstration humaines, ainsi que plusieurs heures d'entraînement par clonage comportemental.

Mais ils ont constaté que Codex, Claude Code et Kimi Code ont tous « résolu » cette tâche en moins de 2 heures avec une méthode heuristique basée sur des règles : sans réseau de neurones, sans entraînement, et sans dépendre de données humaines.

Pour permettre à plus de personnes d'essayer la recherche automatisée dans le monde physique à la maison, ils ont développé un système complet basé sur le kit SO-101 de @LeRobotHF + NVIDIA Jetson Thor. Ce système peut accomplir la tâche PushT.

Liens de référence :

https://x.com/_wenlixiao/status/2066913334994358342

https://x.com/DrJimFan/status/2066921736369766762

Cet article provient du compte public WeChat « Machine Heart » (ID : almosthuman2014), auteur : Yang Wen

Questions liées

QQuel est le projet présenté par l'équipe de NVIDIA GEAR et quel est son objectif principal ?

ALe projet s'appelle ENPIRE. Son objectif principal est d'implémenter pour la première fois la recherche automatisée sur du matériel robotique réel, permettant à des agents de programmation de piloter de manière autonome un processus complet de résolution de tâches physiques complexes, avec pour objectif final de fonctionner sans aucune intervention humaine.

QQuelle est l'architecture du système ENPIRE et quels sont ses quatre modules principaux ?

AL'architecture d'ENPIRE est conçue pour créer une boucle de rétroaction physique reproductible. Elle est composée de quatre modules principaux : le module Environnement (EN) pour la réinitialisation et la validation automatiques, le module Amélioration des Politiques (PI) pour l'optimisation, le module Rollout (R) pour l'évaluation des politiques sur un ou plusieurs robots, et le module Évolution (E) où l'agent analyse les journaux, consulte la littérature et améliore le code.

QQuel est l'un des résultats clés observés concernant la difficulté des tâches robotiques dans ENPIRE ?

AUne observation clé est que pour de nombreuses tâches robotiques, réinitialiser l'environnement est souvent plus facile que d'accomplir la tâche elle-même. C'est pourquoi ENPIRE commence par faire construire à l'agent un environnement de réinitialisation automatique, souvent via une simple tâche de saisie et de placement.

QQuels sont les deux nouveaux indicateurs de performance proposés par les chercheurs pour mesurer l'efficacité d'ENPIRE et que révèlent-ils ?

ALes chercheurs ont proposé le Taux d'Utilisation Moyen du Robot (Mean Robot Utilization - MRU) et le Taux d'Utilisation Moyen des Tokens (Mean Token Utilization - MTU). Le MRU, qui mesure le temps où le robot exécute réellement des expériences, était inférieur à 50% dans leurs expériences, révélant que les robots passaient la moitié du temps à attendre que l'agent 'pense'.

QComment la parallélisation des robots a-t-elle affecté les performances dans l'expérience ENPIRE, et quels sont les plans pour ce projet ?

AL'augmentation du nombre de robots parallèles (par exemple, passer à 8 robots) a considérablement accéléré la résolution des tâches, réduisant le temps pour atteindre une performance quasi parfaite sur une tâche d'insertion d'épingle d'environ 1,5 heure à seulement 40 minutes. Le projet ENPIRE prévoit d'être entièrement open-source, permettant potentiellement aux développeurs de construire des systèmes similaires chez eux.

Lectures associées

Dialogue avec Ray Dalio : Nous sommes actuellement dans une bulle de l'IA, 1% de mon portefeuille est en Bitcoin

Ray Dalio, fondateur de Bridgewater Associates, met en garde contre la bulle actuelle de l'IA, présentant des signes classiques similaires aux précédents krachs financiers. Il explique qu'une combinaison de spéculation excessive, d'endettement et de changements de taux d'intérêt pourrait provoquer son éclatement, entraînant une récession économique. Dalio décrit également un « grand cycle » mondial d'environ 80 ans, caractérisé par des inégalités croissantes, des déficits publics élevés et des tensions géopolitiques. Nous serions actuellement dans une phase de déclin de ce cycle, avec un ordre mondial en transition. Pour protéger leur patrimoine, il conseille aux investisseurs de diversifier leurs actifs (actions, obligations, or, immobilier) plutôt que de détenir uniquement des liquidités. Il mentionne détenir environ 1% de Bitcoin, mais préfère l'or physique pour sa stabilité. Concernant l'IA, Dalio souligne qu'elle remplacera progressivement le travail intellectuel humain, creusant les inégalités. L'avenir appartiendra à ceux qui sauront allier intelligence humaine et collaboration avec l'IA. Enfin, il évoque un monde de plus en plus régionalisé, avec un affaiblissement de la puissance américaine, visible dans des conflits comme celui avec l'Iran, et la montée en puissance d'autres pôles, notamment la Chine.

marsbitIl y a 3 h

Dialogue avec Ray Dalio : Nous sommes actuellement dans une bulle de l'IA, 1% de mon portefeuille est en Bitcoin

marsbitIl y a 3 h

7,2 billions de KRW en une journée, les achats nets des investisseurs étrangers atteignent un record historique ce vendredi ! Wall Street : Les vents contraires sur les flux de capitaux sud-coréens se sont dissipés

Les marchés boursiers sud-coréens montrent des signes tangibles d'amélioration des flux de capitaux. Le 31 juillet, les investisseurs étrangers ont réalisé un achat net record de 7 200 milliards de wons sur une seule journée dans le KOSPI, marquant un renversement de la tendance de sorties massives observée ces derniers mois. En juillet, leurs ventes nettes mensuelles se sont fortement réduites à 9 800 milliards de wons, contre 48 400 et 44 500 milliards en juin et mai respectivement. Parallèlement, les institutions domestiques comme les fonds de pension ont inversé leur tendance, passant à un achat net de 1 000 milliards de wons en juillet. La Commission des services financiers a également resserré l'accès aux ETF à effet de levier sur actions individuelles pour les investisseurs de détail, réduisant ainsi la volatilité du marché. Citigroup Research maintient son objectif pour le KOSPI à 10 000 points, estimant que les vents contraires liés aux flux de capitaux s'atténuent. Des facteurs tels que les fondamentaux solides du secteur des puces mémoire, les faibles valorisations du marché, une économie robuste et un environnement politique favorable devraient soutenir le marché. La possibilité d'interventions des autorités pour stabiliser le marché offre également un filet de sécurité.

marsbitIl y a 3 h

7,2 billions de KRW en une journée, les achats nets des investisseurs étrangers atteignent un record historique ce vendredi ! Wall Street : Les vents contraires sur les flux de capitaux sud-coréens se sont dissipés

marsbitIl y a 3 h

Choc ! La prochaine IA d'OpenAI résout 10 problèmes du calibre de la Médaille Fields

**OpenAI provoque un séisme mathématique avec son nouveau modèle Astra** OpenAI a dévoilé des avancées mathématiques majeures réalisées par son modèle interne Astra, présenté par Sam Altman. L'IA aurait résolu ou fait progresser dix problèmes complexes dans des domaines variés comme la géométrie haute dimension, la théorie des groupes et la complexité quantique. Le résultat le plus marquant est la construction du premier groupe "non sofic" infini et finiment présenté, réfutant une conjecture de Mikhail Gromov vieille de 27 ans. Cette seule découverte est qualifiée de niveau "Prix Fields". Astra a également amélioré une borne fondamentale sur le problème de l'empilement des sphères en haute dimension, stagnant depuis 1978, et a réfuté la conjecture de rigidité d'Alain Connes en construisant une infinité de groupes non isomorphes partageant la même algèbre de von Neumann. Ces résultats, compilés dans un document de 249 pages, sont accompagnés de preuves formelles vérifiées par l'assistant Lean 4. OpenAI précise que le coût total de génération de ces démonstrations aurait été inférieur à 2000 dollars. La communauté mathématique réagit avec stupeur, certains experts y voyant un tournant historique où l'IA démontre une intuition et une capacité de raisonnement pouvant surpasser les meilleurs mathématiciens humains.

marsbitIl y a 4 h

Choc ! La prochaine IA d'OpenAI résout 10 problèmes du calibre de la Médaille Fields

marsbitIl y a 4 h

Grâce aux lancers de dés, les clés Bitcoin sont stockées hors ligne, mais tout le monde ne s'y mettra pas

Le titre « Les clés Bitcoin protégées par des dés, mais la méthode reste marginale » introduit un article sur la génération manuelle de graines de portefeuille Bitcoin à l'aide de dés. L'article explique le concept d'entropie, illustré par Claude Shannon, où un dé à six faces génère environ 2,585 bits d'incertitude. Il aborde le scandale récent de Coldcard, où une vulnérabilité du générateur de nombres aléatoires matériel a compromis des fonds. Les utilisateurs ayant généré leur phrase de récupération avec des dés (environ 99 lancers pour une haute sécurité) n'étaient pas affectés pour leur seed principal. Cependant, l'analyse du chercheur Kevin Loaec montre que d'autres fonctions du portefeuille (clés de copie, portefeuilles papier, mots de passe, etc.) utilisaient ce générateur défectueux et restaient vulnérables. L'article souligne les défis pratiques de la méthode des dés : elle est longue, sujette aux erreurs de saisie, et peu adaptée aux nouveaux utilisateurs qui pourraient mal l'exécuter. Il conclut que si cette méthode manuelle est robuste pour les experts, l'objectif à long terme est d'avoir un matériel et des logiciels générant une entropie fiable de manière simple et sécurisée. Il conseille aux propriétaires de Coldcard de vérifier leur firmware et les fonctions utilisées, et rappelle l'intérêt des solutions multi-signatures avec différents fabricants pour limiter les risques.

cryptonews.ruIl y a 8 h

Grâce aux lancers de dés, les clés Bitcoin sont stockées hors ligne, mais tout le monde ne s'y mettra pas

cryptonews.ruIl y a 8 h

Trading

Spot
活动图片