L'équipe NVIDIA permet à un Agent de programmation de prendre en charge des expériences robotiques réelles avec un taux de réussite de 99%

marsbitPublié le 2026-06-18Dernière mise à jour le 2026-06-18

Résumé

NVIDIA a dévoilé le projet ENPIRE, un système où des agents de programmation (Codex, Claude Code, Kimi Code) pilotent de manière autonome des recherches sur des robots physiques. Ce cadre repose sur quatre modules qui forment une boucle fermée : l'environnement, l'amélioration des stratégies, l'évaluation des déploiements et l'évolution par analyse des journaux. Les agents peuvent ainsi automatiser des tâches complexes comme serrer des attaches, ranger des épingles ou installer des GPU, en atteignant un taux de réussite de 99%. Une observation clé est qu'il est souvent plus facile de réinitialiser un environnement robotique que d'accomplir la tâche elle-même. Les agents commencent donc par créer des routines de réinitialisation automatique. L'équipe a constaté une "loi d'échelle physique" : augmenter le nombre de robots parallèles (par exemple, passer à 8) accélère considérablement la résolution des tâches. Le système fonctionne désormais toute la nuit sans intervention humaine. Deux nouvelles métriques sont proposées : le MRU (taux d'utilisation moyen des robots), souvent inférieur à 50%, et le MTU (taux d'utilisation moyen des tokens). Le projet, destiné à être open source, vise à permettre à quiconque de mettre en place un système similaire de recherche robotique autonome.

La recherche automatisée sort cette fois-ci véritablement de son bac à sable logiciel pour entrer dans le monde physique réel.

Récemment, Jim Fan, responsable du laboratoire GEAR de NVIDIA, a présenté un nouveau projet nommé ENPIRE. C'est la première fois qu'ils ont réalisé une recherche automatisée sur du matériel robotique.

Ils ont placé 8 Agents Codex dans une flotte de robots, leur attribuant une puissance de calcul GPU et un budget de token suffisants, avec pour seul objectif simple : résoudre la tâche le plus rapidement possible, maintenir les robots occupés tout en assurant leur sécurité, et ne pas gaspiller la puissance de calcul.

Ensuite, l'intervention humaine a été pratiquement supprimée. Les Agents ont piloté de manière autonome la boucle complète, comprenant la réinitialisation automatique des scènes, la recherche documentaire, la mise en œuvre d'idées et la construction d'infrastructures, l'entraînement et le déploiement de stratégies, l'auto-vérification, l'analyse des journaux et la modification du code, itérant ainsi jusqu'à l'accomplissement fiable de tâches de manipulation délicates et de haute précision sur du matériel réel, comme attacher des serre-câbles, ranger des épingles dans une boîte, ou installer des GPU.

Ils ont également observé une « loi d'échelle physique » : augmenter le nombre de robots en parallèle (par exemple, passer de quelques-uns à 8) accélère significativement la vitesse de résolution des tâches.

Actuellement, certains systèmes du laboratoire fonctionnent en itération autonome toute la nuit sans intervention humaine, les chercheurs n'ayant qu'à consulter les rapports le matin.

Jim Fan affirme que l'objectif futur est de permettre à l'équipe de partir en vacances l'esprit tranquille, et même que le PDG de NVIDIA, Jensen Huang, ne remarquerait pas que le laboratoire continue de fonctionner de manière autonome.

Le projet ENPIRE est prévu pour être entièrement open source, permettant ainsi à tout développeur de construire chez lui un système similaire de recherche robotique autonome.

Adresse du projet : https://research.nvidia.com/labs/gear/enpire/

Architecture du système ENPIRE : quatre modules formant une boucle

ENPIRE est un système-cadre conçu pour les Agents de codage, construisant une boucle de rétroaction physique reproductible grâce à quatre modules centraux : le module Environnement (EN) est responsable de la réinitialisation et de la validation automatiques, le module d'Amélioration de la Stratégie (PI) lance l'optimisation de la stratégie, le module de Déploiement (R) permet d'évaluer la stratégie sur un ou plusieurs robots en parallèle, et le module d'Évolution (E) permet à l'Agent de codage d'analyser les journaux, de consulter la littérature, d'améliorer l'infrastructure d'entraînement et le code algorithmique pour résoudre les modes d'échec.

Ce système en boucle fermée transforme l'apprentissage robotique dans le monde réel en un processus d'optimisation contrôlé et géré par des Agents, minimisant ainsi au maximum l'intervention humaine, tout en permettant de réaliser des expériences d'ablation équitables entre différentes recettes d'entraînement et variantes d'Agents.

Grâce à ENPIRE, des Agents de programmation de pointe peuvent développer de manière autonome des stratégies et atteindre un taux de réussite de 99% sur des tâches complexes de manipulation dans le monde réel, telles que PushT, ranger des épingles dans une boîte, ou utiliser un couteau pour couper des serre-câbles.

Observation clé : réinitialiser l'environnement est plus facile que d'accomplir la tâche elle-même

Une observation clé est la suivante : pour de nombreuses tâches robotiques, réinitialiser l'environnement est souvent plus facile que d'accomplir la tâche elle-même.

Par conséquent, l'approche d'ENPIRE consiste à laisser d'abord l'Agent construire un environnement de réinitialisation automatique via Code-as-Policy. Dans de nombreux cas, la réinitialisation est en fait une simple tâche de pick-and-place, résolvable par Cap-X.

Ensuite, l'agent intelligent écrit une fonction de récompense basée sur des règles heuristiques. L'équipe de recherche place ensuite cet environnement dans un sandbox et lance l'Agent pour mener une recherche automatisée autour du score.

Cela fait écho à la définition de Karpathy sur la recherche automatisée : ici, la recherche automatisée ne se limite pas à ajuster un hyperparamètre ou à modifier un petit bout de code. L'Agent explorera différents paradigmes sur Internet et réécrira tout ce qui peut améliorer les performances, y compris les algorithmes, les objectifs d'entraînement, et même le chargeur de données.

Pour la tâche de rangement des épingles, un Agent a même écrit seul un contrôleur de sécurité basé sur la force de contact, surpassant l'effet d'un simple ajustement de quelques paramètres d'apprentissage par renforcement.

Nouveaux indicateurs : MRU et MTU

La capacité d'extension d'ENPIRE dépend de la taille de l'équipe d'Agents et des ressources de calcul, mais ici, la ressource véritablement rare n'est pas le GPU, mais le temps robotique.

Lorsque l'équipe de recherche a fourni 8 robots aux Agents, au lieu d'un seul, le temps nécessaire pour atteindre une performance quasi parfaite sur la tâche de rangement des épingles est passé de plus de 1,5 heure à environ 40 minutes. Ces Agents se coordonnent via Git : partageant le code, abandonnant les idées non optimales, et sélectionnant de manière autonome les meilleurs résultats d'exécution les uns des autres.

Cela indique un changement plus important : la recherche robotique est en train de devenir un travail de conception d'environnement, consistant à construire pour les Agents de codage un environnement dans lequel ils peuvent mener une recherche automatisée ; le travail algorithmique se déplace vers une couche supérieure, se tournant vers la construction d'une boucle de rétroaction que les Agents peuvent refermer par eux-mêmes.

Et cette boucle s'accumule de manière exponentielle : une compétence acquise aujourd'hui par un Agent devient demain un module de base pour construire et réinitialiser des environnements pour des tâches plus difficiles. Les capacités engendrent de nouvelles capacités.

Dans ce paradigme, la véritable contrainte dure est le budget d'interaction avec le monde réel.

Par conséquent, l'équipe de recherche propose deux indicateurs :

  • Taux d'Utilisation Moyen des Robots (Mean Robot Utilization, MRU) : proportion du temps réel total pendant lequel les robots exécutent effectivement des expériences.
  • Taux d'Utilisation Moyen des Token (Mean Token Utilization, MTU) : mesure l'efficacité avec laquelle l'Agent convertit les token en progrès de recherche.

Dans leurs expériences, le MRU est toujours inférieur à 50%. Autrement dit, les robots sont à l'arrêt la moitié du temps, attendant que l'Agent réfléchisse. Par conséquent, un meilleur cadre de travail et des modèles plus rapides se traduiront directement en bénéfices réels.

PushT est un benchmark de manipulation robotique utilisé depuis longtemps. Habituellement, accomplir cette tâche nécessite beaucoup de données de démonstration humaines, ainsi que plusieurs heures d'entraînement par clonage comportemental.

Mais ils ont constaté que Codex, Claude Code et Kimi Code ont tous « résolu » cette tâche en moins de 2 heures avec une méthode heuristique basée sur des règles : sans réseau de neurones, sans entraînement, et sans dépendre de données humaines.

Pour permettre à plus de personnes d'essayer la recherche automatisée dans le monde physique à la maison, ils ont développé un système complet basé sur le kit SO-101 de @LeRobotHF + NVIDIA Jetson Thor. Ce système peut accomplir la tâche PushT.

Liens de référence :

https://x.com/_wenlixiao/status/2066913334994358342

https://x.com/DrJimFan/status/2066921736369766762

Cet article provient du compte public WeChat « Machine Heart » (ID : almosthuman2014), auteur : Yang Wen

Questions liées

QQuel est le projet présenté par l'équipe de NVIDIA GEAR et quel est son objectif principal ?

ALe projet s'appelle ENPIRE. Son objectif principal est d'implémenter pour la première fois la recherche automatisée sur du matériel robotique réel, permettant à des agents de programmation de piloter de manière autonome un processus complet de résolution de tâches physiques complexes, avec pour objectif final de fonctionner sans aucune intervention humaine.

QQuelle est l'architecture du système ENPIRE et quels sont ses quatre modules principaux ?

AL'architecture d'ENPIRE est conçue pour créer une boucle de rétroaction physique reproductible. Elle est composée de quatre modules principaux : le module Environnement (EN) pour la réinitialisation et la validation automatiques, le module Amélioration des Politiques (PI) pour l'optimisation, le module Rollout (R) pour l'évaluation des politiques sur un ou plusieurs robots, et le module Évolution (E) où l'agent analyse les journaux, consulte la littérature et améliore le code.

QQuel est l'un des résultats clés observés concernant la difficulté des tâches robotiques dans ENPIRE ?

AUne observation clé est que pour de nombreuses tâches robotiques, réinitialiser l'environnement est souvent plus facile que d'accomplir la tâche elle-même. C'est pourquoi ENPIRE commence par faire construire à l'agent un environnement de réinitialisation automatique, souvent via une simple tâche de saisie et de placement.

QQuels sont les deux nouveaux indicateurs de performance proposés par les chercheurs pour mesurer l'efficacité d'ENPIRE et que révèlent-ils ?

ALes chercheurs ont proposé le Taux d'Utilisation Moyen du Robot (Mean Robot Utilization - MRU) et le Taux d'Utilisation Moyen des Tokens (Mean Token Utilization - MTU). Le MRU, qui mesure le temps où le robot exécute réellement des expériences, était inférieur à 50% dans leurs expériences, révélant que les robots passaient la moitié du temps à attendre que l'agent 'pense'.

QComment la parallélisation des robots a-t-elle affecté les performances dans l'expérience ENPIRE, et quels sont les plans pour ce projet ?

AL'augmentation du nombre de robots parallèles (par exemple, passer à 8 robots) a considérablement accéléré la résolution des tâches, réduisant le temps pour atteindre une performance quasi parfaite sur une tâche d'insertion d'épingle d'environ 1,5 heure à seulement 40 minutes. Le projet ENPIRE prévoit d'être entièrement open-source, permettant potentiellement aux développeurs de construire des systèmes similaires chez eux.

Lectures associées

Circle atteint une étape importante en matière de régulation, obtenant une licence d'activité fiduciaire du Département des Services Financiers de l'État de New York (NYDFS)

Circle, une société de services financiers et de stablecoins, a atteint une étape importante en obtenant une licence d'activité fiduciaire limitée du Département des services financiers de l'État de New York (NYDFS). Cette licence permet à Circle d'élargir ses activités dans l'État, notamment en offrant des services de garde d'actifs, en émettant des stablecoins approuvés par l'État et en gérant les réserves qui les soutiennent. La société est enregistrée en tant que fiduciaire à champ d'activité limité, tandis que sa division financière détient déjà une licence BitLicense. Circle devient ainsi l'une des entreprises les plus réglementées du secteur des cryptomonnaies. Le cofondateur et PDG Jeremy Allaire a salué cette réalisation, soulignant que la licence était un objectif de longue date pour Circle, offrant une clarté réglementaire. Il a qualifié le NYDFS d'autorité internationale fixant les normes pour les actifs numériques et a affirmé que cette licence positionnait le stablecoin USDC de Circle au sein d'un système solide et respecté. Cette approbation fait suite à l'autorisation précédente de l'OCC pour la création de Circle National Trust, plaçant les activités de stablecoins de la société sous supervision fédérale et visant un nouveau standard de transparence et de gouvernance.

cryptonews.ruIl y a 21 mins

Circle atteint une étape importante en matière de régulation, obtenant une licence d'activité fiduciaire du Département des Services Financiers de l'État de New York (NYDFS)

cryptonews.ruIl y a 21 mins

Cryptomonnaie à prix réduit : le bitcoin pourrait devenir moins cher en Russie que sur le marché mondial

À partir du 1er septembre 2026, la Russie doit mettre en œuvre une loi encadrant les crypto-monnaies, créant un écosystème licencié avec des plateformes d'échange officielles. Cependant, cette réglementation pourrait entraîner une décote des actifs numériques, comme le Bitcoin, sur le marché russe par rapport aux cours mondiaux. Cette situation serait principalement causée par les risques liés aux sanctions internationales, des vérifications strictes de l'origine des fonds (KYC/AML) et des capacités limitées à transférer les actifs à l'étranger. L'infrastructure régulée russe pourrait être "marquée" comme risquée par les services internationaux de conformité, réduisant la liquidité et la valeur des actifs qui y transitent. De plus, une offre excédentaire pourrait être générée par l'activité des mineurs nationaux contraints de vendre localement. Bien qu'une différence de prix théorique puisse créer une opportunité d'arbitrage, celle-ci serait difficile, voire impossible, à exploiter. Les procédures de conformité, les commissions, les risques réglementaires et la persistance des marqueurs de risque liés à l'historique des transactions sur la blockchain annuleraient très probablement tout profit potentiel. En conséquence, le marché russe pourrait bien devenir une zone de discount pour les crypto-actifs, sans que cette décote ne soit aisément monétisable par les traders.

cryptonews.ruIl y a 23 mins

Cryptomonnaie à prix réduit : le bitcoin pourrait devenir moins cher en Russie que sur le marché mondial

cryptonews.ruIl y a 23 mins

Peter Schiff affirme que le plan STRC de Strategy nuit aux actionnaires de MSTR

La pression des vendeurs sur les actions de MicroStrategy (MSTR) s'est accentuée après la publication des résultats du Q2 2024 et les critiques de Peter Schiff. L'économiste a attaqué l'objectif déclaré de la société de maintenir le cours de ses actions privilégiées (STRC) proche de 100 dollars, affirmant que cette priorité nuit aux actionnaires ordinaires de MSTR en créant un conflit d'intérêts. MicroStrategy décrit l'objectif de stabilité du STRC comme un pilier de sa stratégie de "capital-crédit numérique", conçue pour stabiliser sa structure financière et financer l'acquisition de bitcoin. Les actions privilégiées STRC, qui versent un dividende variable actuel de 12%, visent à offrir une source de financement complémentaire. La société a renforcé ses réserves de trésorerie (environ 3,75 milliards de dollars) pour couvrir ces dividendes et a procédé à des rachats de STRC. Les avis des investisseurs sont partagés. Schiff, critique du bitcoin, redoute une dilution au détriment des actionnaires ordinaires. D'autres analystes, comme Grayscale Research, estiment que la vente de bitcoins par MicroStrategy et la recapitalisation récente ont au contraire réduit les risques financiers et renforcé la confiance. Le prochain défi pour MicroStrategy sera de concilier ses achats de bitcoin, ses obligations de dividendes privilégiés, les rachats d'actions et la performance de ses actions ordinaires MSTR. Les décisions futures de vente de bitcoin ou d'ajustement des réserves révéleront si le soutien au STRC consolide la structure du capital ou valide les craintes concernant les actionnaires ordinaires.

cryptonews.ruIl y a 23 mins

Peter Schiff affirme que le plan STRC de Strategy nuit aux actionnaires de MSTR

cryptonews.ruIl y a 23 mins

Trading

Spot
活动图片