L'IA de Nvidia déchaîne l'ARC-AGI-3, une équipe majoritairement chinoise résout d'un coup 183 niveaux

marsbitPublié le 2026-08-24Dernière mise à jour le 2026-08-24

Résumé

NVIDIA a réussi un score parfait de 100% avec son agent intelligent de codage généraliste, AVO, sur le benchmark ARC-AGI-3. Cet agent a résolu les 183 niveaux des 25 environnements de jeu en seulement 6 624 étapes, sans aucune instruction sur les règles. L'exploit est notable car les modèles de pointe comme Claude Opus 5, utilisés seuls, n'obtiennent qu'environ 30% de réussite. La percée ne vient pas du modèle de langage sous-jacent (Claude Opus 5), mais d'une architecture externe appelée « harnais ». Deux mécanismes clés font la différence : une **mémoire persistante** qui conserve l'état et l'historique des essais au-delà des limites du contexte, et un **superviseur** qui redirige l'agent principal lorsqu'il est bloqué. Fait remarquable, AVO fonctionne entièrement en mode texte, traitant l'environnement visuel sous forme de grille textuelle 64x64. À l'origine, AVO a été conçu non pas pour les jeux, mais pour **l'optimisation autonome des noyaux GPU CUDA**. Dans cette tâche, il a dépassé les implémentations de référence comme cuDNN et FlashAttention-4 après des jours de recherche automatique. Cette démonstration prouve que son architecture centrale – un cycle d'hypothèse, test, mémorisation et correction – est transférable à des domaines radicalement différents. L'équipe à l'origine d'AVO est en grande partie composée de chercheurs d'origine chinoise, dont des contributeurs clés à des projets open-source majeurs comme MXNet, TVM et XGBoost. L'initiative s'inscrit dans la...

À l'instant même, AVO, l'agent de codage universel de Nvidia, a obtenu un score parfait sur l'ARC-AGI-3 !

Il a complété la totalité des 183 niveaux dans 25 environnements de jeu, n'utilisant au total que 6624 étapes, avec un RHAE de 100.00.

Sachez que l'ARC-AGI-3 est réputé pour être totalement injuste. Il plonge l'agent directement dans un jeu inconnu, sans donner ni règles ni objectifs, il doit tout découvrir par lui-même en appuyant, en observant et en déduisant.

Certains environnements permettent de se déplacer haut, bas, gauche, droite, en tournant dans des couloirs ; en heurtant un cube bleu-noir, tout l'écran pivote de 90 degrés. D'autres ne permettent même pas de se déplacer, seulement de cliquer, en faisant alterner les couleurs des cellules par clics pour obtenir le motif cible.

Chaque environnement compte au moins six niveaux, et plus on avance, plus c'est difficile. Un niveau que l'on peut terminer en cinq étapes au premier palier peut en nécessiter cinquante au sixième.

Et l'agent n'a qu'une grille de 64×64 et quelques touches à sa disposition.

Les modèles de pointe, en essayant de forcer directement, n'y arrivent tout simplement pas.

Le modèle utilisé cette fois par AVO est Claude Opus 5. Mais si on le laisse passer le test seul, son score n'est que de 30.16%, ce qui le place néanmoins en tête du classement officiel.

Le ARC Prize a analysé les enregistrements de parties de la génération précédente et a identifié trois types d'erreurs typiques.

  • La première : comprendre localement, mais pas globalement.
  • La deuxième : calquer des mécanismes inconnus sur des jeux familiers.
  • La troisième : terminer un niveau sans l'avoir réellement appris.

La troisième est la plus fatale. Opus avait autrefois terminé le premier niveau de ka59 en seulement 37 étapes, mais sa compréhension du mécanisme de clic était erronée dès le départ. Arrivé au deuxième niveau, il s'accrochait toujours à sa fausse théorie, et finissait par être bloqué.

L'approche de Nvidia est de ne pas toucher au modèle, mais d'ajouter une couche d'enveloppe extérieure.

Ainsi, avec le même Claude Opus 5, le score est passé directement de 30% à 100%.

Sur X (Twitter), c'était l'explosion. D'un côté, les messages « L'ARC-AGI-3 est tombé », « Il faut changer de classement à grimper » défilent à l'écran, de l'autre, on ne tarit pas d'éloges sur le coup de maître de Nvidia.

Si la tendance se poursuit, la prochaine transition majeure au niveau des modèles pourrait ne pas venir d'un nouveau modèle, mais d'une mise à jour de l'enveloppe (harness).

Le saut à 100 points, décomposé, n'est que deux choses

Alors, qu'est-ce que Nvidia a ajouté autour du modèle pour combler ces trois fossés d'un coup ?

Comme le récent et explosif DeepSeek Harness ou Codex Harness, AVO gère aussi un ensemble de choses en dehors du modèle proprement dit.

Incluant quoi lui fournir comme contexte, quels outils lui donner, comment stocker l'état, comment intégrer les retours, que faire en cas de blocage, et comment continuer quand le contexte est plein, etc.

Concrètement, sur le plan mécanique, ce sont deux choses qui ont vraiment fait la différence.

La première est la mémoire persistante.

Le point le plus critique dans les tâches de longue durée est que le contexte finit par être saturé.

Une fois plein, la mémoire du modèle est réinitialisée. Tout ce qui a été essayé précédemment, les impasses, les résultats du profileur, tout disparaît.

Au tour suivant, il recommence à tomber dans les mêmes pièges.

AVO, lui, stocke tout cela : les versions précédentes des implémentations, les résultats de chaque évaluation, les sorties du compilateur et de l'analyseur, le processus de raisonnement accumulé, tout y est.

Après une réinitialisation de contexte, l'agent reprend depuis l'état actuel, et ne reconstruit pas toute la recherche à partir de zéro.

La deuxième est le superviseur.

L'agent principal est chargé de travailler, tête baissée. Ce qu'il observe, modifie, teste, soumet, il le décide lui-même.

Le superviseur ne travaille pas, il surveille simplement toute la trajectoire de recherche. Dès qu'il détecte une stagnation des progrès, ou que l'agent commence à tourner en rond, à répéter des actions inutiles, il intervient pour rediriger l'agent principal vers d'autres stratégies.

Un détail supplémentaire.

AVO a exécuté l'ensemble de l'ARC-AGI-3 en utilisant une modalité purement textuelle. Chaque observation de frame fournie au modèle était une grille textuelle précise de 64×64, pas une seule image, pas un seul token d'image n'a été envoyé.

Autrement dit, dans un jeu où l'écran est rempli de pixels, le modèle n'a jamais vu une seule image du début à la fin.

Ce mécanisme a permis d'obtenir le bulletin de notes : 6624 étapes pour terminer 183 niveaux, avec un RHAE de 100.

La conclusion que tire Nvidia de cela est que la capacité de longue durée n'a jamais été une caractéristique que le modèle possédait seul, mais qu'elle émerge de l'ensemble du système.

La mémoire détermine ce qui peut être conservé pour le prochain tour, les outils déterminent quelles actions l'agent peut effectuer, les retours lui indiquent s'il fait fausse route.

Et quand une hypothèse est réfutée, la capacité à revenir en arrière et à continuer détermine si la tâche peut être poursuivie.

Il révolutionne d'abord Nvidia elle-même

Ce qui est intéressant, c'est qu'AVO n'a pas du tout été conçu pour jouer. Son champ de bataille principal est l'optimisation des opérateurs GPU.

Le 25 mars de cette année, Nvidia a publié sur arXiv un article intitulé « AVO : Agentized Variation Operators for Autonomous Evolutionary Search ».

Adresse de l'article : https://arxiv.org/abs/2603.24517

Deux mots dans le titre sont clés : recherche évolutive et opérateurs de variation.

La recherche évolutive en elle-même n'est pas complexe. On a un lot de codes candidats, on les modifie, on les exécute, on garde la version la plus rapide, puis on continue à modifier, en poussant de génération en génération.

L'étape responsable de la « modification » s'appelle l'opérateur de variation dans les algorithmes évolutionnistes. Auparavant, il était figé, la manière de modifier était prédéfinie par l'homme ; plus tard, on a utilisé des LLM pour modifier, mais cela ne produisait qu'un morceau de code par appel.

L'approche d'AVO est de remplacer l'ensemble de l'opérateur de variation par un agent autonome.

Ainsi, il peut non seulement consulter le guide de programmation CUDA et la documentation de l'architecture PTX, exécuter des tests, lire le profileur, mais aussi diagnostiquer lui-même les problèmes de correction, puis décider où modifier dans la version suivante.

L'équipe l'a placé sur un B200, avec pour tâche d'optimiser un noyau d'attention, l'opérateur le plus exploité dans les Transformer. Puis les humains l'ont laissé faire.

AVO a fonctionné de manière autonome et continue pendant 7 jours, explorant plus de 500 directions d'optimisation, et finalement soumis 40 versions valides de noyaux.

Le noyau d'attention multi-têtes produit était jusqu'à 3.5% plus rapide que le cuDNN propriétaire de Nvidia, et jusqu'à 10.5% plus rapide que l'implémentation open-source de pointe FlashAttention-4.

Ensuite, il a appliqué cette même optimisation au GQA, actuellement dominant pour les grands modèles. Cette fois, après environ 30 minutes de fonctionnement autonome, le nouveau noyau était 7.0% plus rapide que cuDNN et 9.3% plus rapide que FlashAttention-4.

L'écriture manuelle de noyaux CUDA a toujours été le travail le plus exigeant de cet écosystème, et AVO est le premier à le surpasser.

Et les 25 jeux de l'ARC-AGI-3 utilisent exactement ce même système.

Optimiser des noyaux et jouer à des jeux semblent être deux choses totalement sans rapport. Mais pour Nvidia, ces deux activités reposent sur la même boucle sous-jacente.

L'agent formule d'abord une hypothèse à partir de preuves incomplètes, agit pour tester, observe les résultats, stocke les états utiles, puis affine sa compréhension du problème. Si l'hypothèse est fausse, il revient en arrière et réfléchit à nouveau, puis continue à itérer.

Pour reprendre les mots de Nvidia, ce qui est transférable n'est pas la connaissance du domaine, mais le mécanisme qui maintient la progression autonome sur de longues durées.

Ceux qui l'ont créé sont une équipe majoritairement chinoise

En déroulant la liste des auteurs de l'article sur AVO, on voit une série de noms très familiers.

Les 23 signataires rassemblent presque toutes les figures clés de l'infrastructure open-source de deep learning des dix dernières années.

L'un des premiers co-auteurs, Bing Xu, est Distinguished Engineer chez Nvidia et l'auteur de MXNet. Encore plus tôt, il était le quatrième auteur de l'article original sur les GAN en 2014, co-signé avec le dernier auteur Yoshua Bengio sous l'affiliation de l'Université de Montréal.

Tianqi Chen, l'auteur de TVM et XGBoost, figure également sur la liste. La lignée TVM conduit aussi à Luis Ceze, avec qui il a cofondé OctoAI, racheté par Nvidia en septembre 2024, Ceze ayant ensuite rejoint Nvidia pour continuer à travailler sur le compilateur pour l'apprentissage automatique.

Viennent ensuite Zihao Ye, auteur de FlashInfer, et Vinod Grover, un vétéran du compilateur CUDA.

À la barre se trouve Humphrey Shi, vice-président de l'IA haute performance chez Nvidia et également professeur au Georgia Tech. Un autre premier co-auteur, Zhifan Ye, est justement un doctorant en cours au Georgia Tech.

Le blog de cette fois est signé par cinq noms, dont quatre sont chinois : outre Humphrey Shi, il y a Terry Chen, Zhifan Ye et Yeyin Zhu. Le cinquième, Jean-Francois Puget, est un double champion et Grand Master Kaggle chez Nvidia.

Le passage le plus intéressant provient d'un récit autobiographique précédent de Bing Xu sur X.

Il y a un an et demi, quand lui et Terry Chen ont commencé à travailler sur la programmation par agents chez Nvidia, ni l'un ni l'autre ne connaissait la programmation GPU.

Précisément parce qu'ils ne savaient pas, ils se sont orientés dès le premier jour vers un système entièrement automatique, ne nécessitant aucune intervention humaine, et ont baptisé cette approche « programmation à l'aveugle ».

Un an et demi plus tard, ce système qui ne dépend pas des instructions humaines a surpassé les noyaux que les experts humains optimisaient depuis des mois.

La facture finit par être réglée sur les cartes graphiques de Jensen

Pourquoi une entreprise qui vend des cartes graphiques passerait-elle un an et demi à créer un agent autonome qui ne nécessite aucune intervention humaine ?

Parce que cette couche d'enveloppe peut s'adapter à n'importe quel modèle.

AVO a déjà été exécuté sur différents modèles. Pour les mêmes niveaux, couplé à GPT-5.6 Sol, le temps est plus court ; avec Opus 5, il utilise moins d'étapes.

Nvidia ne gagne pas d'argent en vendant des modèles, mais cette couche, elle peut la dominer. Cela correspond aussi à sa stratégie globale de ces dernières années.

Du côté des modèles, ils optent pour l'open source. Nemotron 4, annoncé en août de cette année, vise l'échelle du trillion de paramètres, avec une formation prévue pour l'automne. Le modèle sera offert gratuitement, l'argent sera récupéré sur les GPU et la pile logicielle qui suivent.

Du côté de la puissance de calcul, les agents de longue durée sont justement la charge de travail qu'ils souhaitent le plus. Le jugement de Jensen Huang lors du GTC cette année est que le point d'inflexion de l'inférence est arrivé. Au cours des deux dernières années, la demande en puissance de calcul a augmenté d'environ dix mille fois, tandis que l'utilisation n'a augmenté que d'environ cent fois. La différence est entièrement absorbée par l'inférence.

Donc, peu importe le modèle utilisé. Tant que les agents effectuent des tâches de plus en plus longues et de plus en plus lourdes, la facture finira par être réglée sur leurs cartes graphiques.

Quant aux trois chiffres « 100 points », ils se déprécient rapidement en ce moment.

En mars, personne n'arrivait à atteindre 1 point. Tycho a été le premier à obtenir un score parfait fin juillet, VISTA en a obtenu un autre le 5 août, et le score d'AVO est déjà le troisième en six semaines, les trois utilisant tous Claude Opus 5 comme moteur.

Mais ce qu'AVO a accompli n'en sera pas amoindri pour autant.

Une architecture née pour extraire les derniers pourcentages de performance de FlashAttention sur un B200 a été presque intégralement transférée dans un jeu en pixels, et a fonctionné.

Seules l'interface de tâche et la méthode d'évaluation ont été changées au milieu, la boucle centrale n'a pas été modifiée d'une seule ligne.

Comme l'écrit Nvidia à la fin de son blog : Le modèle est important, mais le modèle n'est pas la totalité de l'agent.

Références :

https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/

Cet article provient du compte WeChat public « New Zhiyuan », auteur : ASI Apocalypse, éditeur : Moïse

Cryptos en tendance

Questions liées

QQuel est le nom de l'agent d'intelligence artificielle de NVIDIA dont parle l'article, et quelle réalisation majeure a-t-il accomplie ?

AL'agent s'appelle AVO. Il a obtenu un score parfait de 100.00 RHAE sur le benchmark ARC-AGI-3, en résolvant les 183 niveaux de ses 25 environnements de jeu en seulement 6624 étapes.

QQuel modèle de langage principal AVO utilise-t-il, et quelle était sa performance initiale sans le système AVO sur ARC-AGI-3 ?

AAVO utilise principalement Claude Opus 5. Sans le système AVO, Claude Opus 5 seul n'obtenait qu'un score de 30.16% sur ARC-AGI-3, ce qui en faisait déjà le leader du classement officiel à l'époque.

QQuels sont les deux mécanismes clés du système AVO qui ont permis cette amélioration spectaculaire des performances ?

ALes deux mécanismes clés sont : 1) Une mémoire persistante qui conserve l'état, les essais et les résultats entre les sessions, évitant de tout recommencer à zéro. 2) Un superviseur qui surveille la progression de l'agent principal et l'oriente vers d'autres stratégies en cas de blocage ou de répétition d'actions inutiles.

QDans quel domaine AVO a-t-il été initialement conçu et quels résultats a-t-il obtenu dans ce domaine ?

AAVO a été initialement conçu pour l'optimisation des noyaux GPU (opérateurs). En optimisant de manière autonome pendant 7 jours, il a généré un noyau d'attention multi-têtes jusqu'à 3.5% plus rapide que la bibliothèque propriétaire cuDNN de NVIDIA et jusqu'à 10.5% plus rapide que l'implémentation open-source de pointe FlashAttention-4.

QQuel est le point commun entre la tâche d'optimisation des noyaux GPU et celle de résolution des jeux ARC-AGI-3, selon la perspective de NVIDIA ?

ASelon NVIDIA, le point commun est le cycle fondamental sous-jacent. Dans les deux cas, l'agent formule une hypothèse à partir d'informations partielles, teste, observe les résultats, conserve un état utile, affine sa compréhension du problème et peut revenir en arrière si l'hypothèse est fausse. C'est le mécanisme permettant de maintenir une progression autonome sur le long terme qui est transférable, et non les connaissances spécifiques au domaine.

Lectures associées

« Cryptoprésident » Trump vend des actions Coinbase et Strategy

L'Office de l'éthique gouvernementale américain a publié le rapport sur les transactions financières du président Trump pour juin. Sur plus de 1000 opérations sur titres, seules sept concernaient des entreprises liées aux cryptomonnaies, principalement des ventes. Le rapport mentionne quatre transactions sur Coinbase Global : trois ventes entre le 12 et le 23 juin pour un total de 116 003 $ à 315 000 $, suivies d'un seul achat le 24 juin (50 001 $ - 100 000 $). Les actions de MicroStrategy, le plus grand détenteur corporatif de Bitcoin, ont été vendues deux fois les 23 et 24 juin (16 002 $ - 65 000 $), sans aucun achat enregistré. Une seule opération, un achat de 1 001 $ à 15 000 $, concerne Robinhood le 3 juin. Les ETF Bitcoin spot, les sociétés de minage et Trump Media n'apparaissent pas. Le volume total des transactions de juin s'élève entre 78,1 et 263,1 millions de dollars. Les investissements en crypto sont donc marginaux par rapport à l'activité globale du portefeuille. Ceci contraste avec la déclaration de revenus 2025 de Trump, qui montrait environ 1,4 milliard de dollars de revenus liés aux cryptomonnaies. Le Bureau ovale affirme que les investissements sont gérés par des conseillers indépendants. Ces ventes semblent en contradiction avec la rhétorique de "crypto-président" tenue par Trump pendant la campagne électorale de 2024.

cryptonews.ruIl y a 9 mins

« Cryptoprésident » Trump vend des actions Coinbase et Strategy

cryptonews.ruIl y a 9 mins

Le cours de Circle rebondit de près de 17 % en deux jours, ce qui augmente véritablement n'est peut-être pas les fondamentaux

Le titre de l'article indique que le cours de l'action de Circle a rebondi de près de 17% en deux jours, une hausse qui ne serait pas principalement due à des fondamentaux. Les 19 et 20 août, le cours de Circle a augmenté d'environ 16,7%, porté par la remontée du Bitcoin au-dessus de 70 000 $, le recul des rendements des Treasuries et la force générale des actions liées à la cryptomonnaie. Des annonces comme la réunion à la Maison Blanche avec des dirigeants du secteur et la croissance des parts de marché de l'USDC ont également soutenu le sentiment. Les résultats du T2 2026 de Circle montrent une croissance continue du volume en circulation de l'USDC (+19%) et du volume des transactions sur chaîne (+151%). Cependant, la croissance des revenus a ralenti à +7%, car plus de 85% des revenus proviennent toujours des intérêts sur les actifs de réserve, dont le rendement a baissé. Pour sa transformation à long terme, Circle mise sur sa blockchain Arc, dont le réseau principal public est prévu pour le 16 septembre, et sur son réseau de paiement CPN. L'objectif est de développer les revenus liés aux services logiciels et de réseau, réduisant ainsi la dépendance aux intérêts. Un pré-vente de jetons Arc a déjà boosté les prévisions de revenus pour 2026. La valorisation à 259 $ d'ici 2030 selon un modèle TIKR (scénario neutre) intègre la réussite potentielle de cette transformation en plateforme. Elle contraste avec le prix cible moyen de Wall Street d'environ 101 $ pour les 12 prochains mois, qui se base davantage sur les revenus des réserves et l'environnement des taux. En conclusion, la récente hausse du cours reflète surtout un regain d'optimisme sectoriel. La prochaine étape clé sera le lancement d'Arc et, surtout, la capacité de Circle à générer des revenus commerciaux réels et croissants grâce à son écosystème, afin de valider sa transformation.

marsbitIl y a 11 mins

Le cours de Circle rebondit de près de 17 % en deux jours, ce qui augmente véritablement n'est peut-être pas les fondamentaux

marsbitIl y a 11 mins

Semaine record pour le bitcoin : hausse de plus de 16 000 $ et prédictions du cycle « le plus puissant » de l'histoire

Le bitcoin a enregistré sa plus forte augmentation hebdomadaire en valeur absolue de son histoire, passant d'environ 63 000 $ à 79 000 $ du 17 au 23 août 2026. Matt Cole, PDG de Strive, estime que cette hausse explosive constitue une percée par rapport au dollar et à l'or. Il prédit que la demande pour les actifs rares, comme le bitcoin et l'or, devrait s'intensifier, potentiellement alimentée par le développement de l'IA, et que le prochain cycle de marché pourrait être le "plus fort" jamais vu, attirant une part disproportionnée de liquidités. Les analystes sont globalement optimistes pour la suite. Dominic John de Zeus Research anticipe une poursuite de la hausse à court terme, portée par les entrées dans les ETF et une amélioration de la liquidité macroéconomique. Un maintien au-dessus de 80 000 $ pourrait ouvrir la voie vers 85 000-90 000 $, voire 100 000 $. Cependant, Rachel Lucas de BTC Markets met en garde contre les explications simplistes et conseille de surveiller les indicateurs tels que les entrées dans les ETF au comptant, l'intérêt ouvert et les taux de financement. Une demande au comptant solide est un fondement plus sain qu'une dynamique surchauffée sur les marchés à terme, laquelle peut signaler un risque de correction abrupte. Elle rappelle que la prise de bénéfices après une telle hausse est normale.

cryptonews.ruIl y a 22 mins

Semaine record pour le bitcoin : hausse de plus de 16 000 $ et prédictions du cycle « le plus puissant » de l'histoire

cryptonews.ruIl y a 22 mins

Trading

Spot

Articles tendance

Comment acheter ONE

Bienvenue sur HTX.com ! Nous vous permettons d'acheter Harmony (ONE) de manière simple et pratique. Suivez notre guide étape par étape pour commencer votre parcours crypto.Étape 1 : Création de votre compte HTXUtilisez votre adresse e-mail ou votre numéro de téléphone pour ouvrir un compte sur HTX gratuitement. L'inscription se fait en toute simplicité et débloque toutes les fonctionnalités.Créer mon compteÉtape 2 : Choix du mode de paiement (rubrique Acheter des cryptosCarte de crédit/débit : utilisez votre carte Visa ou Mastercard pour acheter instantanément Harmony (ONE).Solde :utilisez les fonds du solde de votre compte HTX pour trader en toute simplicité.Prestataire tiers :pour accroître la commodité d'utilisation, nous avons ajouté des modes de paiement populaires tels que Google Pay et Apple Pay.P2P :tradez directement avec d'autres utilisateurs sur HTX.OTC (de gré à gré) : nous offrons des services personnalisés et des taux de change compétitifs aux traders.Étape 3 : stockage de vos Harmony (ONE)Après avoir acheté vos Harmony (ONE), stockez-les sur votre compte HTX. Vous pouvez également les envoyer ailleurs via un transfert sur la blockchain ou les utiliser pour trader d'autres cryptos.Étape 4 : tradez des Harmony (ONE)Tradez facilement Harmony (ONE) sur le marché Spot de HTX. Il vous suffit d'accéder à votre compte, de sélectionner la paire de trading, d'exécuter vos trades et de les suivre en temps réel. Nous offrons une expérience conviviale aux débutants comme aux traders chevronnés.

690 vues totalesPublié le 2024.12.12Mis à jour le 2026.06.02

Comment acheter ONE

Discussions

Bienvenue dans la Communauté HTX. Ici, vous pouvez vous tenir informé(e) des derniers développements de la plateforme et accéder à des analyses de marché professionnelles. Les opinions des utilisateurs sur le prix de ONE (ONE) sont présentées ci-dessous.

活动图片