Un nouveau travail du lauréat du prix Turing Sutton : en utilisant une formule de 1967 pour résoudre une grande lacune de l'apprentissage par renforcement en flux continu

marsbitPublié le 2026-05-10Dernière mise à jour le 2026-05-10

Résumé

En 2024, une équipe de l'Université d'Alberta a identifié le "stream barrier", l'incapacité de l'apprentissage par renforcement profond à apprendre en flux continu (taille de lot de 1, sans mémoire de relecture), provoquant l'instabilité de l'entraînement. Une nouvelle étude, menée par Arsalan Sharifnassab (Openmind) et Mohamed Elsayed, A. Rupam Mahmood et Richard S. Sutton (Alberta), propose une solution radicale : le défaut ne vient pas du manque de données, mais du mauvais réglage du pas d'apprentissage. Ils introduisent les "Intentional Updates" (mises à jour intentionnelles). Au lieu de spécifier combien les paramètres doivent bouger, on spécifie de combien doit changer la sortie de la fonction (par exemple, réduire l'erreur de prédiction de 5%). Le pas d'apprentissage est alors calculé rétroactivement pour atteindre cet objectif. Cette idée s'inspire de l'algorithme NLMS de 1967. Les chercheurs l'étendent à l'apprentissage par renforcement profond, créant des algorithmes comme Intentional TD(λ) pour l'évaluation, Intentional Q(λ) pour le contrôle discret, et Intentional Policy Gradient pour le contrôle continu. Les résultats sur des benchmarks (MuJoCo, Atari) montrent que ces méthodes, en mode flux pur, égalent ou approchent les performances d'algorithmes de référence comme SAC ou DQN qui utilisent de grandes mémoires de relecture, tout en étant jusqu'à 140 fois plus économes en calcul. Bien que plus robuste et nécessitant moins de réglages, la méthode présente enco...

Fin 2024, un article intitulé "Streaming Deep Reinforcement Learning Finally Works" (arXiv:2410.14606) a suscité un large débat dans la communauté scientifique. Ses auteurs, de l'équipe de Mahmood à l'Université de l'Alberta, ont consacré de nombreuses pages à décrire une réalité embarrassante : l'apprentissage par renforcement, une méthode qui par nature devrait être capable d'« apprendre en marchant », est presque incapable de le faire à l'ère des réseaux de neurones profonds. Dès qu'on retire le tampon de relecture (replay buffer) ou qu'on fixe la taille du lot (batch size) à 1, l'entraînement s'effondre. Ils appellent ce phénomène la « barrière du flux » (stream barrier).

L'article proposait la série d'algorithmes StreamX, qui, grâce à un réglage minutieux des hyperparamètres, une initialisation parcimonieuse et diverses astuces de stabilisation, franchissaient à peine ce mur.

Pourtant, moins d'un an et demi plus tard, un membre du même groupe de recherche, en collaboration avec des chercheurs de l'institut Openmind, propose une réponse radicalement différente : la racine de la barrière du flux n'est pas « pas assez de données », mais « l'unité choisie pour le pas d'apprentissage (step size) est erronée ».

Titre de l'article : Intentional Updates for Streaming Reinforcement Learning

Adresse de l'article : https://arxiv.org/pdf/2604.19033v1

Dépôt de code : https://github.com/sharifnassab/Intentional_RL

Un coup d'accélérateur, un trou de quelle taille

Imaginez que vous appreniez à garer une voiture. L'instructeur vous dit d'« appuyer sur l'accélérateur pendant 0,1 seconde » à chaque fois. Le problème est qu'en appuyant pendant la même durée de 0,1 seconde, la distance parcourue par la voiture peut varier énormément selon que vous êtes en montée, en descente, à vide ou en charge. Parfois, il manque un centimètre pour se garer parfaitement, d'autres fois, il manque 30 centimètres et vous rentrez directement dans le mur.

C'est précisément ce que fait le pas d'apprentissage traditionnel en descente de gradient : il spécifie de combien les paramètres doivent bouger à chaque fois, mais ne contrôle pas du tout de combien la sortie de la fonction change réellement. En entraînement par lots, lorsque les erreurs de centaines ou milliers d'échantillons sont moyennées, les cas extrêmes sont dilués et le problème n'est pas flagrant. Mais en environnement « flux continu », chaque étape ne dispose que d'un seul échantillon, il n'y a pas de moyenne. Dès que la direction du gradient est instable, l'amplitude de la mise à jour devient erratique — aujourd'hui, avancer de 30 cm, demain, reculer de 50 cm — et le processus d'apprentissage s'effondre dans des oscillations violentes.

Ce phénomène de « sur- et sous-ajustement » (overshooting and undershooting) est particulièrement grave en apprentissage par renforcement, car le gradient à chaque pas de temps varie non seulement en amplitude, mais aussi en direction de manière très rapide.

Redéfinir « combien un pas doit accomplir »

Dans un article récemment publié par Arsalan Sharifnassab de l'institut Openmind et Mohamed Elsayed, A. Rupam Mahmood et Richard Sutton de l'Université de l'Alberta, les chercheurs proposent une approche différente : plutôt que de spécifier combien les paramètres doivent bouger, il vaut mieux spécifier directement de combien la sortie de la fonction doit changer.

Cette idée ne sort pas de nulle part. En 1967, les chercheurs japonais Nagumo et Noda, dans leur article « A learning method for system identification », avaient déjà proposé l'algorithme « Normalized Least Mean Squares » (NLMS) dans le domaine du filtrage adaptatif ; essentiellement, il utilise aussi le changement de sortie souhaité pour déduire le pas d'apprentissage, et non l'inverse. Cependant, cet algorithme ne s'appliquait qu'à des scénarios linéaires simples.

Les chercheurs ont étendu cette idée à l'apprentissage par renforcement profond. Ils l'appellent « mises à jour intentionnelles » (Intentional Updates) : avant chaque mise à jour, définir clairement « ce que je souhaite accomplir avec cette étape », puis en déduire la taille du pas nécessaire.

Pour l'apprentissage de la valeur (c'est-à-dire la prédiction de la récompense future), leur intention est définie comme suit : après chaque mise à jour, l'erreur de prédiction de la valeur de l'état courant doit être réduite d'une proportion fixe — par exemple de 5 %, ni plus ni moins. Pour l'apprentissage de la politique (c'est-à-dire l'optimisation des actions décisionnelles), leur intention est définie comme suit : la probabilité de sélection de l'action courante ne doit changer que d'une quantité « modérée » à chaque étape.

Pour reprendre la métaphore de la conduite : c'est comme si le conducteur décidait avant chaque manœuvre « je veux faire avancer la voiture de 20 cm », puis calculait automatiquement à quelle profondeur appuyer sur l'accélérateur en fonction des conditions de la route (pente, charge), au lieu d'appuyer toujours de la même profondeur et de s'en remettre au hasard.

Le lauréat du prix Turing et son puzzle

L'un des signataires de l'article est Richard S. Sutton — lauréat du prix Turing 2024, largement considéré comme le « père de l'apprentissage par renforcement moderne ».

La stature de Sutton dans le monde académique est comparable à celle de Feynman en physique : il a non seulement proposé l'apprentissage par différence temporelle (TD learning) et le gradient de politique (policy gradient), deux cadres fondamentaux de l'apprentissage par renforcement moderne, mais il a aussi co-écrit avec Andrew Barto le manuel le plus faisant autorité dans ce domaine, « Reinforcement Learning: An Introduction » (maintenant dans sa deuxième édition, accessible gratuitement en ligne). Il a partagé le prix Turing 2024 avec Barto, le jury ayant salué leurs travaux pour « avoir jeté les bases conceptuelles et algorithmiques de l'apprentissage par renforcement ».

Après avoir reçu le prix, Sutton n'a pas choisi de prendre sa retraite, mais a investi la dotation dans l'institut Openmind qu'il a fondé, dédié au financement de jeunes chercheurs souhaitant explorer des problèmes fondamentaux « dans un environnement non soumis aux pressions commerciales ». Ce nouvel article est issu de cette institution à but non lucratif.

Et le premier auteur, Sharifnassab, venait juste de publier le cadre MetaOptimize à ICML 2025, étudiant comment ajuster automatiquement en ligne le taux d'apprentissage. Les deux sujets sont très cohérents : comment rendre le pas d'apprentissage lui-même plus intelligent.

Détails de l'algorithme : plus simple qu'imaginé

La dérivation mathématique des « mises à jour intentionnelles » n'est pas complexe, sa formule centrale peut se décrire en une phrase : le pas d'apprentissage est égal à la « quantité de changement de sortie souhaitée » divisée par « l'influence réelle de la direction du gradient sur la sortie ».

Dans l'apprentissage de la valeur, cette « influence réelle » est la norme du vecteur gradient (mesurant en quelque sorte à quel point la région des paramètres est « raide ») : plus la pente est forte, plus le pas est petit ; plus elle est douce, plus le pas est grand, garantissant ainsi que l'impact de chaque mise à jour sur la fonction de valeur reste constant.

Dans l'apprentissage de la politique, la « quantité de changement souhaitée » est définie comme proportionnelle à la fonction d'avantage : de combien l'action courante est meilleure que la moyenne, la politique bougera d'autant dans cette direction — avec une moyenne mobile pour normaliser l'échelle, assurant qu'à long terme l'amplitude des changements de politique reste stable dans une plage interprétable.

Les chercheurs ont également combiné cette idée centrale avec deux pratiques d'ingénierie : la mise à l'échelle diagonale de style RMSProp (pour gérer les différences d'échelle entre dimensions des paramètres) et les traces d'éligibilité (eligibility traces, aidant à propager le signal de récompense vers les pas de temps passés).

Finalement, trois algorithmes complets sont formés : Intentional TD (λ) pour la prédiction de valeur, Intentional Q (λ) pour le contrôle d'actions discrètes, et Intentional Policy Gradient pour le contrôle continu.

Résultats expérimentaux : égaler SAC même sans GPU

L'article évalue cette approche sur plusieurs benchmarks standards, et les résultats sont impressionnants.

Sur les tâches de contrôle continu MuJoCo (incluant des robots de simulation complexes comme Ant, Humanoid, HalfCheetah), la nouvelle méthode Intentional AC, en configuration flux continu (taille de lot = 1, sans tampon de relecture), atteint des performances finales qui se rapprochent voire rivalisent à plusieurs reprises avec SAC — un algorithme utilisant un grand tampon de relecture par lots et considéré comme l'étalon-or actuel pour ces tâches. En termes de calcul, le nombre d'opérations en virgule flottante requises pour une mise à jour d'Intentional AC n'est qu'environ 1/140 de celui d'une mise à jour de SAC.

Sur les jeux d'actions discrètes Atari et MinAtar, Intentional Q-learning performe de manière comparable au DQN utilisant un tampon de relecture, et parvient à exécuter toutes les tâches avec le même jeu d'hyperparamètres, sans avoir besoin de les ajuster une par une.

Les chercheurs ont également vérifié spécifiquement si « l'intention » était réellement réalisée : ils ont mesuré le rapport entre le changement réel et le changement attendu. Dans une configuration simplifiée avec les traces d'éligibilité désactivées, l'écart-type de ce rapport n'était que de 0,016 à 0,029, et le 99e centile était toujours inférieur à 1,07 ; signifiant que la grande majorité du temps, la mise à jour a bien fait « exactement ce qui était convenu ».

De plus, une série d'expériences d'ablation montre que retirer la normalisation RMSProp ou le terme σ entraîne une baisse de performance mais la méthode reste compétitive, et que cette « mise à l'échelle intentionnelle » elle-même est le contributeur principal, les autres composants étant des auxiliaires.

Il reste des problèmes

Le cadre des « mises à jour intentionnelles » montre également un avantage notable en robustesse. Lorsque les chercheurs retirent une à une les diverses astuces de stabilisation dont dépend la méthode StreamX (initialisation parcimonieuse, mise à l'échelle des récompenses, normalisation des entrées, LayerNorm), la dégradation des performances d'Intentional AC est nettement moindre que celle du StreamAC original, indiquant que la mise à l'échelle intentionnelle réduit à la racine la dépendance aux « béquilles » externes.

Mais l'article reconnaît aussi un problème non entièrement résolu : dans l'apprentissage de la politique, la taille du pas dépend de l'action échantillonnée courante, ce qui peut implicitement attribuer des « poids » différents aux différentes actions, et potentiellement altérer la direction attendue du gradient de politique. Dans les tâches Humanoid et HumanoidStandup, en mesurant la similarité cosinus de la direction attendue de la mise à jour, les chercheurs ont constaté que ce biais était proche de 0,96 pendant les phases d'apprentissage critiques (presque aucun impact) ; mais dans Ant-v4, l'alignement descendait à une médiane de 0,63, montrant que le problème ne peut pas toujours être ignoré.

Les auteurs indiquent que les recherches futures devraient chercher des stratégies de sélection de pas indépendantes de l'action, afin que « l'intention » reste non biaisée en espérance. C'est un travail clair laissé aux successeurs dans cette direction.

Conclusion : permettre à l'IA d'apprendre en agissant, comme les humains

Le paradigme d'entraînement dominant actuel des grands modèles repose sur la digestion par lots de masses de données : nourrir tous les textes et codes d'Internet, itérer de manière répétée, pour finalement voir émerger des capacités impressionnantes. Cette voie s'est avérée efficace, mais elle est fondamentalement « apprendre d'abord, utiliser ensuite » : une fois l'entraînement terminé, le modèle est figé, incapable de se mettre à jour continuellement à partir de chaque interaction ultérieure.

Ce que recherche l'apprentissage par renforcement en flux continu, c'est un mode d'apprentissage radicalement différent : ne pas dépendre de masses de relectures, ne pas dépendre d'immenses grappes de GPU, transformer immédiatement chaque expérience en mise à jour des paramètres, de manière continue, économique et adaptative. Cela se rapproche davantage de la manière dont les humains et les animaux apprennent réellement.

De la percée préliminaire d'Elsayed et al. en 2024 « ça fonctionne enfin », au principe de « mise à jour intentionnelle » proposé dans cet article, l'apprentissage par renforcement profond en flux continu mûrit à une vitesse surprenante. Il ne remplacera pas les grands modèles entraînés par lots, mais pour les robots nécessitant une adaptation en ligne à long terme, les dispositifs de périphérie (edge devices), et tout scénario d'application ne pouvant supporter des tampons de relecture massifs et des grappes de GPU, cette voie devient de plus en plus convaincante.

La taille du pas n'est pas juste un hyperparamètre, c'est l'engagement de l'IA sur « combien elle veut accomplir » à chaque étape. Quand cet engagement devient enfin contrôlable, l'apprentissage lui-même se stabilise.

Cet article provient du compte WeChat officiel « Machine Heart » (ID:almosthuman2014), auteur : 关注RL的 (Qui s'intéresse au RL)

Questions liées

QQuel est le principal obstacle identifié dans l'apprentissage par renforcement en streaming avant l'étude mentionnée, et comment est-il désigné ?

ALe principal obstacle identifié est l'incapacité de l'apprentissage par renforcement profond à fonctionner efficacement en mode 'en ligne', où les données arrivent une par une sans tampon de relecture. Ce problème est désigné sous le nom de 'stream barrier' (barrière du streaming).

QQuelle idée centrale les chercheurs proposent-ils pour surmonter la 'barrière du streaming' dans l'apprentissage par renforcement ?

ALes chercheurs proposent de changer l'approche pour déterminer le pas d'apprentissage. Au lieu de fixer la taille du déplacement des paramètres, ils suggèrent de spécifier directement de combien la sortie de la fonction (par exemple, la prédiction de valeur) doit changer, puis de calculer le pas nécessaire pour atteindre cet objectif. Cette méthode est appelée 'Intentional Updates' (mises à jour intentionnelles).

QQuelle est l'origine historique du concept clé utilisé dans la méthode des 'Intentional Updates' ?

ALe concept clé trouve son origine dans l'algorithme 'Normalized Least Mean Squares' (NLMS) proposé par les chercheurs japonais Nagumo et Noda en 1967 dans le domaine du filtrage adaptatif. Cet algorithme utilisait déjà l'idée d'adapter le pas d'apprentissage en fonction du changement de sortie souhaité.

QQuels sont les trois algorithmes complets développés à partir du principe des 'Intentional Updates' ?

ALes trois algorithmes complets développés sont : Intentional TD(λ) pour l'apprentissage de la valeur, Intentional Q(λ) pour le contrôle d'actions discrètes, et Intentional Policy Gradient pour le contrôle continu.

QD'après l'article, quel avantage majeur la méthode 'Intentional AC' présente-t-elle par rapport à l'algorithme SAC en termes de ressources de calcul ?

AL'avantage majeur est une réduction drastique des besoins en calcul. Chaque mise à jour de l'algorithme Intentional AC nécessite environ 140 fois moins d'opérations à virgule flottante qu'une mise à jour de l'algorithme SAC, tout en obtenant des performances comparables en mode streaming.

Lectures associées

Bulletin de financement | Crypto.com obtient 400 millions de dollars d'investissement, les secteurs de la CeFi et des stablecoins continuent d'attirer des capitaux

**Résumé des Investissements Hebdomadaires (13-19 Juillet)** Le marché du financement crypto a connu une nette accélération la semaine dernière, avec 17 transactions totalisant plus de 812 millions de dollars, soit un doublement en nombre et en volume. Les secteurs de la finance centralisée (CeFi) et des stablecoins ont dominé les investissements. L'échange **Crypto.com** a levé 4 milliards de dollars auprès de Citadel Securities, portant sa valorisation à 200 milliards de dollars. **Alpaca** (infrastructure de courtage API) a levé 135 millions de dollars, tandis que **Flex** (plateforme bancaire transfrontalière basée sur des stablecoins) a obtenu 70 millions de dollars. **Velocity** (solutions de règlement par stablecoins) a sécurisé 38 millions de dollars. **Tether** a investi 20 millions de dollars dans la banque numérique argentine Ualá. Dans l'infrastructure financière, **ADI Chain** (règlement de stablecoins) a levé 50 millions de dollars, **Cyclops** (infrastructure de paiement par stablecoins) 20 millions de dollars, et **Pact Labs** (intégration de l'USDT dans les salaires) 7 millions de dollars dirigés par Tether. Le secteur DeFi a annoncé deux levées, dont **Quote Trade** (DEX axé sur l'IA) avec 4 millions de dollars. Un tour de table notable est celui de la plateforme de marché prédictif **Pascal**, qui a levé 9 millions de dollars. Parallèlement, le secteur IA/robotique reste très actif. L'entreprise de cloud IA **Fireworks** (soutenue par Nvidia) a levé 1.5 milliard de dollars, la startup de robots humanoïdes **Walden Robotics** (filiale de Toyota) 300 millions de dollars, et le fabricant chinois de robots humanoïdes **逐际动力 (Climber Robotics)** près de 200 millions de dollars dans un tour Pre-IPO. Enfin, plusieurs acquisitions ont eu lieu, notamment celle de l'échange singapourien **Coinhako** par le japonais SBI Holdings, et de la startup de dépôts crypto **Glide** par **MoonPay**.

marsbitIl y a 55 mins

Bulletin de financement | Crypto.com obtient 400 millions de dollars d'investissement, les secteurs de la CeFi et des stablecoins continuent d'attirer des capitaux

marsbitIl y a 55 mins

Le bear market le plus doux ? Les vendeurs de BTC délaissent le marché, ARK et Bitwise affichent un optimisme collectif

La volatilité demeure sur le marché des cryptomonnaies. Le bitcoin (BTC) évolue autour de 75 000 USD, tandis que l'ether (ETH) lutte pour maintenir 1 900 USD. Les liquidations à court terme ont principalement affecté les positions vendeuses. Les perspectives des institutions sont mitigées mais montrent des signes de retour de l'optimisme prudent. Polymarket estime à 33% la probabilité que le BTC passe sous 50 000 USD cette année. ARK Invest relève des signaux de tension vendeuse, avec une part historiquement élevée des BTC détenus à long terme. Bitwise qualifie ce ralentissement de "baissier structurellement le plus doux" jamais enregistré, notant que les creux de cycle sont de plus en plus hauts et que les investisseurs institutionnels voient les baisses comme des opportunités. D'un point de vue technique, Bit estime que le creux de la vague baissière (C) est probablement formé, une zone de fond idéale se situant entre 50 000 et 55 000 USD. Cependant, un analyste de Glassnode met en garde : si le BTC ne dépasse pas durablement 66 000 USD, un risque de sommet à court terme subsiste. L'analyste Darkfost identifie quant à lui une bande de soutien cruciale entre 59 000 et 70 000 USD. Signe notable d'un changement de sentiment, le trader Doctor Profit a annoncé avoir fermé toutes ses positions vendeuses sur les cryptos, réalisant d'importants bénéfices, et a recommencé à accumuler du BTC au comptant depuis 64 000 USD. Il estime que le marché anticipe trop uniformément un creux vers 40 000-50 000 USD à l'automne, ce qui pourrait ne pas se matérialiser.

Foresight NewsIl y a 1 h

Le bear market le plus doux ? Les vendeurs de BTC délaissent le marché, ARK et Bitwise affichent un optimisme collectif

Foresight NewsIl y a 1 h

Évolution de l'ordre à l'ère de l'IA et du Web3 : Dimensions concurrentielles et voies d'exploration de m&W

Nous traversons une ère de transformation profonde, passant de l'amélioration de la productivité à la refonte des relations de production. Les agents IA (intelligents) libèrent une capacité de production inédite. À l'avenir, les tâches seront de moins en moins accomplies par des individus isolés et de plus en plus par des réseaux collaboratifs mêlant humains et agents IA. Une question fondamentale émerge : comment établir des relations de confiance, évaluer des contributions complexes et créer des mécanismes de répartition de la valeur stables et équitables entre des humains et des agents IA étrangers en collaboration à long terme ? Si Web3 a posé les bases techniques pour les actifs, l'identité et l'organisation, l'ère des agents IA exige un système d'ordre nouveau intégrant identité, crédit, collaboration et incitations économiques. L'article analyse le positionnement de m&WDAO par rapport aux principales voies d'exploration actuelles : * **Colony** : se concentre sur la gouvernance et la collaboration **humaines** basées sur la contribution. * **SingularityNET (ASI)** : se concentre sur l'échange et la découverte **ouvertes des capacités de l'IA**. * **Gitcoin Passport / Verax** : se concentrent sur la **vérification de l'authenticité de l'identité** et la résistance aux sybils. * **Farcaster & Lens Protocol** : se concentrent sur les **réseaux d'information et d'identité ouverts**. Contrairement à ces approches, m&W explore une voie complémentaire et plus fondamentale : **comment construire un réseau de collaboration crédible entre humains et agents IA**. Son cheminement se structure en trois phases évolutives : 1. **m&W 1.0 : Ancrage du Crédit** – Sélection de "Builders" de haute qualité via un mécanisme d'impact ("proton collision"). Leurs contributions continues sont transformées en actifs de crédit non transférables (SBT), posant les bases d'une identité et d'une réputation fiables pour leurs futurs "doubles numériques" (agents IA). 2. **m&W 2.0 : Économie de la Collaboration (EcoFi)** – Le protocole EcoFi connecte les nœuds crédibles à des tâches réelles. Il utilise un système de vérification à plusieurs niveaux (pré-analyse par IA, jugement de valeur complexe par des Builders, arbitrage final par un réseau OG) pour évaluer, rémunérer et liquider les contributions, créant une boucle de valeur fermée qui renforce en retour le système de crédit. 3. **m&W 3.0 : Ordre Intelligent** – Le crédit humain accumulé (SBT) sert de base de confiance pour les agents IA (doubles numériques) lorsqu'ils entrent dans le réseau économique. Cela facilite l'émergence d'une "économie de collaboration homme-machine", où les agents ne sont plus de simples outils mais des participants actifs et crédibles. Ce parcours ambitieux présente des défis techniques et économiques majeurs, comme le démarrage à froid dû à une sélection exigeante, l'équilibre délicat entre vérification par IA et gouvernance humaine, et la stabilité à long terme de l'économie du jeton $CMW. En résumé, m&W ne cherche pas à être une plateforme de modèles IA, un marché d'algorithmes ou un outil de service Agent de plus. Son ambition est de répondre à une question structurelle de l'ère de l'IA : **comment établir un nouvel ordre économique - incluant crédit, collaboration et répartition de la valeur - pour un futur où humains et agents IA co-créeront de la valeur**. Il s'agit d'explorer les nouvelles relations de production à l'ère de l'intelligence artificielle.

链捕手Il y a 1 h

Évolution de l'ordre à l'ère de l'IA et du Web3 : Dimensions concurrentielles et voies d'exploration de m&W

链捕手Il y a 1 h

2026 IMO : la Chine truste les scores parfaits, le lycée de Shanghai domine, GPT-5.6 rejoue le moment AlphaGO

Félicitations à l'équipe chinoise ! L'équipe de Chine a remporté la première place aux Olympiades Internationales de Mathématiques (IMO) 2026 à Shanghai, avec une performance historique : les six membres de l'équipe ont tous obtenu une médaille d'or et un score total de 232 points, devançant les États-Unis (2e) de 25 points. Trois étudiants, Deng Leyan et Zhang Bolun du Shanghai High School, et Liu Che de la High School Affiliated to East China Normal University, ont réalisé un score parfait de 42/42. Cet événement marque la 26e victoire de la Chine depuis sa première en 1989. Le Shanghai High School, hôte de cette 67e édition (une première pour une école secondaire), a vu ses anciens élèves devenir des mathématiciens renommés. L'article souligne également un développement parallèle majeur : l'intelligence artificielle. Alors que les prouesses des étudiants humains représentent la "perfection sans erreur", il est rapporté que le modèle GPT-5.6 Pro aurait résolu les six problèmes de l'IMO 2026 dès sa première tentative, sans guidance humaine. Si cela est confirmé, cela pourrait indiquer que l'IA franchit une nouvelle étape, passant de la résolution par essais à une précision immédiate, évoquant un "moment AlphaGo" pour les olympiades de mathématiques. Les États-Unis et la Russie ont terminé respectivement deuxième et troisième du classement par équipes.

marsbitIl y a 1 h

2026 IMO : la Chine truste les scores parfaits, le lycée de Shanghai domine, GPT-5.6 rejoue le moment AlphaGO

marsbitIl y a 1 h

Trading

Spot
活动图片