OpenAI résout 10 problèmes mathématiques complexes, Fable en « reproduit » 5 en 24 heures

marsbitPublié le 2026-08-05Dernière mise à jour le 2026-08-05

Résumé

En seulement 24 heures, une course spectaculaire s'est jouée en mathématiques entre les géants de l'IA, OpenAI et Anthropic. Le 1er août, OpenAI a annoncé que son futur modèle principal non dévoilé, Astra, avait démontré 10 résultats mathématiques de pointe, fournissant des certificats Lean et des analyses détaillées. Ces problèmes ouverts, non résolus depuis des décennies pour certains, sont considérés comme significatifs, l'un d'eux étant potentiellement digne d'une publication dans les prestigieuses *Annals of Mathematics*. Moins d'un jour plus tard, un chercheur d'Anthropic, Levent Alpöge, a riposté en déclarant que Fable, un modèle déjà public, avait indépendamment résolu 5 des 10 problèmes d'OpenAI. Il affirme avoir utilisé des conditions strictes : autonomie complète, prompts génériques, pas d'accès internet et des précautions pour éviter toute contamination par les solutions d'OpenAI. Cet événement réduit drastiquement la « durée de vie » d'une primeur mathématique. OpenAI avait également souligné un faible coût marginal (environ 2000 dollars) pour trouver ces solutions, bien que les coûts de R&D, de formalisation et de vérification restent énormes. Au-delà du simple « benchmark », cette confrontation agit comme un processus de revue par les pairs, testant la fiabilité et la reproductibilité indépendante des découvertes. Cependant, l'essentiel de ces travaux est incompréhensible pour le grand public, voire pour la plupart des scientifiques. La confiance repose déso...

10 problèmes mathématiques, 24 heures pour un retournement de situation.

Ce week-end, OpenAI et Anthropic, les deux géants de l'IA, se sont affrontés sur les fronts les plus avancés des mathématiques.

Le 1er août, le chercheur d'OpenAI Sébastien Bubeck a d'abord annoncé que leur prochain modèle phare non divulgué, Astra, avait prouvé d'un coup 10 avancées mathématiques de pointe, en fournissant également 10 certificats Lean et 10 analyses détaillées des raisonnements par problème.

Il ne faut pas sous-estimer ces 10 problèmes.

Leurs principales conclusions n'avaient pas été progressées depuis au moins 10 ans, certains étant bloqués depuis plusieurs décennies, ce sont de véritables problèmes ouverts.

Bien qu'ils ne soient pas les énigmes les plus profondes des mathématiques, ce sont chacun des os durs à ronger.

Elliot Glazer, responsable de FrontierMath chez Epoch AI, a déclaré sans ambages : le seul article sur l'existence des groupes non sophiqués pourrait certainement être publié dans Annals of Mathematics, une revue de premier plan reconnue par la communauté mathématique.

La publication de ces 10 problèmes difficiles a immédiatement fait exploser le monde de l'IA, certains criant sur le moment que « la singularité mathématique est arrivée ».

Anthropic a rapidement répondu.

En moins de 24 heures, le chercheur Levent Alpöge a répondu sous le post de Bubeck : « J'en ai fait la moitié avec Fable. »

Puis il a ajouté qu'il avait résolu les items 4, 5, 6, 7 et 8 de la liste d'OpenAI, soit un total de 5 items.

Les conditions expérimentales, selon Levent, étaient propres : totalement autonome, prompts génériques, pas d'accès internet pendant toute la durée, avec même une couche de protection ajoutée pour éviter que les solutions d'OpenAI ne fuient dans le contexte.

Bien sûr, Levent n'a pas encore publié les détails complets des preuves de Fable, il a indiqué qu'il les mettrait en ligne.

Mais si cela est confirmé, la donne change :

L'avantage de la primeur obtenu par OpenAI avec son modèle non publié Astra n'a tenu que 24 heures. Et Fable, qui l'a rattrapé, est un modèle qu'Anthropic a déjà rendu public et que tout le monde peut utiliser.

Une « primeur mathématique » dont la durée de conservation n'est plus que de 24 heures

L'utilisateur Chubby a relayé : « Fable, disponible publiquement, a reproduit la moitié des réalisations d'Astra. »

Dans les commentaires, certains ont plaisanté : à ce compte-là, OpenAI n'aurait-elle obtenu qu'une simple primeur ?

Autrefois, la bataille pour la priorité d'un résultat mathématique se mesurait généralement en années.

Qui l'a pensé en premier, qui l'a prouvé en premier, qui l'a publié en premier, avec entre-temps de longues phases de soumission, révision, modification.

Mais maintenant, Astra n'est même pas encore officiellement publié, et les résultats qu'il a annoncés, en seulement 24 heures, ont déjà été rattrapés à moitié par un modèle public.

La valeur de la primeur demeure, mais sa durée de conservation s'est considérablement raccourcie.

De nombreux internautes crient déjà à la « singularité mathématique », et les deux géants de l'IA se serrent de près.

Derrière les 2000 dollars, une facture encore plus salée

OpenAI a aussi lancé un chiffre : trouver ces 10 solutions a coûté moins de 2000 dollars.

Selon le chercheur Noam Brown, cela correspond aux tokens nécessaires pour trouver ces solutions, convertis au prix de l'API Sol.

C'est-à-dire qu'il s'agit uniquement du coût marginal de raisonnement au moment où les 10 solutions ont été exécutées avec succès.

En dehors de cela, il y a aussi le coût de formation et de R&D d'Astra lui-même, celui des problèmes tentés sans succès, les heures-homme pour organiser les arguments en un article de 249 pages, le coût de formalisation de chaque preuve en Lean, et enfin le coût de la revue par des mathématiciens externes.

Noam lui-même admet qu'ils ont aussi essayé d'autres problèmes majeurs, sans succès, n'ayant résolu aucun des problèmes du millénaire.

Malgré tout, 2000 dollars font tout de même tomber le coût marginal de résolution d'un problème mathématique de pointe par l'IA à un plancher.

Certains plaisantent même en se demandant si OpenAI annoncera demain 10 autres percées mathématiques, ou s'attendra à la semaine prochaine pour en publier 100 d'un coup.

De « l'émulation mutuelle » à « la vérification mutuelle »

Le fait que Fable refasse la même série de problèmes qu'Astra est bien plus intéressant qu'un simple benchmark.

Un benchmark teste des réponses connues : les questions et les réponses standards sont posées, on compare les scores.

Alors que deux modèles, dans des conditions sans réseau et protégées contre les fuites, arrivent indépendamment à la même conclusion de pointe, testent quelque chose de complètement différent : la fiabilité même de ce résultat, la possibilité de le reproduire de manière indépendante.

Cela ressemble davantage à un examen par les pairs.

Pour l'instant, Levent s'est contenté de « faire une déclaration » sur X, sans publier les PDF des 5 preuves, les prompts, les journaux d'exécution complets, le coût en tokens ou les certificats Lean.

L'utilisateur Haider s'interroge : même si c'est vrai, pourquoi utiliser Fable pour reproduire Astra, plutôt que de l'utiliser directement pour résoudre de nouveaux problèmes ouverts ?

En réalité, Fable ne fait pas que profiter de la notoriété d'Astra, il résout aussi de nouveaux problèmes.

En juillet, Levent a utilisé Fable pour produire un contre-exemple tridimensionnel à la conjecture de Jacobian, et par la suite, quelqu'un a même rédigé un document de vérification algébrique de 7 pages, confirmant que cette application explicite réfutait bien la conjecture en dimension trois et supérieure.

Des résultats que la grande majorité ne comprend pas, qui va les valider ?

L'importance réelle de ces 10 résultats est très difficile à juger pour la grande majorité des gens.

Ethan Mollick a mis le doigt dessus : pour presque chaque personne sur Terre, cela dépasse non seulement nos capacités, mais notre compréhension. Nous ne pouvons que croire les mathématiciens professionnels qui nous diront si c'est impressionnant ou non.

Le code, les images, le chat, les gens ordinaires peuvent encore expérimenter par eux-mêmes où réside la puissance de l'IA.

Mais l'existence de groupes non sophiqués, les contre-exemples à la conjecture de rigidité de Connes, le théorème de répétition parallèle quantique, seuls un nombre infime d'experts peuvent les comprendre.

Plus les capacités de l'IA s'avancent vers les frontières scientifiques, moins le public peut s'appuyer sur l'expérience directe, et plus il dépend d'une longue chaîne de confiance. Cet état où « on ne sait même plus s'émerveiller » se produit simultanément dans de plus en plus de domaines.

Le mathématicien Thomas Bloom rappelle que ces résultats utilisent des théories mathématiques accumulées sur des siècles, des systèmes de formalisation construits de la main des mathématiques. Les décrire simplement comme « l'IA remplaçant les mathématiciens » n'est pas honnête.

Le critère qu'il donne est : cette preuve nous apprend-elle quelque chose de nouveau sur ce problème ?

La vraie question se pose donc : lorsque l'IA peut produire à faible coût et en série des preuves mathématiques de pointe, sur quoi devons-nous mesurer ses réalisations ?

La réponse n'est peut-être pas du côté de sa production, mais du côté de la validation : la capacité d'une preuve à être lue, vérifiée, et son importance jugée, est ce qui déterminera finalement sa valeur réelle.

La compétence la plus rare est en train de passer de « faire une preuve » à « comprendre et valider une preuve ».

Lorsque l'IA peut prouver dix problèmes difficiles en une nuit, le véritable défi ne fait que commencer : les preuves étant produites de plus en plus vite, notre vérification pourra-t-elle suivre ?

Références :

https://x.com/haider1/status/2083908869915611554

https://x.com/polynoamial/status/2083470822258467194

https://x.com/kimmonismus/status/2083950641978679363 https://x.com/Dr_Singularity/status/2083653287463571742

Cet article provient du compte public WeChat « AI-Sci启示录 », auteur : ASI启示录

Questions liées

QQuel événement majeur a déclenché la compétition entre OpenAI et Anthropic en mathématiques ?

AOpenAI a annoncé que son modèle non publié Astra a prouvé 10 problèmes mathématiques difficiles, puis Anthropic a répondu que son modèle public Fable en avait résolu 5 en 24 heures.

QQuelle est la principale signification du fait que Fable ait reproduit la moitié des résultats d'Astra en 24 heures ?

ACela signifie que la durée de l'avantage d'être le premier à publier une découverte mathématique se réduit considérablement, et qu'un modèle public peut rapidement rattraper un modèle non publié, accélérant la vérification indépendante.

QSelon l'article, quel est le coût marginal estimé pour OpenAI pour trouver ces 10 solutions, et que ne couvre-t-il pas ?

ALe coût marginal est inférieur à 2000 dollars, basé sur les tokens utilisés. Il ne couvre pas les coûts de R&D du modèle, les problèmes non résolus, le temps humain de rédaction, la formalisation en Lean ou l'examen par des mathématiciens.

QEn quoi le fait de résoudre les mêmes problèmes diffère-t-il des classements traditionnels (benchmarks) pour les modèles d'IA ?

ALes benchmarks testent des réponses connues, tandis que résoudre indépendamment les mêmes problèmes ouverts teste la fiabilité et la reproductibilité des résultats, ce qui ressemble davantage à un examen par les pairs.

QSelon la conclusion de l'article, quelle capacité devient la plus cruciale à mesure que l'IA produit des preuves mathématiques à grande vitesse ?

ALa capacité la plus cruciale est passée de « produire une preuve » à « comprendre et valider une preuve ». La vérification humaine et l'évaluation de l'importance des résultats deviennent le défi central.

Lectures associées

Criant d'acheter, pourquoi Goldman Sachs reste optimiste sur Samsung et SK Hynix

Malgré une baisse récente de 23% et 35% des actions de Samsung Electronics et SK Hynix, Goldman Sachs réitère sa recommandation d'achat. La banque mise sur trois facteurs pour soutenir sa position optimiste. Premièrement, Goldman anticipe une remontée significative des prix du HBM (High Bandwidth Memory), composant clé pour l'IA, d'ici 2027. Le prix moyen par gigabit devrait atteindre environ 2,9$, retrouvant ainsi un écart de prix par rapport à la DRAM traditionnelle. Cette hausse s'explique par une demande d'IA supérieure à l'offre, une complexité de fabrication accrue et une consommation de capacités de production plus importante. Deuxièmement, la signature d'accords d'approvisionnement à long terme (LTA), d'une durée de 3 à 5 ans, avec de grands clients comme les centres de données, devrait stabiliser le cycle. Ces contrats couvriraient une part importante de la capacité de production prévue (jusqu'à 70% pour Samsung) et incluraient des mécanismes comme des prix planchers et des acomptes, réduisant les risques pour les fabricants. Troisièmement, les stocks des principaux fournisseurs et clients restent à un niveau bas (2-4 semaines), limitant le risque d'un retournement soudain du marché à court terme. De plus, la demande croissante de SSD d'entreprise pour serveurs IA devrait compenser partiellement la faiblesse des marchés grand public comme les smartphones, maintenant le marché NAND sous tension. Enfin, Goldman considère que l'expansion de fabricants comme CXMT ne menace pas à court terme l'équilibre du marché mondial de la DRAM haut de gamme et du HBM, en raison d'écarts technologiques persistants. Les risques persistent (demande d'IA inférieure aux attentes, conditions des LTA moins favorables), mais pour Goldman, la combinaison de la hausse des prix du HBM, des contrats à long terme et des faibles stocks soutient la visibilité des revenus et justifie l'optimisme.

marsbitIl y a 6 mins

Criant d'acheter, pourquoi Goldman Sachs reste optimiste sur Samsung et SK Hynix

marsbitIl y a 6 mins

Il fut l'artisan de deux grandes industries à Shanghai, mais s'en est allé discrètement avec des regrets

À la fin des années 1990, Jiang Shangzhou, vice-directeur de la Commission économique de Shanghai, a joué un rôle déterminant dans le développement de deux industries stratégiques en Chine : les semi-conducteurs et l'aviation commerciale. Alors que l'industrie chinoise des puces électroniques peinait dans un cycle de dépendance technologique, Jiang a défendu avec audace un plan visant à construire dix lignes de production de puces de 8 pouces à Shanghai en cinq ans, contre deux prévues nationalement. Il a contribué à attirer des talents comme Zhang Rujing, fondateur de SMIC, et Yin Zhiyao, fondateur d'AMEC, et à créer le parc de Zhangjiang. Grâce à ses efforts, Shanghai a dépassé l'objectif avec 18 lignes, jetant les bases de ce qui allait devenir le premier cluster national de semi-conducteurs. Parallèlement, malgré un diagnostic de cancer du poumon, Jiang, en tant que chef d'un groupe d'experts d'État, a plaidé avec persévérance pendant trois ans pour inclure les « gros porteurs civils » dans les grands projets scientifiques nationaux. Il a surmonté les débats sur le « fabriquer ou acheter » et a souligné l'importance stratégique et l'effet d'entraînement industriel du projet. Son travail a pavé la voie à la création de COMAC et au développement du C919. Tout au long de sa carrière, d'abord à Sanya puis à Yangpu, Jiang a été un visionnaire, souvent en avance sur son temps, ce qui lui a valu des incompréhensions. Nommé président de SMIC en 2009 en pleine crise, il a dirigé l'entreprise jusqu'à son décès en 2011, sans voir l'aboutissement complet de ses projets. Aujourd'hui, Shanghai est le leader chinois des semi-conducteurs et de l'aviation commerciale, réalisant en grande partie la vision de Jiang Shangzhou. Son héritage réside dans sa clairvoyance stratégique, son pragmatisme et son dévouement à l'essor industriel de la Chine, dont les bénéfices se sont étendus bien au-delà de sa vie.

marsbitIl y a 20 mins

Il fut l'artisan de deux grandes industries à Shanghai, mais s'en est allé discrètement avec des regrets

marsbitIl y a 20 mins

Comment AMD a recentré ses revenus sur le centre de données en 12 trimestres

Selon les résultats financiers du deuxième trimestre d'AMD, la trajectoire des revenus de l'entreprise s'est nettement déplacée vers le datacenter. Sur les 12 derniers trimestres, la part des revenus du datacenter est passée de 27,6 % à 58,2 % du chiffre d'affaires total, dépassant le seuil de 50 % au quatrième trimestre 2025. Ce trimestre, ce segment a généré 6,718 milliards de dollars, en hausse de 107 % en un an, et a contribué à environ 90 % de la croissance totale des revenus de l'entreprise. Parallèlement, le segment "gaming" a vu ses revenus baisser de 31 % sur un an pour atteindre 779 millions de dollars. Toutefois, cette contraction ne représente qu'une fraction modeste des gains du datacenter. Les données suggèrent une expansion significative du chiffre d'affaires global d'AMD, plutôt qu'un simple transfert de ressources internes d'un segment à l'autre. Le segment "gaming" inclut également les activités semi-customisées pour consoles, ce qui empêche de réduire son évolution à la seule demande de cartes graphiques grand public. En comparaison avec ses pairs, la croissance des revenus datacenter d'AMD est rapide, mais l'écart d'échelle reste important. Pour le dernier trimestre disponible, ses 6,718 milliards de dollars sont proches des 6,262 milliards du segment DCAI d'Intel, mais loin des quelque 75,2 milliards de dollars de Nvidia. Il est crucial de noter que les définitions des segments et les périodes fiscales diffèrent entre ces entreprises, ce qui limite les comparaisons directes. En résumé, le datacenter est devenu le principal moteur de croissance et la plus grande source de revenus d'AMD. Bien que le segment "gaming" ait reculé simultanément, les données financières publiques ne permettent pas de conclure à un simple réallocation de ressources internes.

marsbitIl y a 22 mins

Comment AMD a recentré ses revenus sur le centre de données en 12 trimestres

marsbitIl y a 22 mins

Infographie du portefeuille Cloudflare : Un nouveau joueur pour les paiements en stablecoin avec X402

Cloudflare a annoncé le lancement de Wallets, permettant aux utilisateurs de réserver un identifiant (handle). Cependant, la fonctionnalité complète de portefeuille avec recharge, paiements et portefeuilles virtuels pour agents n'est pas encore disponible ("Soon"). L'annonce distingue trois produits : Stripe Projects (parrainage de paiements par carte, en bêta), Monetization Gateway (pour les marchands, sur liste d'attente), et Wallets (pour les payeurs, en cours de développement). Le produit actuel ressemble plus à une page d'identité qu'à un réseau de paiement opérationnel. Les données du protocole de paiement x402 (75,41 millions de transactions, 24,24 millions de dollars sur 30 jours, moyenne de 0,32$ par transaction) montrent une activité de micropaiements, mais ne reflètent pas l'adoption spécifique de Cloudflare Wallet. L'exemple de paiement MCP de Cloudflare (0,01$ par appel) illustre le flux technique x402 : requête 402, signature de l'agent, règlement par un facilitateur. Actuellement, les clés privées restent gérées par les développeurs en environnement de test. La feuille de route de Wallet prévoit de séparer le portefeuille principal du compte des portefeuilles virtuels des agents, avec des règles de contrôle (plafonds, listes blanches). Des détails cruciaux comme les stablecoins supportés, les blockchains, les frais ou la conformité KYC ne sont pas encore publics.

marsbitIl y a 43 mins

Infographie du portefeuille Cloudflare : Un nouveau joueur pour les paiements en stablecoin avec X402

marsbitIl y a 43 mins

Trading

Spot
活动图片