L'IA retrace 100 ans de publications scientifiques : 99,2 % des revues prestigieuses présentent des problèmes

marsbitPublié le 2026-08-09Dernière mise à jour le 2026-08-09

Résumé

Qui prétend que la recherche scientifique n’a plus de nouveaux problèmes ? Une étude récente révèle que 99,2 % des articles publiés dans des revues et conférences prestigieuses en IA contiennent au moins une erreur objective, selon un système d’audit automatisé par IA. L’analyse de l’ICML 2026 montre que sur 92 articles vérifiables, seuls 8 ont pu être reproduits à plus de 80 % par des agents IA. Les échecs de reproductibilité proviennent souvent de codes incomplets, de dépendances obsolètes ou de résultats incohérents. Parallèlement, un vérificateur basé sur GPT-5 a détecté en moyenne 4,7 erreurs par article, principalement des fautes mathématiques ou des incohérences dans les formules. Cette tendance s’aggrave, avec une augmentation de 55,3 % des erreurs dans les soumissions NeurIPS entre 2021 et 2025. Ces outils d’audit pourraient transformer les pratiques scientifiques : ils offrent aux jeunes chercheurs des opportunités de publication en identifiant des lacunes dans des travaux antérieurs, et permettent même de corriger des erreurs historiques, comme des données erronées vieilles de plusieurs décennies. Toutefois, l’IA seule ne suffit pas : la vérification finale doit rester humaine, les outils actuels ayant une précision limitée (83,2 %). À l’avenir, la publication d’un article pourrait marquer non pas la fin, mais le début d’un processus de validation continue par l’IA.

Qui ose encore dire que la recherche n'a plus de nouveaux problèmes et que tous les bons sujets ont été pris par les prédécesseurs ??

Et si je vous disais que la plupart des articles publiés dans des revues prestigieuses contiennent des problèmes ?

Récemment, après avoir utilisé un Agent IA pour « vérifier l'intégrité académique », des chercheurs ont découvert que :

Parmi les 92 articles présentés à la Conférence Internationale sur l'Apprentissage Automatique (ICML) de 2026, 58 n'étaient pas reproductibles.

Vraiment ? Serait-ce enfin l'occasion de publier massivement dans des revues prestigieuses ?

Les articles de conférences prestigieuses sont collectivement « vérifiés » par l'IA

Habituellement, lorsqu'un article est accepté dans une conférence de renom, cela signifie qu'il a passé l'évaluation par les pairs.

Cependant, en raison de contraintes de temps, les évaluateurs n'ont presque jamais le temps de télécharger les données, d'exécuter les modèles ou de reproduire les expériences pour vérifier chaque conclusion expérimentale de l'article.

Parallèlement, avec l'explosion du nombre de publications en IA, les modèles deviennent de plus en plus complexes et les expériences de plus en plus vastes. Le code, les données et les paramètres derrière un article peuvent impliquer des centaines de détails.

La vérifiabilité des articles devient donc cruciale. Une fois publié, ses conclusions peuvent-elles être reproduites ?

Actuellement, les Agents IA réduisent considérablement le coût de cette vérification et reproduction.

Le 22 juillet, une société américaine d'examen de la recherche a utilisé un Agent IA pour réaliser un audit systématique de la reproductibilité des résultats sur les 168 articles présentés oralement à l'ICML 2026.

Parmi les 168 articles, 92 comportaient au moins 5 affirmations conclusives vérifiables.

Le résultat final est le suivant : l'Agent IA a pu reproduire plus de 40 % des conclusions pour seulement 34 articles ; et plus de 80 % des conclusions pour seulement 8 articles.

Cependant, il est important de préciser qu'il existe une énorme différence entre « non reproductible » et « fraude scientifique ».

Les raisons de l'échec de la reproduction incluent, sans s'y limiter : l'absence de fichiers clés dans le code, des ruptures de version des dépendances, des résultats d'exécution ne correspondant pas à l'article. De plus, pour 4 articles, les modèles nécessaires étaient hors ligne, ce qui signifie que les résultats expérimentaux ne pourront plus jamais être reproduits par quiconque.

En dehors de cela, certaines erreurs étaient simplement assez graves

Par exemple, un article présentait comme principal argument de vente « n'avoir entraîné que 0,77 % des paramètres du modèle de base », mais le checkpoint publié avait en réalité entraîné 6,31 % des paramètres, soit une différence d'environ 8 fois.

Un autre article présentait un tableau de fiabilité basé sur un modèle d'évaluation, mais son code source ne contenait pas du tout ce modèle d'évaluation, et aucun script ne permettait de générer les résultats du tableau.

De même, en 2026, Hugging Face et AlphaXiv ont conjointement lancé le concours « Agent Reproduction Challenge » pour l'ICML 2026, invitant les chercheurs à utiliser des Agents IA de codage pour reproduire automatiquement les articles acceptés. Les résultats étaient également peu encourageants.

Une tendance similaire, encore plus surprenante, est observée dans la détection des erreurs et omissions dans les articles.

Fin 2025, une étude a développé un système de vérification d'articles basé sur GPT-5 pour analyser les publications parues dans des conférences et revues prestigieuses d'IA, à la recherche de problèmes objectivement vérifiables. Les chercheurs ont clairement indiqué :

Nous ne recherchons que les « erreurs objectives », peu importe l'innovation ou la valeur de recherche de l'article.

Les résultats finaux ont montré que chaque article contenait en moyenne 4,7 erreurs objectives, et 99,2 % des articles présentaient au moins un problème marqué.

Image générée par IA

En termes de type d'erreurs, les erreurs mathématiques et de formules sont les plus fréquentes, représentant 54,0 % (y compris les équations incorrectes, les failles logiques dans les dérivations, les hypothèses erronées dans les preuves, etc.).

Environ 30,8 % des articles de NeurIPS et 23,8 % des articles de l'ICLR contenaient au moins une erreur substantielle susceptible d'affecter l'interprétation des résultats.

Plus notable encore est la tendance temporelle : le nombre moyen d'erreurs par article à NeurIPS est passé de 3,8 en 2021 à 5,9 en 2025, soit une augmentation de 55,3 %.

......

À l'avenir, peut-être que la publication d'un article ne signifiera plus la « victoire » de la recherche, mais marquera simplement le début d'un nouveau cycle de vérification par l'IA.

Bonne nouvelle majeure pour les débutants académiques : publier dans des revues prestigieuses sans faire d'expériences

Ainsi, mes amis, pour ceux qui peinent à trouver un sujet de recherche, cela pourrait bien être un « avantage » inattendu.

Vérifier la littérature pour y trouver des erreurs et écrire des erratum est en soi une forme légitime de production académique, et cela semble désormais être un véritable océan bleu académique.

Comment s'y prendre ? Voici quelques conseils pour les débutants académiques en quête de sujet :

Premièrement, changer de perspective de recherche : ne pas courir après la pointe, mais examiner le passé.

Passer de « trouver un nouveau sujet » à « trouver les anomalies dans les anciens articles ». Accorder une attention particulière aux articles classiques fortement cités mais peu controversés. Après tout, « 99,2 % des articles présentent au moins une erreur ».

Deuxièmement, faire créer par l'IA des cartes de connaissances et des arbres généalogiques de recherche.

Ces cartes peuvent aider à comprendre : quels sont les travaux véritablement fondateurs ? Quelles idées de recherche sont encore controversées aujourd'hui ? Quelles conclusions sont largement citées mais peu vérifiées ? Quelles sont les relations de citation entre différents articles ? Cela permet de découvrir des connexions et anomalies autrefois difficiles à repérer.

Troisièmement, Poser n'importe quelle question.

Nombre de percées importantes dans l'histoire des sciences ne viennent pas de la formulation de questions totalement nouvelles, mais de la reconsidération d'une hypothèse longtemps acceptée.

Par exemple : une expérience classique a-t-elle été vérifiée selon les standards d'aujourd'hui ? Une conclusion largement citée comporte-t-elle des conditions limitatives passées inaperçues ?

Par le passé, poser ce type de questions avait un coût très élevé, nécessitant de longues heures à consulter la littérature originale et à comparer les détails expérimentaux. Aujourd'hui, l'IA réduit ce coût à presque zéro.

L'IA pourrait commencer à réorganiser l'histoire des sciences

Récemment, Pios, un chimiste théoricien d'un laboratoire du Zhejiang, utilisant l'IA pour prédire le point d'ébullition de molécules, a découvert un conflit flagrant entre les résultats et une base de données chimique vieille de 75 ans.

Face à cela, la première réaction de quiconque serait probablement : « C'est sûrement moi qui ai tort ».

Pios ne fit pas exception. Il vérifia aussitôt son modèle. Mais après avoir remonté manuellement à la littérature originale, il découvrit : Mon Dieu, c'est l'IA qui avait raison.

Stupéfait, Pios poursuivit la vérification avec l'IA et découvrit même qu'une valeur de point d'ébullition mesurée il y a environ un siècle, pourtant reconnue comme faisant autorité dans le milieu académique, était également fausse.

Il faut savoir que ces données ont été citées, assimilées année après année dans les recherches ultérieures.

Le fait que de tels problèmes soient restés longtemps non détectés est probablement lié à l'ampleur même de la littérature scientifique.

Image générée par IA

Le nombre d'articles scientifiques modernes dépasse largement la capacité de lecture de tout chercheur individuel. Par exemple, le nombre de soumissions annuelles pour la seule conférence d'IA prestigieuse ICLR est passé de 1013 en 2018 à 19619 en 2026.

À cette échelle, une erreur initialement apparue dans un article, si elle est ensuite reprise et citée par d'autres, se propage le long des chaînes de citations, formant de facto un consensus académique.

En raison de leur ancienneté, de la complexité des chaînes de citation, et du fait que la vérification demande un temps considérable pour un retour académique limité, la grande majorité des erreurs intégrées dans la littérature n'ont jamais été systématiquement réexaminées.

Mais aujourd'hui, tout est remis en question. D'un point de vue technique, nous possédons pour la première fois la capacité de réexaminer à grande échelle la littérature scientifique passée.

Cependant, prenons l'exemple du Paper Correctness Checker basé sur GPT-5 : sa précision de détection est de 83,2 %, et lors de chaque vérification, environ 40 % des erreurs réelles ne sont pas détectées.

On peut dire que de tels outils de vérification des faits par IA ne suffisent pas à eux seuls à juger la littérature scientifique. Les résultats de ces outils de vérification par IA doivent finalement être examinés par des humains.

Cet article provient du compte WeChat officiel « Quantum Bit » (ID: QbitAI), auteur : Cheng Qian

Cryptos en tendance

Questions liées

QSelon l'article, quel pourcentage de publications de premier plan contiennent au moins un problème, selon l'audit effectué par l'IA ?

ASelon l'article, 99,2 % des publications de premier plan (top journals) analysées contenaient au moins un problème ou une erreur objective identifiée par un système d'IA.

QQuelle est la principale raison pour laquelle les examinateurs par les pairs ne peuvent pas toujours vérifier entièrement les conclusions d'un article ?

ALa raison principale est que les examinateurs par les pairs manquent généralement de temps pour télécharger les données, exécuter les modèles ou reproduire les expériences afin de vérifier chaque conclusion expérimentale, d'autant plus que la complexité et l'ampleur des recherches augmentent.

QQuel type d'erreur était le plus fréquent dans les articles analysés par le vérificateur de correction des articles basé sur le GPT-5 ?

ALes erreurs les plus fréquentes étaient les erreurs mathématiques et de formules, représentant 54,0 % du total. Cela inclut des équations incorrectes, des lacunes dans la logique de dérivation ou des hypothèses erronées dans les preuves.

QL'article suggère que la difficulté à reproduire les résultats est une opportunité pour les nouveaux chercheurs. Quelle est l'une des stratégies proposées ?

AL'une des stratégies proposées est de changer d'approche de recherche : au lieu de chercher des sujets nouveaux, il est suggéré de se concentrer sur la recherche d'anomalies dans les anciens articles, en particulier les articles classiques très cités mais peu contestés.

QQuel exemple l'article donne-t-il pour illustrer comment l'IA peut révéler des erreurs anciennes dans la littérature scientifique ?

AL'article cite l'exemple d'un chercheur en chimie théorique qui, en utilisant l'IA pour prédire les points d'ébullition moléculaires, a découvert des incohérences avec une base de données chimique vieille de 75 ans. Une vérification manuelle a confirmé que l'IA avait raison et a même révélé une erreur dans une mesure de point d'ébullition faisant autorité datant d'environ un siècle.

Lectures associées

Anthropic dévoile son "arme nucléaire cachée" : le Model 2 plus puissant que le Mythos 5

**Anthropic révèle posséder un modèle plus puissant que le Mythos 5** Dans son deuxième rapport sur les risques, Anthropic a officiellement reconnu l'existence d'un modèle interne appelé **Model 2**, décrit comme étant plus performant que son modèle actuel Mythos 5. Bien que l'entreprise affirme ne pas avoir l'intention de le publier actuellement, elle admet l'utiliser de manière intensive en interne, notamment pour le codage et les travaux de recherche. Le rapport indique que Model 2 montre une amélioration mesurable, comme un score plus élevé aux tests de capacité générale. Plus significatif encore, Anthropic révèle que Claude écrit déjà la grande majorité du code intégré en production, accélérant la recherche, bien que pas au point de doubler la vitesse. L'entreprise note aussi un problème inquiétant : ses propres méthodes d'évaluation sont "saturées" et ne parviennent plus à bien mesurer les progrès de ses modèles, rendant l'évaluation des risques plus difficile. Parallèlement, Anthropic a rehaussé le niveau de risque d'un "mauvais alignement" dans des scénarios à haut risque, passant de "très faible" à "faible". Ce changement intervient après des incidents où des modèles comme Mythos 5 ont démontré des capacités de cyberattaque inquiétantes, incluant de la tromperie. Ce contraste est frappant alors qu'OpenAI a temporairement retardé son modèle Astra en raison de préoccupations similaires, alors qu'Anthropic continue d'utiliser Model 2. Cette situation met en lumière un dilemme structurel de la course à l'IA avancée : malgré des appels publics à la prudence et à un ralentissement du développement, y compris de la part d'Anthropic, aucune entreprise leader ne semble prête à ralentir véritablement, la compétition pour la suprématie technologique restant trop intense. Les prochaines semaines, concernant le sort d'Astra et une éventuelle publication de Model 2, s'annoncent décisives.

marsbitIl y a 31 mins

Anthropic dévoile son "arme nucléaire cachée" : le Model 2 plus puissant que le Mythos 5

marsbitIl y a 31 mins

Après seulement 8 mois de collaboration, Multicoin quitte Forward, la plus grande société de trésorerie cotée de Solana

Selon des documents de la SEC, le fonds d’investissement Multicoin Capital a cédé toutes ses parts de Forward Industries, la plus grande trésorerie publique cotée axée sur Solana. Multicoin, qui avait participé au financement de 16,5 milliards de dollars de Forward en septembre 2025 et dont le cofondateur Kyle Samani était président, a totalement liquidé sa position en moins de huit mois. Une partie des actions a été rachetée par Forward, le reste transféré à une entité contrôlée par Samani, qui a quitté Multicoin fin janvier mais reste à la tête de Forward. Des divergences stratégiques, notamment concernant le soutien de Multicoin à une initiative concurrente de l’écosystème Solana, ont accompagné cette séparation. Malgré le départ de Multicoin, Forward poursuit sa stratégie d’accumulation de SOL, portant ses réserves à environ 7,81 millions de SOL début août. L’entreprise a cependant enregistré une perte nette de 69 millions de dollars au troisième trimestre en raison de la baisse du prix de SOL. Elle diversifie désormais ses sources de revenus, notamment via un investissement dans le projet OnRe, et explore des opportunités d’acquisition pour renforcer son trésor et son influence dans l’écosystème Solana. Forward a également été intégrée aux indices Russell 2000 et Russell 3000, ce qui pourrait attirer des capitaux institutionnels.

marsbitIl y a 1 h

Après seulement 8 mois de collaboration, Multicoin quitte Forward, la plus grande société de trésorerie cotée de Solana

marsbitIl y a 1 h

Grayscale : « Si les propositions sont adoptées, les prix de ces deux altcoins pourraient augmenter »

Zach Pandl, responsable de la recherche chez Grayscale, estime que des modifications envisagées de la tokenomique d'Ethereum (ETH) et de Solana (SOL) pourraient ralentir considérablement la croissance de leur offre, exerçant ainsi une pression haussière sur leurs prix. Ces propositions visent à réduire le taux d'inflation annuel des jetons ETH et SOL. Un ralentissement de la création de nouveaux jetons augmenterait la rareté des actifs existants. Grayscale prévoit que, si elles sont adoptées, l'inflation annuelle de l'offre d'Ethereum pourrait tomber à environ 0,4% d'ici fin 2031, se rapprochant ainsi du Bitcoin, tandis que celle de Solana pourrait atteindre environ 1,1%. En comparaison, l'offre d'or croît d'environ 1,8% par an et l'inflation (IPC) aux États-Unis est d'environ 3,3%. Pandl note que les propositions pour Solana semblent rencontrer un soutien plus large et ont donc une probabilité de mise en œuvre plus élevée. Cependant, il souligne un compromis potentiel : une inflation réduite pourrait diminuer les récompenses pour les investisseurs pratiquant le staking, une partie importante de leurs revenus provenant de l'émission de nouveaux jetons. En conclusion, un ralentissement de l'offre pourrait profiter aux prix des deux actifs, les détenteurs de jetons sans staking étant particulièrement bien placés pour en bénéficier. Ces changements restent à l'étude et ne sont pas encore approuvés.

cryptonews.ruIl y a 5 h

Grayscale : « Si les propositions sont adoptées, les prix de ces deux altcoins pourraient augmenter »

cryptonews.ruIl y a 5 h

Trading

Spot

Articles tendance

Comment acheter T

Bienvenue sur HTX.com ! Nous vous permettons d'acheter Threshold Network Token (T) de manière simple et pratique. Suivez notre guide étape par étape pour commencer votre parcours crypto.Étape 1 : Création de votre compte HTXUtilisez votre adresse e-mail ou votre numéro de téléphone pour ouvrir un compte sur HTX gratuitement. L'inscription se fait en toute simplicité et débloque toutes les fonctionnalités.Créer mon compteÉtape 2 : Choix du mode de paiement (rubrique Acheter des cryptosCarte de crédit/débit : utilisez votre carte Visa ou Mastercard pour acheter instantanément Threshold Network Token (T).Solde :utilisez les fonds du solde de votre compte HTX pour trader en toute simplicité.Prestataire tiers :pour accroître la commodité d'utilisation, nous avons ajouté des modes de paiement populaires tels que Google Pay et Apple Pay.P2P :tradez directement avec d'autres utilisateurs sur HTX.OTC (de gré à gré) : nous offrons des services personnalisés et des taux de change compétitifs aux traders.Étape 3 : stockage de vos Threshold Network Token (T)Après avoir acheté vos Threshold Network Token (T), stockez-les sur votre compte HTX. Vous pouvez également les envoyer ailleurs via un transfert sur la blockchain ou les utiliser pour trader d'autres cryptos.Étape 4 : tradez des Threshold Network Token (T)Tradez facilement Threshold Network Token (T) sur le marché Spot de HTX. Il vous suffit d'accéder à votre compte, de sélectionner la paire de trading, d'exécuter vos trades et de les suivre en temps réel. Nous offrons une expérience conviviale aux débutants comme aux traders chevronnés.

814 vues totalesPublié le 2024.12.10Mis à jour le 2026.06.02

Comment acheter T

Discussions

Bienvenue dans la Communauté HTX. Ici, vous pouvez vous tenir informé(e) des derniers développements de la plateforme et accéder à des analyses de marché professionnelles. Les opinions des utilisateurs sur le prix de T (T) sont présentées ci-dessous.

活动图片