L'IA retrace 100 ans de publications scientifiques : 99,2 % des revues prestigieuses présentent des problèmes

marsbitDipublikasikan tanggal 2026-08-09Terakhir diperbarui pada 2026-08-09

Abstrak

Qui prétend que la recherche scientifique n’a plus de nouveaux problèmes ? Une étude récente révèle que 99,2 % des articles publiés dans des revues et conférences prestigieuses en IA contiennent au moins une erreur objective, selon un système d’audit automatisé par IA. L’analyse de l’ICML 2026 montre que sur 92 articles vérifiables, seuls 8 ont pu être reproduits à plus de 80 % par des agents IA. Les échecs de reproductibilité proviennent souvent de codes incomplets, de dépendances obsolètes ou de résultats incohérents. Parallèlement, un vérificateur basé sur GPT-5 a détecté en moyenne 4,7 erreurs par article, principalement des fautes mathématiques ou des incohérences dans les formules. Cette tendance s’aggrave, avec une augmentation de 55,3 % des erreurs dans les soumissions NeurIPS entre 2021 et 2025. Ces outils d’audit pourraient transformer les pratiques scientifiques : ils offrent aux jeunes chercheurs des opportunités de publication en identifiant des lacunes dans des travaux antérieurs, et permettent même de corriger des erreurs historiques, comme des données erronées vieilles de plusieurs décennies. Toutefois, l’IA seule ne suffit pas : la vérification finale doit rester humaine, les outils actuels ayant une précision limitée (83,2 %). À l’avenir, la publication d’un article pourrait marquer non pas la fin, mais le début d’un processus de validation continue par l’IA.

Qui ose encore dire que la recherche n'a plus de nouveaux problèmes et que tous les bons sujets ont été pris par les prédécesseurs ??

Et si je vous disais que la plupart des articles publiés dans des revues prestigieuses contiennent des problèmes ?

Récemment, après avoir utilisé un Agent IA pour « vérifier l'intégrité académique », des chercheurs ont découvert que :

Parmi les 92 articles présentés à la Conférence Internationale sur l'Apprentissage Automatique (ICML) de 2026, 58 n'étaient pas reproductibles.

Vraiment ? Serait-ce enfin l'occasion de publier massivement dans des revues prestigieuses ?

Les articles de conférences prestigieuses sont collectivement « vérifiés » par l'IA

Habituellement, lorsqu'un article est accepté dans une conférence de renom, cela signifie qu'il a passé l'évaluation par les pairs.

Cependant, en raison de contraintes de temps, les évaluateurs n'ont presque jamais le temps de télécharger les données, d'exécuter les modèles ou de reproduire les expériences pour vérifier chaque conclusion expérimentale de l'article.

Parallèlement, avec l'explosion du nombre de publications en IA, les modèles deviennent de plus en plus complexes et les expériences de plus en plus vastes. Le code, les données et les paramètres derrière un article peuvent impliquer des centaines de détails.

La vérifiabilité des articles devient donc cruciale. Une fois publié, ses conclusions peuvent-elles être reproduites ?

Actuellement, les Agents IA réduisent considérablement le coût de cette vérification et reproduction.

Le 22 juillet, une société américaine d'examen de la recherche a utilisé un Agent IA pour réaliser un audit systématique de la reproductibilité des résultats sur les 168 articles présentés oralement à l'ICML 2026.

Parmi les 168 articles, 92 comportaient au moins 5 affirmations conclusives vérifiables.

Le résultat final est le suivant : l'Agent IA a pu reproduire plus de 40 % des conclusions pour seulement 34 articles ; et plus de 80 % des conclusions pour seulement 8 articles.

Cependant, il est important de préciser qu'il existe une énorme différence entre « non reproductible » et « fraude scientifique ».

Les raisons de l'échec de la reproduction incluent, sans s'y limiter : l'absence de fichiers clés dans le code, des ruptures de version des dépendances, des résultats d'exécution ne correspondant pas à l'article. De plus, pour 4 articles, les modèles nécessaires étaient hors ligne, ce qui signifie que les résultats expérimentaux ne pourront plus jamais être reproduits par quiconque.

En dehors de cela, certaines erreurs étaient simplement assez graves

Par exemple, un article présentait comme principal argument de vente « n'avoir entraîné que 0,77 % des paramètres du modèle de base », mais le checkpoint publié avait en réalité entraîné 6,31 % des paramètres, soit une différence d'environ 8 fois.

Un autre article présentait un tableau de fiabilité basé sur un modèle d'évaluation, mais son code source ne contenait pas du tout ce modèle d'évaluation, et aucun script ne permettait de générer les résultats du tableau.

De même, en 2026, Hugging Face et AlphaXiv ont conjointement lancé le concours « Agent Reproduction Challenge » pour l'ICML 2026, invitant les chercheurs à utiliser des Agents IA de codage pour reproduire automatiquement les articles acceptés. Les résultats étaient également peu encourageants.

Une tendance similaire, encore plus surprenante, est observée dans la détection des erreurs et omissions dans les articles.

Fin 2025, une étude a développé un système de vérification d'articles basé sur GPT-5 pour analyser les publications parues dans des conférences et revues prestigieuses d'IA, à la recherche de problèmes objectivement vérifiables. Les chercheurs ont clairement indiqué :

Nous ne recherchons que les « erreurs objectives », peu importe l'innovation ou la valeur de recherche de l'article.

Les résultats finaux ont montré que chaque article contenait en moyenne 4,7 erreurs objectives, et 99,2 % des articles présentaient au moins un problème marqué.

Image générée par IA

En termes de type d'erreurs, les erreurs mathématiques et de formules sont les plus fréquentes, représentant 54,0 % (y compris les équations incorrectes, les failles logiques dans les dérivations, les hypothèses erronées dans les preuves, etc.).

Environ 30,8 % des articles de NeurIPS et 23,8 % des articles de l'ICLR contenaient au moins une erreur substantielle susceptible d'affecter l'interprétation des résultats.

Plus notable encore est la tendance temporelle : le nombre moyen d'erreurs par article à NeurIPS est passé de 3,8 en 2021 à 5,9 en 2025, soit une augmentation de 55,3 %.

......

À l'avenir, peut-être que la publication d'un article ne signifiera plus la « victoire » de la recherche, mais marquera simplement le début d'un nouveau cycle de vérification par l'IA.

Bonne nouvelle majeure pour les débutants académiques : publier dans des revues prestigieuses sans faire d'expériences

Ainsi, mes amis, pour ceux qui peinent à trouver un sujet de recherche, cela pourrait bien être un « avantage » inattendu.

Vérifier la littérature pour y trouver des erreurs et écrire des erratum est en soi une forme légitime de production académique, et cela semble désormais être un véritable océan bleu académique.

Comment s'y prendre ? Voici quelques conseils pour les débutants académiques en quête de sujet :

Premièrement, changer de perspective de recherche : ne pas courir après la pointe, mais examiner le passé.

Passer de « trouver un nouveau sujet » à « trouver les anomalies dans les anciens articles ». Accorder une attention particulière aux articles classiques fortement cités mais peu controversés. Après tout, « 99,2 % des articles présentent au moins une erreur ».

Deuxièmement, faire créer par l'IA des cartes de connaissances et des arbres généalogiques de recherche.

Ces cartes peuvent aider à comprendre : quels sont les travaux véritablement fondateurs ? Quelles idées de recherche sont encore controversées aujourd'hui ? Quelles conclusions sont largement citées mais peu vérifiées ? Quelles sont les relations de citation entre différents articles ? Cela permet de découvrir des connexions et anomalies autrefois difficiles à repérer.

Troisièmement, Poser n'importe quelle question.

Nombre de percées importantes dans l'histoire des sciences ne viennent pas de la formulation de questions totalement nouvelles, mais de la reconsidération d'une hypothèse longtemps acceptée.

Par exemple : une expérience classique a-t-elle été vérifiée selon les standards d'aujourd'hui ? Une conclusion largement citée comporte-t-elle des conditions limitatives passées inaperçues ?

Par le passé, poser ce type de questions avait un coût très élevé, nécessitant de longues heures à consulter la littérature originale et à comparer les détails expérimentaux. Aujourd'hui, l'IA réduit ce coût à presque zéro.

L'IA pourrait commencer à réorganiser l'histoire des sciences

Récemment, Pios, un chimiste théoricien d'un laboratoire du Zhejiang, utilisant l'IA pour prédire le point d'ébullition de molécules, a découvert un conflit flagrant entre les résultats et une base de données chimique vieille de 75 ans.

Face à cela, la première réaction de quiconque serait probablement : « C'est sûrement moi qui ai tort ».

Pios ne fit pas exception. Il vérifia aussitôt son modèle. Mais après avoir remonté manuellement à la littérature originale, il découvrit : Mon Dieu, c'est l'IA qui avait raison.

Stupéfait, Pios poursuivit la vérification avec l'IA et découvrit même qu'une valeur de point d'ébullition mesurée il y a environ un siècle, pourtant reconnue comme faisant autorité dans le milieu académique, était également fausse.

Il faut savoir que ces données ont été citées, assimilées année après année dans les recherches ultérieures.

Le fait que de tels problèmes soient restés longtemps non détectés est probablement lié à l'ampleur même de la littérature scientifique.

Image générée par IA

Le nombre d'articles scientifiques modernes dépasse largement la capacité de lecture de tout chercheur individuel. Par exemple, le nombre de soumissions annuelles pour la seule conférence d'IA prestigieuse ICLR est passé de 1013 en 2018 à 19619 en 2026.

À cette échelle, une erreur initialement apparue dans un article, si elle est ensuite reprise et citée par d'autres, se propage le long des chaînes de citations, formant de facto un consensus académique.

En raison de leur ancienneté, de la complexité des chaînes de citation, et du fait que la vérification demande un temps considérable pour un retour académique limité, la grande majorité des erreurs intégrées dans la littérature n'ont jamais été systématiquement réexaminées.

Mais aujourd'hui, tout est remis en question. D'un point de vue technique, nous possédons pour la première fois la capacité de réexaminer à grande échelle la littérature scientifique passée.

Cependant, prenons l'exemple du Paper Correctness Checker basé sur GPT-5 : sa précision de détection est de 83,2 %, et lors de chaque vérification, environ 40 % des erreurs réelles ne sont pas détectées.

On peut dire que de tels outils de vérification des faits par IA ne suffisent pas à eux seuls à juger la littérature scientifique. Les résultats de ces outils de vérification par IA doivent finalement être examinés par des humains.

Cet article provient du compte WeChat officiel « Quantum Bit » (ID: QbitAI), auteur : Cheng Qian

Kripto yang Sedang Tren

Pertanyaan Terkait

QSelon l'article, quel pourcentage de publications de premier plan contiennent au moins un problème, selon l'audit effectué par l'IA ?

ASelon l'article, 99,2 % des publications de premier plan (top journals) analysées contenaient au moins un problème ou une erreur objective identifiée par un système d'IA.

QQuelle est la principale raison pour laquelle les examinateurs par les pairs ne peuvent pas toujours vérifier entièrement les conclusions d'un article ?

ALa raison principale est que les examinateurs par les pairs manquent généralement de temps pour télécharger les données, exécuter les modèles ou reproduire les expériences afin de vérifier chaque conclusion expérimentale, d'autant plus que la complexité et l'ampleur des recherches augmentent.

QQuel type d'erreur était le plus fréquent dans les articles analysés par le vérificateur de correction des articles basé sur le GPT-5 ?

ALes erreurs les plus fréquentes étaient les erreurs mathématiques et de formules, représentant 54,0 % du total. Cela inclut des équations incorrectes, des lacunes dans la logique de dérivation ou des hypothèses erronées dans les preuves.

QL'article suggère que la difficulté à reproduire les résultats est une opportunité pour les nouveaux chercheurs. Quelle est l'une des stratégies proposées ?

AL'une des stratégies proposées est de changer d'approche de recherche : au lieu de chercher des sujets nouveaux, il est suggéré de se concentrer sur la recherche d'anomalies dans les anciens articles, en particulier les articles classiques très cités mais peu contestés.

QQuel exemple l'article donne-t-il pour illustrer comment l'IA peut révéler des erreurs anciennes dans la littérature scientifique ?

AL'article cite l'exemple d'un chercheur en chimie théorique qui, en utilisant l'IA pour prédire les points d'ébullition moléculaires, a découvert des incohérences avec une base de données chimique vieille de 75 ans. Une vérification manuelle a confirmé que l'IA avait raison et a même révélé une erreur dans une mesure de point d'ébullition faisant autorité datant d'environ un siècle.

Bacaan Terkait

Pengamatan Pasar Metrics Ventures: Saat "Perlombaan Mata Uang Buruk" Menjadi Norma, Bagaimana Memilih Aset Perlindungan Nilai?

**Pengamatan Pasar Metrics Ventures: Memilih Aset Safe Haven di Era "Persaingan Mata Uang yang Buruk"** Laporan bulanan Metrics Ventures untuk Juli-Agustus menyoroti tren makro ekonomi global di tengah ketidakpastian kebijakan moneter AS. Analisis menyimpulkan bahwa era "persaingan mata uang yang buruk" di antara negara-negara Barat telah menjadi norma, di mana kepercayaan terhadap mata uang fiat terus terkikis. Pasar bereaksi secara terpecah: pasar saham AS tampak percaya diri, sementara pasar obligasi dan valuta asing menunjukkan sinyal ketidakpercayaan. Logam mulia seperti emas telah menemukan dasar harga, mencerminkan konsensus bank sentral tentang tren penurunan mata uang yang tak terhindarkan. Menatap ke depan untuk kuartal III-IV, laporan ini merekomendasikan fokus pada aset-aset berikut: 1. **Sumber daya strategis** seperti tembaga dan listrik, yang terkait dengan ketegangan rantai pasokan global. 2. **Emas**, sebagai penyimpan nilai yang terus menilai ulang hilangnya kredibilitas mata uang. 3. **Aset-aset China (RMB)**, khususnya di sektor teknologi (contoh: indeks STAR 50), yang tren bullish-nya dinilai tetap kuat. 4. **Saham sumber daya komoditas** dalam pasar China, yang dianggap memiliki valuasi menarik dengan opsi imbal hasil dari kenaikan harga logam. Sementara itu, pasar cryptocurrency diperkirakan sulit mencatatkan kinerja unggul besar sebelum adanya pelonggaran likuiditas berlebih atau sebelum pertumbuhan AI sepenuhnya terharga di pasar. Inti laporan menekankan bahwa intervensi kebijakan (seperti intervensi nilai tukar AS-Jepang dan penggunaan fasilitas FIMA) menandakan pergeseran dalam pengelolaan moneter global. Dalam iklim ini, logam dan sumber daya nyata dipandang sebagai strategi berisiko rendah dengan nilai ekspektasi (EV) positif dalam jangka menengah.

marsbit37m yang lalu

Pengamatan Pasar Metrics Ventures: Saat "Perlombaan Mata Uang Buruk" Menjadi Norma, Bagaimana Memilih Aset Perlindungan Nilai?

marsbit37m yang lalu

Agustus, 'Bull Market' Wall Street Kembali, 'Sifat Judi' Juga Kembali

August menyaksikan kembalinya "bull market" di Wall Street, dengan S&P 500 mencapai rekor tertinggi baru. Sentimen investor berbalik positif dengan cepat setelah penjualan Juli, didorong oleh musim laba korporat yang luar biasa kuat (laba Q2 naik >50%) dan data inflasi AS yang lebih lembut, yang mengurangi tekanan kenaikan suku bunga Fed. Uang mengalir deras kembali ke saham teknologi dan produk leverage seperti ETF leverage dan opsi call, menandakan kembalinya "semangat berjudi". Saham chip seperti Super Micro Computer melonjak ~38% pada Agustus. Strategi leverage pada indeks luas berkinerja baik, berbeda dengan leverage pada saham tunggal. Namun, kenaikan cepat ini juga menimbulkan kewaspadaan. Pasar saat ini mematok skenario "masa keemasan" yang hampir sempurna: pertumbuhan kuat, suku bunga terbatas, dan guncangan sementara. Sinyal yang saling bertentangan muncul: harga minyak melonjak, imbal hasil obligasi pemerintah jangka panjang tetap tinggi (menandakan kekhawatiran inflasi jangka panjang), sementara indeks ketakutan VIX turun. Para analis memperingatkan bahwa kondisi ini sangat rapuh dan tidak memberikan ruang untuk kesalahan. Intinya: Pasar saham merayakan prospek soft landing dan siklus laba AI, tetapi pasar obligasi mengisyaratkan risiko yang belum terselesaikan. Pertarungan antara narasi optimis "Goldilocks" dan kekhawatiran inflasi jangka panjang akan menjadi tema utama di paruh kedua 2026.

marsbit1j yang lalu

Agustus, 'Bull Market' Wall Street Kembali, 'Sifat Judi' Juga Kembali

marsbit1j yang lalu

Trading

Spot

Artikel Populer

Cara Membeli T

Selamat datang di HTX.com! Kami telah membuat pembelian Threshold Network Token (T) menjadi mudah dan nyaman. Ikuti panduan langkah demi langkah kami untuk memulai perjalanan kripto Anda.Langkah 1: Buat Akun HTX AndaGunakan alamat email atau nomor ponsel Anda untuk mendaftar akun gratis di HTX. Rasakan perjalanan pendaftaran yang mudah dan buka semua fitur.Dapatkan Akun SayaLangkah 2: Buka Beli Kripto, lalu Pilih Metode Pembayaran AndaKartu Kredit/Debit: Gunakan Visa atau Mastercard Anda untuk membeli Threshold Network Token (T) secara instan.Saldo: Gunakan dana dari saldo akun HTX Anda untuk melakukan trading dengan lancar.Pihak Ketiga: Kami telah menambahkan metode pembayaran populer seperti Google Pay dan Apple Pay untuk meningkatkan kenyamanan.P2P: Lakukan trading langsung dengan pengguna lain di HTX.Over-the-Counter (OTC): Kami menawarkan layanan yang dibuat khusus dan kurs yang kompetitif bagi para trader.Langkah 3: Simpan Threshold Network Token (T) AndaSetelah melakukan pembelian, simpan Threshold Network Token (T) di akun HTX Anda. Selain itu, Anda dapat mengirimkannya ke tempat lain melalui transfer blockchain atau menggunakannya untuk memperdagangkan mata uang kripto lainnya.Langkah 4: Lakukan trading Threshold Network Token (T)Lakukan trading Threshold Network Token (T) dengan mudah di pasar spot HTX. Cukup akses akun Anda, pilih pasangan perdagangan, jalankan trading, lalu pantau secara real-time. Kami menawarkan pengalaman yang ramah pengguna baik untuk pemula maupun trader berpengalaman.

1.2k Total TayanganDipublikasikan pada 2024.12.10Diperbarui pada 2026.06.02

Cara Membeli T

Diskusi

Selamat datang di Komunitas HTX. Di sini, Anda bisa terus mendapatkan informasi terbaru tentang perkembangan platform terkini dan mendapatkan akses ke wawasan pasar profesional. Pendapat pengguna mengenai harga T (T) disajikan di bawah ini.

活动图片