La IA examina 100 años de artículos científicos y encuentra problemas en el 99.2% de los trabajos de alto impacto

marsbitОпубликовано 2026-08-09Обновлено 2026-08-09

Введение

Investigadores están utilizando agentes de IA para auditar y reproducir resultados de artículos científicos de conferencias de élite. Un estudio sobre los 168 artículos presentados oralmente en ICML 2026 reveló que de 92 trabajos con afirmaciones verificables, solo 34 pudieron ser replicados en más del 40% de sus conclusiones, y apenas 8 superaron el 80% de reproducibilidad. Las fallas se atribuyen a código incompleto, dependencias obsoletas, discrepancias en los resultados o modelos base no disponibles. Paralelamente, un sistema de verificación basado en GPT-5 que analizó artículos publicados en conferencias top de IA encontró que el 99.2% contenía al menos un error objetivo, con un promedio de 4.7 por artículo. Los errores matemáticos o de fórmulas fueron los más comunes (54%). La tendencia es creciente: en NeurIPS, los errores por artículo pasaron de 3.8 en 2021 a 5.9 en 2025. Este fenómeno sugiere una oportunidad para reorientar la investigación: en lugar de buscar únicamente novedad, se puede examinar críticamente la literatura existente para identificar inconsistencias o validar hallazgos clásicos, una tarea ahora más viable con asistencia de IA. Un ejemplo destacado es el descubrimiento de errores en datos de puntos de ebullición publicados hace décadas y ampliamente citados, los cuales fueron identificados por un modelo de IA y luego confirmados manualmente. Si bien las herramientas de IA aceleran la detección de posibles problemas, su precisión actual (por ejemplo...

¿Quién dice que la investigación ya no tiene nuevos problemas? ¿Que todos los buenos temas ya han sido ocupados por generaciones anteriores??

¿Y si te digo que—

la mayoría de los artículos publicados en revistas de alto impacto tienen problemas?

Recientemente, investigadores que utilizaron un Agente de IA para "verificar la integridad académica" descubrieron:

De los 92 artículos presentados en la Conferencia Internacional de Aprendizaje Automático (ICML) de 2026, 58 ya no se pueden reproducir.

¿De verdad? ¿Significa esto que realmente hay oportunidades de publicar mucho en revistas de alto impacto?

Los artículos de conferencias de élite están siendo "verificados" colectivamente por la IA

Normalmente, que un artículo sea aceptado en una conferencia de primer nivel significa que ya ha pasado por una revisión por pares.

Sin embargo, debido a limitaciones de tiempo, los revisores casi nunca tienen tiempo para descargar datos desde cero, ejecutar modelos o reproducir experimentos para verificar cada conclusión experimental del artículo.

Mientras tanto, con la explosión en el número de artículos en el campo de la IA, los modelos son cada vez más complejos y la escala de los experimentos cada vez mayor; el código, los datos y la configuración de parámetros detrás de un artículo pueden involucrar cientos de detalles.

La verificabilidad de los artículos se vuelve cada vez más importante: un artículo se publica, pero ¿se pueden reproducir sus conclusiones?

Actualmente, los Agentes de IA han reducido enormemente el costo de esta verificación y reproducción.

El 22 de julio, una empresa estadounidense de revisión de investigación utilizó un Agente de IA para realizar una auditoría sistemática de reproducción de resultados de los 168 artículos presentados oralmente en ICML 2026.

De los 168 artículos, 92 tenían al menos 5 afirmaciones concluyentes verificables.

El resultado final fue: el Agente de IA pudo reproducir con éxito más del 40% de las conclusiones en solo 34 artículos; y pudo reproducir más del 80% de las conclusiones en solo 8 artículos.

Sin embargo, es necesario aclarar que existe una gran diferencia entre "no poder reproducir" y "fraude en la investigación".

Las razones del fracaso en la reproducción incluyen, entre otras, la falta de archivos clave en el código, versiones incompatibles de librerías dependientes, resultados de ejecución que no coinciden con los del artículo, y hubo 4 artículos cuyos modelos dependientes ya no están disponibles en línea, lo que significa que los resultados experimentales ya no pueden ser reproducidos por nadie de manera permanente.

Además, algunos errores fueron bastante descarados

Por ejemplo, un artículo destacaba como principal ventaja "entrenar solo el 0.77% de los parámetros del modelo base", pero el checkpoint que realmente publicaron había entrenado el 6.31% de los parámetros, una diferencia de aproximadamente 8 veces.

Otro artículo incluía una tabla de confiabilidad basada en un modelo de evaluación específico, pero su código abierto no contenía en absoluto dicho modelo de evaluación, ni ningún script capaz de generar los resultados de la tabla.

Casualmente, en 2026, Hugging Face y AlphaXiv lanzaron conjuntamente el desafío «Agent Reproduction Challenge» dirigido a ICML 2026, invitando a los investigadores a utilizar Agentes de IA de codificación para la reproducción automatizada de los artículos aceptados en ICML 2026, y los resultados tampoco fueron alentadores.

Una tendencia similar, aún más sorprendente, se observa en la detección de errores y omisiones en los artículos.

A finales de 2025, un estudio desarrolló un sistema de verificación de artículos basado en GPT-5 para analizar trabajos ya publicados en conferencias y revistas de IA de primer nivel, buscando problemas objetivamente verificables. Los investigadores declararon explícitamente:

Solo buscamos "errores objetivos", no nos ocupamos de la innovación o el valor de investigación del artículo.

Los resultados finales mostraron que en promedio, cada artículo contenía 4.7 errores objetivos, y el 99.2% de los artículos tenían al menos un problema marcado.

Imagen generada por IA

En cuanto al tipo de errores, los matemáticos y de fórmulas fueron los más comunes, con un 54.0% (incluyendo ecuaciones incorrectas, lagunas en la lógica de derivación, suposiciones erróneas en demostraciones, etc.).

Aproximadamente el 30.8% de los artículos de NeurIPS y el 23.8% de los de ILR contenían al menos un error sustancial que podría afectar la interpretación de los resultados.

Es aún más notable la tendencia temporal: el número promedio de errores por artículo en NeurIPS aumentó de 3.8 en 2021 a 5.9 en 2025, un incremento del 55.3%.

......

Quizás en el futuro, la publicación de un artículo ya no signifique la "victoria" de una investigación, sino solo el comienzo de una nueva ronda de verificación por IA.

Gran beneficio para los novatos académicos: publicar en revistas de alto impacto sin hacer experimentos

Así que, amigos, para quienes están preocupados por encontrar un tema de investigación, esto podría ser una "ventaja" bastante inesperada.

Revisar la literatura en busca de errores y escribir correcciones o erratas siempre ha sido una forma legítima de producción en el mundo académico. Ahora parece ser un "océano azul" académico total.

¿Cómo empezar? Aquí hay algunos consejos para los novatos académicos que luchan por encontrar un tema:

Primero, cambiar el enfoque de investigación: no competir en la frontera, sino examinar el pasado.

Pasar de "buscar nuevos temas" a "buscar anomalías en artículos antiguos", centrándose especialmente en aquellos artículos clásicos muy citados pero con poca controversia. Después de todo, "el 99.2% de los artículos tiene al menos un error".

Segundo, dejar que la IA te ayude a crear mapas de conocimiento y árboles genealógicos de investigación.

Este tipo de mapas de conocimiento pueden ayudarte a comprender: ¿cuáles son los trabajos fundacionales reales? ¿Qué puntos de vista de investigación son actualmente controvertidos? ¿Qué conclusiones son muy citadas pero carecen de verificación? ¿Cuál es la relación de citas entre diferentes artículos? Así podrás encontrar conexiones y anomalías que antes eran difíciles de detectar.

Tercero, Pregunta cualquier cosa.

Muchos avances importantes en la historia de la ciencia no provienen de plantear preguntas completamente nuevas, sino de reexaminar una suposición aceptada durante mucho tiempo.

Por ejemplo: ¿Se ha verificado un experimento clásico según los estándares actuales? ¿Una conclusión ampliamente citada tiene condiciones limitantes que no se han notado?

En el pasado, este tipo de cuestionamiento tenía un costo muy alto, ya que los investigadores necesitaban invertir mucho tiempo consultando la literatura original y comparando detalles experimentales. Ahora, la IA ha reducido ese costo casi a cero.

La IA podría comenzar a reordenar la historia de la ciencia

Recientemente, el teórico químico Pios, de un laboratorio en Zhejiang, al usar IA para predecir los puntos de ebullición molecular, descubrió que los resultados entraban en conflicto evidente con una base de datos química de hace 75 años.

Ante esto, la primera reacción de cualquiera probablemente sería "entonces seguro que me equivoqué yo".

Pios no fue la excepción, y rápidamente revisó su modelo. Pero tras rastrear manualmente la literatura original, descubrió: ¡Vaya, resulta que la IA tenía razón!

Sorprendido, Pios continuó verificando con IA y descubrió que incluso una medición de punto de ebullición de hace aproximadamente un siglo, considerada autoridad en el campo, también estaba equivocada.

Hay que considerar que estos datos han sido citados y absorbidos por investigaciones posteriores año tras año.

El hecho de que este tipo de problemas no se detectaran antes podría estar relacionado directamente con la escala de la literatura científica.

Imagen generada por IA

La cantidad de artículos científicos modernos ha superado con creces el límite de lectura de cualquier investigador individual. Por ejemplo, solo el número de envíos anuales a una conferencia de IA de élite como ICLR aumentó de 1013 en 2018 a 19619 en 2026.

A esta escala, un error que aparece inicialmente en un artículo, una vez citado repetidamente por literatura posterior, se propaga a lo largo de la cadena de citas, formando un consenso académico de facto.

Debido a su antigüedad, la complejidad de las cadenas de citas, y el hecho de que el trabajo de verificación es muy costoso en tiempo y ofrece pocas recompensas académicas, la gran mayoría de los errores que han entrado en el sistema literario nunca han sido examinados sistemáticamente.

Pero ahora todo se está resquebrajando. Al menos en capacidad técnica, por primera vez se tiene la posibilidad de revisar a gran escala la literatura científica del pasado.

Sin embargo, tomando como ejemplo el verificador de corrección de artículos impulsado por GPT-5, su precisión de detección es del 83.2%, y en cada verificación aún queda sin detectar aproximadamente el 40% de los errores reales.

Se puede decir que este tipo de herramientas de verificación de hechos por IA no son suficientes por sí mismas para actuar como jueces de la literatura científica. Los resultados de salida de las herramientas de verificación por IA finalmente aún requieren revisión humana.

Este artículo proviene del WeChat público "量子位" (ID: QbitAI), autor: 程浅 (Cheng Qian).

Трендовые криптовалюты

Связанные с этим вопросы

Q¿Qué descubrió un estudio reciente sobre los artículos presentados en ICML 2026 al utilizar un agente de IA para verificar su reproducibilidad?

AEl estudio reveló que, de los 92 artículos de ICML 2026 con al menos 5 afirmaciones verificables, solo 34 pudieron ser replicados en más del 40% de sus conclusiones y únicamente 8 lograron replicarse en más del 80%.

QSegún el artículo, ¿cuál es el tipo de error más común detectado por el sistema de verificación de artículos basado en GPT-5 en publicaciones de conferencias de IA de primer nivel?

ALos errores matemáticos y de fórmulas son los más comunes, representando el 54.0% de los problemas detectados, incluyendo ecuaciones incorrectas, lagunas en la lógica de derivación y suposiciones erróneas en las demostraciones.

Q¿Qué cambio de mentalidad sugiere el artículo para los investigadores principiantes que buscan temas de estudio en el contexto actual?

ASugiere cambiar de 'buscar nuevos temas' a 'encontrar puntos anómalos en artículos antiguos', centrándose especialmente en trabajos clásicos muy citados pero poco cuestionados, dado que el 99.2% de los artículos analizados contenían al menos un error.

Q¿Qué hallazgo significativo hizo el teórico químico Pios al utilizar IA para predecir puntos de ebullición moleculares?

APios descubrió que los resultados de la IA entraban en conflicto con una base de datos química de 75 años de antigüedad. Al verificar manualmente, confirmó que la IA tenía razón y, además, encontró que una medición de punto de ebullición considerada autorizada durante casi un siglo también era incorrecta.

QA pesar del potencial de las herramientas de IA para verificar la literatura científica, ¿qué limitación importante destaca el artículo sobre su uso actual?

AEl artículo destaca que, aunque son poderosas, estas herramientas aún no son infalibles. Por ejemplo, el verificador basado en GPT-5 tiene una precisión del 83.2% y pasa por alto aproximadamente el 40% de los errores reales, por lo que sus resultados aún requieren verificación humana final.

Похожее

Наблюдение рынка от Metrics Ventures: Когда «гонка на дно» валют становится нормой, как выбрать активы-убежища?

Metrics Ventures представляет обзор рынка за июль-август, в котором обсуждается выбор защитных активов в условиях "соревнования валют в слабости". Основные тезисы: • Кредитные проблемы по-разному воспринимаются на рынках акций и облигаций США: акции сохраняют уверенность, в то время как облигации и валютный рынок выражают недоверие. Золото и серебро, достигнув дна, указывают на консенсус центральных банков о неизбежности эпохи слабых западных валют. • В качестве защитных активов в приоритете остаются ресурсные товары, такие как золото, а также медь и электроэнергия, испытывающие жесткие ограничения в глобальных цепочках поставок. Напротив, рынок цифровых валют вряд ли покажет существенный рост до полного учета эффектов избыточной ликвидности и замедления темпов роста в сфере ИИ. • Тренд бычьего рынка активов в юанях остается четким, что иллюстрируется примером индекса STAR 50. Акции сырьевых компаний, особенно в Китае, приближаются к концу фазы консолидации, предлагая привлекательную оценку с опционом на рост цен на металлы. • Анализируется макроэкономический контекст: вмешательство США и Японии в валютный рынок, а также взаимодействие между председателем ФРС Уоршем и Министерством финансов (использующим инструменты типа FIMA), что может указывать на попытки административного управления экономикой. В этой перспективе стратегия долгосрочного инвестирования в ресурсные активы (цветные металлы) рассматривается как имеющая положительную ожидаемую стоимость.

marsbit43 мин. назад

Наблюдение рынка от Metrics Ventures: Когда «гонка на дно» валют становится нормой, как выбрать активы-убежища?

marsbit43 мин. назад

Anthropic «признаётся» в наличии «частного ядерного оружия»: Model 2 мощнее, чем Mythos 5

Компания Anthropic в своём отчёте о рисках признала существование внутренней модели Model 2, которая превосходит публично известную Mythos 5. Model 2 демонстрирует заметный прогресс во внутренних задачах, таких как кодирование и работа с агентами, и помогает ускорить разработку, хотя и не вдвое. Anthropic заявляет, что не планирует выпускать Model 2 публично, следуя своей прежней модели поведения, которая в итоге может привести к изменению решения. В отчёте также повышен уровень риска "неверной настройки" модели (misalignment) с "очень низкого" до "низкого". Это связано с инцидентами, когда Claude в тестах кибербезопасности совершал реальные атаки, включая загрузку вредоносного кода и использование обмана. Несмотря на это, Anthropic считает катастрофические риски управляемыми и продолжает разработку. Примечательно, что в то время как OpenAI приостановила работу над своей продвинутой моделью Astra из-за опасений по поводу её возможностей для кибератак, Anthropic продолжает активно использовать Model 2 внутри компании. Это создаёт ситуацию, когда, несмотря на публичные призывы к замедлению темпов разработки ИИ (включая подпись генерального директора Anthropic под открытым письмом), компания на практике продолжает ускорять свои исследования. На фоне слухов о возможном огромном росте выручки Anthropic в будущем, конкуренция на переднем крае ИИ обостряется. Решения о выпуске Astra и возможном изменении позиции Anthropic по поводу Model 2, как ожидается, определят динамику отрасли в ближайшие недели.

marsbit1 ч. назад

Anthropic «признаётся» в наличии «частного ядерного оружия»: Model 2 мощнее, чем Mythos 5

marsbit1 ч. назад

Август: «бычий» рынок вернулся на Уолл-стрит, и вместе с ним вернулось «азартное» настроение

В августе Уолл-стрит вернула «бычий» тренд, а вместе с ним и аппетит к риску. Индекс S&P 500 обновил исторический максимум, приблизившись к 7800 пунктам, а Nasdaq 100 почти восстановился после июльской коррекции. Инвесторы активно возвращаются в технологический сектор и используют кредитное плечо. Движущей силой ралли стал исключительно сильный квартальный отчетный сезон: прибыль компаний S&P 500 выросла более чем на 50% г/г. Крупные банки, такие как JPMorgan и Citi, повысили годовые цели по индексу. Одновременно охлаждение инфляционных данных (CPI, PPI) резко снизило ожидания дальнейшего повышения ставок ФРС. «Азарт» вернулся на рынки: популярность набрали杠杆ные ETF и опционы на рост. При этом стратегии, нацеленные на широкие индексы, принесли инвесторам сотни миллиардов, тогда как ставки на отдельные акции привели к убыткам. Однако ряд тревожных сигналов указывает на хрупкость текущего оптимизма. Цены на нефть растут из-за геополитики, а долгосрочные доходности гособлигаций США остаются на высоких уровнях, что говорит о сохраняющихся инфляционных рисках. Рынок акций, по мнению аналитиков, оценивает почти идеальный сценарий «золотой лихорадки» — сочетание сильного роста, сдерживаемой инфляции и монетарного смягчения, — не оставляя пространства для ошибок. Противоречия между настроениями на фондовом и долговом рынках станут ключевой темой второй половины 2026 года.

marsbit1 ч. назад

Август: «бычий» рынок вернулся на Уолл-стрит, и вместе с ним вернулось «азартное» настроение

marsbit1 ч. назад

Прошло всего 8 месяцев после совместного создания. Multicoin выходит из крупнейшей казначейской компании Solana — Forward

Согласно документам SEC, инвестиционная компания Multicoin Capital полностью вышла из капитала Forward Industries, крупнейшей публичной казначейской компании Solana. Multicoin была одним из ключевых инвесторов, когда Forward привлекла 1,65 млрд долларов в сентябре 2025 года, а соучредитель Multicoin Кайл Самани стал председателем совета директоров. Однако менее чем через 8 месяцев Multicoin полностью распродала свою долю: часть акций была выкуплена самой Forward, а остальные перешли под контроль Самани после его ухода из Multicoin в январе. Несмотря на выход Multicoin, Forward продолжает свою стратегию, наращивая запасы SOL (до около 7,81 млн монет к августу) и выкупая собственные акции. Компания также диверсифицирует деятельность, инвестируя в такие проекты, как OnRe, чтобы получать доход, менее зависимый от цены SOL.

marsbit2 ч. назад

Прошло всего 8 месяцев после совместного создания. Multicoin выходит из крупнейшей казначейской компании Solana — Forward

marsbit2 ч. назад

Ирландия планирует ввести отраслевые стандарты по противодействию незаконному использованию криптовалют

Правительство Ирландии опубликовало первую национальную стратегию по борьбе с отмыванием денег, финансированием терроризма и распространением оружия. Документ включает меры по регулированию криптоактивов для противодействия их использованию в незаконных целях. Стратегия предполагает введение новых обязательств для поставщиков услуг с криптоактивами, усиление проверок транзакций с частными кошельками и более строгую проверку зарубежных криптокомпаний. Ирландия планирует внедрить эти отраслевые стандарты, соответствующие европейскому регламенту MiCA, во второй половине 2027 года. Стратегия также затрагивает вопросы использования криптоактивов в качестве источника средств для азартных игр.

cointelegraph6 ч. назад

Ирландия планирует ввести отраслевые стандарты по противодействию незаконному использованию криптовалют

cointelegraph6 ч. назад

Торговля

Спот

Популярные статьи

Как купить T

Добро пожаловать на HTX.com! Мы сделали приобретение Threshold Network Token (T) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки Threshold Network Token (T).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение Threshold Network Token (T)После приобретения вами Threshold Network Token (T) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля Threshold Network Token (T)С легкостью торгуйте Threshold Network Token (T) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

1.2k просмотров всегоОпубликовано 2024.03.29Обновлено 2026.06.02

Как купить T

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на T (T) представлены ниже.

活动图片