Investigadores están utilizando agentes de IA para auditar y reproducir resultados de artículos científicos de conferencias de élite. Un estudio sobre los 168 artículos presentados oralmente en ICML 2026 reveló que de 92 trabajos con afirmaciones verificables, solo 34 pudieron ser replicados en más del 40% de sus conclusiones, y apenas 8 superaron el 80% de reproducibilidad. Las fallas se atribuyen a código incompleto, dependencias obsoletas, discrepancias en los resultados o modelos base no disponibles. Paralelamente, un sistema de verificación basado en GPT-5 que analizó artículos publicados en conferencias top de IA encontró que el 99.2% contenía al menos un error objetivo, con un promedio de 4.7 por artículo. Los errores matemáticos o de fórmulas fueron los más comunes (54%). La tendencia es creciente: en NeurIPS, los errores por artículo pasaron de 3.8 en 2021 a 5.9 en 2025. Este fenómeno sugiere una oportunidad para reorientar la investigación: en lugar de buscar únicamente novedad, se puede examinar críticamente la literatura existente para identificar inconsistencias o validar hallazgos clásicos, una tarea ahora más viable con asistencia de IA. Un ejemplo destacado es el descubrimiento de errores en datos de puntos de ebullición publicados hace décadas y ampliamente citados, los cuales fueron identificados por un modelo de IA y luego confirmados manualmente. Si bien las herramientas de IA aceleran la detección de posibles problemas, su precisión actual (por ejemplo, 83.2% en un verificador) aún requiere supervisión humana final. La publicación de un artículo podría dejar de ser un punto final para convertirse en el inicio de un nuevo ciclo de verificación automatizada.
marsbit5天前




