¿La gente de los laboratorios de vanguardia ya casi no lee artículos?
Un investigador de OpenAI dispara contra las tres grandes conferencias con una frase: ¡Demasiada exageración y fraude!

Todo comenzó con un artículo de ICLR cuyos resultados eran tan buenos que resultaban incomprensibles; al investigarlo, los internautas descubrieron su "secreto".

¿Publicar en conferencias de élite ha "evolucionado" hasta este punto?

Primero, ver si el código es de código abierto; segundo, ver si el método experimental oculta algún "truco dudoso"; tercero, ver si los resultados obtenidos realmente respaldan la conclusión principal — después de estos interrogantes, ¿cuántos artículos de las conferencias de élite resistirían una inspección exhaustiva?
De hecho, alguien lo ha hecho.
De 105 artículos, solo 8 "aprueban"
En julio de este año, SAI, cofundado por Chenhao Tan, profesor asociado de Ciencias de la Computación y Ciencia de Datos en la Universidad de Chicago, publicó una revisión experimental a gran escala.
Su objetivo fueron los 168 artículos Orales de ICML 2026.
Este año, ICML recibió 23,918 envíos, de los cuales solo 168 obtuvieron el estatus de Oral, aproximadamente el 0.7%.
En otras palabras, SAI examinó la crema de la crema de entre más de veinte mil envíos.
Además de leer el método, el diseño experimental y los resultados del artículo como cualquier revisor tradicional, SAI Review también descarga el código, los modelos y los datos, configura el entorno, ejecuta los experimentos y finalmente compara los resultados con el artículo original punto por punto.
SAI revisó los 168 artículos Orales. Solo 104 tenían código de código abierto, y finalmente completó la replicación completa de 105 artículos.
Entre ellos, solo 34 replicaron más del 40% de las afirmaciones; solo 8 replicaron más del 80%.

Ya sea que cada artículo contenga al menos 1, 3 o 5 afirmaciones verificables, la mediana de la puntuación de replicación se mantuvo entre 28% y 30%, con una distribución general que apenas cambió.

Excluyendo los experimentos que no se ejecutaron, se detuvieron prematuramente o excedieron la capacidad del hardware, la mediana de la puntuación de replicación fue de solo 42% a 50%; cuando cada artículo contenía al menos 3 afirmaciones verificables, la mediana se mantuvo estable en 42%.
Encontraron los problemas más comunes en la replicación: código que no se ejecuta, archivos faltantes, documentación incompleta, dependencias dañadas o resultados del código que no coinciden con el artículo.
También hubo 4 artículos que dependían de modelos ya descontinuados. Investigadores posteriores, incluso dispuestos a gastar dinero y tiempo, nunca podrían obtener los mismos resultados.
SAI también citó dos ejemplos más concretos.
Un artículo presentó como principal ventaja "entrenar solo 0.77% de los parámetros del modelo base", pero el punto de control publicado en realidad entrenó 6.31% de los parámetros, aproximadamente 8 veces la cifra declarada.
Otro artículo mostraba una tabla de confiabilidad puntuada por un modelo juez, pero en el código abierto no se encontraba este modelo juez, ni había ningún script capaz de calcular los números en la tabla.
Artículos de baja calidad: alto beneficio, bajo riesgo
Los resultados de replicación de SAI pueden considerarse bastante malos.
Peor aún, los problemas encontrados aquí son solo aquellos que "pueden ser descubiertos bajo ciertas condiciones".
Aquellos artículos sin código directamente se vuelven "invulnerables".

E incluso si el código está completamente abierto, el tiempo, esfuerzo y dinero necesarios para verificar un artículo son enormes, y los resultados a menudo son decepcionantes, lo que puede resultar extremadamente frustrante.
Según las estimaciones de SAI basadas en los precios públicos bajo demanda de Google Cloud, el costo medio para ejecutar completamente un artículo Oral de ICML es de aproximadamente 8,900 dólares. Entre los 105 artículos, 17 superaron los 100,000 dólares, y el más caro se acercó a los 2.2 millones de dólares.
Cuanto más dependa un artículo de la computación a gran escala, más difícil será replicarlo de forma independiente.
Sin código, otros no pueden verificarlo; con código, es posible que nadie pueda pagar el costo.
Así, un artículo con problemas puede pasar sin problemas la revisión, obtener citas, ser incluido en el currículum y, a cambio, conseguir una admisión, un puesto académico o una oportunidad de trabajo en un gran laboratorio.
Si alguien descubre por casualidad que los resultados no coinciden, las conferencias rara vez reexaminan y el artículo no necesariamente se retira.
Esto es lo que se comenta: "Hacer investigación deficiente tiene beneficios, pero casi no tiene consecuencias".

No leen artículos, pero en la contratación sí los piden
En el campo de los grandes modelos, es cierto que muchos avances realmente importantes ya no aparecen en forma de artículos.
Como ingeniero de OpenAI, en la vanguardia de la industria, no es difícil entender esta sensación. Después de todo, tienen más potencia computacional, retroalimentación experimental más rápida y muchos resultados internos no públicos, lo que les da la base para "no leer artículos".
Pero expresarlo de esta manera es un poco controvertido.
Un comentario criticó a quienes están en las empresas tecnológicas por "subir al barco y luego quitar la escalera": reclutan investigadores de la academia, se basan en los logros acumulados públicamente por el mundo académico, acaparan talento y GPU a precios más altos, ellos mismos aceptan cada vez menos la revisión por pares, y luego se dan la vuelta y declaran que la investigación académica es "principalmente un fraude".

Un poco sarcástico, pero tiene sentido.
Estas personas de laboratorios de vanguardia pueden "no leer artículos", pero quienes quieren entrar aún tienen que publicar artículos primero.
Para estudiantes e investigadores jóvenes con poca experiencia industrial, los artículos en conferencias de élite siguen siendo la credencial más directa para demostrar sus capacidades de investigación.
Solicitar un doctorado, buscar un puesto académico o entrar en laboratorios de vanguardia como OpenAI depende de los artículos para obtener visibilidad.
Las personas de la industria, una vez dentro de los grandes laboratorios, menosprecian los artículos, pero siguen utilizando el número de artículos, el nivel de las conferencias y las citas para filtrar a quienes están fuera.
Así, el artículo se encuentra en una posición incómoda: su credibilidad en la difusión del conocimiento está cuestionada, pero su valor en la competencia por el talento no ha disminuido en absoluto.
Por lo tanto, "los grandes laboratorios ya no leen artículos" suena un poco arrogante. Porque quienes realmente tienen el privilegio de no leer artículos, a menudo han cruzado esa barrera gracias a ellos.
Por supuesto, no todos los estudiantes son villanos académicos que diseñan cuidadosamente fraudes.
Un investigador universitario bromeó diciendo que desearía que sus estudiantes ya tuvieran la capacidad de escribir un artículo exagerado o incluso fraudulento.

Mientras algunos "compiten por ser estafadores académicos", otros aún luchan con LaTeX.
Enlaces de referencia:
https://x.com/MathewShen42/status/2084465434506768867
https://x.com/kellerjordan0/status/2084721463089902074
https://sai.science/blog/how-much-science-is-verifiable
https://x.com/mengyer/status/2085134204786921886
Este artículo proviene de la cuenta pública de WeChat "Machine Heart" (ID: almosthuman2014), autor: Machine Heart





