Люди из передовых лабораторий почти не читают статьи?
Один исследователь из OpenAI одной фразой раскритиковал три крупнейшие конференции: Слишком много преувеличений и фальсификаций!

Поводом послужила статья для ICLR с результатами настолько хорошими, что это вызывало недоумение. Пользователи сети изучили её и обнаружили «секрет».

Неужели публикация статей на топовых конференциях «эволюционировала» до такого?

Сначала смотрят, открыт ли код, затем — не скрывает ли методология экспериментов каких-либо «недобросовестных приёмов», и только потом — достаточно ли полученных результатов для подтверждения основного вывода — после такого многоуровневого «допроса» сколько же статей на топовых конференциях действительно выдерживают проверку?
Оказалось, что кто-то действительно так и поступил.
Из 105 статей только 8 «соответствуют требованиям»
В июле этого года SAI, соучредителем которой является доцент кафедры компьютерных наук и науки о данных Чикагского университета Тань Чэньхао, опубликовал масштабный «экспериментальный обзор».
Объектом их исследования стали все 168 устных статей (Oral) ICML 2026.
В этом году ICML получила 23918 заявок, из которых только 168 получили статус Oral, что составляет около 0,7%.
Другими словами, SAI проверили уже самую верхушку, отобранную из более чем двадцати тысяч заявок.
Помимо чтения методов, дизайна экспериментов и результатов, как это делают традиционные рецензенты, SAI Review также загружает код, модели и данные, настраивает окружение и запускает эксперименты, после чего сравнивает полученные результаты с исходными данными в статье.
SAI проверили все 168 статей Oral, из которых только у 104 был открыт код, и в итоге полностью воспроизвели 105 статей.
Из них только 34 статьи удалось воспроизвести более чем на 40% заявленных утверждений; тех, где воспроизведение превысило 80%, осталось всего 8.

Независимо от того, содержала ли каждая статья хотя бы 1, 3 или 5 проверяемых утверждений, медианный балл воспроизводимости оставался в пределах 28%—30%, общее распределение практически не менялось.

Исключив эксперименты, которые не были запущены, были прерваны досрочно или требовали аппаратных мощностей сверх возможностей, медианный балл воспроизводимости составил всего 42%—50%; когда каждая статья содержала как минимум 3 проверяемых утверждения, медиана стабилизировалась на уровне 42%.
При воспроизведении столкнулись с типичными проблемами: код не запускается, отсутствуют файлы, неполные инструкции, повреждённые зависимости или несоответствие результатов, полученных при запуске кода, данным в статье.
Кроме того, 4 статьи зависели от моделей, которые уже сняты с доступа. Последующие исследователи, даже если готовы потратить деньги и время, не смогут получить те же самые результаты.
SAI также привели два более конкретных примера.
В одной статье основным преимуществом заявлено «обучение всего 0,77% параметров базовой модели», тогда как в опубликованных контрольных точках фактически было обучено 6,31% параметров, что примерно в 8 раз больше заявленной цифры.
Другая статья представила таблицу надёжности, оценённую судейской моделью, однако в открытом коде эта судейская модель отсутствовала, и не было скриптов, которые могли бы рассчитать цифры в таблице.
Низкокачественные статьи: высокий доход, низкий риск
Результаты воспроизведения SAI можно назвать довольно удручающими.
Что ещё хуже, обнаруженные здесь проблемы — это лишь те проблемы, которые «можно обнаружить при определённых условиях».
Те статьи, у которых нет кода, просто «неуязвимы».

И даже при полностью открытом коде проверка одной статьи требует огромных затрат времени, усилий и денег, а итог часто оказывается неутешительным, что может довести до отчаяния.
Согласно оценке SAI, основанной на публичных ценах Google Cloud по требованию, средняя стоимость полного повторного запуска экспериментов для одной устной статьи ICML составляет около 8900 долларов США. Из 105 статей для 17 стоимость превысила 100 тысяч долларов, а самая дорогая приблизилась к 2,2 миллионам долларов.
Чем больше статья зависит от масштабных вычислительных мощностей, тем сложнее её независимо воспроизвести.
Если кода нет, другие не могут её проверить; если код есть, возможно, никто не сможет позволить себе такую стоимость.
Таким образом, проблемная статья вполне может успешно пройти рецензирование, получить цитирования, попасть в резюме и обеспечить поступление, академическую должность или работу в крупной лаборатории.
Если случайно кто-то обнаружит несоответствие результатов, конференции редко проводят повторную проверку, и статью не обязательно отзывают.
Как сказано в комментариях: «Плохие исследования приносят выгоду, но почти не влекут последствий».

Статьи не читают, но при найме на работу их требуют
В области больших языковых моделей действительно многие действительно важные достижения больше не публикуются в виде статей.
Для инженера OpenAI, находящегося на переднем крае отрасли, такая точка зрения вполне понятна. В конце концов, у них есть более мощные вычислительные ресурсы, более быстрая обратная связь по экспериментам и множество непубличных внутренних результатов, что даёт им «основание не читать статьи».
Но высказывать это вслух несколько двусмысленно.
Один комментарий иронично заметил, что люди в технологических компаниях, поступая так, «поднимаются на борт и убирают трап»: они нанимают исследователей из университетов, основываясь на публично накопленных в академической среде достижениях, переманивают таланты и GPU по более высоким ценам, сами всё реже проходят экспертный обзор, а в итоге поворачиваются и заявляют, что академические исследования «в основном являются обманом».

Немного резко, но справедливо.
Эти люди из передовых лабораторий могут «не читать статьи», но тем, кто хочет в них попасть, всё равно нужно сначала публиковать статьи.
Для студентов и молодых исследователей, не имеющих большого опыта работы в отрасли, статьи на топовых конференциях по-прежнему остаются самым прямым доказательством исследовательских способностей.
Поступление в аспирантуру, поиск академической должности, попадание в передовые лаборатории, такие как OpenAI, — всё это требует статей для привлечения внимания.
Люди из индустрии, попав в крупные лаборатории, начинают пренебрегать статьями, но по-прежнему используют количество статей, уровень конференций и индекс цитирования для отбора тех, кто стоит за дверью.
Таким образом, статьи оказываются в неловком положении: их достоверность в распространении знаний ставится под сомнение, а ценность в конкурентной борьбе за таланты никуда не исчезает.
Поэтому заявление «крупные лаборатории больше не читают статьи» звучит несколько высокомерно. Ведь те, у кого действительно есть право не читать статьи, как правило, уже переступили этот порог благодаря собственным статьям.
Конечно, не все студенты — злодеи, тщательно планирующие академические аферы.
Один исследователь из университета в шутку сказал, что он бы даже хотел, чтобы его студенты уже обладали способностью написать статью с преувеличениями или даже фальсификациями.

Кто-то «стремится стать академическим мошенником», а кто-то всё ещё борется с LaTeX.
Ссылки:
https://x.com/MathewShen42/status/2084465434506768867
https://x.com/kellerjordan0/status/2084721463089902074
https://sai.science/blog/how-much-science-is-verifiable
https://x.com/mengyer/status/2085134204786921886
Эта статья из официального аккаунта WeChat «Машина разума» (ID:almosthuman2014), автор: Машина разума





