Кто еще скажет, что в науке не осталось новых проблем? Что все перспективные направления уже заняты предшественниками??
А если я скажу, что —
в большинстве уже опубликованных статей из топовых журналов есть проблемы?

Недавно исследователи, использовавшие ИИ-агента для «академической проверки на честность», обнаружили:
Из 92 докладов, представленных на Международной конференции по машинному обучению (ICML) 2026 года, 58 уже не поддаются воспроизведению.
Серьёзно? Неужели и правда появился шанс активно публиковаться в топовых журналах?
Статьи с топ-конференций массово «разоблачаются» ИИ
Обычно, если статья попадает на топовую конференцию, это означает, что она прошла рецензирование.
Однако, из-за ограничений по времени, рецензенты практически не имеют возможности полностью скачивать данные, запускать модели или воспроизводить эксперименты, чтобы проверить каждое экспериментальное утверждение в статье.
В то же время, с взрывным ростом количества публикаций в области ИИ, модели становятся все сложнее, масштабы экспериментов — все больше, а код, данные и настройки параметров для одной статьи могут включать сотни деталей.
Верифицируемость статей становится все более важной: статья опубликована, но можно ли заново получить её выводы?
Сейчас ИИ-агенты значительно снижают стоимость такой проверки и воспроизведения.
22 июля американская исследовательско-аналитическая компания с помощью ИИ-агента провела систематический аудит на воспроизводимость результатов для всех 168 устных докладов ICML 2026.

Из 168 статей у 92 было как минимум 5 проверяемых выводных утверждений.
Конечный результат: ИИ-агенту удалось успешно воспроизвести более 40% выводов только для 34 статей; а воспроизвести более 80% выводов — лишь для 8 статей.
Однако следует пояснить, что между «невозможностью воспроизвести» и «фальсификацией исследования» существует огромная разница.
Причины неудачного воспроизведения включают, но не ограничиваются отсутствием ключевых файлов в коде, проблемами с версиями зависимостей, несоответствием результатов запуска данным в статье, а также 4 статьи, зависимые от моделей, которые уже сняты с обслуживания, что означает, что экспериментальные результаты уже никогда не смогут быть воспроизведены кем-либо.
Кроме того, некоторые ошибки были довольно вопиющими —
Например, одна статья позиционировала как ключевое преимущество «обучение всего 0,77% параметров базовой модели», но фактически выложенный чекпоинт был обучен на 6,31% параметров, разница примерно в 8 раз.
Другая статья содержала таблицу надежности, основанную на некоторой оценочной модели, но в открытом коде этой оценочной модели не было, как и не было никаких скриптов, способных сгенерировать результаты из таблицы.

Не случайно в 2026 году Hugging Face и AlphaXiv совместно запустили челлендж «Agent Reproduction Challenge» для ICML 2026, пригласив исследователей использовать ИИ-агентов для программирования для автоматизированного воспроизведения принятых на конференцию статей, и результаты оказались столь же неутешительными.
Аналогичная тенденция в обнаружении ошибок и упущений в статьях выглядит еще более поразительной.
В конце 2025 года в одном исследовании была разработана система проверки статей на основе GPT-5 для анализа работ, уже опубликованных в ведущих конференциях и журналах по ИИ, с целью поиска объективно проверяемых проблем. Исследователи четко заявили:
Мы ищем только «объективные ошибки», мы не оцениваем новизну и научную ценность статьи.
Итоговые результаты показали, что в среднем на статью было обнаружено 4.7 объективных ошибок, 99.2% статей имели как минимум одну помеченную проблему.

△ Изображение создано ИИ
По типам ошибок, математические ошибки и ошибки в формулах занимали первое место, составляя 54,0% (включая неправильно написанные уравнения, логические пробелы в выводах, ошибочные допущения в доказательствах и т.д.).
Примерно 30,8% статей NeurIPS и 23,8% статей ICLR содержали как минимум одну существенную ошибку, способную повлиять на интерпретацию результатов.
Ещё более примечательна временная тенденция: среднее количество ошибок на статью NeurIPS выросло с 3,8 в 2021 году до 5,9 в 2025 году, увеличение на 55,3%.
......
Возможно, в будущем публикация статьи перестанет означать объявление «победы» в исследовании, а станет лишь началом следующего раунда проверки ИИ.
Большой бонус для новичков в науке: публикация в топ-журналах без экспериментов
Так что, друзья, для тех, кто ломает голову над выбором темы, это, возможно, и правда довольно неожиданный «бонус».
Поиск ошибок в литературе и написание исправлений (erratum) — это и так вполне легитимная форма научного выхода, а сейчас, похоже, это настоящий «голубой океан» в науке.

Как именно подступиться? Дадим несколько советов начинающим исследователям, озадаченным выбором темы:
Во-первых, измените подход к исследованию: не гонитесь за передним краем, копайте в прошлом.
Перейдите от «поиска новой темы» к «поиску аномалий в старых статьях», уделяя особое внимание тем классическим работам, которые широко цитируются, но вызывают мало споров. Ведь «99,2% статей содержат как минимум одну ошибку».
Во-вторых, используйте ИИ для создания карты знаний и исследовательской генеалогии.
Такая карта знаний может помочь понять — какие работы являются по-настоящему основополагающими? Какие научные точки зрения в настоящее время остаются спорными? Какие выводы широко цитируются, но недостаточно проверены? Каковы связи цитирования между различными статьями? Это позволит найти связи и аномалии, ранее трудно обнаруживаемые.
В-третьих, Спрашивайте что угодно (Ask anything).
Многие важные прорывы в истории науки происходили не от постановки совершенно новых вопросов, а от пересмотра давно принятого допущения.
Например: проверялся ли классический эксперимент по сегодняшним стандартам? Существуют ли незамеченные ограничительные условия у широко цитируемого вывода?
Раньше такая проверка была очень затратной, исследователям приходилось тратить много времени на изучение первоисточников, сравнение деталей экспериментов, но сейчас ИИ сводит эти затраты практически к нулю.
ИИ, возможно, начнёт переписывать историю науки
Недавно теоретический химик Pios из Чжэцзянской лаборатории, используя ИИ для предсказания точек кипения молекул, обнаружил явное противоречие между результатами и данными 75-летней химической базы данных.
На это первой реакцией любого, вероятно, будет: «Тогда, наверное, ошибаюсь я».
Pios не был исключением, он тут же принялся проверять свою модель. Но после ручного прослеживания исходной литературы он обнаружил: Боже, правым оказался именно ИИ.
Pios был крайне удивлен и продолжил проверку с помощью ИИ, в итоге обнаружив, что примерно столетние и считающиеся в научном сообществе авторитетными данные измерений точек кипения также оказались ошибочными.
Стоит понимать, что эти данные на протяжении многих лет цитировались и включались в последующие исследования.
Долгое необнаружение подобных проблем, возможно, напрямую связано с масштабами научной литературы.

△ Изображение создано ИИ
Объем современных научных публикаций уже давно превышает пределы чтения любого отдельного исследователя. Например, только количество заявок на одну ведущую конференцию по ИИ, ICLR, выросло с 1013 в 2018 году до 19619 в 2026 году.
При таких масштабах ошибка, впервые появившаяся в какой-либо статье, после многократного цитирования в последующих работах продолжает передаваться по цепочке ссылок, фактически формируя научный консенсус.
Из-за давности лет, сложности цепочек цитирования, а также огромных временных затрат на повторную проверку и ограниченной академической отдачи, подавляющее большинство ошибок, уже вошедших в систему научной литературы, никогда не подвергались систематическому пересмотру.
Но сейчас все изменилось. По крайней мере, с технической точки зрения, у человечества впервые появилась возможность массово пересматривать прошлые научные публикации.
Однако, если взять в качестве примера систему проверки корректности статей Paper Correctness Checker на базе GPT-5, её точность обнаружения составляет 83,2%, и при каждой проверке около 40% реальных ошибок остаются невыявленными.
Можно сказать, что подобные инструменты проверки фактов на основе ИИ сами по себе не в состоянии выступать судьями научной литературы, а выводы таких ИИ-инструментов в конечном итоге всё равно требуют проверки человеком.
Статья из WeChat официального аккаунта «Квантовый бит» (ID: QbitAI), автор: Чэн Цянь






