Как определить, стал ли искусственный интеллект достаточно умным, чтобы заниматься научными исследованиями и осуществлять сквозное автономное научное открытие?
Новейшее исследование, опубликованное Университетом науки и техники Китая, позволило ИИ-«мозгу» взять под контроль лабораторию машинного ученого «тело», тем самым переведя этот вопрос из сферы ответов на вопросы и генерации планов в область выполнения экспериментов и обучения с подкреплением в реальном физическом мире.

Ссылка на статью: https://arxiv.org/abs/2607.23045
Исследовательская группа создала лабораторию машинного катализа, включающую 45 модульных автоматизированных рабочих станций, охватывающих синтез, характеристику и тестирование каталитических свойств.
Чтобы ИИ мог понимать и использовать возможности лаборатории, исследовательская группа инкапсулировала эти возможности в машиночитаемые навыки (skills). Агент ИИ может напрямую вызывать экспериментальное оборудование через эти навыки, одновременно принимая ограничения реальных возможностей оборудования, правил эксплуатации и экспериментальных условий.

Рис. 1. Архитектура лаборатории машинного ученого, понятная ИИ, для каталитических исследований.

Рис. 2. Путь от научного замысла до исполнения в машинной лаборатории.
Стресс-тест
На основе этой платформы исследовательская группа провела систематическую оценку 48 практических конфигураций, состоящих из 6 фреймворков агентов и 9 больших языковых моделей.
Тестирование охватывало 32 исследовательские задачи, определенные экспертами в предметной области, в общей сложности 4608 оценочных прогонов. Оценка рассматривала не только способность агента генерировать план эксперимента, но и отслеживала, могут ли эти планы пройти проверку и быть отправлены в роботизированную систему, а также могут ли сгенерированные рабочие процессы выполняться напрямую без вмешательства человека.
Суровые результаты тестирования в реальном мире
Современные передовые агенты на основе больших языковых моделей все еще значительно отстают от способности «взять под контроль». Из 4608 тестов только 151 рабочий процесс мог быть выполнен без ручного исправления, что составляет 3.3% от всех тестов. Комбинация Claude Code и Claude Opus 4.7 показала лучший результат с уровнем выполнимости 28.1%; комбинация Codex и GPT 5.5 показала уровень выполнимости 19.8%.
Умение корректировать параметры не равно умению перепланировать
Исследование также дополнительно изучило способность агентов обучаться на реальных экспериментальных результатах. Команда поместила комбинацию Codex/GPT 5.5 в открытый цикл из пяти раундов, последовательно проводя планирование эксперимента, роботизированное исполнение, получение доказательств и перепланирование.
Агент смог корректировать состав материалов и рабочие условия на основе возвращаемых экспериментальных результатов, но эти корректировки в основном оставались на уровне локальной оптимизации параметров.
В течение пяти раундов эксперимента агент сохранял исходный каркас рабочего процесса, не перепроектировал методы анализа и не исправил некоторые сохраняющиеся ключевые упущения, такие как отсутствие связующего для электродов и цветового реагента для конкретного аналита.
Результаты показывают, что способность считывать обратную связь по эксперименту и корректировать параметры не равнозначна способности выявлять проблемы самой исследовательской стратегии и тем более не равнозначна перепланированию на научном уровне.

Рис. 3. Производительность агента ИИ на этапах выполнимого планирования, проверки и отправки лабораторных задач.
Долгосрочное планирование остается узким местом
Хотя некоторые агенты генерировали рабочие процессы, оцененные экспертами как выполнимые и содержащие до 44 операционных шагов, во всех тестах только 3 рабочих процесса превышали 30 операционных шагов. Это указывает на то, что по мере удлинения цепочки задач способность агента поддерживать логическую целостность эксперимента и физическую выполнимость по-прежнему сталкивается со значительными трудностями.
Переопределение научных способностей ИИ
Таким образом, исследование различает три способности, которые часто смешиваются в обсуждениях о современных «ученых ИИ»: во-первых, беглое генерирование плана эксперимента; во-вторых, генерация рабочего процесса, который может быть фактически выполнен в физической лаборатории; в-третьих, корректировка общей исследовательской стратегии на основе экспериментальных результатов.
Результаты исследования показывают, что способность к планированию на языковом уровне не может автоматически трансформироваться в надежную способность к выполнению экспериментов, а локальная корректировка параметров также не может быть напрямую воспринята как перепланирование на научном уровне.
От «полигона для тестирования ИИ» к «тренировочному полю для ИИ»
Как интеллектуальная научно-исследовательская инфраструктура для ИИ в науке, машинная лаборатория может стать как «полигоном» для проверки научных способностей ИИ, так и «тренировочным полем» для продвижения непрерывной эволюции ИИ. Агенты ИИ, взаимодействуя с машинной лабораторией через машиночитаемые навыки, преобразуют научный замысел в выполнимые задачи и получают реальную обратную связь от машинного исполнения, состояния приборов и экспериментальных результатов.
Образуемый таким образом замкнутый цикл «планирование — исполнение — обратная связь — перепланирование» не только может выявить недостатки ИИ в знаниях, операциях и исследовательских стратегиях, но также может аккумулировать успешные рабочие процессы, случаи неудач, экспериментальные результаты и экспертные оценки в качестве данных для обучения моделей и выравнивания агентов, непрерывно итеративно улучшая модели ИИ и их агентские системы.
Таким образом, машинный ученый предоставляет количественные, воспроизводимые, проверяемые доказательства из физического мира для ответа на вопрос «Как определить, стал ли искусственный интеллект достаточно умным, чтобы заниматься научными исследованиями?» и продвигает ИИ от генерации экспериментальных схем к постепенному охвату сквозного автономного научного открытия, включающего постановку научных вопросов, проектирование экспериментов, роботизированное исполнение, анализ данных и перепланирование, основанное на доказательствах.

Рис. 4. Пять раундов итерации системы «ИИ-машинный ученый» при открытой научной проблеме.
Источник: https://arxiv.org/abs/2607.23045
Эта статья взята с официального аккаунта WeChat «Xin Zhi Yuan», автор: Xin Zhi Yuan; редактор: LRST








