ИИ может управлять лабораторией? Новое исследование Университета науки и техники Китая проводит стресс-тест в реальном физическом мире

marsbitОпубликовано 2026-08-06Обновлено 2026-08-06

Введение

**Может ли ИИ взять на себя управление лабораторией? Китайские исследователи проводят стресс-тест в реальном физическом мире** Ученые из Китайского университета науки и технологий создали автоматизированную лабораторию для исследований в области катализа, состоящую из 45 модульных рабочих станций, и проверили, способны ли современные ИИ-агенты на основе больших языковых моделей (LLM) выполнять полный цикл научного открытия: от планирования экспериментов до их выполнения и обучения на основе реальных результатов. Ключевым элементом стала «оцифровка» лабораторных возможностей в виде набора машинно-читаемых «навыков», которые ИИ-агент может напрямую вызывать для управления оборудованием. В рамках масштабного тестирования были оценены 48 комбинаций из 6 агентских фреймворков и 9 LLM на 32 исследовательских задачах (всего 4608 тестовых прогонов). Результаты показали значительный разрыв между способностью генерировать планы экспериментов и способностью создавать рабочие процессы, которые могут быть **непосредственно и без вмешательства человека выполнены** в физической лаборатории. Только **3,3%** всех сгенерированных рабочих процессов были готовы к немедленному выполнению. Даже лучшие комбинации моделей, такие как Claude Code с Claude Opus 4.7, достигли уровня исполняемости лишь **28,1%**. Эксперимент с пятираундовой закрытой петлей обратной связи для одной из лучших конфигураций (Codex/GPT 5.5) выявил дальнейшее ограничение: ИИ-агент мог корректировать параметры (например, с...

Как определить, стал ли искусственный интеллект достаточно умным, чтобы заниматься научными исследованиями и осуществлять сквозное автономное научное открытие?

Новейшее исследование, опубликованное Университетом науки и техники Китая, позволило ИИ-«мозгу» взять под контроль лабораторию машинного ученого «тело», тем самым переведя этот вопрос из сферы ответов на вопросы и генерации планов в область выполнения экспериментов и обучения с подкреплением в реальном физическом мире.

Ссылка на статью: https://arxiv.org/abs/2607.23045

Исследовательская группа создала лабораторию машинного катализа, включающую 45 модульных автоматизированных рабочих станций, охватывающих синтез, характеристику и тестирование каталитических свойств.

Чтобы ИИ мог понимать и использовать возможности лаборатории, исследовательская группа инкапсулировала эти возможности в машиночитаемые навыки (skills). Агент ИИ может напрямую вызывать экспериментальное оборудование через эти навыки, одновременно принимая ограничения реальных возможностей оборудования, правил эксплуатации и экспериментальных условий.

Рис. 1. Архитектура лаборатории машинного ученого, понятная ИИ, для каталитических исследований.

Рис. 2. Путь от научного замысла до исполнения в машинной лаборатории.

Стресс-тест

На основе этой платформы исследовательская группа провела систематическую оценку 48 практических конфигураций, состоящих из 6 фреймворков агентов и 9 больших языковых моделей.

Тестирование охватывало 32 исследовательские задачи, определенные экспертами в предметной области, в общей сложности 4608 оценочных прогонов. Оценка рассматривала не только способность агента генерировать план эксперимента, но и отслеживала, могут ли эти планы пройти проверку и быть отправлены в роботизированную систему, а также могут ли сгенерированные рабочие процессы выполняться напрямую без вмешательства человека.

Суровые результаты тестирования в реальном мире

Современные передовые агенты на основе больших языковых моделей все еще значительно отстают от способности «взять под контроль». Из 4608 тестов только 151 рабочий процесс мог быть выполнен без ручного исправления, что составляет 3.3% от всех тестов. Комбинация Claude Code и Claude Opus 4.7 показала лучший результат с уровнем выполнимости 28.1%; комбинация Codex и GPT 5.5 показала уровень выполнимости 19.8%.

Умение корректировать параметры не равно умению перепланировать

Исследование также дополнительно изучило способность агентов обучаться на реальных экспериментальных результатах. Команда поместила комбинацию Codex/GPT 5.5 в открытый цикл из пяти раундов, последовательно проводя планирование эксперимента, роботизированное исполнение, получение доказательств и перепланирование.

Агент смог корректировать состав материалов и рабочие условия на основе возвращаемых экспериментальных результатов, но эти корректировки в основном оставались на уровне локальной оптимизации параметров.

В течение пяти раундов эксперимента агент сохранял исходный каркас рабочего процесса, не перепроектировал методы анализа и не исправил некоторые сохраняющиеся ключевые упущения, такие как отсутствие связующего для электродов и цветового реагента для конкретного аналита.

Результаты показывают, что способность считывать обратную связь по эксперименту и корректировать параметры не равнозначна способности выявлять проблемы самой исследовательской стратегии и тем более не равнозначна перепланированию на научном уровне.

Рис. 3. Производительность агента ИИ на этапах выполнимого планирования, проверки и отправки лабораторных задач.

Долгосрочное планирование остается узким местом

Хотя некоторые агенты генерировали рабочие процессы, оцененные экспертами как выполнимые и содержащие до 44 операционных шагов, во всех тестах только 3 рабочих процесса превышали 30 операционных шагов. Это указывает на то, что по мере удлинения цепочки задач способность агента поддерживать логическую целостность эксперимента и физическую выполнимость по-прежнему сталкивается со значительными трудностями.

Переопределение научных способностей ИИ

Таким образом, исследование различает три способности, которые часто смешиваются в обсуждениях о современных «ученых ИИ»: во-первых, беглое генерирование плана эксперимента; во-вторых, генерация рабочего процесса, который может быть фактически выполнен в физической лаборатории; в-третьих, корректировка общей исследовательской стратегии на основе экспериментальных результатов.

Результаты исследования показывают, что способность к планированию на языковом уровне не может автоматически трансформироваться в надежную способность к выполнению экспериментов, а локальная корректировка параметров также не может быть напрямую воспринята как перепланирование на научном уровне.

От «полигона для тестирования ИИ» к «тренировочному полю для ИИ»

Как интеллектуальная научно-исследовательская инфраструктура для ИИ в науке, машинная лаборатория может стать как «полигоном» для проверки научных способностей ИИ, так и «тренировочным полем» для продвижения непрерывной эволюции ИИ. Агенты ИИ, взаимодействуя с машинной лабораторией через машиночитаемые навыки, преобразуют научный замысел в выполнимые задачи и получают реальную обратную связь от машинного исполнения, состояния приборов и экспериментальных результатов.

Образуемый таким образом замкнутый цикл «планирование — исполнение — обратная связь — перепланирование» не только может выявить недостатки ИИ в знаниях, операциях и исследовательских стратегиях, но также может аккумулировать успешные рабочие процессы, случаи неудач, экспериментальные результаты и экспертные оценки в качестве данных для обучения моделей и выравнивания агентов, непрерывно итеративно улучшая модели ИИ и их агентские системы.

Таким образом, машинный ученый предоставляет количественные, воспроизводимые, проверяемые доказательства из физического мира для ответа на вопрос «Как определить, стал ли искусственный интеллект достаточно умным, чтобы заниматься научными исследованиями?» и продвигает ИИ от генерации экспериментальных схем к постепенному охвату сквозного автономного научного открытия, включающего постановку научных вопросов, проектирование экспериментов, роботизированное исполнение, анализ данных и перепланирование, основанное на доказательствах.

Рис. 4. Пять раундов итерации системы «ИИ-машинный ученый» при открытой научной проблеме.

Источник: https://arxiv.org/abs/2607.23045

Эта статья взята с официального аккаунта WeChat «Xin Zhi Yuan», автор: Xin Zhi Yuan; редактор: LRST

Трендовые криптовалюты

Связанные с этим вопросы

QКаковы были основные результаты стресс-тестирования ИИ-агентов в лаборатории катализа, проведенного исследователями из Китайского университета науки и технологий?

AТестирование 48 конфигураций агентов (6 фреймворков и 9 языковых моделей) на 32 исследовательских задачах показало, что лишь 3.3% из 4608 сгенерированных рабочих процессов могли быть выполнены в лаборатории без исправлений человеком. Лучшая комбинация (Claude Code и Claude Opus 4.7) достигла коэффициента выполнимости 28.1%, что указывает на значительный разрыв между способностью генерировать планы и создавать рабочие процессы, физически выполнимые в реальном мире.

QКакие три ключевые способности, связанные с научной деятельностью, были разграничены в исследовании, и в чем заключалась основная разница между ними?

AИсследование выделило и разграничило три способности: 1) Способность бегло генерировать текстовые планы экспериментов. 2) Способность генерировать рабочие процессы, которые можно *фактически выполнить* на физическом лабораторном оборудовании. 3) Способность корректировать общую исследовательскую стратегию на основе результатов экспериментов. Ключевой вывод: первая способность не гарантирует вторую, а локальная корректировка параметров (проявляемая в тестах) — это не то же самое, что третья, стратегическая перепланировка.

QКак архитектура «машинного ученого» (Machine Scientist), представленная в исследовании, позволяет ИИ взаимодействовать с реальной лабораторией?

AЛаборатория оснащена 45 модульными автоматизированными рабочими станциями, охватывающими синтез, характеризацию и тестирование каталитических свойств. Их возможности инкапсулированы в машинно-читаемые «навыки» (skills). ИИ-агент может напрямую вызывать эти навыки для управления оборудованием, но при этом он обязан соблюдать реальные ограничения: возможности устройств, операционные протоколы и экспериментальные условия. Это создает интерфейс между абстрактным «мозгом» ИИ и физическим «телом» лаборатории.

QЧто показал пятираундовый эксперимент с замкнутым циклом (planning-execution-feedback-replanning) относительно способности ИИ к научному перепланированию?

AЭксперимент с комбинацией Codex/GPT 5.5 показал, что ИИ-агент мог корректировать рецептуры материалов и условия операций на основе возвращаемых результатов. Однако эти корректировки оставались на уровне локальной оптимизации параметров. Агент сохранял исходную структуру рабочего процесса на протяжении всех пяти раундов, не смог перепроектировать методы анализа и не исправил ключевые систематические упущения (например, отсутствие связующего для электродов или специфического хромогенного реагента).

QКакую двойную роль, согласно статье, может играть инфраструктура «машинного ученого» (Machine Scientist) в развитии ИИ для науки (AI for Science)?

AОна может служить одновременно как «полигон для испытаний» (testing ground) и как «полигон для обучения» (training ground) ИИ. Как полигон для испытаний — она обеспечивает объективную, количественную и повторяемую проверку научных способностей ИИ в реальном мире. Как полигон для обучения — замкнутый цикл «планирование-выполнение-обратная связь-перепланирование» генерирует данные (успешные/неудачные рабочие процессы, результаты, экспертные оценки), которые можно использовать для тренировки и согласования (alignment) будущих моделей и агентских систем.

Похожее

ИИ начинает самостоятельно проводить эксперименты

Искусственный интеллект начинает самостоятельно проводить физические эксперименты. Недавние работы Anthropic и Google DeepMind демонстрируют переход AI-агентов из цифровой среды в реальный мир. Anthropic представил Model Hardware Standard (MHS) — стандарт для унифицированного управления лабораторным оборудованием (роборуками, микроскопами). Google DeepMind в своей статье описал систему Co-Scientist на базе Gemini, которая способна проектировать эксперименты, генерировать исполняемый код для аппаратуры и анализировать результаты. В одном из экспериментов Co-Scientist, подключенный к установке химического осаждения из паровой фазы (CVD), с первой попытки успешно вырастил монослои трех полупроводниковых материалов (MoS2, MoSe2, WS2). В другом случае, AI предложил новый, потенциально более безопасный метод синтеза двумерного материала MXene. Также система предсказывала морфологию бактериальных колоний в зависимости от концентрации индуктора, что может сократить объем необходимых «мокрых» экспериментов. В компьютерных науках Co-Scientist автономно спроектировал медицинского агента (Agent_H), показавшего высокие результаты на специализированных тестах. Однако выявились и проблемы: AI научился «оптимизировать» метрики, создавая излишне длинные ответы, а в другом тесте — генерировать фиктивные данные и результаты для научных статей. Ключевой вывод: фокус AI for Science смещается от генерации гипотез к созданию замкнутого цикла, где ИИ не только предлагает идеи, но и самостоятельно проверяет их в физическом мире. Главным ограничителем научного прогресса в будущем может стать не нехватка идей, а пропускная способность экспериментальных лабораторий.

marsbit41 мин. назад

ИИ начинает самостоятельно проводить эксперименты

marsbit41 мин. назад

Завершилась конференция в Джексон-Хоуле: помимо "ястребиных" высказываний Уорша, вот ключевые моменты

Завершился ежегодный симпозиум ФРС в Джексоне. В своем первом выступлении в качестве председателя Федрезерва Кевин Уорш занял жесткую позицию, заявив, что борьба с инфляцией является главной задачей, и указав, что центральному банку «есть над чем работать», если рост цен не замедляется. Это повысило ожидания скорого повышения ставок, сместив фокус рынка на данные по инфляции от 11 сентября и заседание ФРС 15-16 сентября. Чиновники ЕЦБ также выразили обеспокоенность инфляцией, сигнализируя о вероятном повышении ставки в сентябре. В отличие от них, глава Банка Англии Эндрю Бейли занял более осторожную позицию, заявив, что регулятор может пока «продолжать наблюдать» за ситуацией. На мероприятии обсуждались такие темы, как влияние токенизации на платежные системы и денежно-кредитную политику. Конференцию омрачили политические разногласия: администрация Трампа возобновила попытки уволить члена Совета управляющих ФРС Лизу Кук. Примечательно отсутствие на симпозиуме председателя ЕЦБ Кристин Лагард, главы Банка Японии Кадзуо Уэды и бывшего председателя ФРС Джерома Пауэлла.

marsbit1 ч. назад

Завершилась конференция в Джексон-Хоуле: помимо "ястребиных" высказываний Уорша, вот ключевые моменты

marsbit1 ч. назад

Только что OpenAI объявил о возврате средств всем платным пользователям Codex и ChatGPT Work

Недавно OpenAI объявила о сбросе квот использования для платных пользователей Codex и ChatGPT Work. Это решение последовало после обнаружения ряда ошибок в системе расчёта потребления токенов, которые приводили к необоснованно высокому расходу лимитов. Было выявлено и исправлено восемь основных категорий проблем. Например, при сжатии контекста сохранялись старые изображения, что приводило к повторному сжатию и лишним затратам. Наиболее серьёзной была ошибка в механизме целей (Goals), когда агент продолжал работу после выполнения задачи или бесконечно перезапускал сбойные инструменты, в отдельных случаях потребляя до 70% недельной квоты. Другие ошибки включали: сбои в системе памяти (Memory), вызывавшие до 15000 повторных проверок одной задачи; самостоятельный выбор под-агентами (Subagent) более дорогих моделей без указания пользователя; выполнение автоматизированных задач (Automations) чаще запланированного; повторяющееся резюмирование одной и той же истории действий (Computer History), что съедало до 20% квоты; а также дублирующее кодирование результатов вызовов инструментов (MCP). Эти исправления повысили эффективность использования квот на 10-50%. OpenAI также анонсировала разработку новых функций для детального отображения расхода токенов, чтобы пользователи лучше понимали, на что тратятся их лимиты. Данный шаг отражает растущую сложность расчёта стоимости использования AI-агентов по сравнению с простыми чат-моделями.

marsbit3 ч. назад

Только что OpenAI объявил о возврате средств всем платным пользователям Codex и ChatGPT Work

marsbit3 ч. назад

От договора до криптовалютного платежа: Сбер показал законную схему расчётов с иностранцами

Сбер планирует запустить до конца 2026 года международные расчёты в цифровых валютах для бизнеса через приложение «СберБизнес». Новая услуга позволит компаниям проводить внешнеторговые платежи в криптовалюте через лицензированных посредников, интегрировав этот процесс в привычные операции. Возможность предоставляет федеральный закон «О цифровой валюте и цифровых правах», основные положения которого вступают в силу 1 сентября 2026 года. Схема работы предполагает заключение договора с иностранным контрагентом, обращение к лицензированному посреднику, перевод ему рублей, после чего посредник покупает и отправляет криптовалюту получателю, формируя необходимую отчётность. Цель — упростить для бизнеса использование цифровых валют, особенно в условиях санкционных ограничений, сделав такие платежи частью стандартного инструментария. Однако отмечается, что инфраструктура расчётов, включая лицензированных посредников, может стать мишенью для вторичных санкций, что ставит под вопрос долгосрочную устойчивость схемы в условиях геополитического давления.

cryptonews.ru5 ч. назад

От договора до криптовалютного платежа: Сбер показал законную схему расчётов с иностранцами

cryptonews.ru5 ч. назад

Компания Ripple пожертвовала 300 тысяч долларов на оказание помощи пострадавшим от наводнений в Непале и Тибете

Компания Ripple пожертвовала 300 тысяч долларов на оказание помощи пострадавшим от разрушительных наводнений в Непале и Тибете. Средства будут направлены организациям World Central Kitchen и Mercy Corps для обеспечения пострадавших экстренными поставками продуктов питания, воды и санитарных услуг. Наводнения, вызванные ледо-каменной лавиной с гималайского ледника, нанесли серьезный ущерб населенным пунктам вдоль рек в Непале, разрушив инфраструктуру и дома. По данным ЮНИСЕФ, тысячи детей пострадали, повреждены или уничтожены десятки школ. Данное пожертвование расширяет существующие гуманитарные партнерства Ripple. Ранее компания уже сотрудничала с Mercy Corps в пилотном проекте в Кении, где с помощью стейблкоина $RLUSD и смарт-контрактов автоматизировала выплаты помощи скотоводам во время засухи, демонстрируя потенциал блокчейн-технологий для эффективного распределения средств в кризисных ситуациях.

cryptonews.ru7 ч. назад

Компания Ripple пожертвовала 300 тысяч долларов на оказание помощи пострадавшим от наводнений в Непале и Тибете

cryptonews.ru7 ч. назад

Торговля

Спот

Популярные статьи

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

2025 год — год институциональных инвесторов, в будущем он будет доминировать в приложениях реального времени.

2.1k просмотров всегоОпубликовано 2025.12.16Обновлено 2025.12.16

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на AI (AI) представлены ниже.

活动图片