ИИ может управлять лабораторией? Новое исследование Университета науки и техники Китая проводит стресс-тест в реальном физическом мире

marsbitОпубликовано 2026-08-06Обновлено 2026-08-06

Введение

**Может ли ИИ взять на себя управление лабораторией? Китайские исследователи проводят стресс-тест в реальном физическом мире** Ученые из Китайского университета науки и технологий создали автоматизированную лабораторию для исследований в области катализа, состоящую из 45 модульных рабочих станций, и проверили, способны ли современные ИИ-агенты на основе больших языковых моделей (LLM) выполнять полный цикл научного открытия: от планирования экспериментов до их выполнения и обучения на основе реальных результатов. Ключевым элементом стала «оцифровка» лабораторных возможностей в виде набора машинно-читаемых «навыков», которые ИИ-агент может напрямую вызывать для управления оборудованием. В рамках масштабного тестирования были оценены 48 комбинаций из 6 агентских фреймворков и 9 LLM на 32 исследовательских задачах (всего 4608 тестовых прогонов). Результаты показали значительный разрыв между способностью генерировать планы экспериментов и способностью создавать рабочие процессы, которые могут быть **непосредственно и без вмешательства человека выполнены** в физической лаборатории. Только **3,3%** всех сгенерированных рабочих процессов были готовы к немедленному выполнению. Даже лучшие комбинации моделей, такие как Claude Code с Claude Opus 4.7, достигли уровня исполняемости лишь **28,1%**. Эксперимент с пятираундовой закрытой петлей обратной связи для одной из лучших конфигураций (Codex/GPT 5.5) выявил дальнейшее ограничение: ИИ-агент мог корректировать параметры (например, с...

Как определить, стал ли искусственный интеллект достаточно умным, чтобы заниматься научными исследованиями и осуществлять сквозное автономное научное открытие?

Новейшее исследование, опубликованное Университетом науки и техники Китая, позволило ИИ-«мозгу» взять под контроль лабораторию машинного ученого «тело», тем самым переведя этот вопрос из сферы ответов на вопросы и генерации планов в область выполнения экспериментов и обучения с подкреплением в реальном физическом мире.

Ссылка на статью: https://arxiv.org/abs/2607.23045

Исследовательская группа создала лабораторию машинного катализа, включающую 45 модульных автоматизированных рабочих станций, охватывающих синтез, характеристику и тестирование каталитических свойств.

Чтобы ИИ мог понимать и использовать возможности лаборатории, исследовательская группа инкапсулировала эти возможности в машиночитаемые навыки (skills). Агент ИИ может напрямую вызывать экспериментальное оборудование через эти навыки, одновременно принимая ограничения реальных возможностей оборудования, правил эксплуатации и экспериментальных условий.

Рис. 1. Архитектура лаборатории машинного ученого, понятная ИИ, для каталитических исследований.

Рис. 2. Путь от научного замысла до исполнения в машинной лаборатории.

Стресс-тест

На основе этой платформы исследовательская группа провела систематическую оценку 48 практических конфигураций, состоящих из 6 фреймворков агентов и 9 больших языковых моделей.

Тестирование охватывало 32 исследовательские задачи, определенные экспертами в предметной области, в общей сложности 4608 оценочных прогонов. Оценка рассматривала не только способность агента генерировать план эксперимента, но и отслеживала, могут ли эти планы пройти проверку и быть отправлены в роботизированную систему, а также могут ли сгенерированные рабочие процессы выполняться напрямую без вмешательства человека.

Суровые результаты тестирования в реальном мире

Современные передовые агенты на основе больших языковых моделей все еще значительно отстают от способности «взять под контроль». Из 4608 тестов только 151 рабочий процесс мог быть выполнен без ручного исправления, что составляет 3.3% от всех тестов. Комбинация Claude Code и Claude Opus 4.7 показала лучший результат с уровнем выполнимости 28.1%; комбинация Codex и GPT 5.5 показала уровень выполнимости 19.8%.

Умение корректировать параметры не равно умению перепланировать

Исследование также дополнительно изучило способность агентов обучаться на реальных экспериментальных результатах. Команда поместила комбинацию Codex/GPT 5.5 в открытый цикл из пяти раундов, последовательно проводя планирование эксперимента, роботизированное исполнение, получение доказательств и перепланирование.

Агент смог корректировать состав материалов и рабочие условия на основе возвращаемых экспериментальных результатов, но эти корректировки в основном оставались на уровне локальной оптимизации параметров.

В течение пяти раундов эксперимента агент сохранял исходный каркас рабочего процесса, не перепроектировал методы анализа и не исправил некоторые сохраняющиеся ключевые упущения, такие как отсутствие связующего для электродов и цветового реагента для конкретного аналита.

Результаты показывают, что способность считывать обратную связь по эксперименту и корректировать параметры не равнозначна способности выявлять проблемы самой исследовательской стратегии и тем более не равнозначна перепланированию на научном уровне.

Рис. 3. Производительность агента ИИ на этапах выполнимого планирования, проверки и отправки лабораторных задач.

Долгосрочное планирование остается узким местом

Хотя некоторые агенты генерировали рабочие процессы, оцененные экспертами как выполнимые и содержащие до 44 операционных шагов, во всех тестах только 3 рабочих процесса превышали 30 операционных шагов. Это указывает на то, что по мере удлинения цепочки задач способность агента поддерживать логическую целостность эксперимента и физическую выполнимость по-прежнему сталкивается со значительными трудностями.

Переопределение научных способностей ИИ

Таким образом, исследование различает три способности, которые часто смешиваются в обсуждениях о современных «ученых ИИ»: во-первых, беглое генерирование плана эксперимента; во-вторых, генерация рабочего процесса, который может быть фактически выполнен в физической лаборатории; в-третьих, корректировка общей исследовательской стратегии на основе экспериментальных результатов.

Результаты исследования показывают, что способность к планированию на языковом уровне не может автоматически трансформироваться в надежную способность к выполнению экспериментов, а локальная корректировка параметров также не может быть напрямую воспринята как перепланирование на научном уровне.

От «полигона для тестирования ИИ» к «тренировочному полю для ИИ»

Как интеллектуальная научно-исследовательская инфраструктура для ИИ в науке, машинная лаборатория может стать как «полигоном» для проверки научных способностей ИИ, так и «тренировочным полем» для продвижения непрерывной эволюции ИИ. Агенты ИИ, взаимодействуя с машинной лабораторией через машиночитаемые навыки, преобразуют научный замысел в выполнимые задачи и получают реальную обратную связь от машинного исполнения, состояния приборов и экспериментальных результатов.

Образуемый таким образом замкнутый цикл «планирование — исполнение — обратная связь — перепланирование» не только может выявить недостатки ИИ в знаниях, операциях и исследовательских стратегиях, но также может аккумулировать успешные рабочие процессы, случаи неудач, экспериментальные результаты и экспертные оценки в качестве данных для обучения моделей и выравнивания агентов, непрерывно итеративно улучшая модели ИИ и их агентские системы.

Таким образом, машинный ученый предоставляет количественные, воспроизводимые, проверяемые доказательства из физического мира для ответа на вопрос «Как определить, стал ли искусственный интеллект достаточно умным, чтобы заниматься научными исследованиями?» и продвигает ИИ от генерации экспериментальных схем к постепенному охвату сквозного автономного научного открытия, включающего постановку научных вопросов, проектирование экспериментов, роботизированное исполнение, анализ данных и перепланирование, основанное на доказательствах.

Рис. 4. Пять раундов итерации системы «ИИ-машинный ученый» при открытой научной проблеме.

Источник: https://arxiv.org/abs/2607.23045

Эта статья взята с официального аккаунта WeChat «Xin Zhi Yuan», автор: Xin Zhi Yuan; редактор: LRST

Трендовые криптовалюты

Связанные с этим вопросы

QКаковы были основные результаты стресс-тестирования ИИ-агентов в лаборатории катализа, проведенного исследователями из Китайского университета науки и технологий?

AТестирование 48 конфигураций агентов (6 фреймворков и 9 языковых моделей) на 32 исследовательских задачах показало, что лишь 3.3% из 4608 сгенерированных рабочих процессов могли быть выполнены в лаборатории без исправлений человеком. Лучшая комбинация (Claude Code и Claude Opus 4.7) достигла коэффициента выполнимости 28.1%, что указывает на значительный разрыв между способностью генерировать планы и создавать рабочие процессы, физически выполнимые в реальном мире.

QКакие три ключевые способности, связанные с научной деятельностью, были разграничены в исследовании, и в чем заключалась основная разница между ними?

AИсследование выделило и разграничило три способности: 1) Способность бегло генерировать текстовые планы экспериментов. 2) Способность генерировать рабочие процессы, которые можно *фактически выполнить* на физическом лабораторном оборудовании. 3) Способность корректировать общую исследовательскую стратегию на основе результатов экспериментов. Ключевой вывод: первая способность не гарантирует вторую, а локальная корректировка параметров (проявляемая в тестах) — это не то же самое, что третья, стратегическая перепланировка.

QКак архитектура «машинного ученого» (Machine Scientist), представленная в исследовании, позволяет ИИ взаимодействовать с реальной лабораторией?

AЛаборатория оснащена 45 модульными автоматизированными рабочими станциями, охватывающими синтез, характеризацию и тестирование каталитических свойств. Их возможности инкапсулированы в машинно-читаемые «навыки» (skills). ИИ-агент может напрямую вызывать эти навыки для управления оборудованием, но при этом он обязан соблюдать реальные ограничения: возможности устройств, операционные протоколы и экспериментальные условия. Это создает интерфейс между абстрактным «мозгом» ИИ и физическим «телом» лаборатории.

QЧто показал пятираундовый эксперимент с замкнутым циклом (planning-execution-feedback-replanning) относительно способности ИИ к научному перепланированию?

AЭксперимент с комбинацией Codex/GPT 5.5 показал, что ИИ-агент мог корректировать рецептуры материалов и условия операций на основе возвращаемых результатов. Однако эти корректировки оставались на уровне локальной оптимизации параметров. Агент сохранял исходную структуру рабочего процесса на протяжении всех пяти раундов, не смог перепроектировать методы анализа и не исправил ключевые систематические упущения (например, отсутствие связующего для электродов или специфического хромогенного реагента).

QКакую двойную роль, согласно статье, может играть инфраструктура «машинного ученого» (Machine Scientist) в развитии ИИ для науки (AI for Science)?

AОна может служить одновременно как «полигон для испытаний» (testing ground) и как «полигон для обучения» (training ground) ИИ. Как полигон для испытаний — она обеспечивает объективную, количественную и повторяемую проверку научных способностей ИИ в реальном мире. Как полигон для обучения — замкнутый цикл «планирование-выполнение-обратная связь-перепланирование» генерирует данные (успешные/неудачные рабочие процессы, результаты, экспертные оценки), которые можно использовать для тренировки и согласования (alignment) будущих моделей и агентских систем.

Похожее

Акции США и золото растут одновременно, почему только BTC "притворяется мертвым"?

Акции США и золото растут, но BTC остается в стороне: в то время как глобальные рынки обновляют максимумы, Bitcoin практически не движется. Краткое изложение текущей ситуации: - Акции и золото демонстрируют взрывной рост, нефть резко скорректировалась вниз, тогда как Bitcoin остается статичным. - Несмотря на кражу 594 BTC, вызвавшую перемещение в 200 раз большего объема «спящих» монет, цена не отреагировала, что указывает на отсутствие активных покупок или продаж. - Сигналы формирования дна проявляются через скуку и апатию, а не через классическую капитуляцию, но ключевые показатели еще не достигли уровней, характерных для истинных низов прошлых медвежьих рынков. - Институциональный спрос, двигавший предыдущий бычий рынок (через американские ETF и казначейские покупки), в последнем квартале сменился на чистый отток. - Рынок опционов оценивает низкую вероятность значительных движений в любую сторону, но краткосрочные настроения остаются крайне неустойчивыми и резко меняются на малейших колебаниях цены. - Исторически подобные периоды сильного сжатия волатильности почти всегда разрешались ростом. Однако на этот раз сжатие произошло при отсутствии работающего двигателя спроса. Вывод: рынок Bitcoin сжат, недооценен и отстает от глобального аппетита к риску. Условия для формирования дна складываются, но не завершены. Возврат устойчивого чистого притока в ETF-фонды или расширение волатильности вверх станут сигналами улучшения. Текущее состояние «нулевой ценности движения при чрезмерной реакции на новости» неустойчиво.

marsbit21 мин. назад

Акции США и золото растут одновременно, почему только BTC "притворяется мертвым"?

marsbit21 мин. назад

Бернштейн анализирует первый отчет SpaceX после выхода на биржу: как обоснована целевая цена в 239 долларов?

SpaceX представила свой первый квартальный отчет после выхода на биржу, показав агрессивную историю роста: выручка Connectivity (Starlink) остаётся прибыльной, доходы от AI-вычислений быстро растут, а Илон Маск перенёс цель по достижению годовой выручки в $1 трлн с 2031 на 2030 год. Bernstein сохранил рейтинг «Outperform» и целевую цену в $239, что подразумевает потенциал роста около 91% от цены закрытия 4 августа. Однако эта оценка не основана на полном достижении цели в $1 трлн. Прогноз Bernstein на 2031 год — $554 млрд выручки, что ниже видения руководства. Более высокие цены на AI-вычисления и амбициозные цели рассматриваются как потенциальный дополнительный рост сверх текущей оценки. Во втором квартале выручка SpaceX выросла на 92% до $7,8 млрд, превысив ожидания. Starlink (Connectivity) с 12 млн пользователей остаётся прибыльным столпом (операционная маржа ~38,6%). AI-бизнес показал выручку в $2,56 млрд, но требует огромных капвложений ($15,8 млрд за квартал). Раздел Space (запуски) остаётся убыточным из-за затрат на разработку Starship. Ключевые факторы для будущей оценки: способность Starlink расти, трансформация AI-мощностей в стабильный доход и достижение Starship полной многоразовости для частых и дешёвых запусков. Целевая цена $239 зависит от совместного выполнения этих условий. Неопределённость вокруг окупаемости AI-инвестиций, снятия ограничений на продажу акций и прогресса Starship объясняет падение акций после отчёта, несмотря на превышение ожиданий.

marsbit39 мин. назад

Бернштейн анализирует первый отчет SpaceX после выхода на биржу: как обоснована целевая цена в 239 долларов?

marsbit39 мин. назад

Индекс S&P 500 вновь обновляет исторический рекорд, а ваши технологические акции все еще "отбивают убытки"?

4 августа 2026 года индекс S&P 500 закрылся на рекордном уровне в 7736,52 пункта, в то время как многие известные технологические акции, такие как NVIDIA (упали примерно на 20% с пика), оставались далеко от своих исторических максимумов. Эта кажущаяся противоречивой ситуация объясняется ключевой концепцией диверсификации. S&P 500 — это взвешенный по рыночной капитализации индекс, охватывающий 500 крупнейших компаний США из 11 различных секторов. Хотя технологический сектор является крупнейшим (около 30%), остальные 70% распределены между финансами, здравоохранением, промышленностью и другими отраслями. В июне-июле 2026 года, когда технологические и полупроводниковые акции испытывали давление, рост в финансовом, медицинском и промышленном секторах компенсировал их слабость и позволил общему индексу обновлять максимумы. Это наглядная демонстрация того, как работает диверсификация: убытки в одной части портфеля компенсируются прибылями в других. Индекс равного веса S&P 500 (RSP), где каждая из 500 компаний имеет одинаковый вес, с начала года показал доходность 14,9%, опередив стандартный S&P 500 (13,2%), что подчеркивает силу более широкого участия рынка. Таким образом, рекорд S&P 500 отражает успех диверсифицированного подхода, а не всеобщий рост. Для инвесторов, сконцентрированных только на технологических акциях, опыт рынка был совершенно иным. Ключевой вывод: диверсификация — это не просто теория, а практический механизм, встроенный в структуру индекса, который обеспечивает устойчивость, когда отдельные сектора испытывают трудности.

marsbit50 мин. назад

Индекс S&P 500 вновь обновляет исторический рекорд, а ваши технологические акции все еще "отбивают убытки"?

marsbit50 мин. назад

GSR увеличивает подверженность Bitcoin после падения портфеля Crypto Core3 на 57,78%

Крипто-портфель Crypto Core3 компании GSR, институционального маркет-мейкера, продемонстрировал падение на 57,78% за последний год. На 5 августа портфель состоял из Ethereum (44,1%), Solana (36,5%) и Bitcoin (19,3%). Несмотря на доминирование Ethereum, компания увеличила долю Bitcoin и снизила долю Ethereum, чтобы адаптироваться к рыночной волатильности. За последние 12 месяцев все три основных актива показали отрицательную динамику: Solana упала на 40,21%, Ethereum – на 35,49%, а Bitcoin – на 24,82%. Более высокий вес активов с наибольшими потерями усугубил общий убыток портфеля. Ротация портфеля GSR, направленная на увеличение экспозиции к Bitcoin, демонстрирует стратегию управления рисками во время затяжного спада рынка. Этот пример подчеркивает, что даже диверсифицированные крипто-портфели не защищены от убытков при общем падении рынка. Подобные раскрытия институциональными игроками дают представление о преобладающих рыночных настроениях и стратегиях в отрасли.

TheNewsCrypto57 мин. назад

GSR увеличивает подверженность Bitcoin после падения портфеля Crypto Core3 на 57,78%

TheNewsCrypto57 мин. назад

Компания Grayscale реорганизует финансирование во втором квартале, добавив этот альткоин в свой фонд смарт-контрактов! Вот подробности

Криптоуправляющая компания Grayscale провела ребалансировку своих фондов на второй квартал 2026 года, внеся ключевые изменения в состав активов. В фонде смарт-контрактов впервые появился токен BNB, который теперь занимает около 31% портфеля, в то время как доли Ethereum и Solana составляют по 29% каждая. Это расценивается как сигнал растущего интереса институциональных инвесторов к экосистеме BNB Chain. В фонде DeFi крупнейшими активами остаются Uniswap (34,16%), Ondo Finance (25,44%) и Aave (19,97%). В фонде децентрализованного ИИ компания уменьшила долю NEAR Protocol до 31% и увеличила долю Bittensor (TAO) до 29%. Эксперты отмечают, что такие обновления отражают адаптацию инвестиционной стратегии к текущим рыночным условиям и развитию проектов.

cryptonews.ru58 мин. назад

Компания Grayscale реорганизует финансирование во втором квартале, добавив этот альткоин в свой фонд смарт-контрактов! Вот подробности

cryptonews.ru58 мин. назад

Торговля

Спот

Популярные статьи

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

2025 год — год институциональных инвесторов, в будущем он будет доминировать в приложениях реального времени.

1.9k просмотров всегоОпубликовано 2025.12.16Обновлено 2025.12.16

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на AI (AI) представлены ниже.

活动图片