ИИ может управлять лабораторией? Новое исследование Университета науки и техники Китая проводит стресс-тест в реальном физическом мире

marsbitОпубликовано 2026-08-06Обновлено 2026-08-06

Введение

**Может ли ИИ взять на себя управление лабораторией? Китайские исследователи проводят стресс-тест в реальном физическом мире** Ученые из Китайского университета науки и технологий создали автоматизированную лабораторию для исследований в области катализа, состоящую из 45 модульных рабочих станций, и проверили, способны ли современные ИИ-агенты на основе больших языковых моделей (LLM) выполнять полный цикл научного открытия: от планирования экспериментов до их выполнения и обучения на основе реальных результатов. Ключевым элементом стала «оцифровка» лабораторных возможностей в виде набора машинно-читаемых «навыков», которые ИИ-агент может напрямую вызывать для управления оборудованием. В рамках масштабного тестирования были оценены 48 комбинаций из 6 агентских фреймворков и 9 LLM на 32 исследовательских задачах (всего 4608 тестовых прогонов). Результаты показали значительный разрыв между способностью генерировать планы экспериментов и способностью создавать рабочие процессы, которые могут быть **непосредственно и без вмешательства человека выполнены** в физической лаборатории. Только **3,3%** всех сгенерированных рабочих процессов были готовы к немедленному выполнению. Даже лучшие комбинации моделей, такие как Claude Code с Claude Opus 4.7, достигли уровня исполняемости лишь **28,1%**. Эксперимент с пятираундовой закрытой петлей обратной связи для одной из лучших конфигураций (Codex/GPT 5.5) выявил дальнейшее ограничение: ИИ-агент мог корректировать параметры (например, с...

Как определить, стал ли искусственный интеллект достаточно умным, чтобы заниматься научными исследованиями и осуществлять сквозное автономное научное открытие?

Новейшее исследование, опубликованное Университетом науки и техники Китая, позволило ИИ-«мозгу» взять под контроль лабораторию машинного ученого «тело», тем самым переведя этот вопрос из сферы ответов на вопросы и генерации планов в область выполнения экспериментов и обучения с подкреплением в реальном физическом мире.

Ссылка на статью: https://arxiv.org/abs/2607.23045

Исследовательская группа создала лабораторию машинного катализа, включающую 45 модульных автоматизированных рабочих станций, охватывающих синтез, характеристику и тестирование каталитических свойств.

Чтобы ИИ мог понимать и использовать возможности лаборатории, исследовательская группа инкапсулировала эти возможности в машиночитаемые навыки (skills). Агент ИИ может напрямую вызывать экспериментальное оборудование через эти навыки, одновременно принимая ограничения реальных возможностей оборудования, правил эксплуатации и экспериментальных условий.

Рис. 1. Архитектура лаборатории машинного ученого, понятная ИИ, для каталитических исследований.

Рис. 2. Путь от научного замысла до исполнения в машинной лаборатории.

Стресс-тест

На основе этой платформы исследовательская группа провела систематическую оценку 48 практических конфигураций, состоящих из 6 фреймворков агентов и 9 больших языковых моделей.

Тестирование охватывало 32 исследовательские задачи, определенные экспертами в предметной области, в общей сложности 4608 оценочных прогонов. Оценка рассматривала не только способность агента генерировать план эксперимента, но и отслеживала, могут ли эти планы пройти проверку и быть отправлены в роботизированную систему, а также могут ли сгенерированные рабочие процессы выполняться напрямую без вмешательства человека.

Суровые результаты тестирования в реальном мире

Современные передовые агенты на основе больших языковых моделей все еще значительно отстают от способности «взять под контроль». Из 4608 тестов только 151 рабочий процесс мог быть выполнен без ручного исправления, что составляет 3.3% от всех тестов. Комбинация Claude Code и Claude Opus 4.7 показала лучший результат с уровнем выполнимости 28.1%; комбинация Codex и GPT 5.5 показала уровень выполнимости 19.8%.

Умение корректировать параметры не равно умению перепланировать

Исследование также дополнительно изучило способность агентов обучаться на реальных экспериментальных результатах. Команда поместила комбинацию Codex/GPT 5.5 в открытый цикл из пяти раундов, последовательно проводя планирование эксперимента, роботизированное исполнение, получение доказательств и перепланирование.

Агент смог корректировать состав материалов и рабочие условия на основе возвращаемых экспериментальных результатов, но эти корректировки в основном оставались на уровне локальной оптимизации параметров.

В течение пяти раундов эксперимента агент сохранял исходный каркас рабочего процесса, не перепроектировал методы анализа и не исправил некоторые сохраняющиеся ключевые упущения, такие как отсутствие связующего для электродов и цветового реагента для конкретного аналита.

Результаты показывают, что способность считывать обратную связь по эксперименту и корректировать параметры не равнозначна способности выявлять проблемы самой исследовательской стратегии и тем более не равнозначна перепланированию на научном уровне.

Рис. 3. Производительность агента ИИ на этапах выполнимого планирования, проверки и отправки лабораторных задач.

Долгосрочное планирование остается узким местом

Хотя некоторые агенты генерировали рабочие процессы, оцененные экспертами как выполнимые и содержащие до 44 операционных шагов, во всех тестах только 3 рабочих процесса превышали 30 операционных шагов. Это указывает на то, что по мере удлинения цепочки задач способность агента поддерживать логическую целостность эксперимента и физическую выполнимость по-прежнему сталкивается со значительными трудностями.

Переопределение научных способностей ИИ

Таким образом, исследование различает три способности, которые часто смешиваются в обсуждениях о современных «ученых ИИ»: во-первых, беглое генерирование плана эксперимента; во-вторых, генерация рабочего процесса, который может быть фактически выполнен в физической лаборатории; в-третьих, корректировка общей исследовательской стратегии на основе экспериментальных результатов.

Результаты исследования показывают, что способность к планированию на языковом уровне не может автоматически трансформироваться в надежную способность к выполнению экспериментов, а локальная корректировка параметров также не может быть напрямую воспринята как перепланирование на научном уровне.

От «полигона для тестирования ИИ» к «тренировочному полю для ИИ»

Как интеллектуальная научно-исследовательская инфраструктура для ИИ в науке, машинная лаборатория может стать как «полигоном» для проверки научных способностей ИИ, так и «тренировочным полем» для продвижения непрерывной эволюции ИИ. Агенты ИИ, взаимодействуя с машинной лабораторией через машиночитаемые навыки, преобразуют научный замысел в выполнимые задачи и получают реальную обратную связь от машинного исполнения, состояния приборов и экспериментальных результатов.

Образуемый таким образом замкнутый цикл «планирование — исполнение — обратная связь — перепланирование» не только может выявить недостатки ИИ в знаниях, операциях и исследовательских стратегиях, но также может аккумулировать успешные рабочие процессы, случаи неудач, экспериментальные результаты и экспертные оценки в качестве данных для обучения моделей и выравнивания агентов, непрерывно итеративно улучшая модели ИИ и их агентские системы.

Таким образом, машинный ученый предоставляет количественные, воспроизводимые, проверяемые доказательства из физического мира для ответа на вопрос «Как определить, стал ли искусственный интеллект достаточно умным, чтобы заниматься научными исследованиями?» и продвигает ИИ от генерации экспериментальных схем к постепенному охвату сквозного автономного научного открытия, включающего постановку научных вопросов, проектирование экспериментов, роботизированное исполнение, анализ данных и перепланирование, основанное на доказательствах.

Рис. 4. Пять раундов итерации системы «ИИ-машинный ученый» при открытой научной проблеме.

Источник: https://arxiv.org/abs/2607.23045

Эта статья взята с официального аккаунта WeChat «Xin Zhi Yuan», автор: Xin Zhi Yuan; редактор: LRST

Трендовые криптовалюты

Связанные с этим вопросы

QКаковы были основные результаты стресс-тестирования ИИ-агентов в лаборатории катализа, проведенного исследователями из Китайского университета науки и технологий?

AТестирование 48 конфигураций агентов (6 фреймворков и 9 языковых моделей) на 32 исследовательских задачах показало, что лишь 3.3% из 4608 сгенерированных рабочих процессов могли быть выполнены в лаборатории без исправлений человеком. Лучшая комбинация (Claude Code и Claude Opus 4.7) достигла коэффициента выполнимости 28.1%, что указывает на значительный разрыв между способностью генерировать планы и создавать рабочие процессы, физически выполнимые в реальном мире.

QКакие три ключевые способности, связанные с научной деятельностью, были разграничены в исследовании, и в чем заключалась основная разница между ними?

AИсследование выделило и разграничило три способности: 1) Способность бегло генерировать текстовые планы экспериментов. 2) Способность генерировать рабочие процессы, которые можно *фактически выполнить* на физическом лабораторном оборудовании. 3) Способность корректировать общую исследовательскую стратегию на основе результатов экспериментов. Ключевой вывод: первая способность не гарантирует вторую, а локальная корректировка параметров (проявляемая в тестах) — это не то же самое, что третья, стратегическая перепланировка.

QКак архитектура «машинного ученого» (Machine Scientist), представленная в исследовании, позволяет ИИ взаимодействовать с реальной лабораторией?

AЛаборатория оснащена 45 модульными автоматизированными рабочими станциями, охватывающими синтез, характеризацию и тестирование каталитических свойств. Их возможности инкапсулированы в машинно-читаемые «навыки» (skills). ИИ-агент может напрямую вызывать эти навыки для управления оборудованием, но при этом он обязан соблюдать реальные ограничения: возможности устройств, операционные протоколы и экспериментальные условия. Это создает интерфейс между абстрактным «мозгом» ИИ и физическим «телом» лаборатории.

QЧто показал пятираундовый эксперимент с замкнутым циклом (planning-execution-feedback-replanning) относительно способности ИИ к научному перепланированию?

AЭксперимент с комбинацией Codex/GPT 5.5 показал, что ИИ-агент мог корректировать рецептуры материалов и условия операций на основе возвращаемых результатов. Однако эти корректировки оставались на уровне локальной оптимизации параметров. Агент сохранял исходную структуру рабочего процесса на протяжении всех пяти раундов, не смог перепроектировать методы анализа и не исправил ключевые систематические упущения (например, отсутствие связующего для электродов или специфического хромогенного реагента).

QКакую двойную роль, согласно статье, может играть инфраструктура «машинного ученого» (Machine Scientist) в развитии ИИ для науки (AI for Science)?

AОна может служить одновременно как «полигон для испытаний» (testing ground) и как «полигон для обучения» (training ground) ИИ. Как полигон для испытаний — она обеспечивает объективную, количественную и повторяемую проверку научных способностей ИИ в реальном мире. Как полигон для обучения — замкнутый цикл «планирование-выполнение-обратная связь-перепланирование» генерирует данные (успешные/неудачные рабочие процессы, результаты, экспертные оценки), которые можно использовать для тренировки и согласования (alignment) будущих моделей и агентских систем.

Похожее

Московская биржа запустит собственный цифровой депозитарий для криптовалют

Московская биржа готовится запустить собственный цифровой депозитарий для работы с криптовалютами к концу 2026 — началу 2027 года. Он будет независим от Национального расчетного депозитария (НРД). Банк России утвердил требования к таким структурам, включая минимальный размер капитала от 50 до 250 млн рублей в зависимости от функций. На рынке параллельно формируются другие центры ликвидности. Сбербанк, Альфа-Банк, ВТБ, группа «Т-Технологии» и СПБ Биржа также разрабатывают собственную инфраструктуру для хранения и торговли цифровыми активами, планируя запуск в ближайшее время. Брокерам будет предложен выбор: подключиться к депозитарию Московской биржи или развивать собственные решения. Закон «О цифровой валюте и цифровых правах» вступает в силу с 1 сентября 2026 года с переходным периодом до 1 июля 2027 года. Таким образом, к моменту начала регулирования в России появится несколько независимых депозитарных систем, что создает распределенную архитектуру рынка. Это отличается от централизованной модели, выбранной, например, Казахстаном. Распределенный подход распределяет риски между игроками, но может осложнить перевод активов, в то время как централизованный снижает фрагментацию ликвидности, но усиливает зависимость от одного регулятора. Устойчивость каждой модели покажет практика.

cryptonews.ru2 мин. назад

Московская биржа запустит собственный цифровой депозитарий для криптовалют

cryptonews.ru2 мин. назад

RWAs противодействуют замедлению DeFi, поскольку токенизированные активы набирают популярность: CoinShares

Реальные мировые активы (RWA) демонстрируют рост, несмотря на общее замедление в секторе DeFi, согласно совместному отчёту CoinShares и Token Terminal. В то время как общий объём депозитов в DeFi во втором квартале 2026 года сократился примерно на 15%, депозиты в RWA-протоколы выросли более чем в три раза, достигнув $7,4 млрд. Это указывает, что спрос на токенизированные активы определяется их практической полезностью, а не общими рыночными циклами. Ключевыми категориями RWA стали стейблкоины, приносящие доход, и токенизированные казначейские облигации (такие как фонд BlackRock BUIDL), предлагающие доходность от 3,2% до 5,5%. Они активно используются в качестве залога и инструментов для получения дохода. Торговые объёмы RWA на децентрализованных биржах (DEX) выросли примерно на 220% в годовом исчислении, несмотря на общее падение объёмов DEX на 70%. Основной вклад внесли токены, обеспеченные золотом (XAUt, PAXG), и доходные долларовые продукты. Кроме того, RWA активно проникают на рынки деривативов. Объёмы торгов бессрочными фьючерсами на токенизированные активы растут, позволяя трейдерам использовать кредитное плечо для ставок на товары, фондовые индексы и акции технологических компаний.

cointelegraph2 мин. назад

RWAs противодействуют замедлению DeFi, поскольку токенизированные активы набирают популярность: CoinShares

cointelegraph2 мин. назад

Раунд финансирования серии B эмитента стабильной монеты иены JPYC достиг 38 млн долларов

Японский эмитент стейблкоина JPYC привлек около 6 млрд иен (38 млн долларов США) в расширенном раунде финансирования Серии B. Новым инвестором стала логистическая группа AZ-COM Maruwa Holdings. Средства будут направлены на развитие финансовой и Web3-экосистемы, а также на расширение использования стейблкоина, привязанного к иене. Хотя точная сумма расширения не раскрывается, общий объем раунда вырос примерно на 1 млрд иен по сравнению с маем. Ранее сообщалось, что AZ-COM рассматривала инвестиции более 1 млрд иен и возможность использования стейблкоина для расчетов с партнерами по доставке. JPYC заявляет, что интеграция его стейблкоина с логистической сетью AZ-COM может способствовать развитию ончейн-финансов, объединяющих коммерческие, логистические и платежные потоки.

cointelegraph48 мин. назад

Раунд финансирования серии B эмитента стабильной монеты иены JPYC достиг 38 млн долларов

cointelegraph48 мин. назад

Артур Хейз активизировал свои покупки этого альткоина, инвестировав 2 миллиона долларов за последние пять дней!

Артур Хейз, основатель BitMEX, активно наращивает свои инвестиции в токен $ENA проекта Ethena экосистемы Ethereum. По данным Lookonchain, за последние пять дней он приобрел 22,64 миллиона токенов на общую сумму около 2 миллионов долларов, включая последнюю покупку на 985 000 долларов. Эти действия вновь привлекли внимание рынка к данному альткоину и к экосистеме Ethereum в целом. Хейз известен своими макроэкономическими анализами, и его растущие вложения в $ENA могут отражать позитивный взгляд на проекты DeFi. Ethena разрабатывает решения в области синтетических долларов, а её токен используется для управления платформой. Эксперты отмечают, что хотя сделки крупных инвесторов («китов») являются важным сигналом, на цены влияют и другие факторы: общие рыночные условия, ликвидность и фундаментальные показатели проекта. Поэтому инвестиционные решения не должны основываться исключительно на активности крупных игроков.

cryptonews.ru1 ч. назад

Артур Хейз активизировал свои покупки этого альткоина, инвестировав 2 миллиона долларов за последние пять дней!

cryptonews.ru1 ч. назад

Токен рухнул на 99%, а основатель сел: NFT-стартап Few and Far обошелся инвесторам в $10 млн

Прокуратура Южного округа Нью-Йорка предъявила обвинения основателю NFT-стартапа Few and Far Таджу Тарше в мошенничестве с ценными бумагами и электронных средствах связи. По версии следствия, с февраля 2022 года он привлёк более $10 млн от 67 инвесторов через продажу прав на будущие токены FAR (SAFT), обещая развивать маркетплейс на блокчейне NEAR. Вместо этого средства тратились на онлайн-казино, спекулятивные криптовалюты, личные нужды, включая кредит на жильё в Майами и хобби диджея. После запуска в мае 2024 года токен FAR практически сразу обесценился более чем на 99%. Тарша был арестован 6 июня 2026 года и грозит до 20 лет тюрьмы по каждому эпизоду. Это дело следует паттерну мошенничеств в NFT-индустрии, поднимая вопрос о недостатках контроля за средствами в схемах типа SAFT.

cryptonews.ru1 ч. назад

Токен рухнул на 99%, а основатель сел: NFT-стартап Few and Far обошелся инвесторам в $10 млн

cryptonews.ru1 ч. назад

Торговля

Спот

Популярные статьи

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

2025 год — год институциональных инвесторов, в будущем он будет доминировать в приложениях реального времени.

1.9k просмотров всегоОпубликовано 2025.12.16Обновлено 2025.12.16

Неделя обучения по популярным токенам (2): 2026 может стать годом приложений реального времени, сектор AI продолжает оставаться в тренде

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на AI (AI) представлены ниже.

活动图片