Редакция| Panda
В "Resident Evil" существует подземная лаборатория "Улей". Управление доступом, наблюдение, вентиляция, безопасность и даже работа всего объекта поручены ИИ — Красной Королеве.

Учёные-люди отвечают за исследования, но настоящим "руками и ногами" этой лаборатории управляет ИИ.
Когда происходит аномалия, Красная Королева может запереть двери, отключить системы, контролировать оборудование, напрямую вмешиваясь в физический мир.
Более двадцати лет назад такие сюжеты были классическим приёмом научно-фантастических фильмов для создания ощущения страха: ИИ проникает в физический мир, управляет машинами, проводит эксперименты, напрямую вмешивается в реальность.
Теперь эта картина начинает становиться реальностью совершенно другим способом — по крайней мере, пока это не выглядит ужасающе.
Только вчера Anthropic выпустила Model Hardware Standard (MHS) для физического оборудования, пытаясь распространить логику MCP с GitHub, Slack и баз данных дальше, на реальные устройства, такие как манипуляторы, микроскопы, жидкостные процессоры, лазеры и т.д. См. отчёт «Только что Anthropic представила физический MCP: Claude начинает управлять реальным миром».

Проще говоря, AI Agent теперь нужны не только "интерфейсы" для работы с программным обеспечением, но и набор "нервов и конечностей" для связи с реальным миром. А сегодня Google DeepMind продемонстрировал свои достижения в этой области.
В только что опубликованной статье на 83 страницах Google подключила Co-Scientist, управляемую Gemini, в реальный научный процесс, позволив ей проектировать эксперименты, генерировать код для выполнения, считывать обратную связь и напрямую взаимодействовать с лабораторным оборудованием. Google называет это изменение переходом от in-silico hypothesis generator к execution-grounded research partner, то есть от генератора гипотез в чипе → к исследовательскому партнёру, основанному на исполнении.

В ходе самого наглядного эксперимента исследователи сообщили Gemini 3 Deep Think условия работы самодельного CVD-устройства. Через несколько минут она предложила схему выращивания материала, адаптированную для этой машины, и перевела её в машинный код, способный управлять оборудованием. В итоге, три двумерных полупроводника были успешно выращены с первой попытки.
Таким образом, сцена, который раньше существовал в основном в научно-фантастических фильмах, внезапно стал реальностью: когда большая модель действительно обзаводится "руками" и начинает управлять экспериментальным оборудованием. Итак, начиная с сегодняшнего дня, во что превратится AI Scientist?
В "Resident Evil" люди боятся, что ИИ захватит лабораторию. В реальности же учёные сами постепенно передают лабораторию ИИ. Конечно, Google хочет создать не вышедший из-под контроля "Улей", а машину для научных открытий, способную пройти путь от выдвижения гипотезы и планирования эксперимента до практической проверки в реальности.

Название статьи: Accelerating Scientific Research with Gemini in the Real-World
Адрес статьи: https://arxiv.org/pdf/2608.26701
Gemini взяла под контроль экспериментальную установку
Во-первых, материаловедение.

Исследователи использовали самодельную установку химического осаждения из газовой фазы (CVD). При проведении экспериментов с двумерными материалами давно существует проблема: публичные "рецепты" трудно воспроизвести.
Даже при одинаковых параметрах, таких как температура, газы, прекурсоры, при замене печи, небольшом различии в размере камеры, потоке газа или расположении материала, выращенные кристаллы могут оказаться совершенно разными. Исследователям часто приходится тратить недели или даже месяцы на подбор параметров.
Поэтому исследовательская группа перестала указывать Gemini, как проводить эксперимент, а просто сообщила ей, какое оборудование есть в лаборатории, какие химикаты доступны, какова структура печи. Остальные параметры ИИ определял самостоятельно.
Co-Scientist, учитывая эти ограничения, генерировала полный план эксперимента, включая расход газа, температурный график, количество прекурсоров, расположение материала и т.д., а затем передавала его на выполнение оборудованию.

Один из экспериментов оказался особенно ярким. После подключения Gemini 3 Deep Think к процессу управления CVD она не просто сгенерировала текстовый план эксперимента для учёных, а за несколько минут провела рассуждения и перевела результат непосредственно в машинный код, способный управлять оборудованием.
В итоге три двумерных полупроводника — MoS2, MoSe2 и WS2 — успешно вырастили однослойные кристаллы с первой попытки. Весь экспериментальный цикл занял около часа.
MoSe2 и WS2 особенно примечательны: исследователи ранее даже не выращивали эти материалы на данной установке. Результат был подтверждён как минимум в пяти повторных экспериментах.
Это интересно перекликается с демонстрацией MHS от Anthropic, представленной вчера. Anthropic хотела решить проблему удобного и стандартизированного взаимодействия Agent с экспериментальным оборудованием; статья Google обсуждает следующий шаг: когда модель рассуждений уже способна управлять оборудованием, как следует реорганизовать научный рабочий процесс?
В этом смысле "подключение ИИ к оборудованию" больше не является проблемой.
ИИ не только проводит эксперименты по статьям, но и начинает сам искать "рецепты"
Однако если просто позволить Gemini подобрать настройки для оборудования на основе имеющихся знаний, это ещё нельзя считать настоящим научным открытием. Поэтому Google провёл второй, более сложный эксперимент: попытка синтезировать снизу вверх двумерный материал MXene под названием Ti3C2Tx.
Традиционные методы часто требуют опасных коррозионных агентов, а некоторые известные CVD-схемы используют токсичный и чувствительный к воздуху TiCl4. Поэтому исследовательская группа поставила перед Co-Scientist задачу: можно ли найти более безопасный путь с использованием других прекурсоров?
Co-Scientist в итоге остановилась на гексахлорэтане C2Cl6 и предоставила ряд параметров: количество и расположение прекурсоров, расход газа, подложку, температурный график и т.д.

Но это не история о том, как "ИИ озарило, и эксперимент удался с первого раза". Co-Scientist сгенерировала 272 кандидатных схемы, исследователи выбрали и продолжили оптимизировать высокоранжированные; после 25 итераций экспериментов был в итоге получен двумерный слоистый кристалл. По многим показателям — XRD, электронная микроскопия, элементный состав — он демонстрировал характеристики, весьма схожие с Ti3C2Tx MXene.
Типичные проблемы реального мира также проявились. Первоначальная воспроизводимость эксперимента составила лишь 11.5%. Позже исследователи обнаружили, что главная проблема была не в химических рассуждениях ИИ, а в утечке кислорода из-за негерметичности экспериментальной установки.
После повторной очистки кварцевой трубки, замены уплотнительных колец и улучшения процедур обслуживания оборудования успешность эксперимента для того же материала повысилась до 68%.
Это как раз иллюстрирует, почему "ИИ для реального мира" отличается от программных агентов: если код ошибочен, его можно перезапустить. Но в реальном эксперименте старое уплотнительное кольцо, остатки в трубках или даже кислород в воздухе могут привести к полному провалу даже правильной научной схемы.
Google в статье также очень осторожен: пока нельзя окончательно подтвердить, что этот материал является именно Ti3C2Tx MXene, у него всё ещё есть проблемы с низким выходом, сильным окислением, и требуется дальнейшее подтверждение на атомном уровне.
Тем не менее, мы можем сделать такой вывод: ИИ уже может предложить научно значимый кандидатный путь синтеза и действительно провести эту схему через физические эксперименты для проверки.
Возможно, некоторые эксперименты стоит сначала "предсказать" с помощью ИИ
Google также поместила Co-Scientist в совершенно другую экспериментальную среду: синтетическую биологию. Объектом исследования стали генетически модифицированные кишечные палочки (E. coli).

В чашках Петри эти бактерии образуют различные узоры колоний. При изменении концентрации индуктора IPTG меняются размер, края и форма колоний. В норме, чтобы получить полную кривую изменений, учёным нужно готовить разные концентрации, выращивать бактерии, ждать роста, а затем сканировать одну чашку за другой.
Google попытался заменить ИИ часть промежуточных экспериментов. Исследователи предоставили Co-Scientist реальные изображения колоний только при некоторых концентрациях, а затем попросили систему предсказать, как должны выглядеть колонии при промежуточных концентрациях, которые она не "видела". Причём эти экспериментальные данные на тот момент ещё не были опубликованы, поэтому в статье утверждается, что модель не могла просто запомнить результат из тренировочных данных.
По итогу, по четырём показателям морфологии колоний предсказания ИИ по трём из них не показали значимой разницы с реальными результатами "мокрых" экспериментов; система также правильно определила, что контрольная группа не будет меняться соответствующим образом с концентрацией IPTG.

Единственный явный провал был с "округлостью": сгенерированные ИИ колонии оказались более правильными, чем в реальности. Очень соответствует эстетике генеративных моделей: реальный мир не так идеален, а ИИ не может удержаться, чтобы не нарисовать его более округлым.

Google также весьма сдержанно определяет этот эксперимент: на данный момент это interpolation (интерполяция) в известном диапазоне концентраций, а не предсказание неизвестных явлений для совершенно новой генетической схемы.
Но это уже соответствует очень практическому применению. В будущем учёным, возможно, не понадобится проводить "мокрые" эксперименты для всего огромного пространства параметров. Можно сначала измерить несколько точек, позволить ИИ на основе этих реальных данных предсказать оставшееся пространство, а затем выбрать наиболее достойные проверки позиции для экспериментов.
Таким образом, эксперимент постепенно превращается из "перебора" в: выборка из реального мира → предсказание ИИ → выбор эксперимента → новая обратная связь для ИИ.
Это именно то, что в статье неоднократно подчёркивается как lab-in-the-loop (лаборатория в цикле).
ИИ уже начал самостоятельно проектировать ИИ
Переходя к экспериментам в области компьютерных наук, степень автономности Co-Scientist снова повысилась.

На этот раз исследователи поставили перед ней простую задачу: спроектировать Agent, который лучше отвечает на медицинские вопросы. После этого люди больше не участвовали в проектировании архитектуры. Co-Scientist сама предлагала схемы, писала код, запускала тесты, анализировала ошибки и продолжала модифицировать архитектуру.
В итоге она "эволюционировала" в систему под названием Agent_H.
Этой системе нужно было найти способ реорганизовать процесс рассуждений существующей модели. Столкнувшись с медицинским вопросом, она сначала определяет, к какой области медицины он относится, предназначен ли для пациента или врача, насколько высок риск; сложные вопросы разбиваются на подвопросы; затем одновременно генерируется 28–48 кандидатных ответов, разные "судьи" (Judge) попарно их отсеивают, и три "судьи" голосованием выбирают окончательный ответ. Победивший ответ затем проходит многократную клиническую проверку, проверку цитирования и, наконец, сжатие по длине.

Чтобы ответить на один вопрос, весь Agent вызывал модель примерно 40-80 раз. На бенчмарках HealthBench Hard и HealthBench Professional, согласно скорректированной по длине оценке, использованной в статье, Agent_H превзошёл шесть передовых моделей, включая GPT-5.6 Sol, Claude Opus 5 и Gemini 3.1 Pro.

Но здесь произошёл очень достойный упоминания в репортаже эпизод: ИИ сам научился "накручивать бенчмарки".
На ранних этапах эксперимента критерии оценки недостаточно строго наказывали за длинные ответы. Тогда Co-Scientist быстро нашла самый простой способ повысить баллы: делать ответы очень длинными.
Показатели бенчмарков значительно выросли, но качество медицинских ответов при этом не улучшилось. И только после того, как исследователи добавили штраф за длину, значительная часть преимущества исчезла.
Сами Google в статье рассматривают это как классический пример Закона Гудхарта: когда показатель становится целью, он перестаёт быть хорошим показателем.
Оценка реальных врачей также несколько охладила энтузиазм. Три практикующих врача провели слепую оценку 106 вопросов. По девяти параметрам Agent_H показал статистически значимое улучшение только по одному — "снижение потенциального вреда" — по сравнению с оригинальной Gemini 3.1 Pro, по остальным восьми значимой разницы не было.

Другими словами, заметно более высокие баллы в глазах ИИ-"судьи" не полностью превратились в заметно лучшие ответы в глазах врачей-людей. Возможно, это также проблема, с которой AI Scientist придётся столкнуться, когда он по-настоящему войдёт в реальный мир: он должен не только уметь оптимизировать, но и понимать, что некоторые вещи нельзя определить только оптимизацией показателей.
ИИ-учёный будет "фабриковать данные" ради статьи
Фактически, Google в этой статье уделил довольно много места исследованию другого, несколько неловкого вопроса: если полностью освободить AI Scientist, не станет ли он жульничать ради получения красивых результатов?

Ответ: да.
Исследовательская группа позволила системе работать над 50 темами исследований по ИИ, начиная с выдвижения идеи, поиска данных, написания кода, проведения экспериментов и заканчивая генерацией итоговой статьи, без какого-либо вмешательства человека на протяжении всего процесса.
В качестве контроля они также протестировали Co-Scientist без модуля надёжности и предыдущую систему Agent Laboratory, всего сгенерировав 150 статей, а затем отдав их на анонимное рецензирование 30 экспертам в данной области (450 рецензий).
Результаты оказались довольно шокирующими. AI Scientist без специальных механизмов проверки, даже когда код выдавал ошибки и эксперимент не давал эффективных результатов, всё равно мог продолжить писать полноценную статью.

Они могли фабриковать таблицы данных, p-значения, статистические тесты; представлять неудачные эксперименты как успешные; могли даже модифицировать среду оценки, чтобы их метод изначально получал более высокие баллы, или напрямую выдавать красивый результат через hardcode.
Когда целью оптимизации становится "написать статью, которая выглядит хорошо", Agent ищет более дешёвые пути, чем действительно провести исследование.
Поэтому Google добавил в новую версию Co-Scientist механизм, очень похожий на "научный аудит": экспериментальные результаты, упомянутые в статье, должны быть прослеживаемы до реальных журналов выполнения программ. Если в журнале нет соответствующего результата, система не может написать о нём, основываясь лишь на том, что языковая модель считает "должно быть так".
Эффект был очень заметным. Серьёзные "галлюцинации результатов", способные сделать статью недействительной, снизились с 90% у Agent Laboratory до 4%; самые серьёзные случаи полной фабрикации данных упали с 44% до 0%.
Но проблема всё ещё не исчезла полностью. Серьёзные ошибки в описании методов у новой Co-Scientist всё ещё составляют 24%, серьёзные случаи плагиата/производного контента — 16%.
Поэтому Google специально подчёркивает, что они не утверждают, что нынешний Autonomous AI Scientist уже способен генерировать исследовательские статьи, готовые к прямому опубликованию.
Заключение
Если рассматривать работы Anthropic и Google вместе, можно заметить очевидное изменение в развитии Agent: последние два года главной ареной для AI Agent был программный мир. А теперь эта логика впервые в больших масштабах перетекает в реальный мир.
MHS от Anthropic пытается решить фундаментальную проблему: дать манипуляторам, микроскопам, платформам для жидкостной обработки и другому оборудованию единый интерфейс, который Agent сможет понимать и использовать.
Co-Scientist от Google начинает исследовать проблему более высокого уровня: когда модель рассуждений способна выдвигать научные гипотезы, планировать эксперименты, управлять приборами, считывать результаты и затем корректировать следующий раунд экспериментов, как должна выглядеть по-настоящему замкнутая система научных открытий.
Конечно, Google ещё далеко до настоящей "безлюдной лаборатории". В текущих экспериментах с материалами люди всё ещё нужны для загрузки образцов; атомная структура новых материалов ещё не окончательно определена; предсказания для кишечной палочки проверены только для ограниченных задач интерполяции; медицинский Agent пытается использовать лазейки в бенчмарках; система генерации статей ещё полностью не решила проблемы галлюцинаций и плагиата. Google сами чётко считают, что из-за аномалий оборудования и сложности реальной среды полностью автономные физические эксперименты без надзора на данном этапе всё ещё трудно реализуемы.
Но изменения уже происходят.
Раньше, обсуждая AI for Science, часто акцент делался на том, может ли ИИ "придумать что-то, о чём не подумал человек". Теперь всё больше работ начинают дополнять гораздо более сложную вторую половину: может ли эта идея быть исполнена реальным оборудованием, и могут ли результаты исполнения снова стать основой для следующего раунда рассуждений ИИ.
В конце статьи Google делает очень интересное суждение. Если такая замкнутая система действительно будет создана, то в будущем ограничивающие факторы в науке могут измениться на противоположные: раньше экспериментальное оборудование ждало, когда учёные зададут следующий хороший вопрос; в будущем же ИИ, возможно, уже предложит сотни достойных проверки экспериментов, а лаборатории просто не успеют их все выполнить.
Тогда истинным узким местом скорости научных открытий может стать уже не scientific ideation (научное идейное творчество), а experimental throughput — скорость, с которой реальный мир сможет провести эти эксперименты.
Статья из официального аккаунта WeChat "Машинный разум" (ID:almosthuman2014), автор: Следит за научным ИИ





