Закон масштабирования — панацея? Первый бенчмарк для операций с кристаллическими структурами, и ведущие большие модели терпят коллективный провал
Новый бенчмарк AtomWorld, представленный на ICML 2026 исследователями из Университета науки и технологий Китая (Су чжоу) и Университета Нового Южного Уэльса, подвергает сомнению универсальность Scaling Law (закона масштабирования) в сфере AI for Science. Бенчмарк фокусируется на практических задачах по манипуляции атомными структурами в материаловедении, таких как создание поверхностей, замещение атомов, вращение фрагментов и расширение суперъячейки.
Результаты тестирования ведущих моделей (Claude Opus, GPT, Gemini, Qwen, DeepSeek, Llama) показали, что простое увеличение масштаба модели (Scaling Law) хотя и улучшает выполнение простых, шаблонных операций (замена, удаление, перемещение атомов), но не гарантирует успеха в сложных задачах, требующих понимания трёхмерного пространства и геометрического планирования. Например, задача вращения вокруг атома оставалась сложной даже для самых мощных моделей.
Исследование указывает на принципиальное различие между способностью модели *понимать* научные знания (на основе текстовых данных) и её способностью *выполнять* точные действия в физически корректном трёхмерном пространстве. Авторы утверждают, что для прогресса в AI for Science необходим переход от «Language Scaling» к «Action Scaling» — созданию масштабируемых циклов обучения, где модель учится на основе совершаемых действий, обратной связи от симуляторов и проверки физических ограничений. AtomWorld предоставляет основу для такого обучения, автоматически генерируя задачи, эталонные структуры и средства проверки, чтобы превратить научного ИИ-агента из «энциклопедии, отвечающей на вопросы», в «лабораторного помощника, выполняющего задачи».
marsbit07/15 03:59