Может ли большая модель писать промышленные алгоритмы оптимизации? MIT предлагает FrontierOR для тестирования ИИ
Заголовок: Могут ли большие языковые модели создавать промышленные алгоритмы оптимизации? MIT представляет FrontierOR, тестирующий ИИ в этой области.
В последние годы крупные языковые модели (LLM) добились значительных успехов в переводе естественного языка в математические модели и код для решателей, демонстрируя начальные способности к оптимизационному моделированию. Однако для реальных промышленных задач этого недостаточно. Основная сложность заключается в проектировании масштабируемых, точных и быстрых алгоритмов для больших экземпляров задач, а не просто в формулировке ограничений.
Исследователи из Массачусетского технологического института и других учреждений представили бенчмарк FrontierOR, который оценивает способность LLM самостоятельно разрабатывать эффективные алгоритмы для сложных задач оптимизации, аналогично экспертам по исследованию операций. В отличие от существующих тестов, проверяющих лишь умение строить модель или вызывать решатель, FrontierOR фокусируется на создании специализированных алгоритмов (декомпозиция, эвристики, локальный поиск, гибридные методы) для крупномасштабных задач, где универсальные решатели (например, Gurobi) часто неэффективны.
Бенчмарк создан на основе 180 реальных задач из научной литературы по исследованию операций (1992–2025 гг.) и включает подмножество Hard из 50 особенно сложных задач. Оценка проводится в два этапа: проверка выполнимости и качества на малых экземплярах, а затем оценка на больших экземплярах по четырём метрикам, включая комплексный показатель QTE (качество-время-эффективность).
Результаты тестирования современных моделей (GPT-5.3-Codex, Gemini 3.1 Pro, Claude Opus 4.6) показали, что они достигли высокого уровня выполнимости генерируемого кода (Execution rate до 0.98). Однако ключевые показатели — Feasibility (выполнимость на больших задачах), Solution quality (качество решения) и QTE — остаются значительно ниже. Это указывает, что главным препятствием теперь является не синтаксис кода, а глубина и качество алгоритмического проектирования. Более сильные модели демонстрируют большее разнообразие в выборе методов (меньше reliance на чистый вызов решателя), что коррелирует с лучшими результатами.
Эксперименты с автоэволюцией (самоулучшением) алгоритмов, где модели имеют возможность итеративно улучшать исходный код на основе feedback (фреймворки CORAL, OpenEvolve, EoH), показали значительный прогресс. На самых сложных задачах показатель QTE удалось поднять с 0.15 (one-shot) до 0.50. Это демонстрирует потенциал LLM как систем, способных к итеративному алгоритмическому поиску.
FrontierOR намечает путь к созданию "ИИ-инженеров алгоритмов" — систем, которые смогут автоматически проектировать эффективные методы оптимизации для таких областей, как логистика, энергетика и транспорт, объединяя способности LLM к пониманию структуры задачи с мощью традиционных решателей для локальной оптимизации.
marsbit07/10 09:10