# Сопутствующие статьи по теме Самоэволюция

Новостной центр HTX предлагает последние статьи и углубленный анализ по "Самоэволюция", охватывающие рыночные тренды, новости проектов, развитие технологий и политику регулирования в криптоиндустрии.

Может ли большая модель писать промышленные алгоритмы оптимизации? MIT предлагает FrontierOR для тестирования ИИ

Заголовок: Могут ли большие языковые модели создавать промышленные алгоритмы оптимизации? MIT представляет FrontierOR, тестирующий ИИ в этой области. В последние годы крупные языковые модели (LLM) добились значительных успехов в переводе естественного языка в математические модели и код для решателей, демонстрируя начальные способности к оптимизационному моделированию. Однако для реальных промышленных задач этого недостаточно. Основная сложность заключается в проектировании масштабируемых, точных и быстрых алгоритмов для больших экземпляров задач, а не просто в формулировке ограничений. Исследователи из Массачусетского технологического института и других учреждений представили бенчмарк FrontierOR, который оценивает способность LLM самостоятельно разрабатывать эффективные алгоритмы для сложных задач оптимизации, аналогично экспертам по исследованию операций. В отличие от существующих тестов, проверяющих лишь умение строить модель или вызывать решатель, FrontierOR фокусируется на создании специализированных алгоритмов (декомпозиция, эвристики, локальный поиск, гибридные методы) для крупномасштабных задач, где универсальные решатели (например, Gurobi) часто неэффективны. Бенчмарк создан на основе 180 реальных задач из научной литературы по исследованию операций (1992–2025 гг.) и включает подмножество Hard из 50 особенно сложных задач. Оценка проводится в два этапа: проверка выполнимости и качества на малых экземплярах, а затем оценка на больших экземплярах по четырём метрикам, включая комплексный показатель QTE (качество-время-эффективность). Результаты тестирования современных моделей (GPT-5.3-Codex, Gemini 3.1 Pro, Claude Opus 4.6) показали, что они достигли высокого уровня выполнимости генерируемого кода (Execution rate до 0.98). Однако ключевые показатели — Feasibility (выполнимость на больших задачах), Solution quality (качество решения) и QTE — остаются значительно ниже. Это указывает, что главным препятствием теперь является не синтаксис кода, а глубина и качество алгоритмического проектирования. Более сильные модели демонстрируют большее разнообразие в выборе методов (меньше reliance на чистый вызов решателя), что коррелирует с лучшими результатами. Эксперименты с автоэволюцией (самоулучшением) алгоритмов, где модели имеют возможность итеративно улучшать исходный код на основе feedback (фреймворки CORAL, OpenEvolve, EoH), показали значительный прогресс. На самых сложных задачах показатель QTE удалось поднять с 0.15 (one-shot) до 0.50. Это демонстрирует потенциал LLM как систем, способных к итеративному алгоритмическому поиску. FrontierOR намечает путь к созданию "ИИ-инженеров алгоритмов" — систем, которые смогут автоматически проектировать эффективные методы оптимизации для таких областей, как логистика, энергетика и транспорт, объединяя способности LLM к пониманию структуры задачи с мощью традиционных решателей для локальной оптимизации.

marsbit07/10 09:10

Может ли большая модель писать промышленные алгоритмы оптимизации? MIT предлагает FrontierOR для тестирования ИИ

marsbit07/10 09:10

В новом блоге Вэн Ли предлагает «Самосовершенствование следует начинать с Harness», Цуй Тяньи из DeepSeek распространяет и поддерживает

Бывший вице-президент OpenAI по безопасности и соучредитель Thinking Machines Lab Лилия Вэн предложила новый взгляд на саморазвитие ИИ (RSI). Она утверждает, что наиболее реалистичный путь начинается не с прямой модификации весов модели, а с эволюции **Harness** — внешней системы управления, которая отвечает за вызов инструментов, управление контекстом, планирование задач и верификацию результатов. Исследователь DeepSeek Цуй Тяньи поддержал эту идею, отметив, что самосовершенствование на уровне Harness, как и на уровне модели, — многообещающее направление. Вэн выделяет прогресс от инженерии контекста (ACE, MCE) и дизайна рабочих процессов (AI Scientist, ADAS, AFlow) до **Self-Improving Harness**. Последнее включает в себя цикл: поиск слабых мест, предложение модификаций кода Harness и их валидацию. Такие системы, как DGM, показали, что эволюция Harness способна значительно повысить производительность агентов в задачах кодирования без изменения весов модели. Однако путь к полноценному RSI сталкивается с проблемами: слабые или нечеткие оценочные функции, риск взлома системы вознаграждений (reward hacking), коллапс разнообразия решений и противоречие между краткосрочным успехом и долгосрочной устойчивостью системы. Роль человека, по мнению Вэн, смещается в сторону надзора на более высоком уровне абстракции. Вывод: Harness становится критически важным фактором, определяющим конечные возможности ИИ-систем, и представляет собой практическую точку входа для исследований в области саморазвития искусственного интеллекта.

marsbit07/08 10:27

В новом блоге Вэн Ли предлагает «Самосовершенствование следует начинать с Harness», Цуй Тяньи из DeepSeek распространяет и поддерживает

marsbit07/08 10:27

Трепещите, люди, ИИ продолжает ускоряться

Тревога, люди: ИИ продолжает ускоряться На конференции BAAI 2026 стало ясно, что ИИ стремительно развивается по всем направлениям: от моделей и софта до "железа", прокладывая путь из цифрового в физический мир. Ключевые тренды: 1. **Scaling Law в силе:** Закон масштабирования не исчерпан. Масштабирование параметров, синтетических данных и вычислительных мощностей продолжает улучшать большие языковые и мультимодальные модели. Одновременно с этим развивается AI Coding, позволяя ИИ в перспективе самостоятельно обновлять цифровые продукты — начинается этап самоэволюции. 2. **Мир как новая цель:** Следующая ключевая цель — создание "модели мира", способной понимать и предсказывать состояния физического мира. Технологические пути (языковые, пиксельные, 3D-центричные модели) еще не сходятся. По оценкам, на конвергенцию может уйти 3-5 лет. Институт BAAI представил свою разработку в этой области — универсальную базовую модель мира *Wujie·Physis-v0.1*. 3. **Агенты становятся полезнее:** ИИ-агенты переходят от стадии "работоспособности" к стадии "удобства". Появляются специализированные решения (например, для диагностики в кардиологии или для конспектирования встреч). Для повышения их эффективности критически важна отладка инженерных аспектов (Harness) — таких как уточнение задач, проверка и обратная связь, что определяет верхний предел возможностей агента. Итог: ИИ уже не просто инструмент, а фундаментальная сила, перестраивающая мир. Его развитие сосредоточено на двух фронтах: углубление понимания мира через модели и расширение практической полезности через интеллектуальных агентов.

marsbit06/13 02:52

Трепещите, люди, ИИ продолжает ускоряться

marsbit06/13 02:52

Внезапно! Anthropic призывает всех приостановить исследования в области ИИ

Важное заявление от Anthropic: ИИ начал саморазвитие. По данным компании, более 80% кода Anthropic сейчас пишет их ИИ Claude, что привело к восьмикратному росту объема кода, сливаемого инженерами. Качество кода Claude также резко возросло: успешность выполнения сложных задач выросла с 26% до 76% за полгода. Claude теперь также выполняет ревью кода и участвует в исследованиях, демонстрируя ускорение в десятки раз по сравнению с человеком в некоторых задачах. Anthropic ввела метрику "длительность задачи, которую ИИ может выполнить самостоятельно": от 4 минут в марте 2024 года до 16+ часов для самой новой модели. Эта скорость удвоения ускорилась с 7 до 4 месяцев. Компания прогнозирует, что к 2027 году ИИ сможет работать над задачами неделями. В блоге описаны три возможных сценария: стагнация роста, ускорение с сохранением человеческого контроля или полная рекурсивная самоитерация (RSI), когда ИИ начнет создавать следующее поколение ИИ самостоятельно. Anthropic выражает озабоченность по поводу выравнивания (alignment) и заявляет о готовности замедлить или приостановить работу при наличии проверяемого механизма, гарантирующего, что все лаборатории последуют их примеру. Открытие последовало за похожим заявлением OpenAI, что указывает на растущую актуальность темы саморазвития ИИ в отрасли.

marsbit06/05 00:28

Внезапно! Anthropic призывает всех приостановить исследования в области ИИ

marsbit06/05 00:28

活动图片