Моделирование мира: от предсказания к планированию. HWM и вызовы долгосрочного управления

marsbitОпубликовано 2026-04-17Обновлено 2026-04-17

Введение

Модели мира, такие как V-JEPA 2, фокусируются на прогнозировании будущего, но сталкиваются с проблемами в длительных задачах управления: накопление ошибок и рост вычислительной сложности. HWM решает это через иерархическое планирование: верхний уровень определяет этапы, нижний — локальные действия. Это снижает ошибки и затраты, повышая успешность задач (например, с 0% до 70% в робототехнике). WAV добавляет проверку прогнозов. Тренд — переход от предсказания к исполняемым системам, объединяющим прогноз, планирование и коррекцию.

За последний год фокус исследований мировых моделей изначально был сосредоточен на обучении представлений и предсказании будущего. Модели сначала понимают мир, а затем внутренне проигрывают будущие состояния. Это направление уже дало ряд представительных результатов. V-JEPA 2 (Video Joint Embedding Predictive Architecture 2 — набор моделей мира для видео, выпущенный Meta в 2025 году), предобученный на более чем 1 миллионе часов интернет-видео в сочетании с небольшим количеством данных взаимодействия с роботами, продемонстрировал потенциал мировых моделей в понимании, предсказании и планировании для роботов с нулевым-shot обучением).

Но то, что модель умеет предсказывать, не означает, что она умеет справляться с длинными задачами. При столкновении с многоэтапным управлением система обычно сталкивается с двумя проблемами. Первая — ошибки предсказания накапливаются в ходе длинного rollout'а (многошагового проигрывания), что приводит к тому, что весь путь все больше отклоняется от цели. Вторая — пространство поиска действий быстро расширяется с ростом горизонта планирования (planning horizon), что приводит к постоянному росту стоимости планирования. HWM не переписывает базовый путь обучения мировой модели, а добавляет иерархическую структуру планирования поверх уже существующей мировой модели с условиями по действиям, позволяя системе сначала организовать поэтапный путь, а затем обрабатывать локальные действия.

С технической точки зрения, V-JEPA 2 (https://ai.meta.com/research/vjepa/) больше ориентирован на представление мира и базовое предсказание, HWM — на долгосрочное планирование, а WAV (World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry, https://arxiv.org/abs/2604.01985) — на идентификацию и исправление искажений собственных предсказаний моделью. Эти три линии постепенно сходятся. Акцент исследований мировых моделей сместился с простого предсказания будущего на то, как превратить способность к предсказанию в исполнимые, исправимые, проверяемые системные возможности.

I. Почему долгосрочное управление остается узким местом для мировых моделей

Сложность долгосрочного управления легче понять на примере роботизированных задач. Возьмем, к примеру, манипуляцию манипулятором: взять чашку и положить ее в ящик — это не одно действие, а цепочка последовательных шагов. Система должна приблизиться к объекту, скорректировать позу, выполнить захват, переместиться к целевой позиции, а затем обработать ящик и размещение. Как только цепочка становится длинной, возникают две проблемы. Во-первых, ошибки предсказания накапливаются вдоль rollout'а, а во-вторых, пространство поиска действий быстро расширяется.

Системе обычно не хватает не локальной способности к предсказанию, а способности организовать удаленную цель в поэтапный путь. Многие действия локально кажутся отклонением от цели, но на самом деле являются необходимыми промежуточными шагами для ее достижения. Например, поднять руку перед захватом, немного отступить перед открытием ящика, чтобы скорректировать угол.

В демонстрационных задачах мировые модели уже могут давать связные предсказания. Но при входе в реальные сценарии управления производительность начинает падать, и проблемы всплывают. Давление исходит не только от самого представления, но и от того, что уровень планирования еще недостаточно зрелый.

II. Как HWM перестраивает процесс планирования

HWM разделяет изначально одноуровневый процесс планирования на два уровня. Верхний уровень отвечает за этапные направления в более длительных временных масштабах, нижний уровень — за локальное исполнение в более коротких временных масштабах. Модель планирует не в одном ритме, а одновременно в двух разных временных ритмах.

Одноуровневые методы при обработке длинных задач обычно требуют прямого поиска всей цепочки действий в пространстве низкоуровневых действий. Чем длиннее задача, тем выше стоимость поиска, и тем легче ошибки предсказания распространяются вдоль многошагового rollout'а. После разделения процесса в HWM, высокий уровень обрабатывает только выбор маршрута в более длительных временных масштабах, низкий уровень обрабатывает только выполнение текущего сегмента, и вся длинная задача разбивается на несколько более коротких, что снижает сложность планирования.

Здесь также есть ключевой дизайн: высокоуровневые действия — это не просто запись разницы между двумя состояниями, а использование кодировщика для сжатия последовательности низкоуровневых действий в представление действия более высокого уровня. Для длительных задач ключевым является не только разница между начальной и конечной точкой, но и то, как организованы промежуточные шаги. Если высокий уровень видит только разницу в перемещении, он легко теряет информацию о пути в этой цепочке действий.

HWM воплощает иерархический способ организации задач. Столкнувшись с многоэтапной работой, система больше не разворачивает все действия сразу, а сначала формирует грубый этапный путь, а затем выполняет и корректирует его по частям. После внедрения этих иерархических отношений в мировую модель, способность к предсказанию начинает стабильнее превращаться в способность к планированию.

III. От 0% до 70%. Что говорят результаты экспериментов

В задаче захвата и размещения в реальном мире, настроенной в статье, система получала только конечное целевое условие, без предоставления искусственно разбитых промежуточных целей. В таких условиях HWM достигла успеха в 70% случаев, в то время как одноуровневая мировая модель показала успех 0%. Изначально почти невыполнимая длительная задача после введения иерархического планирования стала с высокой вероятностью достижимым результатом.

В статье также тестировались задачи манипуляции с толканием объектов и навигации в лабиринте и другие симуляционные задачи. Результаты показали, что иерархическое планирование не только повысило成功率, но и снизило вычислительную стоимость этапа планирования. В некоторых средах вычислительная стоимость этапа планирования может быть сокращена до примерно четверти от исходной, при сохранении более высокой или сопоставимой успешности.

IV. От V-JEPA к HWM и к WAV

V-JEPA 2 представляет направление представления мира. V-JEPA 2 предобучался на более чем 1 миллионе часов интернет-видео, а затем, в сочетании с менее чем 62 часами видео с роботами, проходил post-training (целевое обучение после предобучения), чтобы получить latent action-conditioned world model (мировую модель, работающую в абстрактном пространстве представлений и делающую предсказания с учетом информации о действиях), пригодную для понимания, предсказания и планирования в физическом мире. Он демонстрирует, что модель может получить представление о мире через масштабное наблюдение и перенести это представление в планирование для роботов.

HWM находится на следующем шаге. Модель уже обладает представлением мира и базовой способностью к предсказанию, но как только дело доходит до многоэтапного управления, возникают проблемы накопления ошибок и расширения пространства поиска. HWM не меняет базовый путь обучения представлений, а добавляет структуру планирования с множественными временными масштабами поверх уже существующей мировой модели с условиями по действиям. Она решает проблему того, как модель организует удаленную цель в набор промежуточных шагов, а затем продвигается по ним по частям.

WAV further смещает фокус на верификацию. Чтобы войти в сценарии оптимизации политик и развертывания, мировая модель должна не только уметь предсказывать, но и обнаруживать, в каких областях она склонна к искажениям, и соответственно корректироваться. Она focuses на том, как модель проверяет себя.

V-JEPA ориентирован на представление мира, HWM — на планирование задач, WAV — на проверку результатов. Хотя их фокус разный, общее направление едино. Следующий этап для мировых моделей — это уже не только внутреннее предсказание, а постепенное соединение предсказания, планирования и верификации в единый набор системных возможностей.

V. От внутреннего предсказания к исполняемой системе

Многие предыдущие работы по мировым моделям были ближе к улучшению непрерывности предсказания будущих состояний или стабильности внутреннего представления мира. Но текущий акцент исследований начал меняться: система должна не только формировать суждение о среде, но и превращать это суждение в действие, а после получения результата продолжать корректировать следующий шаг. Чтобы приблизиться к реальному развертыванию, необходимо контролировать распространение ошибок в долгосрочных задачах, сжимать область поиска, снижать стоимость вывода.

Такие изменения также повлияют на AI agent. Многие агентные системы уже могут выполнять короткие задачи, такие как вызов инструментов, чтение файлов, выполнение инструкций из нескольких шагов. Но как только задача становится длинной, многоэтапной, требующей перепланирования на midway, производительность падает. Это не fundamentally отличается от сложностей в управлении роботами: везде недостаток способности к организации высокоуровневого пути приводит к разрыву между локальным исполнением и общей целью.

Иерархический подход, предлагаемый HWM — высокий уровень отвечает за путь и этапные цели, низкий уровень за локальные действия и обработку обратной связи, плюс наложение проверки результатов — такая иерархическая структура будет продолжать появляться в большем количестве систем в будущем. Следующий этап для мировых моделей также больше не будет focused только на предсказании будущего, а на организации предсказания, исполнения и коррекции в исполняемый путь.

Связанные с этим вопросы

QКаковы основные проблемы, с которыми сталкиваются мировые модели при выполнении длительных задач управления?

AОсновные проблемы включают накопление ошибок прогнозирования при длительном rollout и быстрое расширение пространства поиска действий с увеличением горизонта планирования. Это приводит к отклонению от цели и росту вычислительных затрат.

QКак HWM реструктурирует процесс планирования для преодоления ограничений длительного контроля?

AHWM разделяет планирование на два уровня: верхний уровень отвечает за этапные направления в более длительных временных масштабах, а нижний уровень обрабатывает локальное выполнение в коротких временных масштабах. Это снижает сложность планирования и уменьшает накопление ошибок.

QКакие результаты экспериментов демонстрируют эффективность HWM?

AВ экспериментах по захвату и размещению объектов в реальном мире HWM достиг успеха в 70% случаев, в то время как одноуровневая модель показала 0% успеха. Также наблюдалось снижение вычислительных затрат до одной четверти от исходных при сохранении высокой эффективности.

QКак соотносятся подходы V-JEPA 2, HWM и WAV в развитии мировых моделей?

AV-JEPA 2 фокусируется на обучении репрезентации мира, HWM — на многоуровневом планировании длительных задач, а WAV — на верификации и коррекции прогнозов. Эти три направления постепенно объединяются, формируя системные возможности прогнозирования, планирования и проверки.

QКакое влияние оказывает переход мировых моделей от прогнозирования к исполняемым системам?

AПереход позволяет моделям не только предсказывать будущее, но и преобразовывать прогнозы в действия, контролировать распространение ошибок, сокращать пространство поиска и снижать вычислительные затраты. Это особенно важно для многозадачных сценариев, таких как управление роботами и AI-агентами.

Похожее

За $100 000 в месяц: Truth Social продает доступ к постам Трампа инвестиционным фирмам

Корпорация Trump Media and Technology Group (TMTG) запустила платный сервис Truth API, предоставляющий институциональным инвесторам и фирмам, занимающимся высокочастотной торговлей, мгновенный доступ к постам самых влиятельных аккаунтов в Truth Social, включая аккаунт экс-президента Дональда Трампа. Стоимость подписки, по данным источников, может достигать $100 000 в месяц. Компания позиционирует это как стратегию по извлечению прибыли из собственных активов. Инициатива вызвала критику со стороны ряда сенаторов-демократов и республиканцев, которые обвинили TMTG в продаже привилегированного доступа к постам президента и потребовали проверки со стороны SEC. В ответ компания заявила о скоординированной кампании по нанесению вреда её бизнесу. Анализ отмечает, что подобный сервис создает архитектуру риска, аналогичную случаям, когда торговые алгоритмы в прошлом вызывали обвал рынков, реагируя на фейковые сообщения в соцсетях. Отсутствие встроенного механизма верификации постов в реальном времени делает платформу потенциальной целью для манипуляций.

cryptonews.ru2 ч. назад

За $100 000 в месяц: Truth Social продает доступ к постам Трампа инвестиционным фирмам

cryptonews.ru2 ч. назад

Дивиденды по привилегированным акциям STRC остаются на уровне 12% несмотря на цену ниже номинала

Хотя привилегированные акции STRC компании Strategy завершили июль значительно ниже номинальной стоимости в $100, инвесторам сообщили, что дивиденд за август останется на уровне 12% и не будет увеличен. Акции закрылись 2 августа на уровне $89.46. Генеральный директор Фонг Ле подтвердил, что корпоративная цель — достичь торговли акциями в диапазоне $99-$100, но не уточнил сроки. В июле компания сообщила о чистом убытке в $8.22 млрд за второй квартал, в основном из-за нереализованных потерь на хранении биткоина. Для обеспечения выплат по привилегированным акциям Strategy создала денежный резерв в $3.75 млрд, которого хватит более чем на два года. Компания также выкупила часть своих привилегированных акций со скидкой и намерена продолжать покупки, пока они торгуются ниже номинала.

cointelegraph4 ч. назад

Дивиденды по привилегированным акциям STRC остаются на уровне 12% несмотря на цену ниже номинала

cointelegraph4 ч. назад

Вывод биткоинов продолжается: 8 лет хранения в холодном кошельке Coldcard закончились нулем

Аппаратный кошелек Coldcard оказался уязвимым, что привело к масштабному выводу средств. По данным Galaxy Research на 2 августа 2026 года, похищено уже более 1367 BTC (около $88.6 млн) с 4585 адресов. Проблема связана не с прошивкой, а с seed-фразами, сгенерированными на уязвимых устройствах в определенный период (Mk2/Mk3 с прошивкой 4.0.1–4.1.9; Mk4/Mk5 до версии 5.6.0; Q до версии 1.5.0Q). Причина — ошибка в интеграции библиотеки libNgU, из-за которой устройство перестало использовать аппаратный генератор случайных чисел, перейдя на предсказуемый программный. Обновление прошивки не меняет существующую seed-фразу, поэтому владельцам необходимо сгенерировать новую на исправленной версии и перевести активы. Статья приводит трагичный пример 39-летнего инвестора, который за 8 лет накопил 2 BTC тяжелым трудом, храня их в Coldcard как защиту от гиперинфляции в своей стране, но потерял все за минуты из-за этой уязвимости. Этот случай показывает, что даже стратегия холодного хранения не является абсолютно надежной, особенно когда уязвимость кроется в самом генераторе случайных чисел внутри изолированного устройства.

cryptonews.ru4 ч. назад

Вывод биткоинов продолжается: 8 лет хранения в холодном кошельке Coldcard закончились нулем

cryptonews.ru4 ч. назад

Торговля

Спот
活动图片