Моделирование мира: от предсказания к планированию. HWM и вызовы долгосрочного управления

marsbitОпубликовано 2026-04-17Обновлено 2026-04-17

Введение

Модели мира, такие как V-JEPA 2, фокусируются на прогнозировании будущего, но сталкиваются с проблемами в длительных задачах управления: накопление ошибок и рост вычислительной сложности. HWM решает это через иерархическое планирование: верхний уровень определяет этапы, нижний — локальные действия. Это снижает ошибки и затраты, повышая успешность задач (например, с 0% до 70% в робототехнике). WAV добавляет проверку прогнозов. Тренд — переход от предсказания к исполняемым системам, объединяющим прогноз, планирование и коррекцию.

За последний год фокус исследований мировых моделей изначально был сосредоточен на обучении представлений и предсказании будущего. Модели сначала понимают мир, а затем внутренне проигрывают будущие состояния. Это направление уже дало ряд представительных результатов. V-JEPA 2 (Video Joint Embedding Predictive Architecture 2 — набор моделей мира для видео, выпущенный Meta в 2025 году), предобученный на более чем 1 миллионе часов интернет-видео в сочетании с небольшим количеством данных взаимодействия с роботами, продемонстрировал потенциал мировых моделей в понимании, предсказании и планировании для роботов с нулевым-shot обучением).

Но то, что модель умеет предсказывать, не означает, что она умеет справляться с длинными задачами. При столкновении с многоэтапным управлением система обычно сталкивается с двумя проблемами. Первая — ошибки предсказания накапливаются в ходе длинного rollout'а (многошагового проигрывания), что приводит к тому, что весь путь все больше отклоняется от цели. Вторая — пространство поиска действий быстро расширяется с ростом горизонта планирования (planning horizon), что приводит к постоянному росту стоимости планирования. HWM не переписывает базовый путь обучения мировой модели, а добавляет иерархическую структуру планирования поверх уже существующей мировой модели с условиями по действиям, позволяя системе сначала организовать поэтапный путь, а затем обрабатывать локальные действия.

С технической точки зрения, V-JEPA 2 (https://ai.meta.com/research/vjepa/) больше ориентирован на представление мира и базовое предсказание, HWM — на долгосрочное планирование, а WAV (World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry, https://arxiv.org/abs/2604.01985) — на идентификацию и исправление искажений собственных предсказаний моделью. Эти три линии постепенно сходятся. Акцент исследований мировых моделей сместился с простого предсказания будущего на то, как превратить способность к предсказанию в исполнимые, исправимые, проверяемые системные возможности.

I. Почему долгосрочное управление остается узким местом для мировых моделей

Сложность долгосрочного управления легче понять на примере роботизированных задач. Возьмем, к примеру, манипуляцию манипулятором: взять чашку и положить ее в ящик — это не одно действие, а цепочка последовательных шагов. Система должна приблизиться к объекту, скорректировать позу, выполнить захват, переместиться к целевой позиции, а затем обработать ящик и размещение. Как только цепочка становится длинной, возникают две проблемы. Во-первых, ошибки предсказания накапливаются вдоль rollout'а, а во-вторых, пространство поиска действий быстро расширяется.

Системе обычно не хватает не локальной способности к предсказанию, а способности организовать удаленную цель в поэтапный путь. Многие действия локально кажутся отклонением от цели, но на самом деле являются необходимыми промежуточными шагами для ее достижения. Например, поднять руку перед захватом, немного отступить перед открытием ящика, чтобы скорректировать угол.

В демонстрационных задачах мировые модели уже могут давать связные предсказания. Но при входе в реальные сценарии управления производительность начинает падать, и проблемы всплывают. Давление исходит не только от самого представления, но и от того, что уровень планирования еще недостаточно зрелый.

II. Как HWM перестраивает процесс планирования

HWM разделяет изначально одноуровневый процесс планирования на два уровня. Верхний уровень отвечает за этапные направления в более длительных временных масштабах, нижний уровень — за локальное исполнение в более коротких временных масштабах. Модель планирует не в одном ритме, а одновременно в двух разных временных ритмах.

Одноуровневые методы при обработке длинных задач обычно требуют прямого поиска всей цепочки действий в пространстве низкоуровневых действий. Чем длиннее задача, тем выше стоимость поиска, и тем легче ошибки предсказания распространяются вдоль многошагового rollout'а. После разделения процесса в HWM, высокий уровень обрабатывает только выбор маршрута в более длительных временных масштабах, низкий уровень обрабатывает только выполнение текущего сегмента, и вся длинная задача разбивается на несколько более коротких, что снижает сложность планирования.

Здесь также есть ключевой дизайн: высокоуровневые действия — это не просто запись разницы между двумя состояниями, а использование кодировщика для сжатия последовательности низкоуровневых действий в представление действия более высокого уровня. Для длительных задач ключевым является не только разница между начальной и конечной точкой, но и то, как организованы промежуточные шаги. Если высокий уровень видит только разницу в перемещении, он легко теряет информацию о пути в этой цепочке действий.

HWM воплощает иерархический способ организации задач. Столкнувшись с многоэтапной работой, система больше не разворачивает все действия сразу, а сначала формирует грубый этапный путь, а затем выполняет и корректирует его по частям. После внедрения этих иерархических отношений в мировую модель, способность к предсказанию начинает стабильнее превращаться в способность к планированию.

III. От 0% до 70%. Что говорят результаты экспериментов

В задаче захвата и размещения в реальном мире, настроенной в статье, система получала только конечное целевое условие, без предоставления искусственно разбитых промежуточных целей. В таких условиях HWM достигла успеха в 70% случаев, в то время как одноуровневая мировая модель показала успех 0%. Изначально почти невыполнимая длительная задача после введения иерархического планирования стала с высокой вероятностью достижимым результатом.

В статье также тестировались задачи манипуляции с толканием объектов и навигации в лабиринте и другие симуляционные задачи. Результаты показали, что иерархическое планирование не только повысило成功率, но и снизило вычислительную стоимость этапа планирования. В некоторых средах вычислительная стоимость этапа планирования может быть сокращена до примерно четверти от исходной, при сохранении более высокой или сопоставимой успешности.

IV. От V-JEPA к HWM и к WAV

V-JEPA 2 представляет направление представления мира. V-JEPA 2 предобучался на более чем 1 миллионе часов интернет-видео, а затем, в сочетании с менее чем 62 часами видео с роботами, проходил post-training (целевое обучение после предобучения), чтобы получить latent action-conditioned world model (мировую модель, работающую в абстрактном пространстве представлений и делающую предсказания с учетом информации о действиях), пригодную для понимания, предсказания и планирования в физическом мире. Он демонстрирует, что модель может получить представление о мире через масштабное наблюдение и перенести это представление в планирование для роботов.

HWM находится на следующем шаге. Модель уже обладает представлением мира и базовой способностью к предсказанию, но как только дело доходит до многоэтапного управления, возникают проблемы накопления ошибок и расширения пространства поиска. HWM не меняет базовый путь обучения представлений, а добавляет структуру планирования с множественными временными масштабами поверх уже существующей мировой модели с условиями по действиям. Она решает проблему того, как модель организует удаленную цель в набор промежуточных шагов, а затем продвигается по ним по частям.

WAV further смещает фокус на верификацию. Чтобы войти в сценарии оптимизации политик и развертывания, мировая модель должна не только уметь предсказывать, но и обнаруживать, в каких областях она склонна к искажениям, и соответственно корректироваться. Она focuses на том, как модель проверяет себя.

V-JEPA ориентирован на представление мира, HWM — на планирование задач, WAV — на проверку результатов. Хотя их фокус разный, общее направление едино. Следующий этап для мировых моделей — это уже не только внутреннее предсказание, а постепенное соединение предсказания, планирования и верификации в единый набор системных возможностей.

V. От внутреннего предсказания к исполняемой системе

Многие предыдущие работы по мировым моделям были ближе к улучшению непрерывности предсказания будущих состояний или стабильности внутреннего представления мира. Но текущий акцент исследований начал меняться: система должна не только формировать суждение о среде, но и превращать это суждение в действие, а после получения результата продолжать корректировать следующий шаг. Чтобы приблизиться к реальному развертыванию, необходимо контролировать распространение ошибок в долгосрочных задачах, сжимать область поиска, снижать стоимость вывода.

Такие изменения также повлияют на AI agent. Многие агентные системы уже могут выполнять короткие задачи, такие как вызов инструментов, чтение файлов, выполнение инструкций из нескольких шагов. Но как только задача становится длинной, многоэтапной, требующей перепланирования на midway, производительность падает. Это не fundamentally отличается от сложностей в управлении роботами: везде недостаток способности к организации высокоуровневого пути приводит к разрыву между локальным исполнением и общей целью.

Иерархический подход, предлагаемый HWM — высокий уровень отвечает за путь и этапные цели, низкий уровень за локальные действия и обработку обратной связи, плюс наложение проверки результатов — такая иерархическая структура будет продолжать появляться в большем количестве систем в будущем. Следующий этап для мировых моделей также больше не будет focused только на предсказании будущего, а на организации предсказания, исполнения и коррекции в исполняемый путь.

Связанные с этим вопросы

QКаковы основные проблемы, с которыми сталкиваются мировые модели при выполнении длительных задач управления?

AОсновные проблемы включают накопление ошибок прогнозирования при длительном rollout и быстрое расширение пространства поиска действий с увеличением горизонта планирования. Это приводит к отклонению от цели и росту вычислительных затрат.

QКак HWM реструктурирует процесс планирования для преодоления ограничений длительного контроля?

AHWM разделяет планирование на два уровня: верхний уровень отвечает за этапные направления в более длительных временных масштабах, а нижний уровень обрабатывает локальное выполнение в коротких временных масштабах. Это снижает сложность планирования и уменьшает накопление ошибок.

QКакие результаты экспериментов демонстрируют эффективность HWM?

AВ экспериментах по захвату и размещению объектов в реальном мире HWM достиг успеха в 70% случаев, в то время как одноуровневая модель показала 0% успеха. Также наблюдалось снижение вычислительных затрат до одной четверти от исходных при сохранении высокой эффективности.

QКак соотносятся подходы V-JEPA 2, HWM и WAV в развитии мировых моделей?

AV-JEPA 2 фокусируется на обучении репрезентации мира, HWM — на многоуровневом планировании длительных задач, а WAV — на верификации и коррекции прогнозов. Эти три направления постепенно объединяются, формируя системные возможности прогнозирования, планирования и проверки.

QКакое влияние оказывает переход мировых моделей от прогнозирования к исполняемым системам?

AПереход позволяет моделям не только предсказывать будущее, но и преобразовывать прогнозы в действия, контролировать распространение ошибок, сокращать пространство поиска и снижать вычислительные затраты. Это особенно важно для многозадачных сценариев, таких как управление роботами и AI-агентами.

Похожее

Майкл Сэйлор заявил, что стало невозможно принять обновление биткойна, против которого он выступал!

Майкл Сэйлор заявил, что обновление Bitcoin BIP-110 математически не сможет достичь требуемого порога в 55% добровольной поддержки майнеров в текущем цикле сложности. По его данным, из 946 блоков, сгенерированных к моменту блока 960 561, лишь в 24 был зафиксирован сигнал поддержки этого предложения, и все они исходили от майнеров DATUM через пул OCEAN. Сэйлор подчеркнул, что отсутствие сигналов от остальных майнеров означает, что текущий уровень поддержки не отражает консенсуса. BIP-110 предлагает ограничить возможность добавления в блокчейн Bitcoin данных, не связанных с денежными переводами (например, изображений или текста), чтобы предотвратить «засорение» сети. Сэйлор выступает против, считая, что сеть не должна решать, какие транзакции являются «нужными», а правила не могут меняться по воле небольшой группы. Он также утверждает, что высокая статистика поддержки может быть искусственно завышена из-за автоматизированного процесса сигнализации в некотором программном обеспечении.

cryptonews.ru15 мин. назад

Майкл Сэйлор заявил, что стало невозможно принять обновление биткойна, против которого он выступал!

cryptonews.ru15 мин. назад

В рамках стратегии дивидендная доходность STRC сохраняется на уровне 12%, поскольку цена акций остается ниже номинальной стоимости

Исполнительный председатель Strategy Майкл Сэйлор подтвердил, что дивидендная ставка по бессрочным привилегированным акциям STRC сохранится на уровне 12% до августа 2026 года. Механизм «трещотки» повышает ставку на 0,5%, когда цена падает ниже $95, но не может её понизить при восстановлении цены, что призвано поддерживать стоимость акций на уровне номинала в $100. Несмотря на рекордную дивидендную доходность, акции STRC продолжают торговаться со скидкой около 10-11% от номинала, закрывшись 31 июля на отметке $89.46. Конкуренция с продуктами вроде SATA (13% доходность) и волатильность биткоина усложняют задачу. Устойчивый дисконт вынудил Strategy приостановить выпуск новых акций STRC, ограничив один из каналов финансирования закупок биткоина. Аналитики и юристы высказывают опасения по поводу долгосрочных рисков структуры «трещотки» и способности компании поддерживать выплаты при падении цены биткоина. Strategy создала финансовые резервы, покрывающие около 26 месяцев обязательств, и утвердила программу выкупа акций и монетизации биткоинов для управления рисками.

cryptonews.ru17 мин. назад

В рамках стратегии дивидендная доходность STRC сохраняется на уровне 12%, поскольку цена акций остается ниже номинальной стоимости

cryptonews.ru17 мин. назад

Аналитик: В августе курс биткоина упадет до 60 тыс. долларов, а затем восстановится до 70 тыс. долларов

Аналитик Андрей Порошин (Bitbanker) прогнозирует динамику биткоина на август. Он ожидает, что криптовалютный рынок переживёт спад из-за отсутствия макроэкономических стимулов. Решение ФРС США сохранить процентные ставки не дало рынку чётких сигналов, оставив инвесторов в состоянии осторожности. По базовому сценарию, биткоин в августе может упасть до уровня $60 000 – $62 000, после чего восстановится до $70 000. Этот уровень всё ещё ниже себестоимости майнинга в США, что вынуждает некоторых майнеров переходить в бизнес ИИ-центров обработки данных. В качестве положительного катализатора аналитик отмечает уход со рынка слабых игроков, например, сворачивание деятельности BitMEX, что традиционно снижает краткосрочное давление на цену. Геополитические факторы (эскалация конфликта Иран-США) и неопределённость вокруг закона CLARITY, по его мнению, не окажут существенного влияния на рынок в августе. Более активные ценовые колебания Порошин ожидает в сентябре в связи с новыми решениями ФРС и возможным движением по закону CLARITY Act.

cryptonews.ru17 мин. назад

Аналитик: В августе курс биткоина упадет до 60 тыс. долларов, а затем восстановится до 70 тыс. долларов

cryptonews.ru17 мин. назад

В результате взлома Coldcard, одного из крупнейших взломов биткоин-кошельков за последнее время, началась новая волна убытков! Убытки растут

В результате взлома Coldcard, одного из крупнейших взломов биткоин-кошельков за последнее время, произошла третья волна атак. Исследовательская компания Galaxy Research сообщает, что из кошельков, созданных на этих устройствах, было выведено еще 207,73 BTC. Общие потери теперь составляют около 1367 BTC (примерно 88,6 млн долларов США) по 4585 адресам. Первые две волны атак демонстрировали схожие черты, что указывало на одного злоумышленника. Однако третья волна отличается по методам: используются отдельные адреса для каждой жертвы, адреса P2WSH вместо P2WPKH, и атака нацелена на стандартный путь генерации. Это может означать либо модификацию инструментов первоначальным взломщиком, либо появление нового. Похищенные биткоины, общая стоимость которых оценивается в 88,6 млн долларов, пока не были потрачены злоумышленниками. Анализ показывает, что потери в основном пришлись на кошельки с небольшим балансом, что характерно для индивидуальных пользователей, а не институциональных сервисов. Уязвимое ПО Coldcard было выпущено 17 марта 2021 года, и все украденные средства были созданы после этой даты.

cryptonews.ru1 ч. назад

В результате взлома Coldcard, одного из крупнейших взломов биткоин-кошельков за последнее время, началась новая волна убытков! Убытки растут

cryptonews.ru1 ч. назад

Trump Media продаёт ещё 2628 BTC, запасы снижаются до 4261 BTC

Компания Trump Media & Technology Group (TMTG), стоящая за социальной сетью Truth Social, продолжает сокращать свои вложения в Bitcoin. По данным аналитической платформы Lookonchain, компания продала ещё 2628 BTC на сумму около 165 миллионов долларов через платформу Crypto.com. Это продолжение серии продаж, начавшихся семь месяцев назад. Всего за этот период TMTG продала 7281 BTC на общую сумму примерно 545 миллионов долларов по средней цене 74 855 долларов за монету. Первоначально компания приобрела 11542 BTC по средней цене 118 522 доллара. После последних транзакций её резервы сократились до 4261 BTC (около 269,8 миллиона долларов), что на 63% меньше изначальных холдингов. Эти продажи происходят на фоне усиленного внимания законодателей к криптовалютным интересам, связанным с Дональдом Трампом. В Конгрессе идут дебаты по закону CLARITY Act, который касается этических норм, владения цифровыми активами и потенциальных конфликтов интересов государственных лиц. Критики указывают на такие проекты, как мемкойны TRUMP и MELANIA, а также на токены World Liberty Financial, связывая политическое влияние с частными криптоинтересами.

cointelegraph1 ч. назад

Trump Media продаёт ещё 2628 BTC, запасы снижаются до 4261 BTC

cointelegraph1 ч. назад

Торговля

Спот
活动图片