Моделирование мира: от предсказания к планированию. HWM и вызовы долгосрочного управления

marsbitОпубликовано 2026-04-17Обновлено 2026-04-17

Введение

Модели мира, такие как V-JEPA 2, фокусируются на прогнозировании будущего, но сталкиваются с проблемами в длительных задачах управления: накопление ошибок и рост вычислительной сложности. HWM решает это через иерархическое планирование: верхний уровень определяет этапы, нижний — локальные действия. Это снижает ошибки и затраты, повышая успешность задач (например, с 0% до 70% в робототехнике). WAV добавляет проверку прогнозов. Тренд — переход от предсказания к исполняемым системам, объединяющим прогноз, планирование и коррекцию.

За последний год фокус исследований мировых моделей изначально был сосредоточен на обучении представлений и предсказании будущего. Модели сначала понимают мир, а затем внутренне проигрывают будущие состояния. Это направление уже дало ряд представительных результатов. V-JEPA 2 (Video Joint Embedding Predictive Architecture 2 — набор моделей мира для видео, выпущенный Meta в 2025 году), предобученный на более чем 1 миллионе часов интернет-видео в сочетании с небольшим количеством данных взаимодействия с роботами, продемонстрировал потенциал мировых моделей в понимании, предсказании и планировании для роботов с нулевым-shot обучением).

Но то, что модель умеет предсказывать, не означает, что она умеет справляться с длинными задачами. При столкновении с многоэтапным управлением система обычно сталкивается с двумя проблемами. Первая — ошибки предсказания накапливаются в ходе длинного rollout'а (многошагового проигрывания), что приводит к тому, что весь путь все больше отклоняется от цели. Вторая — пространство поиска действий быстро расширяется с ростом горизонта планирования (planning horizon), что приводит к постоянному росту стоимости планирования. HWM не переписывает базовый путь обучения мировой модели, а добавляет иерархическую структуру планирования поверх уже существующей мировой модели с условиями по действиям, позволяя системе сначала организовать поэтапный путь, а затем обрабатывать локальные действия.

С технической точки зрения, V-JEPA 2 (https://ai.meta.com/research/vjepa/) больше ориентирован на представление мира и базовое предсказание, HWM — на долгосрочное планирование, а WAV (World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry, https://arxiv.org/abs/2604.01985) — на идентификацию и исправление искажений собственных предсказаний моделью. Эти три линии постепенно сходятся. Акцент исследований мировых моделей сместился с простого предсказания будущего на то, как превратить способность к предсказанию в исполнимые, исправимые, проверяемые системные возможности.

I. Почему долгосрочное управление остается узким местом для мировых моделей

Сложность долгосрочного управления легче понять на примере роботизированных задач. Возьмем, к примеру, манипуляцию манипулятором: взять чашку и положить ее в ящик — это не одно действие, а цепочка последовательных шагов. Система должна приблизиться к объекту, скорректировать позу, выполнить захват, переместиться к целевой позиции, а затем обработать ящик и размещение. Как только цепочка становится длинной, возникают две проблемы. Во-первых, ошибки предсказания накапливаются вдоль rollout'а, а во-вторых, пространство поиска действий быстро расширяется.

Системе обычно не хватает не локальной способности к предсказанию, а способности организовать удаленную цель в поэтапный путь. Многие действия локально кажутся отклонением от цели, но на самом деле являются необходимыми промежуточными шагами для ее достижения. Например, поднять руку перед захватом, немного отступить перед открытием ящика, чтобы скорректировать угол.

В демонстрационных задачах мировые модели уже могут давать связные предсказания. Но при входе в реальные сценарии управления производительность начинает падать, и проблемы всплывают. Давление исходит не только от самого представления, но и от того, что уровень планирования еще недостаточно зрелый.

II. Как HWM перестраивает процесс планирования

HWM разделяет изначально одноуровневый процесс планирования на два уровня. Верхний уровень отвечает за этапные направления в более длительных временных масштабах, нижний уровень — за локальное исполнение в более коротких временных масштабах. Модель планирует не в одном ритме, а одновременно в двух разных временных ритмах.

Одноуровневые методы при обработке длинных задач обычно требуют прямого поиска всей цепочки действий в пространстве низкоуровневых действий. Чем длиннее задача, тем выше стоимость поиска, и тем легче ошибки предсказания распространяются вдоль многошагового rollout'а. После разделения процесса в HWM, высокий уровень обрабатывает только выбор маршрута в более длительных временных масштабах, низкий уровень обрабатывает только выполнение текущего сегмента, и вся длинная задача разбивается на несколько более коротких, что снижает сложность планирования.

Здесь также есть ключевой дизайн: высокоуровневые действия — это не просто запись разницы между двумя состояниями, а использование кодировщика для сжатия последовательности низкоуровневых действий в представление действия более высокого уровня. Для длительных задач ключевым является не только разница между начальной и конечной точкой, но и то, как организованы промежуточные шаги. Если высокий уровень видит только разницу в перемещении, он легко теряет информацию о пути в этой цепочке действий.

HWM воплощает иерархический способ организации задач. Столкнувшись с многоэтапной работой, система больше не разворачивает все действия сразу, а сначала формирует грубый этапный путь, а затем выполняет и корректирует его по частям. После внедрения этих иерархических отношений в мировую модель, способность к предсказанию начинает стабильнее превращаться в способность к планированию.

III. От 0% до 70%. Что говорят результаты экспериментов

В задаче захвата и размещения в реальном мире, настроенной в статье, система получала только конечное целевое условие, без предоставления искусственно разбитых промежуточных целей. В таких условиях HWM достигла успеха в 70% случаев, в то время как одноуровневая мировая модель показала успех 0%. Изначально почти невыполнимая длительная задача после введения иерархического планирования стала с высокой вероятностью достижимым результатом.

В статье также тестировались задачи манипуляции с толканием объектов и навигации в лабиринте и другие симуляционные задачи. Результаты показали, что иерархическое планирование не только повысило成功率, но и снизило вычислительную стоимость этапа планирования. В некоторых средах вычислительная стоимость этапа планирования может быть сокращена до примерно четверти от исходной, при сохранении более высокой или сопоставимой успешности.

IV. От V-JEPA к HWM и к WAV

V-JEPA 2 представляет направление представления мира. V-JEPA 2 предобучался на более чем 1 миллионе часов интернет-видео, а затем, в сочетании с менее чем 62 часами видео с роботами, проходил post-training (целевое обучение после предобучения), чтобы получить latent action-conditioned world model (мировую модель, работающую в абстрактном пространстве представлений и делающую предсказания с учетом информации о действиях), пригодную для понимания, предсказания и планирования в физическом мире. Он демонстрирует, что модель может получить представление о мире через масштабное наблюдение и перенести это представление в планирование для роботов.

HWM находится на следующем шаге. Модель уже обладает представлением мира и базовой способностью к предсказанию, но как только дело доходит до многоэтапного управления, возникают проблемы накопления ошибок и расширения пространства поиска. HWM не меняет базовый путь обучения представлений, а добавляет структуру планирования с множественными временными масштабами поверх уже существующей мировой модели с условиями по действиям. Она решает проблему того, как модель организует удаленную цель в набор промежуточных шагов, а затем продвигается по ним по частям.

WAV further смещает фокус на верификацию. Чтобы войти в сценарии оптимизации политик и развертывания, мировая модель должна не только уметь предсказывать, но и обнаруживать, в каких областях она склонна к искажениям, и соответственно корректироваться. Она focuses на том, как модель проверяет себя.

V-JEPA ориентирован на представление мира, HWM — на планирование задач, WAV — на проверку результатов. Хотя их фокус разный, общее направление едино. Следующий этап для мировых моделей — это уже не только внутреннее предсказание, а постепенное соединение предсказания, планирования и верификации в единый набор системных возможностей.

V. От внутреннего предсказания к исполняемой системе

Многие предыдущие работы по мировым моделям были ближе к улучшению непрерывности предсказания будущих состояний или стабильности внутреннего представления мира. Но текущий акцент исследований начал меняться: система должна не только формировать суждение о среде, но и превращать это суждение в действие, а после получения результата продолжать корректировать следующий шаг. Чтобы приблизиться к реальному развертыванию, необходимо контролировать распространение ошибок в долгосрочных задачах, сжимать область поиска, снижать стоимость вывода.

Такие изменения также повлияют на AI agent. Многие агентные системы уже могут выполнять короткие задачи, такие как вызов инструментов, чтение файлов, выполнение инструкций из нескольких шагов. Но как только задача становится длинной, многоэтапной, требующей перепланирования на midway, производительность падает. Это не fundamentally отличается от сложностей в управлении роботами: везде недостаток способности к организации высокоуровневого пути приводит к разрыву между локальным исполнением и общей целью.

Иерархический подход, предлагаемый HWM — высокий уровень отвечает за путь и этапные цели, низкий уровень за локальные действия и обработку обратной связи, плюс наложение проверки результатов — такая иерархическая структура будет продолжать появляться в большем количестве систем в будущем. Следующий этап для мировых моделей также больше не будет focused только на предсказании будущего, а на организации предсказания, исполнения и коррекции в исполняемый путь.

Связанные с этим вопросы

QКаковы основные проблемы, с которыми сталкиваются мировые модели при выполнении длительных задач управления?

AОсновные проблемы включают накопление ошибок прогнозирования при длительном rollout и быстрое расширение пространства поиска действий с увеличением горизонта планирования. Это приводит к отклонению от цели и росту вычислительных затрат.

QКак HWM реструктурирует процесс планирования для преодоления ограничений длительного контроля?

AHWM разделяет планирование на два уровня: верхний уровень отвечает за этапные направления в более длительных временных масштабах, а нижний уровень обрабатывает локальное выполнение в коротких временных масштабах. Это снижает сложность планирования и уменьшает накопление ошибок.

QКакие результаты экспериментов демонстрируют эффективность HWM?

AВ экспериментах по захвату и размещению объектов в реальном мире HWM достиг успеха в 70% случаев, в то время как одноуровневая модель показала 0% успеха. Также наблюдалось снижение вычислительных затрат до одной четверти от исходных при сохранении высокой эффективности.

QКак соотносятся подходы V-JEPA 2, HWM и WAV в развитии мировых моделей?

AV-JEPA 2 фокусируется на обучении репрезентации мира, HWM — на многоуровневом планировании длительных задач, а WAV — на верификации и коррекции прогнозов. Эти три направления постепенно объединяются, формируя системные возможности прогнозирования, планирования и проверки.

QКакое влияние оказывает переход мировых моделей от прогнозирования к исполняемым системам?

AПереход позволяет моделям не только предсказывать будущее, но и преобразовывать прогнозы в действия, контролировать распространение ошибок, сокращать пространство поиска и снижать вычислительные затраты. Это особенно важно для многозадачных сценариев, таких как управление роботами и AI-агентами.

Похожее

Эксплойт Coldcard вызывает исход биткойнов, «бычья» консолидация крипторынка: Дайджест Ходлера, 2 августа

После утечки средств из кошельков Coldcard на сумму около $90 млн в биткойнах, мелкие держатели стали активно переводить средства на централизованные биржи. Объём переводов менее 1 BTC достиг максимума с 2022 года. По данным Galaxy Research, в результате трёх волн атак было скомпрометировано более 4500 адресов. Эксплойт использовал уязвимость в процессе генерации сида кошелька. В США обсуждение "Закона о ясности" (Clarity Act) зашло в тупик из-за разногласий по этическим нормам для политиков и регулированию стейблкоинов. Вероятность принятия закона до истечения срока крайне мала. Отчётность компаний за второй квартал показала снижение доходов: Coinbase сообщила о чистых убытках, а доход Robinhood от криптовалютных операций упал на 38%. При этом аналитик ARK Invest заявил, что индустрия вступает в фазу крупнейшей консолидации, что, по его мнению, является бычьим сигналом. Чемпионат мира по футболу 2026 года принёс $20 млрд объёма на блокчейн-рынках прогнозов. За неделю Bitcoin и Ether потеряли около 3% стоимости. Среди альткоинов лучше всего себя показали Cardano (ADA) и Uniswap (UNI). Аналитики Grayscale предположили, что дно рынка Bitcoin, возможно, уже достигнуто раньше традиционного четырёхлетнего цикла. В разделе FUD: основатель Telegram Павел Дуров объявлен в розыск в России, платформа Pump.fun уволила сотрудников перед получением ими токенов на миллионы долларов, а сотрудник Белого дома покинул пост на фоне обвинений в использовании инсайдерской информации для ставок на прогнозных рынках.

cointelegraph6 мин. назад

Эксплойт Coldcard вызывает исход биткойнов, «бычья» консолидация крипторынка: Дайджест Ходлера, 2 августа

cointelegraph6 мин. назад

ПОСЛЕДНИЕ НОВОСТИ: Дональд Трамп сделал резкое заявление по поводу Ирана! Он остановил атаки

Президент США Дональд Трамп заявил о приостановке запланированных масштабных военных действий против Ирана. Это решение было принято после обращения к нему Саудовской Аравии, ОАЭ, Катара и самого Ирана с просьбой предоставить время для дипломатических переговоров. Союзники в регионе полагают, что соглашение близко. Первоначальный этап переговоров будет сосредоточен на вопросах безопасности и возобновлении нормальной работы Ормузского пролива — ключевого маршрута для мировой нефтеторговли, чья безопасность критически важна для глобальных цен на энергоносители. После решения этих вопросов планируется начать переговоры по иранской ядерной программе. Новый раунд переговоров с Ираном начнётся завтра. В своём выступлении Трамп также коснулся темы валютного рынка, заявив, что США вмешались в поддержку японской иены, подчеркнув крепкие союзнические и взаимовыгодные экономические отношения с Японией.

cryptonews.ru1 ч. назад

ПОСЛЕДНИЕ НОВОСТИ: Дональд Трамп сделал резкое заявление по поводу Ирана! Он остановил атаки

cryptonews.ru1 ч. назад

Банк Италии не увидел системных преимуществ стейблкоинов в переводах

Исследование Банка Италии показало, что стейблкоины (на примере USDC) не демонстрируют устойчивых системных преимуществ в стоимости и скорости международных денежных переводов по сравнению с традиционными сервисами. Анализ транзакций на 200 USDC в 10 платежных коридорах (Италия — Бразилия, Аргентина, Япония, ОАЭ, ЮАР и др.) выявил, что финальная стоимость переводов варьировалась от 0,3% до почти 9%. Сроки исполнения колебались от менее 20 минут в коридорах с инфраструктурой мгновенных платежей до 1-2 рабочих дней в ее отсутствие. Ключевые издержки и задержки связаны не с комиссиями блокчейна, а с процессами конвертации в фиатные валюты и работой локальных платежных систем. Хотя в большинстве изучных направлений стоимость переводов со стейблкоинами была ниже среднемирового показателя в 6,65%, по сравнению с сервисом Wise преимущество наблюдалось только в трех из семи сопоставимых случаев. Авторы отмечают, что преимущества стейблкоинов могли бы быть более заметны, если бы их можно было напрямую тратить без конвертации. Также подчеркивается, что запретительное регулирование не устраняет спрос на стейблкоины, а излишне жесткие правила лишь усложняют их использование для розничных клиентов. В контексте исследования упоминается значительное снижение общей капитализации рынка стейблкоинов в июле.

cryptonews.ru2 ч. назад

Банк Италии не увидел системных преимуществ стейблкоинов в переводах

cryptonews.ru2 ч. назад

«Биткойн-бум» в разгаре: новое заявление Сэйлора вызвало спекуляции о покупках

Исполнительный председатель MicroStrategy Майкл Сэйлор 2 августа опубликовал сообщение «Bitcoin Drive engaged», что вызвало спекуляции о новой покупке биткойнов компанией. Его отчет показал, что резерв MicroStrategy составляет 843 775 BTC стоимостью около $53,25 млрд, со средней себестоимостью $75 653 и нереализованным убытком в $10,58 млрд. Ранее аналогичный сигнал предшествовал объявлению о пополнении долларового резерва. В то же время, реестр компании отразил две недавние продажи на общую сумму 3 588 BTC, сократив запасы. Эти продажи, согласно документам SEC, были проведены для финансирования выплат по привилегированным акциям. Неделей ранее компания не покупала биткойны, увеличив свой долларовый резерв примерно до $3,75 млрд. Финансовые риски остаются высокими после отчетности об операционном убытке в $8,33 млрд за второй квартал 2026 года. Ожидается, что обновление данных в понедельник покажет, означает ли сообщение Сэйлора возврат к накоплению биткойнов, поскольку компания балансирует между своими крупными запасами криптовалюты и растущими денежными обязательствами.

cryptonews.ru2 ч. назад

«Биткойн-бум» в разгаре: новое заявление Сэйлора вызвало спекуляции о покупках

cryptonews.ru2 ч. назад

Паттерн на графике биткоина «голоса и плечи» сулит подъём к $67,200

Несмотря на медленное снижение в начале августа, на графике биткоина формируется перевёрнутая разворотная модель «голова и плечи». Цена $BTC колеблется около $63,200, формируя правое плечо, что является основным поводом для краткосрочного оптимизма. Ключевой вопрос — хватит ли покупателям сил для рывка к уровню $67,200 для подтверждения разворота. В то же время в паре ETH/BTC уже пробито разворотное дно. Ethereum демонстрирует относительную силу, закрепился в восходящем тренде и движется к цели 0,0312, а против доллара тестирует уровень $1875, открывая путь к $2163. Эта ротация капитала в пользу ETH лишает биткоин объёма, необходимого для быстрого роста. Таким образом, ситуация для биткоина остаётся напряжённой: либо он в ближайшие дни последует примеру Ethereum и осуществит быстрый рост выше $67,200, либо, если атака на «шею» паттерна не состоится, медведи возьмут контроль и отправят цену к уровням поддержки $60,000 и $58,000.

cryptonews.ru2 ч. назад

Паттерн на графике биткоина «голоса и плечи» сулит подъём к $67,200

cryptonews.ru2 ч. назад

Торговля

Спот
活动图片