Моделирование мира: от предсказания к планированию. HWM и вызовы долгосрочного управления

marsbitОпубликовано 2026-04-17Обновлено 2026-04-17

Введение

Модели мира, такие как V-JEPA 2, фокусируются на прогнозировании будущего, но сталкиваются с проблемами в длительных задачах управления: накопление ошибок и рост вычислительной сложности. HWM решает это через иерархическое планирование: верхний уровень определяет этапы, нижний — локальные действия. Это снижает ошибки и затраты, повышая успешность задач (например, с 0% до 70% в робототехнике). WAV добавляет проверку прогнозов. Тренд — переход от предсказания к исполняемым системам, объединяющим прогноз, планирование и коррекцию.

За последний год фокус исследований мировых моделей изначально был сосредоточен на обучении представлений и предсказании будущего. Модели сначала понимают мир, а затем внутренне проигрывают будущие состояния. Это направление уже дало ряд представительных результатов. V-JEPA 2 (Video Joint Embedding Predictive Architecture 2 — набор моделей мира для видео, выпущенный Meta в 2025 году), предобученный на более чем 1 миллионе часов интернет-видео в сочетании с небольшим количеством данных взаимодействия с роботами, продемонстрировал потенциал мировых моделей в понимании, предсказании и планировании для роботов с нулевым-shot обучением).

Но то, что модель умеет предсказывать, не означает, что она умеет справляться с длинными задачами. При столкновении с многоэтапным управлением система обычно сталкивается с двумя проблемами. Первая — ошибки предсказания накапливаются в ходе длинного rollout'а (многошагового проигрывания), что приводит к тому, что весь путь все больше отклоняется от цели. Вторая — пространство поиска действий быстро расширяется с ростом горизонта планирования (planning horizon), что приводит к постоянному росту стоимости планирования. HWM не переписывает базовый путь обучения мировой модели, а добавляет иерархическую структуру планирования поверх уже существующей мировой модели с условиями по действиям, позволяя системе сначала организовать поэтапный путь, а затем обрабатывать локальные действия.

С технической точки зрения, V-JEPA 2 (https://ai.meta.com/research/vjepa/) больше ориентирован на представление мира и базовое предсказание, HWM — на долгосрочное планирование, а WAV (World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry, https://arxiv.org/abs/2604.01985) — на идентификацию и исправление искажений собственных предсказаний моделью. Эти три линии постепенно сходятся. Акцент исследований мировых моделей сместился с простого предсказания будущего на то, как превратить способность к предсказанию в исполнимые, исправимые, проверяемые системные возможности.

I. Почему долгосрочное управление остается узким местом для мировых моделей

Сложность долгосрочного управления легче понять на примере роботизированных задач. Возьмем, к примеру, манипуляцию манипулятором: взять чашку и положить ее в ящик — это не одно действие, а цепочка последовательных шагов. Система должна приблизиться к объекту, скорректировать позу, выполнить захват, переместиться к целевой позиции, а затем обработать ящик и размещение. Как только цепочка становится длинной, возникают две проблемы. Во-первых, ошибки предсказания накапливаются вдоль rollout'а, а во-вторых, пространство поиска действий быстро расширяется.

Системе обычно не хватает не локальной способности к предсказанию, а способности организовать удаленную цель в поэтапный путь. Многие действия локально кажутся отклонением от цели, но на самом деле являются необходимыми промежуточными шагами для ее достижения. Например, поднять руку перед захватом, немного отступить перед открытием ящика, чтобы скорректировать угол.

В демонстрационных задачах мировые модели уже могут давать связные предсказания. Но при входе в реальные сценарии управления производительность начинает падать, и проблемы всплывают. Давление исходит не только от самого представления, но и от того, что уровень планирования еще недостаточно зрелый.

II. Как HWM перестраивает процесс планирования

HWM разделяет изначально одноуровневый процесс планирования на два уровня. Верхний уровень отвечает за этапные направления в более длительных временных масштабах, нижний уровень — за локальное исполнение в более коротких временных масштабах. Модель планирует не в одном ритме, а одновременно в двух разных временных ритмах.

Одноуровневые методы при обработке длинных задач обычно требуют прямого поиска всей цепочки действий в пространстве низкоуровневых действий. Чем длиннее задача, тем выше стоимость поиска, и тем легче ошибки предсказания распространяются вдоль многошагового rollout'а. После разделения процесса в HWM, высокий уровень обрабатывает только выбор маршрута в более длительных временных масштабах, низкий уровень обрабатывает только выполнение текущего сегмента, и вся длинная задача разбивается на несколько более коротких, что снижает сложность планирования.

Здесь также есть ключевой дизайн: высокоуровневые действия — это не просто запись разницы между двумя состояниями, а использование кодировщика для сжатия последовательности низкоуровневых действий в представление действия более высокого уровня. Для длительных задач ключевым является не только разница между начальной и конечной точкой, но и то, как организованы промежуточные шаги. Если высокий уровень видит только разницу в перемещении, он легко теряет информацию о пути в этой цепочке действий.

HWM воплощает иерархический способ организации задач. Столкнувшись с многоэтапной работой, система больше не разворачивает все действия сразу, а сначала формирует грубый этапный путь, а затем выполняет и корректирует его по частям. После внедрения этих иерархических отношений в мировую модель, способность к предсказанию начинает стабильнее превращаться в способность к планированию.

III. От 0% до 70%. Что говорят результаты экспериментов

В задаче захвата и размещения в реальном мире, настроенной в статье, система получала только конечное целевое условие, без предоставления искусственно разбитых промежуточных целей. В таких условиях HWM достигла успеха в 70% случаев, в то время как одноуровневая мировая модель показала успех 0%. Изначально почти невыполнимая длительная задача после введения иерархического планирования стала с высокой вероятностью достижимым результатом.

В статье также тестировались задачи манипуляции с толканием объектов и навигации в лабиринте и другие симуляционные задачи. Результаты показали, что иерархическое планирование не только повысило成功率, но и снизило вычислительную стоимость этапа планирования. В некоторых средах вычислительная стоимость этапа планирования может быть сокращена до примерно четверти от исходной, при сохранении более высокой или сопоставимой успешности.

IV. От V-JEPA к HWM и к WAV

V-JEPA 2 представляет направление представления мира. V-JEPA 2 предобучался на более чем 1 миллионе часов интернет-видео, а затем, в сочетании с менее чем 62 часами видео с роботами, проходил post-training (целевое обучение после предобучения), чтобы получить latent action-conditioned world model (мировую модель, работающую в абстрактном пространстве представлений и делающую предсказания с учетом информации о действиях), пригодную для понимания, предсказания и планирования в физическом мире. Он демонстрирует, что модель может получить представление о мире через масштабное наблюдение и перенести это представление в планирование для роботов.

HWM находится на следующем шаге. Модель уже обладает представлением мира и базовой способностью к предсказанию, но как только дело доходит до многоэтапного управления, возникают проблемы накопления ошибок и расширения пространства поиска. HWM не меняет базовый путь обучения представлений, а добавляет структуру планирования с множественными временными масштабами поверх уже существующей мировой модели с условиями по действиям. Она решает проблему того, как модель организует удаленную цель в набор промежуточных шагов, а затем продвигается по ним по частям.

WAV further смещает фокус на верификацию. Чтобы войти в сценарии оптимизации политик и развертывания, мировая модель должна не только уметь предсказывать, но и обнаруживать, в каких областях она склонна к искажениям, и соответственно корректироваться. Она focuses на том, как модель проверяет себя.

V-JEPA ориентирован на представление мира, HWM — на планирование задач, WAV — на проверку результатов. Хотя их фокус разный, общее направление едино. Следующий этап для мировых моделей — это уже не только внутреннее предсказание, а постепенное соединение предсказания, планирования и верификации в единый набор системных возможностей.

V. От внутреннего предсказания к исполняемой системе

Многие предыдущие работы по мировым моделям были ближе к улучшению непрерывности предсказания будущих состояний или стабильности внутреннего представления мира. Но текущий акцент исследований начал меняться: система должна не только формировать суждение о среде, но и превращать это суждение в действие, а после получения результата продолжать корректировать следующий шаг. Чтобы приблизиться к реальному развертыванию, необходимо контролировать распространение ошибок в долгосрочных задачах, сжимать область поиска, снижать стоимость вывода.

Такие изменения также повлияют на AI agent. Многие агентные системы уже могут выполнять короткие задачи, такие как вызов инструментов, чтение файлов, выполнение инструкций из нескольких шагов. Но как только задача становится длинной, многоэтапной, требующей перепланирования на midway, производительность падает. Это не fundamentally отличается от сложностей в управлении роботами: везде недостаток способности к организации высокоуровневого пути приводит к разрыву между локальным исполнением и общей целью.

Иерархический подход, предлагаемый HWM — высокий уровень отвечает за путь и этапные цели, низкий уровень за локальные действия и обработку обратной связи, плюс наложение проверки результатов — такая иерархическая структура будет продолжать появляться в большем количестве систем в будущем. Следующий этап для мировых моделей также больше не будет focused только на предсказании будущего, а на организации предсказания, исполнения и коррекции в исполняемый путь.

Связанные с этим вопросы

QКаковы основные проблемы, с которыми сталкиваются мировые модели при выполнении длительных задач управления?

AОсновные проблемы включают накопление ошибок прогнозирования при длительном rollout и быстрое расширение пространства поиска действий с увеличением горизонта планирования. Это приводит к отклонению от цели и росту вычислительных затрат.

QКак HWM реструктурирует процесс планирования для преодоления ограничений длительного контроля?

AHWM разделяет планирование на два уровня: верхний уровень отвечает за этапные направления в более длительных временных масштабах, а нижний уровень обрабатывает локальное выполнение в коротких временных масштабах. Это снижает сложность планирования и уменьшает накопление ошибок.

QКакие результаты экспериментов демонстрируют эффективность HWM?

AВ экспериментах по захвату и размещению объектов в реальном мире HWM достиг успеха в 70% случаев, в то время как одноуровневая модель показала 0% успеха. Также наблюдалось снижение вычислительных затрат до одной четверти от исходных при сохранении высокой эффективности.

QКак соотносятся подходы V-JEPA 2, HWM и WAV в развитии мировых моделей?

AV-JEPA 2 фокусируется на обучении репрезентации мира, HWM — на многоуровневом планировании длительных задач, а WAV — на верификации и коррекции прогнозов. Эти три направления постепенно объединяются, формируя системные возможности прогнозирования, планирования и проверки.

QКакое влияние оказывает переход мировых моделей от прогнозирования к исполняемым системам?

AПереход позволяет моделям не только предсказывать будущее, но и преобразовывать прогнозы в действия, контролировать распространение ошибок, сокращать пространство поиска и снижать вычислительные затраты. Это особенно важно для многозадачных сценариев, таких как управление роботами и AI-агентами.

Похожее

От золота к биткойну: фиксированное предложение + институциональная лихорадка — повторится ли история «взрывного» роста цен?

Аналитики проводят параллели между биткоином и золотом, отмечая схожие черты: фиксированное предложение, статус негенерирующих доход активов-убежищ и зависимость цены от настроений инвесторов. Эксперт Bloomberg Intelligence Эрик Бальчунас указывает, что история золотых ETF за 22 года может служить дорожной картой для биткоин-ETF. После запуска в 2004 году золотые ETF пережили взлёты, болезненные коррекции и долгое восстановление, но каждый цикл устанавливал новые максимумы. Биткоин-ETF, одобренные в 2024 году, стали одними из самых быстрорастущих в истории, открыв криптоактив для институциональных инвесторов. Однако это привело к повышенной волатильности: крупные оттоки средств из ETF, как у BlackRock IBIT, могут оказывать значительное давление на рынок. Несмотря на падение цены более чем на 50% с октября 2025 года, многие остаются оптимистичны в долгосрочной перспективе, видя в биткоине "цифровое золото". Устойчивый институциональный спрос на ETF и растущее включение биткоина в инвестиционные портфели компаний помогают смягчать продажи. Если биткоин сможет занять даже небольшую часть рыночной капитализации золота (около $28 трлн), это откроет огромный потенциал для роста. Путь, вероятно, будет сопряжён с высокой волатильностью, но фиксированное предложение в сочетании с волнами институционального спроса может вновь привести к взрывному росту цены.

Foresight News4 мин. назад

От золота к биткойну: фиксированное предложение + институциональная лихорадка — повторится ли история «взрывного» роста цен?

Foresight News4 мин. назад

Почему AI-агенты для покупок не так широко распространены?

**Почему AI-агенты для покупок не получили широкого распространения?** Идея о том, что AI-агент с кошельком может полностью заменить человека в совершении покупок, кажется простой, но содержит логические изъяны. Она смешивает два ключевых аспекта шопинга: **информационный поиск** (сбор, фильтрация, сравнение) и **ценностную оценку** (субъективное суждение о качестве, уместности, доверии к продавцу). Машинный поиск данных успешно автоматизируется. Однако ценностная оценка, особенно **определение потребностей** (что важно для меня и почему), остается прерогативой человека. Исследования показывают, что предпочтения нестабильны и формируются в процессе выбора, поэтому взаимодействие с AI должно быть итеративным, а не разовым. Критическое разграничение — является ли сам процесс выбора **рутиной или удовольствием**. * **Стандартные товары** (бумага, батарейки): выбор не имеет ценности, идеальны для полной автоматизации. * **Товары для удовольствия** (вино, книги, одежда): сам выбор — часть наслаждения. Здесь AI должен выступать как помощник, сужая опции для финального решения человека. Схема **«дать AI кошелек»** решает лишь самую простую проблему — проведение платежа, и только в сценарии, где AI обладает полной автономией. Отраслевые решения (Stripe, Mastercard, Google, Visa) уже разделяют **авторизацию** и **хранение средств**, предоставляя AI ограниченные, одноразовые платежные токены, а не полный контроль над кошельком. Истинные сценарии для автономных AI-кошельков лежат не в розничной торговле, а в **B2B-закупках** и **межмашинных расчетах (M2M)**, где процессы стандартизированы, а решения лишены субъективизма. Таким образом, главными препятствиями для повсеместного внедрения AI2C-покупок являются не технологии платежей, а: 1. **Недостаток достоверных данных** (фальшивые отзывы, поддельные товары), без которых любая автоматизация опасна. 2. **Принципиальная невозможность автоматизировать определение человеческих потребностей и ценностей**. Итог: будущее AI в шопинге — не в полном замещении, а в усилении. AI должен взять на себя утомительный поиск и анализ, оставляя человеку ключевые права: **определять критерии выбора** и **получать удовольствие от самого акта выбора**. Платформам следует сосредоточиться на улучшении именно этого опыта.

Foresight News1 ч. назад

Почему AI-агенты для покупок не так широко распространены?

Foresight News1 ч. назад

После девяти месяцев шортинга полный переход в лонг: известный трейдер открывает позицию по биткоину около 64 000 долларов, расхождения между быками и медведями на крипторынке усиливаются

Популярный трейдер Doctor Profit закрыл все короткие позиции по биткойну после девяти месяцев успешного шортинга и начал покупать на уровне около $64 000, заявив, что фундаментальные изменения — такие как возможное принятие закона CLARITY и институциональный спрос — могут привести к досрочному достижению дна рыночного цикла. Тем временем, аналитик on-chain gumsays отмечает, что бычье расхождение на недельном графике биткойна длится уже 147 дней, что близко к 161 дню перед минимумом 2022 года. Однако исследователь циклов Джейк Пахор указывает, что три ключевых условия для рыночного дна, наблюдавшихся с 2014 года, пока не выполнены: с момента пика октября 2025 года прошло лишь 9 месяцев (вместо типичных 12), индекс страха CSH ни разу не опускался ниже 20, а цена не пробивала реализованную цену (~$53 000). Рынок разделён: одни считают, что институциональный спрос через ETF и регулирование изменили правила игры, другие ждут классических сигналов капитуляции. Стратегия Пахора отражает этот раскол — он продолжает периодические покупки, но сохраняет крупный капитал для более низких цен, если историческая модель повторится.

marsbit1 ч. назад

После девяти месяцев шортинга полный переход в лонг: известный трейдер открывает позицию по биткоину около 64 000 долларов, расхождения между быками и медведями на крипторынке усиливаются

marsbit1 ч. назад

Опытный трейдер рассказывает: Как торговать на ошибочных ожиданиях рынка?

Опытный трейдер делится историей успешной сделки, построенной на торговле против ошибочных рыночных ожиданий. В основе его метода — анализ не самих данных (например, слабого CPI), а того, как рынок *ожидает*, что эти данные повлияют на цены, и проверка, остаётся ли этот механизм влияния (функция реакции) в силе. На примере сделки с Nasdaq (NQ) он показывает: после слабых данных CPI рынок ожидал общего снижения ставок и роста акций, особенно технологических. Однако долгосрочные реальные ставки (10-30 лет) достигли многолетних максимумов, отказавшись подтверждать этот сценарий. Это означало, что «дешёвых» долгосрочных денег для роста дорогих tech-акций не будет. Рост NQ на фоне слабого CPI стал ошибочным定价ованием. Трейдер выявил несоответствие: рынок предполагал цепочку «слабый CPI → смягчение политики → падение долгосрочных ставок → рост оценки NQ», но ключевое звено (падение долгосрочных ставок) не сработало. Это создало возможность для short-позиций по NQ, наиболее уязвимому к дорогим долгосрочным деньгам индексу. В статье изложена структура для поиска подобных возможностей: 1. Определить текущую рыночную причинно-следственную цепочку. 2. Найти в ней ключевую переменную с «правом вето». 3. Проверить, отказывается ли эта переменная подтверждать цепочку. 4. Дождаться, пока цена по инерции продолжит двигаться по старому сценарию. 5. Выбрать наиболее чистый актив для выражения этой ошибки. 6. Заранее определить условия для выхода (опровержение гипотезы или реализация логики). Главный вывод: альфа часто возникает не из-за информпреимущества, а из-за разницы в функциях реакции. Когда макрорежим меняется, рынок может по привычке реагировать на данные по-старому, создавая ошибку в цене. Ключевой вопрос: «На какую причинно-следственную цепочку опирается первая рыночная реакция, и остаётся ли она справедливой сегодня?».

marsbit1 ч. назад

Опытный трейдер рассказывает: Как торговать на ошибочных ожиданиях рынка?

marsbit1 ч. назад

Торговля

Спот
活动图片