Моделирование мира: от предсказания к планированию. HWM и вызовы долгосрочного управления

marsbitОпубликовано 2026-04-17Обновлено 2026-04-17

Введение

Модели мира, такие как V-JEPA 2, фокусируются на прогнозировании будущего, но сталкиваются с проблемами в длительных задачах управления: накопление ошибок и рост вычислительной сложности. HWM решает это через иерархическое планирование: верхний уровень определяет этапы, нижний — локальные действия. Это снижает ошибки и затраты, повышая успешность задач (например, с 0% до 70% в робототехнике). WAV добавляет проверку прогнозов. Тренд — переход от предсказания к исполняемым системам, объединяющим прогноз, планирование и коррекцию.

За последний год фокус исследований мировых моделей изначально был сосредоточен на обучении представлений и предсказании будущего. Модели сначала понимают мир, а затем внутренне проигрывают будущие состояния. Это направление уже дало ряд представительных результатов. V-JEPA 2 (Video Joint Embedding Predictive Architecture 2 — набор моделей мира для видео, выпущенный Meta в 2025 году), предобученный на более чем 1 миллионе часов интернет-видео в сочетании с небольшим количеством данных взаимодействия с роботами, продемонстрировал потенциал мировых моделей в понимании, предсказании и планировании для роботов с нулевым-shot обучением).

Но то, что модель умеет предсказывать, не означает, что она умеет справляться с длинными задачами. При столкновении с многоэтапным управлением система обычно сталкивается с двумя проблемами. Первая — ошибки предсказания накапливаются в ходе длинного rollout'а (многошагового проигрывания), что приводит к тому, что весь путь все больше отклоняется от цели. Вторая — пространство поиска действий быстро расширяется с ростом горизонта планирования (planning horizon), что приводит к постоянному росту стоимости планирования. HWM не переписывает базовый путь обучения мировой модели, а добавляет иерархическую структуру планирования поверх уже существующей мировой модели с условиями по действиям, позволяя системе сначала организовать поэтапный путь, а затем обрабатывать локальные действия.

С технической точки зрения, V-JEPA 2 (https://ai.meta.com/research/vjepa/) больше ориентирован на представление мира и базовое предсказание, HWM — на долгосрочное планирование, а WAV (World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry, https://arxiv.org/abs/2604.01985) — на идентификацию и исправление искажений собственных предсказаний моделью. Эти три линии постепенно сходятся. Акцент исследований мировых моделей сместился с простого предсказания будущего на то, как превратить способность к предсказанию в исполнимые, исправимые, проверяемые системные возможности.

I. Почему долгосрочное управление остается узким местом для мировых моделей

Сложность долгосрочного управления легче понять на примере роботизированных задач. Возьмем, к примеру, манипуляцию манипулятором: взять чашку и положить ее в ящик — это не одно действие, а цепочка последовательных шагов. Система должна приблизиться к объекту, скорректировать позу, выполнить захват, переместиться к целевой позиции, а затем обработать ящик и размещение. Как только цепочка становится длинной, возникают две проблемы. Во-первых, ошибки предсказания накапливаются вдоль rollout'а, а во-вторых, пространство поиска действий быстро расширяется.

Системе обычно не хватает не локальной способности к предсказанию, а способности организовать удаленную цель в поэтапный путь. Многие действия локально кажутся отклонением от цели, но на самом деле являются необходимыми промежуточными шагами для ее достижения. Например, поднять руку перед захватом, немного отступить перед открытием ящика, чтобы скорректировать угол.

В демонстрационных задачах мировые модели уже могут давать связные предсказания. Но при входе в реальные сценарии управления производительность начинает падать, и проблемы всплывают. Давление исходит не только от самого представления, но и от того, что уровень планирования еще недостаточно зрелый.

II. Как HWM перестраивает процесс планирования

HWM разделяет изначально одноуровневый процесс планирования на два уровня. Верхний уровень отвечает за этапные направления в более длительных временных масштабах, нижний уровень — за локальное исполнение в более коротких временных масштабах. Модель планирует не в одном ритме, а одновременно в двух разных временных ритмах.

Одноуровневые методы при обработке длинных задач обычно требуют прямого поиска всей цепочки действий в пространстве низкоуровневых действий. Чем длиннее задача, тем выше стоимость поиска, и тем легче ошибки предсказания распространяются вдоль многошагового rollout'а. После разделения процесса в HWM, высокий уровень обрабатывает только выбор маршрута в более длительных временных масштабах, низкий уровень обрабатывает только выполнение текущего сегмента, и вся длинная задача разбивается на несколько более коротких, что снижает сложность планирования.

Здесь также есть ключевой дизайн: высокоуровневые действия — это не просто запись разницы между двумя состояниями, а использование кодировщика для сжатия последовательности низкоуровневых действий в представление действия более высокого уровня. Для длительных задач ключевым является не только разница между начальной и конечной точкой, но и то, как организованы промежуточные шаги. Если высокий уровень видит только разницу в перемещении, он легко теряет информацию о пути в этой цепочке действий.

HWM воплощает иерархический способ организации задач. Столкнувшись с многоэтапной работой, система больше не разворачивает все действия сразу, а сначала формирует грубый этапный путь, а затем выполняет и корректирует его по частям. После внедрения этих иерархических отношений в мировую модель, способность к предсказанию начинает стабильнее превращаться в способность к планированию.

III. От 0% до 70%. Что говорят результаты экспериментов

В задаче захвата и размещения в реальном мире, настроенной в статье, система получала только конечное целевое условие, без предоставления искусственно разбитых промежуточных целей. В таких условиях HWM достигла успеха в 70% случаев, в то время как одноуровневая мировая модель показала успех 0%. Изначально почти невыполнимая длительная задача после введения иерархического планирования стала с высокой вероятностью достижимым результатом.

В статье также тестировались задачи манипуляции с толканием объектов и навигации в лабиринте и другие симуляционные задачи. Результаты показали, что иерархическое планирование не только повысило成功率, но и снизило вычислительную стоимость этапа планирования. В некоторых средах вычислительная стоимость этапа планирования может быть сокращена до примерно четверти от исходной, при сохранении более высокой или сопоставимой успешности.

IV. От V-JEPA к HWM и к WAV

V-JEPA 2 представляет направление представления мира. V-JEPA 2 предобучался на более чем 1 миллионе часов интернет-видео, а затем, в сочетании с менее чем 62 часами видео с роботами, проходил post-training (целевое обучение после предобучения), чтобы получить latent action-conditioned world model (мировую модель, работающую в абстрактном пространстве представлений и делающую предсказания с учетом информации о действиях), пригодную для понимания, предсказания и планирования в физическом мире. Он демонстрирует, что модель может получить представление о мире через масштабное наблюдение и перенести это представление в планирование для роботов.

HWM находится на следующем шаге. Модель уже обладает представлением мира и базовой способностью к предсказанию, но как только дело доходит до многоэтапного управления, возникают проблемы накопления ошибок и расширения пространства поиска. HWM не меняет базовый путь обучения представлений, а добавляет структуру планирования с множественными временными масштабами поверх уже существующей мировой модели с условиями по действиям. Она решает проблему того, как модель организует удаленную цель в набор промежуточных шагов, а затем продвигается по ним по частям.

WAV further смещает фокус на верификацию. Чтобы войти в сценарии оптимизации политик и развертывания, мировая модель должна не только уметь предсказывать, но и обнаруживать, в каких областях она склонна к искажениям, и соответственно корректироваться. Она focuses на том, как модель проверяет себя.

V-JEPA ориентирован на представление мира, HWM — на планирование задач, WAV — на проверку результатов. Хотя их фокус разный, общее направление едино. Следующий этап для мировых моделей — это уже не только внутреннее предсказание, а постепенное соединение предсказания, планирования и верификации в единый набор системных возможностей.

V. От внутреннего предсказания к исполняемой системе

Многие предыдущие работы по мировым моделям были ближе к улучшению непрерывности предсказания будущих состояний или стабильности внутреннего представления мира. Но текущий акцент исследований начал меняться: система должна не только формировать суждение о среде, но и превращать это суждение в действие, а после получения результата продолжать корректировать следующий шаг. Чтобы приблизиться к реальному развертыванию, необходимо контролировать распространение ошибок в долгосрочных задачах, сжимать область поиска, снижать стоимость вывода.

Такие изменения также повлияют на AI agent. Многие агентные системы уже могут выполнять короткие задачи, такие как вызов инструментов, чтение файлов, выполнение инструкций из нескольких шагов. Но как только задача становится длинной, многоэтапной, требующей перепланирования на midway, производительность падает. Это не fundamentally отличается от сложностей в управлении роботами: везде недостаток способности к организации высокоуровневого пути приводит к разрыву между локальным исполнением и общей целью.

Иерархический подход, предлагаемый HWM — высокий уровень отвечает за путь и этапные цели, низкий уровень за локальные действия и обработку обратной связи, плюс наложение проверки результатов — такая иерархическая структура будет продолжать появляться в большем количестве систем в будущем. Следующий этап для мировых моделей также больше не будет focused только на предсказании будущего, а на организации предсказания, исполнения и коррекции в исполняемый путь.

Связанные с этим вопросы

QКаковы основные проблемы, с которыми сталкиваются мировые модели при выполнении длительных задач управления?

AОсновные проблемы включают накопление ошибок прогнозирования при длительном rollout и быстрое расширение пространства поиска действий с увеличением горизонта планирования. Это приводит к отклонению от цели и росту вычислительных затрат.

QКак HWM реструктурирует процесс планирования для преодоления ограничений длительного контроля?

AHWM разделяет планирование на два уровня: верхний уровень отвечает за этапные направления в более длительных временных масштабах, а нижний уровень обрабатывает локальное выполнение в коротких временных масштабах. Это снижает сложность планирования и уменьшает накопление ошибок.

QКакие результаты экспериментов демонстрируют эффективность HWM?

AВ экспериментах по захвату и размещению объектов в реальном мире HWM достиг успеха в 70% случаев, в то время как одноуровневая модель показала 0% успеха. Также наблюдалось снижение вычислительных затрат до одной четверти от исходных при сохранении высокой эффективности.

QКак соотносятся подходы V-JEPA 2, HWM и WAV в развитии мировых моделей?

AV-JEPA 2 фокусируется на обучении репрезентации мира, HWM — на многоуровневом планировании длительных задач, а WAV — на верификации и коррекции прогнозов. Эти три направления постепенно объединяются, формируя системные возможности прогнозирования, планирования и проверки.

QКакое влияние оказывает переход мировых моделей от прогнозирования к исполняемым системам?

AПереход позволяет моделям не только предсказывать будущее, но и преобразовывать прогнозы в действия, контролировать распространение ошибок, сокращать пространство поиска и снижать вычислительные затраты. Это особенно важно для многозадачных сценариев, таких как управление роботами и AI-агентами.

Похожее

В результате взлома Coldcard, одного из крупнейших взломов биткоин-кошельков за последнее время, началась новая волна убытков! Убытки растут

В результате взлома Coldcard, одного из крупнейших взломов биткоин-кошельков за последнее время, произошла третья волна атак. Исследовательская компания Galaxy Research сообщает, что из кошельков, созданных на этих устройствах, было выведено еще 207,73 BTC. Общие потери теперь составляют около 1367 BTC (примерно 88,6 млн долларов США) по 4585 адресам. Первые две волны атак демонстрировали схожие черты, что указывало на одного злоумышленника. Однако третья волна отличается по методам: используются отдельные адреса для каждой жертвы, адреса P2WSH вместо P2WPKH, и атака нацелена на стандартный путь генерации. Это может означать либо модификацию инструментов первоначальным взломщиком, либо появление нового. Похищенные биткоины, общая стоимость которых оценивается в 88,6 млн долларов, пока не были потрачены злоумышленниками. Анализ показывает, что потери в основном пришлись на кошельки с небольшим балансом, что характерно для индивидуальных пользователей, а не институциональных сервисов. Уязвимое ПО Coldcard было выпущено 17 марта 2021 года, и все украденные средства были созданы после этой даты.

cryptonews.ru52 мин. назад

В результате взлома Coldcard, одного из крупнейших взломов биткоин-кошельков за последнее время, началась новая волна убытков! Убытки растут

cryptonews.ru52 мин. назад

Trump Media продаёт ещё 2628 BTC, запасы снижаются до 4261 BTC

Компания Trump Media & Technology Group (TMTG), стоящая за социальной сетью Truth Social, продолжает сокращать свои вложения в Bitcoin. По данным аналитической платформы Lookonchain, компания продала ещё 2628 BTC на сумму около 165 миллионов долларов через платформу Crypto.com. Это продолжение серии продаж, начавшихся семь месяцев назад. Всего за этот период TMTG продала 7281 BTC на общую сумму примерно 545 миллионов долларов по средней цене 74 855 долларов за монету. Первоначально компания приобрела 11542 BTC по средней цене 118 522 доллара. После последних транзакций её резервы сократились до 4261 BTC (около 269,8 миллиона долларов), что на 63% меньше изначальных холдингов. Эти продажи происходят на фоне усиленного внимания законодателей к криптовалютным интересам, связанным с Дональдом Трампом. В Конгрессе идут дебаты по закону CLARITY Act, который касается этических норм, владения цифровыми активами и потенциальных конфликтов интересов государственных лиц. Критики указывают на такие проекты, как мемкойны TRUMP и MELANIA, а также на токены World Liberty Financial, связывая политическое влияние с частными криптоинтересами.

cointelegraph1 ч. назад

Trump Media продаёт ещё 2628 BTC, запасы снижаются до 4261 BTC

cointelegraph1 ч. назад

Фуцзянь, Цзиньцзян: супер-единорог в сфере памяти тихо делает своё дело

В провинции Фуцзянь в городе Цзиньцзян, известном производством спортивной обуви, находится перспективная компания в области производства чипов памяти — Fujian Jinhua Integrated Circuit Co. (Jinhua). Основанная в 2016 году как часть национального плана по развитию полупроводниковой промышленности, компания столкнулась с серьёзными вызовами. В 2018 году она была внесена в санкционный список Министерства торговли США по обвинению в промышленном шпионаже в пользу американской компании Micron, что привело к остановке производственной линии. После пяти лет судебных разбирательств в феврале 2024 года федеральный суд в Сан-Франциско полностью оправдал Jinhua, сняв все обвинения. Несмотря на правовую победу, компания всё ещё остаётся в санкционном списке, а годы задержек серьёзно замедлили её развитие. Под руководством своего ключевого инженера Чэнь Чжэнкуня, известного как «мастер эффективности», компания сумела адаптировать производство, увеличив долю отечественного оборудования. В отличие от ChangXin Memory Technologies (CXMT) и Yangtze Memory Technologies (YMTC), которые продвинулись дальше в производстве DRAM и NAND-памяти соответственно, Jinhua сосредоточена на специализированной (нишевой) DRAM-памяти для потребительской электроники. Её текущая производственная мощность составляет около 40 000 пластин в месяц. Хотя её доход в 2023 году оценивался примерно в 2 млрд юаней, что значительно меньше, чем у конкурентов, компания остаётся важным игроком. История Jinhua тесно связана с амбициозной промышленной трансформацией города Цзиньцзян. Местные власти оказали компании полную поддержку, включая финансовые гарантии и создание кластера, что демонстрирует стратегическую важность проекта для региона. Несмотря на то, что Jinhua упустила первые годы бума на рынке памяти, её устойчивость в условиях санкций показывает потенциал для восстановления в новом цикле роста, движимом развитием искусственного интеллекта.

marsbit1 ч. назад

Фуцзянь, Цзиньцзян: супер-единорог в сфере памяти тихо делает своё дело

marsbit1 ч. назад

Почему биткойн-фермы внезапно стали новым входом для вычислительных мощностей ИИ на фоне дефицита электроэнергии в 38 ГВт?

Заголовок: Почему майнинговые фермы для биткоина внезапно стали новым входом для вычислительных мощностей ИИ на фоне дефицита электроэнергии в 38 ГВт? Краткое содержание: Когда конкуренция между центрами обработки данных ИИ сместилась с вопроса «кто купит больше GPU» к «кто раньше получит электроэнергию», некоторые майнинговые фермы для биткоина, ранее считавшиеся волатильными активами, начали трансформироваться в центры обработки данных для облачных провайдеров, используя свои готовые возможности подключения к сети, землю и трансформаторные подстанции. По расчетам Morgan Stanley, в период 2026-2028 годов в США может возникнуть дефицит электроэнергии для ЦОДов около 38 ГВт, и модернизация старых майнинговых ферм может обеспечить от 10 до 19 ГВт. Такие компании, как TeraWulf и Hut 8, переориентируются с добычи криптовалют на предоставление инфраструктуры («Powered Shell Provider»), предлагая клиентам из сферы ИИ критически важный ресурс — возможность быстрее конкурентов развернуть значительные вычислительные мощности. Ключевой ценностью становится не вычислительная мощность для майнинга, а дефицитный доступ к электросетям, получение которого «с нуля» в некоторых регионах США теперь может занять 5-7 лет.

华尔街日报1 ч. назад

Почему биткойн-фермы внезапно стали новым входом для вычислительных мощностей ИИ на фоне дефицита электроэнергии в 38 ГВт?

华尔街日报1 ч. назад

Майкл Сэйлор: «Мы никогда не говорили, что никогда не будем продавать биткоины»

Председатель стратегической комиссии Майкл Сэйлор прокомментировал сообщения о новом разрешении компании Strategy на продажу биткоинов. Он заявил, что данное разрешение не является новым — оно было объявлено ещё 29 июня в рамках системы управления капиталом компании. Соглашение позволяет продавать BTC на сумму до 5 миллиардов долларов для определённых целей, но не обязывает компанию к продаже. Сэйлор подчеркнул, что Strategy никогда официально не брала на себя обязательство никогда не продавать свои биткоины, хотя и рассчитывает оставаться чистым покупателем BTC в долгосрочной перспективе. Он назвал текущие новости «старыми», переподанными как новые, и подтвердил, что программа монетизации биткоинов компании не предполагает обязательной продажи её активов.

cryptonews.ru3 ч. назад

Майкл Сэйлор: «Мы никогда не говорили, что никогда не будем продавать биткоины»

cryptonews.ru3 ч. назад

Торговля

Спот
活动图片