3 июня 2026 года команда World Labs совместно с профессором Стэнфордского университета Ли Фэйфэй опубликовала концептуальный аналитический доклад под предельно прямым, почти без каких-либо художественных оборотов, заголовком: «Функциональная таксономия мировых моделей». Первое же предложение статьи нарушает негласную договорённость в отрасли: «Мировая модель — один из самых важных и в то же время самых злоупотребляемых терминов в современной сфере искусственного интеллекта».
Контекст этой фразы хорошо знаком всем, кто следит за индустрией ИИ.
В феврале 2024 года OpenAI представила модель генерации видео Sora, в техническом отчёте которой прямо говорилось: «Модель генерации видео как симулятор мира». Директор по робототехнике NVIDIA Джим Фан тогда оставил на LinkedIn комментарий, который позже цитировался многократно: по сути Sora — это «мировая модель, где единственно допустимым действием является бездействие». С другой стороны, согласно открытым сообщениям, команда ИИ Tesla на публичных мероприятиях неоднократно называла прогнозирующий компонент внутри системы полного автономного вождения «мировой моделью» или «симулятором мира». Игровые движки, инструменты 3D-генерации, модели воплощённого интеллекта — всевозможные продукты и технологии запихиваются в одну корзину и наклеивают на них один и тот же ярлык.
Что общего у генератора видео, сети прогнозирования для автономного вождения, модели управления роботом и физического движка? Практически ничего. Но все они называются «мировыми моделями».
Более чем двухлетняя концептуальная путаница наконец-то встретила попытку систематического упорядочивания. Команда Ли Фэйфэй на этот раз не представила новую модель, не опубликовала новый бенчмарк, не продемонстрировала никаких функций продукта. Они сделали нечто более фундаментальное: вернулись к теоретическому истоку — частично наблюдаемым марковским процессам принятия решений — и свели все системы, именуемые на рынке «мировыми моделями», к трём различным функциональным проекциям одного и того же когнитивного цикла.
Эти три проекции: рендерер, симулятор и планировщик. В рамках классификации World Labs, Sora и подобные ей модели генерации видео относятся к рендерерам.
Как один термин смог вместить столько противоречащих друг другу значений
Чтобы понять корни этой путаницы, нужно сначала задать более фундаментальный вопрос: когда компания говорит «мы создаём мировую модель», что именно она имеет в виду?
Для OpenAI цель Sora — «понимать и представлять физический мир в видео». Как следует из технического отчёта, Sora, изучая статистические закономерности в огромных массивах видеоданных, способна генерировать кадры, соответствующие визуальному здравому смыслу: упавшая на пол чашка разбивается, бумажный самолётик, отпущенный рукой, летит, у идущего человека ноги двигаются поочерёдно. Эти сцены выглядят так, будто модель «понимает физику».
Для Tesla «мировая модель» — это нейронная сеть в системе FSD, прогнозирующая траектории движения участников дорожного движения на несколько секунд вперёд. Она должна выдавать точные 3D-координаты, скорость, ориентацию, чтобы модуль планирования пути мог рассчитать безопасные решения для вождения. Этой модели не нужно выводить пиксели, она выводит векторы и вероятностные распределения.
Для компании по робототехнике «мировая модель» — это внутренний симуляционный механизм, позволяющий роборуке предсказать: «Если я сдвину эту чашку на 5 см влево, она упадёт?». Она должна понимать свойства объектов, контактную механику и устойчивость, выводя оценку осуществимости действия.
Цели трёх типов компаний совершенно различны. Компании по генерации видео заботятся о точности воспроизведения пикселей, компании по автономному вождению — о точности прогнозирования физических состояний, компании по робототехнике — о прогнозируемости последствий действий. Все они занимаются «мировой моделью», но делают совершенно разные вещи.
World Labs в статье указывает на суть проблемы: все эти системы получили одно и то же имя потому, что действительно воплощают один из аспектов «понимания мира». Однако каждая из них выполняет лишь одно звено полного когнитивного цикла, но маркетинг, медийное освещение и инвестиционные нарративы упаковывают их в полноценную мировую модель.
Другой двигатель концептуальной путаницы — внутренняя напряжённость самого термина. Словосочетание «мировая модель» несёт в себе ауру грандиозного нарратива, звучит более впечатляюще, чем «модель генерации видео» или «модель прогнозирования видео», и лучше поддерживает высокие оценки и истории для привлечения финансирования. Когда технические возможности не соответствуют общественным ожиданиям, превращение концепции в инструмент пропаганды становится неизбежным.
Вернёмся в 1960-е: какой должна быть полная «мировая модель»
Классификационная система World Labs построена на, казалось бы, древней теоретической основе: частично наблюдаемых марковских процессах принятия решений (POMDP).
Эта система описывает полный цикл взаимодействия агента со средой. Агент находится в некотором состоянии среды, выполняет действие, действие меняет состояние среды, агент через сенсоры получает частичное наблюдение, наблюдение запускает обновление внутреннего состояния, обновлённое познание диктует следующее действие. Цикл повторяется.
В рамках этой системы полная функция «мировой модели» должна включать три звена: генерация наблюдений из состояния (пиксели, облака точек и т.д., которые видит человек или собирают сенсоры), вывод следующего состояния из действия и текущего состояния (прогнозирование физических изменений), генерация действия из наблюдений и цели (планирование решений).
Языковые модели изучают статистические закономерности текстовых последовательностей, а мировые модели изучают статистические характеристики пространства и времени. Как свет отражается на поверхностях разных материалов, как движутся объекты под действием гравитации, как передаётся энергия после столкновения твёрдых тел — вот закономерности, которые должна улавливать мировая модель.
Команда World Labs в статье указывает, что все ныне существующие на рынке системы, называемые «мировыми моделями», фактически являются лишь проекцией одного из функциональных звеньев упомянутого выше полного цикла. Одни системы занимаются только рендерингом «от состояния к наблюдению», другие — только выводом состояния «от действия к следующему состоянию», третьи — только планированием «от наблюдения к действию». Каждая из них вырезает отрезок дуги цикла, но на каждую наклеивают ярлык, представляющий собой полный круг.
Ценность этой аналитической системы в том, что она предоставляет систему координат для сравнения, выходящую за рамки маркетинговых формулировок. Неважно, как компания упаковывает свой продукт, — стоит поместить его обратно в цикл POMDP, посмотреть, что он принимает на вход, что выдаёт на выходе и какого звена не хватает, как границы его возможностей тут же станут очевидны.
Границы возможностей трёх проекций: рендерер, симулятор, планировщик
В таксономии World Labs первый тип определяется как «рендерер». Его основная цель — генерировать высококачественные пиксельные изображения, ориентированные на человеческое визуальное восприятие. Входные данные — это репрезентация некоторого состояния среды (текстовое описание, параметры 3D-сцены или неявное кодирование), выходные данные — непрерывные кадры.
Рендерер оптимизируется в направлении визуального правдоподобия, а не физической точности. В статье World Labs прямо указано, что здание, сгенерированное рендерером, может «качаться», потому что он на самом деле не решает уравнения строительной механики; разбрызгивающаяся жидкость может выглядеть реалистично, но объём жидкости, скорость потока и сила удара могут совершенно не соответствовать реальным физическим величинам. Поэтому такие модели не годятся для архитектурного проектирования, обучения роботов и задач, требующих точного физического моделирования.
Genie 3 от Google, различные модели преобразования текста в видео и практически все инструменты ИИ-генерации видео относятся к этой категории. Разумеется, Sora тоже в их числе.
Второй тип — «симулятор». Его основная цель — не создавать картинку для просмотра человеком, а генерировать точные состояния, пригодные для последующих вычислений. Входные данные — текущее состояние среды и внешние воздействия (или действия), выходные данные — следующее состояние, физически и геометрически соответствующее законам реального мира. Состояния, выводимые симулятором, можно использовать для анализа напряжений, расчёта энергопотребления, обнаружения столкновений, а также в качестве входных данных для рендерера для создания визуализации, но основная его ценность заключается в вычислимости самого состояния.
Типичный представитель таких систем — NVIDIA Omniverse. Это не нативная ИИ-модель, а платформа цифровых двойников, сочетающая традиционные физические движки и вычисления с ускорением на ИИ. World Labs в статье оценивает, что симулятор является мостом между рендерингом и планированием, но основным узким местом является нехватка качественных 3D-данных с физической разметкой. По оценке World Labs в статье, данных для обучения таких моделей на несколько порядков меньше, чем видео, доступного в интернете.
Третий тип — «планировщик». Его входные данные — данные наблюдений (изображения с камер, облака точек лидара, показания тактильных сенсоров и т.д.) и целевые инструкции, выходные данные — какое действие следует выполнить дальше. Модели VLA (визуально-языково-действенные) и World Action Models относятся к этой категории.
Различия между тремя категориями — это не мелкие расхождения в технических подходах, а фундаментальное функциональное разделение. Рендерер выводит пиксели для просмотра человеком, симулятор выводит состояния для вычислений машиной, планировщик выводит действия для исполнительных механизмов. Система может обладать несколькими способностями одновременно, но когда большинство систем, называемых «мировыми моделями», по сути делают только рендеринг, приравнивание «рендеринга» к «пониманию мира» является серьёзным когнитивным несоответствием.
Двухлетние дебаты: является ли Sora мировой моделью или нет
В феврале 2024 года, когда OpenAI представила Sora, в заголовке технического отчёта прямо значилось: «Модель генерации видео как симулятор мира». Эта формулировка немедленно вызвала жаркие споры в академических кругах и сообществе разработчиков.
Сторонники считают, что генерируемые Sora видео демонстрируют 3D-пространственную согласованность, постоянство объектов и некоторое интуитивное понимание физического взаимодействия. У откушенного гамбургера остаются следы зубов, собака, бегущая по снегу, поднимает снежную пыль — такие детали, кажется, указывают на то, что модель усвоила некоторые физические закономерности.
Основной аргумент противников исходит из классического определения мировой модели в области обучения с подкреплением: мировая модель должна уметь предсказывать переход состояний на основе действия. То есть, при заданном текущем состоянии и входном действии, модель должна выводить состояние после этого действия. Sora этого не умеет. Пользователь не может сказать Sora «подтолкни эту чашку слева» и затем наблюдать, упадёт ли чашка, в каком направлении и куда полетят осколки.
Комментарий Джима Фана точно уловил это противоречие: «По сути, Sora — это мировая модель, только она допускает бездействие в качестве единственного действия». Это означает, что Sora действительно предсказывает изменения среды во времени, но этот процесс изменений не подвержен никакому внешнему вмешательству, он может разворачиваться только по присущей видеоданным причинно-следственной цепочке. Она не занимается интерактивным выводом, а просто продолжает пассивно наблюдаемую последовательность.
На сабреддите r/MachineLearning многие исследователи в области обучения с подкреплением выразили более резкую критику: систему, которая не может предсказывать переход состояний на основе действия, нельзя называть мировой моделью, это всего лишь модель прогнозирования видео.
Классификационная система World Labs даёт окончательный ответ на эти дебаты. В цикле POMDP действие является ключевым входным параметром, запускающим переход состояния, система, лишённая этого входа, является лишь проекцией звена «генерация наблюдений» в полном когнитивном цикле. Sora относится к рендерерам, это не полная мировая модель и уж тем более не симулятор мира.
Но это не значит, что Sora не имеет ценности. Рендерер решает иную задачу: как генерировать кадры, соответствующие визуальным ожиданиям человека. Сама по себе эта задача чрезвычайно сложна и имеет огромную коммерческую ценность. Проблема в том, что упаковка способности к рендерингу как способности «понимать мир» вводит в заблуждение технических руководителей и инвесторов, заставляя думать, будто эти модели уже обладают способностью к физическому выводу или воплощённому взаимодействию.
Промышленная ценность прояснения понятий
Определение границ понятия «мировая модель» — это не академические придирки к словам. Это напрямую влияет на выбор технологий, инвестиционные решения и уровень понимания обществом возможностей ИИ.
Для производственного предприятия, оценивающего возможность использования некой «мировой модели» для обучения роботов, выяснение того, является ли эта модель рендерером, симулятором или планировщиком, — необходимое условие, чтобы избежать ошибок на миллионы долларов. Модель, способная генерировать только видеокадры, какой бы реалистичной ни была картинка, не может заменить точные вычисления сил, действующих на объекты, траекторий движения и последствий столкновений.
Для инвестиционных фондов различение трёх проекций означает возможность более точно определять положение проекта в технологическом стеке. Если стартап, называющий себя «мировой моделью», по сути производит рендерер, его конкуренты — компании по генерации видео, а не платформы цифровых двойников или модели управления роботами. Это напрямую определяет способ оценки размера рынка и выбор компаний для сравнения.
Для академических кругов чёткая классификация — предпосылка для создания сопоставимых бенчмарков. Если термин «мировая модель» продолжит расширяться, исследователям будет трудно определить, что считать улучшением, а что — прорывом, а рецензирование будет основываться на двусмысленности.
World Labs в статье также отмечает, что прояснение понятий не для того, чтобы создавать противостояние. Будущее развитие будет заключаться в слиянии трёх проекций. По-настоящему понимающая физические свойства чашки модель должна одновременно уметь рендерить её внешний вид, симулировать физический процесс её опрокидывания при толчке и планировать, как роборуке устойчиво её схватить. Но пока технология не дошла до этого этапа, осознание границ важнее, чем размышления о слиянии.
По оценке World Labs в статье, симуляторы и технологии цифровых двойников, такие как NVIDIA Omniverse, нацелены на потенциальный рынок стоимостью более триллиона долларов в таких областях, как фабрики, склады, цепочки поставок. Эта цифра взята из собственных оценок производителей, но когда рынок действительно достигнет такого масштаба, зависит от того, смогут ли симуляторы преодолеть узкое место — нехватку качественных 3D-данных с физической разметкой.
Для современного этапа индустрии ИИ, возможно, самое важное осознание простое: умение генерировать реалистичное видео не равно пониманию физического мира; возможность называться мировой моделью не равно реальному моделированию мира. Пробиться сквозь маркетинговые формулировки, рассмотреть, что именно система принимает на вход, что выдаёт на выходе и какого звена не хватает в цикле POMDP — это самый честный способ оценки границ технических возможностей.








