«Мир есть всё, что происходит».
В 1921 году Людвиг Витгенштейн написал эту знаменитую фразу в своем «Логико-философском трактате». Спустя столетие ее процитировала Ли Фэйфэй, одна из ведущих фигур в области ИИ, в начале своей последней технической статьи.
В ландшафте глубинного обучения люди за последние три года привыкли к разрушительному воздействию ИИ на язык, начиная с ChatGPT, который дал машинам способность к выражению, программированию и рассуждению, далеко превосходящую человеческие возможности.
Однако за цифровыми чудесами часто упускается из виду слепое пятно: машины могут рассуждать о мире, но ничего не знают о его физической сущности. Опубликованная Ли Фэйфэй статья стала отрезвляющим отрезвлением.
В то время как генеративный ИИ стал незаменимым инструментом по всему миру, определения «мировой модели» внутри отрасли становятся всё более запутанными. Будь то генерация видео или воплощенный интеллект, компании борются за право толкования этой концепции.
После публикации статьи Ли Фэйфэй многие сочли, что она пытается вернуть себе право определять «мировую модель». Но как раз наоборот, я думаю, что Ли Фэйфэй на самом деле хотела этим объявить людям манифест: мир состоит не из языка, а из строгих физических пространственных и временных закономерностей.
Чтобы действительно войти в человеческий физический мир, машины должны выйти из зоны комфорта текстовой статистики и научиться понимать преломление света, инерцию объектов и логику столкновений. Это не только сдвиг парадигмы в технологиях, но и необходимый путь для ИИ к воплощенному интеллекту.
01
Людям нужна таксономия
Необходимо признать, что в словаре ИИ «мировая модель» превратилась в универсальное местоимение: кажется, любой проект, связанный с генерацией изображений или моделированием среды, можно связать с ней. Эта неопределённость проистекает из многомерных потребностей людей в определении «мира».
Когда технология только зарождается, естественно, не существует единых правил, чтобы ограничить её четкими рамками. Подобная путаница в определении «мировой модели» не редкость в истории. Когда древнегреческие философы спорили о том, является ли сущностью мира вода, огонь или неделимые атомы, они по сути искали основу для своих рассуждений.
Сейчас область ИИ сталкивается с той же проблемой: когда модель генерации видео производит результат, который чрезвычайно реалистичен визуально, но совершенно невозможен с точки зрения физических законов, как его следует определять? В своей статье Ли Фэйфэй упоминает старую и надежную основу для определения: частично наблюдаемый процесс принятия решений Маркова (POMDP).
Это также центральная аксиома механизма обучения с подкреплением, раскрывающая вечный замкнутый цикл взаимодействия агента с физическим миром: агент совершает действие (Action), которое приводит к изменению состояния мира (State). Однако у агента нет взгляда свыше, он может только строить локальное восприятие реальности через наблюдение (Observation).
По сути, мировая модель — это абстрактная модель мира, которую машина строит в своем «мозгу», чтобы выжить в этом цикле. Если какой-либо элемент этого цикла не определен четко, то так называемая мировая модель останется лишь слепым нагромождением пикселей.
02
Три столпа построения интеллекта
Этот цикл звучит просто, функция каждого звена легко понимаема. Однако при внимательном рассмотрении внутри каждого есть бесчисленное множество нечетко определенных деталей. Чтобы объяснить эту путаницу, Ли Фэйфэй выделила три ключевых компонента мировой модели. Они являются одновременно и технической классификацией, и тремя столпами на пути ИИ к воплощенному интеллекту.
1. Рендерер (Renderer)
Основная логика рендерера — это визуальная правдоподобность. Его вывод — это пиксели, он стремится сделать изображение естественным, связным и эстетичным для человеческого глаза.
Это также самая коммерчески зрелая область на данный момент. Такие известные модели генерации видео, как Sora от OpenAI и Seedance 2.0 от ByteDance, модели генерации изображений, как GPT-image-2 от OpenAI и Nano Banana 2 от Google, по сути, являются на данный момент самыми сложными машинами визуальной вероятности. Изучив миллиарды интернет-изображений и видео, они в конечном итоге овладели распределением закономерностей света, тени и форм.
Однако Ли Фэйфэй указывает, что у этой красивой реальности есть цена. Хотя эти топовые модели могут генерировать великолепные здания, если попытаться взаимодействовать с их сгенерированной физической структурой, здание, скорее всего, мгновенно рухнет из-за отсутствия поддерживающей структуры. Другими словами, они не понимают, что такое «опора», они генерируют лишь то, что зритель «видит», а не то, как мир «существует».
2. Симулятор (Simulator)
Симулятор стремится именно к тому, чего не хватает рендереру — к точности структуры. Ему совершенно безразлично, красиво видео или нет, его единственная забота — следует ли мир физическим законам. Когда симулятор выводит самый обычный стакан, он также должен включать распределение массы, коэффициент трения материала, реакцию на гравитацию и физические границы при столкновении.
Симулятор делает содержимое видео правдивым. Однако в нынешней волне ИИ симулятор не только сильно недооценен, но и часто игнорируется.
Из этого примера со стаканом видно, что наличие симулятора превращает «обсуждение искусства» в «исследование физики». Для построения симулятора, строго следующего физическим законам, требуются немыслимые вычислительные ресурсы и затраты на разметку данных. Но для робота визуальная привлекательность — почти бесполезный атрибут, тогда как физическая точность решает всё.
Если симулятор недостаточно точен, робот, обучающийся в нем, никогда не сможет войти в реальный мир. Проблема перехода от симуляции к реальности (Sim-to-Real) объективно существует: действия, прошедшие тест на 100% в лаборатории, в реальном мире могут быть полностью парализованы малейшим трением — это так называемый «парадокс Моравека».
3. Планировщик (Planner)
Планировщик отвечает за вывод действий. Как точка соединения восприятия и обратной связи, он должен решать ключевую проблему, не имеющую стандартного ответа: «Что делать дальше?». В рамках Ли Фэйфэй это также последнее звено всего цикла «восприятие-действие» и наиболее передовая и сложная область.
Все существующие модели «визуальный-язык-действие» (VLA) пытаются заставить систему принимать решения в неструктурированном сложном мире. Планировщик не просто предсказывает будущее, но и выбирает из бесчисленных возможностей путь, наиболее способствующий достижению цели. Это ключ к превращению машины из «наблюдателя» в «практика».
03
Хаб на миллиарды долларов
Из трех категорий, предложенных Ли Фэйфэй, модели, соответствующие рендереру и планировщику, уже довольно распространены; оставшийся симулятор, естественно, становится самым трудным для реализации звеном. Ли Фэйфэй также дала чрезвычайно проницательную оценку: симулятор — это связующее звено между рендерингом и планированием, центральный хаб всей системы.
В области симуляторов наиболее выдающихся результатов добился не OpenAI, Anthropic или Google, а NVIDIA Дженсена Хуанга.
Omniverse от NVIDIA заявляет о возможности поддержки триллионной мечты о цифровых двойниках именно потому, что он постиг суть симулятора. На платформе NVIDIA работа фабрик, цепочек поставок и складов уже превратилась в полные цифровые зеркала. Для промышленности это уже не визуальная демонстрация, а ключевая инфраструктура производительности.
Это не преувеличение, а возможность для рынка стоимостью в триллионы долларов, лежащая перед всеми нами.
От виртуальной визуализации в строительстве и молекулярно-динамического моделирования в фармацевтике до сценарного тестирования для автономного вождения. Этим отраслям не хватает не фотореалистичных моделей для создания изображений и видео, а симулятора чрезвычайно высокой точности. Без преувеличения можно сказать, что овладение способностью моделировать физический мир равносильно получению приоритетного допуска к индустриализации ИИ.
Но трудности в реальности таковы, что в этой области почти нет технологических оптимистов. Ли Фэйфэй также признает, что огромная пропасть по-прежнему существует.
Во-первых, это проблема данных для воплощенного интеллекта, о которой мы уже неоднократно упоминали. Видеоданных в интернете бесчисленное множество, но 3D-данные с четкой геометрической структурой, свойствами материалов и разметкой физической обратной связи чрезвычайно редки.
Во-вторых, применение генеративного ИИ всегда сопряжено со скрытыми рисками. Геометрические модели, созданные ИИ, в лучшем случае могут быть визуально идеальными, но часто физически нелогичны, например, пересечение чашки со столом или потеря объемности при столкновении объектов. Люди могут одним словом «клиппинг» описать эти странные явления, но в реальных промышленных применениях это означает катастрофу.
04
К унифицированной мировой модели
Несмотря на все трудности, Ли Фэйфэй дала положительный прогноз тенденции отрасли: границы между рендерингом, симуляцией и планированием становятся всё более размытыми.
Это не прекрасная перспектива, а уже происходящая реальность. Команда World Labs Ли Фэйфэй, проведя исследования, считает, что человечество уже движется к единой базовой модели. В этой архитектуре воображение и логика могут объединиться.
Модели будущего больше не будут простым наложением и комбинацией функций, а единой нейронной сетевой основой. Она сможет одновременно рендерить фотореалистичные сцены с помощью гауссовского сплайта и в реальном времени генерировать сетки столкновений, необходимые физическому движку. Проще говоря, универсальная базовая модель позволит осуществлять бесшовное переключение между режимами визуального восприятия, необходимыми человеку, и режимами состояния, необходимыми физическому движку.
С другой стороны, традиционные модели статичны, тогда как будущие мировые модели будут обладать более мощной интерактивностью. Рендерер больше не будет пассивным генератором видео, он постепенно начнет принимать инструкции для действий; симулятор станет более редактируемым и контролируемым; планировщик также сможет логически мыслить и автоматически корректировать стратегию в соответствии с изменениями среды.
05
Длинная дуга пространственного интеллекта
Наконец, возвращаясь к макроуровню, почему всё это, связанное с «мировой моделью», важно?
По мнению Ли Фэйфэй, за последние несколько десятилетий исследования ИИ человечество постоянно искало тот ключ, который позволил бы машинам войти в физический мир. Сегодня у нас уже есть языковые модели, хорошо справляющиеся с логикой, и теперь нам нужны модели для работы с пространством. Суть пространственного интеллекта заключается в том, как машина взаимодействует с физическим миром, в котором она находится.
Эта битва ведется не за то, у кого больше вычислительных мощностей, а за то, кто сможет определить цифровые стандарты физического мира.
Мировая модель — это отнюдь не простая оптимизация алгоритмов, а грандиозный подвиг эволюции ИИ.
«Язык дал машинам способность говорить об этом мире, а мировая модель — это способ, которым машины в конечном итоге будут понимать, представлять, рассуждать и взаимодействовать с физическим миром».
Каждый человек в эту эпоху переходит от этапа разговоров о мире к новой эре его подлинного понимания и реконструкции.
Тем не менее, мировая модель — это лишь промежуточный узел на пути к ОИИ, а ИИ, созданный человечеством, также находится еще очень далеко от подлинной «мировой модели» в истинном смысле. Здесь стоит поделиться слегка радикальной точкой зрения другого ведущего специалиста в области мировых моделей, Яна ЛеКуна:
В оптимистичном прогнозе пройдет еще пять-десять лет, прежде чем машинный интеллект сможет хотя бы приблизиться к уровню щенка.
Эта статья взята с официального аккаунта WeChat «Кремниевая звездная искра», автор: Сы Ци








