Без лишних слов, сразу к ежедневному лежанию на диване (doge)!
Только что гуру Капати объявил, что «мы» из Anthropic начали использовать принципиально новый способ нагружать большие модели —
«Властелин колец».

По словам Капати, этот «бенчмарк Властелина колец» приходит на смену некогда популярному SVG-тесту «Пеликан, едущий на велосипеде».

Конкретно, Капати просто скормил Opus 5 самое начало «Властелина колец» и заставил модель с помощью Three.js на ходу сконструировать целый «Миддл-зем».
Что касается конечного результата, то он чем-то напоминает китайские 3D-мультфильмы конца 1990-х — начала 2000-х: очень грубый и абстрактный.
Но объективно говоря, если присмотреться подольше, и если вы случайно знакомы с новозеландским местом съемок «Властелина колец» — Хоббитоном, то действительно можно уловить в этом некоторый дух~
Однако эта, на первый взгляд, не очень изысканная штука обошлась Opus 5 в: 1 миллион токенов, 2 часа и 5500 строк кода.
Конечно, на сцене не один Claude блистал.
Самое смешное — это новая порция от пользователей, преподнесшая
версию DeepSeek V4 Flash.
Получился целый «китаец может летать», все персонажи на экране парят.
Перед этими очевидными ляпами Капати оказался довольно объективен.
Он отметил, что Opus 5 пока не может по-настоящему «войти» в созданный им мир, а только постоянно делает скриншоты в разные моменты времени и медленно проверяет, где что пошло не так.
И это как раз выявило один явный недостаток современных больших моделей:
Они уже умеют писать код, строить сцены, создавать игры, но еще не могут по-настоящему понимать видео и не умеют сами играть в игры, которые они делают.
Два часа, и вручную построен Миддл-зем
Давайте сначала посмотрим, как конкретно проводится этот тест «Властелина колец».
Если буквально следовать словам Капати в твите, то основным промптом, введенным для Opus 5, должно быть начало первой главы «Властелина колец» — «Давно ожидаемый пир».

Бильбо Бэггинс из Бэг-Энда объявил о проведении грандиозного банкета по случаю своего 111-го дня рождения, и Хоббитон тут же зашумел...
Заинтересованные друзья могут попробовать сами.
Кроме того, Капати также указал в промпте Three.js — библиотеку JavaScript для создания 3D-сцен с помощью кода.
Таким образом, задача Opus 5 заключалась в том, чтобы сначала понять текст начала «Властелина колец», а затем перевести его в 3D-мир, способный работать в реальном времени в браузере.

В ходе всего процесса Opus 5 должен был создать персонажей, здания и предметы из полигонов, поместить их один за другим в систему координат x, y, z, а затем расставить камеры, освещение и анимацию.
Когда персонажи двигаются, куда поворачивается камера, как меняется свет и как должны взаимодействовать объекты в сцене — всё это модель должна была определить с помощью кода.
Хотя конечное изображение нельзя назвать изысканным, и часто возникают проблемы с клиппингом, парением и т.д., например, разделение тела и головы персонажа... но вся сцена, по крайней мере, была действительно построена.

Важно отметить, что это не то же самое, что когда видео-модель напрямую генерирует кадр за кадром пикселей.
Three.js сначала должна создать персонажей, объекты и сцены как трёхмерные объекты, а затем на основе кода в реальном времени рассчитать их положение, угол и состояние движения.
Поэтому демо, которое мы видим, — это не обычное AI-сгенерированное видео, а запись экрана во время работы 3D-веб-сцены.
Однако Капати в комментариях также отметил, что процедурная 3D и генерация видео — не взаимоисключающие вещи.
Пользователи предложили: можно отдать эту грубую запись Three.js в Seedance в качестве референсного видео, а затем попросить видео-модель отрендерить её заново с более высоким качеством.

Капати быстро согласился.
По его задумке, процедурный код может отвечать за раскадровку и управление, сначала определяя скелет: где стоят персонажи, как движется камера, как развивается сюжет.
Затем запись экрана передается модели Video-to-Video, чтобы она добавила текстуры, светотени и детали, подняв «товарный вид» всего Миддл-земля до максимума.
Что касается аудио, Opus 5 на этот раз не взял на себя всё сразу.
Капати сказал, что из-за личных требований к качеству звука в конечном итоге использовался ElevenLabs.

Так и появилось на свет демо «Властелина колец» с картинкой, кадрами и закадровым голосом.
Капати также уже выложил весь проект в открытый доступ, конкретные ссылки можно найти в конце статьи.

Пользователи гораздо интереснее, чем Капати
Как только Капати выложил демо, многие пользователи тоже поспешили его протестировать.
В целом, можно только сказать:
У нынешних пользователей воображения больше, чем у Капати.
Кто-то запустил с помощью Claude проект «Earth Online», цель которого — с помощью группы AI-агентов построить всю Землю
по кусочкам.
На данный момент агенты еще не достроили всю Землю, создав только район набережной Сан-Франциско в стиле low-poly. Но по имеющемуся изображению видно, что пропорции зданий, масштаб персонажей и общий стиль сохраняются довольно единообразно.
Этот эффект немного похож на мультфильмы в стиле Lego. Художественный стиль не сложный, но персонажи, сцены и действия могут стабильно работать в одном мире.
Если продолжать двигаться в этом направлении, то анимация в простом стиле и легковесные игры уже начинают обретать черты AI-нативной разработки.
Другие пользователи с помощью Fable 5 и GPT-5.6 Sol построили 3D-цифровую модель Нью-Йорка и подключили к ней данные в реальном времени.
Модель должна не только правильно расставить улицы и здания Нью-Йорка, но и поддерживать пространственные отношения между разными районами. Автор также предположил, что такая задача по генерации виртуальных миров, возможно, может стать новым бенчмарком для пространственного мышления.
Но самое невероятное еще впереди.
Один пользователь не смог купить билеты на концерт Kanye West, поэтому просто создал себе концерт в браузере с помощью ИИ.
Весь проект также построен на Three.js. Только один HTML-файл, без вызова готовых 3D-моделей, сцена, персонажи и свет — всё сгенерировано кодом.
На весь концерт было подготовлено 14 песен, у каждой песни свой дизайн освещения и уникальная визуализация сферической сцены.
Обычные пользователи могут послушать фрагменты, а подключившись к Spotify Premium, можно воспроизводить полные треки и всё шоу.
Не достал билет? Просто сгенерируй себе приватный концерт! Слишком круто!
И это еще не всё!!!
В конце исходного поста Капати также помечтал о том, что впоследствии можно добавить игровой процесс в эти 3D-миры, позволяя игрокам входить в них в роли наблюдателей, NPC или даже персонажей истории.
Но не успел Капати организовать игровую версию, как пользователи уже её сделали.

Этот проект также использует Opus 5 и Three.js, он не только работает и взаимодействует, но даже снабжен аудио.
Появляется все больше примеров 3D-дизайна. От пропорций зданий и планировки пространства до стиля сцен — Opus 5 уже способен поддерживать относительно стабильную согласованность в проектах довольно большого масштаба.
Подобных примеров много, здесь мы не будем демонстрировать их все.
Объективно говоря, эти работы все еще далеки от по-настоящему зрелых игр.
Вопросы о том, интересен ли眼花ряющий игровой процесс, стабильна ли длительная работа, готовы ли игроки действительно провести в нем 15 минут, пока остаются без ответа.
Но порог создания контента в реальном времени в 3D и игровых прототипов действительно был значительно снижен.
Более того, разве не прекрасно иметь новый способ тестирования возможностей моделей, который к тому же достаточно интересен и увлекателен?
Пеликан, пора с велосипеда
Так почему же вдруг заставили большую модель генерировать «Властелина колец»?
Все началось с нашумевшего несколько лет назад теста «Пеликан, едущий на велосипеде».
Эта задача изначально появилась от разработчика Симона Уиллисона, требовалась всего одна фраза:
Сгенерируй SVG-изображение пеликана, едущего на велосипеде.

Хотя задача кажется простой, на самом деле она довольно сложна для модели.
Потому что SVG выглядит как картинка, но в основе лежит строка кода.
Модель должна не только знать, как выглядят пеликан и велосипед по отдельности, но и разобрать их на линии, круги и многоугольники, а затем с помощью координат правильно расположить взаимное положение каждой детали.

Что еще важнее, пеликан и велосипед сами по себе не очень сочетаются.
Рама, шины и педали велосипеда должны сохранять правильную геометрическую структуру; у пеликана же большой клюв, короткие ноги и телосложение, которое, похоже, совсем не приспособлено для кручения педалей.

Когда их объединяют, можно практически сразу понять, поняла ли модель пространственные отношения:
Кривые ли колеса, попала ли нога на педаль, птица действительно едет на велосипеде или же она была немедленно расчленена рамой.
Просто посмотрите на эти демо конца 24 года~
Именно поэтому «Пеликан, едущий на велосипеде» на какое-то время стал классическим тестом для народного наблюдения за пространственным пониманием, комбинированием объектов и генерацией кода большими моделями.

Но по мере того, как модели становятся все мощнее, этот пеликан уже почти доехал до конца своего пути.
Достаточно взглянуть на производительность
DeepSeek R1 и
DeepSeek V4, чтобы понять, что современные модели уже могут справляться с этой задачей вполне прилично.

Что еще важнее, один SVG может проверить только одноразовый вывод модели.
Он не может измерить, способна ли модель планировать сложный проект, работать непрерывно несколько часов и в ходе написания тысяч строк кода постоянно проверять и исправлять свои ошибки.
И вот, Капати заменил маленькую задачу «нарисовать картинку» на большой проект «построить мир» —
Пеликан может слезать, Миддл-зем официально принимает эстафету.

Пеликан Капати
Вскоре новость о том, что Капати готовится сменить тему для «теста пеликана», также распространилась по крупным сообществам.
Высоко оцененный комментарий на Hacker News гласит, что хотя качество изображения в этих демо довольно посредственное, это как раз и говорит о том, что нам нужен новый тест, сложнее, чем генерация одной картинки.
Новый бенчмарк не должен проверять только то, может ли модель правильно нарисовать картинку, он также должен проверять, понимает ли она мир.

Ведь «Пеликан на велосипеде» использовался уже слишком долго.
Модели постоянно оптимизируются под такие задачи для лидерства в рейтингах, и различия между ними становится все труднее разглядеть.
В сравнении, генерация целого 3D-мира требует от модели понимания пространственных отношений между персонажами и объектами, обработки камеры, движения и изменения сцены, а не просто вызова видео-генеративной модели для вывода последовательности кадров.

Конечно, есть и те, кто высказывает противоположное мнение.
Тест с пеликаном достаточно лаконичен, дешев, и результаты легко сравнивать.
Для одного теста модели тратить столько токенов на генерацию целого 3D-мира — это немного похоже на пускание фейерверков за счет вычислительных мощностей.

В то же время, сама способность Three.js оценивать комплексные возможности больших моделей также подверглась сомнению.
Некоторые считают, что такие демо в лучшем случае доказывают лишь то, что Anthropic хорошо обучили коду Three.js, но не то, что модель действительно понимает пространство и физический мир.
Но вскоре пользователи возразили:
Превращение абстрактного, неоднозначного литературного текста в 3D-анимацию требует от модели одновременной обработки пространственных отношений, физических законов, повседневных объектов, а также 3D-трансформаций и математических задач компьютерной графики.
Если это можно назвать лишь «умением писать Three.js», то это несколько недооценивает эти 5500 строк кода.

Другие пользователи задали еще более открытый вопрос:
Действительно ли так называемое «пространственное мышление» отличается от мышления, которое большая модель обычно применяет при обработке текста и кода?
Одна точка зрения заключается в том, что жизнеспособность изображения зависит от того, понимает ли модель пространственные отношения, такие как «спереди/сзади, внутри/снаружи, далеко/близко, перекрытие», а также расстояния, углы и относительные размеры объектов под разными углами обзора.

Но другая точка зрения гласит, что независимо от того, обрабатывает ли модель «рядом с камнем» или «внутри массива», она, возможно, делает одно и то же: генерирует токены один за другим на основе контекста, выполняя при этом процесс мышления.
Если это так, то то, что продемонстрировал Opus 5, — это не просто внезапно проявившаяся «пространственная способность».
Более вероятно, что универсальные способности к рассуждению, изначально присущие большим языковым моделям для понимания текста и кода, уже начали естественным образом распространяться на трёхмерный мир.
От рисования пеликана до построения Миддл-земля — задача, кажется, изменилась, но, возможно, в основе тестируется один и тот же вопрос:
Может ли модель превратить свое понимание мира в структуру, которая действительно способна работать.
И в конце концов, возможно, возникает еще более невероятный вопрос —
Если универсальные большие модели уже могут сами писать код для построения 3D-миров, а затем вызывать API вроде Seedance и ElevenLabs для завершения изображения и звука, то насколько еще необходимо пользователю лично открывать специальный продукт для генерации видео и вводить промпт?
Ссылки
[1]https://karpathy.ai/lotr-movie/
[2]https://simonwillison.net/2025/Jun/6/six-months-in-llms/
[3] https://x.com/wizardbrainz/status/2083012159341203708
[4]https://x.com/aniketjart/status/2083645765097033845
[5]https://x.com/davidfromkansas/status/2075691129899528254
[6]https://x.com/MindaugasLT/status/2083488027343470939
Эта статья из WeChat Official Account «Quantum Bit», автор: henry







