Sans plus de paroles, commençons notre séance quotidienne de farniente (doge) !
À l'instant même, le grand maître Karpathy a annoncé que « nous », Anthropic, avons commencé à utiliser une toute nouvelle méthode pour pousser les grands modèles dans leurs retranchements —
《Le Seigneur des Anneaux》.

Selon Karpathy, ce "benchmark du Seigneur des Anneaux" est en train de remplacer le test SVG "Pélican à vélo" qui a fait fureur par le passé.

Concrètement, Karpathy a directement donné le début du 《Seigneur des Anneaux》 à Opus 5, demandant au modèle de créer en direct un "monde de la Terre du Milieu" entier en utilisant Three.js.
Quant à l'effet final, cela ressemble un peu aux films d'animation 3D chinois de la fin des années 90 et du début des années 2000 : très grossier, et aussi très abstrait.
Mais objectivement parlant, en regardant attentivement pendant un moment, si vous êtes familier avec le site de tournage du 《Seigneur des Anneaux》 à Hobbiton, situé en Nouvelle-Zélande, vous pouvez effectivement en percevoir un certain parfum~
Cependant, ce truc qui semble peu raffiné a coûté à Opus 5 : 1 million de tokens, 2 heures et 5500 lignes de code.
Bien sûr, la scène n'est pas seulement occupée par Claude en solitaire.
Le plus drôle, c'est certainement la nouvelle version DeepSeek V4 Flash servie par les internautes.
Directement, un "Chinois peut voler", les personnages à l'écran flottent tous.
Face à ces incohérences visibles à l'œil nu, Karpathy est plutôt honnête.
Il souligne qu'Opus 5 ne peut pas encore vraiment "entrer" dans le monde qu'il génère, il ne peut que capturer des captures d'écran à différents moments, puis vérifier lentement où se trouvent les problèmes.
Et cela révèle précisément une faiblesse évidente des grands modèles actuels :
Ils sont déjà capables d'écrire du code, de construire des scènes, de générer des jeux, mais ils ne peuvent pas encore vraiment comprendre une vidéo, ni jouer eux-mêmes au jeu qu'ils ont créé.
Deux heures pour fabriquer manuellement la Terre du Milieu
Voyons d'abord comment ce test "Seigneur des Anneaux" est réalisé concrètement.
Si l'on s'en tient au sens littéral du tweet de Karpathy, le prompt principal donné à Opus 5 devrait être le début du premier chapitre du 《Seigneur des Anneaux》, 《Une fête longtemps attendue》.

Bilbo Bessac de Cul-de-Sac annonce qu'il va donner une grande fête pour son cent-onzième anniversaire, ce qui suscite immédiatement des discussions animées à Hobbitebourg......
Les personnes intéressées peuvent essayer par elles-mêmes.
En outre, Karpathy a également spécifié Three.js dans le prompt, c'est-à-dire une bibliothèque JavaScript pour construire des scènes 3D avec du code.
Ainsi, la tâche d'Opus 5 est de d'abord comprendre le texte du début du 《Seigneur des Anneaux》, puis de le traduire en un monde 3D pouvant fonctionner en temps réel dans un navigateur.

Pendant tout le processus, Opus 5 doit utiliser des polygones pour assembler des personnages, des bâtiments et des objets, les placer un par un dans un système de coordonnées x, y, z, puis organiser la caméra, les lumières et les animations.
Le moment où les personnages se déplacent, la direction vers laquelle la caméra tourne, comment les lumières changent, et comment les objets dans la scène interagissent, tout doit être défini par le modèle via du code.
Bien que l'image finale ne soit pas raffinée et que des problèmes comme le clipping ou la lévitation apparaissent fréquemment, par exemple le corps et la tête d'un personnage séparés... l'ensemble de la scène a tout de même été construite.

Il est important de noter que ce n'est pas la même chose qu'un modèle vidéo générant directement des pixels image par image.
Three.js doit d'abord établir les personnages, objets et scènes en tant qu'objets tridimensionnels, puis calculer en temps réel leur position, angle et état de mouvement selon le code.
Donc, la démo que nous voyons n'est pas une vidéo générée par IA ordinaire, mais un enregistrement d'écran d'une scène 3D web en cours d'exécution.
Cependant, Karpathy a également mentionné dans les commentaires que la 3D procédurale et la génération vidéo ne sont pas mutuellement exclusives.
Un internaute a suggéré de donner cet enregistrement Three.js grossier à Seedance comme vidéo de référence, puis de laisser un modèle vidéo le re-rendre avec une qualité graphique supérieure.

Karpathy a rapidement exprimé son accord.
Selon son idée, le code procédural pourrait être responsable du storyboard et du contrôle, fixant d'abord la structure : où les personnages se tiennent, comment la caméra se déplace, comment l'intrigue avance.
Ensuite, donner l'enregistrement à un modèle Video-to-Video pour qu'il ajoute les textures, les lumières et les détails, améliorant ainsi l'"apparence" du monde entier de la Terre du Milieu.
Quant à l'audio, Opus 5 ne s'en est pas chargé cette fois.
Karpathy a déclaré que, pour des raisons de qualité personnelle, ils ont finalement utilisé ElevenLabs.

C'est ainsi que cette démo du 《Seigneur des Anneaux》 avec images, caméra et voix-off est née.
Karpathy a déjà open-source l'ensemble du projet, le lien spécifique se trouve en fin d'article.

Les internautes sont bien plus intéressants que Karpathy
Peu après que Karpathy ait publié la démo, de nombreux internautes sont venus la tester.
Dans l'ensemble, on peut dire :
Les internautes de cette génération ont beaucoup plus d'imagination que Karpathy.
Quelqu'un a lancé un projet « Earth Online » avec Claude, visant à construire progressivement la Terre entière avec un groupe d'Agents IA.
Actuellement, les Agents n'ont pas encore fini toute la Terre, n'ayant construit qu'un quartier au bord de l'eau de San Francisco en style low poly. Mais d'après les images actuelles, la proportion des bâtiments, l'échelle des personnages et le style général restent relativement cohérents.
Cet effet ressemble un peu à ce genre de films d'animation en Lego. Le style graphique n'est pas complexe, mais les personnages, scènes et actions peuvent fonctionner de manière stable dans le même monde.
En poursuivant dans cette direction, l'animation au style simple et les jeux légers commencent à avoir un début d'aspect natif de l'IA.
D'autres utilisateurs ont créé un modèle numérique 3D de New York avec Fable 5 et GPT-5.6 Sol, et y ont intégré des données en temps réel.
Le modèle doit non seulement positionner correctement les rues et les bâtiments de New York, mais aussi maintenir les relations spatiales entre les différentes zones. L'auteur suggère donc que ce genre de tâche de génération de mondes virtuels pourrait devenir un nouveau benchmark de raisonnement spatial.
Le plus exagéré est encore à venir.
Un internaute n'ayant pas réussi à acheter de billet pour le concert de Kanye West, s'est simplement généré un concert privé dans son navigateur avec l'IA.
Le projet est également construit avec Three.js. Un seul fichier HTML, sans utiliser aucun modèle 3D préexistant, la scène, les personnages et les lumières sont entièrement générés par du code.
Le concert propose 14 chansons, chacune avec son propre éclairage et une scène sphérique visuelle dédiée.
Les utilisateurs ordinaires peuvent écouter des extraits, et en se connectant à Spotify Premium, ils peuvent lire les morceaux complets et le concert entier.
N'avoir pas obtenu de billet, et simplement se générer un concert privé, c'est vraiment incroyable !
Ce n'est pas fini !!!
Karpathy, à la fin de son post original, a envisagé d'ajouter des mécaniques de jeu à ces mondes 3D, permettant aux joueurs d'y entrer en tant que spectateurs, PNJ, ou même personnages de l'histoire.
Mais avant que Karpathy n'ait le temps de créer la version jeu, les internautes l'ont déjà fait.

Ce projet utilise également Opus 5 et Three.js, peut non seulement fonctionner et interagir, mais inclut même l'audio.
De plus en plus d'exemples de conception 3D apparaissent. Des proportions architecturales, la disposition spatiale au style des scènes, Opus 5 est déjà capable de maintenir une cohérence relativement stable dans des projets de grande envergure.
Il existe de nombreux autres exemples similaires, que nous ne montrerons pas ici un par un.
Objectivement parlant, ces œuvres sont encore loin d'être des jeux véritablement aboutis.
Si les mécaniques de jeu complexes sont amusantes, si l'exécution à long terme est stable, si les joueurs sont vraiment prêts à y rester 15 minutes, il n'y a pas encore de réponse à ces questions.
Mais le seuil de création de contenu 3D en temps réel et de prototypes jouables a effectivement été largement abaissé.
De plus, avoir une nouvelle méthode pour tester les capacités des modèles, tout en étant suffisamment intéressante et amusante, n'est-ce pas magnifique ?
Le pélican a assez pédalé
Alors, pourquoi soudainement demander à un grand modèle de générer 《Le Seigneur des Anneaux》 ?
Cela nous ramène au test "Pélican à vélo" qui a fait fureur il y a quelques années.
Cette question vient à l'origine du développeur Simon Willison, l'instruction n'était qu'une phrase :
Générez une image SVG d'un pélican faisant du vélo.

Bien que cette question semble simple, elle met en réalité le modèle à rude épreuve.
Parce qu'une SVG ressemble à une image, mais en coulisses, c'est une chaîne de code.
Le modèle doit non seulement savoir à quoi ressemblent respectivement un pélican et un vélo, mais aussi les décomposer en lignes, cercles et polygones, puis organiser la relation de position de chaque composant avec des coordonnées.

Plus crucial encore, le pélican et le vélo ne sont pas naturellement compatibles.
Le cadre, les pneus et les pédales du vélo doivent conserver la structure géométrique correcte ; le pélican, quant à lui, a un grand bec, des pattes courtes, et une silhouette qui ne semble vraiment pas faite pour pédaler.

Les combiner permet de voir presque immédiatement si le modèle comprend vraiment les relations spatiales :
Les roues sont-elles de travers, les pieds atteignent-ils les pédales, l'oiseau est-il vraiment en train de faire du vélo ou a-t-il été démembré par le cadre ?
Regardez ces démos de fin d'année 24 ci-dessus~
C'est pour cette raison que "Pélican à vélo" est devenu un test classique populaire pour observer la compréhension spatiale, la combinaison d'objets et la génération de code des grands modèles.

Mais à mesure que les modèles deviennent plus puissants, ce pélican a presque assez pédalé.
Il suffit de voir les performances de DeepSeek R1 et DeepSeek V4 ci-dessous pour savoir que les modèles actuels peuvent résoudre ce problème de manière assez correcte.

Plus important encore, une seule SVG ne peut évaluer qu'une sortie ponctuelle du modèle.
Elle ne peut pas tester si le modèle peut planifier un projet complexe, travailler de manière continue pendant plusieurs heures, et vérifier et corriger ses erreurs à travers des milliers de lignes de code.
Ainsi, Karpathy a remplacé un petit exercice de "dessiner une image" par un grand projet de "construire un monde" —
Le pélican peut descendre de vélo, le monde de la Terre du Milieu prend officiellement le relais.

Le pélican de Karpathy
Rapidement, la nouvelle que Karpathy préparait un changement de sujet pour le "test du pélican" s'est également répandue dans les grandes communautés.
Un commentaire populaire sur Hacker News estime que bien que la qualité visuelle de ces démos soit généralement médiocre, cela montre précisément que nous avons besoin d'un nouveau test plus difficile que la génération d'une simple image.
Le nouveau benchmark ne devrait pas se contenter de vérifier si le modèle peut dessiner correctement, mais aussi s'il peut comprendre un monde.

Après tout, le "Pélican à vélo" est utilisé depuis trop longtemps.
Les modèles continuent de grappiller des points sur ce type de tâches, rendant les différences entre eux de plus en plus difficiles à discerner.
En comparaison, générer un monde 3D complet nécessite que le modèle comprenne les relations spatiales entre personnages et objets, gère les changements de caméra, d'action et de scène, et pas simplement invoquer un modèle de génération vidéo pour produire une séquence d'images.

Bien sûr, certains s'y opposent également.
Le test du pélican est suffisamment simple, peu coûteux, et les résultats sont faciles à comparer.
Consommer autant de Tokens pour générer un monde 3D entier juste pour tester un modèle une fois, c'est un peu comme faire des feux d'artifice avec la puissance de calcul.

Parallèlement, la capacité de Three.js lui-même à mesurer les capacités globales des grands modèles a également été remise en question.
Certains pensent que ce genre de démo ne peut tout au plus prouver qu'Anthropic s'est bien entraîné sur le code Three.js, et ne montre pas que le modèle comprend vraiment l'espace et le monde physique.
Mais des internautes ont rapidement rétorqué :
Transformer un texte littéraire abstrait et au sens ambigu en une animation 3D nécessite que le modèle traite simultanément les relations spatiales, les lois physiques, les objets du quotidien, ainsi que les problèmes mathématiques des transformations 3D et de l'infographie.
Si cela ne peut être considéré que comme "savoir écrire du Three.js", c'est un peu sous-estimer ces 5500 lignes de code.

D'autres internautes ont soulevé une question encore plus ouverte :
Le prétendu "raisonnement spatial" est-il vraiment différent du raisonnement que les grands modèles effectuent habituellement avec du texte ou du code ?
Un point de vue soutient que l'établissement d'une image dépend de la compréhension par le modèle des relations spatiales comme "devant/derrière, intérieur/extérieur, proche/loin, occlusion", ainsi que de la distance, de l'angle et de la taille relative des objets sous différents angles de vue.

Mais un autre point de vue soutient que, que le modèle traite "à côté de la pierre" ou "à l'intérieur du tableau", il fait peut-être la même chose : générer des Tokens un par un en fonction du contexte, et accomplir le raisonnement au cours de ce processus.
Si c'est le cas, alors ce qu'Opus 5 montre n'est pas simplement une "capacité spatiale" qui apparaît soudainement.
Il est plus probable que la capacité de raisonnement général des grands modèles de langage, utilisée à l'origine pour comprendre le texte et le code, commence naturellement à s'étendre au monde tridimensionnel.
De dessiner un pélican à construire un monde de la Terre du Milieu, le sujet semble avoir changé, mais ce qu'on teste en coulisses est peut-être toujours la même question :
Le modèle peut-il transformer sa compréhension du monde en une structure réellement exécutable.
Et enfin, peut-être y a-t-il une question encore plus extravagante —
Si un modèle généraliste peut déjà écrire son propre code pour construire un monde 3D, puis invoquer des API comme Seedance, ElevenLabs pour compléter l'image et le son, alors dans quelle mesure l'utilisateur a-t-il encore besoin d'ouvrir personnellement un produit de génération vidéo spécialisé pour y saisir un prompt ?
Liens de référence
[1]https://karpathy.ai/lotr-movie/
[2]https://simonwillison.net/2025/Jun/6/six-months-in-llms/
[3] https://x.com/wizardbrainz/status/2083012159341203708
[4]https://x.com/aniketjart/status/2083645765097033845
[5]https://x.com/davidfromkansas/status/2075691129899528254
[6]https://x.com/MindaugasLT/status/2083488027343470939
Cet article provient du compte officiel WeChat "Quantum Bit", auteur : henry







