Tunjukkan Padaku "The Lord of the Rings", Karpathy Rekomendasikan Tolok Ukur Baru untuk Evaluasi Model Besar
Karpathy dari Anthropic memperkenalkan "The Lord of the Rings (LOTR) Benchmark", sebuah tolok ukur baru untuk menguji kemampuan model bahasa besar (LLM) dalam tugas pemahaman ruang dan pembuatan kode yang kompleks.
Tantangannya adalah meminta LLM (Claude 3.5 Opus dalam demo ini) untuk membaca awal novel "The Lord of the Rings" dan menerjemahkannya menjadi dunia 3D interaktif yang berjalan di browser menggunakan Three.js. Proses ini membutuhkan sekitar 100 juta token, 2 jam, dan 5500 baris kode. Hasilnya adalah animasi 3D sederhana yang menunjukkan karakter dan adegan awal cerita, meskipun masih terdapat kesalahan teknis seperti karakter yang melayang.
Benchmark ini diusulkan sebagai pengganti tes "Pelican Riding a Bicycle" SVG yang populer sebelumnya. Tes baru ini dianggap lebih menantang karena tidak hanya menguji pembuatan gambar statis, tetapi juga kemampuan model untuk memahami hubungan spasial, merencanakan proyek besar, menulis kode panjang, dan memelihara konsistensi visual sepanjang waktu.
Demo ini memicu respons luas dari komunitas. Banyak pengguna mencoba tugas serupa dengan model lain seperti DeepSeek, menghasilkan proyek seperti model 3D kota New York, konser Kanye West virtual, hingga prototipe game. Hal ini menunjukkan potensi LLM dalam menurunkan ambang batas pembuatan konten 3D dan prototipe yang dapat dimainkan.
Diskusi berlanjut tentang apakah tes ini benar-benar mengukur "pemahaman spasial" atau hanya keterampilan penulisan kode Three.js yang baik. Namun, banyak yang setuju bahwa kemampuan model untuk menerjemahkan deskripsi tekstual yang kompleks ke dalam dunia 3D yang koheren merupakan kemajuan signifikan dalam kemampuan penalaran umum mereka.
Karpathy telah membuka sumber proyek demo LOTR, mendorong eksplorasi lebih lanjut tentang bagaimana LLM dapat menciptakan, memahami, dan berinteraksi dengan dunia virtual.
marsbit8m yang lalu