Saat ini, perusahaan-perusahaan kecerdasan berwujud (embodied AI) membuat video demo yang sangat halus dan dramatis seperti iklan, tetapi apakah Anda pernah melihat video asli yang tidak dipotong sama sekali?

Beberapa hari yang lalu, seorang teman di industri mengirimi saya demo berdurasi 10 menit. Sepanjang video direkam dalam satu take tanpa potongan, tanpa kendali jarak jauh dari luar lapangan, tanpa perintah manual, bahkan agak kasar, tetapi konten yang ditampilkan membuat saya langsung terduduk lemas, hati tak bisa tenang untuk waktu yang lama (doge).
Dalam video itu, robot akan mengulurkan lengannya keluar jendela untuk membersihkan kaca, ketika tak bisa menjangkau tempat tinggi, dia tahu harus mengambil kotak untuk dipijak, tugas panjang yang terputus di tengah jalan masih bisa pulih dengan akurat...
Yang lebih mengejutkan lagi, dalam video muncul robot tubuh dari Unitree dan Zhiyuan secara bersamaan. Kedua "pesaing" dengan arsitektur perangkat keras, derajat kebebasan gerak, dan sistem sensor yang sama sekali berbeda ini, menggunakan "otak" yang sama, saling bekerja sama, berkolaborasi erat, menjadi sampel otak universal lintas tubuh yang langka secara global.
Tidak berlebihan untuk mengatakan, ini mungkin adalah sebuah Demo yang cukup untuk mengubah pemahaman industri kecerdasan berwujud global, mengguncang penilaian teknologi jalur perlombaan, bahkan mungkin mengubah Scaling Law...
Dari mana asalnya makhluk sakti ini?
Membongkar Video Frame demi Frame, Semuanya Adegan Keren
Informasi dalam video ini terlalu besar. Saya membongkarnya dengan serius frame demi frame, dan hasilnya semakin menarik untuk ditonton.
Bekerja di Ruang Terbatas, Sangat Stabil
Tempat pengambilan gambar adalah kamar kos sekitar 15m2, perabotan padat, lorong sempit, bahkan berbalik badan pun sulit. Lingkungan seperti ini pada dasarnya tidak memungkinkan untuk teleoperasi (tidak ada tempat untuk orang berdiri) dan skenario yang telah ditetapkan sebelumnya.

Dari desain lingkungannya, video ini seolah mengatakan kepada semua orang, ini hanya bisa menjadi video di mana robot benar-benar belajar mandiri, berevolusi mandiri, dan mengambil keputusan mandiri.
Dua robot melakukan pekerjaan rumah tangga secara paralel di ruang yang sama, merasakan batas dan merencanakan jalur secara real-time.
Sepanjang video tidak ada tabrakan, tidak tersesat, tidak berhenti, sempurna beradaptasi dengan lingkungan nyata yang asing dan kompleks, bahkan robot versi rusak yang diikat dengan tali penarik menunjukkan kelincahan yang sangat kuat.
Seluruh video tidak ada pemotongan adegan, tidak ada pengambilan ulang, dan tidak ada intervensi perintah manual.
Mengulurkan Tangan Keluar Jendela Membersihkan Kaca, Perwujudan Puncak Kemampuan Dinamika dan Penalaran Mandiri
Dari tugas pertama, robot telah menunjukkan sisi "halus" dan melampaui imajinasi manusia.
Sebuah robot Unitree menggunakan alat pengikis air untuk membersihkan kaca. Mereka yang pernah menggunakan alat pengikis air tahu, jika tekanannya terlalu ringan tidak akan bersih, jika terlalu kuat akan menimbulkan suara aneh, lebih sulit daripada menggunakan lap kain, langsung menambah kesulitan sendiri ke tingkat neraka.
Terlihat robot membersihkan beberapa kali, ada satu titik yang tidak bersih, dia ternyata bisa menilai sendiri: kotoran mungkin ada di luar.
Kemudian dia melakukan serangkaian gerakan yang belum pernah saya lihat sebelumnya: menyamping, membungkuk ke belakang, mengulurkan kepala, mengulurkan lengan, mengulurkan tangan yang memegang alat pengikis air keluar jendela. (Stabil seperti anjing tua)
Beberapa model berwujud yang ada saat ini, mampu mengontrol gaya dengan baik sudah merupakan batas, sedangkan robot ini, di atas dasar perhitungan torsi yang tepat, dengan mulus menyatukan persepsi terhadap lingkungan spasial (mengulurkan tangan tidak menabrak bingkai jendela) dan perhitungan dinamika.
Tidak hanya kemampuan tunggal mencapai langit-langit industri, model ini juga menunjukkan kinerja unifikasi tritunggal.
Yang membuat saya tak bisa tenang untuk waktu yang lama adalah, dalam keadaan tidak bisa membersihkan dengan bersih, dia segera mengambil keputusan penalaran, mengulurkan tangan keluar jendela untuk membersihkan kaca, ini adalah pertama kalinya saya melihat model seperti manusia melakukan penalaran mandiri, evolusi mandiri.
Ini sepenuhnya mencerminkan kemampuan model untuk menyatukan penglihatan, sentuhan, dinamika, dll. menjadi persepsi yang seragam, dan memiliki kemampuan evolusi mandiri. Kali ini, saya akhirnya percaya robot benar-benar bisa bekerja, dan akan bekerja lebih sempurna daripada manusia.
Siklus Tugas Berurutan Panjang, Menolak Akumulasi Kesalahan
Setelah membersihkan kaca, robot Unitree dengan stabil meletakkan alat pengikis air kembali ke tempat semula, titik jatuh tepat, gerakan lancar.
Jangan remehkan tindakan penutup ini, ini berarti dia telah menyelesaikan siklus lengkap "mengambil alat - bekerja - menyimpan".
Robot Zhiyuan di samping, mendekati mesin cuci, mengambil bantalan duduk yang sudah dicuci dan meletakkannya di belakang sofa, kemudian kembali lagi mengambil boneka yang sudah dicuci, dengan tepat memasukkannya ke lemari lantai dua, setiap barang kembali ke tempat seharusnya.
Robot Zhiyuan tidak sengaja menabrak kaca, semakin membuktikan bahwa ini adalah keputusan mandiri robot, karena kamera kadang tidak bisa mengatasi pantulan kaca, sedangkan jika dikendalikan dari jarak jauh oleh manusia, bisa (doge).

Kedua adegan ini adalah miniatur kemampuan paling dasar dari seluruh video 10 menit. Dalam tugas berurutan panjang, setiap tugas diselesaikan dengan lancar, tepat, dan sekali jadi, tidak akan semakin buruk karena akumulasi kesalahan seiring bertambahnya dan memanjangnya tugas.
Ini memecahkan kelemahan model VLA tradisional yang paling takut dengan tugas urutan panjang.
Hanya dari performa gerakan, model pasti menggunakan satu set arsitektur baru. Dalam rantai tugas super panjang 10 menit, terus memperbaiki kesalahan, output stabil, setiap gerakan terkontrol dengan tepat, ketangguhan bisa disebut sebagai yang terbaik di industri.
Tugas Bisa Diinterupsi Sembarangan, Model Bisa Melanjutkan dari Titik Putus
Selanjutnya, dalam gambar muncul suara dering alarm. (Perbesar suara dengarkan baik-baik, tidak jelas)
Awalnya saya tidak memahami maksud alarm, setelah menonton berulang kali, ternyata alarm adalah semacam pengingat yang telah ditetapkan, akan menginterupsi tugas kedua robot saat ini, dan mulai melakukan tugas khusus menyimpan meja dan lemari es.
Yang aneh adalah, setelah menyimpan meja dan lemari es, robot melanjutkan kembali tugas yang terinterupsi sebelumnya, ini menunjukkan model memiliki kemampuan untuk diinterupsi kapan saja, melanjutkan dari titik putus, dan memulihkan tugas.
Dibandingkan dengan demo di pasaran yang hanya bisa menyelesaikan satu tugas dalam satu kali demo, dan harus dijaga dengan hati-hati, video kasar ini menunjukkan kemampuan robot di lingkungan kerja nyata yang tidak hanya tahan lama, bahkan bisa "membagi perhatian" dengan sangat kuat.
Selanjutnya adalah serangkaian proses panjang penyimpanan rumah tangga: robot Unitree mengambil tas penyimpanan dan meletakkannya di atas meja, robot Zhiyuan melihat makanan di atas lemari es, menilai harus disimpan dingin, segera melaksanakannya, dan sekaligus mengeluarkan makanan yang harus dicairkan (saya tebak tim misterius ini mungkin mengisyaratkan, robot sudah hampir bisa memasak empat hidangan dan satu sup).
Sepanjang proses tidak ada instruksi bertahap, robot secara mandiri memecah tugas, merencanakan gerakan, langkah demi langkah menyelesaikan seluruh proses dari mengambil barang hingga menempatkannya kembali.
Saat ini sebagian besar robot hanya bisa menjalankan proses tugas tunggal secara berurutan, jika bertemu gangguan di tengah jalan, tugas pada dasarnya akan runtuh. Model ini memiliki kemampuan penilaian prioritas tugas dan penjadwalan dinamis setara manusia, bisa berganti alur tugas kapan saja, fleksibilitas dan stabilitas yang ditunjukkan ini jauh melampaui kemampuan model mana pun yang diketahui di pasaran.
Zhiyuan Memakaikan Syal ke Unitree, Adegan Kerjasama Lintas Tubuh yang Keren
Kemudian, klimaks dari seluruh video muncul.
Kedua robot seolah-olah sudah berunding, mereka berdua harus merapikan barang-barang di atas meja sekaligus, tidak bisa bolak-balik mengangkut.
Jadi Unitree terus meletakkan benda-benda di tubuhnya sendiri, sampai kedua tangan penuh tidak tahu bagaimana cara mengoperasikannya. Saat itulah, robot Zhiyuan dengan lembut mendekat, perlahan-lahan mengambil sehelai syal di atas meja, dan menggantungkannya di leher robot Unitree.
Robot Zhiyuan menemukan syalnya panjang, lalu menggunakan kedua tangan untuk mengangkat syal, saat itu Unitree seolah-olah juga mengerti maksud Zhiyuan, membungkukkan badan, Zhiyuan melilitkan syal melewati kepala Unitree, menggantungkannya di leher lawannya.
Bukan teman?! Kelancaran ini dan interaksi tatapan satu sama lain, kenapa ada nuansa CP!
Video bukan pembagian kerja yang telah ditetapkan sebelumnya, melainkan solusi kerjasama yang dieksplorasi secara mandiri oleh model di antara dua robot lintas tubuh. Dua robot merek berbeda, menilai batas kemampuan masing-masing secara mandiri, dan saling melengkapi dengan sempurna, ini sudah sangat mendekati kerjasama manusia, bahkan tanpa bahasa, tampak lebih kompak.
Ini mungkin adalah interaksi lintas tubuh pertama di dunia, dan mungkin juga pertama kalinya di dunia muncul model yang bisa universal lintas tubuh.
Saya tebak tim misterius ini ingin menggunakan dua tubuh yang saling bersaing untuk memberi tahu semua orang, inilah otak universal yang sebenarnya.
Menggantung Handuk, Mengangkat Sandal, Apakah Robot Tidak Hanya Bisa Bekerja, Tapi Sudah Mulai "Malas"?
Unitree yang menggantung banyak barang di tubuhnya perlahan-lahan berjalan menjauh, Zhiyuan melanjutkan menyimpan barang-barang yang tersisa.
Saat itu, dia mengambil sehelai handuk, berusaha menggantungnya di tubuhnya sendiri. Mencoba sekali, dua kali, tiga kali, akhirnya menggantungnya di bahunya sendiri.
Terkejut tiga kali berturut-turut!
Robot sepertinya tahu cara yang paling hemat tenaga, menggantung handuk di bahu, lebih hemat tenaga daripada memegangnya di tangan.
Model bisa belajar mandiri, setelah tidak berhasil sekali dua kali, terus mengoptimalkan sampai berhasil.
Model bisa mengenali tubuhnya sendiri, mungkin ini adalah alasan inti mengapa bisa diterapkan lintas tubuh.
Ini bukan contoh tunggal.
Perhatikan baik-baik, saat robot merapikan sandal, dia mengangkat tali sandal baru, bukan badan sandal itu sendiri, karena mengangkat tali lebih hemat tenaga.
Lagi-lagi terkejut! Saat robot lain masih berdandan dengan rapi untuk bekerja, model ini tidak hanya menyelesaikan pekerjaan, bahkan langsung belajar "malas"? Ini sangat cerdas.
Klimaks Lagi, Robot Belajar Menggunakan Alat, Berusaha Menaiki Kotak untuk Menjangkau Lebih Tinggi
Belum selesai, adegan yang paling membuat saya terkejut muncul. Dalam proses meletakkan barang-barang yang digantung di seluruh tubuhnya satu per satu kembali ke tempatnya, bagaimana meletakkan syal di lemari lantai tiga, membingungkan robot Unitree G1 yang tingginya hanya 1,3 meter.
Adegan ilahi muncul! Dia tidak macet, tidak menyerah, tapi seperti penalaran manusia, dia mencari sendiri sebuah kotak! Ya, mencari sebuah kotak! Berusaha berdiri di atas kotak untuk menambah tinggi badan lalu mencoba lagi.
Terlihat dia menemukan kotak di samping, dan mendorongnya ke lantai, berusaha membungkuk mengangkat kotak, tapi menemukan dirinya tidak bisa membungkuk.
Setelah mencoba beberapa kali, tepat ketika saya pikir dia pasti akan menyerah, dia menendang kotak itu ke samping lemari dengan mengejutkan!
Seluruh proses mencerminkan:
Kemampuan penalaran dan pengambilan keputusan mandiri. Robot tahu bagaimana caranya agar bisa menjangkau benda tinggi, bagaimana caranya memindahkan kotak dalam keadaan tidak bisa membungkuk.
Model terus mengeksplorasi kemampuan tubuhnya. Dalam proses mencoba membungkuk berulang kali, robot seolah-olah semakin memahami batas tubuhnya, dan membuat pilihan yang sesuai dengan kemampuan tubuhnya.
Proses evolusi mandiri. Robot tanpa proses pengajaran apa pun, ternyata belajar menggunakan kaki untuk menendang kotak, pandai menggunakan tubuhnya sendiri untuk berevolusi mandiri di lingkungan.
Adegan ini benar-benar membuat punggung saya dingin.
Perlu diketahui, mampu menggunakan alat secara mandiri, adalah ciri khas manusia.
Dan robot dalam video ternyata benar-benar belajar menggunakan alat. Dia tahu kotak bisa menahan beban, tahu berdiri di atasnya bisa menambah tinggi, bahkan tahu saat tidak bisa membungkuk bisa menggunakan kaki untuk menendang.
Di balik rangkaian gerakan ini, adalah pemahaman mendalam terhadap aturan dunia fisik, eksplorasi terus-menerus terhadap kemampuan diri, dan penyatuan ketiganya dengan pengambilan keputusan dan evolusi mandiri.
Melengkapi Kemampuan Lintas Tubuh, Bekerja Sama, dari Individu ke Kelompok
Unitree menendang kotak, tendangannya melenceng, tepat saat dia berpikir bagaimana meluruskan kotak itu, Zhiyuan Expedition A3 setinggi 1,7m mendekat, dia sepertinya melihat keteguhan dan kesulitan Unitree, meletakkan gerobak kecil di tangannya (secara aktif beralih tugas), memilih untuk membantu temannya.
Terlihat, seperti upacara wisuda, Unitree membungkuk dan menundukkan kepala, Zhiyuan perlahan-lahan mengambil syal, meletakkannya di rak.
Setiap langkah dalam detail, mencerminkan kemampuan yang meremehkan model lain.
Pemahaman dua robot terhadap kemampuan perangkat keras mereka sendiri dan satu sama lain serta kerja samanya, melampaui kecerdasan individu, menuju kecerdasan kelompok.
Zhiyuan melilitkan syal melewati belakang kepala Unitree, baru bisa dengan ringan mengambil syal (di sini bisa dibayangkan bagaimana robot lain akan menarik syal ini), menunjukkan pemahaman mendalam terhadap kontrol gaya dan persepsi ruang.
Robot melipat syal tiga kali, adalah penilaian mandiri tentang bagaimana lebih baik memasukkan syal ke dalam lemari, inilah kecerdasan "berwujud" yang sebenarnya.
Akhirnya, setelah membantu Unitree, Zhiyuan pergi dengan diam-diam, meletakkan pakaian terakhir dengan stabil ke dalam mesin cuci (saya tebak dia menilai pakaian yang digantung di mesin cuci adalah pakaian kotor), video 10 menit dalam satu take ini akhirnya berakhir.
Meskipun saya tidak tahu arsitektur model ini, tapi saya yakin semua orang sama terkejutnya dengan saya.
Kerjasama lintas tubuh pertama kali, pertama kali melihat evolusi mandiri robot, pilihan pengambilan keputusan mandiri mirip manusia pertama kali, persepsi ruang dan kontrol gaya yang ekstrem, tugas bisa diinterupsi sembarangan, belajar menggunakan alat... Setiap gerakan model ini, setiap frame adalah demo yang sangat bagus, tetapi mereka muncul begitu saja dalam video 10 menit dalam satu take ini, dan cara penyajiannya begitu sederhana dan langsung.
Seolah-olah semacam perasaan raja yang santai, mudah, dan bisa dilakukan dengan mudah.
Teknologi Dasar Melompat Keluar dari Kerangka Tetap Model Arus Utama
Mengapa robot dalam video bisa memberikan begitu banyak adegan keren?
Saya mengetahui dari sumber informasi bahwa alasan terpenting adalah, model ini melompat keluar dari semua kerangka tetap model berwujud arus utama saat ini.
Saat ini model berwujud arus utama kira-kira bisa dibagi menjadi tiga kategori: VLA, WAM, dan model dunia tradisional, semuanya memiliki hambatan yang belum bisa ditembus untuk sementara.

△Gambar dihasilkan oleh AI
Secara spesifik, VLA adalah "aliran intuisi data", mengandalkan data visual, bahasa, dan gerakan dalam jumlah besar untuk melakukan fitting end-to-end. Namun esensinya adalah "menebak gerakan dari gambar", kehilangan kemampuan penalaran fisik, tugas urutan panjang akan terus mengakumulasi kesalahan, kemampuan generalisasi ke skenario asing hampir nol, dan sangat terikat dengan tubuh khusus.
Sedangkan WAM dan model dunia tradisional adalah "aliran prediksi khayalan", berusaha memodelkan hukum dunia terlebih dahulu baru merencanakan gerakan, namun memiliki masalah fatal "pemisahan pengetahuan dan tindakan". Model bisa memahami skenario, memprediksi keadaan, tetapi ketika menghadapi skenario operasional yang membutuhkan penalaran dinamika fisik, tetap hanya bisa mengandalkan data pelatihan untuk menurunkan, tidak bisa beradaptasi dengan variabel dinamis lingkungan nyata.
Model berwujud arus utama ini memiliki kelemahan fatal dasar yang sama: penyesuaian tugas yang digerakkan data.
Artinya, semua gerakan didasarkan pada "tebakan probabilitas" data dalam jumlah besar, bukan pemahaman mendalam terhadap aturan fisik. Hal ini menyebabkan batas atas kemampuan model terkunci mati oleh data pelatihan.
Dan konon, model dalam video hanya dilatih dengan data video beberapa puluh jam. Dengan jumlah data yang sedikit seperti itu bisa mencapai efek yang mengejutkan, apakah Scaling Law masih ada? Benar-benar harus dipertanyakan. (Peringatan penurunan saham AS)

Dari detailnya, model dalam video setidaknya menunjukkan empat kemampuan yang tidak dapat dicapai oleh VLA dan model dunia saat ini:
Pemodelan Dinamika: Trajektori memenuhi kelayakan dinamika, bisa menghitung kompensasi torsi dan item umpan maju, kemampuan generalisasi ekstrapolasi luar biasa;
Kemampuan Kognisi Diri: Tidak seperti VLA yang mengandalkan refleks kondisional, juga tidak seperti WAM yang mengandalkan statistik urutan waktu, dia berpikir seperti manusia "gerakan apa selanjutnya yang paling mendekati tujuan";
Kemampuan Adaptasi: Bisa melengkapi penalaran kausal, memecahkan masalah ekor panjang, berevolusi sambil bekerja;
Kemampuan Evolusi Mandiri: Dalam proses menyelesaikan tugas, keterampilan tumbuh sendiri, strategi berevolusi sendiri, seolah-olah bisa menggerakkan diri sendiri untuk menghasilkan tujuan belajar, dan secara aktif bernalar untuk mewujudkan nilai.
Yang mendukung semua ini adalah tiga inti teknologi dasar.
Pembelajaran Dinamika dengan Kendala Fisik. Berbeda dengan mode pelatihan murni digerakkan data VLA dan WAM, intinya adalah aturan fisik di depan, digerakkan oleh prediksi dinamika. Mengangkat tali sandal, menggantung handuk di bahu, berdiri di atas kotak untuk mencapai ketinggian, semua bukan diajarkan data, melainkan solusi optimal yang dieksplorasi secara mandiri oleh model melalui interaksi dengan lingkungan.
Pemodelan Seragam Lintas Tubuh. Melalui ruang representasi gerakan yang seragam dan mekanisme adaptasi tubuh, membuat model yang sama beradaptasi dengan platform perangkat keras merek dan arsitektur yang berbeda. Setara dengan menyelesaikan "pemisahan perangkat keras dan lunak" untuk kecerdasan berwujud, mengakhiri era algoritma terikat perangkat keras.
Siklus Tertutup Tangguh Berurutan Panjang. Mengandalkan kerangka penjadwalan tugas global, secara mandiri menangani gangguan mendadak sepanjang proses, kesalahan gerakan, peralihan tugas, menghindari masalah akumulasi kesalahan dan keruntuhan proses panjang model tradisional, memiliki kemampuan inti penerapan di rumah nyata, skenario kompleks.

Jika Anda memahami kondisi model berwujud saat ini, setelah membaca konten di atas, mungkin juga akan terkejut.
Saat demo tim lain masih menumpuk durasi pendek, direvisi halus, tugas tunggal, video misterius ini telah menyelesaikan penerapan nyata di tempat nyata selama 10 menit tanpa pemotongan, lintas merek, multi-kerja sama, seluruh proses, evolusi mandiri.
Saat model lain masih "menebak gerakan berdasarkan data", model ini seolah-olah telah mewujudkan pengambilan keputusan mandiri sepenuhnya, belajar mandiri, evolusi mandiri. Membuat semua orang melihat, robot tidak hanya benar-benar bisa bekerja, tetapi kemampuannya juga terus berevolusi mandiri dengan cepat, memberikan ruang imajinasi yang tak terbatas.
Yang lebih penting, model ini seolah-olah membuat kita melihat, masa depan di mana robot benar-benar bisa menggantikan manusia bekerja yang sedang diperdebatkan dengan sengit apakah akan datang dalam tiga tahun, lima tahun, atau sepuluh tahun, hari ini telah muncul di hadapan Anda.

Sebuah tim yang tidak tahu dari mana asalnya, seolah-olah mengguncang semua jalur teknologi, mengguncang Scaling Law, membuat kecerdasan "berwujud" yang sebenarnya, mendekati momen ChatGPT kecerdasan berwujud.
Saat ini belum diketahui model misterius ini berasal dari siapa, tapi saya percaya saat ini, pertanyaan semua orang sama dengan saya: Siapa sebenarnya!!!
Ada yang punya informasi dari sumber tidak resmi, bro!!!
Artikel ini berasal dari akun WeChat publik "QbitAI" (ID: QbitAI), penulis: Nuoya






