# Artikel Terkait Pra-pelatihan

Pusat Berita HTX menyediakan artikel terbaru dan analisis mendalam mengenai "Pra-pelatihan", mencakup tren pasar, pembaruan proyek, perkembangan teknologi, dan kebijakan regulasi di industri kripto.

10.000 Jam Data Manusia, Melatih Model Gerakan Implisit Dunia Bergerak Seluruh Tubuh Global Pertama

Perusahaan kecerdasan embodied Zhi Zai Wu Jie merilis **Being-M0.7**, model aksi-dunia laten (Latent World-Action Model) global pertama yang dirancang untuk operasi mobile-manipulasi seluruh tubuh robot humanoid. Model ini mengatasi tiga tantangan utama dalam pengembangan robot humanoid: 1) biaya pengumpulan data demonstrasi robot fisik yang tinggi dan langka, 2) beban komputasi besar dari model prediksi video piksel, dan 3) kurangnya koordinasi antara kontrol gerak dan manipulasi. Being-M0.7 dilatih awal dengan lebih dari **10.000 jam data multimodal berpusat pada manusia** (video sudut pandang orang pertama, data gerakan manusia), menggunakan arsitektur **Vision-Motion Mixture of Transformers (MoT)**. Arsitektur ini memungkinkan pelatihan bersama data berpasangan (video-gerakan), data video murni, dan data gerakan murni. Model kemudian diadaptasi ke tubuh robot spesifik melalui sejumlah kecil data demonstrasi robot fisik dengan bantuan **Action Expert** yang ringan. Model ini menggunakan representasi gerak seragam yang ringkas (hanya kepala, kedua tangan, dan kaki) untuk menjembatani perbedaan morfologi antara manusia dan robot, serta menerapkan prediksi dalam ruang laten (bukan ruang piksel) untuk fokus pada informasi semantik yang relevan dengan kontrol dan mengurangi kebisingan. Kemampuannya diuji dalam empat demonstrasi tugas menantang di dunia nyata dengan robot Unitree G1: * **Menangkap ikan di akuarium:** Mengoordinasikan gerak seluruh tubuh untuk menangkap target dinamis dalam cairan. * **Mengambil objek melalui cermin:** Menyimpulkan posisi objek tersembunyi menggunakan informasi pantulan cermin. * **Memindahkan dan mengambil objek secara berurutan:** Menjaga pemahaman status dalam tugas jangka panjang dengan banyak subtugas. * **Memindahkan kotak sambil menghindari rintangan:** Menyesuaikan orientasi tubuh dan langkah untuk melewati celah sempit sambil membawa beban. Hasilnya menunjukkan kemampuan model dalam **perencanaan jangka panjang, penalaran ruang, penggunaan alat, dan koordinasi seluruh tubuh yang adaptif** berdasarkan prediksi keadaan masa depan. Pendekatan ini menggeser fokus kompetisi robot humanoid dari demonstrasi gerak murni ke kemampuan model yang dapat diskalakan, dengan memanfaatkan data perilaku manusia yang melimpah sebagai landasan untuk pembelajaran dan transfer pengetahuan ke robot.

marsbit07/15 01:53

10.000 Jam Data Manusia, Melatih Model Gerakan Implisit Dunia Bergerak Seluruh Tubuh Global Pertama

marsbit07/15 01:53

Karpathy Baru-Baru Ini Mengkritik: Satu Kalimat Membuat Seluruh Pengembang Agent Diam Seribu Bahasa

Karpathy, peneliti inti tim pra-pelatihan di Anthropic, mengejutkan komunitas pengembang AI Agent dengan pernyataan tegasnya: "Kesalahan terbesar di bidang AI saat ini adalah orang-orang terburu-buru memaksa Agent bekerja, tanpa memahami model dasar yang mendasarinya terlebih dahulu." Dia berbagi pelajaran berharga dari proyek "World of Bits" tahun 2016 di OpenAI, yang bertujuan membuat Agent menggunakan komputer, tetapi gagal karena teknologi saat itu (seperti reinforcement learning) belum matang. Menurutnya, fokus yang benar saat itu adalah pada pengembangan model bahasa. Karpathy memberikan tiga saran penting: 1. Berhenti memaksa Agent melakukan segalanya; perbaiki dan pahami model dasarnya terlebih dahulu. 2. Membuat demo mudah, tetapi mengubahnya menjadi produk yang matang membutuhkan waktu hingga sepuluh tahun, seperti yang terlihat pada contoh mobil otonom dan VR. 3. Agent bukanlah produk itu sendiri; kemampuan dasar model lah yang merupakan produk sejati. Agent akan muncul secara alami jika fondasinya kuat. Ia juga mendorong para pengembang untuk belajar dari neurosains, seperti struktur otak manusia (misalnya, hipokampus untuk memori), untuk merancang Agent yang lebih baik. Pesan utamanya adalah: meskipun perusahaan besar seperti OpenAI unggul dalam pelatihan model bahasa besar, dalam pengembangan Agent, pengembang independen dan startup berada di garis terdepan. Tidak ada raksasa teknologi yang memiliki keunggulan lima tahun di bidang ini, sehingga peluang inovasi terbuka lebar bagi mereka yang gesit dan berani mencoba. Intinya, Karpathy tidak melarang pengembangan Agent, tetapi menekankan pentingnya fondasi yang kuat dan kesiapan untuk komitmen jangka panjang.

marsbit07/06 02:35

Karpathy Baru-Baru Ini Mengkritik: Satu Kalimat Membuat Seluruh Pengembang Agent Diam Seribu Bahasa

marsbit07/06 02:35

Pertama Kali: Pra-pelatihan VLA Murni dari Video Manusia untuk Operasi Cekatan, Dapat Diterapkan Hanya dengan Sedikit Data untuk Fine-tuning

Riset kolaboratif dari Microsoft Asia Research dan Universitas Tsinghua memperkenalkan kerangka pra-pelatihan VITRA, yang pertama kali memanfaatkan video aktivitas manusia skala besar untuk pra-pelatihan model Vision-Language-Action (VLA) dalam manipulasi lincah. Inti inovasinya adalah solusi otomatis untuk mengubah video manusia tanpa anotasi menjadi data V-L-A terstruktur. Melalui ekstraksi jejak gerakan 3D tangan, segmentasi aksi atomik berdasarkan kecepatan, dan pembuatan instruksi bahasa dengan GPT-4, dibangun dataset besar berisi 1 juta klip. Model VLA, dengan arsitektur gabungan VLM (PaliGemma-2) dan Diffusion Action Expert, menunjukkan kemampuan prediksi gerakan **zero-shot** yang kuat di lingkungan tak terlihat. Setelah penyetelan halus (**fine-tuning**) hanya dengan sekitar 1.2K data robot nyata, model berhasil diterapkan pada robot lengan lengkap dengan tangan lincah (seperti Realman dengan XHAND1), mencapai tingkat keberhasilan tinggi dalam tugas seperti mengambil, menempatkan, menuang, dan menyapu, serta menunjukkan **kemampuan generalisasi dan ketangguhan** yang luar biasa terhadap objek dan latar belakang baru. Penelitian ini juga mengungkap **hukum penskalaan (_scaling law_)** antara jumlah data pra-pelatihan dan peningkatan kinerja. Dukungan perangkat keras dari tangan lincah XHAND1, dengan model URDF presisi tinggi dan arsitektur penggerak langsung (_direct-drive_), memungkinkan alih ruang gerak manusia-robot dan eksekusi yang responsif. Karya terobosan ini membuka jalan bagi pelatihan model VLA yang lebih efisien dan dapat digeneralisasi, menggunakan data video manusia yang melimpah, mendekatkan pada realisasi kecerdasan berwujud (_embodied AI_) yang lincah dan adaptif.

marsbit06/08 08:57

Pertama Kali: Pra-pelatihan VLA Murni dari Video Manusia untuk Operasi Cekatan, Dapat Diterapkan Hanya dengan Sedikit Data untuk Fine-tuning

marsbit06/08 08:57

活动图片