Model Generatif Bisa Dilatih End-to-End? Intinya Hanya Sebuah For Loop
Model generatif seperti model difusi atau autoregresif yang dominan saat ini biasanya tidak melatih seluruh proses generasi secara end-to-end. Mereka dilatih hanya untuk memprediksi satu "langkah kecil" dalam proses, namun saat inferensi, langkah ini harus diulang ratusan atau ribuan kali. Ketidaksesuaian ini menyebabkan masalah "exposure bias," di mana kesalahan menumpuk seiring waktu.
Makalah terbaru dari UIUC dan Harvard memperkenalkan paradigma baru bernama **Explorative Modeling (XM)**. Inti dari metode ini sangat sederhana: alih-alih menghasilkan satu sampel, model menghasilkan **K kandidat** dalam setiap langkah pelatihan. Kemudian, hanya kandidat yang paling dekat dengan data target yang dipilih untuk menghitung gradien dan memperbarui model.
Mengapa ini berhasil? Dalam tugas generatif, satu input bisa memiliki banyak output yang valid (mode). Fungsi kerugian rekonstruksi tradisional cenderung menyebabkan "mode blurring," di mana model hanya mempelajari rata-rata dari semua mode, menghasilkan output yang tidak realistis. Dengan menghasilkan beberapa kandidat, model dapat "mengeksplorasi" dan menangkap beberapa mode yang berbeda sekaligus, sehingga menghindari rata-rata yang kabur.
Penelitian ini menunjukkan bahwa **"eksplorasi" (K) bertindak sebagai sumbu penskalaan ketiga** yang efektif, selain parameter dan data. Eksperimen pada gambar, video, dan bahasa menunjukkan peningkatan kinerja yang monoton dengan peningkatan K, dengan keuntungan yang lebih besar pada skala yang lebih besar. XM dapat meningkatkan efisiensi FLOP hingga 4.1x dan efisiensi sampel hingga 6.2x.
Yang lebih menarik, ketika diterapkan secara ekstrem, XM memungkinkan **pelatihan generatif yang benar-benar end-to-end**. Dalam tugas kontrol robot, "Explorative Policy" berbasis XM mencapai kinerja yang setara dengan "Diffusion Policy" yang membutuhkan 100 langkah inferensi, sementara hanya membutuhkan satu langkah inferensi maju. Ini membuktikan bahwa kompleksitas untuk menangani banyak mode dapat dipindahkan dari inferensi ke pelatihan.
Meskipun ide "best-of-K" bukan hal baru, kontribusi utama makalah ini adalah penjelasan teoritis bahwa mekanisme ini secara langsung meningkatkan **ekspresivitas generatif** model. Dengan demikian, ini menawarkan cara baru yang ampuh untuk mengatasi tantangan mendasar dalam pemodelan generatif.
marsbit12m yang lalu