Karya Baru Tim He Kaiming: Menghapus VAE dan Data Privat, Hasil Generasi Gambar dari Teks Justru Lebih Baik
Tim riset Kai Ming He meluncurkan model teks-ke-gambar yang sangat sederhana bernama MiniT2I, yang menantang pendekatan rumit yang umum digunakan saat ini. Model ini menghilangkan komponen standar seperti pengkode VAE, mekanisme injeksi kondisi AdaLN, data privat, dan tahap penyelarasan RL/DPO. Sebagai gantinya, MiniT2I dilatih secara langsung di ruang piksel RGB menggunakan target pemadanan aliran pada model Transformer.
MiniT2I mengadopsi arsitektur MM-JiT yang sederhana, menggantikan mekanisme modulasi kondisi kompleks dengan dua blok adaptor teks ringan dan menghapus cabang AdaLN. Model ini dilatih secara dua tahap hanya menggunakan data publik: pra-pelatihan pada dataset CC12M yang diberi keterangan ulang, dan penyempurnaan pada sekitar 120 ribu pasangan gambar-teks berkualitas tinggi.
Dengan hanya 258 juta parameter (versi B/16), MiniT2I mencapai skor 0,87 pada GenEval dan 84,2 pada DPG-Bench, mengungguli model lain di ruang piksel yang jauh lebih besar. Keunggulannya meliputi biaya komputasi yang lebih rendah, arsitektur yang lebih mudah dipahami, dan hasil yang sebanding dalam hal kualitas dan keragaman gaya dengan model besar seperti SD3-Medium dalam beberapa skenario. Namun, model ini masih memiliki keterbatasan seperti artefak batas patch, efek samping CFG pada ruang piksel, dan kinerja yang lebih rendah dalam rendering teks dibandingkan sistem industri, yang memerlukan data yang lebih khusus.
marsbit06/22 10:20