Alumni Tsinghua '00 Wang Guan Kembali Hadir dengan Karya Baru: Gunakan Token 1/900, Komputasi 1/432, Ubah Paradigma Model Pra-Latihan Transformer
Alumni muda 00-an Universitas Tsinghua, Wang Guan, dan timnya merilis karya baru: model pra-pelatihan efisien HRM-Text, yang menggunakan model rekursif berlapis (HRM) untuk menggantikan Transformer standar. Dengan hanya 1B parameter dan dilatih pada 40B token unik dengan biaya sekitar $1.500, HRM-Text mencapai performa setara model sumber terbuka 2B hingga 7B dalam benchmark seperti MMLU (60,7%) dan GSM8K (84,5%). Metode ini menggunakan 100-900 kali lebih sedikit token pelatihan dan 96-432 kali lebih sedikit perhitungan dibanding baseline standar. Arsitekturnya membagi komputasi menjadi modul H (lambat) dan L (cepat) dengan pembaruan rekursif multi-langkah, sementara target pelatihannya berfokus hanya pada bagian jawaban dalam pasangan instruksi-jawaban, menggunakan masker PrefixLM. Pendekatan ini menunjukkan bahwa prior struktural dan target pelatihan yang ditargetkan dapat secara signifikan menurunkan ambang batas pra-pelatihan. Namun, ada batasan seperti cakupan pengetahuan yang terbatas dan kebutuhan validasi skala lebih besar di masa depan.
marsbit05/26 03:18