# Artikel Terkait MMMU

Pusat Berita HTX menyediakan artikel terbaru dan analisis mendalam mengenai "MMMU", mencakup tren pasar, pembaruan proyek, perkembangan teknologi, dan kebijakan regulasi di industri kripto.

Di Balik 'Raport' AI, Tersembunyi Seorang 'Pembuat Soal' Tionghoa

Setiap kali model AI terdepan dirilis, industri melihat "laporan nilai" seperti MMLU-Pro, MMMU, dan MMMU-Pro. Tolok ukur ini telah menjadi bahasa umum untuk mengevaluasi kemampuan model. Di baliknya adalah nama seorang peneliti Tionghoa, Chen Wenhu, asisten profesor di University of Waterloo. Dia dan lab TIGERLab-nya menciptakan MMLU-Pro karena MMLU lama tidak lagi efektif—model canggih seperti OpenAI o3 hampir mencapai nilai sempurna. MMLU-Pro, dengan 12.032 soal lebih sulit dan 10 pilihan jawaban, berhasil membedakan kembali kemampuan model. Selain itu, mereka mengembangkan MMMU untuk mengevaluasi model multimodal (teks dan gambar) pada 11.500 soal dari berbagai disiplin ilmu. Bahkan model terkuat seperti GPT-4V hanya mencapai akurasi 56%. MMMU-Pro kemudian dibuat agar model tidak bisa mengandalkan teks saja dan harus benar-benar memahami informasi visual. Chen Wenhu memiliki latar belakang riset dalam pemahaman informasi kompleks. Pengalamannya di Google DeepMind untuk proyek Gemini membantunya memahami celah dalam evaluasi. Labnya juga mengerjakan penelitian model, seperti UniVideo untuk video dan MoCha untuk karakter virtual, yang memperdalam pemahaman mereka dalam merancang tolok ukur yang solid. Kini, dia bergabung dengan Meta untuk fokus pada data pelatihan dan evaluasi multimodal. Karyanya menggarisbawahi kontribusi signifikan peneliti Tionghoa di balik layar dalam membentuk standar evaluasi AI global.

marsbit06/20 03:54

Di Balik 'Raport' AI, Tersembunyi Seorang 'Pembuat Soal' Tionghoa

marsbit06/20 03:54

Di Balik Skor AI, Ada "Pembuat Soal" Seorang Tionghoa

Setiap peluncuran model AI terbaru, industri sering merujuk pada sejumlah "rapor" standar seperti MMLU-Pro, MMMU, dan MMMU-Pro. Di balik sistem evaluasi kunci ini, terdapat seorang "penyusun soal" bernama Chen Wenhu, asisten profesor di University of Waterloo. MMLU-Pro dikembangkan oleh Chen dan timnya sebagai respons atas keterbatasan MMLU lama. Ketika model-model mutakhir seperti o3 OpenAI mulai mencapai skor hampir sempurna, MMLU-Pro hadir dengan 12.032 soal yang lebih menantang, memperluas pilihan jawaban dan menekankan penalaran, sehingga berhasil membedakan kemampuan model yang sebelumnya tampak setara. Chen juga terlibat dalam MMMU, tolok ukur multimodal yang mengevaluasi pemahaman model terhadap gambar, grafik, dan teks secara terintegrasi. MMMU-Pro kemudian menyempurnakannya dengan memastikan model tidak bisa mengandalkan teks saja. Latar belakang Chen dalam pemahaman informasi kompleks dan pengembangannya di Google DeepMind untuk proyek Gemini memberinya wawasan mendalam. Ia mendirikan TIGERLab (atau "Geng Harimau"), yang tidak hanya fokus pada evaluasi tetapi juga riset model, seperti UniVideo untuk video dan MoCha untuk karakter virtual. Saat ini, Chen bergabung dengan Meta Super Intelligence Lab, terus berkontribusi pada data dan evaluasi multimodal. Karyanya mengingatkan bahwa di balik kemajuan AI yang terlihat, ada banyak talenta seperti dirinya yang membangun fondasi penting bagi perkembangan industri.

marsbit06/19 09:21

Di Balik Skor AI, Ada "Pembuat Soal" Seorang Tionghoa

marsbit06/19 09:21

活动图片