# Artikel Terkait Pengujian model

Pusat Berita HTX menyediakan artikel terbaru dan analisis mendalam mengenai "Pengujian model", mencakup tren pasar, pembaruan proyek, perkembangan teknologi, dan kebijakan regulasi di industri kripto.

Di Balik Skor AI, Ada "Pembuat Soal" Seorang Tionghoa

Setiap peluncuran model AI terbaru, industri sering merujuk pada sejumlah "rapor" standar seperti MMLU-Pro, MMMU, dan MMMU-Pro. Di balik sistem evaluasi kunci ini, terdapat seorang "penyusun soal" bernama Chen Wenhu, asisten profesor di University of Waterloo. MMLU-Pro dikembangkan oleh Chen dan timnya sebagai respons atas keterbatasan MMLU lama. Ketika model-model mutakhir seperti o3 OpenAI mulai mencapai skor hampir sempurna, MMLU-Pro hadir dengan 12.032 soal yang lebih menantang, memperluas pilihan jawaban dan menekankan penalaran, sehingga berhasil membedakan kemampuan model yang sebelumnya tampak setara. Chen juga terlibat dalam MMMU, tolok ukur multimodal yang mengevaluasi pemahaman model terhadap gambar, grafik, dan teks secara terintegrasi. MMMU-Pro kemudian menyempurnakannya dengan memastikan model tidak bisa mengandalkan teks saja. Latar belakang Chen dalam pemahaman informasi kompleks dan pengembangannya di Google DeepMind untuk proyek Gemini memberinya wawasan mendalam. Ia mendirikan TIGERLab (atau "Geng Harimau"), yang tidak hanya fokus pada evaluasi tetapi juga riset model, seperti UniVideo untuk video dan MoCha untuk karakter virtual. Saat ini, Chen bergabung dengan Meta Super Intelligence Lab, terus berkontribusi pada data dan evaluasi multimodal. Karyanya mengingatkan bahwa di balik kemajuan AI yang terlihat, ada banyak talenta seperti dirinya yang membangun fondasi penting bagi perkembangan industri.

marsbit06/19 09:21

Di Balik Skor AI, Ada "Pembuat Soal" Seorang Tionghoa

marsbit06/19 09:21

活动图片