# Bài viết Liên quan MMMU

Trung tâm Tin tức HTX cung cấp những bài viết mới nhất và phân tích chuyên sâu về "MMMU", bao gồm xu hướng thị trường, cập nhật dự án, phát triển công nghệ và chính sách quản lý trong ngành tiền kỹ thuật số.

Phía sau bảng điểm AI, ẩn giấu một 'người ra đề' gốc Hoa

Mỗi khi một mô hình AI tiên tiến ra mắt, giới công nghệ lại dõi theo những “bảng điểm” quen thuộc như MMLU-Pro, MMMU hay MMMU-Pro. Đây là các tiêu chuẩn đánh giá quan trọng giúp so sánh năng lực của các mô hình lớn như GPT, Claude hay Gemini. Tuy nhiên, ít người biết rằng đằng sau những bộ đề thi này là một nhà nghiên cứu người Hoa: Chen Wenhu (Trần Văn Hổ), trợ lý giáo sư tại Đại học Waterloo, Canada. Ông cùng phòng thí nghiệm TIGERLab (còn gọi là Hổ Đầu Bang) đã tạo ra MMLU-Pro vào năm 2024 để giải quyết vấn đề “mất chuẩn” của bộ đánh giá MMLU cũ, khi nhiều mô hình tiên tiến đạt điểm gần tuyệt đối, khó phân biệt được sự khác biệt thực sự. MMLU-Pro với hơn 12.000 câu hỏi, mở rộng lựa chọn và tăng cường các câu đòi hỏi suy luận, đã giúp kéo giãn khoảng cách điểm số và đánh giá ổn định hơn. Trước đó, nhóm của Chen Wenhu cũng phát triển MMMU - bộ đánh giá đa phương thức (multimodal) yêu cầu mô hình kết hợp hiểu biết hình ảnh, biểu đồ với kiến thức chuyên môn để trả lời câu hỏi. Ngay cả các mô hình mạnh nhất thời điểm đó như GPT-4V cũng chỉ đạt độ chính xác khoảng 56%. Phiên bản MMMU-Pro sau này được thiết kế để đảm bảo mô hình không thể “bỏ qua” thông tin hình ảnh mà chỉ dựa vào văn bản để đoán đáp án. Nghiên cứu của Chen Wenhu tập trung vào việc hiểu thông tin phức tạp, hỏi đáp tri thức và suy luận. Ông từng làm việc tại Google Research và DeepMind, tham gia vào dự án Gemini, trước khi gia nhập Đại học Waterloo và thành lập TIGERLab. Phòng thí nghiệm không chỉ tạo ra các bộ đánh giá mà còn nghiên cứu phát triển mô hình, chẳng hạn trong lĩnh vực xử lý video. Hiện tại, Chen Wenhu làm việc tại Phòng thí nghiệm Siêu trí tuệ (Super Intelligent Lab) của Meta, tiếp tục tập trung vào dữ liệu huấn luyện và đánh giá đa phương thức. Công việc của ông và nhiều nhà nghiên cứu người Hoa khác đang đóng góp quan trọng vào sự phát triển chung của ngành AI, dù có thể không nằm dưới ánh đèn sân khấu.

marsbit06/20 03:53

Phía sau bảng điểm AI, ẩn giấu một 'người ra đề' gốc Hoa

marsbit06/20 03:53

Phía sau bảng điểm AI, ẩn giấu một "người ra đề" người Hoa

Bài viết này giới thiệu Giáo sư Văn Hổ Trần (Chen Wenhu), một nhà khoa học máy tính người Hoa hiện công tác tại Đại học Waterloo, Canada, và là người đứng sau các bộ đánh giá tiêu chuẩn quan trọng trong ngành AI như MMLU-Pro, MMMU và MMMU-Pro. Khi các mô hình AI tiên tiến như GPT-4, Claude hay Gemini đạt điểm số gần tuyệt đối trên các bài kiểm tra cũ như MMLU, cộng đồng cần một thước đo mới để phân biệt khả năng thực sự. Năm 2024, nhóm của Giáo sư Văn Hổ Trần tại Phòng thí nghiệm TIGER (còn gọi là Hổ Đầu Bang) đã phát triển MMLU-Pro. Bộ dữ liệu mới này với hơn 12.000 câu hỏi đã mở rộng lựa chọn, tăng cường các câu hỏi suy luận và loại bỏ những câu đơn giản, giúp giảm đáng kể điểm số của các mô hình và đánh giá ổn định hơn. Ông cũng là tác giả chính của MMMU - bộ tiêu chuẩn đánh giá đa phương thức (multimodal) đầu tiên yêu cầu mô hình kết hợp hiểu biết hình ảnh phức tạp (biểu đồ, bản đồ, công thức) với kiến thức chuyên ngành để trả lời câu hỏi. Phiên bản nâng cấp MMMU-Pro sau đó được tạo ra để đảm bảo mô hình thực sự xử lý thông tin thị giác chứ không chỉ dựa vào văn bản. Bài viết cho thấy công việc của Giáo sư Văn Hổ Trần bắt nguồn từ hướng nghiên cứu lâu dài về hiểu thông tin phức tạp và trả lời câu hỏi dựa trên tri thức. Kinh nghiệm thực tế của ông từ khi tham gia phát triển mô hình Gemini tại Google DeepMind và hiện tại là tại Phòng thí nghiệm Siêu Trí tuệ của Meta, cùng với việc phòng thí nghiệm của ông cũng tự phát triển các mô hình (như UniVideo, Vamba), đã giúp ông thiết kế ra những bài đánh giá sát thực tế, phát hiện đúng điểm mạnh yếu của mô hình. Tác giả kết luận rằng trong khi sự chú ý của ngành AI thường đổ dồn vào các nhà sáng lập hay lãnh đạo nổi tiếng, thì sự đóng góp của các nhà nghiên cứu như Giáo sư Văn Hổ Trần trong việc xây dựng "ngôn ngữ chung" để đánh giá tiến bộ AI là vô cùng quan trọng.

marsbit06/19 09:20

Phía sau bảng điểm AI, ẩn giấu một "người ra đề" người Hoa

marsbit06/19 09:20

活动图片