# MMMU的所有文章

在 HTX 新聞中心流覽與「MMMU」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

AI 成绩单背后,藏着一位华人“出题人”

AI领域重要的基准评测MMLU-Pro、MMMU、MMMU-Pro背后,都站着同一位“出题人”——加拿大滑铁卢大学助理教授陈文虎。 随着大语言模型能力快速提升,旧的评测基准如MMLU逐渐“失灵”,顶尖模型得分趋近满分,难以区分高下。为此,陈文虎团队于2024年推出MMLU-Pro。它通过将选项扩至10个、增加推理题比例、剔除简单题等方式,使模型准确率相较旧基准显著下降16%-33%,成绩波动更小,有效拉开了模型间的真实差距。 在多模态评测方面,陈文虎团队推出的MMMU基准包含1.15万道需结合图像与专业知识的复杂题目,即便是当时最强的GPT-4V和Gemini Ultra准确率也未超过60%。后续的MMMU-Pro则进一步堵住模型仅凭文本猜答案的漏洞,强制其进行真正的多模态理解。 陈文虎的研究方向长期聚焦于复杂信息理解与推理。他曾于谷歌DeepMind参与Gemini多模态模型的研发与评估工作,这让他深谙模型能力增长路径与评估盲区。他创立的“老虎实验室”不仅做评测,也研发视频理解与生成等模型,这种“既做题也出题”的经历,使其能更精准地设计出触及模型能力边界的评估体系。 如今,陈文虎已加入Meta超级智能实验室,继续专注于多模态预训练与评估工作。他的故事反映了在AI浪潮中,众多华人研究者正深度参与并塑造着行业发展的核心基础工作。

marsbit06/20 03:51

AI 成绩单背后,藏着一位华人“出题人”

marsbit06/20 03:51

AI成绩单背后,藏着一位华人“出题人”

每次前沿AI模型发布,业界都会关注MMLU-Pro、MMMU等基准测试的成绩单。这些评测已成为衡量模型能力的“标准科目”,但其背后的关键人物却鲜为人知——华人学者陈文虎。 陈文虎是加拿大滑铁卢大学助理教授,“老虎实验室”(TIGERLab)创始人。随着模型能力快速提升,旧评测体系如MMLU逐渐“失灵”,模型分数趋同,难以区分高下。为此,陈文虎团队推出了MMLU-Pro,通过增加选项、强化推理题、清理简单题目等方式,使新基准更难、更稳定,有效拉开了模型间的差距。 在多模态领域,陈文虎团队创建的MMMU基准包含1.15万道需结合图像与专业知识进行推理的题目,即便顶尖模型初期准确率也仅约60%。后续的MMMU-Pro进一步堵住模型“只看文字猜答案”的漏洞,强调真正的多模态理解能力。 陈文虎的研究始终围绕复杂信息理解与推理。他拥有产业界研发经验,曾参与谷歌Gemini项目,如今在Meta超级智能实验室继续专注于多模态评估。他相信,好的评估源于对模型能力边界的深刻理解,而“老虎实验室”同时进行模型研发,正是为了更懂如何出题。 在AI行业的光环常聚焦于明星公司与产品之时,陈文虎的工作在底层塑造着行业评估模型的共同语言,展现了华人才智在关键基础环节的深远影响。

marsbit06/19 09:18

AI成绩单背后,藏着一位华人“出题人”

marsbit06/19 09:18

活动图片