Artículos Relacionados con MMMU

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "MMMU", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

Tras las notas de la IA, se esconde un "creador de exámenes" chino

Cada vez que se lanza un modelo de IA de vanguardia, la comunidad fija su atención en ciertas "hojas de resultados" familiares: MMLU-Pro, MMMU, MMMU-Pro. Estos puntos de referencia se han convertido en exámenes estándar para evaluar y comparar modelos como GPT, Claude, Gemini, Llama, Qwen y DeepSeek. Detrás de estas influyentes evaluaciones está el investigador chino Wenhu Chen, profesor asistente en la Universidad de Waterloo y fundador del TIGERLab (apodado "虎头帮"). Su trabajo surge de una necesidad crítica: a medida que los modelos avanzaban, las pruebas antiguas como MMLU se saturaban con puntuaciones casi perfectas, dejando de ser útiles para discernir diferencias reales. En 2024, Chen y su equipo presentaron MMLU-Pro, una renovación exhaustiva del original. Con 12,032 preguntas de 14 disciplinas, aumenta las opciones de respuesta de 4 a 10 para reducir las conjeturas e incorpora problemas más complejos que requieren razonamiento. El resultado fue una caída del 16% al 33% en la precisión de los modelos y una evaluación más estable y discriminatoria, rápidamente adoptada por la industria. Su contribución se extiende al ámbito multimodal con MMMU, un conjunto de 11,500 preguntas que combinan imágenes (gráficos, mapas, fórmulas) con conocimientos académicos para probar una comprensión integrada. Incluso los mejores modelos como GPT-4V inicialmente solo alcanzaron un 56% de precisión, revelando un largo camino por recorrer. Su sucesor, MMMU-Pro, cierra aún más las brechas, obligando a los modelos a utilizar la información visual y no solo el texto. La experiencia de Chen, que incluye investigación doctoral en preguntas complejas y una etapa en Google DeepMind trabajando en Gemini, le permite anticipar cómo los modelos pueden "aparentar" competencia. Su laboratorio no solo diseña evaluaciones, sino que también desarrolla modelos (como UniVideo para video o MoCha para avatares), asegurando que sus "exámenes" reflejen desafíos reales y los límites actuales de la tecnología. Actualmente, Chen continúa este trabajo en el laboratorio de superinteligencia de Meta, enfocado en datos y evaluación multimodal. Su historia destaca el papel fundamental, aunque a menudo menos visible, de los investigadores que construyen las herramientas para medir el verdadero progreso de la IA.

marsbit06/20 03:54

Tras las notas de la IA, se esconde un "creador de exámenes" chino

marsbit06/20 03:54

Detrás de las hojas de calificaciones de la IA, hay un "creador de exámenes" chino

El artículo habla sobre las "hojas de calificaciones" (benchmarks) que se utilizan para evaluar el rendimiento de los modelos de IA avanzados, como GPT, Claude y Gemini, y destaca la figura de Wenhu Chen, un investigador chino que está detrás de varios de estos puntos de referencia fundamentales, como MMLU-Pro, MMMU y MMMU-Pro. Chen, profesor asistente en la Universidad de Waterloo y fundador del TigerLab (también conocido como "la banda de la cabeza de tigre"), abordó la necesidad de nuevas pruebas cuando los modelos más potentes, como el o3 de OpenAI, comenzaron a alcanzar puntuaciones casi perfectas en evaluaciones anteriores como MMLU, lo que las volvía menos útiles para discriminar capacidades. MMLU-Pro, presentado en 2024, es una versión más difícil y robusta que la original, con más opciones de respuesta y preguntas que requieren mayor razonamiento, logrando así diferenciar mejor el rendimiento de los modelos. Por otro lado, MMMU es un benchmark multimodal que evalúa la capacidad de los modelos para comprender y razonar combinando información de texto e imágenes complejas (como diagramas, gráficos, mapas) en múltiples disciplinas académicas. Incluso los mejores modelos al inicio mostraban un bajo rendimiento en esta prueba. MMMU-Pro fue un desarrollo posterior para garantizar que los modelos no evadieran el procesamiento visual. La investigación de Chen se ha centrado históricamente en la comprensión de información compleja y el razonamiento, lo que lo preparó bien para diseñar evaluaciones efectivas. Su experiencia incluye un doctorado en la UC Santa Bárbara, trabajar en Google Research y DeepMind en el proyecto Gemini, y ahora forma parte del laboratorio de superinteligencia de Meta. Su laboratorio también desarrolla investigación en modelos, como en comprensión y generación de video. El artículo concluye subrayando que, aunque la atención pública suele centrarse en las figuras más visibles de la IA, hay muchos profesionales talentosos, como Chen, cuya contribución en áreas fundamentales como la evaluación es crucial para el progreso del campo.

marsbit06/19 09:22

Detrás de las hojas de calificaciones de la IA, hay un "creador de exámenes" chino

marsbit06/19 09:22

活动图片