Artículos Relacionados con Benchmark

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Benchmark", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

El nuevo campeón de la IA en Japón: ¿Cómo se compara un pequeño modelo de 7B con Fable y Mythos?

En junio de 2026, Sakana AI de Japón sacudió la comunidad con Fugu, un pequeño modelo de solo 7B de parámetros que actúa como "capataz" orquestando modelos globales líderes como GPT-5 y Claude Opus. En los exigentes benchmarks SWE-Bench Pro (73.7) y TerminalBench 2.1 (82.1), Fugu Ultra superó a modelos como GPT-5.5 y Claude Opus 4.8. Sakana afirma que rivaliza incluso con los restringidos Fable 5 y Mythos Preview, aunque esta comparación se basa en informes públicos y no en pruebas directas. Su arquitectura se centra en un núcleo de 7B, el RL Conductor, que no genera respuestas directas, sino que descompone tareas, las asigna a modelos especialistas y sintetiza los resultados. Esto mejora la estabilidad en sesiones largas, la revisión profunda de código y reduce el consumo de tokens. Las pruebas beta destacaron su eficacia en flujos de trabajo complejos. Sin embargo, esta estrategia presenta vulnerabilidades: depende de APIs de modelos estadounidenses (riesgo de costes e inestabilidad), puede tener mayor latencia y las comparaciones con modelos no accesibles son polémicas. Para Japón, con limitaciones en cómputo y datos, Fugu representa una vía de "salida asimétrica", priorizando la orquestación inteligente sobre el tamaño bruto del modelo. Demuestra que la competencia en IA se desplaza hacia la integración de sistemas, aunque la dependencia de tecnologías subyacentes sigue siendo un límite.

marsbit06/22 11:22

El nuevo campeón de la IA en Japón: ¿Cómo se compara un pequeño modelo de 7B con Fable y Mythos?

marsbit06/22 11:22

Tras las notas de la IA, se esconde un "creador de exámenes" chino

Cada vez que se lanza un modelo de IA de vanguardia, la comunidad fija su atención en ciertas "hojas de resultados" familiares: MMLU-Pro, MMMU, MMMU-Pro. Estos puntos de referencia se han convertido en exámenes estándar para evaluar y comparar modelos como GPT, Claude, Gemini, Llama, Qwen y DeepSeek. Detrás de estas influyentes evaluaciones está el investigador chino Wenhu Chen, profesor asistente en la Universidad de Waterloo y fundador del TIGERLab (apodado "虎头帮"). Su trabajo surge de una necesidad crítica: a medida que los modelos avanzaban, las pruebas antiguas como MMLU se saturaban con puntuaciones casi perfectas, dejando de ser útiles para discernir diferencias reales. En 2024, Chen y su equipo presentaron MMLU-Pro, una renovación exhaustiva del original. Con 12,032 preguntas de 14 disciplinas, aumenta las opciones de respuesta de 4 a 10 para reducir las conjeturas e incorpora problemas más complejos que requieren razonamiento. El resultado fue una caída del 16% al 33% en la precisión de los modelos y una evaluación más estable y discriminatoria, rápidamente adoptada por la industria. Su contribución se extiende al ámbito multimodal con MMMU, un conjunto de 11,500 preguntas que combinan imágenes (gráficos, mapas, fórmulas) con conocimientos académicos para probar una comprensión integrada. Incluso los mejores modelos como GPT-4V inicialmente solo alcanzaron un 56% de precisión, revelando un largo camino por recorrer. Su sucesor, MMMU-Pro, cierra aún más las brechas, obligando a los modelos a utilizar la información visual y no solo el texto. La experiencia de Chen, que incluye investigación doctoral en preguntas complejas y una etapa en Google DeepMind trabajando en Gemini, le permite anticipar cómo los modelos pueden "aparentar" competencia. Su laboratorio no solo diseña evaluaciones, sino que también desarrolla modelos (como UniVideo para video o MoCha para avatares), asegurando que sus "exámenes" reflejen desafíos reales y los límites actuales de la tecnología. Actualmente, Chen continúa este trabajo en el laboratorio de superinteligencia de Meta, enfocado en datos y evaluación multimodal. Su historia destaca el papel fundamental, aunque a menudo menos visible, de los investigadores que construyen las herramientas para medir el verdadero progreso de la IA.

marsbit06/20 03:54

Tras las notas de la IA, se esconde un "creador de exámenes" chino

marsbit06/20 03:54

Detrás de las hojas de calificaciones de la IA, hay un "creador de exámenes" chino

El artículo habla sobre las "hojas de calificaciones" (benchmarks) que se utilizan para evaluar el rendimiento de los modelos de IA avanzados, como GPT, Claude y Gemini, y destaca la figura de Wenhu Chen, un investigador chino que está detrás de varios de estos puntos de referencia fundamentales, como MMLU-Pro, MMMU y MMMU-Pro. Chen, profesor asistente en la Universidad de Waterloo y fundador del TigerLab (también conocido como "la banda de la cabeza de tigre"), abordó la necesidad de nuevas pruebas cuando los modelos más potentes, como el o3 de OpenAI, comenzaron a alcanzar puntuaciones casi perfectas en evaluaciones anteriores como MMLU, lo que las volvía menos útiles para discriminar capacidades. MMLU-Pro, presentado en 2024, es una versión más difícil y robusta que la original, con más opciones de respuesta y preguntas que requieren mayor razonamiento, logrando así diferenciar mejor el rendimiento de los modelos. Por otro lado, MMMU es un benchmark multimodal que evalúa la capacidad de los modelos para comprender y razonar combinando información de texto e imágenes complejas (como diagramas, gráficos, mapas) en múltiples disciplinas académicas. Incluso los mejores modelos al inicio mostraban un bajo rendimiento en esta prueba. MMMU-Pro fue un desarrollo posterior para garantizar que los modelos no evadieran el procesamiento visual. La investigación de Chen se ha centrado históricamente en la comprensión de información compleja y el razonamiento, lo que lo preparó bien para diseñar evaluaciones efectivas. Su experiencia incluye un doctorado en la UC Santa Bárbara, trabajar en Google Research y DeepMind en el proyecto Gemini, y ahora forma parte del laboratorio de superinteligencia de Meta. Su laboratorio también desarrolla investigación en modelos, como en comprensión y generación de video. El artículo concluye subrayando que, aunque la atención pública suele centrarse en las figuras más visibles de la IA, hay muchos profesionales talentosos, como Chen, cuya contribución en áreas fundamentales como la evaluación es crucial para el progreso del campo.

marsbit06/19 09:22

Detrás de las hojas de calificaciones de la IA, hay un "creador de exámenes" chino

marsbit06/19 09:22

Un modelo pequeño de 3B con puntuación de programación comparable a Opus 4.5, un modelo misterioso genera debate, resulta ser chino

Un pequeño modelo de 3B parámetros, VibeThinker-3B, desarrollado por el equipo de Sina Weibo, está generando revuelo al alcanzar un rendimiento en tareas de razonamiento verificable (como programación) comparable al de modelos líderes como GPT-5, Claude Opus 4.5 o Gemini 3 Pro, a pesar de su tamaño significativamente menor. Basado en Qwen2.5-Coder-3B, el modelo fue entrenado con un proceso "Spectrum-to-Signal" que incluye fine-tuning supervisado en dos etapas con aprendizaje curricular, aprendizaje por refuerzo aplicado a múltiples dominios (matemáticas, programación, razonamiento STEM) y destilación de conocimiento. También incorpora una estrategia de evaluación de confiabilidad "Claim-Level" (CLR) para mejorar aún más los resultados en benchmarks. Sus puntuaciones sobresalientes incluyen 94.3 en AIME26, 80.2 en LiveCodeBench v6 y una tasa de aprobación del 96.1% en competiciones recientes de LeetCode. Los autores proponen la "hipótesis de compresión paramétrica", sugiriendo que el razonamiento verificable es una capacidad altamente comprimible que puede alcanzar niveles de vanguardia en modelos pequeños cuando las tareas tienen una estructura clara y señales de feedback confiables, desacoplándose parcialmente del conocimiento factual que requiere más parámetros. El objetivo no es reemplazar a los modelos grandes, sino explorar los límites de los modelos pequeños en dominios específicos. El modelo está disponible públicamente, aunque su rendimiento es intencionalmente especializado y no sobresale en tareas que requieren conocimiento general o de mundo abierto.

marsbit06/18 00:26

Un modelo pequeño de 3B con puntuación de programación comparable a Opus 4.5, un modelo misterioso genera debate, resulta ser chino

marsbit06/18 00:26

La IA recursiva de la que advierte Anthropic, la nueva compañía de Tianyuandong acaba de dar el «primer paso»

Anthropic advirtió recientemente sobre la trayectoria hacia la "mejora recursiva automática" de la IA, donde los sistemas diseñan y entrenan sus propias versiones posteriores. Ahora, Recursive Superintelligence, una nueva empresa cofundada por Yuan Dong Tian (ex Meta FAIR), ha dado su "primer paso" hacia la investigación automatizada de IA. Han desarrollado un sistema de descubrimiento de conocimiento abierto y automatizado, logrando resultados de última generación (SOTA) en tres benchmarks distintos. El sistema automatiza el ciclo de investigación: generar ideas, implementar código, ejecutar experimentos y aprender para decidir el siguiente paso, reduciendo la dependencia de investigadores humanos. En el benchmark *NanoChat Autoresearch* (entrenamiento eficiente con presupuesto fijo), su sistema mejoró el resultado, necesitando un 30% menos de tiempo para lograr la misma calidad. En *NanoGPT Speedrun* (entrenamiento más rápido), redujo el tiempo récord de 79.7 a 77.5 segundos mediante optimizaciones como cálculo de atención en FP8 y un kernel MLP fusionado más eficiente. Finalmente, en *SOL-ExecBench* (optimización de kernels GPU), mejoró la puntuación general de 0.699 a 0.754, acercándose un 18% más al límite teórico del hardware. Recursive, que cuenta con un equipo de renombre y una fuerte financiación, busca construir sistemas de IA que mejoren recursivamente su propia capacidad de investigación. Este trabajo representa una concreción temprana del paradigma de "IA recursiva". Mientras Anthropic urge precaución y coordinación ante este camino, empresas como Recursive ya están avanzando por él, aunque reconocen que este es solo un primer paso en escenarios bien definidos.

marsbit06/12 04:16

La IA recursiva de la que advierte Anthropic, la nueva compañía de Tianyuandong acaba de dar el «primer paso»

marsbit06/12 04:16

"No necesito un modelo mejor": El panorama de la IA bajo un popular post de Reddit

"Claude Fable 5, el nuevo modelo flagship de Anthropic, marcó un 80.3% en el benchmark SWE-Bench Pro, superando ampliamente a modelos anteriores. Sin embargo, una publicación viral en Reddit titulada 'Claude Fable me hizo darme cuenta de que no necesito un modelo mejor' refleja una desconexión entre las métricas técnicas y la percepción de muchos usuarios. Los comentarios más votados expresan 'fatiga' por las mejoras incrementales, argumentando que modelos como Opus 4.8 ya son 'suficientes' para sus flujos de trabajo diarios. La queja principal gira en torno al costo (el doble que Opus) y, sobre todo, a los estrictos 'guardrails' de seguridad de Fable 5. Usuarios reportan que solicitudes relacionadas con ciberseguridad son rechutadas con frecuencia, siendo derivadas a Opus, lo que genera frustración especialmente entre suscriptores de pago. No obstante, usuarios con tareas complejas y de gran escala, como simulaciones de física de miles de líneas de código, defienden el modelo, describiendo una diferencia sustancial y capacidades superiores para contextos largos y análisis profundo. El debate subraya una posible meseta en la percepción pública de la utilidad de la IA: mientras los benchmarks siguen mejorando, para muchos usuarios el 'techo' de necesidades prácticas ya fue alcanzado. La discusión también señala la brecha entre los modelos de acceso público y las versiones más potentes y restringidas, como Mythos 5, disponible solo para gobiernos y empresas críticas. El futuro de estos modelos públicos dependerá de equilibrar capacidad, costo y usabilidad."

marsbit06/12 02:55

"No necesito un modelo mejor": El panorama de la IA bajo un popular post de Reddit

marsbit06/12 02:55

Justo ahora, Claude Mythos 5 es lanzado: 50 millones de líneas de código resueltas en un día

Anthropic ha lanzado Claude Fable 5 y Claude Mythos 5, sus modelos de IA más potentes hasta la fecha. Fable 5, disponible públicamente con salvaguardas, se degrada automáticamente a Claude Opus 4.8 para consultas de alto riesgo, mientras que Mythos 5 es la versión completa restringida. Fable 5 destaca en ingeniería de software, completando en un día una migración de 50 millones de líneas de código que llevaría meses a un equipo. Posee capacidades visuales nativas, pudiendo completar videojuegos solo con capturas de pantalla, y una memoria mejorada para tareas largas y complejas. En pruebas financieras y de investigación científica, muestra un rendimiento líder, con Mythos 5 diseñando compuestos proteicos que ya están en desarrollo farmacéutico. El modelo introduce un nuevo paradigma de seguridad mediante clasificadores y enrutamiento, reteniendo datos de uso por 30 días para monitorización. Su eficiencia en tokens busca controlar costes en tareas autónomas prolongadas. Experiencias de prueba, como la del profesor Ethan Mollick, indican un cambio fundamental: el humano actúa más como un "cliente" que supervisa, mientras la IA opera de forma autónoma como un "estudio" completo, entregando resultados complejos con una intervención mínima. Fable 5 es de uso gratuito para suscriptores hasta el 22 de junio, tras lo cual requerirá créditos adicionales.

marsbit06/10 00:29

Justo ahora, Claude Mythos 5 es lanzado: 50 millones de líneas de código resueltas en un día

marsbit06/10 00:29

Desde Hunyuan hasta WeChat AI: el lento ritmo de Tencent llega al punto de entrega

El 8 de junio de 2026, la plataforma para desarrolladores de WeChat anunció el inicio de la fase de pruebas internas de "WeChat AI", un asistente integrado en el ecosistema que permite a los usuarios operar mini-programas mediante diálogo en lenguaje natural. Ofrece dos modos de integración: uno automático (sin desarrollo adicional, pero que requiere acceso al código fuente) y otro de desarrollo (para funciones personalizadas). Esto marca la primera apertura de la capa de diálogo a la IA dentro del ecosistema de mini-programas de WeChat. Esta iniciativa representa el último paso en la estrategia de IA de Tencent, que avanza desde la reserva tecnológica (su modelo propio, Hunyuan) y la validación en productos independientes (como la app Yuanbao, que superó los 100 millones de MAU tras una campaña de Año Nuevo) hacia la integración en una superapp. Hunyuan, clasificado como el segundo modelo base nacional pero primero en capacidades de aplicación y Agente, proporciona la base técnica estable y confiable necesaria para operaciones precisas, priorizando la fiabilidad sobre la frecuencia de actualización. El modo automático, de baja barrera de entrada, apunta a atraer a los cientos de miles de pequeños equipos desarrolladores de mini-programas. Sin embargo, genera preocupaciones sobre la seguridad del código, la posible inutilización de lógicas publicitarias y la asignación de responsabilidades en caso de error, aspectos aún sin aclarar públicamente. El verdadero desafío es equilibrar la eficiencia de la IA con los intereses del ecosistema. Mientras que la IA podría ejecutar tareas de usuario (como pedir café) sin que este visite la página del comercio, los desarrolladores temen ser "marginados" o perder control sobre la exposición de su marca, el flujo de usuarios y sus datos. El CEO Ma Huateng reconoció esta tensión entre la "programación centralizada" y la "protección del tráfico descentralizado", pero aún no se han revelado los mecanismos concretos de equilibrio. En resumen, con Hunyuan, Yuanbao y WeChat AI, Tencent ha establecido una ruta lógica: un modelo base confiable, un producto independiente para validación de usuarios y la integración final en la superapp. Sin embargo, la aceptación a gran escala dependerá de resolver las dudas de los desarrolladores sobre el acceso al código fuente, definir reglas equitativas de distribución del tráfico y garantizar la precisión operativa de la IA para ganar la confianza del usuario final. La prueba interna es solo un hito en un maratón cuya línea de meta aún está lejana.

marsbit06/08 10:28

Desde Hunyuan hasta WeChat AI: el lento ritmo de Tencent llega al punto de entrega

marsbit06/08 10:28

活动图片