Artículos Relacionados con Benchmark

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Benchmark", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

Valoración supera los 200.000 millones, se filtra que Kimi obtiene 13.600 millones más en financiación, acelerando su OPV en Hong Kong

Según informes, la startup china de IA Moon Dark Side (creadora del asistente Kimi) está en conversaciones para una nueva ronda de financiación que podría alcanzar los 20.000 millones de dólares (unos 136.000 millones de RMB), con el objetivo de alcanzar una valoración de 300.000 millones de dólares (unos 2,035 billones de RMB). Esto supone un incremento de aproximadamente 6 veces respecto a su valoración de 43.000 millones de dólares en diciembre pasado y sería su tercera ronda en seis meses. La empresa, fundada en 2023 por Yang Zhilin, lanzó su modelo principal Kimi K2.6 en abril, cuyo rendimiento se equipara o supera en algunos aspectos al de modelos líderes como GPT-5.4. Su producto Kimi Work, actualmente en fase beta, funciona como un agente local para trabajadores del conocimiento. En cuanto a su actividad comercial, la startup ya genera ingresos, con ingresos anuales recurrentes (ARR) que superaron los 2.000 millones de dólares en abril. Según Bloomberg, la empresa está preparando una posible OPV en Hong Kong. Este movimiento refleja una aceleración en los procesos de capitalización de las principales empresas de modelos de lenguaje en China, como Moon Dark Side, Stepfun y DeepSeek, siguiendo la tendencia global marcada por OpenAI y Anthropic. La financiación y las salidas a bolsa se están convirtiendo en variables clave para la competencia en el sector.

marsbit06/08 07:47

Valoración supera los 200.000 millones, se filtra que Kimi obtiene 13.600 millones más en financiación, acelerando su OPV en Hong Kong

marsbit06/08 07:47

Acaba de pasar: la IA de China irrumpe en el top 2 mundial de programación, solo por detrás de Claude

Hoy, el modelo chino Qwen3.7-Max de Alibaba ha entrado en el top 4 global del ranking Code Arena con 1541 puntos, superando a modelos como GPT-5.5 y Gemini 3.5 Flash. Solo quedan por delante Claude Opus 4.7 y Opus 4.6, lo que convierte a Alibaba en el único representante chino y el segundo a nivel mundial en la competición de modelos de programación. Las pruebas prácticas confirman su rendimiento. En un desafío para crear un juego de carreras 3D en HTML a partir de un prompt, Qwen3.7-Max generó una versión jugable en la primera ronda, incluyendo detalles como una pantalla de inicio y efectos de sonido, donde otros modelos líderes necesitaron múltiples correcciones de errores. Su fortaleza clave reside en ser un "modelo base para Agent", diseñado para ejecutar tareas complejas de forma autónoma y prolongada. En una prueba interna, optimizó código de forma continua durante 35 horas, realizando 1158 llamadas a herramientas sin degradación del contexto. Este avance se atribuye a mejoras en su entrenamiento, como la "expansión de entorno" y la capacidad de "ejecución autónoma de larga duración". Con su combinación de alto rendimiento en benchmarks, resultados prácticos superiores y un coste reducido, Qwen3.7-Max se posiciona como un fuerte competidor en el campo de los modelos de programación, demostrando que la innovación en IA ya no es un monólogo de Silicon Valley.

marsbit05/27 00:20

Acaba de pasar: la IA de China irrumpe en el top 2 mundial de programación, solo por detrás de Claude

marsbit05/27 00:20

El exalumno post-00 de Tsinghua, Wang Guan, presenta otra innovación: revolucionando los modelos de preentrenamiento Transformer con 1/900 tokens y 1/432 de potencia computacional

El equipo de Wang Guan, egresado de la Universidad Tsinghua, ha presentado HRM-Text, un nuevo modelo de preentrenamiento que desafía el paradigma tradicional de los grandes modelos de lenguaje. Sustituyendo el Transformer estándar por un Modelo Recurrente Jerárquico (HRM) y utilizando un objetivo de entrenamiento directo en pares instrucción-respuesta, HRM-Text logra un rendimiento comparable a modelos de código abierto de 2B a 7B de parámetros, pero con una fracción mínima de los recursos. Concretamente, el modelo de 1B de parámetros se entrenó con solo 40B de tokens únicos, utilizando aproximadamente 100-900 veces menos tokens y 96-432 veces menos cómputo estimado que los modelos baseline estándar, a un costo cercano a los 1500 USD. Aún así, alcanzó puntuaciones destacadas en benchmarks clave: MMLU (60.7%), ARC-C (81.9%), DROP (82.2%), GSM8K (84.5%) y MATH (56.2%). La arquitectura HRM emplea módulos de actualización lenta (H) y rápida (L), permitiendo múltiples pasos recurrentes por token para aumentar la profundidad computacional sin agregar parámetros. Técnicas como MagicNorm y Warmup Deep Credit Assignment aseguraron la estabilidad del entrenamiento recurrente. Los experimentos muestran que HRM supera en eficiencia y estabilidad a Transformers de tamaño similar bajo un presupuesto computacional fijo. Las ablaciones confirman la contribución clave del objetivo de finalización de tareas y el enmascaramiento PrefixLM. El análisis sugiere que la estructura recurrente confiere una "profundidad efectiva" mayor. Las limitaciones incluyen una cobertura de conocimiento aún limitada por el corpus, la necesidad de mecanismos de tiempo de cómputo adaptativo, y desafíos de ingeniería para implementar PrefixLM en entornos de diálogo. El trabajo futuro explorará desacoplar el núcleo de razonamiento del almacenamiento de conocimientos y validar la escalabilidad a tamaños de modelo mayores.

marsbit05/26 03:19

El exalumno post-00 de Tsinghua, Wang Guan, presenta otra innovación: revolucionando los modelos de preentrenamiento Transformer con 1/900 tokens y 1/432 de potencia computacional

marsbit05/26 03:19

La paradoja de la automatización: cuanto más fuerte sea la IA, más ocupados estaremos

El artículo "La Paradoja de la Automatización: Cuanto más fuerte es la IA, más ocupados estamos los humanos" desafía la narrativa predominante de que la IA eliminará puestos de trabajo de cuello blanco. Basándose en la experiencia de la empresa Every, que utiliza extensamente agentes de IA, el autor argumenta que, si bien la automatización asume tareas repetitivas (como codificación básica, servicio al cliente o redacción de borradores), no reduce la carga laboral humana. En cambio, reorganiza el trabajo: los humanos pasan de ser ejecutores a ser diseñadores de marcos, supervisores de calidad, tomadores de decisiones y solucionadores de problemas complejos en tiempo real. La IA commoditiza habilidades humanas del "ayer", haciendo que la producción genérica sea abundante y barata. Esto genera una homogeneización que, a su vez, incrementa la demanda de diferenciación, juicio contextual y adaptación a situaciones específicas del presente—competencias exclusivamente humanas. Por lo tanto, los expertos no desaparecen; su rol se vuelve más crucial para mantener estándares, diseñar sistemas y abordar lo que la IA no puede: definir qué vale la pena hacer y por qué. El artículo también critica la interpretación de los benchmarks de IA. Estos miden el desempeño dentro de un "marco" o prompt específico diseñado por humanos. A medida que la IA domina un marco, los humanos desplazan la meta hacia marcos más complejos, creando una brecha perpetua (una "paradoja de Zenón" de la IA). Incluso una IA general (AGI), al carecer de intencionalidad y estar alineada con objetivos humanos, seguiría necesitando un "delimitador" humano. La conclusión es que el futuro del trabajo no es la sustitución, sino una colaboración donde la IA amplifica las capacidades humanas, haciendo que el juicio, la creatividad y la definición de propósito sean más valiosos que nunca.

marsbit05/24 07:26

La paradoja de la automatización: cuanto más fuerte sea la IA, más ocupados estaremos

marsbit05/24 07:26

¡Llega Gemini 3.5! Esta noche, Google hace que Google quede obsoleto

**Google I/O 2026: Geminis Omni, Flash 3.5 y Spark, un salto hacia la superinteligencia** En Google I/O 2026, Sundar Pichai y Demis Hassabis presentaron una avalancha de avances en IA que redefinen el campo. La estrella fue **Gemini Omni**, un modelo “omnimodal” que entiende y genera cualquier combinación de texto, imagen, audio y, lo más destacado, **video de alta calidad**. Omni no solo crea videos realistas; los edita mediante conversación, mantiene la coherencia física y lógica entre escenas, y permite crear avatares personalizados. Ya está disponible en su versión Flash, con una versión Pro en camino. El segundo gran lanzamiento es **Gemini 3.5 Flash**, un modelo que supera ampliamente al anterior flagship, Gemini 3.1 Pro, en benchmarks de código y tareas de agente. Es extremadamente rápido (289 tokens/segundo) y se integra en **Antigravity 2.0**, una plataforma de desarrollo de agentes independiente. Una demostración impactante mostró cómo 93 sub-agentes, dirigidos por 3.5 Flash, escribieron, probaron y auditaron un **sistema operativo funcional desde cero en solo 12 horas**, por menos de 1000 dólares en costos de API. Finalmente, se anunció **Gemini Spark**, un agente personal de IA que funciona 24/7 en la nube. Integrado con las herramientas de Google (Gmail, Docs, Sheets), puede ejecutar tareas complejas como organizar eventos, redactar correos con tu estilo o gestionar información de manera autónoma, incluso mediante comandos de voz. Estará disponible en beta para suscriptores de AI Ultra. En conjunto, estos lanzamientos (creación omnimodal, agentes autónomos de alto rendimiento y asistentes personales persistentes) marcan un salto significativo. Google demostró que las barreras técnicas hacia una Inteligencia Artificial Superinteligente (ASI) se están derribando a un ritmo asombroso, redefiniendo lo que es posible en automatización y creación.

链捕手05/20 07:04

¡Llega Gemini 3.5! Esta noche, Google hace que Google quede obsoleto

链捕手05/20 07:04

En la era de la Auto Investigación, 47 tareas sin respuestas estándar se convierten en la lista obligatoria de evaluación de capacidades de los Agent

Si se coloca a una IA en un entorno de ingeniería sin respuestas estándar, ¿podría sobrevivir? El nuevo benchmark Frontier-Eng Bench, lanzado por Einsia AI, desafía a los agentes de IA con 47 tareas multidisciplinarias y complejas, como la estabilidad de robots submarinos y la optimización de baterías, que no tienen una solución única, sino que requieren una mejora continua y adaptativa. A diferencia de los modelos anteriores que simplemente "buscaban en la memoria", este enfoque pone a la IA en un ciclo cerrado de ingeniería: proponer soluciones, ejecutar simulaciones, recibir retroalimentación, ajustar parámetros y repetir. El objetivo ya no es dar una respuesta correcta, sino medir la capacidad de la IA para mejorar de manera iterativa en entornos con múltiples restricciones, como equilibrar el rendimiento, la seguridad y la eficiencia. Los resultados muestran que, aunque modelos como GPT-5.4 demuestran un rendimiento sólido, aún queda un largo camino para dominar estas tareas. El estudio revela dos hallazgos clave: las mejoras siguen una ley de potencia, volviéndose más difíciles y pequeñas con cada iteración, y la profundidad de la optimización es más crucial que la exploración superficial en paralelo. Este avance sugiere el amanecer de una nueva era de "Auto Research", donde la IA podría actuar como un ingeniero autónomo, trabajando las 24 horas para refinar diseños y procesos basándose en la retroalimentación continua, mientras los humanos establecen los objetivos generales.

marsbit05/13 07:36

En la era de la Auto Investigación, 47 tareas sin respuestas estándar se convierten en la lista obligatoria de evaluación de capacidades de los Agent

marsbit05/13 07:36

活动图片