Artículos Relacionados con Reducción de Costos

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Reducción de Costos", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

El desconocido en el AI local que ansía Apple: Nace el primer modelo cognitivo, 4B iguala a GPT-5.4

**Título: Apple busca AI de dispositivo y surge un modelo cognitivo pionero: 4B iguala a GPT-5.4** **Resumen en español europeo:** La industria de la IA se enfrenta a una crisis de costes, ejemplificada por casos como el de Amazon, que paralizó un ranking interno debido al enorme gasto en computación por el uso de herramientas de IA por los empleados. Frente a este desafío, la visión de Andrej Karpathy de separar el "núcleo cognitivo" de un modelo (su capacidad de pensar y razonar) de su vasto conocimiento factual está ganando terreno. Este enfoque ha sido llevado a la práctica por la empresa china Nextie (明日新程), que ha desarrollado **Alpha**, presentado como el primer **modelo cognitivo para dispositivos** (dispositivo lateral). Con solo **4 mil millones de parámetros**, logra resultados equivalentes a modelos de cientos de miles de millones como GPT-5.4 en tareas de **inteligencia colectiva** (como debate, reflexión o toma de decisiones en grupo mediante votación). El modelo se entrena mediante aprendizaje por refuerzo en modelos de razonamiento de código abierto, centrándose en potenciar la **abstracción y generalización**, no en memorizar datos. Esto permite una drástica reducción del coste computacional, posibilitando su despliegue tanto en la nube como directamente en **dispositivos finales** como ordenadores portátiles o robots de IA encarnada. Este avance podría abrir la puerta a agentes de IA **proactivos** que funcionen de forma continua y autónoma, en lugar de los actuales modelos reactivos que solo responden a comandos. El equipo fundador, procedente de Microsoft Xiaoice, tiene un historial de logros con modelos pequeños, como su modelo de 3.6B que superó a Llama de 65B en rankings japoneses. Nextie se posiciona en el campo de los **sistemas multiagente**, un área de alto crecimiento respaldada por inversiones como la de OpenAI en la startup Isara. En resumen, los modelos cognitivos como Alpha prometen no solo un cambio en la escala de parámetros, sino una **reestructuración fundamental de la economía** de la IA, haciendo viable su integración masiva y continua en dispositivos cotidianos.

marsbit06/09 12:09

El desconocido en el AI local que ansía Apple: Nace el primer modelo cognitivo, 4B iguala a GPT-5.4

marsbit06/09 12:09

La reducción del 99% en el precio del Xiaomi MiMo no es una estrategia de marketing. Luo Fuli publica en X respondiendo a los pesimistas.

**Resumen: El descenso del 99% de Xiaomi MiMo: Una victoria de la ingeniería, no del marketing** El anuncio de Xiaomi de reducir hasta un 99% el precio de las API de su modelo MiMo-V2.5 generó escepticismo, interpretado como una guerra de precios o una maniobra desesperada. Luo Fuli, responsable de MiMo, respondió con un blog técnico detallado, demostrando que la rebaja es el resultado de seis optimizaciones de ingeniería sistemáticas, no una táctica de marketing. La clave es el descuento del 99% aplicado específicamente a la entrada de tipo "Cache Hit" (contexto histórico re-leído). Para lograrlo, el equipo implementó: 1. **Arquitectura Híbrida SWA:** 60 de las 70 capas del modelo solo atienden a los 128 tokens más recientes, reduciendo el volumen de la "memoria" del modelo (KVCache) a 1/7. 2. **Gestión de Memoria en Dos Piscinas:** Asigna memoria por separado para las capas con atención completa y las de ventana deslizante (SWA), liberando realmente la capacidad ahorrada y quintuplicando los usuarios concurrentes por GPU. 3. **Cache de Prefijos Mejorado:** Un nuevo sistema garantiza que solo se reutilicen fragmentos de contexto completos y válidos, logrando una tasa de acierto en caché del 93-95% para peticiones de usuarios frecuentes. 4. **Almacenamiento en SSD Integrado (GCache):** La caché distribuida se aloja en los discos SSD de las propias máquinas con GPU, eliminando costes adicionales de almacenamiento. 5. **Sistema de Enrutamiento Inteligente (LLM-Router):** Dirige peticiones similares a la misma máquina y prioriza las que aciertan en caché, mejorando el rendimiento y la latencia. 6. **Predicción Multi-Token (MTP):** Acelera la generación de respuestas del modelo prediciendo varios tokens a la vez, reduciendo también el coste de la parte de "salida". En conjunto, estas innovaciones redujeron el tiempo de GPU por petición en más de un orden de magnitud, haciendo posible el descuento del 99% manteniendo márgenes positivos. Luo Fuli subraya que este es un logro de ingeniería sistémica, un modelo de reducción de costes verificable que trasciende la mera competencia por precios.

marsbit05/31 10:41

La reducción del 99% en el precio del Xiaomi MiMo no es una estrategia de marketing. Luo Fuli publica en X respondiendo a los pesimistas.

marsbit05/31 10:41

活动图片