¿Ejecutar MoE en un móvil? Meta propone MobileMoE, acelera hasta 3.8 veces en iPhone 16 Pro

marsbitPublicado a 2026-06-01Actualizado a 2026-06-01

Resumen

El equipo de Meta presenta MobileMoE, el primer modelo de mezcla de expertos (MoE) optimizado para ejecutarse de manera eficiente en teléfonos inteligentes comerciales. Diseñado como un modelo de lenguaje Transformer decoder-only, MobileMoE reemplaza las capas densas de feed-forward por capas MoE, empleando un router que selecciona los pocos expertos más relevantes por token junto con un experto compartido. El modelo se entrena en cuatro fases: preentrenamiento, entrenamiento intermedio, ajuste fino supervisado y entrenamiento consciente de cuantización (hasta INT4/INT8). Los experimentos determinan una configuración óptima de 8 expertos con granularidad 8, enrutamiento top-4 y un experto compartido. En evaluaciones de referencia, MobileMoE-S/M logra una precisión media comparable o superior a modelos densos, utilizando entre 1/2 y 1/4 del cálculo de inferencia con memoria similar. Especialmente en iPhone 16 Pro, MobileMoE-S acelera la fase de entrada hasta 3.8 veces y la generación token por token hasta 3.4 veces respecto a líneas de base. MobileMoE establece un nuevo límite de Pareto para modelos de lenguaje grandes en dispositivos, mejorando el equilibrio entre precisión y coste computacional. Los desafíos futuros incluyen mejorar la capacidad de seguimiento de instrucciones y la gestión de memoria dinámica, así como explorar el despliegue en NPU móviles.

En los últimos años, el Modelo de Expertos Mixtos (MoE) se ha utilizado ampliamente en grandes modelos en la nube. Sin embargo, en el lado del cliente móvil, los Modelos de Lenguaje a Gran Escala (LLM) todavía se basan principalmente en arquitecturas densas. En el pasado, las restricciones de memoria, potencia computacional y latencia en dispositivos móviles eran más estrictas, y la investigación sistemática sobre MoE en el lado del cliente dentro del rango de menos de mil millones de parámetros activos ha sido escasa. Hoy, con el aumento de la capacidad DRAM en dispositivos móviles, los modelos MoE también comienzan a tener la oportunidad de desplegarse en teléfonos inteligentes.

El equipo de Meta propone MobileMoE, que implementa por primera vez una inferencia eficiente de MoE en teléfonos inteligentes comerciales. Los resultados muestran que, en 14 pruebas básicas, MobileMoE-S/M, con un uso de memoria similar, logra una precisión promedio igual o mayor que la línea de base densa utilizando solo entre 1/2 y 1/4 de los cálculos de inferencia. En pruebas prácticas, MobileMoE-S mostró la mayor aceleración en el backend GPU/MLX del iPhone 16 Pro, alcanzando una aceleración máxima de hasta 3.8 veces en la fase de entrada.

Enlace del artículo: https://arxiv.org/abs/2605.27358

El equipo de investigación también propuso un conjunto de leyes de escalado para MoE en el lado del cliente, para determinar estructuras de modelo más adecuadas para el despliegue en móviles. MobileMoE establece un nuevo frente de Pareto para los grandes modelos de lenguaje en el lado del cliente, logrando un mejor equilibrio entre precisión y coste computacional de inferencia.

Figura | MobileMoE establece un nuevo frente de Pareto para LLMs en el lado del cliente.

¿Cómo está diseñado MobileMoE?

MobileMoE puede entenderse así: es una clase de modelo de lenguaje MoE diseñado para el despliegue en el lado del cliente. En general, sigue siendo un Transformer decoder-only, pero reemplaza las capas feed-forward densas originales por capas MoE. Un enrutador selecciona a los pocos expertos con la puntuación más alta para cada token para participar en el cálculo, mientras que también hay un experto compartido que siempre participa. El flujo de entrenamiento completo consta de cuatro pasos: preentrenamiento, entrenamiento intermedio, ajuste fino supervisado y entrenamiento consciente de la cuantización.

Preentrenamiento: El equipo de investigación realizó el preentrenamiento con aproximadamente 6T tokens de datos con licencia abierta, con una longitud de contexto de 2048. Los datos consisten principalmente en contenido web, cubriendo también áreas como matemáticas, código, conocimiento y ciencia.

Entrenamiento Intermedio: El equipo extendió la longitud de contexto a 8192 y aumentó aún más la proporción de datos de alta calidad en conocimiento, código, matemáticas y ciencia, con una escala total de aproximadamente 500B tokens.

Ajuste Fino Supervisado (SFT): El equipo realizó el ajuste fino en más de 80 millones de muestras de datos de instrucción con licencia abierta para MobileMoE-Base.

Entrenamiento Consciente de la Cuantización: El equipo cuantificó las capas lineales y los embeddings a INT4, las activaciones dinámicas a INT8, manteniendo la precisión del enrutador en FP32.

Figura | Las cuatro etapas de entrenamiento de MobileMoE.

Resultados Experimentales

Resultados del estudio de ablación

El equipo comparó primero tres variables de arquitectura: el número de expertos E, la granularidad del experto g, y si se incluye un experto compartido.

Figura | Escalado del número de expertos E.

Con un presupuesto de memoria fijo, cuando la memoria supera aproximadamente 0.25 GB, la pérdida del MoE comienza a ser inferior a la del modelo denso correspondiente. Al continuar aumentando el número de expertos E, la pérdida disminuye aún más, pero cuando E llega a 8, el beneficio marginal se debilita notablemente. Los experimentos sobre la granularidad del experto g muestran que configuraciones de expertos más finas son generalmente mejores, con g=8 logrando un buen equilibrio entre rendimiento y coste de entrenamiento; cuando g aumenta de 8 a 16, la mejora en la pérdida es inferior a 0.01, pero el tiempo de entrenamiento aumenta aproximadamente un 50%. Bajo el mismo presupuesto computacional, la pérdida del modelo disminuye aún más al incluir un experto compartido.

Basándose en los resultados del estudio de ablación, el equipo finalmente adoptó la configuración E=8, g=8, con experto compartido, es decir, 60 expertos de enrutamiento de grano fino, enrutamiento Top-4 y 1 experto compartido, y utilizó esta estructura para las tres versiones MobileMoE-S/M/L.

Figura | Escalado de modelos MoE bajo condiciones computacionalmente óptimas.

Figura | Eficiencia de entrenamiento de la arquitectura MoE.

14 evaluaciones básicas: estableciendo un nuevo frente de Pareto en el lado del cliente

El equipo evaluó MobileMoE junto con modelos como Gemma 3, SmolLM2, Qwen3.5, OLMo 2, OLMoE-1B-7B bajo una configuración unificada en 14 evaluaciones básicas divididas en cinco categorías: razonamiento de sentido común, conocimiento, ciencia, lectura comprensiva y razonamiento.

Figura | Trayectoria de preentrenamiento de MobileMoE.

Los resultados de comparación de los modelos Base muestran que la puntuación promedio de MobileMoE-M es mayor que la de Qwen3.5 2B, y la de MobileMoE-L es mayor que la de OLMoE-1B-7B, requiriendo además un tamaño de modelo más pequeño; el equipo también mencionó que la versión Base de MobileMoE-L ya tiene una puntuación promedio mayor que la versión Instruct de OLMoE-1B-7B. En cuanto a la escala de entrenamiento, MobileMoE utiliza aproximadamente 6T tokens de preentrenamiento, menos que los 9T de Llama 3.2 1B y los 11T de SmolLM2 1.7B. En la comparación general de modelos ajustados por instrucciones, la precisión promedio de MobileMoE-M ya se acerca a la de OLMoE-1B-7B, pero con aproximadamente un 60% menos de parámetros activos y totales.

Figura | Comparación de modelos MobileMoE-Base.

Evaluaciones avanzadas: ventaja más notable en tareas de código y matemáticas

En evaluaciones avanzadas tras el ajuste fino por instrucciones, MobileMoE se desempeña mejor en tareas de código y matemáticas. Tomando MobileMoE-L como ejemplo, sus puntuaciones promedio en las evaluaciones de código y matemáticas son más altas que las de Qwen3.5 2B y OLMoE-1B-7B. Sin embargo, el equipo también señala que Qwen3.5 2B sigue siendo más fuerte en seguimiento de instrucciones y razonamiento basado en conocimiento.

Figura | Comparación de modelos Instruct en evaluaciones de referencia avanzadas.

Cuantización y despliegue en el lado del cliente: mantiene competitividad tras INT4, aceleración notable en móviles

Tras la cuantización, las puntuaciones promedio generales de MobileMoE-S/M/L disminuyen en comparación con sus versiones BF16, pero la caída está aproximadamente entre 2 y 3 puntos. Aún así, el rendimiento de la versión INT4 de MobileMoE-L sigue siendo superior al de la versión BF16 Instruct de OLMoE-1B-7B.

El equipo también desplegó MobileMoE en Samsung Galaxy S25 e iPhone 16 Pro para realizar pruebas. Los resultados muestran que, bajo condiciones de memoria de pesos INT4 comparables, MobileMoE-S, en comparación con MobileLLM-Pro, acelera la fase de entrada entre 1.8 y 3.8 veces y acelera la fase de generación token por token entre 2.2 y 3.4 veces.

En cuanto al uso de memoria, en Samsung Galaxy S25, con un contexto de 8K y prompts reales, el pico de RSS de MobileMoE-S es de 1.49 GB, menor que los 1.91 GB de MobileLLM-Pro.

Figura | Latencia de ejecución en el lado del cliente.

Limitaciones y direcciones futuras

Actualmente, en capacidades de seguimiento de instrucciones de orden superior, así como en razonamiento basado en conocimiento, el MobileMoE ajustado por instrucciones aún está por detrás de Qwen3.5 2B. El equipo de investigación cree que esta brecha puede estar relacionada con un post-entrenamiento más completo del último. En el futuro, para reducir esta brecha, se necesitarán refuerzo en destilación, post-entrenamiento orientado al razonamiento y expansión multimodal en el lado del entrenamiento.

Además, el equipo señala que la huella de memoria de MoE en el móvil varía con el contenido de entrada. En comparación con entradas de plantilla fija, las entradas reales generalmente generan un mayor uso de memoria. Si las pruebas se basan únicamente en entradas de plantilla, podría subestimarse la presión de memoria en escenarios de despliegue real. En el futuro, para evaluar con mayor precisión el rendimiento de memoria real de MoE en el lado del cliente, aún se necesitan más datos de medición real.

Mientras tanto, el equipo ya ha completado pruebas sistemáticas en dispositivos reales para backends CPU y GPU, pero la ruta NPU aún está por explorar. Simultáneamente, el uso de memoria en tiempo de ejecución de MoE es relativamente sensible al contenido de entrada. En el futuro, el enrutamiento dinámico, la poda de expertos, la cuantización de precisión mixta y el despliegue en NPU móviles son direcciones para continuar mejorando la eficiencia en el lado del cliente.

Para más detalles técnicos, consulte el artículo original.

Este artículo proviene del WeChat público "学术头条" (ID:SciTouTiao), autor: 夏千斯.

Preguntas relacionadas

Q¿Qué es MobileMoE y en qué dispositivo se ha implementado de manera eficiente por primera vez, según el artículo?

AMobileMoE es un modelo de lenguaje de tipo Mixto de Expertos (MoE) diseñado específicamente para su despliegue en dispositivos de borde. Según el artículo, es la primera vez que se consigue una inferencia eficiente de MoE en teléfonos inteligentes comerciales, implementado por el equipo de Meta.

Q¿Cuáles son las cuatro etapas principales del proceso de entrenamiento de MobileMoE descritas en el texto?

ALas cuatro etapas principales del entrenamiento de MobileMoE son: 1) Preentrenamiento, 2) Entrenamiento intermedio (ampliando la longitud de contexto y mejorando la calidad de los datos), 3) Ajuste fino supervisado (SFT), y 4) Entrenamiento consciente de la cuantificación.

QSegún los resultados experimentales, ¿qué ventaja de velocidad se observó al desplegar MobileMoE-S en un iPhone 16 Pro, específicamente durante la fase de entrada?

AEn las pruebas realizadas en un iPhone 16 Pro, MobileMoE-S logró una aceleración de hasta 3.8 veces en la fase de entrada (procesamiento del prompt inicial) en comparación con otros modelos de referencia.

Q¿En qué tipos de tareas específicas demostró MobileMoE un rendimiento más destacado durante las evaluaciones avanzadas?

AEn las evaluaciones avanzadas (tras el ajuste fino por instrucciones), MobileMoE demostró un rendimiento más destacado, especialmente en tareas relacionadas con código y matemáticas.

Q¿Cuáles son algunas de las limitaciones actuales y futuras direcciones de investigación para MobileMoE mencionadas en el artículo?

AEntre las limitaciones actuales se menciona que, en capacidades de seguimiento de instrucciones de alto nivel y razonamiento de conocimiento, MobileMoE aún está por detrás de modelos como Qwen3.5 2B. Las futuras direcciones incluyen: fortalecer la destilación y el post-entrenamiento orientado al razonamiento, expandir a multimodalidad, explorar el despliegue en NPU de dispositivos móviles, y trabajar en técnicas para optimizar el uso dinámico de memoria (como el enrutamiento dinámico o la poda de expertos).

Lecturas Relacionadas

El Senado da un paso hacia la Ley CLARITY: El objetivo de firma en agosto sigue vivo, por ahora

Tras superar obstáculos clave en el Senado, la Ley CLARITY avanza hacia un período decisivo para determinar si será promulgada este año. Sus partidarios reconocen que el camino es estrecho, tanto en lo procedimental como en lo político, y que se necesita reconciliar versiones distintas del proyecto de ley. El principal desafío es conseguir 60 votos en el Senado para evitar un filibusterismo, lo que requiere apoyo bipartidista. Algunos demócratas clave han condicionado su respaldo a la inclusión de salvaguardas éticas para funcionarios que traten con criptomonedas, un punto que la arquitecta del proyecto, la senadora Gillibrand, considera "innegociable". Otros legisladores buscan garantías sobre las capacidades de aplicación de la ley en el ámbito de las finanzas descentralizadas (DeFi), lo que genera preocupación en la industria sobre posibles debilitamientos de protecciones legales para desarrolladores de software. Aunque algunos observadores ven el receso de agosto como una fecha límite efectiva, otros, como el exasesor parlamentario Adam Minehardt, son más optimistas. Creen que la voluntad política y el capital invertido en el proyecto hacen improbable su abandono, aunque advierten que un retraso hasta el próximo año podría alterar el entorno político, especialmente tras las elecciones de medio término. El objetivo declarado de la Casa Blanca sigue siendo que la Cámara de Representantes apruebe la ley a principios de julio.

bitcoinistHace 6 min(s)

El Senado da un paso hacia la Ley CLARITY: El objetivo de firma en agosto sigue vivo, por ahora

bitcoinistHace 6 min(s)

Las criptomonedas apuntan al mercado de pensiones estadounidense de 49 billones de dólares

La industria de las criptomonedas está apuntando al mercado de planes de jubilación de EE. UU., valorado en 49,1 billones de dólares, a través de las Cuentas de Jubilación Individual Autodirigidas (SDIRA). Estas cuentas permiten a los inversores diversificar en activos alternativos como bienes raíces, metales preciosos y, ahora, criptomonedas. Adam Bergman, fundador de IRA Financial, critica a las grandes instituciones financieras por limitar las opciones de inversión tradicionales y destaca cómo los ricos han utilizado activos alternativos para crear riqueza. Recientemente, su empresa lanzó una plataforma que permite negociar casi 100 criptomonedas, acciones y otros activos en una sola cuenta con una tarifa plana anual. El panorama regulatorio está cambiando. Una orden ejecutiva firmada por el presidente Trump busca democratizar el acceso a activos alternativos, incluidos los digitales, en los planes 401(k). Esto coincide con la creciente aceptación de las criptomonedas por parte de las generaciones más jóvenes. Sin embargo, las SDIRA conllevan riesgos significativos. Los organismos reguladores advierten sobre la falta de supervisión en las inversiones, y los incidentes de seguridad, como el hackeo de 2022 a IRA Financial que resultó en el robo de 36 millones de dólares en criptomonedas, subrayan los peligros de la custodia centralizada. Además, el manejo incorrecto de las claves privadas puede descalificar toda la cuenta, generando consecuencias fiscales severas. En conclusión, aunque las criptomonedas ofrecen una nueva vía para la diversificación de los ahorros para la jubilación, los inversores deben equilibrar cuidadosamente el potencial de mayores rendimientos con los riesgos inherentes y buscar asesoramiento profesional especializado.

marsbitHace 17 min(s)

Las criptomonedas apuntan al mercado de pensiones estadounidense de 49 billones de dólares

marsbitHace 17 min(s)

Debate en Reddit sobre criptomonedas: Acciones tecnológicas galopan durante 8 meses, ¿la comunidad cripto empieza a "resignarse"?

Un hilo de Reddit en r/CryptoMarkets sobre el estancamiento del mercado de criptomonedas comparado con el auge de las acciones tecnológicas ha generado un intenso debate. El autor pregunta si se producirá una rotación de capitales o si la gente ha perdido interés en las cripto. La discusión refleja la tensión actual en la comunidad. Por un lado, los creyentes en los ciclos apuntan a la historia de Bitcoin y predicen un repunte, con usuarios recordando los patrones alcistas cada cuatro años. Por otro, los escépticos argumentan que las narrativas de Bitcoin cambian constantemente y cuestionan su utilidad real más allá de la especulación. Un punto clave de consenso es que la cripto ha perdido protagonismo frente a la revolución de la IA, que está generando un impacto tangible. Muchos usuarios señalan la falta de casos de uso sólidos y masivos para las criptomonedas, con la excepción parcial de las stablecoins y algunos usos en DeFi (aunque con problemas de seguridad). Se destaca una paradoja fundamental: una moneda necesita estabilidad para ser útil, pero la lógica de inversión en Bitcoin se basa en su volatilidad. Los datos fríos respaldan el pesimismo: los ETF de Bitcoin registraron importantes salidas netas en mayo, indicando una desaceleración institucional, y el índice de miedo y codicia cayó a niveles de "miedo". La pregunta central sobre cuándo podría llegar la próxima rotación no tiene una respuesta clara. Los análisis sugieren que mientras los tipos de interés se mantengan altos, el dinero tendrá menos incentivos para fluir hacia activos de alto riesgo como las criptomonedas. La ansiedad subyacente, como resume un usuario, es el "coste de oportunidad": el miedo a perder otras oportunidades de ganancias mientras se espera un posible repunte del mercado cripto.

marsbitHace 18 min(s)

Debate en Reddit sobre criptomonedas: Acciones tecnológicas galopan durante 8 meses, ¿la comunidad cripto empieza a "resignarse"?

marsbitHace 18 min(s)

¿El chatbot, que ha quemado dinero durante tres años, sigue siendo la "tierra nueva" de la era de la IA?

En los últimos años, la industria de la IA buscó su "nuevo continente" en los chatbots, inspirada por el éxito inicial de ChatGPT. Sin embargo, tras tres años de desarrollo, este modelo enfrenta serios desafíos comerciales. OpenAI, con 900 millones de usuarios semanales, sigue perdiendo dinero: por cada dólar ganado, gasta 1.22. En China, la monetización en el segmento de consumo también es difícil, como muestra la reacción negativa al anuncio de tarifas del chatbot Doubao. Mientras tanto, Anthropic, que se enfoca en clientes empresariales (85% de sus ingresos), superó los ingresos de OpenAI en 2026. Esto sugiere que el verdadero valor de la IA está en ser una herramienta de trabajo productiva, no solo un compañero de conversación. Los usuarios buscan agentes que ejecuten tareas, no solo respondan preguntas. El modelo de negocio del chatbot como "super-entrada" está en entredicho. A diferencia de los productos de Internet tradicionales, su costo marginal aumenta con cada usuario, carece de efectos de red sólidos y su rueda de datos es débil. La monetización mediante suscripciones es baja (solo ~5% en ChatGPT paga), y la publicidad enfrenta obstáculos debido a la falta de intención de compra en las consultas y la ruptura de la confianza del usuario. La migración entre chatbots es fácil, y la ventaja competitiva basada en la capacidad del modelo se está reduciendo. Los datos muestran que el crecimiento de usuarios de ChatGPT se está desacelerando, y el uso diario promedio de las apps de IA nativas es bajo comparado con aplicaciones como TikTok. El futuro de la IA puede no ser un chatbot independiente. La evolución apunta hacia agentes con capacidad de ejecución (como OpenClaw) y, más aún, hacia la integración de la IA en aplicaciones existentes (mensajería, sistemas operativos como Apple Intelligence) o hardware, en lugar de aplicaciones nativas aisladas. La lección clave es que, en la era de la IA, aferrarse al "mapa antiguo" del modelo de chatbot no llevará al nuevo continente; es necesario actualizar el enfoque hacia soluciones integradas que resuelvan problemas concretos.

marsbitHace 29 min(s)

¿El chatbot, que ha quemado dinero durante tres años, sigue siendo la "tierra nueva" de la era de la IA?

marsbitHace 29 min(s)

Trading

Spot
Futuros
活动图片