La nueva tecnología DeepSeek se adapta a los chips Apple, acelerando el modelo local en Mac un 60%

marsbitPublicado a 2026-07-03Actualizado a 2026-07-03

Resumen

El proyecto de código abierto DSpark de DeepSeek, originalmente diseñado para acelerar modelos de lenguaje en GPUs de centros de datos, ha sido adaptado por el ingeniero Abdur Rahim para funcionar de forma nativa en chips Apple (mlx-dspark). Esta adaptación logra aceleraciones de aproximadamente 1.6x para Gemma-4 12B y 1.4x para Qwen3-4B en un Mac con M4 Pro, manteniendo una precisión de salida idéntica al modelo original (byte por byte), incluso con muestreo por temperatura. La clave de DSpark es el "decodificado especulativo": un modelo pequeño y rápido (draft) genera varios tokens candidatos que luego son verificados de manera eficiente por el modelo principal (target). Rahim optimizó este proceso para la arquitectura Apple Silicon, utilizando cuantización de 4 bits para el modelo draft (1.8 GB) y 8 bits para el target, logrando una tasa de aceptación del 82%. Posteriormente, el proyecto integró también DFlash, una técnica alternativa de decodificación especulativa que genera bloques de tokens en paralelo. DFlash mostró un rendimiento superior (hasta ~2.1x de aceleración) en tareas estructuradas como código y matemáticas, mientras que DSpark es más eficaz en conversaciones abiertas. La versión mlx-dspark v0.0.3 ahora permite elegir entre ambos métodos según la tarea. Este trabajo demuestra la viabilidad de ejecutar eficientemente LLMs avanzados localmente en hardware Apple, combinando velocidad y precisión.

Crixi desde Feisi
QubitAI | Cuenta pública QbitAI

Una semana después de que DSpark se hiciera de código abierto, ya ha sido portado a ordenadores Apple.

La versión adaptada se llama mlx-dspark y ejecuta los modelos Gemma-4 12B y Qwen3-4B.

Después de instalarla, la velocidad de generación de estos dos modelos en Mac aumentó 1.6 y 1.4 veces respectivamente.

Lo más difícil es que logró algo que la mayoría de las versiones adaptadas no consiguen: la salida es idéntica byte a byte al modelo original, sin una sola letra de diferencia.

Es decir, se gana velocidad sin perder nada de calidad.

El responsable es Abdur Rahim, un ingeniero que dedica su tiempo libre a proyectos de código abierto. La primera versión nativa para Mac desde que DSpark se hizo de código abierto fue obra suya en solitario.

Ejecutar modelos grandes en Mac, acelerados un 60%

Para DSpark, hecho de código abierto por DeepSeek el 27 de junio, las cifras oficiales indican una aceleración del 60% al 85% en escenarios de servidor.

Sin embargo, esta tecnología solo tenía implementación para GPUs en centros de datos, sin una versión adaptada a los chips Apple.

mlx-dspark es la primera versión nativa para chips Apple de esta tecnología.

La idea de DSpark es asignar un modelo más pequeño como asistente al modelo objetivo. El modelo pequeño primero genera varios tokens candidatos de una vez, y luego el modelo objetivo los verifica en bloque, aceptando los correctos y rechazando los erróneos para volver a intentarlo.

El coste de este paso varía entre los centros de datos y los ordenadores Apple.

En las GPUs de los centros de datos, verificar un lote de tokens candidatos es como alquilar un autobús: el precio es fijo sin importar cuántos pasajeros, y la decodificación ya es un cuello de botella de memoria, por lo que verificar unos pocos tokens más apenas consume tiempo extra.

Los chips Apple son más como un taxi con taxímetro: cuantos más tokens candidatos se verifiquen, más sube la tarifa.

Rahim probó que para Gemma-4 12B, cada token adicional verificado añade unos 14 milisegundos. Calculó estos costes en un modelo y concluyó que el límite máximo de velocidad en chips Apple está alrededor de 2.2 veces.

En resumen, Rahim trasladó este modelo pequeño asistente desde el checkpoint de HuggingFace y lo asignó a los modelos objetivo Gemma-4 12B y Qwen3-4B.

También reconstruyó el flujo de verificación en el framework MLX y cuantificó los pesos a 4 bits.

Como resultado, en un M4 Pro, comparado con la herramienta oficial MLX de Apple, la velocidad de generación de Gemma-4 12B aumentó de 18.4 tok/s a aproximadamente 30 tok/s, unas 1.6 veces más rápida; Qwen3-4B pasó de 52.9 tok/s a aproximadamente 73 tok/s, unas 1.4 veces más rápida.

Además, en mlx-dspark, Rahim hizo algo que la mayoría de los trabajos de portabilidad no hacen.

Versiones adaptadas también pueden lograr una alta fidelidad

La mayoría de las versiones que portan modelos grandes a entorno local solo admiten decodificación codiciosa (greedy decoding), es decir, en cada paso eligen el token con mayor probabilidad.

En mlx-dspark, Rahim también implementó el método de muestreo con temperatura descrito originalmente en el artículo de DSpark: el modelo borrador proporciona tokens candidatos, la probabilidad de aceptación es min(1, p/q), y las partes no aceptadas se vuelven a muestrear a partir del residual.

Él mismo verificó que la distribución de salida generada por este flujo es estrictamente igual a la distribución exacta que produciría el modelo objetivo a la misma temperatura, no es una versión aproximada reducida.

La mayoría de las decodificaciones especulativas solo implementan la versión codiciosa porque verificar su corrección es sencillo: basta con comparar palabra por palabra.

El paso extra que dio Rahim fue verificar personalmente la distribución de salida generada en el modo de muestreo, confirmando que no se distorsiona.

Determinar qué precisión debía tener el modelo objetivo responsable de la verificación fue un obstáculo que superó probando.

Si el modelo pequeño se emparejaba con una versión base del modelo objetivo sin ajuste por instrucciones, solo el 47% de los tokens candidatos generados pasaban la verificación; al cambiar a la versión correspondiente ajustada por instrucciones, esta proporción aumentó al 82%.

También probó cambiar el modelo objetivo a precisión bf16, y el coste de verificación aumentó más que la tasa de aceptación, resultando incluso más lento, por lo que mantener el modelo objetivo por defecto en 8 bits es la opción más rentable.

El modelo pequeño responsable de generar los tokens candidatos preliminares utiliza otro esquema de precisión.

El modelo borrador en sí fue comprimido por él, y después de la cuantificación a 4 bits ocupa solo 1.8 GB, cabe en la memoria sin problemas y se ejecuta sin pérdidas.

El resultado es que DSpark no solo logró la aceleración, sino que también replicó en el dispositivo la mejora del 16% al 18% en la tasa de aceptación mencionada en el artículo.

DFlash también se integró, las tareas de código son más rápidas

Después de publicar el tuit, un comentario apareció: Jian Chen, uno de los autores del artículo de DFlash, preguntó si podían probar el modelo de su equipo.

DFlash es otro esquema de decodificación especulativa propuesto en un artículo publicado por z-lab en mayo. El líder del equipo de autores es Zhijian Liu, profesor asistente en UCSD e investigador científico en NVIDIA.

El enfoque de DFlash es diferente al de DSpark: utiliza una "difusión en bloque" paralela para denoizar un bloque completo de 16 tokens de una vez, en lugar de adivinarlos paso a paso con dependencias como hace DSpark.

Rahim actuó rápidamente.

Utilizando el script de portabilidad escrito por Jian, conectó gemma4-12B-it-DFlash publicado por z-lab al modelo objetivo Gemma-4 de mlx-vlm, y en el mismo Mac realizó una comparación directa con DSpark, que acababa de probar.

En tareas de código y matemáticas, la longitud de aceptación de la decodificación por bloques de DFlash alcanzó de 5.95 a 6.20, con una velocidad de aproximadamente 36 tok/s, logrando aproximadamente 2.1 veces más velocidad, superando a DSpark.

Sin embargo, DFlash genera un bloque completo de 16 tokens de una vez, pero el modelo objetivo puede no aprobarlos todos; en la práctica, solo una parte pasa la verificación. En la industria, a esto se le llama "longitud de aceptación", y no siempre se llenan los 16.

Por lo tanto, en escenarios como el chat abierto, donde el contenido es difícil de predecir, la longitud de aceptación no sube, los bloques no se llenan y la ventaja de DFlash no se aprovecha.

La cabeza de Markov de DSpark existe precisamente para abordar este mismo problema: generar un bloque completo de tokens en paralelo, donde las posiciones posteriores se calculan de forma independiente y pueden no encajar bien entre sí. La cabeza de Markov agrega una capa de dependencia entre estas posiciones para corregir específicamente este problema.

Como resultado, en escenarios de chat, DSpark es incluso más rápido que DFlash.

La posterior actualización mlx-dspark v0.0.3 integró oficialmente la versión original de DFlash de z-lab en el paquete, y agregó un parámetro para ajustar manualmente la longitud efectiva del bloque de DFlash: usar bloques cortos para escenarios de chat, y seguir usando bloques completos de 16 para escenarios de código y matemáticas.

Después de esto, el mismo Mac y el mismo paquete pueden realizar tanto tareas de chat como de código y matemáticas, sin necesidad de moverse entre los proyectos DSpark y DFlash.

Rahim dijo en su tuit que el mismo método debería funcionar en modelos borrador más grandes como Qwen3-8B y 14B.

Enlaces de referencia:[1]https://x.com/_ARahim_/status/2072021710602432577[2]https://github.com/ARahim3/mlx-dspark

Este artículo proviene de la cuenta pública de WeChat "Qubit", autor: Atención a la tecnología de vanguardia

Criptos en tendencia

Preguntas relacionadas

Q¿Qué es mlx-dspark y qué logra específicamente en modelos ejecutándose en Mac?

Amlx-dspark es la primera versión nativa para chips Apple de la tecnología DSpark de DeepSeek. Acelera la generación de modelos como Gemma-4 12B y Qwen3-4B en un 60% y 40% respectivamente en Mac, manteniendo una salida idéntica byte a byte al modelo original, sin pérdida de calidad.

Q¿Cómo funciona el método de decodificación especulativa DSpark para lograr la aceleración?

ADSpark emplea un modelo más pequeño (modelo "borrador") que genera rápidamente varios tokens candidatos. Luego, el modelo principal verifica todos los candidatos de una vez, aceptando los correctos y rechazando los erróneos para que el borrador intente nuevamente. Esto reduce el tiempo de decodificación secuencial.

Q¿Qué diferencia clave hay entre DFlash y DSpark en su enfoque de decodificación especulativa?

ADFlash genera un bloque completo de 16 tokens en paralelo mediante un proceso de "difusión de bloques", mientras que DSpark genera tokens candidatos de manera secuencial pero con dependencias (usando una cabeza Markov). DFlash es más rápido en tareas estructuradas como código, mientras que DSpark se desempeña mejor en conversación abierta.

Q¿Qué ajuste realizó Abdur Rahim en mlx-dspark para manejar diferentes tipos de tareas (chat vs. código)?

AEn mlx-dspark v0.0.3, Rahim integró DFlash y añadió un parámetro para ajustar manualmente la longitud efectiva del bloque. Se pueden usar bloques más cortos para chat y el bloque completo de 16 tokens para tareas de código y matemáticas, optimizando el rendimiento para cada escenario dentro del mismo paquete.

Q¿Qué precisión utilizó Rahim para los modelos objetivo y borrador en mlx-dspark para lograr un equilibrio óptimo entre velocidad y precisión?

AEl modelo objetivo principal se mantuvo en precisión de 8 bits, ya que usar bfloat16 incrementaba el costo de verificación. El modelo borrador se cuantificó a 4 bits (ocupando solo 1.8 GB), lo que permitió una ejecución eficiente sin pérdida de precisión y manteniendo una alta tasa de aceptación de tokens candidatos.

Lecturas Relacionadas

BTC marca el ritmo, los altcoins se dan un festín: ¿Quién es el verdadero campeón de este repunte?

El mercado de criptomonedas despertó bruscamente la semana pasada, con Bitcoin liderando una fuerte subida de más del 26%, alcanzando los 79.500 dólares. Este repunte, el mayor desde marzo de 2023, fue impulsado por dos factores macro clave: el anuncio del Tesoro de EE.UU. de aumentar las recompras de bonos a largo plazo (interpretado como un alivio de liquidez) y el impulso del expresidente Trump a una ley de clarificación regulatoria para activos digitales. La dinámica confirmó varias reglas del mercado: 1) Los giros a corto plazo dependen cada vez más del ciclo político y de liquidez de EE.UU. 2) Los ETF spot de Bitcoin y Ethereum actuaron como indicadores adelantados, con entradas netas récord de 26.000 millones de dólares. 3) La subida de Bitcoin desencadenó una rotación clásica de capital hacia otros criptoactivos. Ethereum superó a Bitcoin, subiendo casi un 30%, respaldado por fuertes entradas en su ETF spot y una oferta en exchanges en disminución. Sin embargo, los mayores rendimientos se vieron en las "altcoins". ENA (Ethena) lideró con una subida del 100,75%, impulsada por una asociación con Coinbase. Le siguieron PUMP (~88-99%), STX (~82-94%), TRUMP (~79-91%) y ZEC (~75%), siendo Zcash el único que alcanzó un nuevo máximo histórico. Los memecoins, como "牛来" y BOME, también mostraron una gran elasticidad. El patrón fue claro: Bitcoin preparó el escenario, Ethereum y las principales altcoins actuaron, y los proyectos más especulativos y memecoins ofrecieron los mayores rendimientos, reflejando el camino de rotación del capital desde la prudencia hasta el entusiasmo especulativo.

marsbitHace 29 min(s)

BTC marca el ritmo, los altcoins se dan un festín: ¿Quién es el verdadero campeón de este repunte?

marsbitHace 29 min(s)

Interpretación del informe de Goldman Sachs: Previsión de equipos de obleas front-end (WFE) revisada al alza hasta 150.000 millones de dólares, DRAM y foundry lideran el gasto en equipos

El 23 de agosto, Goldman Sachs publicó un informe que revisa sustancialmente al alza las previsiones de gasto en equipos de fabricación de obleas (WFE). Se prevé que el mercado alcance los 1500, 2180 y 2810 mil millones de dólares en 2026, 2027 y 2028, respectivamente, lo que representa aumentos significativos respecto a las estimaciones anteriores. La revisión se debe principalmente a la fuerte demanda a corto plazo de DRAM y fundición de procesos avanzados, mientras que se espera que la NAND y la lógica/otros (incluido Terafab) impulsen el crecimiento a medio plazo. * **DRAM:** Es el segmento con mayor revisión al alza, impulsado por las mayores necesidades de equipos para la producción de HBM4. Se espera que las limitaciones de capacidad en el sector duren hasta 2028. * **Fundición:** La previsión se ha incrementado, principalmente por la intensificación del proceso N2 de TSMC (que utiliza arquitectura GAA), lo que aumenta la demanda de equipos como litografía EUV. * **Lógica/Otros:** El crecimiento se ve apoyado por la demanda de Intel, la recuperación de los nodos maduros y, de manera destacada, por la contribución inicial de los compromisos de equipos para Terafab de SpaceX y Tesla. * **NAND:** La previsión se mantiene en gran medida, con un gasto centrado en actualizaciones tecnológicas. Goldman Sachs considera que este escenario, con múltiples sectores expandiéndose simultáneamente, beneficia a los principales proveedores de equipos como Applied Materials, Lam Research, ASML, Tokyo Electron, ASMI, BESI, Lasertec y Ebara.

marsbitHace 50 min(s)

Interpretación del informe de Goldman Sachs: Previsión de equipos de obleas front-end (WFE) revisada al alza hasta 150.000 millones de dólares, DRAM y foundry lideran el gasto en equipos

marsbitHace 50 min(s)

Trading

Spot

Artículos destacados

Cómo comprar ONE

¡Bienvenido a HTX.com! Hemos hecho que comprar Harmony (ONE) sea simple y conveniente. Sigue nuestra guía paso a paso para iniciar tu viaje de criptos.Paso 1: crea tu cuenta HTXUtiliza tu correo electrónico o número de teléfono para registrarte y obtener una cuenta gratuita en HTX. Experimenta un proceso de registro sin complicaciones y desbloquea todas las funciones.Obtener mi cuentaPaso 2: ve a Comprar cripto y elige tu método de pagoTarjeta de crédito/débito: usa tu Visa o Mastercard para comprar Harmony (ONE) al instante.Saldo: utiliza fondos del saldo de tu cuenta HTX para tradear sin problemas.Terceros: hemos agregado métodos de pago populares como Google Pay y Apple Pay para mejorar la comodidad.P2P: tradear directamente con otros usuarios en HTX.Over-the-Counter (OTC): ofrecemos servicios personalizados y tipos de cambio competitivos para los traders.Paso 3: guarda tu Harmony (ONE)Después de comprar tu Harmony (ONE), guárdalo en tu cuenta HTX. Alternativamente, puedes enviarlo a otro lugar mediante transferencia blockchain o utilizarlo para tradear otras criptomonedas.Paso 4: tradear Harmony (ONE)Tradear fácilmente con Harmony (ONE) en HTX's mercado spot. Simplemente accede a tu cuenta, selecciona tu par de trading, ejecuta tus trades y monitorea en tiempo real. Ofrecemos una experiencia fácil de usar tanto para principiantes como para traders experimentados.

862 Vistas totalesPublicado en 2024.12.12Actualizado en 2026.06.02

Cómo comprar ONE

Discusiones

Bienvenido a la comunidad de HTX. Aquí puedes mantenerte informado sobre los últimos desarrollos de la plataforma y acceder a análisis profesionales del mercado. A continuación se presentan las opiniones de los usuarios sobre el precio de ONE (ONE).

活动图片