Artículos Relacionados con Cuantificación

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Cuantificación", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

¿Ejecutar MoE en un móvil? Meta propone MobileMoE, acelera hasta 3.8 veces en iPhone 16 Pro

El equipo de Meta presenta MobileMoE, el primer modelo de mezcla de expertos (MoE) optimizado para ejecutarse de manera eficiente en teléfonos inteligentes comerciales. Diseñado como un modelo de lenguaje Transformer decoder-only, MobileMoE reemplaza las capas densas de feed-forward por capas MoE, empleando un router que selecciona los pocos expertos más relevantes por token junto con un experto compartido. El modelo se entrena en cuatro fases: preentrenamiento, entrenamiento intermedio, ajuste fino supervisado y entrenamiento consciente de cuantización (hasta INT4/INT8). Los experimentos determinan una configuración óptima de 8 expertos con granularidad 8, enrutamiento top-4 y un experto compartido. En evaluaciones de referencia, MobileMoE-S/M logra una precisión media comparable o superior a modelos densos, utilizando entre 1/2 y 1/4 del cálculo de inferencia con memoria similar. Especialmente en iPhone 16 Pro, MobileMoE-S acelera la fase de entrada hasta 3.8 veces y la generación token por token hasta 3.4 veces respecto a líneas de base. MobileMoE establece un nuevo límite de Pareto para modelos de lenguaje grandes en dispositivos, mejorando el equilibrio entre precisión y coste computacional. Los desafíos futuros incluyen mejorar la capacidad de seguimiento de instrucciones y la gestión de memoria dinámica, así como explorar el despliegue en NPU móviles.

marsbit06/01 06:12

¿Ejecutar MoE en un móvil? Meta propone MobileMoE, acelera hasta 3.8 veces en iPhone 16 Pro

marsbit06/01 06:12

Nuevo estudio de AMD desafía la creencia común: la inestabilidad del entrenamiento en FP4 no se debe a la falta de aleatoriedad

Un nuevo estudio de AMD y la Universidad Estatal de Pensilvania desafía la creencia de que la inestabilidad en el entrenamiento de modelos grandes de lenguaje (LLM) con precisión FP4 se debe a la falta de aleatoriedad. La investigación, realizada en hardware nativo FP4 (AMD Instinct MI355X), identifica que el problema principal es la acumulación y amplificación de errores estructurales de "microescalado" en la ruta del gradiente de los pesos (Wgrad). El estudio utilizó el formato MXFP4, que aplica factores de escala a pequeños bloques de datos. Los experimentos mostraron que cuantizar a FP4 las operaciones de propagación hacia adelante (Fprop) y gradiente de activación (Dgrad) era tolerable, pero al aplicar FP4 al cálculo del gradiente de los pesos (Wgrad), la convergencia se degradaba significativamente. Contrariamente a la intuición previa, estrategias como el redondeo estocástico o la transformada de Hadamard aleatoria empeoraban la inestabilidad. En cambio, una transformada de Hadamard **determinista** (no aleatoria) resultó efectiva, ya que aplica un patrón de error consistente que no se amplifica a lo largo del entrenamiento. Con esta solución, se completó el preentrenamiento de Llama 3.1-8B, logrando una aceleración del 9-10% en el entrenamiento extremo a extremo respecto a la línea base FP8, con solo un 8-9% de tokens adicionales necesarios para converger. Este trabajo demuestra la viabilidad del entrenamiento nativo FP4, potencialmente duplicando el rendimiento utilizable para entrenamiento en hardware como las GPU AMD MI350 y NVIDIA Blackwell, que ya soportan FP4.

marsbit05/27 06:23

Nuevo estudio de AMD desafía la creencia común: la inestabilidad del entrenamiento en FP4 no se debe a la falta de aleatoriedad

marsbit05/27 06:23

活动图片