Un nouveau papier d'AMD remet en cause les idées reçues : L'instabilité de l'entraînement en FP4 n'est pas due à un manque de stochasticité
AMD et l’Université d’État de Pennsylvanie ont publié une étude qui remet en cause la croyance selon laquelle l’instabilité de l’entraînement des modèles de langue en précision FP4 proviendrait d’un manque de stochasticité. Leur recherche révèle que l’instabilité est principalement due à l’accumulation et à l’amplification d’erreurs structurelles de micro-mise à l’échelle (micro-scaling) le long du chemin des gradients sensibles, notamment lors du calcul du gradient des poids (Wgrad). En utilisant le format MXFP4 et une rotation de Hadamard déterministe (et non stochastique) pour stabiliser le processus, l’équipe a réussi à entraîner complètement un modèle Llama 3.1-8B sur du matériel natif FP4 (AMD Instinct MI355X). Cette méthode a permis d’accélérer le débit des étapes d’entraînement de 20% et d’obtenir une accélération globale de 9 à 10% par rapport à une base FP8, avec seulement 8 à 9% de tokens d’entraînement supplémentaires nécessaires. Ces résultats ouvrent la voie à une utilisation du FP4 non seulement pour l’inférence, mais aussi pour l’entraînement, potentiellement en doublant l’efficacité de calcul sur le matériel supportant nativement cette précision.
marsbit05/27 06:24