Новая статья AMD меняет представления: нестабильность обучения с FP4 вызвана не недостатком случайности
Новый документ AMD меняет представления: нестабильность обучения в формате FP4 вызвана не недостатком случайности, а накоплением структурных ошибок микромасштабирования.
Исследователи AMD и Университета Пенсильвании провели полное предобучение модели Llama 3.1-8B на аппаратном обеспечении AMD Instinct MI355X, поддерживающем FP4, используя формат MXFP4 (Microscaling). Ключевой вывод: основная причина нестабильности при обучении с FP4 — не недостаток случайности, как считалось ранее, а структурные ошибки квантования, которые накапливаются и усиливаются, особенно на критическом пути градиента весов (Wgrad).
Эксперименты показали, что замена операций прямого распространения (Fprop) и градиента активации (Dgrad) на MXFP4 незначительно влияет на сходимость. Однако квантование градиента весов (Wgrad) до 4 бит приводит к значительному ухудшению. Стратегии, добавляющие случайность (стохастическое округление, рандомизированное преобразование Адамара), не стабилизируют процесс, а усугубляют его. Напротив, **детерминированное преобразование Адамара** устраняет нестабильность, обеспечивая согласованный шаблон ошибок на каждом шаге.
С использованием детерминированного преобразования Адамара и полного конвейера MXFP4, обучение завершилось всего на 8-9% большим числом токенов по сравнению с базовым FP8, при этом производительность на шаг выросла на 20%. Итоговое ускорение от начала до конца составило 9-10%.
Работа имеет важное значение: 1) Даёт чёткий диагноз проблемы структурных ошибок. 2) Делает FP4 пригодным не только для вывода, но и для обучения, потенциально удваивая эффективную производительность аппаратного обеспечения. 3) Основана на открытом стандарте OCP Microscaling, обеспечивая переносимость между разными аппаратными платформами.
marsbit05/27 06:21