Новая статья AMD меняет представления: нестабильность обучения с FP4 вызвана не недостатком случайности

marsbitОпубликовано 2026-05-27Обновлено 2026-05-27

Введение

Новый документ AMD меняет представления: нестабильность обучения в формате FP4 вызвана не недостатком случайности, а накоплением структурных ошибок микромасштабирования. Исследователи AMD и Университета Пенсильвании провели полное предобучение модели Llama 3.1-8B на аппаратном обеспечении AMD Instinct MI355X, поддерживающем FP4, используя формат MXFP4 (Microscaling). Ключевой вывод: основная причина нестабильности при обучении с FP4 — не недостаток случайности, как считалось ранее, а структурные ошибки квантования, которые накапливаются и усиливаются, особенно на критическом пути градиента весов (Wgrad). Эксперименты показали, что замена операций прямого распространения (Fprop) и градиента активации (Dgrad) на MXFP4 незначительно влияет на сходимость. Однако квантование градиента весов (Wgrad) до 4 бит приводит к значительному ухудшению. Стратегии, добавляющие случайность (стохастическое округление, рандомизированное преобразование Адамара), не стабилизируют процесс, а усугубляют его. Напротив, **детерминированное преобразование Адамара** устраняет нестабильность, обеспечивая согласованный шаблон ошибок на каждом шаге. С использованием детерминированного преобразования Адамара и полного конвейера MXFP4, обучение завершилось всего на 8-9% большим числом токенов по сравнению с базовым FP8, при этом производительность на шаг выросла на 20%. Итоговое ускорение от начала до конца составило 9-10%. Работа имеет важное значение: 1) Даёт чёткий диагноз проблемы структурных ошибок....

Общеизвестно, что обучение больших моделей чрезвычайно дорого.

Но также известно, что снижение точности вычислений может значительно снизить стоимость обучения. DeepSeek-V3, используя обучение в формате FP8, снизил стоимость до 5,6 миллиона долларов, что уже привлекло внимание всей индустрии.

После успеха FP8 индустрия продолжает исследовать границы низкой точности: если снизить точность с FP8 до FP4, насколько ещё можно снизить стоимость обучения?

Теоретически, вычислительная пропускная способность FP4 может быть в два раза выше, чем у FP8. NVIDIA Blackwell и AMD MI350 уже на аппаратном уровне имеют нативную поддержку вычислений FP4, при этом B200 от NVIDIA заявляет пиковую производительность FP4 до 4500 TOPS (разряженная). Аппаратное обеспечение готово, но со стороны программного обеспечения и алгоритмов возникает проблема:

Обучение больших моделей с нуля на FP4 является крайне нестабильным процессом.

За последние два года такие работы, как LLM-FP4, предобучение NVFP4 и другие, пробовали этот путь, но лишь немногие подходы смогли чисто и надёжно провести полный цикл предобучения с 4-битной точностью, сохранив качество сходимости, близкое к FP8.

Что ещё хуже, причина сбоев оставалась неясной. Анализ предполагал, что причина нестабильности обучения на FP4, вероятно, заключается в недостатке случайности.

Но недавно AMD совместно с Университетом штата Пенсильвания опубликовала статью, которая меняет традиционные представления и даёт новое чёткое объяснение для нативного обучения FP4.

  • Название статьи: Pretraining large language models with MXFP4 on Native FP4 Hardware
  • Ссылка на статью: https://arxiv.org/abs/2605.09825

В этой статье, на GPU AMD Instinct MI355X, используя формат MXFP4, был выполнен полный цикл предобучения модели Llama 3.1-8B. Скорость сквозного обучения оказалась на 9-10% выше, чем у базовой линии FP8, при увеличении затрат на токены всего на 8-9%. Это первый полный эксперимент по предобучению большой модели, выполненный на нативном оборудовании FP4 (не программной эмуляции).

Что ещё важнее, статья раскрывает ключевую проблему: источник нестабильности обучения FP4 — не недостаток случайности, а структурная ошибка микромасштабирования, которая накапливается и усиливается вдоль чувствительных путей градиентов.

Что такое MXFP4

Прежде чем разбирать статью, необходимо понять формат данных MXFP4.

Традиционное целочисленное квантование обычно использует один масштабирующий коэффициент для всего тензора. Ключевой конструкцией MXFP4 является «микромасштабирование» (Micro-scaling): тензор разбивается на небольшие блоки (например, по 32 элемента), для каждого блока выделяется общий экспоненциальный коэффициент (формат E8M0), а каждый элемент внутри блока представлен 4-битным числом с плавающей запятой. Формула восстановления может быть записана как:

где E_shared — это максимальный экспоненциальный коэффициент в блоке, а Q_FP4 — значение, округлённое до ближайшего представимого 4-битного числа с плавающей запятой.

Преимущество микромасштабирования заключается в следующем: каждый блок имеет свой собственный динамический диапазон и не «заложник» глобальных выбросов. Это значительно улучшает качество представления 4-битных чисел с плавающей запятой по сравнению с простым глобальным квантованием.

Но даже с микромасштабированием обучение на FP4 остаётся нестабильным.

Поисковая экспериментальная работа: корень нестабильности

Исследовательская группа сначала разработала контрольный эксперимент с пошаговой проверкой.

Одно полное вычисление линейного слоя Transformer включает три операции универсального матричного умножения:

Fprop (прямое распространение): вычисление Y = XW^T, получение значений активации.

Dgrad (градиент активации): вычисление ∇X = ∇Y · W, передача градиента обратно на вход.

Wgrad (градиент весов): вычисление ∇W = (∇Y)^T · X, получение градиента для обновления весов.

Исследовательская группа, сохраняя все остальные факторы неизменными, постепенно заменяла эти три операции с FP8 на MXFP4, наблюдая влияние каждого шага на сходимость. Все эксперименты выполнялись на AMD Instinct MI355X с использованием нативных тензорных ядер FP4, без зависимости от программной эмуляции.

Задачей обучения была стандартная конфигурация MLPerf: предобучение Llama 3.1-8B на наборе данных C4, целевой метрикой сходимости была перплексия на валидационной выборке, равная 3.3.

Первые два шага привели к умеренному дополнительному расходу токенов, но как только Wgrad также был заменён на MXFP4, расход сразу подскочил до 26-27%.

Wgrad является узким местом обучения FP4. Прямое распространение и градиент активации имеют значительную толерантность к квантованию FP4, но как только градиент весов квантуется до 4 бит, качество сходимости значительно ухудшается.

Ранее преобладала интуиция в индустрии, что ошибка квантования FP4 по сути является проблемой шума, поэтому её можно «сгладить», вводя случайность. Две распространённые стратегии:

Стохастическое округление (Stochastic Rounding): введение случайности при квантовании, чтобы математическое ожидание ошибки округления было равно нулю.

Случайное преобразование Адамара (Randomized Hadamard): перед квантованием используется преобразование Адамара со случайными переворотами знаков для размывания распределения данных.

После квантования Wgrad обе стратегии случайности не только не стабилизировали обучение, но и напрямую привели к отсутствию сходимости. Случайность не помогла, а, наоборот, внесла больше эффективной ошибки квантования на критических путях градиентов.

Напротив, детерминированное преобразование Адамара снизило общие затраты на токены с 26-27% до 8-9%, а траектория обучения плотно следовала за базовой линией FP8.

Это результат, имеющий большую диагностическую ценность. И случайное, и детерминированное преобразования Адамара являются ортогональными преобразованиями, оба могут размывать распределение энергии выбросов, и теоретически должны иметь схожий эффект смягчения ошибок квантования. Но их производительность в сценарии Wgrad кардинально противоположна, что раскрывает суть проблемы:

Нестабильность обучения FP4 обусловлена структурными ошибками, создаваемыми микромасштабированием MXFP4 на чувствительных путях градиентов. Стратегии случайности терпят неудачу, потому что они вносят разные шаблоны ошибок на каждом шаге, и эти изменяющиеся шаблоны накапливаются вдоль пути градиентов, усиливая нестабильность. Детерминированное преобразование эффективно именно потому, что оно применяет одинаковое преобразование на каждом шаге, заставляя шаблоны ошибок оставаться согласованными и избегая их накопления.

Сквозная эффективность: пропускная способность шага обучения +20%, общее ускорение 9-10%

После добавления детерминированного преобразования Адамара и применения полного цикла MXFP4, показатели эффективности следующие:

Пропускная способность шага обучения увеличилась на 20%, и после вычета дополнительных 8-9% затрат на токены, общее сквозное ускорение всё равно составляет 9-10%.

Учитывая, что точность была напрямую снижена с 8 бит до 4 бит, такое качество сходимости и степень ускорения весьма впечатляют.

Левый график: кривая изменения перплексии на валидационной выборке модели Llama 3.1–8B в зависимости от количества токенов обучения при предобучении по стандарту MLPerf на наборе данных C4. Результаты показывают, что MXFP4 + детерминированное преобразование Адамара работает очень близко к FP8, в то время как полный цикл MXFP4 без стабилизации сходится медленнее и менее стабилен. Правый график: увеличенный вид поздних этапов обучения. Целевая перплексия по MLPerf составляет 3.3. По сравнению с нестабилизированным запуском MXFP4, детерминированное преобразование Адамара (H16) сохраняет гораздо более тесное соответствие с базовой линией FP8.

Примечательно, что авторы в статье подчёркивают важное ограничение: эффективность этой схемы обучения FP4 (набор данных MLPerf C4 + Llama 3.1-8B) уже подтверждена, но нельзя напрямую предполагать, что она будет бесшовно переноситься на все модели, все наборы данных и все методы обучения. Поведение обучения FP4 может сильно зависеть от конкретной конфигурации, и конкретные стратегии стабилизации необходимо перепроверять для каждого сценария.

Заключение

Если поместить эту статью в более широкий контекст индустрии, можно выделить как минимум три уровня значимости.

Первый уровень: она отвечает на фундаментальный вопрос «почему». Предыдущие работы по обучению FP4 в основном фокусировались на «как сделать, чтобы оно не падало», тогда как эта статья впервые даёт чёткое причинно-следственное объяснение: сбой вызван структурными ошибками микромасштабирования на пути Wgrad, а не недостатком случайности. Само по себе это объяснение имеет методологическую ценность: оно говорит последующим исследователям, что при столкновении с нестабильностью при обучении с низкой точностью, следует в первую очередь искать источники структурных ошибок, а не слепо добавлять случайность.

Второй уровень: она перемещает FP4 из сферы «исключительно для вывода» в сферу «пригодности для обучения». Ранее консенсус в индустрии заключался в том, что FP4 подходит только для квантования при выводе, а для обучения требуется как минимум FP8. NVIDIA, продвигая на Blackwell именно FP4 для вывода, а не для обучения, также отражала это мнение. Эта статья, выполнив полный цикл предобучения на нативном оборудовании FP4, означает, что вычислительные мощности FP4, подготовленные для вывода на MI355X и Blackwell, теоретически также могут быть использованы для обучения. Если обучение на FP4 окажется работоспособным на более крупных моделях и в большем количестве сценариев, это фактически удвоит доступные вычислительные мощности для обучения на существующем оборудовании.

Третий уровень: она использует открытый стандарт OCP. MXFP4 является частью стандарта форматов микромасштабирования OCP (Microscaling Formats), поддержанного совместно семью компаниями: AMD, NVIDIA, Intel, Meta, Microsoft, Arm, Qualcomm. Использование открытого стандарта означает, что этот метод может быть перенесён на оборудование разных производителей и не будет заблокирован в рамках одной экосистемы.

От FP16 до FP8, DeepSeek-V3 уже доказал, что уменьшение точности вдвое может значительно снизить стоимость обучения. От FP8 до FP4, эта статья сделала ключевой первый шаг. Каждое снижение точности меняет экономику обучения больших моделей.

Эта статья взята из официального аккаунта WeChat «Машинное сердце» (ID:almosthuman2014), редактор: Лэн Мао.

Трендовые криптовалюты

Связанные с этим вопросы

QКакой основной вывод сделали исследователи AMD о причине нестабильности при обучении моделей с использованием FP4?

AОсновной вывод заключается в том, что нестабильность обучения с FP4 вызвана не недостатком случайности, а структурными ошибками микромасштабирования, которые накапливаются и усиливаются по чувствительным градиентным путям, особенно при вычислении градиентов весов (Wgrad).

QЧто такое формат MXFP4 и чем он отличается от обычного квантования?

AMXFP4 — это формат данных 4-битной плавающей запятой с микромасштабированием. Его ключевое отличие от обычного квантования заключается в разделении тензора на небольшие блоки (например, по 32 элемента) и назначении каждому блоку своего общего показателя степени (shared exponent). Это позволяет каждому блоку иметь свой динамический диапазон, предотвращая искажение данных из-за глобальных выбросов.

QКакая операция в обучении трансформеров оказалась наиболее чувствительной к использованию MXFP4?

AНаиболее чувствительной операцией оказалось вычисление градиента весов (Wgrad). Когда эта операция выполнялась с точностью MXFP4, требовалось на 26–27% больше данных (токенов) для достижения сходимости по сравнению с базовым FP8, что указывает на значительное ухудшение качества обучения.

QПочему стратегии со случайным округлением не помогли стабилизировать обучение с FP4?

AСтратегии со случайным округлением или случайным преобразованием Адамара не стабилизировали обучение, потому что на каждом шаге они вносили различный паттерн ошибок. Эти изменчивые ошибки накапливались вдоль градиентного пути, усиливая нестабильность, вместо того чтобы сглаживать её.

QКакой метод стабилизации обучения с MXFP4 оказался эффективным и какую выгоду он дал?

AЭффективным методом оказалось детерминированное преобразование Адамара. Оно стабилизирует обучение, применяя на каждом шаге одно и то же преобразование, что обеспечивает согласованность паттерна ошибок и предотвращает их разрушительное накопление. В результате полное обучение модели Llama 3.1-8B стало возможным с дополнительными затратами всего в 8–9% токенов и обеспечило общее ускорение обучения на 9–10% по сравнению с FP8.

Похожее

Из Кореи в США: благодаря ИИ рабочие профессии становятся всё востребованнее

Искусственный интеллект меняет структуру рынка труда, повышая спрос и зарплаты квалифицированных рабочих специальностей, в то время как традиционное высшее образование теряет привлекательность. Данные из США показывают, что доходы профессиональных училищ выросли на 11.4% в 2025 году, а число увольнений из-за внедрения ИИ достигло рекордных 38 579 в мае. Молодое поколение всё чаще выбирает рабочие профессии, считая их более стабильными в эпоху автоматизации. В США зарплаты таких специалистов, как электрики и сантехники, уже сравнялись или превзошли доходы многих офисных работников. В Корее выпускники профильных школ, например, полупроводниковой, практически гарантированно получают работу в таких компаниях, как Samsung. Дефицит кадров усугубляется массовым выходом на пенсию старшего поколения и бумом строительства инфраструктуры, в том числе для дата-центров. Крупные компании, такие как Meta и JPMorgan, инвестируют миллионы в программы обучения. Несмотря на растущий интерес, преодоление стереотипов о "непрестижности" рабочих профессий остаётся ключевой задачей для полного удовлетворения рыночного спроса.

marsbit32 мин. назад

Из Кореи в США: благодаря ИИ рабочие профессии становятся всё востребованнее

marsbit32 мин. назад

От TPU к самосовершенствующимся агентам: как Джефф Дин видит следующий шаг в развитии ИИ

В статье на основе выступления Джеффа Дина на YC Startup School обсуждается эволюция ИИ от больших моделей к системам с долгосрочными агентами. Дин подчеркивает, что следующий этап ИИ — не просто более умные модели, а создание систем, способных к продолжительной автономной работе, самообучению и автоматизированным экспериментам. Ключевые темы включают смещение фокуса с размера моделей на организацию интеллекта, важность контекстной инженерии, аппаратной эффективности (особенно для вывода), а также возможности для стартапов в нишевых областях, где большие модели слабы. Он отмечает, что по мере удешевления генерации кода возрастает ценность четких спецификаций, правильной постановки задач и "вкуса" в выборе направлений. В итоге, главным становится не ответ модели, а создание надежных систем, способных выполнять сложные, многошаговые задачи.

marsbit35 мин. назад

От TPU к самосовершенствующимся агентам: как Джефф Дин видит следующий шаг в развитии ИИ

marsbit35 мин. назад

Qualcomm: спад ажиотажа вокруг ИИ. Когда наступит выздоровление на рынке смартфонов?

Компания Qualcomm (QCOM.O) опубликовала финансовый отчёт за третий квартал 2026 финансового года (по состоянию на июнь 2026 года). Выручка составила 9,95 млрд долларов США, что на 4% меньше, чем годом ранее, но превысило рыночные ожидания. Однако маржинальность снизилась до 53,1%, не достигнув прогнозируемых 54,6%, главным образом из-за роста себестоимости, включая затраты на производство и память. Основное давление на выручку оказал сегмент мобильных устройств, который упал на 19,6% до 5,09 млрд долларов. Это связано со снижением глобальных поставок смартфонов (кроме Apple) на 11%, а также с тенденцией производителей использовать старые платформы для снижения затрат. В то же время автомобильный бизнес продемонстрировал рост на 61% до 1,59 млрд долларов, а сегмент IoT вырос на 9% до 1,83 млрд. Чистая прибыль составила 2 млрд долларов, однако операционная прибыль снизилась на 41% из-за падения маржинальности и роста расходов. Прогноз на следующий квартал по выручке (97-105 млрд долларов) соответствует ожиданиям, но прогноз по прибыли на акцию оказался ниже рыночных оценок. На фоне слабости основного бизнеса Qualcomm активно развивает направление центров обработки данных (ЦОД) в сфере ИИ, представив четыре продуктовые линии: ускорители ИИ, коммерческие CPU, индивидуальные чипы и решения для подключения. Компания сотрудничает с Microsoft и Meta и ставит амбициозную цель по выручке от этого направления в 15 млрд долларов к 2029 финансовому году. Однако, поскольку данный бизнес ещё не вносит существенного вклада в выручку, а ожидания рынка в отношении ИИ снижаются, акции компании откатились с пиков, достигнутых на волне энтузиазма по поводу ИИ. В краткосрочной перспективе производительность компании по-прежнему зависит от восстановления рынка смартфонов и снижения цен на компоненты, такие как память.

marsbit36 мин. назад

Qualcomm: спад ажиотажа вокруг ИИ. Когда наступит выздоровление на рынке смартфонов?

marsbit36 мин. назад

Эксплойт Coldcard вызывает исход биткойнов, «бычья» консолидация крипторынка: Дайджест Ходлера, 2 августа

После утечки средств из кошельков Coldcard на сумму около $90 млн в биткойнах, мелкие держатели стали активно переводить средства на централизованные биржи. Объём переводов менее 1 BTC достиг максимума с 2022 года. По данным Galaxy Research, в результате трёх волн атак было скомпрометировано более 4500 адресов. Эксплойт использовал уязвимость в процессе генерации сида кошелька. В США обсуждение "Закона о ясности" (Clarity Act) зашло в тупик из-за разногласий по этическим нормам для политиков и регулированию стейблкоинов. Вероятность принятия закона до истечения срока крайне мала. Отчётность компаний за второй квартал показала снижение доходов: Coinbase сообщила о чистых убытках, а доход Robinhood от криптовалютных операций упал на 38%. При этом аналитик ARK Invest заявил, что индустрия вступает в фазу крупнейшей консолидации, что, по его мнению, является бычьим сигналом. Чемпионат мира по футболу 2026 года принёс $20 млрд объёма на блокчейн-рынках прогнозов. За неделю Bitcoin и Ether потеряли около 3% стоимости. Среди альткоинов лучше всего себя показали Cardano (ADA) и Uniswap (UNI). Аналитики Grayscale предположили, что дно рынка Bitcoin, возможно, уже достигнуто раньше традиционного четырёхлетнего цикла. В разделе FUD: основатель Telegram Павел Дуров объявлен в розыск в России, платформа Pump.fun уволила сотрудников перед получением ими токенов на миллионы долларов, а сотрудник Белого дома покинул пост на фоне обвинений в использовании инсайдерской информации для ставок на прогнозных рынках.

cointelegraph53 мин. назад

Эксплойт Coldcard вызывает исход биткойнов, «бычья» консолидация крипторынка: Дайджест Ходлера, 2 августа

cointelegraph53 мин. назад

ПОСЛЕДНИЕ НОВОСТИ: Дональд Трамп сделал резкое заявление по поводу Ирана! Он остановил атаки

Президент США Дональд Трамп заявил о приостановке запланированных масштабных военных действий против Ирана. Это решение было принято после обращения к нему Саудовской Аравии, ОАЭ, Катара и самого Ирана с просьбой предоставить время для дипломатических переговоров. Союзники в регионе полагают, что соглашение близко. Первоначальный этап переговоров будет сосредоточен на вопросах безопасности и возобновлении нормальной работы Ормузского пролива — ключевого маршрута для мировой нефтеторговли, чья безопасность критически важна для глобальных цен на энергоносители. После решения этих вопросов планируется начать переговоры по иранской ядерной программе. Новый раунд переговоров с Ираном начнётся завтра. В своём выступлении Трамп также коснулся темы валютного рынка, заявив, что США вмешались в поддержку японской иены, подчеркнув крепкие союзнические и взаимовыгодные экономические отношения с Японией.

cryptonews.ru2 ч. назад

ПОСЛЕДНИЕ НОВОСТИ: Дональд Трамп сделал резкое заявление по поводу Ирана! Он остановил атаки

cryptonews.ru2 ч. назад

Торговля

Спот

Популярные статьи

Как купить S

Добро пожаловать на HTX.com! Мы сделали приобретение Sonic (S) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки Sonic (S).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение Sonic (S)После приобретения вами Sonic (S) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля Sonic (S)С легкостью торгуйте Sonic (S) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

1.8k просмотров всегоОпубликовано 2025.01.15Обновлено 2026.06.02

Как купить S

Sonic: Обновления под руководством Андре Кронье – новая звезда Layer-1 на фоне спада рынка

Он решает проблемы масштабируемости, совместимости между блокчейнами и стимулов для разработчиков с помощью технологических инноваций.

2.4k просмотров всегоОпубликовано 2025.04.09Обновлено 2025.04.09

Sonic: Обновления под руководством Андре Кронье – новая звезда Layer-1 на фоне спада рынка

HTX Learn: Пройдите обучение по "Sonic" и разделите 1000 USDT

HTX Learn — ваш проводник в мир перспективных проектов, и мы запускаем специальное мероприятие "Учитесь и Зарабатывайте", посвящённое этим проектам. Наше новое направление .

1.9k просмотров всегоОпубликовано 2025.04.10Обновлено 2025.04.10

HTX Learn: Пройдите обучение по "Sonic" и разделите 1000 USDT

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на S (S) представлены ниже.

活动图片