Новый открытый исходный код NVIDIA MoE: одна строка import, ускорение тонкой настройки в 3,7 раза

marsbitОпубликовано 2026-06-26Обновлено 2026-06-26

Введение

NVIDIA представила открытую библиотеку NeMo AutoModel, которая значительно ускоряет тонкую настройку MoE-моделей. Достаточно добавить одну строку импорта в код на основе Hugging Face Transformers v5, чтобы получить прирост производительности до 3.7 раз и сократить использование видеопамяти GPU на 29-32%. Библиотека совместима с API Transformers и вводит три ключевые оптимизации: Expert Parallelism (EP) для распределения параметров экспертов по GPU и снижения нагрузки на память, DeepEP для совмещения вычислений и коммуникаций, а также Transformer Engine для ускорения базовых операций. На примере модели Qwen3-30B-A3B на 8 GPU H100 скорость обучения выросла с 3075 до 11340 токенов в секунду на GPU. Для очень крупных моделей, таких как Nemotron 3 Ultra 550B, NeMo AutoModel позволяет проводить тонкую настройку там, где стандартный Transformers v5 исчерпывает доступную память. Проект доступен на GitHub, предоставляя простой способ ускорения работы с MoE-архитектурами без серьёзных изменений кода.

Одна строка import, тонкая настройка большой модели MoE ускоряется в 3,7 раза.

Последние исследования NVIDIA теперь с открытым исходным кодом: NeMo AutoModel, специально разработанный для масштабного построения и тонкой настройки генеративных моделей ИИ.

На основе Hugging Face Transformers v5, NeMo AutoModel позволяет, не меняя API кода, лишь добавив одну строку import, реализовать более быструю тонкую настройку моделей MoE.

Эксперименты показывают, что по сравнению с оригинальной версией Transformers v5 от Hugging Face, NVIDIA NeMo AutoModel позволяет достичь повышения пропускной способности обучения в 3,4-3,7 раза при тонкой настройке MoE и сократить использование видеопамяти GPU на 29%-32%.

На одном узле с 8xH100 80GB GPU, на примере Qwen3-30B-A3B, NeMo AutoModel напрямую повышает TPS/GPU (пропускную способность на GPU в секунду) с 3075 до 11340, увеличение в 3.69 раза.

Анализ ключевых технологий

MoE уже стала основной архитектурой для современных передовых моделей, но MoE также создает новые вызовы для эффективного обучения:

Параллелизм экспертов, слияние коммуникаций, оптимизация ядра... Для поддержки этих сложных инженерных задач необходима соответствующая инфраструктура.

Transformers v5 от HuggingFace — это наиболее часто используемая в настоящее время «универсальная основа» для обучения MoE. Версия v5 улучшила нативную поддержку MoE, добавив базовые возможности MoE, такие как expert backends, dynamic weight loading, распределенное выполнение.

На этот раз подход NVIDIA заключается в том, чтобы, опираясь на достижения предшественников, сохранить совместимость с API HuggingFace Transformers, позволяя пользователям без серьезных изменений кода получить более высокую пропускную способность обучения и меньшее использование видеопамяти при тонкой настройке MoE.

Конкретно, NeMo AutoModel на основе Transformers v5 добавляет Параллелизм Экспертов (EP), DeepEP и TransformerEngine.

Параллелизм Экспертов (Expert Parallelism)

Технология параллелизма экспертов в основном используется для снижения нагрузки на память.

EP распределяет веса экспертов на несколько GPU, и каждая видеокарта больше не содержит полные параметры всех экспертов, а только часть из них.

Например, на 8 GPU с ep_size=8, веса экспертов распределены на 8 GPU, занимаемая MoE память на каждом GPU может снизиться до 1/8 от исходной.

Согласно результатам экспериментов, для Qwen3 эта технология может снизить пиковое использование памяти с 68.2 GiB до 48.1 GiB, снижение на 29%.

Для модели Nemotron Nanomo, использование памяти снизилось с 62.1 GiB до 42.5 GiB, снижение на 32%.

Освобожденное пространство можно использовать для поддержки большего размера пакета (batch size) или более длинных последовательностей.

DeepEP

DeepEP реализует слияние вычислений и коммуникаций.

В традиционном подходе между распределением токенов и вычислениями экспертов существуют явные затраты на коммуникацию. DeepEP интегрирует операции распределения и комбинирования токенов в оптимизированное GPU ядро, добиваясь перекрытия процессов коммуникации и вычислений экспертов.

TransformerEngine

Ядро TransformerEngine обеспечивает ускорение для различных ключевых операций.

Эта технология предоставляет реализации слияния механизма внимания, линейных слоев и RMSNorm и т.д., ускоряя не только слои MoE, но и обычные Transformer слои.

Одна строка import, 3-кратное ускорение

Подводя итог, для тех, кто уже использует Transformers v5, NVIDIA NeMo AutoModel предлагает безболезненный вариант обновления:

Достаточно добавить одну строку кода import, чтобы получить 3-кратное ускорение тонкой настройки MoE.

На Qwen3-30B-A3B и Nemotron 3 Nano 30B-A3B, по сравнению с Transformers v5, данное решение позволяет достичь повышения пропускной способности обучения в 3.4-3.7 раза при одновременном снижении потребления памяти на 29%-32%.

NVIDIA также продемонстрировала результаты полной тонкой настройки параметров (full-parameter fine-tuning) для Nemotron 3 Ultra 550B A55B на 16 узлах H100, 128 GPU.

TPS/GPU составляет 815, TFLOP/s/GPU примерно 293, пиковое использование памяти — 58.2 GiB.

Причина отсутствия сравнения с v5 здесь в том, что Transformers v5 при таком масштабе просто исчерпает всю память ̄_(ツ)_/ ̄

Если интересно, NVIDIA уже выложила код, конфигурации и скрипты бенчмарков на GitHub: https://github.com/NVIDIA-NeMo/Automodel/tree/blog/transformers-v5-automodel/blog_experiments

Конкретное руководство по использованию здесь: https://docs.nvidia.com/nemo/automodel/latest/get-started/hf-compatibility

Статья из официального аккаунта WeChat «Квантовый бит», автор: Юй Ян

Трендовые криптовалюты

Связанные с этим вопросы

QКакой результат демонстрирует NeMo AutoModel от NVIDIA по сравнению с Hugging Face Transformers v5 при тонкой настройке MoE-моделей?

ANeMo AutoModel демонстрирует увеличение пропускной способности обучения в 3.4-3.7 раза и снижение потребления видеопамяти GPU на 29-32% по сравнению с Hugging Face Transformers v5 при тонкой настройке MoE-моделей.

QКакие ключевые технологии использует NeMo AutoModel для достижения такого ускорения?

ANeMo AutoModel использует три ключевые технологии: Expert Parallelism (EP) для распределения весов экспертов и снижения давления на память, DeepEP для совмещения вычислений и коммуникаций, а также TransformerEngine, предоставляющий оптимизированные ядра для ускорения основных операций, таких как механизм внимания.

QКак пользователи, уже работающие с Transformers v5, могут начать использовать NeMo AutoModel?

AПользователям, уже работающим с Transformers v5, достаточно добавить всего одну строку с импортом NeMo AutoModel в свой код, без необходимости вносить существенные изменения в API или логику. Это позволяет получить значительный прирост производительности с минимальными усилиями.

QЧто такое Expert Parallelism (EP) и какова его польза?

AExpert Parallelism (EP) — это технология, которая распределяет веса экспертов в MoE-модели по нескольким GPU. Вместо того чтобы каждая GPU хранила все параметры экспертов, она хранит только их часть. Это значительно снижает потребление памяти на каждой GPU (например, в 8 раз при использовании 8 GPU), что позволяет увеличить размер пакета или длину последовательности при обучении.

QГде можно найти код и документацию по NeMo AutoModel?

AКод, конфигурации и скрипты для тестирования NeMo AutoModel выложены на GitHub: https://github.com/NVIDIA-NeMo/Automodel/tree/blog/transformers-v5-automodel/blog_experiments. Подробное руководство по началу работы находится по адресу: https://docs.nvidia.com/nemo/automodel/latest/get-started/hf-compatibility.

Похожее

Анализ реальных сценариев использования стейблкоинов и региональных возможностей

Стабильные монеты в основном используются для внутренних расчетов. Согласно анализу данных Allium, внутренние переводы составляют 62,6% от общего идентифицированного объема транзакций в $152 млрд, что указывает на активное использование для платежей, торговли и сбережений в долларах внутри стран. Ключевыми рынками являются Турция, Южная Корея, Мексика, Индонезия и США. В трансграничных операциях 73% средств остаются в пределах региона отправителя. Азиатско-Тихоокеанский регион (АТР) лидирует по объему транзакций (41%) и внутренних переводов ($39,6 млрд, 41,6% глобальных). Он также демонстрирует чистый приток средств, особенно в Индонезию, Сингапур и Южную Корею. Крупнейшие трансграничные коридоры включают Турцию-Индонезию и США-Мексику. В АТР значительны потоки между Тайванем и Индонезией, а также Индонезией и Южной Кореей, формируя основу для развития региональной платежной инфраструктуры. Основные рыночные возможности для институтов лежат в сфере внутренних расчетных сервисов и трансграничных платежных каналов в Азиатско-Тихоокеанском регионе.

marsbit22 мин. назад

Анализ реальных сценариев использования стейблкоинов и региональных возможностей

marsbit22 мин. назад

Ремонтная бригада создала абстрактный шедевр «Пришел бык», а мем-токен с таким же названием вырос в 3000 раз за 3 дня

Статья рассказывает о неожиданном вирусном успехе анимационного фильма «牛来» («Приходи, бык»), созданного небольшой компанией из Даляня, ранее занимавшейся ремонтом. Фильм, вышедший 5 августа, с примитивной графикой и абстрактным сюжетом изначально собрал провальные 7000 юаней за 9 дней. Однако именно его «кустарность» и абсурдность привлекли внимание интернет-сообщества, превратив «牛来» в мем. Фильм стал предметом массовых обсуждений и пародий как в Китае, так и за рубежом, а его посещение превратилось в тренд. На волне хайпа 14 августа была запущена мем-монета с тем же названием. За три дня её рыночная капитализация взлетела почти до 30 миллионов долларов, показав рост в 3000 раз для ранних инвесторов. История «牛来» рассматривается как пример силы мемов в современной культуре, символизирующий как протест против гладкой киноиндустрии, так и народные надежды на «бычий» рынок в финансах.

marsbit1 ч. назад

Ремонтная бригада создала абстрактный шедевр «Пришел бык», а мем-токен с таким же названием вырос в 3000 раз за 3 дня

marsbit1 ч. назад

На самом деле, основной сценарий оплаты стабильными монетами не в трансграничных платежах

Анализ данных Allium показывает, что основная часть трансфера стейблкоинов (62.6% от $15.2 млрд опознанных транзакций) происходит внутри стран, а не как кросс-бордерные переводы. Лидером по объему операций является Азиатско-Тихоокеанский регион (АТР) с 41% от общего отправленного объема. Внутрирегиональные потоки также преобладают: 73% всех идентифицированных средств остаются в регионе отправителя. Крупнейшие внутренние рынки — Турция, Южная Корея, Мексика, Индонезия и США. Пользователи активно используют стейблкоины для внутренних расчетов, платежей и сбережений в долларах США. В кросс-бордерных потоках (27.8% от $5.68 млрд) также доминирует АТР, где формируются значительные двусторонние коридоры (например, Тайвань-Индонезия, Индонезия-Южная Корея). Индонезия, Сингапур и Южная Корея являются чистыми реципиентами капитала. **Ключевой вывод:** для организаций, оценивающих спрос на платежные решения со стейблкоинами, наибольший потенциал в настоящее время представляют услуги по внутренним расчетам внутри стран, а также развитие платежных коридоров внутри АТР.

marsbit2 ч. назад

На самом деле, основной сценарий оплаты стабильными монетами не в трансграничных платежах

marsbit2 ч. назад

2 триллиона долларов: обратный отсчёт до крупнейшего IPO в истории ИИ

Менее чем через два месяца, в октябре, на Уолл-стрит ожидают историческое IPO компании Anthropic с потенциальной оценкой в $2 трлн, что станет крупнейшим в истории ИИ. Всего за пять лет компания, основанная бывшими ключевыми сотрудниками OpenAI, может достичь этой отметки, в то время как Apple на это потребовалось 40 лет. Выручка Anthropic демонстрирует взрывной рост: с $90 млрд (годовой темп) в конце 2025 года до $470 млрд в мае 2026-го. Во втором квартале 2026 года выручка составила $115 млрд, что в 14 раз больше, чем годом ранее. Согласно внутренним прогнозам, к 2028 году выручка может достичь $1,9-2 трлн. Именно на этих ожиданиях будущих доходов инвесторы и банки строят свою оценку. Основу доходов (70-80%) составляют плата за API и корпоративные контракты, взимаемая за использование токенов. Ключевым драйвером роста стала платформа для разработчиков Claude Code, чья доля в доходах компании приближается к 20%. По некоторым данным, Anthropic уже занимает около 40% корпоративных расходов на большие языковые модели, обгоняя OpenAI. Однако на фоне подготовки к IPO в компании нарастает внутренний конфликт. Сообщается о глубоком расколе между руководством, придерживающимся философии «спасения человечества» через безопасный ИИ, и рядовыми сотрудниками, недовольными такой культурой. Многие оказались в ловушке: с одной стороны, ценные опционы перед IPO, с другой — неприятие корпоративной среды. Anthropic оказалась в парадоксальной ситуации: для создания «безопасного» ИИ требуются огромные вычислительные мощности, финансируемые инвесторами, которые, в свою очередь, требуют агрессивного роста и высокой отдачи. Компании предстоит балансировать между этими требованиями, давлением регуляторов, высокими затратами и внутренними противоречиями. Успех или провал ее грандиозного IPO, запланированного на октябрь, определит ее место в финальной гонке за искусственный сверхинтеллект (ASI).

marsbit3 ч. назад

2 триллиона долларов: обратный отсчёт до крупнейшего IPO в истории ИИ

marsbit3 ч. назад

Торговля

Спот

Популярные статьи

Как купить ONE

Добро пожаловать на HTX.com! Мы сделали приобретение Harmony (ONE) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки Harmony (ONE).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение Harmony (ONE)После приобретения вами Harmony (ONE) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля Harmony (ONE)С легкостью торгуйте Harmony (ONE) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

993 просмотров всегоОпубликовано 2024.04.12Обновлено 2026.06.02

Как купить ONE

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на ONE (ONE) представлены ниже.

活动图片