Альма-матер 'Цинхуа' выпускник 00-х Ван Гуан представил новую работу: разрушение парадигмы предобучения Transformer с использованием 1/900 токенов и 1/432 вычислительной мощности

marsbitОпубликовано 2026-05-26Обновлено 2026-05-26

Введение

Новая работа выпускника Университета Цинхуа, Ван Гуана (р. 2000), предлагает альтернативу дорогому и ресурсоёмкому предварительному обучению больших языковых моделей. Исследователи представили HRM-Text — эффективную модель, основанную на иерархической рекуррентной архитектуре (HRM), которая заменяет стандартный Transformer. Ключевые инновации включают: 1. **Архитектура HRM:** Использует модули с медленной (H) и быстрой (L) временной шкалой, выполняющие несколько рекуррентных обновлений на один токен. Это увеличивает вычислительную глубину без роста числа параметров. 2. **Целевая функция обучения:** Модель обучается непосредственно на парах "инструкция-ответ", вычисляя потери только для ответной части с использованием маски PrefixLM (двунаправленное внимание для инструкции, причинное — для ответа). 3. **Методы стабилизации:** MagicNorm (гибридная нормализация) и Warmup Deep Credit Assignment (постепенное увеличение глубины обратного распространения градиента) обеспечивают стабильность глубокого рекуррентного обучения. Эксперименты показывают, что HRM-Text 1B, обученная всего на 40B уникальных токенах с бюджетом около $1500, демонстрирует производительность, сопоставимую с открытыми моделями размером от 2B до 7B параметров. При этом она требует до 900 раз меньше токенов и до 432 раз меньше вычислений для обучения. Модель достигает, например, 60.7% на MMLU и 84.5% на GSM8K. Основные направления будущих исследований: разделение "знаний" и "рассуждений", внедрение адаптивног...

Разрушая традиционную парадигму предобучения больших моделей, команда выпускника 'Цинхуа' 00-х Вана Гуана представила новую работу:

Они заменили стандартный Transformer иерархической рекуррентной моделью (HRM), предложив эффективное предобучение HRM-Text, превосходящее Scaling.

Ссылка на статью: https://arxiv.org/abs/2605.20613

Используя примерно в 100-900 раз меньше обучающих токенов и, по оценкам, в 96-432 раза меньше вычислительных ресурсов, чем стандартная базовая модель, HRM-Text все равно продемонстрировал производительность, сопоставимую с открытыми моделями от 2B до 7B параметров.

При этом, используя 1B параметров, 40B уникальных токенов и стоимость обучения около 1500 долларов, HRM-Text достиг следующих результатов на основных бенчмарках: MMLU 60.7%, ARC-C 81.9%, DROP 82.2%, GSM8K 84.5%, MATH 56.2%.

Рис.| Эффективность предобучения.

На этой основе они ясно заявили: Структурный приоритет и целенаправленные цели обучения могут значительно снизить порог предобучения. Эта схема обучения делает возможным обучение базовой модели с нуля.

Как устроен HRM-Text?

Предобучение больших языковых моделей (LLM) все больше зависит от ограниченного числа организаций, обладающих достаточными вычислительными и данными ресурсами. Обучение конкурентоспособной базовой модели часто требует триллионов токенов, тысяч GPU и даже десятков миллионов долларов на вычислительные мощности.

Однако текущий режим обучения неэффективен, большая часть вычислений тратится на промпты, форматное заполнение и веб-шум в нерелевантных токенах, в результате чего значительная часть тренировочных мощностей не служит непосредственно выводу.

В этой работе исследовательская команда переработала архитектуру и цели обучения, сделав предобучение HRM-Text относительно более эффективным.

Архитектура: Используется иерархическая рекуррентная модель с двумя временными масштабами, разделяющая вычисления на медленный H-модуль и быстрый L-модуль. Стандартный Transformer выполняет одно прямое распространение для каждого токена, тогда как HRM будет выполнять многораундовые рекурсивные обновления на одном и том же токене. Модули H и L каждый составляют лишь половину параметров рекурсивного ядра, а общий объем вычислений примерно эквивалентен 4-кратному рекурсивному развертыванию одного и того же набора параметров, что увеличивает вычислительную глубину без увеличения количества параметров.

Цель обучения: Вместо стандартного авторегрессивного предобучения на полном тексте, обучение проводится непосредственно на парах 'инструкция-ответ', потери рассчитываются только для части ответа, и в сочетании с маской PrefixLM, позволяя части инструкции иметь двунаправленное внимание, а части ответа генерироваться с причинно-следственной маской.

Рис.| Архитектура HRM-Text.

Для повышения стабильности рекуррентного обучения исследовательская команда внедрила MagicNorm и Warmup Deep Credit Assignment.

MagicNorm — это стратегия смешанной нормализации, использующая асимметрию глубины прямых и обратных вычислений при усеченном обратном распространении (Truncated BPTT). Внутри модулей используется PreNorm, а на выходе модуля дополнительно добавляется нормализация, что повышает стабильность глубокого рекуррентного обучения.

Warmup Deep Credit Assignment на начальном этапе обучения передает градиенты только для последних 2 рекуррентных шагов, а затем линейно расширяется до последних 5 шагов. Этот механизм обучения позволяет модели стабильно сходиться на более коротких кредитных путях, а затем постепенно вводить более длинные зависимости.

Каковы результаты?

Экспериментальные результаты показывают, что HRM-Text демонстрирует явные преимущества в эффективности архитектуры, целях обучения и общей производительности.

1. Эффективна ли рекуррентная архитектура при фиксированных вычислительных затратах на обучение

Результаты показывают, что при выравнивании FLOPs, HRM 1B превосходит Transformer 1B, Transformer 3B, Looped Transformer 1B и RINS 1B по большинству бенчмарков; сравнение с TRM также показывает, что обучение HRM более стабильно.

Рис.| Сравнение производительности и стабильности с моделями Transformer. HRM сохраняет стабильную динамику обучения при всех масштабах, в то время как модели Transformer при масштабе в 1 миллиард параметров показали серьезную нестабильность. Кроме того, при масштабе 0.6B HRM требуется в 2 раза меньше вычислений, чем моделям Transformer, чтобы достичь конкурентоспособных результатов по большинству бенчмарков.

2. Полезны ли цель выполнения задачи и PrefixLM

Эксперименты по исключению (абляции) показывают, что при выравнивании FLOPs, показатель MMLU для Transformer 1B увеличивается с 40.55 при стандартной авторегрессии до 47.72 после введения цели выполнения задачи, затем до 53.15 после добавления PrefixLM и, наконец, до 60.73 после замены архитектуры на HRM.

Рис.| Сравнение производительности различных архитектур моделей и целей обучения.

3. Насколько эффективен HRM-Text по сравнению с современными открытыми моделями

HRM-Text 1B достигает 60.7, 81.9, 82.2, 84.5 и 56.2 на MMLU, ARC-C, DROP, GSM8K и MATH соответственно. По сравнению с открытыми моделями, у которых обычно значительно больший бюджет на обучение, используя всего 40 миллиардов уникальных токенов и 1 миллиард параметров, он вошел в диапазон производительности открытых моделей от 2B до 7B; требуемое для обучения количество токенов меньше вплоть до 900 раз, вычислительные затраты меньше вплоть до 432 раз.

Рис.| Результаты оценки HRM-Text 1B по сравнению с полностью открытыми моделями и моделями с открытыми весами того же периода.

4. Привносит ли рекуррентная структура большую эффективную глубину

Результаты показывают, что стандартный Transformer и Looped Transformer стабилизируются на более мелких слоях, тогда как HRM на более глубоких слоях по-прежнему сохраняет более заметные изменения представлений между блоками, более низкое косинусное сходство и более высокие значения KL logit lens.

Рис.| Анализ эффективной глубины.

Рис.| Послойный анализ KL Logit Lens.

Недостатки и направления на будущее

Несмотря на то, что HRM-Text показал впечатляющие результаты в задачах, требующих вывода, этот метод все еще имеет ограничения, и предлагаются направления для будущих исследований.

1. Движение к разделению «знаний» и «рассуждений»

В настоящее время, более широкий охват фактических знаний по-прежнему в большей степени зависит от масштаба модели и широты данных. HRM-Text обучался только на 40 миллиардах уникальных токенов, и явные источники знаний составляют лишь часть данных в смеси, отформатированной под задачи. В будущем исследователям необходимо отдельно проектировать компактное ядро рассуждений и внешнее хранилище фактов, передавая широту знаний тщательно отобранным корпусам, модулям с поисковым усилением (RAG) или обучаемой памяти.

2. Адаптивное время вычислений

Циклическое планирование HRM-Text обеспечивает большую эффективную последовательную глубину, но это также означает, что модель должна выполнять фиксированное количество рекуррентных шагов при выводе. В будущем перспективным направлением может стать внедрение механизма адаптивного времени вычислений, позволяющего простым примерам останавливать вычисления раньше, а полный цикл бюджета оставлять для сложных примеров, что снизит стоимость вывода.

3. Ограниченный текущий диапазон проверки масштабирования

Текущие эксперименты по масштабированию охватывают только контрольную группу Transformer с 3 миллиардами параметров и HRM-Text с 1 миллиардом параметров. Исследовательская команда отмечает, что требуется дальнейшая проверка в последующих работах, сохранятся ли аналогичные преимущества в эффективности при более крупных масштабах моделей.

4. PrefixLM и фреймворки вывода

В настоящее время PrefixLM все еще сталкивается с определенными ограничениями в инженерной реализации при практическом развертывании. Хотя он может работать на стандартных фреймворках для вывода текста, таких как vLLM, это требует поддержки пользовательских масок внимания на этапе предзаполнения (prefill). При расширении до многотурных диалоговых сценариев необходимо дополнительно разработать механизм KV-cache, который гарантирует двунаправленную видимость внутри сегментов пользователя, а также обеспечивает, чтобы процесс генерации со стороны ассистента продолжал следовать причинно-следственным ограничениям.

Более подробные технические детали см. в оригинальной статье.

Эта статья взята с официального аккаунта WeChat "Академические заголовки" (ID: SciTouTiao), автор: Ся Цяньсы.

Трендовые криптовалюты

Связанные с этим вопросы

QЧто такое HRM-Text и какова его основная цель?

AHRM-Text — это эффективная языковая модель, предложенная командой Ван Гуаня из университета Цинхуа. Она использует иерархическую рекуррентную модель (HRM) вместо стандартного Transformer для предварительного обучения. Основная цель — значительно снизить вычислительные и ресурсные затраты на обучение (примерно в 100–900 раз меньше токенов и в 96–432 раза меньше вычислений), сохраняя при этом производительность, сравнимую с открытыми моделями от 2B до 7B параметров.

QКаковы ключевые архитектурные и обучающие особенности HRM-Text?

AАрхитектурно HRM-Text использует двухскоростную иерархическую рекуррентную модель (HRM) с медленным (H) и быстрым (L) модулями, что позволяет выполнять многократные рекуррентные обновления на одном токене для увеличения глубины вычислений. В обучении применяется целевая задача «завершение задания»: модель обучается только на парах «инструкция-ответ», с функцией потерь, вычисляемой только на ответах, и маской PrefixLM, которая делает инструкцию двунаправленной, а ответ — причинно-следственным.

QКакие результаты показал HRM-Text 1B в стандартных тестах?

AМодель HRM-Text с 1 миллиардом параметров, обученная на 40 миллиардах уникальных токенов и стоимостью около 1500 долларов, достигла следующих результатов на основных тестах: MMLU — 60,7%, ARC-C — 81,9%, DROP — 82,2%, GSM8K — 84,5%, MATH — 56,2%. Эти показатели попадают в диапазон производительности открытых моделей от 2B до 7B параметров.

QКакие методы были использованы для повышения стабильности рекуррентного обучения?

AДля стабилизации глубокого рекуррентного обучения в HRM-Text применяются два ключевых метода: MagicNorm — гибридная стратегия нормализации, комбинирующая PreNorm внутри модулей с дополнительной нормализацией на выходе, и Warmup Deep Credit Assignment — метод, который в начале обучения передает градиенты только для последних 2 шагов рекурсии, а затем постепенно увеличивает длину пути до 5 шагов.

QКаковы основные ограничения и будущие направления для HRM-Text?

AОграничения включают: 1) Опора на знания: ограниченный охват фактов из-за небольшого объема данных; предлагается разделить «рассуждение» и «знания», используя внешние хранилища. 2) Адаптивное время вычислений: текущая фиксированная рекурсия неэффективна; предлагается адаптивная схема. 3) Ограниченный масштаб: эффективность на очень больших моделях (>>1B) ещё не подтверждена. 4) Инженерия PrefixLM: необходимость поддержки пользовательских масок внимания и разработки механизмов KV-cache для развертывания в продакшене.

Похожее

BitMine добавляет 7 430 ETH и тратит $86 млн на выкуп акций – Почему?

Компания Bitmine на прошлой неделе значительно сократила закупки Ethereum (ETH), приобретя лишь 7430 ETH — это минимальный еженедельный объем с мая. Вместо наращивания криптовалютного резерва компания направила примерно 86 млн долларов на обратный выкуп 5,5 млн своих обыкновенных акций по средней цене 15,62 доллара, чтобы повысить акционерную стоимость. Несмотря на замедление темпов покупки, резерв Bitmine по-прежнему огромен и составляет 5 777 468 ETH (около 4,8% от общего объема эмиссии ETH). Компания близка к достижению своей долгосрочной цели — владению 5% всех ETH. Уже через 12 месяцев после запуска стратегии фонд почти достиг этого показателя. Кроме того, Bitmine разместила в стейкинге через свою платформу MAVAN около 4,92 млн ETH (85% своих активов). Это может приносить примерно 247 млн долларов годового дохода при текущей доходности в 2,67%, а после стейкинга всего резерва доход может вырасти до 290 млн долларов. Параллельно в статье отмечается, что пока Bitmine фокусируется на Ethereum, компания MicroStrategy Майкла Сэйлора продолжает агрессивно накапливать Bitcoin (BTC), несмотря на финансовое давление и недавние продажи части активов.

ambcrypto31 мин. назад

BitMine добавляет 7 430 ETH и тратит $86 млн на выкуп акций – Почему?

ambcrypto31 мин. назад

9,42 миллиона частных инвесторов бросились покупать акции Changxin Technology, кто же выиграл в лотерее?

Результаты размещения акций Changxin Technology привлекли огромное внимание инвесторов. Всего в онлайн-подписке для частных инвесторов участвовало около 9,4288 миллиона человек, было подано 816,92 миллиарда заявок на акции, сгенерировано примерно 7,7 миллиона выигрышных лотерейных номеров, а итоговая ставка онлайн-подписки составила около 0,4714%, что является рекордно высоким показателем для новых акций на рынке STAR. Из-за высокого спроса компания активировала механизм обратного перевода, увеличив количество акций, размещаемых онлайн, до 3,851 миллиарда. Среди институциональных инвесторов 285 организаций, управляющих 10907 счетами, подали заявки на сумму около 12,38 триллиона акций, получив в итоге 2,173 миллиарда акций при коэффициенте распределения около 0,1756%. Taikang Asset Management стал институциональным инвестором, получившим наибольшее распределение. Среди публичных фондов лидерами по объему размещения стали E Fund, Southern Fund и ICBC Credit Suisse. Основатель ведущей китайской компании в области больших моделей DeepSeek, Лян Вэньфэн, через свои хедж-фонды Ningbo幻方量化 и Zhejiang九章资产 получил самое большое распределение среди частных фондов — акций на общую сумму примерно 1,75 миллиарда юаней. Ожидается, что Changxin Technology официально выйдет на биржу 27 июля. По оценкам рынка, её стоимость после IPO может превысить 1 триллион юаней, а некоторые аналитики дают прогноз до 2-3 триллионов юаней. Однако недавняя коррекция на глобальном технологическом рынке может оказать определенное влияние на цену акций компании после листинга.

marsbit56 мин. назад

9,42 миллиона частных инвесторов бросились покупать акции Changxin Technology, кто же выиграл в лотерее?

marsbit56 мин. назад

Криптовалюта USCR стабилизируется на отметке $0,0022: Сможет ли мемкоин отыграть потери второго квартала?

Криптовалюта USCR, мемкоин, отслеживающий тему официальных крипторезервов США, пытается восстановиться после падения до двухмесячного минимума в $0.0022. В мае цена выросла на 65%, но в июне упала на 37%. Сейчас наблюдается потенциальный отскок, и если быкам удастся закрепиться выше ключевых скользящих средних, возможен рост до $0.0028 (уровень Фибоначчи) и далее до майского пика в $0.0036, что означает потенциал роста на 30-60%. Динамика USCR тесно связана с новостями о создании стратегического резерва биткойна в США. Майский рост совпал с увеличением вероятности этого события и внесением соответствующего законопроекта. Однако его рассмотрение застопорилось, а шансы на создание резерва к 2027 году, по данным Polymarket, упали до 18%, что давит на настроения. Несмотря на неопределённость, база держателей USCR остаётся значительной: 48 тысяч, сократившись лишь на 4 тысячи с начала 2026 года. Восстановление цены будет зависеть от позитивных новостей по законопроекту о биткойн-резерве.

ambcrypto1 ч. назад

Криптовалюта USCR стабилизируется на отметке $0,0022: Сможет ли мемкоин отыграть потери второго квартала?

ambcrypto1 ч. назад

«Богиня благотворительности» с 3 млн подписчиков целиком создана ИИ, поддельный детский дом, международный «фальшивый фонд» рухнул за одну ночь

**Шокирующий разоблачение: Астролябка «благотворительности» с 300 000 подписчиков оказалась масштабной аферой на основе ИИ** Австралийская инфлюенсерша Лили Джей, имевшая почти 3 миллиона подписчиков в Instagram, создала тщательно продуманную мошенническую схему под прикрытием своего «Фонда Лили Джей». Используя искусственный интеллект, она и ее команда генерировали фальшивые изображения и видео, изображающие строительство мечетей, раздачу хлеба в Газе и даже открытие детского дома в Уганде для привлечения пожертвований от преимущественно мусульманской аудитории. Расследование ABC News Verify выявило многочисленные подделки: видео с «открытием» детского дома полностью сгенерировано ИИ (включая детей, саму Лили и фонды), «награда» за гуманитарную деятельность оказалась фальшивкой с цифровым водяным знаком ИИ, а заявленные благотворительные проекты в Уганде и Газе не существуют. Фонд не зарегистрирован как официальная благотворительная организация, что позволяло избегать финансовой отчетности. После запросов ABC сайт фонда стал скрывать кнопки для пожертвований и предупреждения о своем неблаготворительном статусе для посетителей из Австралии, но оставил их для иностранных пользователей. Эксперты предупреждают, что эта афера — тревожный прецедент, демонстрирующий, как ИИ может эксплуатировать человеческое доверие и желание творить добро, создавая убедительные, но полностью вымышленные нарративы.

marsbit1 ч. назад

«Богиня благотворительности» с 3 млн подписчиков целиком создана ИИ, поддельный детский дом, международный «фальшивый фонд» рухнул за одну ночь

marsbit1 ч. назад

L2 «рекалибровка»: когда L1 становится собственным ролл-апом, каков финал Ethereum?

«L2 перекалибровка»: когда L1 становится собственным роллапом, каков финал Ethereum? Первоначально, роллапы (L2) рассматривались как основной путь масштабирования Ethereum, обеспечивая дешёвое и быстрое исполнение транзакций. Однако, с развитием самого L1 (повышение лимита газа, внедрение безсостоятельности и zkEVM) и объединением задач масштабирования, традиционное разделение между L1 как безопасным, но медленным «слоем урегулирования» и L2 как дешёвым «слоем исполнения» меняется. Вопрос теперь не только в увеличении пространства блоков, а в перераспределении ролей в системе с множеством исполняющих сред. Будущая роль L2 смещается от простого предоставления дешёвого газа к обеспечению уникальных функций, таких как оптимизация для конкретных приложений, приватность и гибкие модели управления. Таким образом, L2 станет скорее спектром исполняющих сред с разной степенью наследования безопасности Ethereum, чем единым техническим классом. Ключевой задачей становится решение фрагментации. Разделённая ликвидность и состояние пользователя ухудшают опыт. Усилия концентрируются на улучшении взаимодействия (интероперабельности) через системы на основе намерений (intents) и нативные протоколы, такие как Ethereum Interoperability Layer (EIL), чтобы Ethereum вновь «ощущался как единая цепь». Сокращение времени до финальности транзакций L1 также имеет решающее значение для доверия между цепями. Ещё более радикальная идея — с появлением систем доказательств (zkEVM) внутри L1 сама Ethereum может стать своего рода «собственным роллапом», где высокопроизводительные узлы исполняют транзакции, а валидаторы проверяют криптографические доказательства. Это размывает классические границы между слоями и открывает путь к архитектуре, где множество исполняющих доменов (специализированных L2) сосуществуют, разделяя общую безопасность, ликвидность и систему урегулирования Ethereum. В итоге, будущее Ethereum видится не как победа L1 над L2 или наоборот, а как экосистема взаимосвязанных исполняющих сред, которые, будучи «разобранными» для масштабирования, вновь объединяются в единое, безопасное и удобное для пользователя целое.

marsbit1 ч. назад

L2 «рекалибровка»: когда L1 становится собственным ролл-апом, каков финал Ethereum?

marsbit1 ч. назад

Торговля

Спот

Популярные статьи

Как купить S

Добро пожаловать на HTX.com! Мы сделали приобретение Sonic (S) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки Sonic (S).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение Sonic (S)После приобретения вами Sonic (S) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля Sonic (S)С легкостью торгуйте Sonic (S) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

1.6k просмотров всегоОпубликовано 2025.01.15Обновлено 2026.06.02

Как купить S

Sonic: Обновления под руководством Андре Кронье – новая звезда Layer-1 на фоне спада рынка

Он решает проблемы масштабируемости, совместимости между блокчейнами и стимулов для разработчиков с помощью технологических инноваций.

2.4k просмотров всегоОпубликовано 2025.04.09Обновлено 2025.04.09

Sonic: Обновления под руководством Андре Кронье – новая звезда Layer-1 на фоне спада рынка

HTX Learn: Пройдите обучение по "Sonic" и разделите 1000 USDT

HTX Learn — ваш проводник в мир перспективных проектов, и мы запускаем специальное мероприятие "Учитесь и Зарабатывайте", посвящённое этим проектам. Наше новое направление .

1.9k просмотров всегоОпубликовано 2025.04.10Обновлено 2025.04.10

HTX Learn: Пройдите обучение по "Sonic" и разделите 1000 USDT

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на S (S) представлены ниже.

活动图片