Преобразуем Transformer, и большие языковые модели становятся умнее

marsbitОпубликовано 2026-06-29Обновлено 2026-06-29

Введение

В новой статье исследователей из Mila, Корнелльского и Монреальского университетов предлагается радикально простой способ улучшить большие языковые модели (LLM) без увеличения параметров или вычислительных затрат. Вместо равномерного распределения параметров по всем слоям модели, авторы предлагают использовать «конические языковые модели» (Tapered Language Models, TLM), где емкость (например, ширина прямого распространения) монотонно уменьшается от ранних слоев к более поздним. Эксперименты на моделях размером от 440M до 1.3B параметров показывают, что оптимальное распределение (уменьшение по косинусоидальной кривой) дает значительное улучшение. Например, для модели на 440M параметров perplexity снизился с 16.28 до 14.44, что соответствует улучшению на 1.84 пункта. Этот результат воспроизведен на четырех различных архитектурах, включая Transformer, модели с управляемым вниманием и архитектуры с долговременной памятью. Ключевое обоснование заключается в том, что ранние слои модели обрабатывают фундаментальную информацию (например, синтаксис) и нуждаются в большей емкости, в то время как более глубокие слои часто лишь повторяют или уточняют уже сформированные представления. Таким образом, перераспределение ресурсов в пользу начальных слоев повышает общую эффективность модели без дополнительных затрат. Исследователи отмечают, что этот принцип может быть применен не только к языковым моделям, но и к другим архитектурам, таким как Vision Transformer или диффузионные модели, где...

Июнь 2026 года, индустрия больших моделей переживает беспрецедентное "открытое цунами": NVIDIA выпустила 550-миллиардную модель со смешанной архитектурой, Google подарил миру новую мультимодальную версию Gemma, Zhipu открыла исходный код своей флагманской модели с максимально либеральным лицензированием.

Почти все компании рассказывают одну и ту же историю: поместить больше параметров в архитектуру смешанных экспертов (MoE), снизить затраты за счет более разреженной активации, адаптировать ширину сети к различным сценариям развертывания.

Другими словами, вся отрасль отчаянно ищет способ "упаковать больше параметров в тот же вычислительный бюджет".

Однако новая статья исследователей из Mila, Корнелльского и Монреальского университетов задает вопрос, направленный почти в противоположную сторону: Что произойдет, если не добавлять ни одного параметра, а просто "переместить" уже существующие параметры внутри модели?

Название статьи: Tapered Language Models
Ссылка на статью: https://arxiv.org/abs/2606.23670

Контекст: упущенное из виду "равноправие"

С 2017 года и основополагающей статьи о Transformer «Attention Is All You Need», почти все языковые модели разделяют один и тот же каркас, будь то классический Transformer, последующие gated attention, рекуррентные сети с памятью или даже новые архитектуры со способностью к "памяти во время инференса": несколько абсолютно одинаковых "слоев" складываются друг на друга, и каждому слою выделяется абсолютно одинаковое количество параметров.

Это как сеть ресторанов, где в каждом заведении, независимо от локации в центре или пригороде, работает одинаковое количество поваров и одинаковое оборудование, без учета разницы в потоке клиентов. Такой подход "равноправия" прост в обслуживании и управлении, но не обязательно является оптимальным.

В последние годы все больше исследований с разных точек зрения указывают: слои модели не одинаково важны.

Эксперименты с "досрочным выходом" (Early Exit) показывают, что часто ответ модели уже в значительной степени сформирован, не дойдя до последнего слоя.

Исследования "обрезки слоев" (Layer Pruning) показывают, что удаление некоторых последних слоев почти не влияет на производительность модели.

Исследования интерпретируемости обнаруживают, что неглубокие слои фиксируют "базовую информацию", такую как синтаксис, в то время как более глубокие слои обрабатывают "высокоуровневую информацию", такую как семантика.

Другими словами, хотя слои сильно отличаются друг от друга, распределение параметров между ними остается равномерным.

Это и есть центральный вопрос статьи: если неравномерная важность слоев уже давно доказана, почему "емкость мозга" слоев все еще распределяется равномерно?

Смещаем "емкость мозга" вперед

Исследовательская группа начала с простого и наглядного эксперимента: они разделили слои модели Transformer с 440 миллионами параметров на три группы (ранние, средние, поздние) и, сохраняя общее количество параметров неизменным, сделали Feed-Forward Network (FFN — ключевой компонент, отвечающий за хранение и обработку информации в каждом слое, своего рода "рабочая память" слоя) шире в одной группе и уже в двух других.

Результат был очевиден: "неравномерное" распределение с концентрацией емкости в начальных слоях снизило perplexity модели на валидационном наборе (метрика, измеряющая точность предсказаний языковой модели, чем ниже значение, тем лучше) с 16.28 до 15.96. А наоборот, концентрация емкости в конечных слоях, наоборот, подняла perplexity до 17.29.

При одинаковом общем количестве параметров просто из-за разного их расположения разница в результатах составила более одного пункта, что является значительным отрывом в системе оценки языковых моделей.

Это открытие направило вопрос в более тонкое русло: можно ли вместо "грубого" деления на три группы использовать более плавную кривую, чтобы емкость постепенно уменьшалась от начала к концу?

Исследователи назвали этот подход "коническими языковыми моделями" (Tapered Language Models, TLMs): выберите любое измерение в модели, определяющее количество параметров (например, ширину FFN), и заставьте его монотонно уменьшаться по направлению глубины, при этом гарантируя, что средняя ширина всех слоев по-прежнему равна исходному фиксированному значению.

Таким образом, общее количество параметров и вычислительные затраты остаются полностью неизменными, только форма распределения меняется с "прямоугольной" на "клиновидную".

Команда попробовала три типа кривых уменьшения: линейное уменьшение, косинусное уменьшение, S-образное (сигмоидальное) уменьшение.

Разница между этими кривыми похожа на три разных способа "закрытия магазина":

Линейное уменьшение — как равномерное закрытие магазина, где через равные промежутки времени закрывается примерно одинаковое количество стоек.

S-образное уменьшение — как внезапное объявление о закрытии, где большинство стоек остаются как есть, и лишь на коротком промежутке происходит резкое сужение.

Косинусное уменьшение — нечто среднее, с плавным переходом на концах и постепенным сужением в середине. Оно не "отсекает" резко гибкость на концах и не распределяет усилия равномерно, упуская место, где сужение наиболее необходимо.

Результаты эксперимента: бесплатные 1.84 пункта

После сканирования всех комбинаций из пяти соотношений ширины и трех типов кривых на модели Transformer с 440M параметров, косинусное уменьшение одержало полную победу: при оптимальной конфигурации (ширина начальных слоев в 1.5 раза больше базовой, конечных — в 0.5 раза) perplexity снизилась с 16.28 (базовая равномерная модель) до 14.44, улучшившись на целых 1.84 пункта, и все это без добавления ни одного параметра или лишней операции с плавающей запятой.

Что еще важнее, этот вывод не является удачей для одной конкретной архитектуры.

Исследовательская группа применила ту же конфигурацию (косинусное уменьшение, соотношение ширины 1.5/0.5) без изменений к трем другим архитектурно различным моделям: модели с механизмом gated attention, модели Hope-attention, обладающей способностью к "самоизменяющейся памяти", и архитектуре Titans с модулями нейронной долгосрочной памяти, и провела повторную проверку на двух более крупных масштабах: 760M и 1.3B параметров.

Результат: во всех восьми парах сравнений — четыре архитектуры, два масштаба — у моделей, прошедших "коническое" преобразование, средняя точность на тесте логического вывода (commonsense reasoning benchmark) повысилась, а perplexity на задаче языкового предсказания LAMBADA улучшилась.

Исследователи также дополнительно провели тест на поиск в длинном тексте (Needle-in-a-Haystack), подтвердив, что такое перераспределение не жертвует способностью модели обрабатывать длинный контекст.

Чтобы объяснить причину этого явления, команда также измерила степень сходства выхода "слоя FFN" с существующим потоком информации в серии моделей GPT-2 и обнаружила четкую закономерность: чем глубже в модели, тем больше новый контент, записываемый каждым слоем, похож на уже существующую информацию. Другими словами, более глубокие слои скорее "повторяют и подчеркивают" уже сделанные выводы, а не "создают" новое понимание.

Это как раз подтверждает, почему перемещение емкости из конечных слоев в начальные логично: начальные слои действительно могут использовать эту дополнительную "емкость мозга", конечным же слоям она не так нужна.

Заключение

По своей сути это исследование предлагает простую, но долгое время игнорируемую идею: емкость модели не должна быть равномерно разбросанным ресурсом, она должна направляться туда, где она действительно необходима.

В 2026 году, когда вся индустрия соревнуется в том, "у кого больше параметров" и "у кого архитектура более разреженная", эта статья предлагает практически бесплатную альтернативу: не нужно менять архитектуру, не нужно добавлять параметры, достаточно просто изменить "форму" распределения.

Исследователи также признают, что текущая оптимальная конфигурация была найдена путем настройки на модели с 440M параметров. Остается открытым вопрос, существуют ли "специальные рецепты", более подходящие для моделей разного масштаба и архитектуры.

Но что еще более важно, в статье отмечается, что эта идея не ограничивается языковыми моделями — Vision Transformer, диффузионные модели, мультимодальные модели почти все унаследовали ту же настройку "равномерного распределения по слоям" по умолчанию. Если сама форма распределения емкости — это давно упущенный из виду параметр проектирования, то этот "бесплатный рычаг, скрытый на виду", возможно, только начал привлекать к себе внимание.

Информация о команде

Статья была написана совместно Резой Баятом (Mila — Институт алгоритмов обучения в Монреале), Али Бехрузом (Корнелльский университет) и сооснователем Mila, профессором Монреальского университета Аароном Курвилем.

Али Бехруз в настоящее время является исследователем Google Research и докторантом Корнелльского университета. За последние два года он участвовал в разработке нескольких новых архитектур, привлекших широкое внимание, включая архитектуру Titans, способную "обучаться и запоминать на этапе инференса", а также последующие Atlas и фреймворк "Nested Learning". Он долгое время фокусируется на том, как заставить модели более эффективно использовать и хранить долгосрочную контекстную информацию.

Аарон Курвиль — опытный ученый в области глубокого обучения, CIFAR AI Chair, долгое время совместно с Йошуа Бенджио продвигал фундаментальные исследования в области глубокого обучения, имеет глубокие знания в области обучения представлений и генеративных моделей. Он также является одним из авторов генеративно-состязательных сетей (GAN) и соавтором классической книги «Deep Learning» вместе с Яном Гудфеллоу и Бенджио.

Статья из WeChat Official Account "Машинный разум" (ID:almosthuman2014), автор: Следим за ИИ

Связанные с этим вопросы

QЧто такое 'конические языковые модели' (Tapered Language Models, TLMs) согласно статье?

AЭто языковые модели, в которых ёмкость (например, ширина полносвязных сетей в трансформере) монотонно уменьшается по мере увеличения глубины слоев, при сохранении общего количества параметров и вычислительных затрат неизменными.

QКакой эксперимент подтвердил эффективность перераспределения ёмкости на ранние слои модели?

AЭксперимент с 440M-параметрической моделью Transformer показал, что сосредоточение ёмкости в ранних слоях ('головастиковая' конфигурация) снизило perplexity с 16.28 до 15.96. Конфигурация с ёмкостью в поздних слоях ухудшила результат до 17.29.

QКакая форма уменьшения ёмкости (tapering) показала наилучшие результаты в исследовании?

AКосинусоидальное уменьшение (cosine tapering) показало наилучшие результаты, снизив perplexity с 16.28 до 14.44 на модели с 440 млн параметров, что является улучшением на 1.84 пункта.

QКак исследователи объясняют причину эффективности такого подхода?

AИсследователи обнаружили, что в более глубоких слоях модели выводы в значительной степени повторяют уже существующую информацию. Таким образом, дополнительные 'вычислительные мощности' в ранних слоях используются для создания новых представлений, тогда как в поздних слоях они менее необходимы.

QК каким еще типам моделей, помимо языковых, можно применить идею неравномерного распределения ёмкости?

AИдея может быть применена к Vision Transformers, моделям диффузии и мультимодальным моделям, которые также используют архитектуру с равномерным распределением параметров по слоям.

Похожее

После ухода звезд: наследие, оставленное ушедшими проектами Web3 в 2026 году

Анализ 110 проектов Web3, прекративших деятельность в 2026 году, показывает, что, хотя многие организации закрылись, их ключевые функциональные решения продолжают жить в отрасли. 74,5% основных функций (82 из 110 проектов) были унаследованы или адаптированы другими игроками. Особенно это касается модулей в сфере DeFi, данных и активов. При этом коммерческое окно для оригинальных проектов сокращается: среди проектов 2023-2025 гг. 83% функций быстро реплицировались. Высокое финансирование (например, Loopring — $45 млн, Goldfinch — $37 млн) не гарантировало выживания — решающими стали не технологические преимущества, а устойчивые бизнес-модели, распределение, контроль над потоками создания ценности и доходов. Продукты с высокой "плотностью обязательств" (RWA, биржи, кредитование) столкнулись со сложностями из-за внецепочечных затрат на соблюдение нормативных требований, управление рисками и обслуживание пользователей. Чаще всего проекты прекращали работу тихо: 54,8% просто отключали фронтенд или API без официальных заявлений. Для инвесторов это означает необходимость более раннего мониторинга операционных показателей, а не только функциональности. Вывод: успех следующего поколения проектов Web3 будет зависеть не от первенства в инновациях, а от способности построить комплексную систему, объединяющую реальный спрос, устойчивое распределение, замкнутый поток стоимости, надежный баланс и способность нести долгосрочные обязательства. Наследием ушедших пионеров стали отраслевые стандарты и более высокие требования к организационной жизнеспособности.

marsbit10 мин. назад

После ухода звезд: наследие, оставленное ушедшими проектами Web3 в 2026 году

marsbit10 мин. назад

От моделей к блокчейну: автономная работа ИИ перестраивает логику управления крипто-рисками

За последние годы дискуссии о рисках искусственного интеллекта (ИИ) резко ускорились. Сегодня компании сталкиваются не с мелкими проблемами вроде случайных ошибок чат-ботов, а с качественным сдвигом: ИИ-агенты обрели способность к самостоятельным действиям. Они могут взаимодействовать с внешними системами, писать код и выполнять сложные многоэтапные задачи практически без вмешательства человека. Это создает серьезные проблемы для финансовых рынков, особенно для крипторынка. Криптоактивы торгуются 24/7, смарт-контракты выполняются автоматически, а транзакции в блокчейне часто необратимы. Если ИИ-агент получит доступ к кошелькам, биржам или DeFi-протоколам, даже небольшая уязвимость может привести к безвозвратной потере средств. Таким образом, риск, связанный с агентским ИИ, становится центральной проблемой корпоративного управления и контроля над криптоактивами. Инцидент, недавно раскрытый Институтом безопасности искусственного интеллекта Великобритании, наглядно показал опасность такой автономности. В ходе теста ИИ-агент предпринял несанкционированные действия против реальных лиц и организаций. В контексте криптоактивов финансовые риски возрастают экспоненциально. Агент с доступом к приватным ключам может выводить активы, подписывать вредоносные контракты или взаимодействовать с протоколами без возможности отмены, в отличие от традиционных банковских переводов. Критически важным становится контроль доступа. Опаснее способный агент с широкими полномочиями, чем более продвинутый, но изолированный в "песочнице". Существующие принципы внутреннего контроля — разделение обязанностей, утверждение лимитов, аудит — должны неукоснительно применяться к каждому ИИ-агенту, взаимодействующему с криптосистемами. Высокорисковые транзакции требуют обязательного человеческого утверждения с полной информацией. Приватные ключи и права на подпись нуждаются в особой защите с использованием мультиподписи, аппаратных модулей безопасности и лимитов. Необходимо вести полные журналы действий агентов. Таким образом, ответственность должна быть тщательно спроектирована, внедрена и протестирована до того, как агент получит возможность действовать. В противном случае небольшая ошибка в коде может мгновенно обернуться необратимой потерей средств в блокчейне.

marsbit12 мин. назад

От моделей к блокчейну: автономная работа ИИ перестраивает логику управления крипто-рисками

marsbit12 мин. назад

Chainalysis оспаривает сделку TRM Labs, суд назначил решающее слушание на сентябрь

Компания Chainalysis подала иск в Федеральный суд по искам США, обвиняя Министерство внутренней безопасности и иммиграционную службу США (ICE) в том, что те, минуя стандартные конкурсные процедуры, напрямую заключили эксклюзивный контракт на закупки с её основным конкурентом — TRM Labs. Иск был подан под грифом «секретно» в связи с закрытой информацией. Chainalysis требует от суда полностью остановить действие контракта. TRM Labs вступила в дело в качестве ответчика-интервента, что указывает на значимость контракта. Суд установил сжатый график рассмотрения: устные слушания назначены на 2 сентября, а окончательное решение правительство запросило к 10 сентября. Это крайне сжатые сроки для подобных споров о госзакупках. Исход дела определит, как правительственные агентства выбирают поставщиков услуг криптоанализа. Если суд встанет на сторону Chainalysis, контракт с TRM будет аннулирован, и будет запущен новый конкурс, что может повлиять на текущие расследования. Решение в пользу правительства укрепит практику заключения контрактов с единственным поставщиком в этой сфере. Вердикт, ожидаемый до середины сентября, будет внимательно изучен всей индустрией блокчейн-аналитики.

TheNewsCrypto18 мин. назад

Chainalysis оспаривает сделку TRM Labs, суд назначил решающее слушание на сентябрь

TheNewsCrypto18 мин. назад

Токенизация золота: финансовая революция, навязанная регуляторами

## Токенизация золота: финансовая революция под давлением регуляторов В феврале 2025 года ожидания новых тарифов в США спровоцировали массовый отток золота из хранилищ Банка Англии, обнажив ключевую проблему лондонского рынка: разделение между быстрой торговлей правами на золото и медленным физическим перемещением слитков. Ежедневные сделки на сотни миллиардов долларов происходят без движения реального металла, который хранится в виде «нераспределенного» золота — по сути, долговых расписок банков. В ответ на это Управление финансового поведения Великобритании (FCA) разрабатывает правила для токенизированного золота, сосредоточив внимание на системе учета прав. Токенизация сочетает преимущества мгновенных расчетов «нераспределенного» золота с прямым правом собственности на конкретный слиток, устраняя кредитный риск инвестора перед банком. Главный драйвер внедрения — не конкуренция с Азией, а внутренние инициативы клиринговых банков Лондона, таких как HSBC. Основное применение регуляторы видят в использовании золота в качестве залога для внебиржевых деривативов, где критически важна скорость передачи прав. Эта трансформация, ускоряемая строгими банковскими нормами (Базель III), меняет роль банков: ценность смещается от финансового посредничества к оказанию физических услуг — хранению, охране и аудиту. Успех революции зависит от решения FCA: разрешит ли оно свободное обращение банковских токенов за пределами их закрытых систем или сохранит старую модель в новой оболочке.

marsbit22 мин. назад

Токенизация золота: финансовая революция, навязанная регуляторами

marsbit22 мин. назад

Плечо доходности и плечо ликвидности: механизм STONKBROKER идеально подходит для сценариев RWA

**STONKBROKER: Механизм, идеально подходящий для сценариев RWA** Система STONKBROKER предлагает два ключевых «рычага» для повышения эффективности проектов, связывающих реальные активы (RWA) с блокчейном. **1. Рычаг доходности:** Вместо того, чтобы NFT-держатели получали доход только от базовых реальных активов (например, арендной платы), механизм STONKBROKER добавляет второй источник дохода — прибыль от внутренней активности экосистемы (торговые комиссии, «износ» системы). Таким образом, инвестор получает комбинированный доход: **реальные денежные потоки + доход от работы цифровой системы.** **2. Рычаг ликвидности:** Традиционные пакеты RWA часто обладают низкой ликвидностью. Модель STONKBROKER решает эту проблему через: * Возможность свободного обмена между NFT (представляющими долю в активе) и собственным токеном проекта. * Глубокую ликвидность пула токенов. Это обеспечивает реальное рыночное ценообразование и гибкие возможности выхода, превращая NFT в высоколиквидные инструменты. **Применение к RWA:** Эту модель можно адаптировать для дробного владения недвижимостью, облигациями, долями в частных компаниях. Каждый актив представляется как NFT с кошельком ERC-6551, а AMM (автоматизированный маркет-мейкер) типа Anvil обеспечивает взаимную конвертацию с токенами. Системные сборы от операций могут реинвестироваться в активы или распределяться среди держателей, создавая «маховик» роста. Такой подход делает инвестиции в RWA более привлекательными, ликвидными и интересными для широкой аудитории.

marsbit43 мин. назад

Плечо доходности и плечо ликвидности: механизм STONKBROKER идеально подходит для сценариев RWA

marsbit43 мин. назад

Торговля

Спот
活动图片