Конструкция-памятник Transformer подверглась критике, три статьи на COLM атакуют

marsbitОпубликовано 2026-08-17Обновлено 2026-08-17

Введение

На конференции COLM 2026 три научные работы подвергли критике ключевые, ставшие уже стандартными, архитектурные решения в моделях типа Transformer. Первое исследование «Cracks in the Foundation» (Ai2 и др.) показало, что комбинации таких общепринятых техник, как групповое запросно-ключевое внимание (GQA), скользящее окно внимания (SWA) и нормализация QK, могут значительно ухудшать работу с длинным контекстом. В тесте HELMET 32K разница между лучшей и худшей комбинацией достигла 47%. Вопреки интуиции, нормализация QK, вводимая для стабилизации обучения, в некоторых моделях снижает производительность. Вторая работа «Lost in Backpropagation» (Корнеллский университет) выявила серьезную проблему в выходном слое (проекции), который преобразует скрытые состояния в логиты. Из-за огромной разницы в размерности (скрытое состояние vs. словарь) этот слой «съедает» от 95% до 99% градиента во время обратного распространения ошибки, искажая оставшийся сигнал и потенциально замедляя обучение. Третье исследование «When Fewer Layers Break More Chains» (Тюбингенский университет) предупреждает об опасностях «прунинга» (удаления) слоев — популярного метода сжатия моделей. Хотя после удаления слоев модели сохраняют знания в простых тестах, их способность к сложным, многошаговым рассуждениям (например, в задачах математики) резко падает. Методы «расширения при тестировании» (дополнительные токены на размышление) перестают работать, а дообучение не может полностью восстановить утраченные возможно...

Ключевые технологии Transformer коллективно провалились на одной конференции?!

На COLM 2026 несколько статей одновременно нацелились на одно и то же —

Те проектные решения в Transformer, которые уже никто не ставит под сомнение, на самом деле не выдерживают критики.

Transformer — это почти архитектура по умолчанию для всех основных моделей, и его настройки также в большинстве своем считаются каноническими, мало кто возвращается их проверять.

В итоге эта серия статей с разных сторон заново пересчитала счета по этим выбором по умолчанию.

И что удивительно, выводы разных исследователей оказались поразительно схожи: каждая стандартная конструкция в Transformer заплатила ощутимую цену в каком-то измерении, которое существующие системы бенчмаркинга не измеряют.

Трещины в длинном контексте

Первая статья называется «Трещины в фундаменте» (Cracks in the Foundation), от институтов типа Ai2, и нацеливается на QK-нормализацию, GQA, скользящее окно внимания и длину контекста при предобучении — архитектурные выборы, давно ставшие «стандартными настройками».

Исследователи взяли реальные модели Llama 2, Llama 3, Qwen 3, Olmo 3, выбрали использованные в них значения параметров, сделали перестановки и комбинации и обучили для сравнения 26 моделей.

Размер этих моделей составлял от 7B до 8B параметров, данные, токенизатор и метод расширения контекста оставались неизменными, различалась только архитектура.

Команда назвала эту группу моделей «OlmPool», все они сначала прошли предобучение на 140B токенов, затем финальное обучение для длинного контекста на 10B токенов, в общей сложности сожгли более 170 тысяч GPU-часов.

В результате, оценки 26 моделей на бенчмарке HELMET 32K составили максимум 56.4 и минимум 29.9, разница 26.5 баллов, что в относительном выражении составляет 47%.

Данные одинаковы, архитектура в целом похожа, но просто из-за того, что четыре переключателя повернуты по-разному, оценки могут различаться настолько.

Если переключить один параметр, влияние на самом деле невелико. Использовать длину контекста 4096 или 8192 при предобучении, добавлять или не добавлять скользящее окно внимания — в среднем оценка падает всего на пару баллов.

По-настоящему критично, когда несколько выборов складываются вместе. Как только SWA и GQA оказываются в одной модели, среднее падение составляет 9 баллов, что гораздо больше суммы их индивидуальных влияний.

Худшая комбинация, которую обнаружила команда, — это GQA, скользящее окно внимания и послойная QK-нормализация вместе; падение оценки также оказалось значительно больше суммы отдельных эффектов.

Позже они обнаружили, что просто подсчитав, сколько «вредных конструкций» есть в модели, это число может довольно точно предсказать её производительность на длинном контексте, и даже эффективнее, чем пошаговый анализ архитектуры.

QK-нормализация — самый неинтуитивный пункт. Изначально её добавляли в модели для повышения стабильности обучения, и в индустрии её в основном считают полезной вещью.

Но в статье измерено: если убрать изначальную QK-нормализацию и пост-нормализацию в Olmo 3, заменив их на пре-нормализацию, оценка HELMET, наоборот, вырастает на 6 баллов.

Тот же самый апдейт, примененный к Llama 3, даёт обратный эффект — падение на 3.8 балла.

Один и тот же «стандарт», другой базовый модели — результат может быть полностью противоположным.

В этой части также было обнаружено явление, идущее вразрез с интуицией многих — «фокусировка внимания» (attention focus), когда модель направляет значительную часть внимания на первые несколько токенов контекста.

Это явление всегда считалось вредной привычкой, растрачивающей вычислительные ресурсы, и многие новые методы специально продаются как устраняющие его. Но в этой группе моделей OlmPool, чем более выражена фокусировка внимания, тем лучше производительность на длинном контексте.

QK-нормализация как раз ослабляет эту фокусировку, что, возможно, и является причиной её негативного влияния на способность работать с длинным контекстом.

Съеденный градиент

Вторая статья называется «Потерянный при обратном распространении» (Lost in Backpropagation), из Корнеллского университета, и нацеливается на последний слой, который используется почти во всех языковых моделях — слой выходной проекции.

На каждом шаге языковая модель сначала вычисляет последовательность чисел, представляющую её понимание текущего контекста, эта последовательность называется скрытым состоянием D.

Чтобы предсказать следующее слово, модель должна преобразовать скрытое состояние в оценку (score) для каждого кандидата в словаре; сколько слов в словаре, столько оценок и нужно вывести.

Эти оценки называются logits, чем выше оценка, тем больше модель считает, что это слово является следующим.

Компонент, выполняющий это преобразование, и есть выходной слой, по сути — матричное умножение.

Размер словаря, как правило, гораздо больше длины скрытого состояния: десятки тысяч против, возможно, нескольких тысяч.

Раньше на этот разрыв в размерах смотрели только как на проблему, называемую «узким местом softmax» (softmax bottleneck), означающую, что словарь слишком велик по сравнению со скрытым состоянием, что ограничивает разнообразие распределений следующего слова, которые модель может выразить.

В этой статье говорится, что тот же разрыв имеет и другой эффект.

При обратном распространении сигнал ошибки должен пройти через выходной слой, чтобы вернуться назад и направить корректировку параметров модели, и этот этап также подвержен влиянию разрыва в размерах.

Теоретически, сигнал ошибки перед возвратом содержит количество информации, сопоставимое с размером словаря.

Но количество информации, которое выходной слой может передать обратно, ограничено его собственной структурой, верхний предел примерно равен длине скрытого состояния, что намного меньше размера словаря.

В статье измерены потери информации на этом шаге для уже обученных моделей GPT-2, Pythia, Llama 3, OLMo 2, Qwen 3, спроецировав сигнал ошибки в нулевое пространство весов выходного слоя и посмотрев, сколько осталось.

Результат: на моделях GPT-2, Pythia, Llama 3, OLMo 2, Qwen 3 от 95% до 99% нормы градиента были отсечены на этом шаге.

Косинусное сходство оставшегося сигнала с исходным градиентом составило всего от 0.1 до 0.2.

Более 90% сигнала, который должен вернуться, съедается на этом шаге, а оставшаяся малая часть даже не направлена в нужную сторону.

Этот выходной слой — неизбежный путь, который проходит почти каждая языковая модель, никто не рассматривал его как объект для пристального изучения, но при каждом обратном распространении он тихо стирает большую часть тренировочного сигнала, который должен был вернуться.

Удалить слой — разорвать цепь рассуждений

Есть еще одна статья под названием «Когда меньше слоев ломает больше цепочек» (When Fewer Layers Break More Chains), из Тюбингенского университета, которая рассказывает об уже широко используемом методе сжатия моделей — прунинге слоев (layer pruning), то есть простом удалении целых слоев из Transformer для уменьшения глубины модели и экономии вычислений.

Прунинг слоев возможен, потому что предыдущие исследования показали, что некоторые слои в модели вносят очень маленький вклад в общую производительность, и после их удаления при тестировании на обычных задачах на знания, оценки падают незначительно.

Удалив четверть слоев, можно сохранить более 80% исходной точности, такие результаты сделали прунинг слоев общепринятым методом повышения эффективности.

Но эти бенчмарки измеряют задачи на знание, с короткими ответами, которые можно дать правильно, полагаясь на запомненную информацию.

Эта статья измеряет другую способность — длинные цепочки рассуждений. В статье используется метод «расширения во время тестирования» (test-time scaling), простыми словами — дать модели больше времени подумать, больше токенов для рассуждений или позволить ей сгенерировать ответ несколько раз и выбрать правильный. В норме, чем дольше думать или чем больше попыток, тем выше должна быть точность.

В статье выбрали две модели, которые изначально обладают такой способностью, s1.1-7B и Qwen3-8B, применили к ним три основных метода прунинга слоев, удалив по одному или два слоя каждым методом, а затем проверили, работают ли эти два способа расширения.

Результат: на задачах на знание оценки действительно падают плавно, но при переходе к математическим задачам уровня соревнования AIME24, у s1.1-7B удаление всего одного слоя приводит к резкому падению точности, удаление двух слоев — падение почти до нуля.

Предоставление модели большего количества токенов для размышления должно было помочь ей лучше думать, но у обрезанных моделей, чем больше времени на размышление, тем меньше улучшений. Расширение во время тестирования, по сути, перестает работать.

Далее авторы проверили, можно ли восстановить производительность с помощью дообучения, применив LoRA и полное дообучение параметров к обрезанным моделям.

Для модели с удаленным одним слоем дообучение почти не помогает. Для модели с удаленными двумя слоями дообучение может восстановить часть оценки, но до уровня до обрезки ещё далеко.

В целом, эта статья хочет сказать, что прунинг слоев не так безопасен, как кажется.

Три статьи исследуют совершенно разные объекты: одна изучает длинный контекст, другая — градиенты при обучении, третья — цепочки рассуждений.

Но если посмотреть на них вместе, можно увидеть общую закономерность: все три статьи нацелились на стандартные конструкции, которые уже широко используются основными моделями и которые редко подвергаются повторному сомнению.

Теперь эти «рутинные» операции тоже начинают пересматривать.

Статья из WeChat официального аккаунта «Квантовый бит» (量子位), автор: Внимание к передовым технологиям

Связанные с этим вопросы

QКакие архитектурные решения в Transformer были подвергнуты критике на конференции COLM 2026?

AНа конференции COLM 2026 несколько статей подвергли критике ряд стандартных архитектурных решений Transformer. В частности, рассматривались QK-нормализация, GQA (Grouped-Query Attention), скользящее окно внимания (Sliding Window Attention) и длина контекста при предобучении. Эти решения, ранее считавшиеся стандартными и не требующими проверки, по данным исследований, могут негативно сказываться на производительности моделей, особенно в задачах с длинным контекстом.

QКакое влияние на производительность в задачах с длинным контекстом оказывают различные комбинации архитектурных решений, согласно исследованию 'Cracks in the Foundation'?

AСогласно исследованию 'Cracks in the Foundation', отдельные архитектурные решения, такие как длина контекста предобучения или добавление скользящего окна внимания, сами по себе оказывают небольшое негативное влияние на результаты в тесте HELMET 32K (падение на 1-2 балла). Однако комбинация нескольких решений приводит к синергетическому негативному эффекту. Например, совместное использование GQA и скользящего окна внимания приводило к падению оценки в среднем на 9 баллов, что значительно больше суммы их индивидуальных влияний. Наихудшей комбинацией оказалось одновременное использование GQA, скользящего окна внимания и послойной QK-нормализации.

QКакую проблему в процессе обратного распространения ошибки (backpropagation) выявила статья 'Lost in Backpropagation'?

AСтатья 'Lost in Backpropagation' выявила, что слой проекции вывода (output projection layer) в языковых моделях создает серьезную проблему при обратном распространении ошибки. Из-за значительной разницы в размерности скрытого состояния (например, несколько тысяч) и размера словаря (десятки тысяч) этот слой становится "узким местом". В результате от 95% до 99% нормы градиента теряется при прохождении через этот слой, а оставшийся сигнал имеет очень низкое косинусное сходство (0.1-0.2) с исходным градиентом. Это означает, что большая часть обучающего сигнала не доходит до более ранних слоев модели.

QКакие последствия для способности к длинным цепочкам рассуждений имеет обрезка слоев (layer pruning), согласно статье 'When Fewer Layers Break More Chains'?

AСогласно статье 'When Fewer Layers Break More Chains', обрезка слоев (layer pruning), хотя и мало влияет на результаты в стандартных тестах на знания, катастрофически снижает способность модели к длинным цепочкам рассуждений. Например, на сложных математических задачах (AIME24) удаление даже одного слоя в модели s1.1-7B приводило к резкому падению точности, а удаление двух слоев — почти к нулевой точности. Кроме того, у обрезанных моделей нарушалась способность к 'расширению при тестировании' (test-time scaling): предоставление модели большего количества токенов для размышлений или нескольких попыток генерации перестает улучшать результаты.

QКакой общий вывод можно сделать из трех представленных на COLM 2026 исследований о стандартных архитектурных решениях в Transformer?

AОбщий вывод трех исследований заключается в том, что многие архитектурные решения в Transformer, которые стали де-факто стандартом и редко подвергаются сомнению, могут иметь скрытые, неучтенные недостатки. Эти недостатки проявляются не в стандартных тестах (на знания или короткий контекст), а в более сложных сценариях: работе с длинным контекстом, эффективности обратного распространения градиента или выполнении многошаговых рассуждений. Исследования призывают к более критическому и всестороннему переосмыслению 'унаследованных' проектных выборов в архитектуре Transformer.

Похожее

Аналитик заявил о сохранении биткоина в диапазоне $61–68 тыс.

Биткоин продолжает торговаться в боковом диапазоне $61–68 тыс. на фоне снижения волатильности до минимумов за три года. Аналитик Кирилл Комаленков отмечает, что в ближайшее время, до третьей декады августа, движение вероятно сохранится в этом коридоре, с возможной проверкой уровней $62 300 и $61 600. При этом первый выход за границы диапазона может оказаться ложным движением, так как крупные участники могут собирать ликвидность. Ключевыми факторами для оценки будущего тренда названы потоки средств в биржевые фонды (ETF) и активность трейдеров. Однако сохраняется риск негативного сценария во второй половине августа из-за геополитической напряженности или жесткой риторики регуляторов США, что может спровоцировать коррекцию до $45–50 тыс. к началу осени. Этот уровень, по мнению эксперта, может стать основой для восстановления рынка поздней осенью. Отдельно сообщается, что в России неквалифицированные инвесторы вскоре смогут легально покупать биткоин, эфир и стейблкоины с годовым лимитом в 300 тыс. рублей через одного посредника.

cryptonews.ru8 мин. назад

Аналитик заявил о сохранении биткоина в диапазоне $61–68 тыс.

cryptonews.ru8 мин. назад

Где окажется биткойн через 5 лет?

За последние пять лет биткойн вырос всего на 40%, значительно отстав от индекса S&P 500. В будущем его рост может поддержать несколько факторов. Во время экономической нестабильности, как показал банковский кризис 2023 года, инвесторы могут обращаться к биткойну как к защитному активу благодаря его ограниченной эмиссии (21 млн). Кроме того, расширение институционального внедрения, например, через ETF, может увеличить спрос и цену. Некоторые эксперты, как Эми Ольденбург из Morgan Stanley, прогнозируют долгосрочный рост, потенциально до $1 млн. Однако главным сдерживающим фактором на ближайшие пять лет может стать конкуренция с акциями компаний в сфере искусственного интеллекта. Эти компании демонстрируют высокую прибыльность, рост выручки и впечатляющую доходность акций (например, Micron Technology выросла на 1200% за три года), предлагая инвесторам более привлекательную альтернативу спекулятивным криптовалютам. Таким образом, пока продолжается бум ИИ, рост биткойна может быть умеренным и неопределенным.

cryptonews.ru8 мин. назад

Где окажется биткойн через 5 лет?

cryptonews.ru8 мин. назад

Quantinuum и Quanta объединятся для масштабирования квантовых систем

Quantinuum и тайваньский производитель вычислительной инфраструктуры Quanta Computer заключили соглашение о совместной разработке аппаратной платформы для будущих крупномасштабных квантовых систем. Компании планируют перевести производство квантового оборудования от лабораторных установок к модульной промышленной модели. Партнеры уже проектируют новые компоненты с учетом воспроизводимости и масштабируемости, что должно помочь решить ключевую отраслевую проблему — переход от единичных сложных установок к серийным системам. Сотрудничество сосредоточено на архитектуре trapped-ion, используемой Quantinuum, где применяется подход QCCD для перемещения ионов. Quantinuum рассчитывает, что опыт Quanta в промышленном производстве серверов и глобальных цепочках поставок поможет ускорить создание инфраструктуры для более крупных систем с коррекцией ошибок и сократит разрыв между прототипом и коммерческим развертыванием. Это соглашение следует за другими шагами Quantinuum по коммерциализации, включая партнерство с Oracle для размещения квантового компьютера Helios в облачной инфраструктуре и сообщение о значительном повышении логической точности. В отрасли растут ожидания, что инвестиции в квантовые вычисления начнут приносить заметную прибыль в ближайшие годы.

cryptonews.ru14 мин. назад

Quantinuum и Quanta объединятся для масштабирования квантовых систем

cryptonews.ru14 мин. назад

Bitmine Тома Ли теперь владеет 4,8% от общего объема Ethereum. Стоит ли сейчас покупать ETH?

Том Ли, основатель Fundstrat Global Advisors, убеждённый сторонник криптовалют и председатель совета директоров Bitmine, наращивает позиции в Ethereum. По состоянию на 10 августа Bitmine владеет 5,81 млн ETH, что составляет 4,8% от общего предложения, с целью довести долю до 5%. Несмотря на падение цены ETH почти на 60% за год, Ли сохраняет оптимизм, прогнозируя рост до $22 000 в ближайшие годы и $62 000–250 000 в долгосрочной перспективе. Он видит катализаторами рост сферы смарт-контрактов, децентрализованных приложений, токенизации реальных активов (RWA) и использование блокчейна ИИ-агентами. Хотя прошлый успех Ли с биткоином не гарантирует повторения с эфиром, у Ethereum есть сильные фундаментальные перспективы. Автор статьи считает, что, не следуя агрессивной стратегии Bitmine, инвесторы могут рассмотреть накопление ETH на текущем нестабильном рынке, учитывая потенциал роста, одобрение спотовых ETF и возобновление интереса к крипторынку.

cryptonews.ru16 мин. назад

Bitmine Тома Ли теперь владеет 4,8% от общего объема Ethereum. Стоит ли сейчас покупать ETH?

cryptonews.ru16 мин. назад

Консолидация и Джексон-Хоул: трейдер оценил сценарии движения биткоина и Ethereum

В статье анализируется текущая ситуация на рынке криптовалют перед симпозиумом в Джексон-Хоул. Биткоин застрял в консолидации около $63 513, с ключевой поддержкой на $62 484 и сопротивлением в зоне FVG $64 000-$65 000. Рассмотрены три сценария: пробой вниз к $60 000, импульсный рост к $67 255 или манипулятивный сброс для сбора стоп-лоссов с последующим ростом (приоритетный). Ethereum не смог пробить $2000, торгуясь внутри FVG. Сопротивление — $1931, поддержка — $1852. Сценарии включают пробой вверх, глубокий сброс к $1800 с разворотом или ложный пробой и резкое падение. Отмечен устойчивый приток в ETF Ethereum на фоне оттока из биткоин-ETF. Индекс доллара (DXY) пробил поддержку 99,475, открыв путь к зонам 99,000 и 98,700. Возможны отскок выше 99,475, продолжение падения (приоритетный сценарий) или ретест сопротивления с дальнейшим снижением. Ключевые события недели — протоколы FOMC и данные PMI, которые зададут тон перед выступлением нового главы ФРС. Рекомендуемая стратегия — осторожность, работа на младших таймфреймах и жесткий контроль рисков в условиях низкой ликвидности и потенциальных манипуляций.

cryptonews.ru17 мин. назад

Консолидация и Джексон-Хоул: трейдер оценил сценарии движения биткоина и Ethereum

cryptonews.ru17 мин. назад

Торговля

Спот
活动图片