Ключевые технологии Transformer коллективно провалились на одной конференции?!
На COLM 2026 несколько статей одновременно нацелились на одно и то же —
Те проектные решения в Transformer, которые уже никто не ставит под сомнение, на самом деле не выдерживают критики.

Transformer — это почти архитектура по умолчанию для всех основных моделей, и его настройки также в большинстве своем считаются каноническими, мало кто возвращается их проверять.
В итоге эта серия статей с разных сторон заново пересчитала счета по этим выбором по умолчанию.
И что удивительно, выводы разных исследователей оказались поразительно схожи: каждая стандартная конструкция в Transformer заплатила ощутимую цену в каком-то измерении, которое существующие системы бенчмаркинга не измеряют.
Трещины в длинном контексте
Первая статья называется «Трещины в фундаменте» (Cracks in the Foundation), от институтов типа Ai2, и нацеливается на QK-нормализацию, GQA, скользящее окно внимания и длину контекста при предобучении — архитектурные выборы, давно ставшие «стандартными настройками».

Исследователи взяли реальные модели Llama 2, Llama 3, Qwen 3, Olmo 3, выбрали использованные в них значения параметров, сделали перестановки и комбинации и обучили для сравнения 26 моделей.
Размер этих моделей составлял от 7B до 8B параметров, данные, токенизатор и метод расширения контекста оставались неизменными, различалась только архитектура.
Команда назвала эту группу моделей «OlmPool», все они сначала прошли предобучение на 140B токенов, затем финальное обучение для длинного контекста на 10B токенов, в общей сложности сожгли более 170 тысяч GPU-часов.
В результате, оценки 26 моделей на бенчмарке HELMET 32K составили максимум 56.4 и минимум 29.9, разница 26.5 баллов, что в относительном выражении составляет 47%.
Данные одинаковы, архитектура в целом похожа, но просто из-за того, что четыре переключателя повернуты по-разному, оценки могут различаться настолько.

Если переключить один параметр, влияние на самом деле невелико. Использовать длину контекста 4096 или 8192 при предобучении, добавлять или не добавлять скользящее окно внимания — в среднем оценка падает всего на пару баллов.
По-настоящему критично, когда несколько выборов складываются вместе. Как только SWA и GQA оказываются в одной модели, среднее падение составляет 9 баллов, что гораздо больше суммы их индивидуальных влияний.
Худшая комбинация, которую обнаружила команда, — это GQA, скользящее окно внимания и послойная QK-нормализация вместе; падение оценки также оказалось значительно больше суммы отдельных эффектов.
Позже они обнаружили, что просто подсчитав, сколько «вредных конструкций» есть в модели, это число может довольно точно предсказать её производительность на длинном контексте, и даже эффективнее, чем пошаговый анализ архитектуры.
QK-нормализация — самый неинтуитивный пункт. Изначально её добавляли в модели для повышения стабильности обучения, и в индустрии её в основном считают полезной вещью.
Но в статье измерено: если убрать изначальную QK-нормализацию и пост-нормализацию в Olmo 3, заменив их на пре-нормализацию, оценка HELMET, наоборот, вырастает на 6 баллов.
Тот же самый апдейт, примененный к Llama 3, даёт обратный эффект — падение на 3.8 балла.
Один и тот же «стандарт», другой базовый модели — результат может быть полностью противоположным.

В этой части также было обнаружено явление, идущее вразрез с интуицией многих — «фокусировка внимания» (attention focus), когда модель направляет значительную часть внимания на первые несколько токенов контекста.
Это явление всегда считалось вредной привычкой, растрачивающей вычислительные ресурсы, и многие новые методы специально продаются как устраняющие его. Но в этой группе моделей OlmPool, чем более выражена фокусировка внимания, тем лучше производительность на длинном контексте.
QK-нормализация как раз ослабляет эту фокусировку, что, возможно, и является причиной её негативного влияния на способность работать с длинным контекстом.
Съеденный градиент
Вторая статья называется «Потерянный при обратном распространении» (Lost in Backpropagation), из Корнеллского университета, и нацеливается на последний слой, который используется почти во всех языковых моделях — слой выходной проекции.

На каждом шаге языковая модель сначала вычисляет последовательность чисел, представляющую её понимание текущего контекста, эта последовательность называется скрытым состоянием D.
Чтобы предсказать следующее слово, модель должна преобразовать скрытое состояние в оценку (score) для каждого кандидата в словаре; сколько слов в словаре, столько оценок и нужно вывести.
Эти оценки называются logits, чем выше оценка, тем больше модель считает, что это слово является следующим.
Компонент, выполняющий это преобразование, и есть выходной слой, по сути — матричное умножение.
Размер словаря, как правило, гораздо больше длины скрытого состояния: десятки тысяч против, возможно, нескольких тысяч.
Раньше на этот разрыв в размерах смотрели только как на проблему, называемую «узким местом softmax» (softmax bottleneck), означающую, что словарь слишком велик по сравнению со скрытым состоянием, что ограничивает разнообразие распределений следующего слова, которые модель может выразить.
В этой статье говорится, что тот же разрыв имеет и другой эффект.
При обратном распространении сигнал ошибки должен пройти через выходной слой, чтобы вернуться назад и направить корректировку параметров модели, и этот этап также подвержен влиянию разрыва в размерах.

Теоретически, сигнал ошибки перед возвратом содержит количество информации, сопоставимое с размером словаря.
Но количество информации, которое выходной слой может передать обратно, ограничено его собственной структурой, верхний предел примерно равен длине скрытого состояния, что намного меньше размера словаря.
В статье измерены потери информации на этом шаге для уже обученных моделей GPT-2, Pythia, Llama 3, OLMo 2, Qwen 3, спроецировав сигнал ошибки в нулевое пространство весов выходного слоя и посмотрев, сколько осталось.
Результат: на моделях GPT-2, Pythia, Llama 3, OLMo 2, Qwen 3 от 95% до 99% нормы градиента были отсечены на этом шаге.
Косинусное сходство оставшегося сигнала с исходным градиентом составило всего от 0.1 до 0.2.

Более 90% сигнала, который должен вернуться, съедается на этом шаге, а оставшаяся малая часть даже не направлена в нужную сторону.
Этот выходной слой — неизбежный путь, который проходит почти каждая языковая модель, никто не рассматривал его как объект для пристального изучения, но при каждом обратном распространении он тихо стирает большую часть тренировочного сигнала, который должен был вернуться.
Удалить слой — разорвать цепь рассуждений
Есть еще одна статья под названием «Когда меньше слоев ломает больше цепочек» (When Fewer Layers Break More Chains), из Тюбингенского университета, которая рассказывает об уже широко используемом методе сжатия моделей — прунинге слоев (layer pruning), то есть простом удалении целых слоев из Transformer для уменьшения глубины модели и экономии вычислений.
Прунинг слоев возможен, потому что предыдущие исследования показали, что некоторые слои в модели вносят очень маленький вклад в общую производительность, и после их удаления при тестировании на обычных задачах на знания, оценки падают незначительно.
Удалив четверть слоев, можно сохранить более 80% исходной точности, такие результаты сделали прунинг слоев общепринятым методом повышения эффективности.
Но эти бенчмарки измеряют задачи на знание, с короткими ответами, которые можно дать правильно, полагаясь на запомненную информацию.
Эта статья измеряет другую способность — длинные цепочки рассуждений. В статье используется метод «расширения во время тестирования» (test-time scaling), простыми словами — дать модели больше времени подумать, больше токенов для рассуждений или позволить ей сгенерировать ответ несколько раз и выбрать правильный. В норме, чем дольше думать или чем больше попыток, тем выше должна быть точность.

В статье выбрали две модели, которые изначально обладают такой способностью, s1.1-7B и Qwen3-8B, применили к ним три основных метода прунинга слоев, удалив по одному или два слоя каждым методом, а затем проверили, работают ли эти два способа расширения.
Результат: на задачах на знание оценки действительно падают плавно, но при переходе к математическим задачам уровня соревнования AIME24, у s1.1-7B удаление всего одного слоя приводит к резкому падению точности, удаление двух слоев — падение почти до нуля.
Предоставление модели большего количества токенов для размышления должно было помочь ей лучше думать, но у обрезанных моделей, чем больше времени на размышление, тем меньше улучшений. Расширение во время тестирования, по сути, перестает работать.

Далее авторы проверили, можно ли восстановить производительность с помощью дообучения, применив LoRA и полное дообучение параметров к обрезанным моделям.
Для модели с удаленным одним слоем дообучение почти не помогает. Для модели с удаленными двумя слоями дообучение может восстановить часть оценки, но до уровня до обрезки ещё далеко.
В целом, эта статья хочет сказать, что прунинг слоев не так безопасен, как кажется.
Три статьи исследуют совершенно разные объекты: одна изучает длинный контекст, другая — градиенты при обучении, третья — цепочки рассуждений.
Но если посмотреть на них вместе, можно увидеть общую закономерность: все три статьи нацелились на стандартные конструкции, которые уже широко используются основными моделями и которые редко подвергаются повторному сомнению.
Теперь эти «рутинные» операции тоже начинают пересматривать.
Статья из WeChat официального аккаунта «Квантовый бит» (量子位), автор: Внимание к передовым технологиям





