Автор | AIDeepDive
Сегодня акции "первой в мире публичной компании в области больших моделей" Zhipu AI (02513.HK) снова резко выросли.
Внутридневной рост в какой-то момент превысил 30%. По итогам торгов акции закрылись на отметке 1282 гонконгских доллара, прирост за день составил более 26%, рыночная капитализация достигла 571,57 млрд гонконгских долларов, вновь обновив исторический максимум.

Спусковым крючком для этого скачка стал конкретный технический показатель: 400 токенов/с.
22 мая Zhipu официально открыла для корпоративных клиентов API GLM-5.1 Highspeed (GLM-5.1-highspeed). Самым важным ключевым параметром был только один: скорость вывода модели достигла 400 токенов в секунду, обновив рекорд скорости API среди мировых производителей больших моделей.
Изначально я подумал, что это очередной пиар-ход от локального производителя больших моделей, но, внимательно изучив технические детали, наконец понял логику, стоящую за реакцией рынка капитала.
Что означает 400 токенов/с?
Это означает, что модель генерирует около 200 китайских иероглифов в секунду, что эквивалентно интенсивной производительности профессионального писателя за одну минуту, сжатой до одной секунды.
Объем текста, который автор пишет несколько дней подряд, GLM-5.1 Highspeed может выдать за 1 минуту; задача по рефакторингу системы, на которую у инженера уходит 3 дня, может быть выполнена моделью за время, необходимое, чтобы выпить чашку кофе.
01 Скорость важнее, чем вы думаете
Скорость всегда была наиболее недооцененным измерением в соревновании AI-моделей.
За последние три года гонка вооружений больших моделей сосредоточилась на двух направлениях: масштаб параметров (модели становятся больше и умнее) и ценовые войны (токены дешевеют, становясь доступнее). "Скорость" никогда не была главным героем.
Причина в том, что в прошлом "скорость" обычно достигалась за счет уменьшения количества параметров модели. Чтобы ускориться, приходилось использовать более мелкие и урезанные модели, расплачиваясь потерей возможностей.
Значение GLM-5.1 Highspeed в том, что он сохраняет возможности полноразмерного флагманского базового варианта, одновременно разгоняя скорость до 400 токенов/с.
Как для локальных, так и для международных моделей, "флагманские возможности" и "экстремально низкая задержка" впервые достигнуты без компромиссов.

Почему скорость так критична? Потому что основная арена ИИ претерпевает фундаментальные изменения.
Когда ИИ переходит от чат-ботов к эпохе агентов, вопросы и ответы перестают быть основной сценой. Чтобы выполнить задачу, агенту часто требуется десятки или даже сотни самовызовов модели: написание кода, вызов интерфейсов, поиск информации, использование инструментов...
В таком режиме работы задержка между каждым вызовом безжалостно накапливается и усиливается. Для задачи, требующей 50 вызовов, экономия 1 секунды на каждом вызове ускоряет всю задачу почти на 1 минуту. Для AI-ассистентов по программированию, голосового взаимодействия, систем принятия бизнес-решений этот разрыв может быть вопросом жизни и смерти.
На более глубоком уровне, в рамках фиксированного временного бюджета более быстрый вывод означает, что модель может выполнить более глубокие пути рассуждений, больше раундов самопроверки. Скорость превращается из системного показателя в саму границу интеллекта.
02 Насколько сложно добиться скорости?
Какой сейчас примерно уровень скорости в отрасли?
Среди ведущих игроков GPT-4o от OpenAI работает примерно на 100–150 токенов/с, серия Claude Sonnet от Anthropic — около 80–120 токенов/с, основные API флагманских моделей в Китае в основном находятся в диапазоне 50–100 токенов/с. 400 токенов/с примерно в 3-5 раз выше среднего уровня отрасли.
Что еще важнее, этот разрыв нельзя восполнить простым увеличением вычислительных мощностей.
Сервер с 8 графическими картами H200 теоретически может передавать до 38 ТБ данных в секунду. Для GLM-5.1 генерация одного токена требует чтения только около 42 ГБ активированных параметров. Чисто теоретически скорость должна приближаться к 1000 токенов/с.
Но в реальных системах часто получается всего несколько десятков токенов/с.

Это пропасть в целый порядок величины. GPU не недостаточно быстры; огромное количество времени тратится впустую на ожидание, простой и неэффективное планирование.
На этот раз Zhipu добился прорыва в конечной скорости за счет инноваций на трех уровнях одновременно: механизм вывода, стратегии параллелизма, сетевая архитектура.

03 Трехуровневое техническое наложение, приближение к физическим пределам железа
Раньше большие модели работали так: большая модель разбивалась на независимые операторы, каждый оператор запускал вычислительное ядро (kernel), вычисления завершались, происходила синхронизация и ожидание, затем запускался следующий.
На этапе обучения, когда каждое вычисление занимает от нескольких секунд до нескольких минут, эти накладные расходы на запуск и ожидание совершенно незначительны. Но при выводе на генерацию одного токена какой-то критический шаг может занимать всего несколько десятков микросекунд, и накладные расходы на запуск и ожидание становятся относительно значительными.
Ключевая идея TileRT: скомпилировать всю модель в постоянно работающий механизм, запустить один раз и больше не останавливаться.
TileRT на этапе компиляции кода заранее разворачивает всю вычислительную логику модели в статический непрерывный конвейер. Во время выполнения GPU постоянно работает на высокой скорости, вычисления, перемещение данных, коммуникация выполняются параллельно, промежуточные результаты по возможности остаются во внутреннем кэше GPU, не записываясь обратно в медленную видеопамять и не считываясь заново.

Здесь есть ключевая деталь проектирования: Специализация Warp.
Чтобы понять Warp, нужно сначала понять, как работает GPU. Самое большое отличие GPU от CPU в том, что внутри него есть тысячи относительно простых вычислительных единиц, которые сгруппированы вместе по 32 единицы в группу, эта группа и называется Warp.
Все 32 единицы внутри одного Warp должны всегда действовать синхронно, выполняя одну и ту же инструкцию, как отделение в армии, где командир приказывает всем одновременно выполнять одно и то же действие.
В традиционных фреймворках все Warp выполняют одну и ту же последовательность инструкций; TileRT заставляет разные группы Warp выполнять разные обязанности: одни специально отвечают за предварительную загрузку следующей порции данных, другие — за математические вычисления, третьи — за коммуникацию с другими GPU. Три группы работают одновременно, координируясь как конвейер, не дожидаясь друг друга.
Это похоже на переход от "один рабочий последовательно носит кирпичи, кладет стену, принимает работу" к "группа по переноске кирпичей, группа по кладке стены и группа приемки работают одновременно".
Эффективность внутри одной карты решена, но параллелизм на нескольких картах создает новые вызовы.
Общеотраслевая практика — тензорный параллелизм (Tensor Parallel): Матрица весов модели разбивается на несколько частей, каждая GPU отвечает за одну часть, после вычислений результаты суммируются через высокоскоростное соединение (NVLink).
Эта схема хорошо работает для таких регулярных плотных вычислений, как матричное умножение, и в настоящее время является стандартной многокарточной схемой почти для всех фреймворков вывода больших моделей.
GLM-5.1 использует **MLA (Multi-head Latent Attention, многоголовая потенциальная внимательность) — механизм внимания, предложенный DeepSeek.
Традиционный механизм внимания требует полного сохранения большого объема промежуточных данных (KV Cache) на каждом шаге вычисления для последующего использования, что очень требовательно к видеопамяти; подход MLA заключается в том, чтобы сначала сжать эти промежуточные данные в компактный "потенциальный вектор" для хранения, а затем развернуть и восстановить их при использовании, что значительно снижает требования к видеопамяти и повышает эффективность вывода.
Но в вычислительном процессе MLA есть особый этап: требуется выполнять разреженную индексацию из большого объема исторической информации: похоже на быстрое нахождение наиболее релевантных книг в огромной библиотеке, а затем тщательное чтение именно этих книг.
Этап "поиска книг" зависит от глобальной информации и не подходит для распределения по нескольким картам; "тщательное чтение" — это плотные вычисления, подходящие для многокарточного параллелизма. Если заставить все 8 GPU участвовать в "поиске книг", много времени будет потрачено впустую на синхронную коммуникацию между GPU.
Решение TileRT — заставить GPU работать гетерогенно: GPU 0 специально выступает в роли "библиотекаря-поисковика", отвечая за разреженную индексацию и маршрутизацию решений; GPU 1–7 выступают в роли "аналитиков для тщательного чтения", отвечая за плотные вычисления внимания и матричные операции. Два типа работников совместно используют наиболее подходящие для себя стратегии параллелизма для выполнения всего вычислительного слоя.

Далее TileRT встраивает операции коммуникации между GPU непосредственно в исполняемый конвейер, больше не как отдельный шаг. Снаружи кажется, что вся система из 8 карт выполняет один слой вычислений внимания всего за один запуск ядра, вся внутренняя коммуникация и вычисления бесшовно выполняются внутри непрерывного конвейера.
Вышеупомянутые два уровня решают проблемы в пределах одного сервера. Когда кластер расширяется до сотен или даже тысяч GPU, сама передача данных между GPU становится новым потолком.
Общеотраслевая практика — ROFT (Rail-Optimized Fat-Tree), рекомендованная NVIDIA официальная схема, абсолютный стандарт отрасли.
Ее структура — дерево: серверы сначала подключаются к коммутаторам нижнего уровня Leaf (уровень доступа, непосредственно обращенный к серверам), Leaf подключаются вверх к коммутаторам Spine (магистральный уровень, отвечающий за соединение между разными Leaf, как хаб на скоростной трассе). Передача данных между двумя GPU должна "сначала подняться до Spine, затем спуститься к целевому Leaf", проходя как минимум 3 хопа.
Чтобы избежать концентрации трафика на нескольких каналах, эта архитектура полагается на алгоритм ECMP для распределения данных по нескольким путям, что хорошо работает при условии "статистически равномерного" интернет-трафика.
Но трафик в сценариях вывода совершенно неравномерный. Разница в длине контекста между разными запросами может достигать десятков раз, направление передачи KV Cache между GPU почти случайное, несколько коммутаторов Leaf периодически становятся горячими точками, запуская механизм обратного давления, распространяя перегрузку с локального на весь канал. Эта перегрузка не решается настройкой протоколов, она является продуктом самой топологической структуры.

Фундаментальный прорыв ZCube: сделать возникновение такого рода перегрузок физически невозможным на архитектурном уровне.
Ключевой дизайн состоит из двух шагов:
Первый шаг: Отмена магистрального уровня Spine, сглаживание всей сети. Все коммутаторы Leaf делятся на две группы по четным и нечетным номерам, две группы полностью соединены между собой, любой нечетный коммутатор соединен со всеми четными коммутаторами, и наоборот. Между любыми двумя GPU можно добраться, пройдя максимум через два коммутатора, количество хопов сокращается с 3 до 2.

Второй шаг, самый изящный: Каждая сетевая карта GPU подключается к двум группам коммутаторов двумя совершенно разными способами. Эта особая топология придает ключевое математическое свойство: Между любыми двумя GPU во всей сети существует ровно один оптимальный путь.

"Уникальный путь" прямо устраняет корень перегрузки. Традиционная архитектура склонна к появлению горячих точек именно потому, что есть несколько путей на выбор, и алгоритм балансировки нагрузки, выбрав неправильный, приводит к концентрации трафика. ZCube на уровне дизайна устраняет саму возможность "выбора": балансировка не нужна, потому что развилок просто нет.
04 При одинаковых аппаратных условиях, какова экономика?
После обновления производственного кластера GLM-5.1 Zhipu с традиционного ROFT до ZCube получили три цифры:
Подводя итог: При тех же вложениях в GPU кластер может обслуживать больше пользователей; при тех же требованиях к пользовательскому опыту кластер может закупить на треть меньше сетевого оборудования. Эффективность и стоимость улучшаются в обоих направлениях.

Конкретно, пропускная способность выросла на 15%, что эквивалентно бесплатному получению дополнительных 15% вычислительных мощностей. При неизменном количестве GPU увеличение пропускной способности на 15% эквивалентно снижению удельной аппаратной стоимости каждого токена примерно на 13%, или возможности обслужить на 15% больше пользователей при тех же затратах.
Если в кластере 1000 GPU, это обновление эквивалентно凭空 получению мощности 150 дополнительных карт. По текущим рыночным ценам на высокопроизводительные карты для вывода это вычислительная стоимость в масштабе сотен миллионов юаней.
Снижение задержки в хвосте на 40,6% решает проблему стабильности, а не средней скорости. Для задачи агента, требующей 50 вызовов, если задержка в хвосте уменьшается на 1 секунду каждый раз, наихудшее время выполнения всей задачи сокращается почти на 1 минуту.
Снижение затрат на треть — это прямая экономия на уровне строительства. ZCube отменяет уровень Spine, при том же масштабе кластера необходимое количество коммутаторов и оптических модулей напрямую сокращается на треть. По оценкам Zhipu, в кластерах масштаба в десятки тысяч карт только эта статья может сэкономить примерно от 210 до 640 миллионов юаней.
В долгосрочной перспективе, по мере экспоненциального роста масштабов кластеров, сложность коммуникации между GPU возрастает в разы, вероятность и влияние перегрузок также увеличиваются. Это означает, что ценность таких архитектурных инноваций, как ZCube, будет проявляться все сильнее по мере непрерывного расширения кластеров вывода. Завтра выгода от кластера в десятки тысяч карт может быть не только сегодняшними 15%.
05 В заключение
Прочитав технический отчет Zhipu, я задумался: не станет ли это, как внезапное появление DeepSeek, бурей для отрасли?
Если подумать, их влияние, кажется, в разных аспектах. Когда появился DeepSeek, он доказал, что такой же интеллект можно реализовать с гораздо меньшими вычислительными мощностями. Рынок опасался, что "требуется меньше GPU", поэтому в тот же день рыночная капитализация NVIDIA сократилась почти на 600 миллиардов долларов.
Но сегодняшняя технология Zhipu доказывает: на тех же вычислительных мощностях можно производить больше. Она переосмысливает то, как должна выглядеть "инфраструктура помимо GPU".
В краткосрочной перспективе NVIDIA не пострадает, но в долгосрочной перспективе "ров" NVIDIA, состоящий из GPU + соединений NVLink + сети InfiniBand + программной экосистемы CUDA, начинает "размываться", особенно InfiniBand, приобретенная NVIDIA в 2019 году за 6,9 миллиарда долларов с покупкой Mellanox. Премия NVIDIA за сетевую сторону будет значительно размыта.
Кроме того, ZCube отменяет уровень Spine, но требования к плотности портов коммутаторов Leaf, наоборот, возрастают. Выигрывают производители, способные делать высокоплотные коммутаторы Leaf с большим количеством портов (Ruijie, Arista, коммутационные чипы Broadcom), страдают производители, в основном полагающиеся на премию за высококлассные коммутаторы уровня Spine.
В 2025 году Celestica и NVIDIA вместе занимали около 50% рынка коммутаторов для серверной сети AI. Эта структура будет пересмотрена после распространения парадигмы ZCube.
Оптические модули — самое прямое выигрышное направление в этой цепочке изменений, логика очень ясна. Для отечественных производителей оптических модулей (Zhongji Innolight, TFC Optical Communication и др.) это структурный позитивный фактор: не только общий объем растет, но и спрос на высокоскоростные оптические модули (800G, 1,6T) в парадигме ZCube становится более концентрированным и срочным по сравнению с традиционной архитектурой.
Будь то TileRT или архитектура ZCube, это механизм вывода, работающий на стандартных GPU, не зависящий от проприетарных аппаратных особенностей NVIDIA, и теоретически может быть портирован на отечественные чипы, такие как Huawei Ascend. Если это направление будет реализовано, оно значительно снизит порог входа в программный стек для отечественных AI-чипов в сценариях вывода.
Возможно, это и есть большее значение, стоящее за этим технологическим прорывом.








