Автор | Сунь Юнцзе
В 2026 году выпуск DeepSeek V4 неоднократно откладывался, что неожиданно вызвало глобальную дискуссию в сообществе ИИ о «декудаизации». Согласно сообщениям различных СМИ, эта ожидаемая многомодальная модель с открытым исходным кодом, масштаб параметров которой достигнет триллионного уровня с поддержкой контекста в миллион токенов, активно адаптируется к чипам Huawei Ascend, а её ключевой код переписывается с использованием фреймворка CANN.
Если это станет реальностью, это будет первым случаем в Китае, когда экосистема ИИ системно исследует возможность размещения ключевых возможностей модели на не-CUDA платформе в реальной производственной среде. Другими словами, это не просто выпуск модели, а скорее «стресс-тест» базового технологического пути.
Однако, как подчеркнул основатель DeepSeek Лян Вэньфэн во внутренних обсуждениях, это лишь «первый шаг долгого пути». В будущем риски и возможности сосуществуют, а баланс, и даже выбор, между совместимостью и самостоятельностью определит, сможет ли китайский ИИ действительно пройти свой собственный путь развития.
Задержка DeepSeek V4: неизбежная цена перехода на базовую платформу ИИ-вычислений
Как упоминалось ранее, выпуск V4, изначально запланированный на Китайский Новый год или февраль-март этого года, неоднократно пропускал сроки, и только в начале апреля соответствующие СМИ подтвердили, что выпуск состоится «в течение нескольких недель». Причина заключается в глубокой адаптации на стороне логического вывода (inference) к чипам Huawei Ascend. Но проблема в том, что этот путь оказался гораздо сложнее, чем предполагалось. Чтобы понять эту сложность, нужно сначала вернуться к техническим характеристикам самого DeepSeek V4.
Как известно, в 2026 году масштаб параметров больших моделей перешагнул «триллионный» рубеж и движется к уровню в несколько триллионов. В этом контексте, хотя V4 использует более агрессивную архитектуру MoE (Mixture of Experts), которая теоретически снижает объем вычислений для единичного логического вывода за счет «активации экспертов по требованию», расплатой являются более экстремальные требования к системным возможностям, включая пропускную способность памяти, межчиповое соединение (Interconnect) и управление KV Cache.

Другими словами, нагрузка на вычислительную мощность сместилась с «чистых вычислений» на «системное планирование и коммуникацию». В экосистеме NVIDIA для этой проблемы существуют относительно зрелые решения.
Например, на основе H100 или B200, с помощью NVLink и NVSwitch строится высокоскоростное соединение с пропускной способностью между GPU внутри узла на уровне ТБ/с, образуя вычислительную сеть, приближенную к «полносвязной», где данные перемещаются между чипами как по скоростному шоссе, а задержки и затраты на синхронизацию значительно сокращаются. Но когда DeepSeek попытался перенести эту сложную систему на платформу Huawei Ascend, он столкнулся с совершенно другой аппаратной топологией.
Нельзя отрицать, что чипы Ascend за последние годы значительно продвинулись, но в плане «полносвязности» сверхбольших кластеров они все еще отстают от NVIDIA на физическом уровне. Например, из-за ограничений технологического процесса и возможностей SerDes IP, Ascend в большей степени полагается на оптические модули для межузлового масштабирования. Эта схема «обмена пространства на пропускную способность» хотя и жизнеспособна, но вносит более длинные физические линии связи, что приводит к сложностям с задержкой сигнала, накладными расходами на синхронизацию, а также управлением энергопотреблением и охлаждением.
В то же время, разрыв на уровне программного обеспечения также нельзя игнорировать. Фреймворк CANN от Ascend в целом уступает по зрелости экосистеме CUDA в таких аспектах, как покрытие операторов, автоматический параллелизм, слияние ядер (kernel fusion) и планирование распределенной коммуникации. Это означает, что инженерной команде DeepSeek потребуется проводить целенаправленную оптимизацию множества низкоуровневых деталей и даже вручную переписывать ключевые операторы.
Что еще сложнее, это отставание часто является не линейным, а системным. Конкретно это проявляется в том, что падение производительности одного оператора может повлиять на всю вычислительную цепочку; снижение эффективности одной коммуникации может привести к значительным колебаниям общей пропускной способности. Конечным результатом может быть то, что модель все еще может работать, но до стабильной, эффективной и масштабируемой работы еще далеко.
С этой точки зрения, задержка DeepSeek V4 — это не просто вопрос графика выпуска продукта, а неизбежная цена глубокой磨合ки (притирки) между ведущей китайской алгоритмической командой и отечественной чиповой экосистемой. Хотя процесс сложен, он имеет большое значение.
Что еще более важно, этот процесс посылает четкий сигнал о том, что конкуренция в сфере ИИ переходит от «сравнения возможностей моделей» к «сравнению инженерных системных возможностей». И на этом этапе тот, кто сможет быстрее «запустить, стабилизировать и удешевить» модель, действительно приблизится к отраслевому преимуществу.
Монополию CUDA трудно сломать, CANN вынуждена идти на компромисс
Если упомянутые выше трудности адаптации DeepSeek V4 на стороне логического вывода раскрывают реальные инженерные ограничения, то, углубляясь в этот вопрос, возникает более фундаментальный вопрос: почему простая миграция модели с одной вычислительной платформы на другую стала такой сложной?
Оглядываясь на альянс Wintel эпохи ПК, Microsoft и Intel, хотя и монополизировали рынок, между двумя компаниями существовала борьба интересов, что оставляло пространство для подъема Linux, AMD и даже системы Apple. Однако NVIDIA установила в области ИИ своего рода «монополию единой вертикали», то есть слияние Microsoft и Intel.
Конкретно это проявляется в том, что на аппаратном уровне NVIDIA определяет физическую структуру SM (Streaming Multiprocessor) и вычислительную логику Tensor Core; на программном уровне CUDA предоставляет закрытые библиотеки, такие как cuBLAS, cuDNN, которые идеально соответствуют аппаратуре 1:1. Их наложение привело к ужасающей реальности: более 6 миллионов разработчиков по всему миру оптимизируют алгоритмы вокруг cuBLAS, cuDNN, NVLink/NVSwitch; фреймворки (PyTorch, TensorFlow)优先 (отдают приоритет) реализации под CUDA; даже гетерогенные кластеры «anti-NVIDIA», такие как AWS Trainium + Cerebras WSE, при миграции KV кэша все еще требуют программного обеспечения NVIDIA NIXL и AWS EFA.

Таким образом, это уже не точечные технические детали, а экосистемная блокировка, то есть до того, как переносимость моделей станет неэффективной, у разработчиков уже сформировалась инерция «мыслить на языке аппаратных особенностей NVIDIA». Именно эта экосистемная инерция позволяет NVIDIA, подобно огромной черной дыре, поглощать более 90% глобальных инновационных дивидендов.
В этом контексте CANN от Huawei, как его самый сильный конкурент, изначально действительно пыталась идти по относительно независимому пути, но с наступлением эры больших моделей этот путь начал выявлять проблемы, такие как нежелание разработчиков мигрировать, неготовность предприятий брать на себя риски и медленный рост экосистемы. В сочетании с давлением времени (например, быстрая итерация больших моделей) путь полной самостоятельности стал нереалистичным.
Исходя из этого, CANN постепенно внедрила уровень абстракции, подобный CUDA, например, в CANN Next предпринята попытка соответствовать интерфейсам cuBLAS, cuDNN, достичь высокой степени совместимости, чтобы сократить стоимость миграции модели с «нескольких недель или даже месяцев» до «часов»; на архитектурном уровне недавно выпущенная гетерогенная архитектура 950PR (разделение предзаполнения/декодирования) также намеренно имитирует разделенный сервис NVIDIA, а не полностью гетерогенный путь Google TPU.
Мы должны признать, что эта стратегия, приближенная к «приоритету совместимости», в краткосрочной перспективе успешна: она снижает порог входа, позволяет Ascend быстро получить основу для применения на внутреннем рынке и дает таким компаниям, как DeepSeek, Tencent, ByteDance, возможность с низким порогом испытать отечественные вычисления. Например, CANN Next, реализуя модель программирования SIMT, достигла совместимости с CUDA выше 95%, что помогло многим предприятиям значительно сократить время миграции до часов, ускорив практическое внедрение.
Но последующая проблема заключается в том, что как только дело доходит до передовых инноваций, уровень совместимости становится «потолком».
Например, когда разработчики начинают глубоко использовать платформу Ascend, они обнаруживают, что хотя обычные пути уже проторены, как только дело доходит до некоторых редких, инновационных низкоуровневых операторов, поддержка CANN снижается, а производительность сильно скачет. Трудности, с которыми столкнулся DeepSeek V4 в процессе адаптации, такие как попытки внедрить гибридные архитектуры, отличные от Transformer, например, SSM (State Space Model) или Mamba, и обнаружение того, что низкоуровневая оптимизация CANN все еще в основном ориентирована на матричное умножение (GEMM), во многом связаны с тем, что при попытке некоторых выходящих за рамки обычного алгоритмических оптимизаций они натыкаются на «границы» уровня совместимости CANN.
Более глубокая проблема заключается в том, что一旦选择兼容,就意味着默认CUDA仍然是隐形标准,你可以替换硬件,但在软件语义和开发范式上,仍然在沿用对方定义的规则。这既是捷径,也是限制。 (Как только выбирается совместимость, это означает, что по умолчанию CUDA остается невидимым стандартом; вы можете заменить оборудование, но в семантике программного обеспечения и парадигме разработки вы все еще используете правила, определенные другой стороной. Это и короткий путь, и ограничение.)
Совместимость таит вызовы, будущие возможности все еще требуют подлинной самостоятельности
Как упоминалось ранее, в условиях сложившегося де-факто стандарта экосистемы CUDA, выбор Huawei пути «подобного совместимости» почти неизбежен, но одновременно он ставит всю китайскую индустрию ИИ перед ключевым выбором: продолжать ли совместимость с CUDA или постепенно двигаться к truly независимой экосистеме?
В краткосрочной перспективе ответ почти не вызывает сомнений: необходимо быть совместимым, это выбор эффективности и реальности. Но в долгосрочной перспективе этот путь скрывает不容忽视ные риски.
Как известно, когда система (например, CANN) проектируется для совместимости с другой системой (например, CUDA), она неизбежно наследует ее ограничения.
Факт в том, что в настоящее время большинство глобальных алгоритмов с открытым исходным кодом разработаны вокруг архитектуры NVIDIA. Если для использования этих существующих активов一味追求 (слепо стремиться) к совместимости 1:1, то мы попадем в «ловушку имитатора» в проектировании оборудования, что проявится в том, что一旦英伟达的硬件架构在未来某个节点面临范式转型,例如从Transformer转向某种不需要大规模矩阵乘法、而是更依赖异步逻辑的新架构时,那么一直处于“影子状态”的国产算力栈可能会面临瞬间的技术断层,而这种“Bug对Bug兼容”的死胡同,无疑让我们的底层创新始终笼罩在别人的阴影之下。 (если в какой-то момент в будущем аппаратная архитектура NVIDIA столкнется с сменой парадигмы, например, переход от Transformer к какой-то новой архитектуре, не требующей массового матричного умножения, а больше зависящей от асинхронной логики, тогда отечественный стек вычислений,始终处于«теневым状态», может столкнуться с мгновенным технологическим разрывом, и этот тупик «совместимости баг в баг», несомненно, будет держать наши низкоуровневые инновации под тенью других).
Более глубокий риск заключается в «временном лаге». Согласно статистике Bernstein и Epoch AI, хотя доля Huawei на внутреннем рынке резко выросла, в общем объеме глобальных вычислений ИИ доля отечественных чипов составляет лишь 5%, что все еще относительно мало. Именно этот разрыв в абсолютном масштабе приводит к серьезному «трению эффективности НИОКР».


Конкретно это проявляется в том, что американские гиганты ИИ могут использовать мощную пропускную способность связи Blackwell, чтобы за 18 месяцев пройти Scaling Laws для параметров в 10T, в то время как китайские顶尖人才 (лучшие таланты) вынуждены тратить более 50% своих научно-исследовательских мощностей на решение проблем типа «как решить затухание сигнала в устаревших чипах» и «адаптация незрелых компиляторов».
Следует пояснить, что этот временной разрыв в быстро меняющуюся эпоху ИИ может быть无限放大 (бесконечно усилен). Пока наши таланты заняты «заполнением ям», противник, возможно, уже завершил экспоненциальное复利 (сложное наращивание) возможностей модели, что приводит к тому, что一年模型的领先 (годовое лидерство модели оппонента) превращается в разрыв не в один год для нас, с наложением экспоненциального复合增长 (сложного роста) возможностей модели,数据飞轮 (колеса данных) и安全对齐 (безопасного выравнивания).
Конечно, вызовы часто содержат возможности. Если DeepSeek V4 будет успешно выпущен, это докажет осущеспособность «отечественного полного стека», ускорит созревание экосистемы CANN, привлечет больше разработчиков, и, в сочетании с глобальными настроениями «天下苦英伟达久矣» (мир давно страдает от NVIDIA), поддержка CANN в отрасли может превзойти ожидания. И если последующие чипы, такие как Huawei Ascend, достигнут 80-90% производительности логического вывода H100, в叠加 (совокупности) с преимуществами совместимости CANN Next, критический масштаб цепочки поставок китайского ИИ有望 (имеет шанс) сформироваться в течение 1-2 лет.
Но необходимо清醒认识 (трезво осознавать), что совместимость может решить только проблему «выживания», а подлинная самостоятельность определяет, «как далеко мы сможем пройти». И следующие 3-5 лет будут关键窗口期 (критическим окном возможностей). Если мы сможем, сохраняя совместимость, постепенно建立 (построить) независимые модели программирования, системы операторов и системные архитектуры, у экосистемы китайского ИИ все еще есть шанс实现 (осуществить) скачок от следования к определению правил. В противном случае китайский ИИ может陷入 (попасть в) колею «поезда грубого копирования».
В заключение: задержка выпуска DeepSeek V4, кажущаяся случайным «срывом сроков», на самом деле раскрывает более глубокую реальность: конкуренция в ИИ давно уже не просто спор моделей, а всестороннее соревнование базовой экосистемы и системных возможностей. Совместимость с CUDA, конечно, кратчайший путь к реальности, но если остановиться на этом, это может также锁定 (зафиксировать) будущий потолок.
Поэтому настоящая проблема заключается не в том, можно ли заменить одну технологию, а в том, можно ли摆脱 (избавиться) от зависимости от существующих парадигм и построить собственную систему правил. И следующие 3-5 лет определят, станет ли китайский ИИ важным полюсом в глобальной экосистеме или надолго останется на позиции «высококлассного последователя». Конечно,追求 (стремясь) к самостоятельности, также необходимо警惕 (остерегаться) потенциального влияния закрытой экосистемы на привлекательность для глобальных разработчиков, чтобы确保 (гарантировать) открытость экосистемы и долгосрочную международную конкурентоспособность.






