Может ли DeepSeek сэкономить Китаю 1 триллион долларов?

marsbitОпубликовано 2026-06-03Обновлено 2026-06-03

Введение

Статья анализирует, как DeepSeek может радикально снизить затраты на инфраструктуру искусственного интеллекта в Китае за счет повышения эффективности оборудования, а не за счет снижения цен на чипы. Основная проблема современного ИИ — высокая зависимость от дорогих и дефицитных компонентов, особенно памяти HBM. В статье на примере будущей платформы Nvidia Vera Rubin (стоимостью около $7,8 млн) показано, как быстро растут расходы на память. DeepSeek атакует эту проблему с помощью трех ключевых технологий в своей модели V4: 1. **Сжатие «памяти» (контекста):** Технология Multi-head Latent Attention (MLA) кардинально сокращает объем кэша KV, необходимого для длинных контекстов, без потери качества, что высвобождает дорогую память HBM. 2. **Эффективное использование «тела» модели:** Применяя архитектуру Mixture of Experts (MoE) и интеллектуальное распределение параметров, модель активирует только небольшую часть своих «экспертов» для каждой задачи, уменьшая нагрузку на высокоскоростную память. 3. **Повторное использование вычислений:** Система кэширования позволяет повторно использовать ранее вычисленные результаты (например, при многократном чтении одного документа), заменяя дорогие вычисления дешевым чтением из памяти. В совокупности эти инновации позволяют, согласно автору, увеличить эффективную пропускную способность (производство токенов) на одном аппаратном обеспечении в 4 раза. Это эквивалентно экономии 75% капитальных затрат на оборудование для достижения того же уров...

Во второй половине 2026 года NVIDIA поставит свою самую мощную на сегодняшний день AI-платформу: Vera Rubin VR200 NVL72. В одном целевом серверном шкафу размещены 72 GPU Rubin и 36 CPU Vera. По оценкам Morgan Stanley, себестоимость материалов этой машины составляет около 7,8 миллиона долларов США.

Эта цифра и так пугающая. Но более важное, за чем стоит следить, — это то, куда уходят эти деньги.

Из этих 7,8 миллионов около 2 миллионов долларов потрачены не на знаменитые GPU-чипы и не на вычислительные ядра, а на память — высокоскоростную видеопамять (HBM4) и обычную оперативную память (LPDDR5X). Всего за год стоимость этой части памяти взлетела на 435% из-за роста цен.

Это сигнал. В этой все дорожающей AI-машине деньги массово перетекают от «компонентов, отвечающих за вычисления» к «компонентам, отвечающим за память и хранение».

Запомните этот сигнал. Потому что эта статья рассказывает о DeepSeek, который делает как раз обратное: всех подгоняет время, заставляя платить аппаратную наценку за AI из-за все более дорогой памяти. А он ищет способ, не ослабляя конкурентоспособности, с помощью интеграции программного и аппаратного обеспечения повысить токен-продуктивность этих дорогих аппаратных средств более чем в 4 раза, что эквивалентно экономии 75% инвестиций в железо.

И в конце этого пути в последнее время активно обсуждается одна гипотеза — может ли DeepSeek своими усилиями сэкономить Китаю на инфраструктурном строительстве искусственного интеллекта триллион долларов?

Неужели это возможно?

Триллион долларов экономят

Тот прайс-лист от NVIDIA — это самая весомая цифра в последних бухгалтерских книгах AI-инфраструктуры. В текущей ситуации спроса и предложения, если вы хотите купить самую передовую AI-машину, вы должны принять этот счет.

DeepSeek не может изменить это.

Он меняет другое: на одной и той же машине, на тех же самых дорогих аппаратных средствах хранения стоимостью 2 миллиона долларов, сколько именно токенов может быть произведено.

После выпуска DeepSeek V4 этот вопрос стал особенно конкретным.

На что стоит обратить внимание в V4 — это не только сама модель, но и три ключевых направления, которые она демонстрирует: Во-первых, продолжать сжимать «память», чтобы длинный контекст больше не перегружал видеопамять; во-вторых, пробуждать «тело» по требованию, чтобы огромной модели-эксперту не приходилось каждый раз задействовать все ресурсы; в-третьих, превращать повторные вычисления в переиспользуемый актив, чтобы вычисленный контекст не сжигал деньги снова и снова.

Часть характеристик этих технологий демонстрирует яркую особенность — они сделали акцент на совместной работе программного и аппаратного обеспечения, а не на чисто программной оптимизации. Поэтому некоторые шутливо сравнивают — возможно, DeepSeek станет крупнейшей в Китае компанией по производству аппаратного обеспечения для AI.

Страница модели показывает, что в сценарии с контекстом в 1 миллион токенов V4-Pro по сравнению с предыдущим поколением требует только 27% вычислительных ресурсов на один токен при инференсе и 10% занимаемого кэша. В этой статье мы возьмем приблизительно четверть вычислительной мощности для последующих расчетов.

При традиционном подходе это оборудование могло поддерживать только одну единицу пропускной способности, а благодаря сжатию длинного контекста, активации по требованию, повторному использованию кэша и планированию инференса DeepSeek позволяет эффективную выработку токенов на том же оборудовании увеличить в четыре раза — таким образом, стоимость не «срезается», а распределяется. Раньше работу, которую делали 4 машины, теперь, возможно, сможет выполнить одна; раньше генерация каждого токена полностью «съедала» стоимость дорогого оборудования, теперь ту же стоимость оборудования можно распределить на 4 токена.

В этом и заключается настоящая сила DeepSeek: он не изменил прайс-лист NVIDIA, но изменил производительность машин NVIDIA в бухгалтерской книге AI. Значение этого события намного превышает разовое снижение цен на API.

И масштаб в 1 триллион долларов тоже не взят с потолка.

Отчет McKinsey 2026 года «Стоимость вычислений» дает конкретную цифру: к 2030 году глобальным центрам обработки данных для удовлетворения спроса на вычислительные мощности потребуются инвестиции в размере около 6,7 триллионов долларов, из которых часть, предназначенная специально для обработки AI-нагрузок, съест около 5,2 триллиона долларов.

Другими словами, в ближайшие несколько лет деньги, которые человечество планирует вложить в AI-аппаратное обеспечение, измеряются триллионами долларов.

И значительная часть этих огромных средств уйдет на самые передовые и дефицитные аппаратные средства — то есть на высокоскоростную видеопамять HBM и оперативную память LPDDR. То, что делает DeepSeek, — это систематическое снижение зависимости всей китайской индустрии AI от этой части дорогого оборудования. Даже если снизить зависимость лишь частично, он сэкономит для отрасли астрономическую сумму триллионного масштаба.

Когда ежедневное потребление токенов в Китае с сегодняшних ста с лишним триллионов продолжит расти до сотен, тысяч триллионов, любое снижение стоимости единичного токена будет умножено на огромную разницу в инфраструктурных затратах. Если действительно ту же пропускную способность можно обеспечить с помощью четверти оборудования, то в обозримом будущем это может позволить сэкономить Китаю на инфраструктурных инвестициях в вычислительные мощности для AI почти 1 триллион долларов.

Это инфраструктурный расчет: кто может заставить те же жесткие затраты на оборудование производить больше токенов, тот строит меньше дата-центров, покупает меньше GPU, накапливает меньше видеопамяти, тот перераспределяет билеты в будущее AI.

Так как же DeepSeek этого добился? Ответ: он провел три операции над этой машиной большой модели.

Два прожорливых пожирателя

Распространенное заблуждение: самое дорогое в большой модели — это «мышление», вычисления. На самом деле нет.

Ее настоящие два прожорливых пожирателя — это «память» и «тело». И они сжигают одно и то же самое дорогое топливо — высокоскоростную видеопамять (HBM), память, напрямую интегрированную в систему GPU, чрезвычайно быструю и дорогую.

Сначала о памяти. При генерации текста у больших моделей есть неуклюжая особенность: чтобы выдать каждое новое слово, ей нужно оглянуться назад и перечитать все предыдущее содержание. Потому что смысл языка строится слоями, то, что следует сказать дальше, полностью зависит от того, какой контекст уже создан ранее.

Это похоже на синхронного переводчика. Он не может начать говорить, основываясь только на вашем последнем предложении, а должен постоянно держать в уме все, что вы сказали ранее — только помня эти предпосылки, он может понять истинное значение текущей фразы. Чем дольше вы говорите, тем больше ему нужно запоминать.

Чтобы не пересчитывать все с нуля на каждом слове (это было бы слишком медленно), модель временно сохраняет уже вычисленные промежуточные результаты. Этот архив называется кэшем ключ-значение (Key-Value Cache, можно понимать как кратковременную память модели).

Проблема в том, что он безумно разрастается по мере увеличения диалога.

Приведем конкретную цифру: по оценкам для одной из стандартных архитектур, обработка контекста объемом примерно в сто двадцать тысяч слов может «съесть» 488 ГБ высокоскоростной видеопамяти только на эту память. А у топового GPU Rubin от NVIDIA, который скоро будет поставлен, объем видеопамяти на карту составляет 288 ГБ. То есть, только для хранения этой «памяти» потребуется заполнить почти полтора, а то и接近 два самых передовых GPU — и модель еще даже не начала реальную работу.

Теперь о «теле». «Тело» модели — это ее весовые параметры, грубо говоря, носитель всех ее знаний и способностей. Чем сильнее способности, тем обычно массивнее тело, достигающее сотен миллиардов, триллионов параметров.

У традиционных плотных моделей (Dense Model, где для обработки любого ввода требуется задействовать все параметры) есть недостаток: что бы вы у нее ни спросили, она должна задействовать все тело. Это как если бы вы пришли в больницу только с зубной болью, а всех врачей всех отделений вызвали бы к вам, чтобы они обследовали вас с головы до ног, и только потом дошла бы очередь до стоматолога. Абсурдно, но счет выставляется полностью.

Это массивное тело также должно постоянно находиться в дорогой высокоскоростной видеопамяти, готовое к работе.

Память и тело, эти два прожорливых пожирателя, заставляют распределение стоимости всей аппаратной системы жестко зависеть от самой дорогой, самой дефицитной, наиболее зависимой от других аппаратных средств. И за последнее десятилетие отраслевой подход был простым и грубым: не хватает вычислительной мощности — добавляем, не хватает видеопамяти — добавляем еще. Таким образом, богатство индустрии в высокой степени концентрировалось на этой самой передовой аппаратной цепочке, самая жирная прибыль застревала в самом дефицитном звене.

Цена токена была взята в заложники дефицитностью одного вида аппаратного обеспечения. А три операции DeepSeek как раз ослабляют эти оковы.

Первая операция: Операция на мозге

Первая операция — на «памяти». И место, где он наносит удар, как раз самое неподходящее или самое страшное для прикосновения — механизм внимания (Attention, ключевой механизм, который большая модель использует для понимания связей в контексте).

Механизм внимания — это мозг большой модели. Его способность понимать контекст, улавливать ключевые моменты в длинном диалоге полностью зависит от этого механизма, который постоянно взвешивает связи между каждым словом. Та дорогая память, о которой шла речь ранее, как раз и есть продукт каждого импульса этого мозга.

Хочется сэкономить на памяти, но боятся риска, поэтому почти все предпочитают обходить этот мозг стороной, действуя только на периферии. От множественного запросного внимания (MQA), предложенного в 2019 году одним из авторов Transformer Noam Shazeer, до группового запросного внимания (GQA), предложенного Google в 2023 году и широко используемого в Llama и других моделях, основная идея основного направления всегда заключалась в том, чтобы «заставить несколько голов запросов использовать одну и ту же память» — по сути, «запоминать меньше, использовать как есть». Эффект экономии места поразителен, но цена — снижение качества модели. Проще говоря, консенсус этого направления всегда заключался в «компромиссе»: по умолчанию сжатие неизбежно вредит качеству, идет торг лишь о степени ущерба.

DeepSeek не идет на компромисс. Он выбирает прямую операцию на мозге, преобразуя сам механизм внимания.

Его решение называется многоголовым латентным вниманием (MLA, Multi-head Latent Attention), впервые появившимся в DeepSeek-V2 в 2024 году. Приведу аналогию: другие модели делают заметки, дословно переписывая каждую деталь, заполняя несколько толстых тетрадей; MLA сначала сводит заметки к высококонцентрированному резюме, сохраняет только резюме, а при использовании точно восстанавливает детали на основе резюме. В терминологии это называется «низкоранговым сжатием» — проецирование тех, казалось бы, сложных, но на самом деле высокоизбыточных воспоминаний в гораздо более компактное пространство для хранения.

Насколько эффект поразителен? Результаты, представленные в статье DeepSeek-V2, показывают, что по сравнению с предыдущей моделью того же семейства, V2 при более высокой способности снизила стоимость обучения на 42,5%, уменьшила KV Cache на 93,3%, а максимальную пропускную способность генерации увеличила в 5,76 раза. В том примере, который «съедал» 488 ГБ, при таком подходе можно сжать до нескольких гигабайт.

Но по-настоящему круто не то, сколько сэкономили, а то, что за это почти не пришлось платить потерей деталей.

По логике, сжав книгу до одной страницы резюме, как бы ты ни восстанавливал, не вернешь все детали. Но в экспериментах, опубликованных DeepSeek, эта сжатая память не только не уступала по эффективности стандартному вниманию «дословного переписывания всей книги», но в некоторых случаях даже была немного лучше.

В V4 этот подход был продвинут еще дальше в экстремальные сценарии длинного контекста: V4-Pro использует гибридную архитектуру внимания, в условиях контекста в 1 миллион токенов требует только 27% вычислительных ресурсов для инференса и 10% занимаемого кэша по сравнению с предыдущим поколением.

Чтобы понять, насколько это сложно, нужно знать, что это операция на самолете в полете. Изменение механизма внимания означает переписывание самой базовой вычислительной логики модели, переобучение всей модели, переделку всей сервисной системы, которая ее поддерживает. Ошибка на любом этапе — и интеллект рушится. Это не замена ниппеля на шине, это операция на открытом мозге.

И DeepSeek добился того, что AI после операции стал здоровее, чем до нее.

Вторая и третья операции: Оснащение машины пронумерованными ячейками хранения

Первая операция усмирила память. Вторая операция — против массивного «тела».

Идея этой операции не является оригинальной для DeepSeek, а продолжает четко обозначенный старый путь: смесь экспертов (MoE), архитектура, где модель разделена на множество «экспертов», и каждый раз вызываются только несколько из них.

Эта концепция появилась в 1991 году, в 2017 году Shazeer и другие внедрили ее в нейронные сети, затем GShard от Google, Switch Transformer перенесли ее в Transformer; по-настоящему же она стала популярной в конце 2023 года благодаря французской компании Mistral и ее модели Mixtral 8x7B, выпущенной просто сбросившей торрент-ссылку — общее количество параметров около 46,7 млрд, но при обработке каждого слова активируется только около 12,9 млрд.

Вернемся к той больнице «с зубной болью, которая тревожит всю больницу». MoE превращает ее в больницу с четкой специализацией отделений: вы пришли с зубной болью, регистратура сразу направляет вас в стоматологию, врачи остальных отделений занимаются своими делами. Общее количество персонала в больнице по-прежнему велико, общее количество параметров может достигать сотен миллиардов, триллионов, но каждый раз действительно задействуется лишь очень небольшая часть.

DeepSeek в V3 продвинул этот подход до довольно агрессивного масштаба, а в эпоху V4 он стал еще более экстремальным — V4-Pro имеет 1,6 триллиона общих параметров, 49 миллиардов активированных параметров; V4-Flash — 284 миллиарда общих параметров, 13 миллиардов активированных параметров. То есть «общее тело» модели продолжает увеличиваться, но часть, которая действительно работает на каждом шаге, по-прежнему сжата до очень небольшого объема.

Но настоящая изюминка второй операции не только в «задействовании меньшего количества врачей». Она заодно преобразует способ, которым модель получает доступ к этому «телу».

Здесь можно представить более подходящую картину. Раньше большая модель была похожа на огромную, но совершенно беспорядочную кладовку: все свалено в кучу, каждый раз, даже если нужно взять только одну вещь, приходится открывать дверь и начинать с самого низа, перебирая все, чтобы найти нужное. Чтобы этот поиск был достаточно быстрым для наплыва клиентов, приходилось размещать всю кладовку в самых дорогих «помещениях в центре города» — то есть в высокоскоростной видеопамяти.

DeepSeek превращает эту кладовку в шкаф с десятками тысяч пронумерованных ячеек. Нужно взять какую-то вещь — просто потяните за соответствующую пронумерованную ячейку, не трогая остальные. Это означает, что вам больше не нужно держать все вещи в самом дорогом помещении. Подавляющее большинство временно неиспользуемых ячеек完全可以 поместить в гораздо более дешевую обычную оперативную память (LPDDR) или даже в еще более дешевые твердотельные накопители, и при необходимости быстро извлечь именно эту ячейку. Экосистема DeepSeek и такие системы инференса с открытым исходным кодом, как SGLang, продолжают исследовать эту разгрузку и потоковую загрузку.

На этом этапе становится видна синергия первых двух операций: первая операция сжимает «память», вторая операция нумерует «тело», извлекая только нужную ячейку. Вместе эти две операции сводят к минимуму ту часть машины, которая в любой момент времени действительно нуждается в занятии самой дорогой видеопамяти.

Третья операция доводит логику «использования по номеру» до предела: даже действие «вычисления» экономится, где возможно. Некоторые результаты вычислений можно заранее рассчитать и сохранить как пронумерованные ячейки, извлекая их при использовании напрямую, вместо того чтобы пересчитывать каждый раз. Это как человек, который выучил таблицу умножения, не станет каждый раз пересчитывать на пальцах семь умножить на восемь, а сразу скажет «пятьдесят шесть». Это равносильно замене чрезвычайно дорогого «жесткого вычисления» (вычисления на чипе) чрезвычайно дешевым «извлечением» (чтением из памяти).

В V4 эта операция получила более прямое коммерческое выражение: цена за попадание в кэш была резко снижена, повторное использование длинного контекста было напрямую заложено в систему ценообразования — повторные вычисления не только технически можно сэкономить, но и коммерчески поощряется их экономить.

Рассматривая все три операции вместе, видно, что это не три изолированных действия, а последовательное развитие одной и той же логики: преобразование хаотичного беспорядка, который необходимо перерывать, в систему, где все можно точно извлекать по номеру. Память сжата до минимума, тело пробуждает только то, что нужно, вычисления по возможности заменяются поиском по таблице. Каждая операция делает использование машиной самого дорогого оборудования чуть меньше, а вместе все три операции позволяют ей выполнять ту же работу, потребляя лишь крохи самых передовых аппаратных средств по сравнению с прошлым.

Насколько дешево

В мае 2026 года DeepSeek объявил о переводе скидки в 75% на V4-Pro в постоянную цену, создав огромную разницу в ценах на попадание в кэш, промах кэша и выходные токены. Цена за попадание в кэш важна, потому что она превращает третью операцию DeepSeek прямо в коммерческое правило: вычисленный контекст не должен снова и снова оплачиваться как «новая работа».

Только при сравнении с реальными счетами становится ясен конкретный разрыв. Рассмотрим приложение среднего масштаба, обрабатывающее 10 миллиардов токенов в месяц, при одинаковом объеме работы: использование DeepSeek V4-Pro — счет около 522 долларов в месяц; использование Claude Opus 4.7 — около 9000 долларов; использование GPT-5.5 — около 10 000 долларов. Разница в семнадцать-девятнадцать раз.

Рассмотрим еще один экстремальный, но распространенный сценарий: помощник по программированию с длинным контекстом, который сто раз перечитывает кодобазу объемом 100 000 токенов. Благодаря практически бесплатному попаданию в кэш, DeepSeek на эту работу тратит всего около 0,036 доллара; та же работа на GPT-5.5 и Claude Opus 4.7 обойдется примерно в 5 долларов — разница более чем в сто раз.

Эта цена чрезвычайно низкая, но это не убыточная акция для привлечения внимания, а результат того, что эта модифицированная машина изначально работает настолько экономично — это стоимость, которую китайцы по крупицам выжимали инженерными методами. Два года назад Лян Вэньфэн, говоря о ценообразовании, заявил, что принцип — «не субсидировать, но и не получать сверхприбыль». На самом деле, следует понимать так: когда ваша структура затрат принципиально отличается от других, ваше ценообразование естественным образом находится в другом диапазоне.

Конечно, эта модификация не гарантирует прибыль. Например, перенос нагрузки на более дешевую память и жесткие диски, как отмечается в некоторых исследованиях, может привести к потерям в энергопотреблении, задержках и сложности планирования. В некоторых случаях общая системная стоимость генерации каждого символа может быть не ниже, если только аппаратное обеспечение, программный стек и носители данных не будут дополнительно оптимизированы. Поэтому эти три операции — это очень сложный баланс, а не бездумная экономия. Но направление определено: использовать дешевые, более доступные для себя ресурсы для замены самого дорогого, наиболее уязвимого ресурса.

Превратить «один триллион» в осязаемый расчет

После стольких разговоров об «экономии», давайте представим ее более наглядно: сколько интеллектуальных вычислительных центров можно не строить?

Сначала посмотрим на поток токенов. По данным на государственном уровне, к марту 2026 года среднесуточный объем вызовов токенов в Китае уже превысил 140 триллионов, что более чем в тысячу раз превышает показатель начала 2024 года. На отраслевом уровне, только для одной большой модели Doubao, в том же месяце среднесуточное использование также превысило 120 триллионов. Хотя границы статистики различаются, они указывают на одно: потребление токенов в Китае уже вышло на ежедневный уровень в сотни триллионов и быстро движется к уровню в тысячи триллионов. Таким образом, 500 триллионов токенов в день можно рассматривать как следующую ближайшую веху; а 5000 триллионов токенов в день — это сценарий высокого трафика после широкого внедрения агентов, мультимодальности, генерации кода.

На этом фоне становится очевидной ценность DeepSeek, если взглянуть на стоимость вычислительных центров. В 2025 году China Unicom начала строительство в Ухане центра интеллектуальных вычислений для инференса на тысячу карт, первоначальные инвестиции составили почти 200 миллионов юаней. Мы можем приблизительно рассматривать это как пример инвестиций в центр инференса уровня тысячи карт: один такой центр стоит около 200 миллионов юаней.

А если рассчитать по повышению эффективности DeepSeek V4, то, по крайней мере, в сценариях с длинным контекстом, которые он хорошо обрабатывает, изменения составляют не оптимизацию на несколько десятков процентов, а увеличение аппаратной эффективности в несколько раз. Мы возьмем не самый агрессивный показатель, а более консервативное, легче понимаемое предположение: три ключевых направления V4 повышают эффективную пропускную способность токенов на том же оборудовании в 4 раза. То есть работу, которую раньше выполняли 4 центра, теперь, возможно, сможет выполнить 1, тем самым экономя 3 эквивалентных центра, что равно экономии 75% эквивалентных инвестиций в оборудование.

Обратите внимание, DeepSeek не просто использует меньше памяти. Как раз наоборот, он разумно использует память — с помощью сжатого внимания, активации по требованию, попадания в кэш и планирования инференса он более интенсивно использует самое дорогое время GPU и видеопамяти. То, что реально экономят, — это то дополнительное оборудование, которое пришлось бы покупать для той же пропускной способности токенов.

Так чему же соответствует один триллион долларов? 1 триллион долларов примерно равен 7 триллионам юаней. При стоимости одного центра инференса уровня тысячи карт в 200 миллионов юаней, 7 триллионов юаней эквивалентны 35 тысячам таких центров. Если подход V4 дает 4-кратное повышение эффективной пропускной способности, то чтобы не строить 35 тысяч таких эквивалентных центров, соответствующий среднесуточный поток токенов составит примерно 5000 триллионов.

Вот отраслевая картина, соответствующая «одному триллиону долларов», упомянутому в этой статье. Это не точный расчет в технической смете, а расчет масштаба инфраструктуры, соответствующий также сценарию трафика на ближайшие несколько лет, а не уже реализованному сейчас. Что он действительно показывает: в эпоху низкого трафика вызовов повышение эффективности экономит несколько карт, несколько серверных шкафов; в эпоху тысяч триллионов токенов в день повышение эффективности экономит десятки тысяч интеллектуальных вычислительных центров, которые должны были быть построены.

Таким образом, DeepSeek на самом деле меняет не цену отдельного вызова, а бухгалтерскую книгу будущей AI-инфраструктуры.

Он меняет опасный тренд

Теперь вернемся к той машине в начале. Помните? Из 7,8 миллионов долларов за Vera Rubin 2 миллиона приходится на память, и эта часть продолжает бешено дорожать. Это показывает опасную тенденцию — стоимость всей отрасли все больше и больше, нездоровым образом, привязывается к чипам памяти. А память не должна быть такой дорогой.

Многие ошибочно полагают, что DeepSeek «подчиняется» этой тенденции, потому что он тоже активно использует память. Как раз наоборот, DeepSeek меняет ее. Старый метод — пассивно, неэффективно поглощать аппаратное обеспечение, концентрируя стоимость на чипах в перевернутом виде, позволяя памяти двигаться по волне роста цен; DeepSeek сначала тремя операциями резко снижает реальный спрос на аппаратное обеспечение, а затем оставшийся небольшой спрос разумно распределяет по самым дешевым, наиболее подходящим уровням хранения. Первое — это «движение под давлением цены», второе — «сначала разобраться в расчетах, а потом решить, на что тратить».

Это различие особенно важно для Китая. Потому что оно переносит поле боя из места, где мы находимся в невыгодном положении, туда, где у нас больше шансов на победу. Самые передовые вычислительные чипы — мы пока не можем догнать. Но такие чипы памяти, как DRAM, как раз и есть те способности, которые Китай реально нарастил в этом году.

Лидер китайского производства DRAM, ChangXin Memory Technologies (CXMT), в первом квартале 2026 года достиг выручки в 50,8 миллиардов юаней, чистая прибыль составила около 25 миллиардов юаней, компания ожидает, что чистая прибыль за первое полугодие достигнет от 66 до 75 миллиардов юаней, что эквивалентно полугодовой прибыли ByteDance за прошлый год. Хотя CXMT на глобальном рынке DRAM все еще занимает лишь четвертое место, эти отечественные производственные мощности, которых раньше практически не было, наконец-то встали на ноги в этом году.

И в этом заключается стратегическое значение трех операций DeepSeek. Это не «замена вычислений памятью», а снижение маржинальной зависимости от самых дефицитных вычислительных мощностей и перенос части давления на более доступные накопители, кэш и системную инженерию. Когда AI-машина больше полагается на память, кэш, планирование и системную инженерию — звенья, которые у нас самих больше шансов освоить, — существующие цепочки поставок Китая внезапно превращаются из «повсюду ограниченных» в «достаточные» и даже «удобные». Это значительно повышает безопасность всей цепочки.

Заключение

Лян Вэньфэн, для которого «искоренение неэффективности» — инстинкт, не удовлетворится тем, чтобы сделать какую-то модель чуть дешевле. Он нацелился на самую большую неэффективность во всей AI-индустрии — предпосылку, которую вся отрасль принимает как должное: «чтобы получить более мощный интеллект, необходимо полагаться на самые передовые, самые дефицитные, самые дорогие аппаратные средства».

Если он сможет заставить всю отрасль делать то же самое с гораздо меньшим количеством передового оборудования, то то, что он сэкономит для отрасли, — это виртуальная производственная база триллионного масштаба, не занимающая ни сантиметра площади заводов, но реально высвобождающая огромные инвестиции, которые должны были быть вложены в оборудование. И этот «один триллион» перестает быть историей про оценку, а становится расчетом инфраструктуры.

Представлять DeepSeek как «алгоритм, уничтожающий NVIDIA» — это другая дешевая сказка. Но если задать вопрос иначе, ответ становится интересным: может ли DeepSeek заставить отрасль покупать меньше самых дорогих аппаратных средств, занимать меньше самых дефицитных видеопамятей, платить меньше части стоимости инференса, которая ранее считалась само собой разумеющейся? Да. Может ли он перераспределить стоимость AI-инфраструктуры от единственного нарратива о высокопроизводительных GPU к архитектуре модели, системе инференса, управлению кэшем, планированию хранения и инженерной оптимизации? Тоже да. В этом и заключается его настоящая отраслевая значимость.

Настоящая технологическая революция часто заключается не в том, чтобы сделать все дороже, а в том, чтобы превратить то, что раньше было доступно лишь немногим, во вновь доступную ежедневную инфраструктуру для большинства. В более широком измерении, в этой игре действительно важно никогда не то, сколько денег сэкономили, а то, что сама экономия незаметно перераспределяет билеты в будущее среди тысяч отраслей и предприятий Китая, нуждающихся в возможностях AI.

(Эта статья основана на открытых материалах и отраслевых обсуждениях. Некоторые прогнозные суждения в статье, такие как инфраструктурная ценность замены в триллионном масштабе, компромиссы в эффективности оборудования, расчеты эквивалентной стоимости и т.д., являются точками зрения в рамках отраслевой экстраполяции и дискуссий, а не установившимися фактами. Просим читателей относиться к ним с осторожностью.)

Статья из официального аккаунта WeChat «胡说成理», автор: Ху Чжэ.

Трендовые криптовалюты

Связанные с этим вопросы

QКакой технологический подход DeepSeek позволяет резко снизить нагрузку на память (KV Cache) при обработке длинного контекста?

AГлубокое сжатие «памяти» (KV Cache) достигается за счёт модификации механизма внимания (Attention). Вместо хранения всех промежуточных результатов DeepSeek использует метод многофакторного латентного внимания (MLA, Multi-head Latent Attention). Этот подход применяет низкоранговое сжатие к «памяти» модели, сохраняя не исходные детали, а их компактное проекционное представление, которое затем точно восстанавливается при необходимости. Например, в DeepSeek-V2 это позволило сократить объём KV Cache на 93,3%, практически без потери качества модели.

QКак три ключевых технических приёма DeepSeek (три «удара») совместно работают для повышения эффективности оборудования?

AТри приёма действуют последовательно и синергетически, снижая зависимость от самого дорогого оборудования — GPU с высокой пропускной способностью памяти (HBM). 1) Сжатие внимания (MLA) минимизирует объём «памяти» (KV Cache). 2) Архитектура смешанных экспертов (MoE) и пономерная адресация параметров позволяют активировать в HBM только небольшую часть «тела» модели (параметров) в каждый момент времени. 3) Повторное использование кэша (вычисленных результатов) заменяет дорогие вычисления дешёвым извлечением из памяти. Вместе они позволяют той же аппаратуре генерировать в 4 раза больше токенов, что эквивалентно экономии 75% капитальных затрат на оборудование.

QНа какую конкретную сумму, по мнению автора, DeepSeek потенциально может сэкономить Китаю инвестиции в AI-инфраструктуру и как эта цифра получена?

AАвтор предполагает потенциальную экономию в размере около 1 триллиона долларов США. Эта оценка основана на экстраполяции. Отправная точка — прогноз McKinsey о том, что к 2030 году глобальные инвестиции в оборудование для AI-нагрузок составят около 5,2 трлн долларов. Основной тезис DeepSeek — повышение эффективности оборудования в 4 раза (за счёт трёх описанных приёмов). Если Китай будет генерировать тысячи триллионов токенов в день (сценарий высокой нагрузки), то для достижения той же пропускной способности потребуется на 75% меньше эквивалентного оборудования. Экономия в 1 трлн долларов (примерно 7 трлн юаней) эквивалентна отказу от строительства 3,5 тысяч центров обработки данных уровня «тысяча GPU», исходя из примерной стоимости одного такого центра в 200 млн юаней.

QВ чём, согласно статье, заключается стратегическая важность подхода DeepSeek для технологической безопасности Китая?

AПодход DeepSeek перемещает точку конкурентного преимущества и зависимости с поля, где Китай отстаёт (передовые GPU), на поле, где он усиливает свои позиции. Вместо пассивного потребления всё большего количества самых дорогих и дефицитных чипов (GPU и HBM), DeepSeek резко снижает потребность в них на единицу полезной работы (токен). Оставшуюся потребность в ресурсах можно более гибко удовлетворять за счёт более доступных компонентов, таких как оперативная память (DRAM), кэш и инженерная оптимизация программно-аппаратного стека. Поскольку производство DRAM в Китае быстро развивается (например, компания CXMT), такая стратегия снижает зависимость от иностранных поставок критических компонентов и повышает устойчивость всей цепочки создания стоимости AI в Китае.

QКак коммерческая политика ценообразования DeepSeek отражает её технические инновации?

AЦеновая политика DeepSeek напрямую закрепляет технические преимущества, особенно третий приём — повторное использование кэша. DeepSeek ввела резко дифференцированные тарифы: крайне низкая цена за токен при попадании в кэш (cache hit) и стандартная цена при промахе (cache miss). Например, для задачи, требующей 100 повторных прочтений контекста в 100 тыс. токенов, стоимость использования DeepSeek может быть в 100 раз ниже, чем у конкурентов (0,036 доллара против ~5 долларов). Это не просто маркетинговая скидка, а отражение реальной низкой стоимости обработки, достигнутой за счёт избегания повторных вычислений. Таким образом, цена стимулирует клиентов использовать модели эффективно и напрямую демонстрирует фундаментально иную структуру издержек компании.

Похожее

Как распознать криптомошенничество или rug pull?

Представьте, что вы нашли многообещающий новый токен с тысячами держателей, растущей ценой и активным сообществом. Все выглядит легитимно, пока ликвидность внезапно не исчезает. Так начинается «скам» (rug pull). Разработчики сначала создают видимость надежности через заблокированную ликвидность и отказ от прав на контракт. Затем они раскручивают токен в соцсетях и нагнетают ажиотаж. Чем сильнее сообщество, тем легче привлечь новый капитал. Весь процесс от раскрутки до вывода средств часто занимает 48-72 часа. «Жесткие» скамы мгновенно выводят ликвидность, а «мягкие» постепенно снижают стоимость через продажи инсайдеров или отказ от развития проекта. Ключевые признаки скама: 1. **Высокая концентрация токенов:** если 5-10 кошельков контролируют более 30% предложения. 2. **Подозрительный смарт-контракт:** неверифицированный код, скрытые функции (например, для дополнительной эмиссии), возможность обновления контракта разработчиком. 3. **Рыночное поведение:** быстрый рост цены на основе рекламы от инфлюенсеров, низкий органический объем торгов, снижение числа новых держателей перед крупными переводами с кошельков разработчиков. Основные виды мошеннических схем: * **Ловушки (Honeypots):** Позволяют покупать, но блокируют или ограничивают продажу (98 442 случая). * **Скрытая эмиссия (Hidden mint):** Позволяет разработчикам напечатать новые токены после запуска, размывая доли держателей (60 985 случаев). * **Фальшивый отказ от прав (Fake ownership renunciation):** Заявления о децентрализации ложны, контроль сохранен (48 974 случая). Вывод: чтобы избежать скама, важно анализировать не только цену, но и сходимость нескольких факторов: структуру владения токенами, код смарт-контракта и модели торговли. Прозрачные условия вестинга, верифицированный код и независимый аудит значительно снижают риски.

ambcrypto39 мин. назад

Как распознать криптомошенничество или rug pull?

ambcrypto39 мин. назад

Открытый интерес по XRP достигает $2,6 млрд на фоне роста спроса на деривативы

Открытый интерес по фьючерсам XRP достиг 2,6 млрд долларов, что означает рост более чем на 10% за 24 часа, согласно данным CoinGlass. Это ставит XRP на четвертое место среди крупнейших криптоактивов по данному показателю. Рост открытого интереса свидетельствует об увеличении активности на деривативном рынке, но не указывает однозначно на бычьи или медвежьи настроения, а также не подтверждает рост спроса на спотовом рынке. Активность может быть вызвана долгосрочными или короткими позициями, хеджированием или спекуляциями. Ключевым вопросом является то, поддержит ли этот рост открытого интереса более сильное движение цены или создаст дополнительные риски волатильности. Для подтверждения устойчивости тренда необходимы сопутствующие сигналы, такие как рост объемов спотовой торговли и устойчивость ключевых ценовых уровней. В противном случае высокий уровень открытого интереса может привести к усилению давления при ликвидации позиций.

bitcoinist1 ч. назад

Открытый интерес по XRP достигает $2,6 млрд на фоне роста спроса на деривативы

bitcoinist1 ч. назад

Прогноз цены Биткоина на 2030 год: вот что нужно знать о следующем бычьем рынке

Недавний анализ AMBCrypto указывает на трудности майнеров Bitcoin (BTC), что соответствует условиям исторических медвежьих рынков. Снижение цены BTC наблюдается после падения 10 октября 2025 года, и точное дно рынка пока не определено. Ключевым фактором для разворота тренда станут чистые притоки стейблкоинов на биржи, которые выступают "топливом" для бычьего рынка. В настоящее время этот показатель отрицателен. Основатель Alphractal, Жоао Ведсон, на основе анализа исторических паттернов предполагает, что дно цикла в районе $41,5–45 тыс. может быть достигнуто в первой половине октября 2026 года. Что касается прогноза цены Bitcoin к 2030 году, технический анализ с использованием уровней Фибоначчи предлагает возможный сценарий. После потенциальной коррекции до области около $39,1 тыс. (близко к целевой зоне Ведсона) возможно возобновление долгосрочного восходящего тренда. Этот тренд может преодолеть уровень расширения Фибоначчи 61.8% на отметке $152,3 тыс. Итоговый пик следующего цикла, согласно такому анализу, может достигнуть $200–220 тыс. к 2030 году, после чего Bitcoin, вероятно, снова вступит в медвежью фазу. Отмечается, что текущий рыночный цикл может оказаться длиннее предыдущих. **Краткий итог:** * По фрактальному анализу, дно рынка Bitcoin возможно в октябре 2026 года. * Для роста к целям в $200+ тыс. к 2030 году необходимы значительные притоки стейблкоинов на биржи.

ambcrypto2 ч. назад

Прогноз цены Биткоина на 2030 год: вот что нужно знать о следующем бычьем рынке

ambcrypto2 ч. назад

Рыночный пульс BTC: 30-я неделя

После восстановления с уровня ниже 58 000 долларов и тестирования 65 000 долларов, биткоин перешёл в фазу консолидации около 64 500 долларов. Восходящий импульс ослаб, объёмы спот-торгов остаются низкими. Волатильность снизилась, что указывает на уменьшение премии за риск на деривативных рынках. Спекулятивный аппетит постепенно возвращается: открытый интерес на фьючерсах и опционах вырос, поток на перпетуальных контрактах сместился к чистым покупкам, а спрос на защиту от падения ослаб. Восстановление происходит осторожно, без агрессивного использования кредитного плеча. Активность в блокчейне стабилизируется. Институциональное давление на продажу ослабевает, о чём свидетельствуют улучшившиеся потоки спот-ETF в США и приближение средних цен покупки ETF к точке безубыточности. Рынок выглядит более сбалансированным: долгосрочные инвесторы обеспечивают поддержку, а спекулятивная активность остаётся сдержанной. Тем не менее, растущая доля краткосрочного капитала, чувствительного к цене, повышает вероятность резких всплесков волатильности, делая рынок устойчивым, но более восприимчивым к сдвигам в импульсе и давлению со стороны продавцов.

insights.glassnode4 ч. назад

Рыночный пульс BTC: 30-я неделя

insights.glassnode4 ч. назад

Спрос на спотовом рынке биткойна ослабевает, несмотря на приток средств в ETF, так как новый капитал не решается зайти

Несмотря на положительный приток средств в биткоин-ETF с 14 июля, этого оказалось недостаточно для уверенного преодоления ключевой зоны сопротивления в районе $65 тыс. Аналитики отмечают, что спрос на спотовом рынке BTC ослабевает, а метрика новых инвесторов остаётся около годовых минимумов, сигнализируя об отсутствии значительного притока свежего капитала. Хотя активное закрытие коротких позиций на деривативном рынке и снижение давления на продажу со стороны краткосрочных держателей помогли стабилизировать цену, показатель средней прибыльности краткосрочных инвесторов (STH SOPR) остаётся ниже 1.0. Это означает, что рынок ещё не перешёл в устойчивое бычье состояние, а текущая ситуация скорее указывает на паузу и консолидацию, чем на начало полномасштабного разворота вверх.

ambcrypto5 ч. назад

Спрос на спотовом рынке биткойна ослабевает, несмотря на приток средств в ETF, так как новый капитал не решается зайти

ambcrypto5 ч. назад

Торговля

Спот

Популярные статьи

Как купить ONE

Добро пожаловать на HTX.com! Мы сделали приобретение Harmony (ONE) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки Harmony (ONE).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение Harmony (ONE)После приобретения вами Harmony (ONE) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля Harmony (ONE)С легкостью торгуйте Harmony (ONE) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

844 просмотров всегоОпубликовано 2024.04.12Обновлено 2026.06.02

Как купить ONE

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на ONE (ONE) представлены ниже.

活动图片