Может ли DeepSeek сэкономить Китаю 1 триллион долларов?

marsbitОпубликовано 2026-06-03Обновлено 2026-06-03

Введение

Статья анализирует, как DeepSeek может радикально снизить затраты на инфраструктуру искусственного интеллекта в Китае за счет повышения эффективности оборудования, а не за счет снижения цен на чипы. Основная проблема современного ИИ — высокая зависимость от дорогих и дефицитных компонентов, особенно памяти HBM. В статье на примере будущей платформы Nvidia Vera Rubin (стоимостью около $7,8 млн) показано, как быстро растут расходы на память. DeepSeek атакует эту проблему с помощью трех ключевых технологий в своей модели V4: 1. **Сжатие «памяти» (контекста):** Технология Multi-head Latent Attention (MLA) кардинально сокращает объем кэша KV, необходимого для длинных контекстов, без потери качества, что высвобождает дорогую память HBM. 2. **Эффективное использование «тела» модели:** Применяя архитектуру Mixture of Experts (MoE) и интеллектуальное распределение параметров, модель активирует только небольшую часть своих «экспертов» для каждой задачи, уменьшая нагрузку на высокоскоростную память. 3. **Повторное использование вычислений:** Система кэширования позволяет повторно использовать ранее вычисленные результаты (например, при многократном чтении одного документа), заменяя дорогие вычисления дешевым чтением из памяти. В совокупности эти инновации позволяют, согласно автору, увеличить эффективную пропускную способность (производство токенов) на одном аппаратном обеспечении в 4 раза. Это эквивалентно экономии 75% капитальных затрат на оборудование для достижения того же уров...

Во второй половине 2026 года NVIDIA поставит свою самую мощную на сегодняшний день AI-платформу: Vera Rubin VR200 NVL72. В одном целевом серверном шкафу размещены 72 GPU Rubin и 36 CPU Vera. По оценкам Morgan Stanley, себестоимость материалов этой машины составляет около 7,8 миллиона долларов США.

Эта цифра и так пугающая. Но более важное, за чем стоит следить, — это то, куда уходят эти деньги.

Из этих 7,8 миллионов около 2 миллионов долларов потрачены не на знаменитые GPU-чипы и не на вычислительные ядра, а на память — высокоскоростную видеопамять (HBM4) и обычную оперативную память (LPDDR5X). Всего за год стоимость этой части памяти взлетела на 435% из-за роста цен.

Это сигнал. В этой все дорожающей AI-машине деньги массово перетекают от «компонентов, отвечающих за вычисления» к «компонентам, отвечающим за память и хранение».

Запомните этот сигнал. Потому что эта статья рассказывает о DeepSeek, который делает как раз обратное: всех подгоняет время, заставляя платить аппаратную наценку за AI из-за все более дорогой памяти. А он ищет способ, не ослабляя конкурентоспособности, с помощью интеграции программного и аппаратного обеспечения повысить токен-продуктивность этих дорогих аппаратных средств более чем в 4 раза, что эквивалентно экономии 75% инвестиций в железо.

И в конце этого пути в последнее время активно обсуждается одна гипотеза — может ли DeepSeek своими усилиями сэкономить Китаю на инфраструктурном строительстве искусственного интеллекта триллион долларов?

Неужели это возможно?

Триллион долларов экономят

Тот прайс-лист от NVIDIA — это самая весомая цифра в последних бухгалтерских книгах AI-инфраструктуры. В текущей ситуации спроса и предложения, если вы хотите купить самую передовую AI-машину, вы должны принять этот счет.

DeepSeek не может изменить это.

Он меняет другое: на одной и той же машине, на тех же самых дорогих аппаратных средствах хранения стоимостью 2 миллиона долларов, сколько именно токенов может быть произведено.

После выпуска DeepSeek V4 этот вопрос стал особенно конкретным.

На что стоит обратить внимание в V4 — это не только сама модель, но и три ключевых направления, которые она демонстрирует: Во-первых, продолжать сжимать «память», чтобы длинный контекст больше не перегружал видеопамять; во-вторых, пробуждать «тело» по требованию, чтобы огромной модели-эксперту не приходилось каждый раз задействовать все ресурсы; в-третьих, превращать повторные вычисления в переиспользуемый актив, чтобы вычисленный контекст не сжигал деньги снова и снова.

Часть характеристик этих технологий демонстрирует яркую особенность — они сделали акцент на совместной работе программного и аппаратного обеспечения, а не на чисто программной оптимизации. Поэтому некоторые шутливо сравнивают — возможно, DeepSeek станет крупнейшей в Китае компанией по производству аппаратного обеспечения для AI.

Страница модели показывает, что в сценарии с контекстом в 1 миллион токенов V4-Pro по сравнению с предыдущим поколением требует только 27% вычислительных ресурсов на один токен при инференсе и 10% занимаемого кэша. В этой статье мы возьмем приблизительно четверть вычислительной мощности для последующих расчетов.

При традиционном подходе это оборудование могло поддерживать только одну единицу пропускной способности, а благодаря сжатию длинного контекста, активации по требованию, повторному использованию кэша и планированию инференса DeepSeek позволяет эффективную выработку токенов на том же оборудовании увеличить в четыре раза — таким образом, стоимость не «срезается», а распределяется. Раньше работу, которую делали 4 машины, теперь, возможно, сможет выполнить одна; раньше генерация каждого токена полностью «съедала» стоимость дорогого оборудования, теперь ту же стоимость оборудования можно распределить на 4 токена.

В этом и заключается настоящая сила DeepSeek: он не изменил прайс-лист NVIDIA, но изменил производительность машин NVIDIA в бухгалтерской книге AI. Значение этого события намного превышает разовое снижение цен на API.

И масштаб в 1 триллион долларов тоже не взят с потолка.

Отчет McKinsey 2026 года «Стоимость вычислений» дает конкретную цифру: к 2030 году глобальным центрам обработки данных для удовлетворения спроса на вычислительные мощности потребуются инвестиции в размере около 6,7 триллионов долларов, из которых часть, предназначенная специально для обработки AI-нагрузок, съест около 5,2 триллиона долларов.

Другими словами, в ближайшие несколько лет деньги, которые человечество планирует вложить в AI-аппаратное обеспечение, измеряются триллионами долларов.

И значительная часть этих огромных средств уйдет на самые передовые и дефицитные аппаратные средства — то есть на высокоскоростную видеопамять HBM и оперативную память LPDDR. То, что делает DeepSeek, — это систематическое снижение зависимости всей китайской индустрии AI от этой части дорогого оборудования. Даже если снизить зависимость лишь частично, он сэкономит для отрасли астрономическую сумму триллионного масштаба.

Когда ежедневное потребление токенов в Китае с сегодняшних ста с лишним триллионов продолжит расти до сотен, тысяч триллионов, любое снижение стоимости единичного токена будет умножено на огромную разницу в инфраструктурных затратах. Если действительно ту же пропускную способность можно обеспечить с помощью четверти оборудования, то в обозримом будущем это может позволить сэкономить Китаю на инфраструктурных инвестициях в вычислительные мощности для AI почти 1 триллион долларов.

Это инфраструктурный расчет: кто может заставить те же жесткие затраты на оборудование производить больше токенов, тот строит меньше дата-центров, покупает меньше GPU, накапливает меньше видеопамяти, тот перераспределяет билеты в будущее AI.

Так как же DeepSeek этого добился? Ответ: он провел три операции над этой машиной большой модели.

Два прожорливых пожирателя

Распространенное заблуждение: самое дорогое в большой модели — это «мышление», вычисления. На самом деле нет.

Ее настоящие два прожорливых пожирателя — это «память» и «тело». И они сжигают одно и то же самое дорогое топливо — высокоскоростную видеопамять (HBM), память, напрямую интегрированную в систему GPU, чрезвычайно быструю и дорогую.

Сначала о памяти. При генерации текста у больших моделей есть неуклюжая особенность: чтобы выдать каждое новое слово, ей нужно оглянуться назад и перечитать все предыдущее содержание. Потому что смысл языка строится слоями, то, что следует сказать дальше, полностью зависит от того, какой контекст уже создан ранее.

Это похоже на синхронного переводчика. Он не может начать говорить, основываясь только на вашем последнем предложении, а должен постоянно держать в уме все, что вы сказали ранее — только помня эти предпосылки, он может понять истинное значение текущей фразы. Чем дольше вы говорите, тем больше ему нужно запоминать.

Чтобы не пересчитывать все с нуля на каждом слове (это было бы слишком медленно), модель временно сохраняет уже вычисленные промежуточные результаты. Этот архив называется кэшем ключ-значение (Key-Value Cache, можно понимать как кратковременную память модели).

Проблема в том, что он безумно разрастается по мере увеличения диалога.

Приведем конкретную цифру: по оценкам для одной из стандартных архитектур, обработка контекста объемом примерно в сто двадцать тысяч слов может «съесть» 488 ГБ высокоскоростной видеопамяти только на эту память. А у топового GPU Rubin от NVIDIA, который скоро будет поставлен, объем видеопамяти на карту составляет 288 ГБ. То есть, только для хранения этой «памяти» потребуется заполнить почти полтора, а то и接近 два самых передовых GPU — и модель еще даже не начала реальную работу.

Теперь о «теле». «Тело» модели — это ее весовые параметры, грубо говоря, носитель всех ее знаний и способностей. Чем сильнее способности, тем обычно массивнее тело, достигающее сотен миллиардов, триллионов параметров.

У традиционных плотных моделей (Dense Model, где для обработки любого ввода требуется задействовать все параметры) есть недостаток: что бы вы у нее ни спросили, она должна задействовать все тело. Это как если бы вы пришли в больницу только с зубной болью, а всех врачей всех отделений вызвали бы к вам, чтобы они обследовали вас с головы до ног, и только потом дошла бы очередь до стоматолога. Абсурдно, но счет выставляется полностью.

Это массивное тело также должно постоянно находиться в дорогой высокоскоростной видеопамяти, готовое к работе.

Память и тело, эти два прожорливых пожирателя, заставляют распределение стоимости всей аппаратной системы жестко зависеть от самой дорогой, самой дефицитной, наиболее зависимой от других аппаратных средств. И за последнее десятилетие отраслевой подход был простым и грубым: не хватает вычислительной мощности — добавляем, не хватает видеопамяти — добавляем еще. Таким образом, богатство индустрии в высокой степени концентрировалось на этой самой передовой аппаратной цепочке, самая жирная прибыль застревала в самом дефицитном звене.

Цена токена была взята в заложники дефицитностью одного вида аппаратного обеспечения. А три операции DeepSeek как раз ослабляют эти оковы.

Первая операция: Операция на мозге

Первая операция — на «памяти». И место, где он наносит удар, как раз самое неподходящее или самое страшное для прикосновения — механизм внимания (Attention, ключевой механизм, который большая модель использует для понимания связей в контексте).

Механизм внимания — это мозг большой модели. Его способность понимать контекст, улавливать ключевые моменты в длинном диалоге полностью зависит от этого механизма, который постоянно взвешивает связи между каждым словом. Та дорогая память, о которой шла речь ранее, как раз и есть продукт каждого импульса этого мозга.

Хочется сэкономить на памяти, но боятся риска, поэтому почти все предпочитают обходить этот мозг стороной, действуя только на периферии. От множественного запросного внимания (MQA), предложенного в 2019 году одним из авторов Transformer Noam Shazeer, до группового запросного внимания (GQA), предложенного Google в 2023 году и широко используемого в Llama и других моделях, основная идея основного направления всегда заключалась в том, чтобы «заставить несколько голов запросов использовать одну и ту же память» — по сути, «запоминать меньше, использовать как есть». Эффект экономии места поразителен, но цена — снижение качества модели. Проще говоря, консенсус этого направления всегда заключался в «компромиссе»: по умолчанию сжатие неизбежно вредит качеству, идет торг лишь о степени ущерба.

DeepSeek не идет на компромисс. Он выбирает прямую операцию на мозге, преобразуя сам механизм внимания.

Его решение называется многоголовым латентным вниманием (MLA, Multi-head Latent Attention), впервые появившимся в DeepSeek-V2 в 2024 году. Приведу аналогию: другие модели делают заметки, дословно переписывая каждую деталь, заполняя несколько толстых тетрадей; MLA сначала сводит заметки к высококонцентрированному резюме, сохраняет только резюме, а при использовании точно восстанавливает детали на основе резюме. В терминологии это называется «низкоранговым сжатием» — проецирование тех, казалось бы, сложных, но на самом деле высокоизбыточных воспоминаний в гораздо более компактное пространство для хранения.

Насколько эффект поразителен? Результаты, представленные в статье DeepSeek-V2, показывают, что по сравнению с предыдущей моделью того же семейства, V2 при более высокой способности снизила стоимость обучения на 42,5%, уменьшила KV Cache на 93,3%, а максимальную пропускную способность генерации увеличила в 5,76 раза. В том примере, который «съедал» 488 ГБ, при таком подходе можно сжать до нескольких гигабайт.

Но по-настоящему круто не то, сколько сэкономили, а то, что за это почти не пришлось платить потерей деталей.

По логике, сжав книгу до одной страницы резюме, как бы ты ни восстанавливал, не вернешь все детали. Но в экспериментах, опубликованных DeepSeek, эта сжатая память не только не уступала по эффективности стандартному вниманию «дословного переписывания всей книги», но в некоторых случаях даже была немного лучше.

В V4 этот подход был продвинут еще дальше в экстремальные сценарии длинного контекста: V4-Pro использует гибридную архитектуру внимания, в условиях контекста в 1 миллион токенов требует только 27% вычислительных ресурсов для инференса и 10% занимаемого кэша по сравнению с предыдущим поколением.

Чтобы понять, насколько это сложно, нужно знать, что это операция на самолете в полете. Изменение механизма внимания означает переписывание самой базовой вычислительной логики модели, переобучение всей модели, переделку всей сервисной системы, которая ее поддерживает. Ошибка на любом этапе — и интеллект рушится. Это не замена ниппеля на шине, это операция на открытом мозге.

И DeepSeek добился того, что AI после операции стал здоровее, чем до нее.

Вторая и третья операции: Оснащение машины пронумерованными ячейками хранения

Первая операция усмирила память. Вторая операция — против массивного «тела».

Идея этой операции не является оригинальной для DeepSeek, а продолжает четко обозначенный старый путь: смесь экспертов (MoE), архитектура, где модель разделена на множество «экспертов», и каждый раз вызываются только несколько из них.

Эта концепция появилась в 1991 году, в 2017 году Shazeer и другие внедрили ее в нейронные сети, затем GShard от Google, Switch Transformer перенесли ее в Transformer; по-настоящему же она стала популярной в конце 2023 года благодаря французской компании Mistral и ее модели Mixtral 8x7B, выпущенной просто сбросившей торрент-ссылку — общее количество параметров около 46,7 млрд, но при обработке каждого слова активируется только около 12,9 млрд.

Вернемся к той больнице «с зубной болью, которая тревожит всю больницу». MoE превращает ее в больницу с четкой специализацией отделений: вы пришли с зубной болью, регистратура сразу направляет вас в стоматологию, врачи остальных отделений занимаются своими делами. Общее количество персонала в больнице по-прежнему велико, общее количество параметров может достигать сотен миллиардов, триллионов, но каждый раз действительно задействуется лишь очень небольшая часть.

DeepSeek в V3 продвинул этот подход до довольно агрессивного масштаба, а в эпоху V4 он стал еще более экстремальным — V4-Pro имеет 1,6 триллиона общих параметров, 49 миллиардов активированных параметров; V4-Flash — 284 миллиарда общих параметров, 13 миллиардов активированных параметров. То есть «общее тело» модели продолжает увеличиваться, но часть, которая действительно работает на каждом шаге, по-прежнему сжата до очень небольшого объема.

Но настоящая изюминка второй операции не только в «задействовании меньшего количества врачей». Она заодно преобразует способ, которым модель получает доступ к этому «телу».

Здесь можно представить более подходящую картину. Раньше большая модель была похожа на огромную, но совершенно беспорядочную кладовку: все свалено в кучу, каждый раз, даже если нужно взять только одну вещь, приходится открывать дверь и начинать с самого низа, перебирая все, чтобы найти нужное. Чтобы этот поиск был достаточно быстрым для наплыва клиентов, приходилось размещать всю кладовку в самых дорогих «помещениях в центре города» — то есть в высокоскоростной видеопамяти.

DeepSeek превращает эту кладовку в шкаф с десятками тысяч пронумерованных ячеек. Нужно взять какую-то вещь — просто потяните за соответствующую пронумерованную ячейку, не трогая остальные. Это означает, что вам больше не нужно держать все вещи в самом дорогом помещении. Подавляющее большинство временно неиспользуемых ячеек完全可以 поместить в гораздо более дешевую обычную оперативную память (LPDDR) или даже в еще более дешевые твердотельные накопители, и при необходимости быстро извлечь именно эту ячейку. Экосистема DeepSeek и такие системы инференса с открытым исходным кодом, как SGLang, продолжают исследовать эту разгрузку и потоковую загрузку.

На этом этапе становится видна синергия первых двух операций: первая операция сжимает «память», вторая операция нумерует «тело», извлекая только нужную ячейку. Вместе эти две операции сводят к минимуму ту часть машины, которая в любой момент времени действительно нуждается в занятии самой дорогой видеопамяти.

Третья операция доводит логику «использования по номеру» до предела: даже действие «вычисления» экономится, где возможно. Некоторые результаты вычислений можно заранее рассчитать и сохранить как пронумерованные ячейки, извлекая их при использовании напрямую, вместо того чтобы пересчитывать каждый раз. Это как человек, который выучил таблицу умножения, не станет каждый раз пересчитывать на пальцах семь умножить на восемь, а сразу скажет «пятьдесят шесть». Это равносильно замене чрезвычайно дорогого «жесткого вычисления» (вычисления на чипе) чрезвычайно дешевым «извлечением» (чтением из памяти).

В V4 эта операция получила более прямое коммерческое выражение: цена за попадание в кэш была резко снижена, повторное использование длинного контекста было напрямую заложено в систему ценообразования — повторные вычисления не только технически можно сэкономить, но и коммерчески поощряется их экономить.

Рассматривая все три операции вместе, видно, что это не три изолированных действия, а последовательное развитие одной и той же логики: преобразование хаотичного беспорядка, который необходимо перерывать, в систему, где все можно точно извлекать по номеру. Память сжата до минимума, тело пробуждает только то, что нужно, вычисления по возможности заменяются поиском по таблице. Каждая операция делает использование машиной самого дорогого оборудования чуть меньше, а вместе все три операции позволяют ей выполнять ту же работу, потребляя лишь крохи самых передовых аппаратных средств по сравнению с прошлым.

Насколько дешево

В мае 2026 года DeepSeek объявил о переводе скидки в 75% на V4-Pro в постоянную цену, создав огромную разницу в ценах на попадание в кэш, промах кэша и выходные токены. Цена за попадание в кэш важна, потому что она превращает третью операцию DeepSeek прямо в коммерческое правило: вычисленный контекст не должен снова и снова оплачиваться как «новая работа».

Только при сравнении с реальными счетами становится ясен конкретный разрыв. Рассмотрим приложение среднего масштаба, обрабатывающее 10 миллиардов токенов в месяц, при одинаковом объеме работы: использование DeepSeek V4-Pro — счет около 522 долларов в месяц; использование Claude Opus 4.7 — около 9000 долларов; использование GPT-5.5 — около 10 000 долларов. Разница в семнадцать-девятнадцать раз.

Рассмотрим еще один экстремальный, но распространенный сценарий: помощник по программированию с длинным контекстом, который сто раз перечитывает кодобазу объемом 100 000 токенов. Благодаря практически бесплатному попаданию в кэш, DeepSeek на эту работу тратит всего около 0,036 доллара; та же работа на GPT-5.5 и Claude Opus 4.7 обойдется примерно в 5 долларов — разница более чем в сто раз.

Эта цена чрезвычайно низкая, но это не убыточная акция для привлечения внимания, а результат того, что эта модифицированная машина изначально работает настолько экономично — это стоимость, которую китайцы по крупицам выжимали инженерными методами. Два года назад Лян Вэньфэн, говоря о ценообразовании, заявил, что принцип — «не субсидировать, но и не получать сверхприбыль». На самом деле, следует понимать так: когда ваша структура затрат принципиально отличается от других, ваше ценообразование естественным образом находится в другом диапазоне.

Конечно, эта модификация не гарантирует прибыль. Например, перенос нагрузки на более дешевую память и жесткие диски, как отмечается в некоторых исследованиях, может привести к потерям в энергопотреблении, задержках и сложности планирования. В некоторых случаях общая системная стоимость генерации каждого символа может быть не ниже, если только аппаратное обеспечение, программный стек и носители данных не будут дополнительно оптимизированы. Поэтому эти три операции — это очень сложный баланс, а не бездумная экономия. Но направление определено: использовать дешевые, более доступные для себя ресурсы для замены самого дорогого, наиболее уязвимого ресурса.

Превратить «один триллион» в осязаемый расчет

После стольких разговоров об «экономии», давайте представим ее более наглядно: сколько интеллектуальных вычислительных центров можно не строить?

Сначала посмотрим на поток токенов. По данным на государственном уровне, к марту 2026 года среднесуточный объем вызовов токенов в Китае уже превысил 140 триллионов, что более чем в тысячу раз превышает показатель начала 2024 года. На отраслевом уровне, только для одной большой модели Doubao, в том же месяце среднесуточное использование также превысило 120 триллионов. Хотя границы статистики различаются, они указывают на одно: потребление токенов в Китае уже вышло на ежедневный уровень в сотни триллионов и быстро движется к уровню в тысячи триллионов. Таким образом, 500 триллионов токенов в день можно рассматривать как следующую ближайшую веху; а 5000 триллионов токенов в день — это сценарий высокого трафика после широкого внедрения агентов, мультимодальности, генерации кода.

На этом фоне становится очевидной ценность DeepSeek, если взглянуть на стоимость вычислительных центров. В 2025 году China Unicom начала строительство в Ухане центра интеллектуальных вычислений для инференса на тысячу карт, первоначальные инвестиции составили почти 200 миллионов юаней. Мы можем приблизительно рассматривать это как пример инвестиций в центр инференса уровня тысячи карт: один такой центр стоит около 200 миллионов юаней.

А если рассчитать по повышению эффективности DeepSeek V4, то, по крайней мере, в сценариях с длинным контекстом, которые он хорошо обрабатывает, изменения составляют не оптимизацию на несколько десятков процентов, а увеличение аппаратной эффективности в несколько раз. Мы возьмем не самый агрессивный показатель, а более консервативное, легче понимаемое предположение: три ключевых направления V4 повышают эффективную пропускную способность токенов на том же оборудовании в 4 раза. То есть работу, которую раньше выполняли 4 центра, теперь, возможно, сможет выполнить 1, тем самым экономя 3 эквивалентных центра, что равно экономии 75% эквивалентных инвестиций в оборудование.

Обратите внимание, DeepSeek не просто использует меньше памяти. Как раз наоборот, он разумно использует память — с помощью сжатого внимания, активации по требованию, попадания в кэш и планирования инференса он более интенсивно использует самое дорогое время GPU и видеопамяти. То, что реально экономят, — это то дополнительное оборудование, которое пришлось бы покупать для той же пропускной способности токенов.

Так чему же соответствует один триллион долларов? 1 триллион долларов примерно равен 7 триллионам юаней. При стоимости одного центра инференса уровня тысячи карт в 200 миллионов юаней, 7 триллионов юаней эквивалентны 35 тысячам таких центров. Если подход V4 дает 4-кратное повышение эффективной пропускной способности, то чтобы не строить 35 тысяч таких эквивалентных центров, соответствующий среднесуточный поток токенов составит примерно 5000 триллионов.

Вот отраслевая картина, соответствующая «одному триллиону долларов», упомянутому в этой статье. Это не точный расчет в технической смете, а расчет масштаба инфраструктуры, соответствующий также сценарию трафика на ближайшие несколько лет, а не уже реализованному сейчас. Что он действительно показывает: в эпоху низкого трафика вызовов повышение эффективности экономит несколько карт, несколько серверных шкафов; в эпоху тысяч триллионов токенов в день повышение эффективности экономит десятки тысяч интеллектуальных вычислительных центров, которые должны были быть построены.

Таким образом, DeepSeek на самом деле меняет не цену отдельного вызова, а бухгалтерскую книгу будущей AI-инфраструктуры.

Он меняет опасный тренд

Теперь вернемся к той машине в начале. Помните? Из 7,8 миллионов долларов за Vera Rubin 2 миллиона приходится на память, и эта часть продолжает бешено дорожать. Это показывает опасную тенденцию — стоимость всей отрасли все больше и больше, нездоровым образом, привязывается к чипам памяти. А память не должна быть такой дорогой.

Многие ошибочно полагают, что DeepSeek «подчиняется» этой тенденции, потому что он тоже активно использует память. Как раз наоборот, DeepSeek меняет ее. Старый метод — пассивно, неэффективно поглощать аппаратное обеспечение, концентрируя стоимость на чипах в перевернутом виде, позволяя памяти двигаться по волне роста цен; DeepSeek сначала тремя операциями резко снижает реальный спрос на аппаратное обеспечение, а затем оставшийся небольшой спрос разумно распределяет по самым дешевым, наиболее подходящим уровням хранения. Первое — это «движение под давлением цены», второе — «сначала разобраться в расчетах, а потом решить, на что тратить».

Это различие особенно важно для Китая. Потому что оно переносит поле боя из места, где мы находимся в невыгодном положении, туда, где у нас больше шансов на победу. Самые передовые вычислительные чипы — мы пока не можем догнать. Но такие чипы памяти, как DRAM, как раз и есть те способности, которые Китай реально нарастил в этом году.

Лидер китайского производства DRAM, ChangXin Memory Technologies (CXMT), в первом квартале 2026 года достиг выручки в 50,8 миллиардов юаней, чистая прибыль составила около 25 миллиардов юаней, компания ожидает, что чистая прибыль за первое полугодие достигнет от 66 до 75 миллиардов юаней, что эквивалентно полугодовой прибыли ByteDance за прошлый год. Хотя CXMT на глобальном рынке DRAM все еще занимает лишь четвертое место, эти отечественные производственные мощности, которых раньше практически не было, наконец-то встали на ноги в этом году.

И в этом заключается стратегическое значение трех операций DeepSeek. Это не «замена вычислений памятью», а снижение маржинальной зависимости от самых дефицитных вычислительных мощностей и перенос части давления на более доступные накопители, кэш и системную инженерию. Когда AI-машина больше полагается на память, кэш, планирование и системную инженерию — звенья, которые у нас самих больше шансов освоить, — существующие цепочки поставок Китая внезапно превращаются из «повсюду ограниченных» в «достаточные» и даже «удобные». Это значительно повышает безопасность всей цепочки.

Заключение

Лян Вэньфэн, для которого «искоренение неэффективности» — инстинкт, не удовлетворится тем, чтобы сделать какую-то модель чуть дешевле. Он нацелился на самую большую неэффективность во всей AI-индустрии — предпосылку, которую вся отрасль принимает как должное: «чтобы получить более мощный интеллект, необходимо полагаться на самые передовые, самые дефицитные, самые дорогие аппаратные средства».

Если он сможет заставить всю отрасль делать то же самое с гораздо меньшим количеством передового оборудования, то то, что он сэкономит для отрасли, — это виртуальная производственная база триллионного масштаба, не занимающая ни сантиметра площади заводов, но реально высвобождающая огромные инвестиции, которые должны были быть вложены в оборудование. И этот «один триллион» перестает быть историей про оценку, а становится расчетом инфраструктуры.

Представлять DeepSeek как «алгоритм, уничтожающий NVIDIA» — это другая дешевая сказка. Но если задать вопрос иначе, ответ становится интересным: может ли DeepSeek заставить отрасль покупать меньше самых дорогих аппаратных средств, занимать меньше самых дефицитных видеопамятей, платить меньше части стоимости инференса, которая ранее считалась само собой разумеющейся? Да. Может ли он перераспределить стоимость AI-инфраструктуры от единственного нарратива о высокопроизводительных GPU к архитектуре модели, системе инференса, управлению кэшем, планированию хранения и инженерной оптимизации? Тоже да. В этом и заключается его настоящая отраслевая значимость.

Настоящая технологическая революция часто заключается не в том, чтобы сделать все дороже, а в том, чтобы превратить то, что раньше было доступно лишь немногим, во вновь доступную ежедневную инфраструктуру для большинства. В более широком измерении, в этой игре действительно важно никогда не то, сколько денег сэкономили, а то, что сама экономия незаметно перераспределяет билеты в будущее среди тысяч отраслей и предприятий Китая, нуждающихся в возможностях AI.

(Эта статья основана на открытых материалах и отраслевых обсуждениях. Некоторые прогнозные суждения в статье, такие как инфраструктурная ценность замены в триллионном масштабе, компромиссы в эффективности оборудования, расчеты эквивалентной стоимости и т.д., являются точками зрения в рамках отраслевой экстраполяции и дискуссий, а не установившимися фактами. Просим читателей относиться к ним с осторожностью.)

Статья из официального аккаунта WeChat «胡说成理», автор: Ху Чжэ.

Трендовые криптовалюты

Связанные с этим вопросы

QКакой технологический подход DeepSeek позволяет резко снизить нагрузку на память (KV Cache) при обработке длинного контекста?

AГлубокое сжатие «памяти» (KV Cache) достигается за счёт модификации механизма внимания (Attention). Вместо хранения всех промежуточных результатов DeepSeek использует метод многофакторного латентного внимания (MLA, Multi-head Latent Attention). Этот подход применяет низкоранговое сжатие к «памяти» модели, сохраняя не исходные детали, а их компактное проекционное представление, которое затем точно восстанавливается при необходимости. Например, в DeepSeek-V2 это позволило сократить объём KV Cache на 93,3%, практически без потери качества модели.

QКак три ключевых технических приёма DeepSeek (три «удара») совместно работают для повышения эффективности оборудования?

AТри приёма действуют последовательно и синергетически, снижая зависимость от самого дорогого оборудования — GPU с высокой пропускной способностью памяти (HBM). 1) Сжатие внимания (MLA) минимизирует объём «памяти» (KV Cache). 2) Архитектура смешанных экспертов (MoE) и пономерная адресация параметров позволяют активировать в HBM только небольшую часть «тела» модели (параметров) в каждый момент времени. 3) Повторное использование кэша (вычисленных результатов) заменяет дорогие вычисления дешёвым извлечением из памяти. Вместе они позволяют той же аппаратуре генерировать в 4 раза больше токенов, что эквивалентно экономии 75% капитальных затрат на оборудование.

QНа какую конкретную сумму, по мнению автора, DeepSeek потенциально может сэкономить Китаю инвестиции в AI-инфраструктуру и как эта цифра получена?

AАвтор предполагает потенциальную экономию в размере около 1 триллиона долларов США. Эта оценка основана на экстраполяции. Отправная точка — прогноз McKinsey о том, что к 2030 году глобальные инвестиции в оборудование для AI-нагрузок составят около 5,2 трлн долларов. Основной тезис DeepSeek — повышение эффективности оборудования в 4 раза (за счёт трёх описанных приёмов). Если Китай будет генерировать тысячи триллионов токенов в день (сценарий высокой нагрузки), то для достижения той же пропускной способности потребуется на 75% меньше эквивалентного оборудования. Экономия в 1 трлн долларов (примерно 7 трлн юаней) эквивалентна отказу от строительства 3,5 тысяч центров обработки данных уровня «тысяча GPU», исходя из примерной стоимости одного такого центра в 200 млн юаней.

QВ чём, согласно статье, заключается стратегическая важность подхода DeepSeek для технологической безопасности Китая?

AПодход DeepSeek перемещает точку конкурентного преимущества и зависимости с поля, где Китай отстаёт (передовые GPU), на поле, где он усиливает свои позиции. Вместо пассивного потребления всё большего количества самых дорогих и дефицитных чипов (GPU и HBM), DeepSeek резко снижает потребность в них на единицу полезной работы (токен). Оставшуюся потребность в ресурсах можно более гибко удовлетворять за счёт более доступных компонентов, таких как оперативная память (DRAM), кэш и инженерная оптимизация программно-аппаратного стека. Поскольку производство DRAM в Китае быстро развивается (например, компания CXMT), такая стратегия снижает зависимость от иностранных поставок критических компонентов и повышает устойчивость всей цепочки создания стоимости AI в Китае.

QКак коммерческая политика ценообразования DeepSeek отражает её технические инновации?

AЦеновая политика DeepSeek напрямую закрепляет технические преимущества, особенно третий приём — повторное использование кэша. DeepSeek ввела резко дифференцированные тарифы: крайне низкая цена за токен при попадании в кэш (cache hit) и стандартная цена при промахе (cache miss). Например, для задачи, требующей 100 повторных прочтений контекста в 100 тыс. токенов, стоимость использования DeepSeek может быть в 100 раз ниже, чем у конкурентов (0,036 доллара против ~5 долларов). Это не просто маркетинговая скидка, а отражение реальной низкой стоимости обработки, достигнутой за счёт избегания повторных вычислений. Таким образом, цена стимулирует клиентов использовать модели эффективно и напрямую демонстрирует фундаментально иную структуру издержек компании.

Похожее

От золота к биткойну: фиксированное предложение + институциональная лихорадка — повторится ли история «взрывного» роста цен?

Аналитики проводят параллели между биткоином и золотом, отмечая схожие черты: фиксированное предложение, статус негенерирующих доход активов-убежищ и зависимость цены от настроений инвесторов. Эксперт Bloomberg Intelligence Эрик Бальчунас указывает, что история золотых ETF за 22 года может служить дорожной картой для биткоин-ETF. После запуска в 2004 году золотые ETF пережили взлёты, болезненные коррекции и долгое восстановление, но каждый цикл устанавливал новые максимумы. Биткоин-ETF, одобренные в 2024 году, стали одними из самых быстрорастущих в истории, открыв криптоактив для институциональных инвесторов. Однако это привело к повышенной волатильности: крупные оттоки средств из ETF, как у BlackRock IBIT, могут оказывать значительное давление на рынок. Несмотря на падение цены более чем на 50% с октября 2025 года, многие остаются оптимистичны в долгосрочной перспективе, видя в биткоине "цифровое золото". Устойчивый институциональный спрос на ETF и растущее включение биткоина в инвестиционные портфели компаний помогают смягчать продажи. Если биткоин сможет занять даже небольшую часть рыночной капитализации золота (около $28 трлн), это откроет огромный потенциал для роста. Путь, вероятно, будет сопряжён с высокой волатильностью, но фиксированное предложение в сочетании с волнами институционального спроса может вновь привести к взрывному росту цены.

Foresight News12 мин. назад

От золота к биткойну: фиксированное предложение + институциональная лихорадка — повторится ли история «взрывного» роста цен?

Foresight News12 мин. назад

Почему AI-агенты для покупок не так широко распространены?

**Почему AI-агенты для покупок не получили широкого распространения?** Идея о том, что AI-агент с кошельком может полностью заменить человека в совершении покупок, кажется простой, но содержит логические изъяны. Она смешивает два ключевых аспекта шопинга: **информационный поиск** (сбор, фильтрация, сравнение) и **ценностную оценку** (субъективное суждение о качестве, уместности, доверии к продавцу). Машинный поиск данных успешно автоматизируется. Однако ценностная оценка, особенно **определение потребностей** (что важно для меня и почему), остается прерогативой человека. Исследования показывают, что предпочтения нестабильны и формируются в процессе выбора, поэтому взаимодействие с AI должно быть итеративным, а не разовым. Критическое разграничение — является ли сам процесс выбора **рутиной или удовольствием**. * **Стандартные товары** (бумага, батарейки): выбор не имеет ценности, идеальны для полной автоматизации. * **Товары для удовольствия** (вино, книги, одежда): сам выбор — часть наслаждения. Здесь AI должен выступать как помощник, сужая опции для финального решения человека. Схема **«дать AI кошелек»** решает лишь самую простую проблему — проведение платежа, и только в сценарии, где AI обладает полной автономией. Отраслевые решения (Stripe, Mastercard, Google, Visa) уже разделяют **авторизацию** и **хранение средств**, предоставляя AI ограниченные, одноразовые платежные токены, а не полный контроль над кошельком. Истинные сценарии для автономных AI-кошельков лежат не в розничной торговле, а в **B2B-закупках** и **межмашинных расчетах (M2M)**, где процессы стандартизированы, а решения лишены субъективизма. Таким образом, главными препятствиями для повсеместного внедрения AI2C-покупок являются не технологии платежей, а: 1. **Недостаток достоверных данных** (фальшивые отзывы, поддельные товары), без которых любая автоматизация опасна. 2. **Принципиальная невозможность автоматизировать определение человеческих потребностей и ценностей**. Итог: будущее AI в шопинге — не в полном замещении, а в усилении. AI должен взять на себя утомительный поиск и анализ, оставляя человеку ключевые права: **определять критерии выбора** и **получать удовольствие от самого акта выбора**. Платформам следует сосредоточиться на улучшении именно этого опыта.

Foresight News1 ч. назад

Почему AI-агенты для покупок не так широко распространены?

Foresight News1 ч. назад

После девяти месяцев шортинга полный переход в лонг: известный трейдер открывает позицию по биткоину около 64 000 долларов, расхождения между быками и медведями на крипторынке усиливаются

Популярный трейдер Doctor Profit закрыл все короткие позиции по биткойну после девяти месяцев успешного шортинга и начал покупать на уровне около $64 000, заявив, что фундаментальные изменения — такие как возможное принятие закона CLARITY и институциональный спрос — могут привести к досрочному достижению дна рыночного цикла. Тем временем, аналитик on-chain gumsays отмечает, что бычье расхождение на недельном графике биткойна длится уже 147 дней, что близко к 161 дню перед минимумом 2022 года. Однако исследователь циклов Джейк Пахор указывает, что три ключевых условия для рыночного дна, наблюдавшихся с 2014 года, пока не выполнены: с момента пика октября 2025 года прошло лишь 9 месяцев (вместо типичных 12), индекс страха CSH ни разу не опускался ниже 20, а цена не пробивала реализованную цену (~$53 000). Рынок разделён: одни считают, что институциональный спрос через ETF и регулирование изменили правила игры, другие ждут классических сигналов капитуляции. Стратегия Пахора отражает этот раскол — он продолжает периодические покупки, но сохраняет крупный капитал для более низких цен, если историческая модель повторится.

marsbit1 ч. назад

После девяти месяцев шортинга полный переход в лонг: известный трейдер открывает позицию по биткоину около 64 000 долларов, расхождения между быками и медведями на крипторынке усиливаются

marsbit1 ч. назад

Опытный трейдер рассказывает: Как торговать на ошибочных ожиданиях рынка?

Опытный трейдер делится историей успешной сделки, построенной на торговле против ошибочных рыночных ожиданий. В основе его метода — анализ не самих данных (например, слабого CPI), а того, как рынок *ожидает*, что эти данные повлияют на цены, и проверка, остаётся ли этот механизм влияния (функция реакции) в силе. На примере сделки с Nasdaq (NQ) он показывает: после слабых данных CPI рынок ожидал общего снижения ставок и роста акций, особенно технологических. Однако долгосрочные реальные ставки (10-30 лет) достигли многолетних максимумов, отказавшись подтверждать этот сценарий. Это означало, что «дешёвых» долгосрочных денег для роста дорогих tech-акций не будет. Рост NQ на фоне слабого CPI стал ошибочным定价ованием. Трейдер выявил несоответствие: рынок предполагал цепочку «слабый CPI → смягчение политики → падение долгосрочных ставок → рост оценки NQ», но ключевое звено (падение долгосрочных ставок) не сработало. Это создало возможность для short-позиций по NQ, наиболее уязвимому к дорогим долгосрочным деньгам индексу. В статье изложена структура для поиска подобных возможностей: 1. Определить текущую рыночную причинно-следственную цепочку. 2. Найти в ней ключевую переменную с «правом вето». 3. Проверить, отказывается ли эта переменная подтверждать цепочку. 4. Дождаться, пока цена по инерции продолжит двигаться по старому сценарию. 5. Выбрать наиболее чистый актив для выражения этой ошибки. 6. Заранее определить условия для выхода (опровержение гипотезы или реализация логики). Главный вывод: альфа часто возникает не из-за информпреимущества, а из-за разницы в функциях реакции. Когда макрорежим меняется, рынок может по привычке реагировать на данные по-старому, создавая ошибку в цене. Ключевой вопрос: «На какую причинно-следственную цепочку опирается первая рыночная реакция, и остаётся ли она справедливой сегодня?».

marsbit2 ч. назад

Опытный трейдер рассказывает: Как торговать на ошибочных ожиданиях рынка?

marsbit2 ч. назад

Торговля

Спот

Популярные статьи

Как купить ONE

Добро пожаловать на HTX.com! Мы сделали приобретение Harmony (ONE) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки Harmony (ONE).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение Harmony (ONE)После приобретения вами Harmony (ONE) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля Harmony (ONE)С легкостью торгуйте Harmony (ONE) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

844 просмотров всегоОпубликовано 2024.04.12Обновлено 2026.06.02

Как купить ONE

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на ONE (ONE) представлены ниже.

活动图片