Во второй половине 2026 года NVIDIA поставит свою самую мощную на сегодняшний день AI-платформу: Vera Rubin VR200 NVL72. В одном целевом серверном шкафу размещены 72 GPU Rubin и 36 CPU Vera. По оценкам Morgan Stanley, себестоимость материалов этой машины составляет около 7,8 миллиона долларов США.
Эта цифра и так пугающая. Но более важное, за чем стоит следить, — это то, куда уходят эти деньги.
Из этих 7,8 миллионов около 2 миллионов долларов потрачены не на знаменитые GPU-чипы и не на вычислительные ядра, а на память — высокоскоростную видеопамять (HBM4) и обычную оперативную память (LPDDR5X). Всего за год стоимость этой части памяти взлетела на 435% из-за роста цен.
Это сигнал. В этой все дорожающей AI-машине деньги массово перетекают от «компонентов, отвечающих за вычисления» к «компонентам, отвечающим за память и хранение».
Запомните этот сигнал. Потому что эта статья рассказывает о DeepSeek, который делает как раз обратное: всех подгоняет время, заставляя платить аппаратную наценку за AI из-за все более дорогой памяти. А он ищет способ, не ослабляя конкурентоспособности, с помощью интеграции программного и аппаратного обеспечения повысить токен-продуктивность этих дорогих аппаратных средств более чем в 4 раза, что эквивалентно экономии 75% инвестиций в железо.
И в конце этого пути в последнее время активно обсуждается одна гипотеза — может ли DeepSeek своими усилиями сэкономить Китаю на инфраструктурном строительстве искусственного интеллекта триллион долларов?
Неужели это возможно?
Триллион долларов экономят
Тот прайс-лист от NVIDIA — это самая весомая цифра в последних бухгалтерских книгах AI-инфраструктуры. В текущей ситуации спроса и предложения, если вы хотите купить самую передовую AI-машину, вы должны принять этот счет.
DeepSeek не может изменить это.
Он меняет другое: на одной и той же машине, на тех же самых дорогих аппаратных средствах хранения стоимостью 2 миллиона долларов, сколько именно токенов может быть произведено.
После выпуска DeepSeek V4 этот вопрос стал особенно конкретным.
На что стоит обратить внимание в V4 — это не только сама модель, но и три ключевых направления, которые она демонстрирует: Во-первых, продолжать сжимать «память», чтобы длинный контекст больше не перегружал видеопамять; во-вторых, пробуждать «тело» по требованию, чтобы огромной модели-эксперту не приходилось каждый раз задействовать все ресурсы; в-третьих, превращать повторные вычисления в переиспользуемый актив, чтобы вычисленный контекст не сжигал деньги снова и снова.
Часть характеристик этих технологий демонстрирует яркую особенность — они сделали акцент на совместной работе программного и аппаратного обеспечения, а не на чисто программной оптимизации. Поэтому некоторые шутливо сравнивают — возможно, DeepSeek станет крупнейшей в Китае компанией по производству аппаратного обеспечения для AI.
Страница модели показывает, что в сценарии с контекстом в 1 миллион токенов V4-Pro по сравнению с предыдущим поколением требует только 27% вычислительных ресурсов на один токен при инференсе и 10% занимаемого кэша. В этой статье мы возьмем приблизительно четверть вычислительной мощности для последующих расчетов.
При традиционном подходе это оборудование могло поддерживать только одну единицу пропускной способности, а благодаря сжатию длинного контекста, активации по требованию, повторному использованию кэша и планированию инференса DeepSeek позволяет эффективную выработку токенов на том же оборудовании увеличить в четыре раза — таким образом, стоимость не «срезается», а распределяется. Раньше работу, которую делали 4 машины, теперь, возможно, сможет выполнить одна; раньше генерация каждого токена полностью «съедала» стоимость дорогого оборудования, теперь ту же стоимость оборудования можно распределить на 4 токена.
В этом и заключается настоящая сила DeepSeek: он не изменил прайс-лист NVIDIA, но изменил производительность машин NVIDIA в бухгалтерской книге AI. Значение этого события намного превышает разовое снижение цен на API.
И масштаб в 1 триллион долларов тоже не взят с потолка.
Отчет McKinsey 2026 года «Стоимость вычислений» дает конкретную цифру: к 2030 году глобальным центрам обработки данных для удовлетворения спроса на вычислительные мощности потребуются инвестиции в размере около 6,7 триллионов долларов, из которых часть, предназначенная специально для обработки AI-нагрузок, съест около 5,2 триллиона долларов.
Другими словами, в ближайшие несколько лет деньги, которые человечество планирует вложить в AI-аппаратное обеспечение, измеряются триллионами долларов.
И значительная часть этих огромных средств уйдет на самые передовые и дефицитные аппаратные средства — то есть на высокоскоростную видеопамять HBM и оперативную память LPDDR. То, что делает DeepSeek, — это систематическое снижение зависимости всей китайской индустрии AI от этой части дорогого оборудования. Даже если снизить зависимость лишь частично, он сэкономит для отрасли астрономическую сумму триллионного масштаба.
Когда ежедневное потребление токенов в Китае с сегодняшних ста с лишним триллионов продолжит расти до сотен, тысяч триллионов, любое снижение стоимости единичного токена будет умножено на огромную разницу в инфраструктурных затратах. Если действительно ту же пропускную способность можно обеспечить с помощью четверти оборудования, то в обозримом будущем это может позволить сэкономить Китаю на инфраструктурных инвестициях в вычислительные мощности для AI почти 1 триллион долларов.
Это инфраструктурный расчет: кто может заставить те же жесткие затраты на оборудование производить больше токенов, тот строит меньше дата-центров, покупает меньше GPU, накапливает меньше видеопамяти, тот перераспределяет билеты в будущее AI.
Так как же DeepSeek этого добился? Ответ: он провел три операции над этой машиной большой модели.
Два прожорливых пожирателя
Распространенное заблуждение: самое дорогое в большой модели — это «мышление», вычисления. На самом деле нет.
Ее настоящие два прожорливых пожирателя — это «память» и «тело». И они сжигают одно и то же самое дорогое топливо — высокоскоростную видеопамять (HBM), память, напрямую интегрированную в систему GPU, чрезвычайно быструю и дорогую.
Сначала о памяти. При генерации текста у больших моделей есть неуклюжая особенность: чтобы выдать каждое новое слово, ей нужно оглянуться назад и перечитать все предыдущее содержание. Потому что смысл языка строится слоями, то, что следует сказать дальше, полностью зависит от того, какой контекст уже создан ранее.
Это похоже на синхронного переводчика. Он не может начать говорить, основываясь только на вашем последнем предложении, а должен постоянно держать в уме все, что вы сказали ранее — только помня эти предпосылки, он может понять истинное значение текущей фразы. Чем дольше вы говорите, тем больше ему нужно запоминать.
Чтобы не пересчитывать все с нуля на каждом слове (это было бы слишком медленно), модель временно сохраняет уже вычисленные промежуточные результаты. Этот архив называется кэшем ключ-значение (Key-Value Cache, можно понимать как кратковременную память модели).
Проблема в том, что он безумно разрастается по мере увеличения диалога.
Приведем конкретную цифру: по оценкам для одной из стандартных архитектур, обработка контекста объемом примерно в сто двадцать тысяч слов может «съесть» 488 ГБ высокоскоростной видеопамяти только на эту память. А у топового GPU Rubin от NVIDIA, который скоро будет поставлен, объем видеопамяти на карту составляет 288 ГБ. То есть, только для хранения этой «памяти» потребуется заполнить почти полтора, а то и接近 два самых передовых GPU — и модель еще даже не начала реальную работу.
Теперь о «теле». «Тело» модели — это ее весовые параметры, грубо говоря, носитель всех ее знаний и способностей. Чем сильнее способности, тем обычно массивнее тело, достигающее сотен миллиардов, триллионов параметров.
У традиционных плотных моделей (Dense Model, где для обработки любого ввода требуется задействовать все параметры) есть недостаток: что бы вы у нее ни спросили, она должна задействовать все тело. Это как если бы вы пришли в больницу только с зубной болью, а всех врачей всех отделений вызвали бы к вам, чтобы они обследовали вас с головы до ног, и только потом дошла бы очередь до стоматолога. Абсурдно, но счет выставляется полностью.
Это массивное тело также должно постоянно находиться в дорогой высокоскоростной видеопамяти, готовое к работе.
Память и тело, эти два прожорливых пожирателя, заставляют распределение стоимости всей аппаратной системы жестко зависеть от самой дорогой, самой дефицитной, наиболее зависимой от других аппаратных средств. И за последнее десятилетие отраслевой подход был простым и грубым: не хватает вычислительной мощности — добавляем, не хватает видеопамяти — добавляем еще. Таким образом, богатство индустрии в высокой степени концентрировалось на этой самой передовой аппаратной цепочке, самая жирная прибыль застревала в самом дефицитном звене.
Цена токена была взята в заложники дефицитностью одного вида аппаратного обеспечения. А три операции DeepSeek как раз ослабляют эти оковы.
Первая операция: Операция на мозге
Первая операция — на «памяти». И место, где он наносит удар, как раз самое неподходящее или самое страшное для прикосновения — механизм внимания (Attention, ключевой механизм, который большая модель использует для понимания связей в контексте).
Механизм внимания — это мозг большой модели. Его способность понимать контекст, улавливать ключевые моменты в длинном диалоге полностью зависит от этого механизма, который постоянно взвешивает связи между каждым словом. Та дорогая память, о которой шла речь ранее, как раз и есть продукт каждого импульса этого мозга.
Хочется сэкономить на памяти, но боятся риска, поэтому почти все предпочитают обходить этот мозг стороной, действуя только на периферии. От множественного запросного внимания (MQA), предложенного в 2019 году одним из авторов Transformer Noam Shazeer, до группового запросного внимания (GQA), предложенного Google в 2023 году и широко используемого в Llama и других моделях, основная идея основного направления всегда заключалась в том, чтобы «заставить несколько голов запросов использовать одну и ту же память» — по сути, «запоминать меньше, использовать как есть». Эффект экономии места поразителен, но цена — снижение качества модели. Проще говоря, консенсус этого направления всегда заключался в «компромиссе»: по умолчанию сжатие неизбежно вредит качеству, идет торг лишь о степени ущерба.
DeepSeek не идет на компромисс. Он выбирает прямую операцию на мозге, преобразуя сам механизм внимания.
Его решение называется многоголовым латентным вниманием (MLA, Multi-head Latent Attention), впервые появившимся в DeepSeek-V2 в 2024 году. Приведу аналогию: другие модели делают заметки, дословно переписывая каждую деталь, заполняя несколько толстых тетрадей; MLA сначала сводит заметки к высококонцентрированному резюме, сохраняет только резюме, а при использовании точно восстанавливает детали на основе резюме. В терминологии это называется «низкоранговым сжатием» — проецирование тех, казалось бы, сложных, но на самом деле высокоизбыточных воспоминаний в гораздо более компактное пространство для хранения.
Насколько эффект поразителен? Результаты, представленные в статье DeepSeek-V2, показывают, что по сравнению с предыдущей моделью того же семейства, V2 при более высокой способности снизила стоимость обучения на 42,5%, уменьшила KV Cache на 93,3%, а максимальную пропускную способность генерации увеличила в 5,76 раза. В том примере, который «съедал» 488 ГБ, при таком подходе можно сжать до нескольких гигабайт.
Но по-настоящему круто не то, сколько сэкономили, а то, что за это почти не пришлось платить потерей деталей.
По логике, сжав книгу до одной страницы резюме, как бы ты ни восстанавливал, не вернешь все детали. Но в экспериментах, опубликованных DeepSeek, эта сжатая память не только не уступала по эффективности стандартному вниманию «дословного переписывания всей книги», но в некоторых случаях даже была немного лучше.
В V4 этот подход был продвинут еще дальше в экстремальные сценарии длинного контекста: V4-Pro использует гибридную архитектуру внимания, в условиях контекста в 1 миллион токенов требует только 27% вычислительных ресурсов для инференса и 10% занимаемого кэша по сравнению с предыдущим поколением.
Чтобы понять, насколько это сложно, нужно знать, что это операция на самолете в полете. Изменение механизма внимания означает переписывание самой базовой вычислительной логики модели, переобучение всей модели, переделку всей сервисной системы, которая ее поддерживает. Ошибка на любом этапе — и интеллект рушится. Это не замена ниппеля на шине, это операция на открытом мозге.
И DeepSeek добился того, что AI после операции стал здоровее, чем до нее.
Вторая и третья операции: Оснащение машины пронумерованными ячейками хранения
Первая операция усмирила память. Вторая операция — против массивного «тела».
Идея этой операции не является оригинальной для DeepSeek, а продолжает четко обозначенный старый путь: смесь экспертов (MoE), архитектура, где модель разделена на множество «экспертов», и каждый раз вызываются только несколько из них.
Эта концепция появилась в 1991 году, в 2017 году Shazeer и другие внедрили ее в нейронные сети, затем GShard от Google, Switch Transformer перенесли ее в Transformer; по-настоящему же она стала популярной в конце 2023 года благодаря французской компании Mistral и ее модели Mixtral 8x7B, выпущенной просто сбросившей торрент-ссылку — общее количество параметров около 46,7 млрд, но при обработке каждого слова активируется только около 12,9 млрд.
Вернемся к той больнице «с зубной болью, которая тревожит всю больницу». MoE превращает ее в больницу с четкой специализацией отделений: вы пришли с зубной болью, регистратура сразу направляет вас в стоматологию, врачи остальных отделений занимаются своими делами. Общее количество персонала в больнице по-прежнему велико, общее количество параметров может достигать сотен миллиардов, триллионов, но каждый раз действительно задействуется лишь очень небольшая часть.
DeepSeek в V3 продвинул этот подход до довольно агрессивного масштаба, а в эпоху V4 он стал еще более экстремальным — V4-Pro имеет 1,6 триллиона общих параметров, 49 миллиардов активированных параметров; V4-Flash — 284 миллиарда общих параметров, 13 миллиардов активированных параметров. То есть «общее тело» модели продолжает увеличиваться, но часть, которая действительно работает на каждом шаге, по-прежнему сжата до очень небольшого объема.
Но настоящая изюминка второй операции не только в «задействовании меньшего количества врачей». Она заодно преобразует способ, которым модель получает доступ к этому «телу».
Здесь можно представить более подходящую картину. Раньше большая модель была похожа на огромную, но совершенно беспорядочную кладовку: все свалено в кучу, каждый раз, даже если нужно взять только одну вещь, приходится открывать дверь и начинать с самого низа, перебирая все, чтобы найти нужное. Чтобы этот поиск был достаточно быстрым для наплыва клиентов, приходилось размещать всю кладовку в самых дорогих «помещениях в центре города» — то есть в высокоскоростной видеопамяти.
DeepSeek превращает эту кладовку в шкаф с десятками тысяч пронумерованных ячеек. Нужно взять какую-то вещь — просто потяните за соответствующую пронумерованную ячейку, не трогая остальные. Это означает, что вам больше не нужно держать все вещи в самом дорогом помещении. Подавляющее большинство временно неиспользуемых ячеек完全可以 поместить в гораздо более дешевую обычную оперативную память (LPDDR) или даже в еще более дешевые твердотельные накопители, и при необходимости быстро извлечь именно эту ячейку. Экосистема DeepSeek и такие системы инференса с открытым исходным кодом, как SGLang, продолжают исследовать эту разгрузку и потоковую загрузку.
На этом этапе становится видна синергия первых двух операций: первая операция сжимает «память», вторая операция нумерует «тело», извлекая только нужную ячейку. Вместе эти две операции сводят к минимуму ту часть машины, которая в любой момент времени действительно нуждается в занятии самой дорогой видеопамяти.
Третья операция доводит логику «использования по номеру» до предела: даже действие «вычисления» экономится, где возможно. Некоторые результаты вычислений можно заранее рассчитать и сохранить как пронумерованные ячейки, извлекая их при использовании напрямую, вместо того чтобы пересчитывать каждый раз. Это как человек, который выучил таблицу умножения, не станет каждый раз пересчитывать на пальцах семь умножить на восемь, а сразу скажет «пятьдесят шесть». Это равносильно замене чрезвычайно дорогого «жесткого вычисления» (вычисления на чипе) чрезвычайно дешевым «извлечением» (чтением из памяти).
В V4 эта операция получила более прямое коммерческое выражение: цена за попадание в кэш была резко снижена, повторное использование длинного контекста было напрямую заложено в систему ценообразования — повторные вычисления не только технически можно сэкономить, но и коммерчески поощряется их экономить.
Рассматривая все три операции вместе, видно, что это не три изолированных действия, а последовательное развитие одной и той же логики: преобразование хаотичного беспорядка, который необходимо перерывать, в систему, где все можно точно извлекать по номеру. Память сжата до минимума, тело пробуждает только то, что нужно, вычисления по возможности заменяются поиском по таблице. Каждая операция делает использование машиной самого дорогого оборудования чуть меньше, а вместе все три операции позволяют ей выполнять ту же работу, потребляя лишь крохи самых передовых аппаратных средств по сравнению с прошлым.
Насколько дешево
В мае 2026 года DeepSeek объявил о переводе скидки в 75% на V4-Pro в постоянную цену, создав огромную разницу в ценах на попадание в кэш, промах кэша и выходные токены. Цена за попадание в кэш важна, потому что она превращает третью операцию DeepSeek прямо в коммерческое правило: вычисленный контекст не должен снова и снова оплачиваться как «новая работа».
Только при сравнении с реальными счетами становится ясен конкретный разрыв. Рассмотрим приложение среднего масштаба, обрабатывающее 10 миллиардов токенов в месяц, при одинаковом объеме работы: использование DeepSeek V4-Pro — счет около 522 долларов в месяц; использование Claude Opus 4.7 — около 9000 долларов; использование GPT-5.5 — около 10 000 долларов. Разница в семнадцать-девятнадцать раз.
Рассмотрим еще один экстремальный, но распространенный сценарий: помощник по программированию с длинным контекстом, который сто раз перечитывает кодобазу объемом 100 000 токенов. Благодаря практически бесплатному попаданию в кэш, DeepSeek на эту работу тратит всего около 0,036 доллара; та же работа на GPT-5.5 и Claude Opus 4.7 обойдется примерно в 5 долларов — разница более чем в сто раз.
Эта цена чрезвычайно низкая, но это не убыточная акция для привлечения внимания, а результат того, что эта модифицированная машина изначально работает настолько экономично — это стоимость, которую китайцы по крупицам выжимали инженерными методами. Два года назад Лян Вэньфэн, говоря о ценообразовании, заявил, что принцип — «не субсидировать, но и не получать сверхприбыль». На самом деле, следует понимать так: когда ваша структура затрат принципиально отличается от других, ваше ценообразование естественным образом находится в другом диапазоне.
Конечно, эта модификация не гарантирует прибыль. Например, перенос нагрузки на более дешевую память и жесткие диски, как отмечается в некоторых исследованиях, может привести к потерям в энергопотреблении, задержках и сложности планирования. В некоторых случаях общая системная стоимость генерации каждого символа может быть не ниже, если только аппаратное обеспечение, программный стек и носители данных не будут дополнительно оптимизированы. Поэтому эти три операции — это очень сложный баланс, а не бездумная экономия. Но направление определено: использовать дешевые, более доступные для себя ресурсы для замены самого дорогого, наиболее уязвимого ресурса.
Превратить «один триллион» в осязаемый расчет
После стольких разговоров об «экономии», давайте представим ее более наглядно: сколько интеллектуальных вычислительных центров можно не строить?
Сначала посмотрим на поток токенов. По данным на государственном уровне, к марту 2026 года среднесуточный объем вызовов токенов в Китае уже превысил 140 триллионов, что более чем в тысячу раз превышает показатель начала 2024 года. На отраслевом уровне, только для одной большой модели Doubao, в том же месяце среднесуточное использование также превысило 120 триллионов. Хотя границы статистики различаются, они указывают на одно: потребление токенов в Китае уже вышло на ежедневный уровень в сотни триллионов и быстро движется к уровню в тысячи триллионов. Таким образом, 500 триллионов токенов в день можно рассматривать как следующую ближайшую веху; а 5000 триллионов токенов в день — это сценарий высокого трафика после широкого внедрения агентов, мультимодальности, генерации кода.
На этом фоне становится очевидной ценность DeepSeek, если взглянуть на стоимость вычислительных центров. В 2025 году China Unicom начала строительство в Ухане центра интеллектуальных вычислений для инференса на тысячу карт, первоначальные инвестиции составили почти 200 миллионов юаней. Мы можем приблизительно рассматривать это как пример инвестиций в центр инференса уровня тысячи карт: один такой центр стоит около 200 миллионов юаней.
А если рассчитать по повышению эффективности DeepSeek V4, то, по крайней мере, в сценариях с длинным контекстом, которые он хорошо обрабатывает, изменения составляют не оптимизацию на несколько десятков процентов, а увеличение аппаратной эффективности в несколько раз. Мы возьмем не самый агрессивный показатель, а более консервативное, легче понимаемое предположение: три ключевых направления V4 повышают эффективную пропускную способность токенов на том же оборудовании в 4 раза. То есть работу, которую раньше выполняли 4 центра, теперь, возможно, сможет выполнить 1, тем самым экономя 3 эквивалентных центра, что равно экономии 75% эквивалентных инвестиций в оборудование.
Обратите внимание, DeepSeek не просто использует меньше памяти. Как раз наоборот, он разумно использует память — с помощью сжатого внимания, активации по требованию, попадания в кэш и планирования инференса он более интенсивно использует самое дорогое время GPU и видеопамяти. То, что реально экономят, — это то дополнительное оборудование, которое пришлось бы покупать для той же пропускной способности токенов.
Так чему же соответствует один триллион долларов? 1 триллион долларов примерно равен 7 триллионам юаней. При стоимости одного центра инференса уровня тысячи карт в 200 миллионов юаней, 7 триллионов юаней эквивалентны 35 тысячам таких центров. Если подход V4 дает 4-кратное повышение эффективной пропускной способности, то чтобы не строить 35 тысяч таких эквивалентных центров, соответствующий среднесуточный поток токенов составит примерно 5000 триллионов.
Вот отраслевая картина, соответствующая «одному триллиону долларов», упомянутому в этой статье. Это не точный расчет в технической смете, а расчет масштаба инфраструктуры, соответствующий также сценарию трафика на ближайшие несколько лет, а не уже реализованному сейчас. Что он действительно показывает: в эпоху низкого трафика вызовов повышение эффективности экономит несколько карт, несколько серверных шкафов; в эпоху тысяч триллионов токенов в день повышение эффективности экономит десятки тысяч интеллектуальных вычислительных центров, которые должны были быть построены.
Таким образом, DeepSeek на самом деле меняет не цену отдельного вызова, а бухгалтерскую книгу будущей AI-инфраструктуры.
Он меняет опасный тренд
Теперь вернемся к той машине в начале. Помните? Из 7,8 миллионов долларов за Vera Rubin 2 миллиона приходится на память, и эта часть продолжает бешено дорожать. Это показывает опасную тенденцию — стоимость всей отрасли все больше и больше, нездоровым образом, привязывается к чипам памяти. А память не должна быть такой дорогой.
Многие ошибочно полагают, что DeepSeek «подчиняется» этой тенденции, потому что он тоже активно использует память. Как раз наоборот, DeepSeek меняет ее. Старый метод — пассивно, неэффективно поглощать аппаратное обеспечение, концентрируя стоимость на чипах в перевернутом виде, позволяя памяти двигаться по волне роста цен; DeepSeek сначала тремя операциями резко снижает реальный спрос на аппаратное обеспечение, а затем оставшийся небольшой спрос разумно распределяет по самым дешевым, наиболее подходящим уровням хранения. Первое — это «движение под давлением цены», второе — «сначала разобраться в расчетах, а потом решить, на что тратить».
Это различие особенно важно для Китая. Потому что оно переносит поле боя из места, где мы находимся в невыгодном положении, туда, где у нас больше шансов на победу. Самые передовые вычислительные чипы — мы пока не можем догнать. Но такие чипы памяти, как DRAM, как раз и есть те способности, которые Китай реально нарастил в этом году.
Лидер китайского производства DRAM, ChangXin Memory Technologies (CXMT), в первом квартале 2026 года достиг выручки в 50,8 миллиардов юаней, чистая прибыль составила около 25 миллиардов юаней, компания ожидает, что чистая прибыль за первое полугодие достигнет от 66 до 75 миллиардов юаней, что эквивалентно полугодовой прибыли ByteDance за прошлый год. Хотя CXMT на глобальном рынке DRAM все еще занимает лишь четвертое место, эти отечественные производственные мощности, которых раньше практически не было, наконец-то встали на ноги в этом году.
И в этом заключается стратегическое значение трех операций DeepSeek. Это не «замена вычислений памятью», а снижение маржинальной зависимости от самых дефицитных вычислительных мощностей и перенос части давления на более доступные накопители, кэш и системную инженерию. Когда AI-машина больше полагается на память, кэш, планирование и системную инженерию — звенья, которые у нас самих больше шансов освоить, — существующие цепочки поставок Китая внезапно превращаются из «повсюду ограниченных» в «достаточные» и даже «удобные». Это значительно повышает безопасность всей цепочки.
Заключение
Лян Вэньфэн, для которого «искоренение неэффективности» — инстинкт, не удовлетворится тем, чтобы сделать какую-то модель чуть дешевле. Он нацелился на самую большую неэффективность во всей AI-индустрии — предпосылку, которую вся отрасль принимает как должное: «чтобы получить более мощный интеллект, необходимо полагаться на самые передовые, самые дефицитные, самые дорогие аппаратные средства».
Если он сможет заставить всю отрасль делать то же самое с гораздо меньшим количеством передового оборудования, то то, что он сэкономит для отрасли, — это виртуальная производственная база триллионного масштаба, не занимающая ни сантиметра площади заводов, но реально высвобождающая огромные инвестиции, которые должны были быть вложены в оборудование. И этот «один триллион» перестает быть историей про оценку, а становится расчетом инфраструктуры.
Представлять DeepSeek как «алгоритм, уничтожающий NVIDIA» — это другая дешевая сказка. Но если задать вопрос иначе, ответ становится интересным: может ли DeepSeek заставить отрасль покупать меньше самых дорогих аппаратных средств, занимать меньше самых дефицитных видеопамятей, платить меньше части стоимости инференса, которая ранее считалась само собой разумеющейся? Да. Может ли он перераспределить стоимость AI-инфраструктуры от единственного нарратива о высокопроизводительных GPU к архитектуре модели, системе инференса, управлению кэшем, планированию хранения и инженерной оптимизации? Тоже да. В этом и заключается его настоящая отраслевая значимость.
Настоящая технологическая революция часто заключается не в том, чтобы сделать все дороже, а в том, чтобы превратить то, что раньше было доступно лишь немногим, во вновь доступную ежедневную инфраструктуру для большинства. В более широком измерении, в этой игре действительно важно никогда не то, сколько денег сэкономили, а то, что сама экономия незаметно перераспределяет билеты в будущее среди тысяч отраслей и предприятий Китая, нуждающихся в возможностях AI.
(Эта статья основана на открытых материалах и отраслевых обсуждениях. Некоторые прогнозные суждения в статье, такие как инфраструктурная ценность замены в триллионном масштабе, компромиссы в эффективности оборудования, расчеты эквивалентной стоимости и т.д., являются точками зрения в рамках отраслевой экстраполяции и дискуссий, а не установившимися фактами. Просим читателей относиться к ним с осторожностью.)
Статья из официального аккаунта WeChat «胡说成理», автор: Ху Чжэ.






