Автор: Брюс
В последнее время весь технологический мир и инвестиционное сообщество пристально следят за одним и тем же: как приложения на основе ИИ «убивают» традиционный SaaS. С тех пор как @AnthropicAI представила Claude Cowork, демонстрируя, как легко она может помочь вам писать письма, создавать презентации и анализировать таблицы Excel, начала распространяться паника о «смерти программного обеспечения». Это действительно пугающе, но если ваш взгляд застрял только на этом, вы, возможно, упускаете настоящее землетрясение.
Это похоже на то, как мы все смотрим на воздушный бой дронов в небе, но никто не замечает, что тектонические плиты под нашими ногами тихо сдвигаются. Настоящий шторм скрыт под поверхностью, в углу, который большинство не видит: вычислительная основа всего мира ИИ переживает «тихую революцию».
И эта революция может закончить грандиозную вечеринку, которую с таким размахом устроила @nvidia, поставщик «лопат» для золотой лихорадки ИИ, гораздо раньше, чем все ожидали.
Два пути революции, которые сходятся
Эта революция — не единичное событие, а переплетение двух, казалось бы, независимых технологических направлений. Они подобны двум армиям, сходящимся в клещи, создавая угрозу гегемонии GPU от Nvidia.
Первый путь — это революция «похудения» алгоритмов.
Задумывались ли вы, нужно ли супермозгу задействовать все клетки для решения задачи? Очевидно, нет. В DeepSeek это поняли и создали архитектуру MoE (Mixture of Experts, смесь экспертов).
Представьте себе компанию, где работают сотни экспертов в разных областях. Но для решения каждой конкретной проблемы на совещание приглашают только двух-трех самых relevant специалистов, а не устраивают мозговой штурм со всеми. В этом гениальность MoE: огромная модель активирует для каждого вычисления лишь небольшую часть «экспертов», drastically экономя вычислительные ресурсы.
К чему это приводит? Модель DeepSeek-V2 номинально имеет 236 миллиардов «экспертов» (параметров), но для работы каждый раз активирует лишь 21 миллиард — менее 9% от общего числа. При этом ее производительность сравнима с GPT-4, которому нужно работать на 100% мощности. Что это значит? Способности ИИ и потребляемые им вычислительные ресурсы больше не связаны напрямую!
Раньше мы молчаливо соглашались: чем сильнее ИИ, тем больше видеокарт он сжигает. Теперь DeepSeek показывает, что с помощью умного алгоритма можно достичь того же результата за десятую часть стоимости. Это ставит под огромный вопрос саму необходимость GPU от Nvidia.
Второй путь — это революция «смены пути» в аппаратном обеспечении.
Работа ИИ делится на два этапа: обучение и вывод (инференс). Обучение — это как учеба, нужно прочитать горы книг, и здесь GPU, карты для параллельных вычислений по принципу «сила есть — ума не надо», действительно хороши. Но вывод — это как наше повседневное использование ИИ, где важнее скорость реакции.
У GPU при выводе есть врожденный недостаток: его память (HBM) является внешней, передача данных туда и обратно вызывает задержки. Это как если бы повару при готовке каждый раз приходилось бегать в соседнюю комнату к холодильнику за ingredients — как ни старайся, быстро не получится. А такие компании, как Cerebras и Groq, пошли другим путем, разработали специализированные чипы для инференса, встроили память (SRAM) прямо в чип, разместив «ingredients» под рукой, и добились «нулевой задержки» доступа.
Рынок уже проголосовал деньгами. OpenAI, с одной стороны, жалуется на неэффективность GPU от Nvidia для вывода, а с другой — заключает с Cerebras контракт на 100 миллиардов долларов на аренду их сервисов для инференса. Сама Nvidia тоже запаниковала и выложила 200 миллиардов долларов, чтобы купить Groq, лишь бы не отстать на этой новой трассе.
Когда пути сходятся: обвал стоимости
Теперь представим себе это: «похудевшая» по алгоритму MoE модель DeepSeek работает на «безмедлительном» чипе от Cerebras.
Что произойдет?
Обвал стоимости.
Во-первых, уменьшенная модель достаточно мала, чтобы целиком поместиться в собственную память чипа. Во-вторых, исчезает узкое место внешней памяти, и скорость реакции ИИ становится невероятно высокой. Конечный результат: стоимость обучения благодаря архитектуре MoE снижается на 90%, стоимость вывода благодаря специализированному hardware и разреженным вычислениям падает еще на порядок. В итоге общая стоимость владения и эксплуатации ИИ мирового класса может составить лишь 10-15% от стоимости традиционного решения на GPU.
Это не улучшение, это смена парадигмы.
Ковер выдергивают из-под трона Nvidia
Теперь должно быть понятно, почему это смертельнее «паники Cowork».
Сегодняшняя многотриллионная капитализация Nvidia построена на простой истории: ИИ — это будущее, а будущее ИИ зависит от наших GPU. Но теперь основа этой истории动摇ется.
На рынке обучения: даже если Nvidia сохранит монополию, но клиенты смогут обходиться в десять раз меньшим количеством карт, общий размер этого рынка может drastically сократиться.
На рынке вывода, этом в десять раз большем «пироге», у Nvidia не только нет абсолютного преимущества, но она еще и подвергается атаке со стороны Google, Cerebras и других «небожителей». Даже ее крупнейший клиент, OpenAI, перебегает к противнику.
Как только Уолл-стрит осознает, что «лопаты» Nvidia больше не являются единственным или даже лучшим выбором, что произойдет с оценкой, построенной на ожидании «вечной монополии»? Думаю, все понимают.
Таким образом, самая большая черная лебедь в ближайшие полгода может быть связана не с тем, какое приложение ИИ кого-то еще «убило», а с, казалось бы, незначительной технической новостью: например, новой статьей об эффективности алгоритма MoE или отчетом, показывающим резкий рост доли рынка специализированных чипов для инференса, которые тихо宣告ят о вступлении войны вычислительных мощностей в новую фазу.
Когда «лопаты» продавца перестают быть единственным выбором, его золотой век, вероятно, подходит к концу.








