Автор: Frank Fu, IOSG
Та пробоина, о которой в 2023 году говорил Дэвид Кан, никогда не была заделана на стороне обучения (training). Её заделали на стороне логического вывода (inference), и рынок только в последние недели начал закладывать это в цены. Когда NVIDIA перестраивает структуру финансовой отчётности вокруг "токенов-услуг", а Cerebras, выходя на IPO, получает 20-кратный ажиотаж на подписку, спор о узких местах завершён. Настоящий вопрос стал следующим: когда логические выводы станут дефицитным ресурсом, на каком уровне стека вычислений осядет ценность.
I. Следовать за GPU: от проблемы в 2 триллиона долларов до проблемы в 6 триллионов
В 2023 году Дэвид Кан из Sequoia сформулировал проблему, нависшую над всем строительством ИИ — "проблему в 2 триллиона долларов". На каждый потраченный на GPU доллар примерно ещё один доллар уходит на его питание в дата-центре, поэтому ежегодные капвложения в GPU означают, что эти чипы в конечном итоге должны принести около 2 триллионов долларов выручки, чтобы окупить этот капитал. Даже делая очень щедрые предположения о доходах от ИИ, он обнаружил "дыру" более чем в 1.25 триллиона долларов между "инвестициями" и "реальной оплатой конечными клиентами". Тревога была прямой: GPU строят с опережением реального спроса.
Год спустя разрыв не сократился, а расширился. В своём продолжении 2024 года, по мере раздувания капвложений у гиперскейлеров, Кан переопределил её как "проблему в 6 триллионов долларов". Медвежья логика свелась к знакомой форме: чрезмерное строительство ведёт к избытку предложения, а избыток сжигает капитал.
Обе статьи по сути задают один вопрос: кто закроет эту дыру? Ответ никогда не появлялся в бухгалтерии на стороне "обучения". Он появился на стороне логического вывода (inference), и рынок только последние несколько недель начал учитывать это в ценообразовании.
II. IPO Cerebras и сжатие логического вывода
Cerebras провела IPO в четверг. Размещение было покрыто в 20 раз сверх предложения, цены установлены почти вдвое выше окончательного повышения в среду. Спрос исходил не от ставки на "убийцу следующего NVIDIA", а от более простой вещи: рынок начал осознавать, что настоящим узким местом в ИИ является вывод (inference), а не обучение (training).
Коронный навык Cerebras — архитектура чипа, которая делает логический вывод чрезвычайно быстрым. Не обучение, а вывод. Именно это и взволновало Уолл-стрит. Рынок логического вывода имеет регулярный, повторяющийся характер, он растёт вместе с использованием. Каждый раз, когда Claude отвечает на вопрос, каждый раз, когда агент выполняет задачу, потребляются вычислительные ресурсы. Обучение происходит один раз, логический вывод никогда не прекращается.
J.P. Morgan оценивает размер рынка логического вывода в 10–50 раз больше рынка обучения. Когда машины начинают выполнять задачи, поставленные другими машинами, то есть при агентном (agentic) расширении, спрос на логический вывод перестаёт расти вместе с количеством пользователей, а растёт вместе с самими вычислительными мощностями.
III. NVIDIA перерисовывает карту: логический вывод выходит на первый план
Если Cerebras — это пробуждение рынка, то последний квартальный отчёт NVIDIA — это подтверждение с вершины цепочки поставок. На последнем созвоне по отчётности Дженсен Хуанг произнёс вслух то, что и так все понимали: спрос на ИИ растёт параболически. Причина проста: агентный ИИ уже наступил. Основной ИИ перешёл от единичного логического вывода к логическому рассуждению и далее к этапу агентов, которые сами вызывают инструменты и организуют задачи. Хуанг говорит: "Токены теперь прибыльны". В эпоху ИИ вычислительная мощность — это доход и прибыль.
Это изменило всю отрасль. Обучение — это единовременная стоимость создания модели, а логический вывод — это регулярная стоимость её работы. И сегодня узкое место именно в выводе, а не в обучении.
NVIDIA зафиксировала эту оценку в своей структуре отчётности. Теперь она раскрывает данные по двум платформам, а не по одной: Дата-центры (Data Center) и Периферийные вычисления (Edge Computing). Дата-центры (в квартале ~$75 млрд, +92% г/г) далее разбиты на Гиперскейлеров (~$38 млрд, +12% кв/кв) и ACIE, то есть Облако ИИ, Промышленность и Предприятия (~$37 млрд, +31% кв/кв). Новая строка — это Периферийные вычисления: $6.4 млрд, +29% г/г, покрывающие конечные точки, где реально работает агентный ИИ и физический ИИ, например, ПК, рабочие станции, базовые станции AI-RAN, роботы и автомобили.
Периферия пока составляет менее 8% от общего дохода, но NVIDIA уже выводит её на уровень "второй платформы" наравне с дата-центрами. Сигнал таков: логический вывод разделяется на два фронта — облачный вывод (cloud inference) в дата-центрах и вывод на конечных устройствах (endpoint inference) на периферии, где ИИ должен видеть, двигаться и действовать в физическом мире. Дорожная карта следует той же логике: Vera Rubin, отгрузки которой начнутся в третьем квартале, имеет пропускную способность логического вывода до 35 раз выше, чем у Blackwell; Хуанг также дал совершенно новую TAM в 2 триллиона долларов для Vera CPU, созданного под агентные нагрузки. Ожидается, что каждая передовая модельная компания переключится на него в первый же день.
Когда самая дорогая компания на планете перестраивает финансовую отчётность вокруг "обслуживания токенов", спор об узких местах уже решён. В оставшейся части статьи обсуждается, кому достанется ценность, когда дефицитным ресурсом станет логический вывод (inference), а не обучение (training).
Сначала сделаем оговорку о границах. Из этих двух фронтов в статье обсуждается облачный вывод (cloud inference), то есть арендованные в дата-центрах GPU, предоставляющие услугу API-токенов. Вывод на конечных устройствах (endpoint inference) работает на локальных чипах внутри самих устройств (Jetson, RTX, Drive, AI-RAN от NVIDIA), полностью минуя стек аренды и агрегации GPU ниже. Здесь давайте рассматривайте его как попутный ветер, усиливающий всю экономику логического вывода и подтверждающий тезис об узких местах, а не рынок, на котором находятся Hyperbolic и Venice — эти две компании полностью находятся на облачной линии.
IV. Сжатие уже наступило
Anthropic — это канарейка в угольной шахте. Использование значительно превысило предварительно настроенные мощности, жалобы на "лоботомированного" Клода заполонили интернет, включая ограниченные ответы, замедленные выводы, сжатые окна контекста. Решение — чистая вычислительная мощность: в мае 2026 года Anthropic взяла под свой контроль весь дата-центр Colossus 1 у SpaceX, 220 000+ GPU NVIDIA, 300+ МВт, и выделила его исключительно под логический вывод (inference), а не под обучение.
Эта мощность разблокировала серию изменений лимитов, каждое из которых является сигналом. 6 мая Anthropic удвоила пятичасовой лимит для Claude Code, отменила ограничения в часы пик и значительно повысила лимиты скорости API для Opus. 13 мая еженедельный лимит Claude Code был снова увеличен на 50% (до 13 июля). Затем, начиная с 15 июня, компания сделала нечто противоположное "щедрости": вывела агентное и программное использование (Agent SDK, headless mode claude -p, CI-пайплайны) из плоских подписок в отдельный пул кредитов (от $20 до $200 в месяц, оплата по ценам API). Этот последний шаг концентрирует весь аргумент в одном действии: агенты потребляют логические выводы быстрее, чем могут выдержать плоские подписки, поэтому их необходимо оценивать по их реальным "регулярным затратам".
Обучение — это единовременные капитальные затраты. Логический вывод — это регулярные операционные расходы, которые накапливаются с каждым новым пользователем, с каждым новым агентом.
V. Этот стек: шесть уровней, одно узкое место
Каждое ИИ-приложение находится в цепочке поставок, которая начинается на фабрике TSMC и заканчивается в API-эндпоинте:


Большинство компаний владеют только одним уровнем. NVIDIA владеет кремнием, CoreWeave владеет bare metal, Together AI владеет оптимизацией логического вывода, OpenRouter владеет маршрутизацией API моделей.
Все, кроме одной.
VI. Hyperbolic: единственная компания, охватывающая три уровня
Hyperbolic запустила свой рынок GPU по запросу в июне 2025 года. В первые месяцы количество её разработчиков превысило 200 000+, среди пользователей — передовые лаборатории ИИ, поисковые системы и крупные потребительские платформы.
Интересна её архитектура.
Hyperbolic не владеет ни одним GPU. Каждая карта поступает от неоклаудов и дата-центров, включая CoreWeave, Lambda Labs, Nebius, а также более мелких операторов с простаивающими мощностями. Это звучит как слабость, но на самом деле является рвом.
Находясь между поставщиками и потребителями GPU, Hyperbolic видит реальные данные, которые не видят другие. Она знает, кто покупает какие GPU, по какой цене и в какое время. Она видит избыток предложения до того, как он станет общеизвестным, видит всплески спроса до того, как они ударят по рынку.
Сегодня сам этот ров — это многооблачная агрегация. Hyperbolic соединяет фрагментированные мощности от десятков независимых облаков и дата-центров в стандартизированный унифицированный пул, позволяя разработчикам арендовать самые дешёвые доступные GPU в любом месте без переговоров с каждым оператором и управления кучей аккаунтов. Чем больше облаков она подключает, тем глубже ликвидность, тем богаче данные о ценообразовании. В дальнейшем команда изучает, как использовать эти данные для моделирования кривых цен на GPU и в конечном итоге задействовать собственный капитал для сглаживания спроса и предложения, взяв на себя роль маркет-мейкера для физических вычислений; однако эта цель всё ещё находится на ранней стадии, а реальная сложная процента в данный момент — это уровень агрегации.
Вот маховик:
-
Подключение большего количества облаков → больше агрегированных предложений
-
Больше предложений → более глубокий рынок и данные о ценах в реальном времени
-
Лучшие данные → более умная маршрутизация сейчас, модели ценообразования в долгосрочной перспективе
-
Лучшая ликвидность и цены → больше разработчиков → больше облаков хотят подключиться
Ни одна другая компания не пытается сделать это. Hyperbolic — единственная компания, одновременно охватывающая уровень аренды GPU, уровень развёртывания и уровень API моделей.
VII. Зеркало Venice
Venice — это самое ясное воплощение экономики логического вывода на уровне приложений, а также полезное сравнение с позицией Hyperbolic. Это приложение для логического вывода с приоритетом приватности: API, совместимый с OpenAI, плюс потребительские подписки (Free / Pro / Pro+ / Max), маршрутизирующие запросы примерно на 75 моделей, около двух третей из которых — модели с открытым исходным кодом или самостоятельно размещённые (Llama, Mistral, Qwen, DeepSeek), остальные — анонимная передача (passthrough) закрытых передовых моделей. Ключевой момент: Venice сама не владеет значительными вычислительными мощностями. Она арендует их у нераскрытых партнёров по GPU и поставщиков конфиденциальных вычислений (NEAR AI Cloud, Phala) и платит передовым лабораториям за пасстраф, поэтому её реальная себестоимость выручки (cost of revenue) — это мощность логического вывода, а не хостинг SaaS.
Что Venice действительно продаёт — это приватность. "Приватизация" здесь — это не превращение общедоступных мощностей в частную собственность, а обёртывание товарного логического вывода гарантией: данные не сохраняются, не используются для обучения, запросы анонимизируются, часть нагрузок работает в TEE, что делает их невидимыми даже для самих операторов. Базовые вычислительные мощности — это массовый товар, надбавка продаётся за эту оболочку приватности. И эта гарантия многослойная, неоднородная: для моделей с открытым исходным кодом, работающих на собственных или TEE GPU, можно добиться почти сквозных конфиденциальных вычислений; но для анонимной передачи закрытых моделей, таких как Claude или GPT, приватность заключается лишь в удалении идентификаторов, а передовая лаборатория на другом конце всё равно обрабатывает ваш исходный промпт. Таким образом, самая сильная приватность покрывает только часть с открытым исходным кодом, для передовых моделей это "анонимность", а не "истинная конфиденциальность". Валовая прибыль Venice = цена подписки − стоимость логического вывода, выплачиваемая ниже по цепочке, а та часть, которую она может брать сверх голой цены API, почти полностью держится на этой премии за приватность, что также объясняет её низкую маржинальность и зависимость от цен пасстрафа передовых моделей.
Дизайн токена упаковывает эту часть спроса на логический вывод. Venice работает на двух токенах: VVV (стейкинг и доступ к платформе) и DIEM, последний — это кредит на логический вывод, каждый DIEM примерно равен $1 стоимости вычислений в день. Платные подписки запускают программируемый выкуп и сжигание VVV (Pro / Pro+ / Max примерно по $2 / $5 / $10 соответственно), а эмиссия уменьшается по фиксированному графику: с 6M → 5M → 4M VVV в месяц до снижения до 3M 1 июля. Выкуп реальный, но является дискреционным и пока незначительным: в апреле и мае было сожжено примерно по $103K, в июне медленно приближается к ~$110K, что намного ниже линии в $200K в месяц.
Фундаментальные показатели здоровее, чем заголовки. Цифра в "$70 млн ARR", ходящая публично, почти наверняка является результатом путаницы между возобновлением подписок и чистым привлечением новых клиентов; защищаемый наблюдаемый интервал ближе к $6–15 млн ARR. Под этим трафик реален: около 136 000 адресов, держащих токены, около 9.9 млн посещений сайта в месяц (~330 000 в день), новые подписки Pro колеблются около линии в ~1400 в день. Это реальный бизнес, но бизнес с низкой маржой, чья экономика зависит от вычислительных мощностей, которые он покупает.
Именно поэтому Hyperbolic находится на уровень выше. Если Venice — это заправка, то Hyperbolic — это нефтеперерабатывающий завод. Venice покупает мощности у того же ограниченного предложения, от которого зависят все; Hyperbolic же агрегирует, стандартизирует это фрагментированное предложение и продаёт его Venice и всем подобным ей игрокам. По мере роста спроса на логический вывод, ценность накапливается не только в приложениях, потребляющих мощности, но и в слое, который агрегирует и маршрутизирует эти мощности и забирает себе себестоимость выручки (cost of revenue), которую платят эти приложения.
VIII. Почему это важно именно сейчас
NVIDIA перестроила финансы вокруг "токенов-услуг". IPO Cerebras доказало, что рынок уже понял, что логический вывод — это узкое место. Антропик мечется в поисках мощностей, доказывая, что это реальная проблема. Агентный и физический ИИ увеличат спрос на несколько порядков, охватив как облачную, так и периферийную линии.
И это также замыкает петлю "проблемы в 6 триллионов долларов" с другой стороны. Медвежья логика Кана, то есть чрезмерное строительство, а затем избыток, в конечном итоге, скорее всего, подтвердится. Но избыток — это как раз оптимальные условия для агрегатора с лёгкими активами: когда цены на GPU падают, а предложение фрагментировано по десяткам облаков, тот игрок, который не владеет оборудованием и маршрутизирует каждую рабочую нагрузку на самую дешёвую доступную карту, будет получать спред, а операторы, владеющие постоянно обесценивающимися GPU, будут нести убытки. Hyperbolic делает ставку на избыток, а не против него.
Компания, которая в конечном итоге победит, будет не той, у которой больше всего GPU, а той, которая сможет сказать вам, какие GPU доступны, где и по какой цене, и направит каждую рабочую нагрузку туда, где её можно запустить с наименьшими затратами.
Hyperbolic строит такую компанию. Не владея GPU, чисто программную, охватывающую три уровня, но стремящуюся стать агрегационным слоем для конечных вычислений логического вывода.





