К середине 2026 года ключевые операционные показатели индустрии ИИ, такие как выручка и количество вызовов, продолжали расти высокими темпами. Однако, анализируя финансовые и операционные структуры различных компаний, можно обнаружить, что за одними и теми же данными роста скрываются разные бизнес-модели. В данной статье рассматриваются четыре структурных парадокса в текущих бизнес-моделях ИИ: затраты, уровни, ответственность и открытость/закрытость исходного кода. Эти четыре парадокса указывают на один и тот же фундаментальный тренд: интеллект быстро превращается в товар, а прибыль концентрируется лишь в немногих сегментах.
Парадокс затрат: чем дешевле токены, тем тяжелее счет
Когда в марте 2023 года был выпущен GPT-4, цена ввода за миллион токенов составляла 30 долларов, вывода — 60 долларов. Предприятия, использовавшие его для создания систем поддержки клиентов, могли тратить на API за месяц больше, чем зарплата всей команды поддержки. Спустя три года цена на аналогичный уровень интеллекта упала более чем на 95%.
Обычная логика подсказывает, что расходы на ИИ должны сократиться, но реальность оказалась противоположной. В марте 2026 года глобальное еженедельное количество вызовов токенов достигло 20,4 триллиона; ежедневный объем вызовов в Китае превысил 140 триллионов, что более чем в тысячу раз больше, чем в начале 2024 года. Это явление соответствует экономическому парадоксу Джевонса (Jevons Paradox): чем выше эффективность парового двигателя, тем ниже удельный расход угля, но общее потребление угля, наоборот, увеличивается. Падение цены за токен не привело к снижению общей суммы счета.
Причина кроется в изменении структуры спроса. После того как цена стала достаточно низкой, множество задач, ранее экономически нецелесообразных, стали решаться с помощью ИИ. Месячные расходы предприятий выросли с 50 тысяч до 500 тысяч долларов, но при этом выполняются задачи, о которых раньше и не помышляли. Еще более ключевым является сдвиг парадигмы использования: прежнее интерактивное взаимодействие в форме диалога ограничивалось временем человека, в то время как агенты (интеллектуальные сущности) могут работать 24 часа в сутки. За одним сотрудником могут «стоять» 10 агентов, и объем их использования может в десятки раз превышать объем чистого человеческого взаимодействия. Исследования показывают, что потребление токенов для задач программирования агентами примерно в тысячу раз превышает потребление при обычных вопросах и ответах. Если цена за единицу падает на порядок, общее потребление может возрасти на два порядка.
Распределение затрат по цепочке создания стоимости также заслуживает внимания. Возьмем, например, подписку на Claude за 20 долларов в месяц. После вычета затрат на вычислительные мощности, каналы сбыта и операционные расходы у компании-разработчика модели остается небольшая маржа прибыли; при этом прибыль, уходящая на уровень чипов, иногда не меньше, чем у компании-разработчика модели. Пользователи платят за интеллект, но большая часть прибыли остается у поставщиков выше по цепочке.
Сталкиваясь с давлением растущих счетов, отрасль начала переходить от экономии на цене единицы к экономии на задачах: простые задачи направляются малым моделям, для агентов устанавливаются бюджетные лимиты на задачи, чтобы предотвратить холостую работу; единицей расчета также становится уже не цена за миллион токенов, а общая стоимость выполнения задачи. Практика показывает, что при использовании одинаковых моделей и объемов компании, обладающие способностями декомпозиции задач, проверки результатов и интеграции процессов, демонстрируют значительно более высокую эффективность выработки. В то же время модель субсидирования также сходит на нет: Claude Code отменил дешевую подписку, Copilot перешел на поминутную оплату. Эффект Джевонса не исчез: отрасль в итоге поняла, что оптимизировать нужно не прайс-лист, а сами задачи.
В то время как счета растут, повышение эффективности предприятий часто остается незаметным. Солоу (Solow) уже указывал на это: компьютеры повсюду, но их нет в статистике производительности. Электродвигатель является наглядным примером: он появился в 1880-х годах, но американским фабрикам потребовалось около сорока лет, чтобы реализовать его эффективность. Большинство предприятий просто заменяли паровые двигатели электродвигателями, оставляя структуру передачи мощности неизменной, в то время как ценность электричества как раз и требовала перепланировки производственных линий.
Сегодня ситуация с ИИ аналогична. Основатель Databricks Годси (Ghodsi) рассказывал о кейсе: на разработку одного коннектора данных всегда уходило девять месяцев; после внедрения больших моделей первая попытка позволила сэкономить лишь полтора месяца; только когда кто-то полностью перестроил процесс, удалось реализовать поставку за квартал. Его вывод: узкое место не в модели, а в способе организации работы.
Таким образом, парадокс затрат имеет два уровня: парадокс Джевонса говорит, что чем дешевле токен, тем тяжелее общий счет; парадокс Солоу говорит, что без изменения процессов эффективность не попадет в статистику. Первое требует оптимизации задач, второе — реструктуризации процессов.
Парадокс уровней: приложения правят балом, и приложения мертвы
Консенсусом эпохи мобильного интернета было «приложение — король»: тот, кто занимает время пользователя, получает возможность монетизации через рекламу и рекомендации, высокая частота использования бьет низкую, количество открытий равно ценности.
В текущем витке развития ИИ произошел разворот. Хуан Жэньсюн (Дженсен Хуанг) публично заявлял, что экономическая ценность в конечном итоге реализуется на уровне приложений, а успешные приложения потянут за собой всю отрасль. Согласно этой логике, капитал должен был бы концентрироваться на уровне приложений. Однако летом 2026 года преобладающим суждением на рынке первичного размещения было «приложения мертвы»: базовые модели развиваются слишком быстро, и слишком тонкие приложения в любой момент могут быть поглощены естественным расширением возможностей моделей. Капитал в первую очередь устремился в модели и инфраструктуру. Уровень приложений все еще привлекает финансирование, но далеко не так, как в предыдущем цикле, где он считался само собой разумеющимся.
Отраслевая бухгалтерия в определенной степени поддерживает выбор капитала. Разбивая экосистему генеративного ИИ на стеки, при годовом доходе около 400 миллиардов долларов, уровень чипов забирает около 70% выручки и почти 80% валовой прибыли; доход уровня приложений составляет около 60 миллиардов долларов, с валовой маржой преимущественно в диапазоне 0-30%, в то время как маржа чиповых компаний, таких как NVIDIA, может достигать около 70%. Прямоугольная структура эпохи облачных вычислений, где уровень приложений занимал наибольшую долю, в индустрии ИИ перевернулась с ног на голову.
Внутри уровня моделей также происходит дифференциация. У компаний, ориентированных на корпоративные API и зависящих от накопления использования существующими клиентами, выручка взлетает, а валовая маржа на инференсе может исправиться с глубокого убытка до примерно 70%; в то время как у компаний, несущих бремя огромной базы бесплатных пользователей, операционные показатели далеко не соответствуют заголовкам о выручке. Излишек распределяется не равномерно по всему уровню моделей, а концентрируется в немногих направлениях с высокой удержаемостью и высокой маржой. Холодность капитала к приложениям имеет как когнитивные предубеждения, так и финансовые основания.
Продукты ИИ больше не конкурируют за время пребывания пользователя, а за то, готов ли пользователь доверить им выполнение важной задачи. Универсальные чат-боты и универсальные агенты, скорее всего, станут основной ареной сражения ведущих компаний-разработчиков моделей, и у стартапов будет мало шансов на прямую конкуренцию. Направления, которые все еще могут быть жизнеспособными, — это встраивание интеллекта в конкретные сценарии и переделка продукта в соответствии с реальным ходом решения проблемы. Пользователь останется не потому, что продукт подключен к какой-то модели, а потому, что продукт понимает материалы, помнит контекст и может продолжить обслуживание. Harvey много лет углубленно работал в юридической сфере, и накопленные им данные по проверкам и судебным прецедентам не могут быть воспроизведены в короткие сроки.
Отсюда можно вывести простой критерий оценки: когда базовая модель усиливается на одно поколение, увеличивается или уменьшается ценность продукта? Те, чья ценность уменьшается, скорее всего, являются просто оберткой для возможностей модели; те, чья ценность увеличивается, обычно обладают частным контекстом, бизнес-процессами, полной способностью к поставке или каналами сбыта. Звено, где реализуется ценность, не исчезло, просто изменился стандарт его жизнеспособности: кто может стать более незаменимым звеном, когда модель становится сильнее.
Парадокс ответственности: прибыль распределяется в соответствии с ответственностью
Рассмотрим два набора данных. Годовой доход Anthropic (ARR) вырос с примерно 1 миллиарда долларов в декабре 2024 года до более чем 47 миллиардов долларов к маю 2026 года, увеличившись более чем в 40 раз за полтора года. По официальным данным OpenAI: в 2023 году ARR составлял 2 миллиарда долларов, в 2024 году — 6 миллиардов долларов, в 2025 году — более 20 миллиардов долларов, а к концу февраля 2026 года превысил 25 миллиардов долларов.
Однако темпы роста лишь доказывают существование спроса, но не доказывают, что прибыль может удерживаться. Находясь в условиях высокого роста, валовая маржа Anthropic на инфраструктуре инференса выросла с 38% год назад до более чем 70%; в то время как внутренние документы OpenAI, обновленные в ноябре 2025 года, отодвинули срок выхода на положительный свободный денежный поток примерно до 2030 года. Находясь в одной и той же индустрии ИИ, рост двух типов компаний уже начал расходиться. Для объяснения этого расхождения на рынке существует три основных точки зрения, каждая из которых имеет свои основания, но также упускает ключевые моменты.
Первое объяснение: время решит все. Себестоимость инференса снижается на порядок каждый год, и текущий счет за вычислительные мощности, сдерживающий валовую маржу, через два-три года, возможно, перестанет быть проблемой. Облачные вычисления, хранение, пропускная способность — все прошли путь раннего сжигания денег ради масштаба, а затем, после выравнивания кривой затрат, прибыль естественным образом появлялась. Но это объяснение не может ответить на факт: два года с самым быстрым падением затрат как раз и стали годами наиболее явного расхождения в прибыльности. Если падение затрат — лекарство, то прибыльность отрасли должна улучшаться в целом, а не наполовину улучшаться, наполовину ухудшаться. Причина в том, что снижение затрат всеобщее, все производители одновременно выигрывают и одновременно передают выгоду пользователям через снижение цен. Связывать прибыль с дефляцией затрат — значит признавать, что у вас нет ценообразующей власти.
Второе объяснение: на уровне приложений существуют рвы. Продукты для поддержки клиентов, управления обращениями глубоко встроены в системы клиентов, накопление данных и стоимость миграции создают защиту. Это утверждение было верным пять лет назад, но ключевым преимуществом новых инструментов ИИ как раз является то, что стоимость миграции стремится к нулю — они не заменяют системы клиента, а напрямую берут на себя существующие процессы. Что касается накопления данных, то один значительный скачок в возможностях базовой модели может резко обесценить накопленные за годы отраслевые базы знаний. Наиболее показательным примером является Intercom: он запустил Fin, который взимает плату за фактически решенные проблемы — 0,99 доллара за обращение, если проблема не решена — плата не взимается. Это в определенной степени свидетельствует о том, что старая модель продажи инструментов поддержки по количеству мест уже難以維持.
Третье объяснение: взимание платы за результат неосуществимо. Трудно определить, решена ли заявка, следует ли приписывать конверсию продаж ИИ, атрибуция неясна. Поэтому взимание платы по токенам, по количеству мест — это норма, а оплата за результат — лишь маргинальный эксперимент. Проблема атрибуции действительно существует, но она скорее может стать источником ценообразующей власти, а не препятствием: именно потому, что атрибуцию трудно осуществить, производители, способные реализовать атрибуцию в определенных областях, фактически превращают саму способность к атрибуции в барьер. Более того, атрибуция в некоторых областях изначально ясна: решена ли заявка, вернулись ли средства по взысканию долга, урегулировано ли страховое возмещение — все это можно прописать в контракте для проверки. В областях, где атрибуция ненадежна, плата за результат не взимается; в областях с четкой атрибуцией взимается плата за результат; различные модели ценообразования будут сосуществовать долгое время.
Исключив три вышеупомянутых объяснения, остается только одна структурная переменная: насколько широкий охват и насколько строгие обязательства по результату готов взять на себя поставщик. Чем серьезнее ответственность, тем выше валовая маржа и тем больше бюджет. Продажа по токенам борется за ИТ-бюджет, продажа по результату проникает в бюджет на персонал: если отдел тратит на персонал 10 тысяч долларов в месяц, а ИИ может достичь аналогичного результата за 1 тысячу долларов, пространство для ценообразования будет совершенно другим.
Это также отвечает на другой вопрос: почему бизнесы, которые легче всего масштабируются, труднее всего удерживают прибыль. Поддержка клиентов, описание товаров, преобразование голоса в заявки — это объемные бизнесы, которые легко демонстрировать и заключать контракты, но именно они содержат наименьшую ответственность и наиболее легко покрываются базовыми моделями напрямую. Напротив, такие области, как право, медицина — низкочастотные, строго регулируемые, с высокой стоимостью ошибок — требуют тяжелой поставки, длительных циклов продаж, их история не «секси», но они продают процессы, данные и ответственность, и одно обновление модели не может их стереть. Выбор Harvey в пользу права не случаен.
Следовательно, оценивая позицию компании в сфере ИИ, вместо того чтобы фокусироваться на темпах роста и возможностях модели, лучше ответить на два вопроса: за какие результаты она готова нести ответственность, и достаточно ли надежна атрибуция этих результатов. Первое — это желание, второе — способность; без одного из них невозможно получить премию за результат. Этот критерий не гарантирует точности суждений, технологии атрибуции все еще находятся на ранней стадии, а изменения в закупочных привычках предприятий происходят медленнее, чем ожидали оптимисты. Но по направлению: прибыль, скорее всего, будет утекать не к самым быстрорастущим компаниям, а к тем, кто готов брать на себя ответственность и способен ее нести.
Парадокс открытости/закрытости исходного кода: открытый код получает трафик, закрытый код получает доход
Если судить только по объему использования, открытый код уже имеет преимущество. Первые пять моделей по трафику на платформе OpenRouter — это все модели с открытыми весами (open-weight models); по уровню внедрения среди разработчиков открытый код составляет 79%, закрытый — 71%. Китайские модели стали основной силой этого раунда экспансии открытого кода: их доля на этой платформе выросла с менее чем 2% год назад до более 45% в апреле 2026 года, а среди топ-10 моделей их доля в потреблении токенов достигла 61%.
Если судить только по доходу, преимущество закрытого кода также очевидно. Опрос a16z среди CIO предприятий из Global 2000 показал: доля расходов предприятий на модели с открытым кодом снизилась с 19% в прошлом году до 11% в текущем, на закрытый код приходится 89%, средний годовой бюджет на большие модели на одно предприятие составляет около 7 миллионов долларов. Внутри платформы OpenRouter наблюдается та же структура: Anthropic, имея 12% доли токенов, получает 46% доли в денежном выражении.
При разнице в производительности всего в несколько процентов и цене в 5-20 раз ниже, почему предприятия все равно выбирают закрытый код? Потому что предприятия покупают не просто сам интеллект, но и надежность, техническую поддержку, соответствие нормативным требованиям, а также субъекта ответственности на случай возникновения проблем. «Достаточно хорошо» и «можно использовать в ключевых бизнес-процессах» — это две разные вещи. Еще одна деталь в опросе заслуживает внимания: совокупная стоимость владения (TCO) открытого и закрытого кода сближается, скорость снижения цен на закрытый код выше, чем скорость построения доверия к открытому. Поэтому гибридное развертывание становится нормой: для экспериментов и периферийных сценариев используется открытый код, для критических путей — закрытый.
Более глубинное изменение заключается в том, что и сам лагерь открытого кода не зарабатывает на моделях. Мотивация разных поставщиков к открытию исходного кода неодинакова. Некоторые ставят целью экосистему платформы, используя открытые веса для привлечения разработчиков и получения влияния на отраслевые стандарты, субсидируя это основным бизнесом; другие рассматривают модели с открытым кодом как канал привлечения клиентов для облачного бизнеса, стимулируя переход разработчиков в облако и, как следствие, рост облачных доходов. Уровень моделей быстро становится товаром, а пулы прибыли мигрируют к двум концам: вычислительным мощностям наверху и оркестрации, данным и услугам внизу.
Сложность для лагеря закрытого кода заключается в том, что его премия сильно зависит от разрыва в возможностях между поколениями; каждый шаг приближения открытого кода ослабляет его власть над ценообразованием по токенам. Но дефицит не исчез, он просто расслоился: передовые модели по-прежнему дефицитны, а «достаточно хороший» интеллект становится товаром. Поэтому при оценке позиции компании вопрос не в том, выбирает ли она открытый или закрытый код, а в том, на чем она зарабатывает доход, и увеличивается или уменьшается ее доход, когда открытый код делает еще один шаг вперед.
Эта статья из официального аккаунта WeChat «Tencent Research Institute» (ID: cyberlawrc), автор: Лю Цюн (Liu Qiong).








