CUDA снова и снова подвергается атакам...
На этот раз за дело взялся искусственный интеллект, выкормленный самой Nvidia.
Небольшая компания, основанная всего год назад, с помощью AI-агента для программирования потратила всего 10 часов, чтобы создать программное обеспечение, подобное CUDA.

Стоп, стоп, стоп.
Вы хотите сказать, что вся эта программная империя, которую Nvidia строила почти 20 лет, просто так была скопирована??

И это еще не все. DeepSeek тоже пытаются меньше писать низкоуровневого кода на CUDA.
Они уже выложили в открытый доступ библиотеку операторов для GPU под названием TileKernels, написанную на TileLang, что избавляет от необходимости писать вручную большое количество низкоуровневого кода CUDA.
Впрочем, подобные «кризисы CUDA» мы слышим уже не в первый раз.
Периодически CUDA вытаскивают на обсуждение, то заменят, то пробивят, то ров снова разрушат...
Неужели это правда?
«Копирование» CUDA за 10 часов
При упоминании Nvidia первое, что приходит в голову многим, — это GPU.
Благодаря поколениям все более производительных чипов — H100, Blackwell, Rubin — Nvidia получила наибольшую выгоду от текущей волны ИИ.
Но по-настоящему непоколебимым преимуществом Nvidia является не аппаратное обеспечение, а программное обеспечение.
Чипы можно купить, параметры можно догнать, технологические процессы будут развиваться. Что действительно заставляет клиентов, начавших использовать Nvidia, с трудом отказываться от нее, так это целая экосистема программного обеспечения, построенная вокруг GPU.
И CUDA — это ядро этой программной империи.
CUDA, что означает Compute Unified Device Architecture, была создана под руководством топ-менеджера Nvidia Яна Бака и разрабатывалась почти 20 лет.
Ее часто называют языком программирования, но точнее будет сказать, что CUDA — это целая программная платформа, построенная вокруг GPU Nvidia.
Если упрощенно разделить ее на три уровня, то в самом низу находится уровень ядра: Kernel, компилятор и среда выполнения, которые заставляют чип работать напрямую.
Посередине — уровень библиотек — высокооптимизированные вычислительные библиотеки, такие как cuBLAS, cuDNN, а также инструменты отладки, проверки и профилирования производительности.
Наверху находятся фреймворки для разработки, такие как PyTorch и TensorFlow, огромное количество накопленного кода и рабочих процессов компаний, а также сообщество разработчиков, выросшее вокруг CUDA.

△
Это может показаться немного абстрактным, но представьте GPU Nvidia как завод.
Самый нижний уровень CUDA отвечает за то, чтобы сообщить машине, что делать на каждом шаге, средний уровень предоставляет готовые производственные инструменты, а верхний уровень — это целая производственная система, которая уже много лет работает.
Таким образом, клиент получает не просто карту от Nvidia, а готовый к использованию завод.
А теперь появляется парень по имени Джереми Никсон с AI-агентом.

Никсон — основатель стартапа в области ПО для ИИ Infinity, ранее он также был исследователем в Google Brain.
Его команда разработала исследовательского AI-агента под названием Ignition, который специализируется на написании низкоуровневого программного обеспечения для различных ИИ-чипов.
Он может генерировать GPU Kernel, запускать тесты, искать ошибки, измерять производительность, а затем автоматически переписывать код на основе результатов.
Инженеры-люди отвечают за задание общего направления, а всю остальную рутинную и умственно затратную работу поручают агенту выполнять в цикле.
Таким образом, Infinity с помощью Ignition создала для стартапа по производству ИИ-чипов d-Matrix программное обеспечение, подобное CUDA.
Всего за 10 часов.
Что??
Неужели весь тот низкоуровневый код, который раньше требовал многократной отладки инженерами по программному обеспечению для чипов, теперь действительно можно доверить ИИ?

Нельзя сказать, что это полностью спекуляция.
AI-агенты действительно хорошо подходят для таких задач программирования, где есть четкая обратная связь.
Можно ли скомпилировать код, правильно ли он вычисляет результаты, улучшилась ли производительность — все это можно проверить путем фактического запуска.
Таким образом, агент может сформировать полный цикл:
написать код → скомпилировать → запустить → проверить правильность и производительность → продолжить редактирование на основе обратной связи
Однако Infinity в основном атакует первый уровень CUDA: генерирует и оптимизирует вычислительные ядра (Kernel) для логического вывода (inference) для различных чипов и создает базовые программные возможности вокруг этих ядер.
Она разрабатывает универсальную библиотеку для логического вывода, совместимую с различными чипами, но это не означает, что она за 10 часов воспроизвела полную экосистему, накопленную CUDA за почти 20 лет.
Но...
Но!
На самом деле, чтобы получить финансирование в размере 15 миллионов долларов, не нужно воспроизводить CUDA.

Текущая оценка стоимости этой компании уже достигла 100 миллионов долларов.
Неизвестно, угрожает ли это Nvidia, но инвесторы, похоже, очень охотно покупаются на это. (doge)
Логический вывод: запущена вторая линия фронта!
Если AI-агент — это оружие для штурма крепости, то рынок логического вывода (inference) — это брешь в крепостной стене.
Вычисления для больших языковых моделей в основном делятся на два этапа:
Обучение (training) — это создание модели, требующее совместной работы тысяч карт в течение нескольких месяцев; Логический вывод (inference) — это использование обученной модели для ответов на вопросы, что можно выполнить на небольшом кластере или даже на одной карте.
В области обучения CUDA в настоящее время по-прежнему практически не имеет альтернатив.
Крупномасштабное обучение чрезвычайно чувствительно к производительности, стабильности и координации кластера. Любая потеря эффективности в коммуникации между чипами, управлении видеопамятью, восстановлении после сбоев программы, умноженная на тысячи или даже десятки тысяч чипов, превращается в реальное время и затраты.
Поэтому компании при выборе платформы для обучения часто крайне консервативны.
Даже если у других чипов хорошие технические характеристики на бумаге, но их программное обеспечение недостаточно зрелое, кластер недостаточно стабилен, то сэкономленные затраты на оборудование могут многократно компенсироваться затратами на разработку и отладку.
Но в области логического вывода правила игры изменились.
Коммерческий директор корейской компании по производству ИИ-чипов Rebellions Маршал Чой считает:
В области логического вывода CUDA больше не является определяющим фактором. Это будет конкуренция в сфере программного обеспечения с открытым исходным кодом.

Почему конкуренты обратили внимание именно на логический вывод?
Потому что при обучении важен «максимальная производительность», а при логическом выводе — «стоимость каждого ответа».
Для обучения требуются тысячи карт, работающих совместно, а логический вывод можно разделить на небольшие кластеры или даже одну карту; при обучении боятся менять чипы, а при логическом выводе можно.
В любом случае, клиенты готовы попробовать, лишь бы работало и было дешево.
Что еще важнее, программное обеспечение для логического вывода может работать на различных чипах. Если фреймворк для логического вывода сможет поддерживать различные чипы, пользователи смогут переключаться между разным оборудованием, не переписывая код —
Таким образом, главный эффект привязки к CUDA теряет силу.
Это открывает возможности для специализированных чипов для логического вывода.
Не всем задачам логического вывода требуются все возможности CUDA, от обучения до координации кластера. Чипы, разработанные заново для конкретных моделей и сценариев, если они смогут работать быстрее, дешевле или энергоэффективнее, получат шанс отобрать часть рынка у Nvidia.
Например, d-Matrix — это сама компания, специализирующаяся на чипах для логического вывода.

Эта компания была основана в 2019 году и специализируется на чипах для логического вывода в генеративном ИИ.
Соучредитель и генеральный директор Сид Шет вспоминал, что они давно предсказывали, что возможности, открываемые логическим выводом в ИИ, в конечном итоге превзойдут возможности обучения.
Программное обеспечение, подобное CUDA, созданное AI-агентом Infinity за 10 часов, предназначено именно для чипов логического вывода d-Matrix.
Таким образом, складывается полная картина события «10 часов»:
Новый чип хочет выйти на рынок логического вывода, но ему не хватает зрелого программного обеспечения; AI-агент быстро генерирует и оптимизирует низкоуровневые ядра (Kernel), сжимая работу по адаптации, которая могла бы занять месяцы или даже годы, до часов или дней.
Сид также открыто заявил:
Хотя Nvidia сохраняет лидирующие позиции в области обучения, в области логического вывода ее ров стал менее глубоким.

И не только d-Matrix обратила внимание на эту брешь.
Специализирующиеся на логическом выводе Rebellions, d-Matrix, делающая ставку на кристаллы размером с пластину (wafer-scale) Cerebras, Inferentia от Amazon, TPU от Google, MI300X от AMD...
Производители чипов и гиганты облачных вычислений уже выстроились на рынке логического вывода, готовясь отобрать кусок мяса у Nvidia.
Для этих компаний не нужно немедленно заменять Nvidia.
Им просто нужно доказать, что при определенных задачах логического вывода, не полагаясь на полный набор оборудования Nvidia и экосистему CUDA, они тоже могут работать быстрее или дешевле.
Этого достаточно.
Ров Nvidia: пробит или нет?
Ответ, возможно, таков... Еще очень далеко.
Как уже говорилось ранее, за 10 часов был переписан «код адаптации для одного чипа», а у экосистемы CUDA есть библиотеки, инструменты отладки, сообщество и миллионы разработчиков, накопленные за 20 лет.
Это не так-то просто разрушить.
Что еще важнее, сгенерировать код — не значит, что его можно использовать.
Основатель INT21 Бинг Сюй, чья предыдущая компания по разработке ПО для ИИ-чипов HippoML была приобретена Nvidia, сам покинул Nvidia только в апреле этого года.

По его оценке: Агент может быстро сгенерировать большой объем кода, но проверка является самым большим узким местом.
ИИ может быстро сгенерировать десять тысяч строк кода, но «доказать, что эти десять тысяч строк работают правильно и стабильно в различных пограничных случаях» — это крайне медленный процесс.
Самым глубоким активом CUDA как раз является ее инструментарий проверки — поэтому он считает, что в эпоху агентов экосистема проверки станет следующим рвом CUDA.
Соучредитель и генеральный директор Modular Крис Латтнер тоже охладил пыл.

Он считает, что улучшения, приносимые агентами для программирования, являются постепенными, и «спекуляции сильно преувеличены».
Есть три причины: во-первых, написание кода — это лишь малая часть разработки программного обеспечения, именно производственная оптимизация определяет производительность чипа, что напрямую влияет на стоимость запуска ИИ;
Во-вторых, программное обеспечение для чипов — это нишевая элитная область, открытого кода намного меньше, чем для разработки приложений, поэтому ИИ изначально может обучаться на меньшем количестве данных;
В-третьих, затраты на перенос миллионов строк существующего кода все еще существуют, это не решается технологиями, а является организационным решением.
Есть еще один момент, который легко упустить: Nvidia сама использует ИИ.
Вице-президент по развитию экосистемы разработчиков Nvidia Анкит Патель заявил:
Мы также используем AI-агентов для более быстрой разработки CUDA и проверки в большем масштабе.
Использовать собственное копье против щита противника — относительное преимущество атакующей стороны также уменьшится.
Подводя итог, Бинг Сюй считает: Победа в этой битве зависит от того, сможет ли скорость, с которой конкуренты догоняют Nvidia, превысить скорость, с которой Nvidia сама развивается.
Но очевидно, что этот крупнейший в мире производитель чипов «не спит и не стоит на месте».
В целом, в краткосрочной перспективе ров Nvidia остается в безопасности, но изменения начнут незаметно происходить именно в области логического вывода.
Главная загадка в долгосрочной перспективе: ров перемещается с «накопленного кода» на «экосистему проверки и оптимизации».
Кто первым займет новую позицию, тот и станет следующим победителем.
Ссылки:[1]https://www.businessinsider.com/nvidia-cuda-new-threats-ai-coding-agents-2026-8
Эта статья взята с официального аккаунта WeChat «Квантовый бит» (量子位), автор: Ting Yu (听雨)








