CUDA ha vuelto a ser vulnerado...
Esta vez, quien ha actuado, ha sido la IA que el propio NVIDIA alimentó.
Una empresa con solo un año de antigüedad, utilizando un Agente de programación con IA, en solo 10 horas, ha montado un conjunto de «software similar a CUDA».

Alto ahí.
¿Estás diciendo que este imperio de software que NVIDIA construyó durante casi 20 años, ha sido así de replicado??

Y no es solo eso. DeepSeek también está intentando escribir menos código CUDA de bajo nivel.
Ya han hecho open-source de una biblioteca de operadores GPU llamada TileKernels, escrita en TileLang, lo que ahorra gran parte del trabajo de escribir manualmente código CUDA de bajo nivel.
Pero similares «crisis de CUDA», tampoco son las primeras que escuchamos.
Cada cierto tiempo, CUDA es sacada a pasear para criticarla, que si la reemplazan, que si la perforan, que si su foso vuelve a ser alterado...
¿Es realmente así?
«Replicar» CUDA en 10 horas
Al mencionar NVIDIA, lo primero que a muchos les viene a la mente son las GPU.
H100, Blackwell, Rubin, aprovechando generaciones de chips cada vez más potentes, NVIDIA se ha llevado el mayor beneficio de esta ola de IA.
Pero la ventaja verdaderamente difícil de mover de NVIDIA, en realidad no es el hardware, sino el software.
Los chips se pueden comprar, los parámetros se pueden seguir, el proceso de fabricación también itera. Lo que realmente hace que los clientes, después de usar NVIDIA, les cueste mucho cambiarse, es todo el ecosistema de software construido alrededor de la GPU.
Y CUDA es el núcleo de este imperio de software.
CUDA, acrónimo de Compute Unified Device Architecture, fue creado por el ejecutivo de NVIDIA Ian Buck y su equipo, durante casi 20 años.
A menudo se le llama lenguaje de programación, pero más precisamente, CUDA es una plataforma de software completa construida alrededor de las GPU de NVIDIA.
Si lo descomponemos en tres capas, la más baja es la capa del kernel, el Kernel que hace trabajar directamente al chip, el compilador y el tiempo de ejecución.
En el medio está la capa de bibliotecas—cuBLAS, cuDNN y otras bibliotecas de computación altamente optimizadas, así como herramientas de depuración, verificación y análisis de rendimiento.
En la parte superior, están los frameworks de desarrollo como PyTorch, TensorFlow, el enorme volumen de código y flujos de trabajo acumulados por las empresas, y el ecosistema de desarrolladores que creció alrededor de CUDA.

△
Esto puede sonar un poco abstracto, pero puedes imaginar la GPU de NVIDIA como una fábrica.
La capa más baja de CUDA se encarga de decirle a la máquina cómo hacer cada paso, la capa intermedia proporciona herramientas de producción listas para usar, y la capa superior es un conjunto completo de sistemas de producción que ya llevan años funcionando.
Así que, para el cliente, lo que compra no es solo una tarjeta de NVIDIA, sino una fábrica lista para usar.
Ahora, un tipo llamado Jeremy Nixon ha llegado con un Agente de IA.

Nixon es el fundador de la startup de software de IA Infinity, y anteriormente también fue investigador en Google Brain.
Su equipo desarrolló un Agente de investigación de IA llamado Ignition, especializado en escribir software de bajo nivel para diferentes chips de IA.
Puede generar GPU Kernels, ejecutar pruebas, buscar errores, medir el rendimiento y luego reescribir el código automáticamente basándose en los resultados.
Los ingenieros humanos se encargan de dar la dirección de alto nivel, y el resto del trabajo tedioso y que requiere mucho esfuerzo mental, se lo dejan al Agente en ciclos repetitivos.
Así, Infinity usó Ignition para construir un conjunto de software similar a CUDA para la startup de chips de IA d-Matrix.
En solo 10 horas.
¿Eh??
¿Es que ahora de verdad se puede confiar a la IA ese código de bajo nivel que antes requería que los ingenieros de software de chips lo depuraran repetidamente?

Realmente no se puede decir que sea puramente exageración.
Los Agentes de IA son realmente adecuados para este tipo de tareas de programación con retroalimentación clara.
Si el código se puede compilar, si los resultados son correctos, si el rendimiento mejora, todo se puede obtener ejecutándolo realmente.
Así, el Agente puede formar un ciclo cerrado completo:
Escribir código → Compilar → Ejecutar → Probar corrección y rendimiento → Continuar modificando según la retroalimentación
Sin embargo, Infinity se ha adentrado principalmente en la primera capa de CUDA: generar y optimizar Kernels de inferencia para diferentes chips, y construir capacidades de software de bajo nivel alrededor de estos Kernels.
Está desarrollando una biblioteca de inferencia genérica orientada a múltiples chips, pero eso no equivale a haber replicado en 10 horas el ecosistema completo acumulado por CUDA durante casi 20 años.
Pero...
¡Pero!
En realidad no necesitas replicar un CUDA, para conseguir 15 millones de dólares en financiación.

La valoración de esta empresa ya ha llegado a 100 millones de dólares.
No se sabe si amenaza a NVIDIA, pero lo que está claro es que el capital lo está comprando bastante. (doge)
¡En el lado de la inferencia, se inicia un segundo frente de batalla!
Si el Agente de IA es el arma para asaltar la ciudad, entonces el mercado de inferencia es la brecha en la muralla.
El cálculo de los modelos grandes se divide principalmente en dos partes:
El entrenamiento es construir el modelo, requiere la colaboración de decenas de miles de tarjetas durante meses; la inferencia es usar el modelo ya entrenado para responder preguntas, puede funcionar en pequeños clústeres o incluso en una sola tarjeta.
En el lado del entrenamiento, CUDA sigue siendo casi invencible por ahora.
El entrenamiento a gran escala es extremadamente sensible al rendimiento, la estabilidad y la colaboración entre clústeres. La comunicación entre chips, la gestión de la memoria, cómo recuperarse cuando un programa falla, cualquier pequeña pérdida de eficiencia, amplificada en miles o incluso decenas de miles de chips, se convierte en tiempo y coste real.
Por lo tanto, las empresas suelen ser extremadamente conservadoras al elegir una plataforma de entrenamiento.
Incluso si otros chips tienen buenos parámetros en papel, siempre que su software no sea lo suficientemente maduro o el clúster no sea lo suficientemente estable, el coste de hardware ahorrado, probablemente se recupere con creces en los costes de desarrollo y prueba y error.
Pero en el lado de la inferencia, las reglas del juego cambian.
Marshall Choy, director comercial de la empresa de chips de IA coreana Rebellions, opina:
En el lado de la inferencia, CUDA ya no es un factor decisivo. Esta será una competencia de software de código abierto.

¿Por qué los competidores están mirando hacia la inferencia?
Porque el entrenamiento se preocupa por el «rendimiento extremo», mientras que la inferencia se preocupa por el «coste de cada respuesta».
El entrenamiento requiere la colaboración de decenas de miles de tarjetas, la inferencia se puede dividir en pequeños clústeres o incluso una sola tarjeta; en el entrenamiento no te atreves a cambiar de chip, pero en la inferencia sí.
En resumen, siempre que funcione y sea barato, los clientes están dispuestos a probar.
Y lo más crucial es que el software de inferencia puede ejecutarse en múltiples chips. Si un framework de inferencia puede soportar múltiples chips, los usuarios pueden cambiar entre diferentes hardwares sin necesidad de reescribir el código——
Así, el mayor efecto de bloqueo de CUDA, queda anulado.
Esto deja una oportunidad para los chips especializados en inferencia.
Las tareas de inferencia no requieren todas las capacidades completas de CUDA, desde el entrenamiento hasta la colaboración en clústeres. Los chips rediseñados para modelos específicos, escenarios específicos, siempre que puedan funcionar más rápido, más baratos o más eficientes energéticamente, tienen la oportunidad de cortar una parte del mercado de NVIDIA.
Por ejemplo, d-Matrix, es en sí misma una empresa de chips centrada en la inferencia.

Esta empresa fue fundada en 2019, se especializa en chips de inferencia para IA generativa.
El cofundador y CEO Sid Sheth recordó que muy pronto juzgaron que la oportunidad que traería la inferencia de IA finalmente superaría al entrenamiento.
El software similar a CUDA que Infinity construyó en 10 horas usando un Agente de IA, sirve precisamente a los chips de inferencia de d-Matrix.
Así, la historia completa del «evento de las 10 horas» se conecta:
Un nuevo chip quiere entrar en el mercado de inferencia, pero carece de software maduro; el Agente de IA genera y optimiza rápidamente Kernels de bajo nivel, comprimiendo el trabajo de adaptación que originalmente podría llevar meses o incluso años, a horas o días.
Sid incluso declaró abiertamente:
Aunque NVIDIA mantiene una posición dominante en el campo del entrenamiento, en el lado de la inferencia, el foso se ha debilitado.

Y no es solo d-Matrix quien mira esta brecha.
Rebellions centrada en inferencia, d-Matrix, Cerebras apostando por chips a nivel de oblea, Inferentia de Amazon, TPU de Google, MI300X de AMD......
Varias fábricas de chips y gigantes de la computación en la nube, ya han desplegado sus fuerzas en el mercado de inferencia, preparándose para arrebatar un trozo de carne a NVIDIA.
Para estas empresas, no necesitan reemplazar a NVIDIA inmediatamente.
Solo necesitan demostrar que, en ciertas tareas de inferencia, sin depender del hardware completo de NVIDIA y del ecosistema CUDA, también pueden funcionar más rápido o más barato.
Eso es suficiente.
El foso de NVIDIA, ¿finalmente se ha alterado o no?
La respuesta puede ser... todavía está lejos.
Como ya se dijo antes, lo que se reescribió en 10 horas fue el «código de adaptación para un chip», mientras que el ecosistema CUDA tiene 20 años de bibliotecas acumuladas, herramientas de depuración, comunidad, millones de desarrolladores.
Esto no es algo que pueda ser alterado fácilmente.
Y lo más crucial es: que se pueda generar código, no significa que se pueda usar.
El fundador de INT21, Bing Xu, cuya anterior empresa de software para chips de IA, HippoML, fue adquirida por NVIDIA, y él mismo dejó NVIDIA en abril de este año.

Su juicio es: El Agente puede generar grandes cantidades de código en poco tiempo, pero la verificación es el mayor cuello de botella.
La IA genera diez mil líneas de código rápidamente, pero «probar que estas diez mil líneas calculan correctamente y funcionan de manera estable en diversas situaciones límite» es extremadamente lento.
El activo más profundo de CUDA es precisamente su cadena de herramientas de verificación—por lo que él cree que, en la era de los Agentes, el ecosistema de verificación se convertirá en el próximo foso de CUDA.
Chris Lattner, cofundador y CEO de Modular, también echó un cubo de agua fría.

Cree que la mejora que traen los Agentes de codificación es incremental, «la exageración está muy inflada».
Tres razones: Primera, escribir código es solo una pequeña parte de la ingeniería de software, la optimización a nivel de producción es lo que determina el rendimiento del chip, determinando directamente el coste de ejecutar IA;
Segunda, el software de chips es un campo de élite y nicho, el código público es mucho menor que en el desarrollo de aplicaciones, y los datos de entrenamiento que la IA puede aprender en esta área ya son escasos;
Tercera, el coste de migración de millones de líneas de código existente sigue ahí, esto no lo puede resolver la tecnología, pertenece a las decisiones organizativas.
Y hay un punto que a menudo se pasa por alto: NVIDIA también está usando IA.
Ankit Patel, vicepresidente del ecosistema de desarrolladores de NVIDIA, declaró:
También estamos usando Agentes de IA para desarrollar CUDA más rápido y para realizar verificaciones a mayor escala.
Usar su propia lanza para atacar el escudo del otro, la ventaja relativa de quien ataca también se reduce.
Bing Xu lo resume así: El resultado de esta batalla depende de si la velocidad a la que los competidores alcanzan a NVIDIA, puede superar la velocidad a la que NVIDIA se itera a sí misma.
Pero está claro que este mayor fabricante de chips del mundo, «no está durmiendo o estancado».
En resumen, a corto plazo el foso de NVIDIA permanece seguro, pero los cambios comenzarán a ocurrir sigilosamente en el lado de la inferencia.
La verdadera incógnita a largo plazo es: el foso se está desplazando del «volumen de código existente» hacia el «ecosistema de verificación y optimización».
Quien ocupe primero la nueva posición, será el próximo ganador.
Enlaces de referencia:[1]https://www.businessinsider.com/nvidia-cuda-new-threats-ai-coding-agents-2026-8
Este artículo proviene del WeChat público «量子位», autor: Escuchando la lluvia






