¿Rubin Ultra recorta especificaciones? ¿Ni siquiera NVIDIA puede soportar el aumento del precio de la memoria?

Odaily星球日报Publicado a 2026-08-03Actualizado a 2026-08-03

Resumen

El informe de SemiAnalysis ha desencadenado un intenso debate en la industria de la IA al revelar posibles ajustes importantes en las especificaciones de Rubin Ultra, la próxima GPU flagship de NVIDIA para IA. Según el informe, Rubin Ultra mantendría el mismo pico teórico de potencia computacional (35 PFLOPs) que Rubin, pero sufriría una reducción significativa en la memoria: se especificaría con 192GB HBM apilado en 8 capas (8-Hi), incluso menos que los 288GB (12-Hi) de Rubin. El ancho de banda de memoria solo aumentaría ligeramente (1 TB/s), y el consumo energético sería similar o ligeramente superior. La mejora principal se centraría en la capacidad de interconexión a escala, soportando clusters de hasta 576 GPUs unidas mediante NVLink (frente a 72 en Rubin), creando un "super-GPU lógico". La causa principal de esta revisión sería el rápido aumento del precio de la memoria HBM, cuyo costo se habría triplicado desde 2025, impactando fuertemente el costo total de los sistemas. Al reducir la cantidad de HBM (bajando su participación en el costo del ~40% al ~28%) e invertir más en la interconexión (subiendo del 4% al 12%), NVIDIA optimizaría la relación costo-rendimiento del sistema completo. Esta noticia provocó una caída de aproximadamente el 8% en las acciones de los principales fabricantes de HBM, SK Hynix y Samsung, reflejando la preocupación del mercado sobre un posible punto de inflexión en la demanda de memoria de alta gama por parte del mayor comprador, NVIDIA, y ...

Original | Odaily星球日报(@OdailyChina)

Autor|Azuma(@azuma_eth)

El pasado fin de semana, un informe de la conocida firma de investigación de inversiones SemiAnalysis generó un intenso debate en toda la industria de la IA.

El contenido central del informe es que, tras la revelación de SemiAnalysis a finales de junio de que el diseño original de 4 chips (4-die) de Rubin Ultra de NVIDIA sería reducido a la mitad, la firma ha vuelto a revelar que NVIDIA ha proporcionado una vista previa de Rubin Ultra a sus principales clientes, pero sus especificaciones han disminuido aún más respecto a las expectativas anteriores.

A continuación, se presenta una captura de pantalla de la información relacionada con Rubin Ultra filtrada en el informe de SemiAnalysis:

  • Rubin Ultra mantendrá el mismo pico teórico de potencia de cálculo que Rubin, ambos de 35 PFLOPs;
  • Recorte severo en la capacidad de memoria gráfica, las especificaciones se reducen a 192GB con apilamiento de 8 capas (8-Hi), incluso por debajo de los 288GB con apilamiento de 12 capas (12-Hi) de Rubin;
  • El ancho de banda de memoria apenas cambia, solo aumenta 1 TB/s, prácticamente insignificante en cálculos reales de alto rendimiento;
  • El consumo energético a nivel de chip incluso aumenta ligeramente, el consumo mínimo es el mismo que el de Rubin (1800 W), el máximo es aún mayor (2600 W);
  • La única mejora significativa es la "escala de interconexión de expansión" (Scale-up world size), que aumenta de 72 GPUs a 576 GPUs, lo que significa que NVIDIA ha trasladado el verdadero punto de venta a la red de clústeres. A través de la red NVLink, puede conectar hasta 576 Rubin Ultra para formar un enorme "super GPU lógica" (la versión estándar solo admite la interconexión de hasta 72 tarjetas).

Como la versión insignia de gama alta de Rubin, anunciada con gran expectación por NVIDIA en GTC 2026, Rubin Ultra estaba originalmente diseñada para integrar más chips (die) y memoria de alto ancho de banda, específicamente para satisfacer las necesidades de entrenamiento e inferencia de modelos de IA a escala extrema. Sin embargo, según los detalles de especificaciones revelados más recientemente por SemiAnalysis, NVIDIA ha ajustado claramente el enfoque de diseño de Rubin Ultra.

El HBM sube demasiado rápido, NVIDIA comienza a replantearse las cuentas

En los últimos dos años, uno de los componentes más críticos en la expansión de la industria de la IA ha sido, sin duda, el HBM.

Con la explosión de demanda de aceleradores de IA como Nvidia H100, H200, Blackwell, la memoria de alto ancho de banda pasó de ser un producto de almacenamiento de alta gama relativamente nicho a convertirse en el eslabón más escaso en toda la infraestructura de IA. SK Hynix, Samsung y Micron, mientras batían récords de resultados, aumentaron sus inversiones en HBM. El desequilibrio entre oferta y demanda del mercado continúa impulsando el alza de precios del HBM.

Para los fabricantes de chips de IA, la importancia del HBM es evidente: la GPU se encarga del cálculo, el HBM proporciona el alto rendimiento de datos; ambos determinan conjuntamente la eficiencia del entrenamiento e inferencia de modelos de IA. Pero el problema es que el HBM ya se ha encarecido hasta el punto de empezar a afectar la economía general del sistema de IA. Tomando como ejemplo el HBM3, el precio de un HBM3 en el punto más bajo del Q2 de 2025 era de solo 180-220 dólares, en el Q1 de este año (precio de contrato) ya había subido a 600-700 dólares, y en el Q2 (precio spot) incluso a 700 - 850 dólares.

Según los cálculos de SemiAnalysis, con el aumento del precio del HBM, el costo puro de materiales (BOM) por bastidor de Rubin Ultra pasó de aproximadamente 6.6 millones de dólares a 8 millones, y tras ajustar las especificaciones de diseño, el costo puede retroceder a unos 6.4 millones de dólares.

Para NVIDIA, una diferencia de coste tan enorme plantea un problema muy real: si continúa aumentando la capacidad de HBM según el diseño original, ¿seguirá proporcionando una mejora de rendimiento que justifique el coste? ¿Existe alguna otra solución más óptima?

SemiAnalysis responde a esto en su informe. El ajuste de Rubin Ultra es, en esencia, una reoptimización por parte de NVIDIA de la estructura de costes del sistema de IA con recursos limitados. Es decir, reducir la configuración de HBM relativamente cara (su porcentaje de coste baja de cerca del 40% al 28%) y destinar recursos a capacidades de interconexión de expansión de mayor valor (su porcentaje de coste sube del 4% al 12%).

Como se mencionó anteriormente, la dirección central de actualización de Rubin Ultra se ha reorientado ahora hacia la "capacidad de interconexión de expansión a nivel de sistema". La arquitectura NVL576 admitida por Rubin Ultra puede conectar hasta 576 GPUs mediante NVLink para formar un dominio de computación unificado, con el objetivo de compensar los ajustes en las especificaciones de un solo chip mediante una expansión del sistema a mayor escala.

Caída de las acciones de memoria, el mercado teme que la demanda haya tocado techo

Posiblemente impactadas por esta noticia, las acciones del sector de la memoria abrieron a la baja esta mañana en la bolsa surcoreana. Hasta las 11:45 hora de Beijing, SK Hynix y Samsung, los dos líderes en HBM, cayeron alrededor de un 8%, y el índice KOSPI también cayó aproximadamente un 5%.

El mercado ya comienza a preocuparse de que, si los ajustes de especificaciones de Rubin Ultra revelados por SemiAnalysis son ciertos (NVIDIA aún no ha confirmado públicamente la información), ¿significaría que NVIDIA, como el comprador central más importante en la infraestructura de IA, está reduciendo su demanda de HBM?

En los últimos dos años, con el rápido crecimiento de la demanda de expansión de la IA, el HBM se ha convertido en la parte más escasa de la infraestructura de IA. NVIDIA, AMD y otros fabricantes de chips han seguido aumentando la configuración de HBM en sus aceleradores de IA, impulsando el espectacular crecimiento de los resultados de fabricantes de memoria como SK Hynix, Samsung y Micron, y reforzando continuamente su poder de fijación de precios en toda la cadena industrial.

La elección de NVIDIA podría significar que los fabricantes de chips de IA están considerando optimizar el diseño del hardware para reducir la dependencia de un solo chip de HBM de alta capacidad. Si este camino demuestra ser viable, es muy probable que el espacio para continuas subidas de precios por parte de los fabricantes de HBM se vea limitado.

La construcción de la infraestructura de IA tarde o temprano se despedirá de la era de la "acumulación frenética de especificaciones y el aumento de precios irreflexivo". Y ahora, incluso NVIDIA, sentada en el trono de hierro de la potencia de cálculo, ha comenzado a ser más cuidadosa con los costes.

Preguntas relacionadas

Q¿Cuáles son las principales especificaciones del Rubin Ultra de NVIDIA según el informe de SemiAnalysis?

ASegún el informe de SemiAnalysis, las especificaciones clave del Rubin Ultra son: potencia teórica máxima de 35 PFLOPs (igual que Rubin), memoria gráfica reducida a 8 capas apiladas (8-Hi) y 192 GB, ancho de banda de memoria prácticamente sin cambios (solo 1 TB/s más), potencia del chip ligeramente superior (hasta 2600 W) y una gran mejora en la interconexión de escala, que soporta hasta 576 GPUs conectadas mediante NVLink.

Q¿Por qué NVIDIA está reduciendo la configuración de HBM en el Rubin Ultra?

ANVIDIA está reduciendo la configuración de HBM (High Bandwidth Memory) en el Rubin Ultra principalmente debido al rápido aumento de los precios de la memoria HBM. Este encarecimiento está afectando la rentabilidad general del sistema de IA, por lo que la compañía está optimizando la estructura de costes, reduciendo la dependencia de HBM y reasignando recursos hacia capacidades de interconexión más valiosas.

Q¿Qué impacto tuvo el informe sobre Rubin Ultra en el mercado de valores de las empresas de memoria?

AEl informe sobre la reducción de especificaciones del Rubin Ultra provocó una caída en las acciones de empresas de memoria. En la apertura del mercado surcoreano, SK Hynix y Samsung, los dos principales fabricantes de HBM, cayeron aproximadamente un 8%, y el índice KOSPI bajó alrededor de un 5%. El mercado teme que NVIDIA, como comprador clave, esté reduciendo su demanda de HBM.

Q¿Cuál es el cambio principal en la arquitectura de interconexión del Rubin Ultra?

AEl cambio principal en la arquitectura de interconexión del Rubin Ultra es la introducción de la arquitectura NVL576, que permite conectar hasta 576 GPUs mediante NVLink para formar un único dominio de computación unificado. Esta mejora busca compensar los ajustes en las especificaciones individuales del chip mediante una mayor escalabilidad a nivel de sistema.

Q¿Cómo ha evolucionado el precio de la memoria HBM3 según el artículo?

ASegún el artículo, el precio de la memoria HBM3 ha experimentado un aumento significativo: en el segundo trimestre de 2025, el precio bajo era de 180-220 dólares; en el primer trimestre de 2026 (precio contractual), subió a 600-700 dólares; y en el segundo trimestre de 2026 (precio spot), alcanzó los 700-850 dólares.

Lecturas Relacionadas

¿Los modelos generativos también pueden entrenarse de extremo a extremo? El núcleo es un bucle for

El entrenamiento de modelos generativos siempre ha sido un reto debido a la "desviación por exposición" (exposure bias): durante el entrenamiento solo se aprenden pequeños pasos, mientras que la generación requiere cientos de iteraciones, lo que causa acumulación de errores. Esto ha impedido que los modelos generativos sean entrenados de extremo a extremo (end-to-end), a diferencia de otras tareas de aprendizaje profundo. Un reciente artículo de la Universidad de Illinois y Harvard introduce "Explorative Modeling (XM)", un nuevo paradigma que resuelve este problema mediante un bucle simple (for). La idea clave es que, en cada paso de entrenamiento, el modelo genera K candidatos y solo retropropaga el gradiente a partir del candidato más cercano a los datos reales. Este enfoque evita que el modelo converja a un promedio borroso entre múltiples modos (mode blurring), un problema inherente a las funciones de pérdida de reconstrucción típicas. XM identifica una tercera dimensión escalable, además de los parámetros y los datos: la "expresividad generativa". Los experimentos en imágenes, video y lenguaje muestran que aumentar la exploración (K) mejora monótonamente el rendimiento, con ganancias de eficiencia en FLOPs, muestras y parámetros. En tareas de control robótico, una política exploratoria XM iguala o supera a políticas de difusión que requieren 100 veces más cómputo en inferencia. El trabajo sugiere que, a gran escala, la expresividad generativa se convierte en el cuello de botella principal, y XM ofrece un camino para modelos generativos verdaderamente end-to-end, generando muestras de alta calidad en una sola pasada hacia adelante.

marsbitHace 1 hora(s)

¿Los modelos generativos también pueden entrenarse de extremo a extremo? El núcleo es un bucle for

marsbitHace 1 hora(s)

¿Máximo de 20 artículos por persona? La nueva norma de ICLR recibe una «petición» sarcástica de un investigador de DeepMind

Un investigador de DeepMind satiriza la nueva norma de ICLR que limita a 20 artículos por autor. La conferencia de IA ICLR 2027 ha establecido una nueva regla: cada autor solo puede figurar en un máximo de 20 trabajos enviados. Los que excedan este límite serán advertidos y, de no corregirse, algunos serán rechazados aleatoriamente. La justificación es la enorme presión sobre el sistema de revisión, tras un aumento del 68% en los envíos para ICLR 2026 (19,525 trabajos). Dan Roy, investigador de Google DeepMind, respondió con una "petición" irónica en X, pidiendo que se elimine el límite. Su mensaje, cargado de sarcasmo, sugiere que los agentes de IA ahora pueden producir investigaciones incrementales y que, "dado que todo el trabajo de revisión ya lo hacen los grandes modelos de lenguaje", debería animarse a enviar más trabajos, no menos. Su sátira apunta a un problema real: el uso de IA tanto en la autoría como en la revisión. Un análisis de 2025 detectó que aproximadamente el 21% de las revisiones de ICLR 2026 eran probablemente generadas completamente por IA. La broma de Roy plantea una pregunta seria: en un entorno donde agentes generan artículos, autores los envían en masa y revisores potencialmente usan IA, ¿limitar el número de envíos es la solución adecuada? El debate sobre la calidad versus la cantidad, y el papel de la IA en la academia, continúa.

marsbitHace 2 hora(s)

¿Máximo de 20 artículos por persona? La nueva norma de ICLR recibe una «petición» sarcástica de un investigador de DeepMind

marsbitHace 2 hora(s)

Trading

Spot
活动图片