Artículos Relacionados con Inferencia

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Inferencia", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

La ansiedad de memoria de los grandes modelos, la solución podría estar en la unidad USB

Según un artículo publicado por IEEE, surge una nueva estrategia inesperada para aliviar la ansiedad por la memoria en los modelos de lenguaje grandes (LLM): utilizar la tecnología **NAND Flash**, la misma que se emplea en las memorias USB. Tradicionalmente, la memoria Flash se ha considerado lenta, especialmente para tareas de IA. Sin embargo, empresas como SanDisk y SK Hynix están promoviendo el **High Bandwidth Flash (HBF)**. Esta tecnología aplica métodos avanzados de empaquetado y apilamiento 3D (similares a los usados en la memoria HBM) a los chips NAND Flash. El objetivo es permitir que la memoria Flash, originalmente diseñada para almacenamiento, participe en el suministro de datos de alta velocidad durante la **inferencia de IA**. La clave está en que la Flash es lenta principalmente para **escribir**, pero su velocidad de **lectura** puede ser mucho mayor. Al apilar múltiples chips, el HBF busca alcanzar un gran ancho de banda de lectura (hasta 1.6 TB/s en su primera generación, con objetivos de 3.2 TB/s) y una alta capacidad (hasta 512 GB por pila). La propuesta no pretende reemplazar a la costosa y ultrarrápida HBM, sino **complementarla**. En la fase de inferencia, los pesos del modelo están congelados y se accede a ellos principalmente para lectura. El HBF podría actuar como un **"grupo de memoria de solo lectura de gran capacidad"** para almacenar estos pesos masivos y estáticos, liberando así la valiosa HBM para los datos de cálculo más críticos y frecuentes. Esto podría aliviar los cuellos de botella de capacidad y costo, reducir el número de aceleradores necesarios en los servidores y mejorar la eficiencia energética. Aunque el HBF aún no es un producto maduro (se estima que su despliegue a gran escala llevará años) y su estandarización está en curso dentro del Open Compute Project (OCP), representa una señal importante. Indica que la arquitectura de memoria para la IA está evolucionando hacia un **sistema en capas**, donde cada tipo de dato (ultrarrápido, de lectura intensiva, almacenamiento frío) reside en la tecnología más adecuada en términos de rendimiento, capacidad y coste. La solución a los desafíos de escalabilidad de los LLMs podría venir no solo de memorias más caras, sino de reinventar y reempaquetar tecnologías ya conocidas, como la Flash.

marsbit07/20 00:22

La ansiedad de memoria de los grandes modelos, la solución podría estar en la unidad USB

marsbit07/20 00:22

Un artículo sobre ingeniería de prompts aceptado en ICML 2026 desata polémica en línea

Un trabajo sobre ingeniería de prompts titulado "Verbalized Sampling" ha sido aceptado en ICML 2026, generando un intenso debate. El método propuesto busca resolver el problema del "colapso modal" en LLMs (modelos de lenguaje grandes), donde las respuestas tienden a ser repetitivas y poco diversas. En lugar de modificar algoritmos o reentrenar modelos, los autores introducen un sencillo cambio en el prompt: piden al modelo que genere múltiples respuestas *y* asigne a cada una un valor de probabilidad estimado. El estudio argumenta que la raíz del problema está en el "sesgo de tipicalidad" presente en los datos de preferencias humanas utilizados para el alineamiento, que favorece respuestas convencionales. Su solución, la "Muestreo Verbalizado" (VS), recuperaría la distribución diversa aprendida durante el pre-entrenamiento. Los experimentos muestran que, en tareas de escritura creativa, la diversidad aumenta entre 1.6 y 2.1 veces sin comprometer la precisión factual o la seguridad. La comunidad en Reddit está dividida. Algunos critican la innovación como mínima, señalando la aparente simplicidad del truco de prompt y cuestionando su generalización. Otros la defienden, comparándola con hitos como el "pensamiento paso a paso" (CoT), y destacan su rigor teórico, experimentación exhaustiva y la valiosa contribución al diagnosticar la causa del colapso modal. El debate refleja una discusión más amplia sobre qué constituye una investigación legítima en el aprendizaje automático actual.

marsbit07/15 08:01

Un artículo sobre ingeniería de prompts aceptado en ICML 2026 desata polémica en línea

marsbit07/15 08:01

Explosión de fábricas de tokens de IA: Profesores y estudiantes de la Universidad de Tsinghua recaudan 10 mil millones en medio año

¿Quién produce los “recursos básicos” de la era de la IA? Tendium Technology, un equipo formado por profesores y estudiantes de la Universidad de Tsinghua, ha llamado la atención tras recaudar más de 10 mil millones de yuanes en medio año. Fundada a finales de 2023, la empresa se centra en la inferencia de modelos de IA, posicionándose como una “fábrica de tokens de IA de alta calidad”. A diferencia de muchas startups que priorizan el entrenamiento de modelos, Tendium eligió optimizar el proceso de inferencia, donde se genera el valor económico real. Su plataforma ATaaS (Token as a Service) emplea tecnologías patentadas como “colaboración heterogénea de sistema completo” y “cómputo por almacenamiento” para producir tokens de IA de manera estable, eficiente y a bajo costo para clientes empresariales. La demanda de inferencia de IA se está disparando. Los datos oficiales muestran que el uso diario de tokens en China superó los 140 billones en marzo de 2026. Tendium ha experimentado un crecimiento explosivo: sus ingresos de junio de 2026 superaron el total de 2025. La compañía opera bajo dos modelos: producción directa de tokens para grandes clientes y “coproducción”, donde ayuda a socios con recursos de cómputo a construir y operar sus propias fábricas de tokens. Con un equipo técnico de primer nivel respaldado por Tsinghua y una validación comercial rápida, Tendium se perfila como un actor clave en la construcción de la infraestructura esencial para la economía de los tokens de IA.

marsbit07/13 03:46

Explosión de fábricas de tokens de IA: Profesores y estudiantes de la Universidad de Tsinghua recaudan 10 mil millones en medio año

marsbit07/13 03:46

DeepSeek fabrica en secreto su propio chip, especializado en inferencia, iniciado hace un año, con un proceso de contratación no público

DeepSeek está desarrollando en secreto su propio chip de IA, centrado en inferencia, según información de Reuters. El proyecto, iniciado hace aproximadamente un año, busca reducir la dependencia de la empresa de proveedores externos como NVIDIA. Aunque se encuentra en etapas tempranas, DeepSeek ya ha establecido contactos con diseñadores de chips, fundiciones y proveedores de memoria. Históricamente conocida por su optimización algorítmica, la compañía ha estado contratando ingenieros de diseño de chips de forma discreta, sin publicar ofertas en plataformas abiertas. Esta estrategia se alinea con una tendencia global donde empresas de modelos de IA, como OpenAI y Anthropic, también exploran el desarrollo de hardware propio. El chip está específicamente diseñado para inferencia, una necesidad crítica a medida que se expanden las aplicaciones de IA. DeepSeek ya ha preparado el terreno con formatos de datos como el UE8M0 FP8, optimizados para hardware futuro. Sin embargo, el desarrollo de un chip competitivo conlleva grandes desafíos en tiempo y coste. El esfuerzo está respaldado por una ronda de financiación de aproximadamente 510 mil millones de yuanes (74 mil millones de dólares) completada en junio de 2026. Los fondos se destinarán a centros de datos con chips domésticos, el desarrollo del chip y la expansión del equipo. La compañía también está reclutando para proyectos de infraestructura, como centros de datos en Ulanqab, Mongolia Interior. DeepSeek mantiene su perfil bajo y no ha comentado públicamente sobre el proyecto.

marsbit07/08 02:06

DeepSeek fabrica en secreto su propio chip, especializado en inferencia, iniciado hace un año, con un proceso de contratación no público

marsbit07/08 02:06

Un megavatio alimenta 60.000 agentes, el GB300 de NVIDIA supera en 20 veces a su predecesor

NVIDIA anuncia que su nuevo sistema GB300 NVL72, utilizando un consumo de energía de un megavatio, puede manejar concurrentemente hasta 61.400 agentes de IA, una mejora de 20 veces sobre la generación anterior H200 (aproximadamente 2.600 agentes por megavatio). Este rendimiento superior se mide utilizando el nuevo punto de referencia AA-AgentPerf, el primero diseñado específicamente para evaluar la inferencia de "agentes de IA". A diferencia de los puntos de referencia tradicionales que miden solicitudes únicas, AA-AgentPerf simula la carga de trabajo real de un agente, como un asistente de programación, que ejecuta docenas o cientos de llamadas encadenadas al modelo, intercaladas con llamadas a herramientas, lo que genera contextos largos y variables. La métrica clave es "agentes concurrentes por megavatio", midiendo cuántos agentes activos puede sostener un sistema bajo un objetivo de nivel de servicio (SLO) específico, como generar 20 o 60 tokens por segundo. La ventaja del GB300 NVL72 no es solo una mejora en el chip, sino una victoria a nivel de sistema. Conecta 72 GPUs en un solo rack mediante NVLink, permitiendo que modelos grandes, como los Mixtos de Expertos (MoE), se distribuyan eficientemente. La optimización del software, incluido TensorRT-LLM, también contribuye. Los resultados muestran que, para un modelo MoE avanzado, el GB300 logra ~57.5 agentes por GPU, frente a ~1.4 del H200, una ventaja de 40 veces por GPU. Es importante señalar que la prueba simula sesiones pre-grabadas y no refleja directamente la capacidad de producción. AA-AgentPerf es un estándar emergente que busca llenar el vacío para medir el rendimiento de los agentes de IA en condiciones realistas, donde la eficiencia energética y la densidad de servicio son cruciales.

marsbit07/06 01:06

Un megavatio alimenta 60.000 agentes, el GB300 de NVIDIA supera en 20 veces a su predecesor

marsbit07/06 01:06

Tanto OpenAI como Anthropic se proponen "desarrollar sus propios chips": más allá del coste, lo más importante es el control de la capacidad de cálculo

Según informes, Anthropic está negociando con Samsung para desarrollar chips de IA personalizados, siguiendo los pasos de OpenAI. Ambas empresas buscan reducir costes y, lo más importante, controlar su infraestructura de cómputo. Actualmente, dependen en gran medida de proveedores como Nvidia, lo que genera incertidumbre y altos costes operativos. El objetivo principal no es solo sustituir a proveedores externos, sino lograr una optimización integral entre el software y el hardware. Los chips personalizados permitirían adaptar el diseño de los modelos de IA a la arquitectura del chip, mejorando la eficiencia energética y el rendimiento. Expertos señalan que la mayor ganancia de eficiencia proviene de este diseño conjunto, no solo de chips más rápidos. Aunque OpenAI y Anthropic avanzan hacia chips propios, esto no reemplazará de inmediato a las GPU de Nvidia, que mantienen ventajas en adaptabilidad y ecosistema. En cambio, los chips personalizados probablemente se usarán para cargas de trabajo específicas, como la inferencia. Esta tendencia refleja una competencia más amplia en la industria por la autonomía en cómputo. Empresas como Google, Amazon, Meta y Microsoft también desarrollan sus propios chips. Para Samsung, obtener el contrato de fabricación de Anthropic supondría un impulso significativo en el competitivo mercado de semiconductores para IA.

marsbit07/03 13:42

Tanto OpenAI como Anthropic se proponen "desarrollar sus propios chips": más allá del coste, lo más importante es el control de la capacidad de cálculo

marsbit07/03 13:42

Acciones de semiconductores se desploman, pero Anthropic quiere fabricar un chip de 2 nm

**Anthropic planea su propio chip de IA de 2nm con Samsung** La startup de inteligencia artificial Anthropic, creadora del modelo Claude, ha iniciado los primeros trabajos para diseñar su propio chip de IA, según fuentes citadas por The Information. Las conversaciones exploratorias con Samsung apuntan a utilizar el avanzado proceso de fabricación de 2 nanómetros y tecnologías de empaquetado de la empresa coreana. Esta iniciativa, aún en fase inicial y sujeta a posibles cancelaciones, tiene como objetivo principal desarrollar un chip optimizado para **inferencia**, el proceso de ejecución de modelos ya entrenados. Esto permitiría a Anthropic ejecutar sus modelos de manera más rápida, eficiente y con menor coste operativo, reduciendo su dependencia de proveedores externos como NVIDIA, AWS o Google. La elección de Samsung no es casual. El gigante tecnológico coreano participó como inversor estratégico en la última ronda de financiación de Anthropic. Para Samsung, fabricar un chip de vanguardia para una empresa líder en IA supone una oportunidad clave para competir contra TSMC en el lucrativo negocio de la **fabricación por contrato (foundry)**. Anthropic enfatiza que, a corto plazo, su expansión en capacidad de cálculo seguirá dependiendo de los chips de sus socios actuales (Trainium de AWS, TPU de Google y GPUs de NVIDIA). La compañía mantiene una estrategia de múltiples proveedores para mitigar riesgos, incluyendo acuerdos a largo plazo por valor de cientos de miles de millones con AWS y Google, y el alquiler de un enorme clúster de GPUs de NVIDIA a través de xAI. Este movimiento se enmarca en una tendencia más amplia: las principales empresas de IA (OpenAI, Google, Amazon, Meta) buscan desarrollar **chips propios personalizados** para ganar eficiencia y control en su infraestructura crítica. Sin embargo, analistas señalan que esta búsqueda de independencia crea interdependencias más complejas, ya que todas dependen de los mismos fabricantes de chips asiáticos para su producción. Pese a estos esfuerzos, NVIDIA mantiene una posición dominante, con una cuota de mercado en inferencia que roza el 75%.

链捕手07/03 10:00

Acciones de semiconductores se desploman, pero Anthropic quiere fabricar un chip de 2 nm

链捕手07/03 10:00

GPT diseña GPT

OpenAI ha presentado su primer chip, Jalapeño, un cambio estratégico que va más allá de competir con Nvidia. La empresa busca controlar todo el proceso de producción de inteligencia artificial, desde los modelos hasta el hardware, la energía y los centros de datos. La brecha entre modelos líderes se está reduciendo, mientras que la ventaja competitiva se desplaza a capas más profundas: suministro de computación, costes de inferencia y eficiencia de sistemas. Cada token generado implica un costo, y OpenAI, con productos de gran consumo como ChatGPT, necesita reducir esta "tasa de inferencia" para fortalecer su rentabilidad y defensa competitiva a largo plazo. Jalapeño, un chip ASIC optimizado para inferencia de modelos de lenguaje, fue desarrollado en solo nueve meses con Broadcom. Este plazo résubevela la ventaja clave de OpenAI: utiliza su propio conocimiento interno sobre cómo se ejecutan sus modelos masivos en producción para guiar el diseño del hardware. Esencialmente, GPT ayuda a diseñar las máquinas que ejecutarán la próxima generación de GPT, creando un ciclo de retroalimentación potente. El enfoque en la inferencia es crucial porque, a diferencia del entrenamiento (una inversión puntual enorme), la inferencia consume el flujo de caja diario. Al optimizarla, OpenAI reduce costes operativos fundamentales para su escalabilidad comercial, especialmente con futuros agentes de IA que realizarán cadenas largas de razonamiento. Este movimiento refleja una ambición mayor: OpenAI no quiere ser solo un proveedor de modelos, sino construir un ecosistema integrado al estilo de Apple, donde el software, el hardware y la infraestructura se optimizan mutuamente en un ciclo cerrado. A corto plazo depende de Nvidia, pero al trazar su propia hoja de ruta de chips, emerge como un nuevo tipo de actor en la infraestructura de IA. En resumen, OpenAI ya no aspira solo a crear la inteligencia más avanzada, sino a controlar los medios completos de su producción.

marsbit06/25 14:06

GPT diseña GPT

marsbit06/25 14:06

CBRS: Ingresos duplican en primer informe tras salida a bolsa, pero pronóstico de margen bruto cae drásticamente; ruta de ejecución del gran contrato de OpenAI es demasiado larga

Cerebras (CBRS) presentó sus primeros resultados trimestrales tras su OPI, con ingresos centrales del Q1 de 1.913 millones de dólares, un aumento interanual del 92%, superando las expectativas. Sin embargo, la guía de margen bruto para el Q2 cayó bruscamente del 46,5% a un rango del 36-38%, lo que hizo que las acciones cayeran más de un 10% en operaciones extrabursátiles. La compañía, que fabrica chips a partir de obleas de silicio completas y apuesta por la IA para inferencia, tiene un contrato de más de 20.000 millones de dólares con OpenAI y un marco de colaboración con AWS. Su guía de ingresos anuales es de 855-865 millones de dólares. El informe revela una transición en su modelo de negocio: de vender hardware a vender potencia de cálculo en la nube. Esto explica en parte la presión sobre los márgenes, atribuida a la escasez temporal de capacidad en centros de datos. Aunque los ingresos superaron las expectativas, la concentración de clientes sigue siendo alta (dos entidades relacionadas de Emiratos Árabes Unidos representaron el 86% de los ingresos en el año fiscal 2025). Los grandes contratos con OpenAI (que comenzará a contribuir en 2026) y AWS (previsto para 2027) son prometedores pero de ejecución larga. Los analistas son mayoritariamente optimistas, con un precio objetivo medio de 300 dólares, apostando por la ventaja de velocidad de Cerebras en la inferencia de IA y el potencial de sus grandes acuerdos. Los escépticos señalan los desafíos en los márgenes, la intensa competencia (especialmente de NVIDIA) y la dependencia continua de pocos clientes. La valoración actual, cercana a los 50.000 millones de dólares, anticipa un crecimiento significativo que depende de la ejecución exitosa de estos contratos a largo plazo.

marsbit06/24 12:24

CBRS: Ingresos duplican en primer informe tras salida a bolsa, pero pronóstico de margen bruto cae drásticamente; ruta de ejecución del gran contrato de OpenAI es demasiado larga

marsbit06/24 12:24

活动图片