AMD compra Taalas: La IA por hardware se las arregla sin la escasa memoria HBM

cryptonews.ruPublished on 2026-08-09Last updated on 2026-08-09

Abstract

AMD acordó comprar la startup Taalas de Toronto, que resuelve un problema clave en la inferencia de redes neuronales: la necesidad de transferir constantemente los pesos del modelo desde la memoria al procesador para generar cada token. Los chips de Taalas eliminan esta operación al integrar los pesos del modelo directamente en los transistores. Esta transferencia de datos limita la velocidad de la inferencia actual y ha convertido a la memoria de alto ancho de banda (HBM) en uno de los componentes más escasos de la industria de semiconductores. El primer chip de prueba de Taalas, fabricado con el proceso de 6 nm de TSMC, ejecutó el modelo Llama 3.1 8B de Meta a una velocidad de 16.960 tokens por segundo, siendo mucho más rápido que las GPU de Nvidia en comparaciones realizadas. Sin embargo, su arquitectura tiene un compromiso clave: cada chip está permanentemente dedicado a un solo modelo. Cambiar de modelo requiere un rediseño parcial que lleva aproximadamente dos meses. La adquisición por parte de AMD subraya una creciente presión sobre el mercado de la memoria HBM. Si bien los precios y la demanda de HBM están en máximos históricos, con una escasez proyectada hasta 2026, enfoques como el de Taalas, junto con los esfuerzos de Nvidia en compresión y cuantización de modelos y las innovaciones de los fabricantes de memoria (como zHBM de Samsung), buscan reducir drásticamente la dependencia de este componente. La compra sugiere que la actual escasez de memoria podría ser un ...

AMD acordó adquirir la startup Taalas de Toronto, que resuelve el principal problema de la inferencia de redes neuronales: la necesidad de transferir constantemente los pesos del modelo desde la memoria al procesador para generar cada token. Los chips de Taalas prescinden de esta operación: los pesos del modelo están literalmente "soldados" en los transistores. Es precisamente este bombeo de datos lo que limita la velocidad de la inferencia actual y convirtió a la memoria de alto ancho de banda (HBM) en el producto más escaso de la industria de los semiconductores.

El acuerdo será percibido como otra ronda de rivalidad entre AMD y Nvidia en el campo de la inferencia, pero en ese frente cambia poco. Lo más interesante es lo que la compra revela sobre el estado del mercado de memoria —la transacción más sobrecalentada en semiconductores en este momento.

Qué creó Taalas

Taalas fue fundada en 2023 por Ljubisa Bajic, creador anteriormente de la compañía de chips Tenstorrent, y su esposa Lejla Bajic, veterana de las divisiones de ingeniería de ATI y AMD, quien asumió el cargo de directora de operaciones. La compañía recaudó 219 millones de dólares de Fidelity, Quiet Capital y el inversor en semiconductores Pierre Lamond —fondos destinados al desarrollo de los llamados circuitos integrados específicos para un modelo (Model-Specific Integrated Circuits).

El primer chip de prueba, fabricado con el proceso de 6 nanómetros de TSMC, servía al modelo Llama 3.1 8B de Meta a una velocidad de 16,960 tokens por segundo. Según la compañía, esto es 48 veces más rápido que las tarjetas gráficas Nvidia y 8.5 veces más rápido que los aceleradores Cerebras en el momento de la comparación. El chip de segunda generación, diseñado para modelos con 20 mil millones de parámetros, debería salir este año.

La arquitectura se divide en dos zonas: un área donde los pesos del modelo están fijos en forma de memoria ROM enmascarada, y una SRAM normal para cachés y adaptadores de ajuste fino, que aún pueden cambiar. "Es en parte este endurecimiento de la programación lo que nos da velocidad", explicó Bajic a la publicación The Next Platform en febrero.

AMD planea integrar los chips de Taalas en los bastidores Helios siguiendo un esquema dividido: los aceleradores Instinct procesarán el prompt, y el silicio de Taalas generará los tokens, todo bajo el control del stack de software ROCm. La compañía enfatizó que se trata de una absorción, no de una contratación del equipo —se espera cerrar la transacción en el cuarto trimestre. El vicepresidente sénior de IA de AMD, Vamsi Boppana, calificó la compra como una extensión de la plataforma.

El compromiso al que se enfrenta Taalas

Soldar los pesos en el silicio tiene un coste obvio: cada chip sirve exactamente a un modelo —para siempre. Cambiar de modelo requiere un rediseño parcial de la topología, e incluso con el ciclo reducido de Taalas, donde solo se cambian dos capas metálicas en una oblea casi terminada, esto lleva unos dos meses en las instalaciones de TSMC. Los modelos principales se actualizan más rápido. La apuesta solo se justifica donde el modelo es estable, se usa ampliamente y es lo suficientemente valioso como para congelarlo.

Este mismo compromiso explica por qué el acuerdo no cambia el panorama en el mercado de inferencia. Nvidia pagó 20 mil millones de dólares por Groq en diciembre —la mayor adquisición de su historia— para integrar hardware especializado para la generación de tokens precisamente en la plataforma alrededor de la cual ya se ha construido toda la industria. La lucha por la inferencia se da a nivel de ecosistemas y software instalado, y un chip atado a un solo modelo no participa en ninguno de los dos. Lo que realmente demuestra el enfoque de Taalas es una tesis más estrecha, pero también más interesante: la limitación de memoria que sufre la inferencia es una decisión de ingeniería, no una realidad física, y se puede evitar.

La cuestión de la memoria

El mercado actualmente está fijando en los precios la suposición de que esta escasez de memoria es permanente. Los precios de la DRAM normal subieron casi un 90% en el primer trimestre. La memoria de alto ancho de banda (HBM) está prácticamente agotada para todo el año 2026, y se espera que el volumen del mercado HBM este año alcance los 54,600 millones de dólares. SK hynix, que controla más de la mitad del suministro de HBM, superó una capitalización de mercado de 1 billón de dólares y anunció la construcción de nuevas fábricas por 38,100 millones de dólares. Para el inversor promedio, toda la apuesta por la memoria depende de un supuesto: la demanda de IA mantendrá la memoria escasa durante años más.

Este supuesto ya está siendo atacado desde varios frentes simultáneamente. Taalas elimina por completo la memoria para pesos del proceso de servir modelos, y los ingenieros de Nvidia comprimen y cuantifican modelos precisamente para reducir la cantidad de memoria que afecta a un modelo desplegado.

Los propios fabricantes de memoria trabajan en la misma dirección. La tecnología zHBM de Samsung, mostrada en la conferencia FMS la semana pasada, coloca la memoria directamente sobre el acelerador, multiplicando el ancho de banda efectivo. SK hynix y Sandisk acaban de publicar el primer estándar para memoria flash de alta velocidad, destinada a reemplazar con NAND barato el trabajo que hoy realiza la HBM. Prácticamente todos los grandes actores de la industria están financiando su propia forma de reducir la necesidad del mismo recurso que el mercado considera permanentemente escaso.

AMD compró una prueba de que la inferencia puede funcionar sin acceder al componente cuya escasez define todo el ciclo actual de demanda de IA —y venderá esa prueba dentro de bastidores donde todavía hay GPU y HBM. Los inversores que consideran los precios actuales de la memoria como una característica permanente de todo el ciclo de construcción de infraestructura de IA, están apostando en contra de un movimiento de ingeniería masivo y creciente, cuyo objetivo es el resultado contrario.

La memoria siempre ha sido un negocio cíclico. Quienes pagan sus precios actuales acaban de financiar una razón más por la que seguirá siéndolo.

Opinión de la IA

Desde el punto de vista del análisis de datos automatizado, el precedente clave para los chips Taalas no se encuentra en el mundo de la IA, sino en la industria criptográfica. Los circuitos integrados específicos para la minería de Bitcoin resuelven un problema similar —sueldan el algoritmo en silicio por velocidad— y obtienen el mismo efecto secundario: falta total de flexibilidad. Hash Telegraph ya describió cómo la especialización de hardware, llevada al límite, genera el riesgo de obsolescencia moral ante un cambio en el algoritmo base o la aparición de un nuevo paradigma computacional.

Los aspectos técnicos que el artículo no detalla conciernen a la economía del tiempo de inactividad: mientras un chip Taalas sirve a un modelo, laboratorios competidores lanzan nuevas versiones cada pocos meses, y el ciclo de reprogramación de la topología lleva unos dos meses en las instalaciones de TSMC. La historia de los ASIC muestra que la especialización solo es rentable con un algoritmo estable —la pregunta es si la arquitectura de los modelos de lenguaje grandes será lo suficientemente estable para esta apuesta.

Trending Cryptos

Related Questions

Q¿Cuál es la principal innovación tecnológica de Taalas que AMD ha adquirido?

ALa principal innovación de Taalas son chips de inteligencia artificial especializados en inferencia que eliminan la necesidad de HBM (memoria de alto ancho de banda) al 'soldar' literalmente los pesos del modelo neuronal en los transistores del chip, evitando la transferencia constante de datos entre memoria y procesador.

Q¿Por qué la compra de Taalas por parte de AMD podría indicar un cambio en el mercado de memoria para IA?

APorque demuestra que el cuello de botella de memoria HBM, actualmente el componente más escaso y caro, es un problema de ingeniería que se puede resolver, no una limitación física permanente. Esto desafía la suposición del mercado de que la escasez de HBM es una constante del ciclo de construcción de infraestructura de IA.

Q¿Cuál es la principal limitación o compromiso (trade-off) de la arquitectura de chips de Taalas?

ALa principal limitación es la falta de flexibilidad: cada chip está permanentemente 'cableado' o configurado para ejecutar un único modelo neuronal específico. Cambiar de modelo requiere un rediseño parcial de la topología del chip, un proceso que puede tardar unos dos meses, lo que lo hace inviable para modelos que se actualizan con frecuencia.

QSegún el artículo, ¿cómo se integran los chips Taalas en la estrategia de productos de AMD?

AAMD planea integrar los chips de Taalas en sus sistemas rack Helios bajo una arquitectura dividida: los aceleradores Instinct de AMD procesarán la solicitud inicial (prompt), mientras que el silicio de Taalas se encargará de generar los tokens de respuesta, todo gestionado por la plataforma de software ROCm de AMD.

Q¿Qué paralelismo histórico establece la sección 'Opinión de IA' del artículo respecto a la tecnología de Taalas?

ALa sección establece un paralelismo con los circuitos integrados específicos de aplicación (ASIC) utilizados en la minería de criptomonedas como Bitcoin. Ambos 'soldan' un algoritmo específico en silicio para obtener velocidad máxima, pero a cambio sufren la misma desventaja: una completa falta de flexibilidad y el riesgo de obsolescencia si cambia el algoritmo o la arquitectura subyacente.

Related Reads

Demand Test: Bitcoin Whales Earn Record $1.2 Billion, Ethereum Holders Return to Profitability

In just three days after Bitcoin's price recovery, new Bitcoin whales have realized over $1.2 billion in profit, marking the largest profit-taking event for this cohort on record according to CryptoQuant. The peak occurred on August 20 with roughly $614 million, setting a daily record. Analysts note this selling pressure began after Bitcoin rose above the realized price of short-term whales, which was around $68,900. With Bitcoin trading near $77,700 on August 23, these whales were sitting on an average profit of about 12.8%. The market recovery allowed investors who were previously at breakeven or at a loss to lock in gains. CryptoQuant described the situation as a key test for Bitcoin demand; sustained prices above whale cost-basis with normalized profit-taking could signal strong new demand, while continued selling pressure could turn the rally into a mere break-even exit. Simultaneously, large Ethereum holders have also returned to an unrealized profit zone following its rally, as noted by CryptoQuant analyst Darkfost. Current profit levels, however, remain relatively low and are not seen as creating significant selling pressure. The Unrealized Profit/Loss Ratio for different whale cohorts stands at 0.075 (for 1k-10k ETH holders), 0.16 (10k-100k ETH), and 0.38 (over 100k ETH). This marks a significant improvement from June, when these whales were in substantial unrealized loss, with Ethereum having risen over 65% since then. The increased profitability is viewed as a positive sentiment signal for the Ethereum market.

cryptonews.ru8m ago

Demand Test: Bitcoin Whales Earn Record $1.2 Billion, Ethereum Holders Return to Profitability

cryptonews.ru8m ago

Kinetiq Team Announces Elysium L2 Network for Hyperliquid

On August 24, the liquid staking protocol Kinetiq announced Elysium, a new L2 network for the Hyperliquid ecosystem. It aims to increase HyperEVM's throughput and simplify the launch of spot markets, tokens, and DeFi applications. Elysium will use $HYPE for gas fees and plans direct integration with HyperCore's trading engine, giving apps access to its liquidity and orderbook data. Technical details and partners will be revealed later, with a launch date set for "soon." A primary reason for Elysium's development is to overcome HyperEVM's limitations, such as low throughput and rising fees during high load. Kinetiq claims the L2 will start with significantly higher block production and transaction speeds, later aiming to approach HyperCore's performance. This targets applications needing frequent state updates like high-frequency spot trading and AMMs, and will provide them deeper access to HyperCore orderbook data. The network also proposes to streamline the process of launching new assets within Hyperliquid, allowing a token to progress from AMM liquidity to HyperCore's spot orderbook and eventually to perp markets via HIP-3 in a unified flow. Regarding revenue, Kinetiq's model allocates 50% of sequencer fees to buy back and burn $KNTQ, 25% to developers using Elysium's block space, and 25% to the Kinetiq treasury. Elysium marks Kinetiq's expansion beyond its core liquid staking product, kHYPE.

cryptonews.ru9m ago

Kinetiq Team Announces Elysium L2 Network for Hyperliquid

cryptonews.ru9m ago

Trading

Spot

Hot Articles

Discussions

Welcome to the HTX Community. Here, you can stay informed about the latest platform developments and gain access to professional market insights. Users' opinions on the price of AI (AI) are presented below.

活动图片