AMD acquiert Taalas : l'IA matérielle se passe de la mémoire HBM, composant en pénurie

cryptonews.ruPublished on 2026-08-09Last updated on 2026-08-09

Abstract

AMD acquiert la start-up canadienne Taalas, qui a développé une technologie de puces d'IA spécialisées pour l'inférence. Ces puces éliminent le besoin de mémoire HBM, un composant critique et rare actuellement, en intégrant directement les poids d'un modèle de réseau neuronal dans les transistors du silicium. Cette approche permet des vitesses d'inférence considérablement plus rapides, mais au prix d'une flexibilité nulle : chaque puce est dédiée à une seule et unique modèle. Le premier prototype, gravé en 6nm, atteint des performances très élevées sur le modèle Llama 3.1 8B. AMD prévoit d'intégrer ces accélérateurs dans ses serveurs, en complément de ses GPU Instinct. L'acquisition par AMD met en lumière une tension sur le marché des semi-conducteurs. Si les investisseurs parient sur une pénurie durable de mémoire HBM, poussant les prix à la hausse, l'industrie travaille activement à réduire cette dépendance. La technologie de Taalas, la compression des modèles par Nvidia, et les innovations des fondeurs de mémoire (comme le zHBM de Samsung) visent toutes à contourner ce goulet d'étranglement. En achetant Taalas, AMD investit dans une preuve que la pénurie de mémoire pour l'IA est un défi d'ingénierie surmontable, et non une fatalité. Cela rappelle que le marché de la mémoire est historiquement cyclique, et que les solutions spécialisées, bien que performantes, peuvent devenir obsolètes si les modèles d'IA évoluent trop rapidement.

La société AMD a accepté d'acquérir la start-up torontoise Taalas, qui résout le principal problème de l'inférence des réseaux neuronaux : la nécessité de transférer constamment les poids du modèle depuis la mémoire vers le processeur pour générer chaque jeton. Les puces Taalas se passent de cette opération : les poids du modèle sont littéralement soudés dans les transistors. C'est précisément ce transfert de données qui limite la vitesse de l'inférence moderne et a fait de la mémoire à haut débit (HBM) la denrée la plus rare de l'industrie des semi-conducteurs.

La transaction sera perçue comme un nouveau round de rivalité entre AMD et Nvidia dans le domaine de l'inférence, mais elle ne change guère la donne sur ce front. Ce qui est bien plus intéressant, c'est ce que l'acquisition révèle de l'état du marché de la mémoire – la transaction la plus surchauffée dans les semi-conducteurs actuellement.

Ce qu'a créé Taalas

Taalas a été fondée en 2023 par Ljubisa Bajic, précédemment fondateur de la société de puces Tenstorrent, et son épouse Lejla Bajic, vétéran des divisions d'ingénierie d'ATI et AMD, qui a pris le poste de directrice des opérations. La société a levé 219 millions de dollars auprès de Fidelity, Quiet Capital et de l'investisseur en semi-conducteurs Pierre Lamond – des fonds destinés au développement de circuits intégrés dits dédiés à un modèle spécifique.

La première puce de test, fabriquée avec le procédé 6 nm de TSMC, servait le modèle Llama 3.1 8B de Meta à une vitesse de 16 960 jetons par seconde. Selon l'entreprise, c'est 48 fois plus rapide que les cartes graphiques Nvidia et 8,5 fois plus rapide que les accélérateurs Cerebras au moment de la comparaison. La puce de deuxième génération, conçue pour des modèles à 20 milliards de paramètres, devrait sortir cette année.

L'architecture se divise en deux zones : une zone où les poids du modèle sont figés sous forme de mémoire ROM masquée, et une SRAM standard pour les caches et les adaptateurs de réglage fin, qui peuvent encore être modifiés. "C'est en partie ce firmware rigide qui nous donne notre vitesse", expliquait Bajic au média The Next Platform en février.

AMD prévoit d'intégrer les puces Taalas dans ses baies Helios selon un schéma partitionné : les accélérateurs Instinct traiteront l'invite (prompt), tandis que le silicium Taalas générera les jetons, le tout sous la gestion de la pile logicielle ROCm. L'entreprise a souligné qu'il s'agissait bien d'une absorption, et non d'un recrutement d'équipe – la finalisation de l'accord est attendue au quatrième trimestre. Le vice-président senior d'AMD en charge de l'IA, Vamsi Boppana, a qualifié cet achat d'extension de plateforme.

Le compromis de Taalas

Le soudage des poids dans le silicium a un prix évident : chaque puce sert exactement un modèle – pour toujours. Changer de modèle nécessite un recalcul partiel de la topologie, et même avec le cycle raccourci de Taalas, où seules deux couches métalliques sont modifiées sur une plaquette presque terminée, cela prend environ deux mois sur les capacités de TSMC. Les modèles phares sont mis à jour plus rapidement. Le pari n'est rentable que là où le modèle est stable, largement utilisé et suffisamment précieux pour être figé.

Ce même compromis explique pourquoi la transaction ne modifie pas la donne sur le marché de l'inférence. Nvidia a payé 20 milliards de dollars pour Groq en décembre – la plus grande acquisition de son histoire – afin d'intégrer du matériel spécialisé pour la génération de jetons précisément dans la plateforme autour de laquelle toute l'industrie est déjà structurée. La bataille pour l'inférence se joue au niveau des écosystèmes et des logiciels établis, et une puce liée à un seul modèle ne participe ni à l'un ni à l'autre. Ce que l'approche de Taalas démontre réellement est une thèse plus étroite, mais plus intéressante : la contrainte mémoire qui handicape l'inférence est une solution d'ingénierie, et non une donnée physique immuable, et on peut la contourner.

La question de la mémoire

Le marché intègre actuellement dans les prix l'hypothèse que cette pénurie de mémoire est permanente. Les prix de la DRAM ordinaire ont augmenté de près de 90 % au premier trimestre. La mémoire à haut débit (HBM) est pratiquement vendue pour toute l'année 2026, et le volume du marché HBM cette année devrait atteindre 54,6 milliards de dollars. SK hynix, qui contrôle plus de la moitié des approvisionnements en HBM, a franchi une capitalisation boursière de 1 000 milliards de dollars et a annoncé la construction de nouvelles usines pour 38,1 milliards de dollars. Pour l'investisseur lambda, tout le pari sur la mémoire repose sur une seule hypothèse : la demande en IA maintiendra la mémoire en pénurie pendant encore des années.

Cette hypothèse est déjà attaquée de plusieurs côtés à la fois. Taalas élimine complètement la mémoire pour les poids du processus de service des modèles, et les ingénieurs de Nvidia compressent et quantifient les modèles précisément pour réduire le volume de mémoire impliqué par un modèle déployé.

Les fabricants de mémoire eux-mêmes travaillent dans la même direction. La technologie zHBM de Samsung, présentée à la conférence FMS la semaine dernière, empile la mémoire directement sur l'accélérateur, multipliant le débit effectif. SK hynix et Sandisk viennent de publier le premier standard de mémoire flash haute vitesse, visant à remplacer par du NAND bon marché le travail effectué aujourd'hui par le HBM. Pratiquement chaque acteur majeur du secteur finance sa propre manière de réduire le besoin en cette ressource que le marché considère comme définitivement rare.

AMD a acheté la preuve que l'inférence peut fonctionner sans faire appel au composant dont la pénurie définit tout le cycle actuel de demande en IA – et vendra cette preuve à l'intérieur de baies où des GPU et du HBM sont toujours présents. Les investisseurs qui considèrent les prix actuels de la mémoire comme une caractéristique permanente de tout le cycle de construction de l'infrastructure IA parient contre un mouvement d'ingénierie massif et croissant, visant le résultat inverse.

La mémoire a toujours été un secteur cyclique. Ceux qui paient ses prix actuels viennent de financer une raison supplémentaire pour laquelle cela restera ainsi.

Avis de l'IA

D'un point de vue d'analyse automatique des données, le précédent clé pour les puces Taalas se trouve non pas dans le monde de l'IA, mais dans l'industrie crypto. Les circuits intégrés spécialisés pour le minage de Bitcoin résolvent un problème similaire – souder l'algorithme dans le silicium pour la vitesse – et subissent le même effet secondaire : une inflexibilité totale. Hash Telegraph a déjà décrit comment la spécialisation matérielle, poussée à l'extrême, engendre un risque d'obsolescence morale lors d'un changement d'algorithme de base ou de l'émergence d'un nouveau paradigme informatique.

Les aspects techniques que l'article ne détaille pas concernent l'économie des temps d'arrêt : pendant qu'une puce Taalas sert un modèle, les laboratoires concurrents publient de nouvelles versions tous les quelques mois, et le cycle de reconfiguration de la topologie prend environ deux mois sur les capacités de TSMC. L'histoire des ASIC montre que la spécialisation n'est rentable que sur un algorithme stable – la question est de savoir si l'architecture des grands modèles linguistiques sera suffisamment stable pour ce pari.

Trending Cryptos

Related Questions

QQuel est le principal problème que la technologie de Taalas résout dans l'inférence des réseaux neuronaux ?

ALa technologie de Taalas élimine la nécessité de transférer constamment les poids du modèle de la mémoire vers le processeur pour générer chaque jeton. Elle intègre physiquement ces poids dans les transistors, contournant ainsi la limitation de vitesse liée à ce transfert de données.

QQuel est le principal compromis (désavantage) de l'approche matérielle de Taalas ?

ALe principal compromis est le manque total de flexibilité. Chaque puce est conçue pour une seule version spécifique d'un modèle. Changer de modèle nécessite une modification de la topologie du circuit (en recalculant des couches métalliques), un processus qui prend environ deux mois, rendant la puce obsolète si le modèle évolue rapidement.

QPourquoi l'acquisition de Taalas par AMD ne change-t-elle pas fondamentalement la rivalité avec Nvidia sur le marché de l'inférence, selon l'article ?

AParce que la bataille pour l'inférence se joue désormais au niveau des écosystèmes logiciels et des plateformes logicielles établies. Une puce spécialisée pour un seul modèle ne participe pas à cette compétition d'écosystème, contrairement à l'acquisition par Nvidia de Groq, qui vise à intégrer du matériel spécialisé dans sa plateforme logicielle dominante.

QQuelle est l'hypothèse du marché concernant la mémoire HBM que l'article remet en question ?

AL'article remet en question l'hypothèse du marché selon laquelle la pénurie de mémoire HBM (Haute Bande Passante) est une caractéristique permanente du cycle de développement de l'IA. Il souligne que de nombreuses initiatives d'ingénierie (comme Taalas, la compression de Nvidia, les nouvelles technologies comme zHBM) visent précisément à réduire cette dépendance.

QÀ quel autre domaine technologique l'article compare-t-il l'approche de Taalas pour illustrer ses risques et sa logique ?

AL'article compare l'approche de Taalas à celle des circuits intégrés spécialisés (ASIC) utilisés pour le minage de cryptomonnaies comme le Bitcoin. Ces ASIC intègrent également un algorithme spécifique dans le silicium pour la vitesse, au prix d'une inflexibilité totale et d'un risque d'obsolescence rapide si l'algorithme de base change.

Related Reads

Demand Test: Bitcoin Whales Earn Record $1.2 Billion, Ethereum Holders Return to Profitability

In just three days after Bitcoin's price recovery, new Bitcoin whales have realized over $1.2 billion in profit, marking the largest profit-taking event for this cohort on record according to CryptoQuant. The peak occurred on August 20 with roughly $614 million, setting a daily record. Analysts note this selling pressure began after Bitcoin rose above the realized price of short-term whales, which was around $68,900. With Bitcoin trading near $77,700 on August 23, these whales were sitting on an average profit of about 12.8%. The market recovery allowed investors who were previously at breakeven or at a loss to lock in gains. CryptoQuant described the situation as a key test for Bitcoin demand; sustained prices above whale cost-basis with normalized profit-taking could signal strong new demand, while continued selling pressure could turn the rally into a mere break-even exit. Simultaneously, large Ethereum holders have also returned to an unrealized profit zone following its rally, as noted by CryptoQuant analyst Darkfost. Current profit levels, however, remain relatively low and are not seen as creating significant selling pressure. The Unrealized Profit/Loss Ratio for different whale cohorts stands at 0.075 (for 1k-10k ETH holders), 0.16 (10k-100k ETH), and 0.38 (over 100k ETH). This marks a significant improvement from June, when these whales were in substantial unrealized loss, with Ethereum having risen over 65% since then. The increased profitability is viewed as a positive sentiment signal for the Ethereum market.

cryptonews.ru8m ago

Demand Test: Bitcoin Whales Earn Record $1.2 Billion, Ethereum Holders Return to Profitability

cryptonews.ru8m ago

Kinetiq Team Announces Elysium L2 Network for Hyperliquid

On August 24, the liquid staking protocol Kinetiq announced Elysium, a new L2 network for the Hyperliquid ecosystem. It aims to increase HyperEVM's throughput and simplify the launch of spot markets, tokens, and DeFi applications. Elysium will use $HYPE for gas fees and plans direct integration with HyperCore's trading engine, giving apps access to its liquidity and orderbook data. Technical details and partners will be revealed later, with a launch date set for "soon." A primary reason for Elysium's development is to overcome HyperEVM's limitations, such as low throughput and rising fees during high load. Kinetiq claims the L2 will start with significantly higher block production and transaction speeds, later aiming to approach HyperCore's performance. This targets applications needing frequent state updates like high-frequency spot trading and AMMs, and will provide them deeper access to HyperCore orderbook data. The network also proposes to streamline the process of launching new assets within Hyperliquid, allowing a token to progress from AMM liquidity to HyperCore's spot orderbook and eventually to perp markets via HIP-3 in a unified flow. Regarding revenue, Kinetiq's model allocates 50% of sequencer fees to buy back and burn $KNTQ, 25% to developers using Elysium's block space, and 25% to the Kinetiq treasury. Elysium marks Kinetiq's expansion beyond its core liquid staking product, kHYPE.

cryptonews.ru9m ago

Kinetiq Team Announces Elysium L2 Network for Hyperliquid

cryptonews.ru9m ago

Trading

Spot

Hot Articles

Discussions

Welcome to the HTX Community. Here, you can stay informed about the latest platform developments and gain access to professional market insights. Users' opinions on the price of AI (AI) are presented below.

活动图片