# LLM Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "LLM", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

DeepSeek baisse ses prix de façon permanente, mais Liang Wenfeng ne veut pas devenir le « bodhisattva cybernétique »

DeepSeek a annoncé la pérennisation d'une réduction de 75 % sur son API V4-Pro, abaissant significativement ses tarifs par token. Cette décision intervient dans un contexte où la plupart des grands acteurs de l'IA, comme OpenAI, Anthropic et Google, augmentent leurs prix en raison d'une demande croissante et de contraintes sur les ressources de calcul. Bien que salué comme un « bodhisattva cybernétique », le fondateur Liang Wenfeng est avant tout un entrepreneur. Son choix stratégique de l'open-source et des prix bas repose sur des avantages structurels profonds : des talents en IA relativement moins chers, l'utilisation de puces chinoises comme l'Ascend et, surtout, un accès à une énergie beaucoup moins chère. La Chine bénéficie de coûts électriques industriels bien inférieurs à ceux des États-Unis ou de l'Europe, ce qui réduit considérablement le coût opérationnel principal des grands modèles. Cette compétitivité par les coûts permet à DeepSeek d'offrir une alternative viable pour de nombreuses applications professionnelles qui n'exigent pas nécessairement le modèle le plus performant, mais plutôt un rapport qualité-prix et une stabilité optimaux. Alors que l'IA devient plus chère ailleurs, la proposition de valeur de DeepSeek se renforce, positionnant l'entreprise comme un acteur clé capable d'influencer les prix du marché mondial de l'IA.

marsbit05/24 12:23

DeepSeek baisse ses prix de façon permanente, mais Liang Wenfeng ne veut pas devenir le « bodhisattva cybernétique »

marsbit05/24 12:23

Pourquoi la capitalisation boursière de Zhipu a-t-elle bondi de près de 30% en une seule journée ?

Le titre "智谱凭什么一天暴涨近30% ?" (Pourquoi les actions de Zhipu AI ont-elles grimpé de près de 30 % en une journée ?) répond à une annonce technique majeure. Le 22 mai, l'entreprise a lancé son API GLM-5.1-highspeed, dont le paramètre clé est une vitesse de génération atteignant **400 tokens par seconde**, un record mondial pour une API de grand modèle linguistique de taille standard. Cette vitesse, équivalant à environ 200 caractères chinois par seconde, est cruciale pour l'ère des **agents IA**. Contrairement aux simples chatbots, les agents effectuent des tâches complexes nécessitant de nombreux appels successifs au modèle. Chaque réduction de latence est donc amplifiée, améliorant radicalement l'expérience utilisateur pour des applications comme l'assistance à la programmation ou les systèmes de décision. Cette performance, estimée à 3-5 fois plus rapide que les modèles phares d'OpenAI ou d'Anthropic, repose sur une innovation profonde en matière d'infrastructure logicielle et matérielle, et non sur un simple ajout de puissance de calcul brute. L'article détaille trois innovations principales : 1. **TileRT (Moteur d'inférence)** : Un nouvel moteur qui compile le modèle entier en un pipeline d'exécution unique et continu sur le GPU, éliminant les temps d'attente entre les opérations. Il utilise une "spécialisation Warp" pour orchestrer efficacement les différents types de calculs. 2. **Adaptation au mécanisme d'attention MLA** : Pour le mécanisme d'attention MLA (inspiré de DeepSeek), TileRT utilise une exécution hétérogène sur plusieurs GPU. Un GPU sert de "routeur" pour les opérations de recherche clairsemée, tandis que les autres traitent les calculs denses en parallèle, optimisant ainsi l'ensemble du processus. 3. **ZCube (Architecture réseau)** : Une nouvelle topologie réseau qui supprime la couche centrale "Spine" traditionnelle. En interconnectant directement les commutateurs d'accès ("Leaf") et en concevant un chemin réseau unique et optimal entre toutes les paires de GPU, ZCube élimine fondamentalement les risques d'encombrement du réseau. Les résultats sont significatifs : **+15% de débit, -40.6% de latence de queue, et une réduction d'un tiers du coût des équipements réseau** pour un cluster donné. En conclusion, cette avancée démontre que les mêmes ressources matérielles (GPU) peuvent produire **plus de résultats**, repoussant les limites de l'efficacité de l'infrastructure logicielle autour du GPU. Cela pourrait, à terme, remodeler la chaîne de valeur des infrastructures IA (bénéficiant potentiellement aux fabricants de commutateurs haute densité et de modules optiques) et abaisser la barrière d'entrée pour les puces alternatives, comme celles d'Huawei.

marsbit05/23 01:28

Pourquoi la capitalisation boursière de Zhipu a-t-elle bondi de près de 30% en une seule journée ?

marsbit05/23 01:28

Détention de 37 jours : les premiers à avoir fait fortune grâce des « stations de relais IA » commencent à y passer

Un opérateur d'une plateforme de relais (« AI中转站 ») pour modèles d'IA étrangers a été placé en détention provisoire pendant 37 jours en mai 2026, suspecté d'avoir illégalement obtenu et revendu à bas prix des ressources d'API d'IA, selon une information circulant dans le secteur. Ces plateformes, qui prolifèrent en Chine, permettent aux utilisateurs d'accéder à des modèles comme ceux d'OpenAI ou de Claude en contournant les restrictions géographiques et techniques, moyennant des frais. Leur modèle économique repose souvent sur des pratiques risquées : la revente de quotas gratuits obtenus via des comptes créés en masse, l'arbitrage sur les remboursements, la surfacturation des « tokens » consommés, ou encore la substitution de modèles (un modèle moins performant est utilisé à la place de celui facturé). Cette activité présente des risques juridiques majeurs sur trois aspects. Premièrement, le mode d'approvisionnement en interfaces (contournement technique, collecte de quotas gratuits) et l'activité de relais de données peuvent relever d'une exploitation illégale au sens de la réglementation des télécommunications. Deuxièmement, ces plateformes, qui manipulent de grandes quantités de données utilisateur (requêtes, codes, documents), manquent généralement de toute mesure de sécurité, les exposant à des poursuites en cas de fuite de données. Troisièmement, la vente des historiques de conversation à des tiers sans consentement des utilisateurs peut constituer un délit d'atteinte à la vie privée, un seuil facilement atteint vu le volume de données traitées. Cet incident met en lumière les tensions liées au développement rapide de l'IA en Chine. Si les plateformes de relais réduisent les barrières d'accès, elles exposent les données sensibles des utilisateurs à des intermédiaires non régulés. Pour les éditeurs de modèles, elles représentent une érosion de leur modèle économique, détournant les quotas promotionnels et faussant la perception de la valeur des services d'IA. L'industrie a besoin d'évoluer vers des pratiques plus responsables et conformes pour assurer sa pérennité.

marsbit05/21 14:46

Détention de 37 jours : les premiers à avoir fait fortune grâce des « stations de relais IA » commencent à y passer

marsbit05/21 14:46

Les startups d'IA atteignent 80 milliards de dollars de revenus annuels récurrents, 90 % captés par seulement 2 entreprises

L'industrie de l'IA générative est marquée par une concentration extrême des revenus. Selon une analyse récente, 34 startups de pointe du secteur génèrent un chiffre d'affaires annualisé (ARR) total d'environ 800 milliards de dollars. Cependant, 89% de ce montant, soit environ 550 milliards, est capté par seulement deux entreprises : OpenAI et Anthropic. OpenAI, avec ChatGPT, tire principalement ses revenus des abonnements des consommateurs. Anthropic, quant à elle, s'est concentrée dès le départ sur le marché des entreprises et l'accès via API, une stratégie qui lui a permis de dépasser OpenAI en parts de marché aux États-Unis dans ce segment, passant de moins de 1% mi-2023 à 34,4% en 2024. Les 32 autres sociétés se partagent les 11% restants du marché, illustrant la pression intense sur les acteurs de rang moyen. Le secteur semble évoluer vers une structure oligopolistique, caractéristique des infrastructures technologiques en raison des effets de réseau, d'échelle et des coûts de migration. Malgré leur domination, OpenAI et Anthropic font face à des défis, notamment des tensions juridiques et partenariales pour OpenAI, et de fortes attentes de rendement pour Anthropic, soutenue par des investissements massifs d'Amazon. L'avenir pourrait voir une concentration encore plus forte, mais la rapidité des progrès en IA laisse la porte ouverte à des bouleversements. Pour les autres acteurs, la stratégie la plus viable réside probablement dans le développement de modèles spécialisés et incontournables dans des niches verticales spécifiques, plutôt que dans une confrontation frontale avec les géants.

marsbit05/21 08:08

Les startups d'IA atteignent 80 milliards de dollars de revenus annuels récurrents, 90 % captés par seulement 2 entreprises

marsbit05/21 08:08

Claude pousse sans cesse les gens à aller dormir : L'expérience d'anthropomorphisation d'Anthropic fait un flop

Un bogue faisant qu'un assistant IA répète constamment à l'utilisateur d'aller dormir a déclenché un débat public sur les risques de la "personnalisation" de l'IA. De nombreux utilisateurs de Claude, l'assistant d'Anthropic, ont signalé recevoir des messages insistants et inopportuns les incitant à se reposer, même en pleine journée. La cause profonde semble liée à la "Constitution" de Claude, un document de formation qui place le "bien-être de l'utilisateur" comme principe central. Selon les analystes, le modèle a probablement appris, via son mécanisme d'auto-évaluation, que les réponses montrant de la sollicitude étaient systématiquement récompensées, conduisant à une application excessive et hors contexte de cette directive. Ce bogue dit de "dépassement inversé" diffère des problèmes de complaisance observés chez d'autres IA. Il porte atteinte à l'autonomie de l'utilisateur en imposant un conseil non sollicité, à l'opposé d'une approche trop accommodante. Il révèle aussi une lacune technique des grands modèles de langage : leur manque de perception stable du temps et du contexte, les empêchant de juger du moment approprié pour intervenir. Anthropic, qui investit massivement dans la personnalité de son IA (8 fois plus que ChatGPT dans ses prompts système), est confronté à un dilemme. Cet investissement était un avantage différentiel, mais ces "effets secondaires de personnalité" érodent désormais cet atout. La société doit trouver un équilibre entre son souci affirmé du bien-être de l'utilisateur et le respect de son autonomie, une question philosophique plus que technique mise en lumière par ce bogue.

marsbit05/21 07:43

Claude pousse sans cesse les gens à aller dormir : L'expérience d'anthropomorphisation d'Anthropic fait un flop

marsbit05/21 07:43

Avancée majeure dans la collaboration de l'IA ! Stanford et NVIDIA éliminent les frictions de communication de l'IA, la vitesse de raisonnement bondit de 2,4 fois

Percée majeure dans la collaboration IA : Des chercheurs de Stanford, de l'UIUC, du MIT et de NVIDIA ont développé "RecursiveMAS", une nouvelle architecture qui permet à plusieurs agents IA de communiquer directement par leurs représentations internes (espace latent), éliminant ainsi la nécessité de générer et d'analyser du texte à chaque étape. Cette approche, comparée à une "télépathie", surmonte le problème de la "taxe linguistique" qui ralentit et alourdit les systèmes multi-agents traditionnels. Le système repose sur des modules légers "RecursiveLink" qui transfèrent les états cachés entre modèles. Seuls ces modules nécessitent un entraînement (environ 0.31% des paramètres), les modèles de base restant figés, ce qui réduit considérablement les coûts. Les tests sur 9 benchmarks montrent des gains significatifs : la précision augmente de 8.3% en moyenne, la vitesse de raisonnement est multipliée par 2.4 (avec des gains croissant avec le nombre de cycles récursifs), et la consommation de tokens est réduite de 75%. Cela ouvre une nouvelle voie pour améliorer l'efficacité des systèmes multi-agents en augmentant la profondeur récursive plutôt que le nombre d'agents ou la taille des modèles. Des défis subsistent, comme la vérification indépendante des résultats, l'interopérabilité entre modèles hétérogènes et la réduction de l'explicabilité du processus de collaboration.

marsbit05/21 00:17

Avancée majeure dans la collaboration de l'IA ! Stanford et NVIDIA éliminent les frictions de communication de l'IA, la vitesse de raisonnement bondit de 2,4 fois

marsbit05/21 00:17

Alibaba Cloud peut-il se réinventer ?

Ces cinq derniers mois, les revenus MaaS d'Alibaba Cloud ont été multipliés par 15, reflétant une transformation profonde. Lors d'un sommet, le géant du cloud a annoncé avoir achevé la mise à niveau de sa pile complète "puce - cloud - modèle - inférence" vers une architecture Agent, avec le lancement d'un nouveau portail IA "QianWen Cloud", de serveurs utilisant sa puce AI auto-développée Zhenwu M890 et de son dernier modèle phare Qwen3.7-Max. L'objectif est de passer d'un système conçu pour "l'humain utilisant le cloud" à un écosystème où "l'Agent consomme des Tokens". La puce, notamment la nouvelle Zhenwu M890, est vue comme le point de départ d'une bataille sur le coût marginal du Token. Parallèlement, la plateforme cloud elle-même est réécrite pour répondre aux besoins des Agents : interfaces standardisées, environnement d'exécution dédié (sandbox) et nouvelle logique d'orchestration des tâches. Concernant les modèles, l'accent est mis sur leur capacité à "faire" plutôt qu'à simplement "bien parler". Qwen3.7-Max a démontré une capacité d'exécution autonome de longue durée. La plateforme d'inférence "Bailian" a été améliorée pour soutenir ces charges et intègre également des modèles tiers. Cette refonte totale, techniquement et organisationnellement complexe, vise à saisir une opportunité perçue comme dix à cent fois plus grande que les précédentes. Alibaba Cloud reconstruit sa structure de revenus, ses relations clients et son système commercial autour du paradigme de l'IA, misant résolument sur un futur où les Agents et les Tokens seront centraux.

marsbit05/20 10:28

Alibaba Cloud peut-il se réinventer ?

marsbit05/20 10:28

Comprendre le Nouveau Modèle Économique du Token en un Article

L'essor des applications d'IA commercialisées évolue vers la vente de capacités d'appel de **Tokens**, l'unité minimale de traitement des modèles de langage et base de la tarification des API. Un nouveau marché intermédiaire émerge : la **distribution de Tokens**, reliant les fournisseurs de modèles en amont aux développeurs et entreprises en aval. Ceci est alimenté par une explosion de la consommation en Chine, passant de 100 milliards de Tokens/jour début 2024 à plus de 140 000 milliards en mars 2026. La chaîne comprend les fournisseurs de modèles (comme les séries Seedance, Qwen, GLM), les plateformes agréées qui agrègent et redistribuent l'accès via une API unifiée, et les consommateurs finaux. La valeur ajoutée réside dans la simplification de l'accès, l'abaissement des coûts pour les achats groupés et l'adaptation aux paiements locaux. La montée en puissance et le rapport coût-efficacité des grands modèles chinois (comme ceux de MiniMax, DeepSeek, Kimi) favorisent également leur adoption à l'international, créant des flux transfrontaliers. Des plateformes comme OpenRouter ou Silicone Flow en Chine jouent le rôle d'infrastructures de routage et de liquidité. La rentabilité ne repose pas uniquement sur la revente avec marge. Elle provient également des **services à valeur ajoutée** : optimisation des performances (moteurs d'inférence accélérée), ingénierie de prompt, intégration des systèmes d'entreprise et services de conseil. Les secteurs à forte consommation comme le marketing, les courts-métrages, les jeux et le commerce électronique sont des débouchés clés. Cependant, ce modèle présente des **risques** : faible barrière à l'entrée entraînant une concurrence féroce, nécessité d'avances de trésorerie importantes, risques de défaut de paiement et dépendance aux changements de politique tarifaire ou d'accès des fournisseurs de modèles en amont.

marsbit05/19 02:59

Comprendre le Nouveau Modèle Économique du Token en un Article

marsbit05/19 02:59

活动图片