Tendances technologiquesActualités

Explorer les dernières innovations, les mises à niveau de protocoles, les solutions inter-chaînes et les mécanismes de sécurité dans l'espace blockchain. Adoption d'une perspective centrée sur les développeurs pour analyser les tendances technologiques émergentes et les percées potentielles.

Faire tourner un MoE sur smartphone ? Meta propose MobileMoE, avec une accélération de 3,8x sur iPhone 16 Pro

Récemment, Meta a proposé MobileMoE, une nouvelle architecture de modèle MoE (Mixture of Experts) optimisée pour fonctionner efficacement sur les smartphones. Cette approche remplace les couches denses traditionnelles des grands modèles de langage (LLM) par des couches MoE, permettant de réduire considérablement la quantité de calculs nécessaires à l'inférence tout en conservant des performances élevées. Les résultats montrent que MobileMoE atteint des scores similaires, voire supérieurs, aux modèles denses de référence sur 14 tests fondamentaux, tout en utilisant seulement 1/2 à 1/4 des opérations de calcul. Après quantification en INT4, le modèle conserve sa compétitivité. Lors de déploiements sur des appareils commerciaux comme l'iPhone 16 Pro, MobileMoE accélère l'inférence jusqu'à 3,8 fois lors de la phase d'entrée et jusqu'à 3,4 fois lors de la génération de tokens, tout en réduisant l'empreinte mémoire. L'étude établit de nouvelles frontières de Pareto pour les LLM sur appareils mobiles, offrant un meilleur compromis entre précision et coût de calcul. Les performances sont particulièrement notables sur les tâches de code et de mathématiques. Les auteurs soulignent que des progrès futurs pourraient passer par l'amélioration de l'alignement via des techniques comme le fine-tuning, le distillation et l'extension multimodale.

marsbit06/01 06:13

Faire tourner un MoE sur smartphone ? Meta propose MobileMoE, avec une accélération de 3,8x sur iPhone 16 Pro

marsbit06/01 06:13

Alibaba « met en rayon », ByteDance « s’entraîne »

Durant la dernière semaine de mai, deux événements consécutifs dans l'industrie de l'IA ont révélé les stratégies divergentes des géants chinois Alibaba et ByteDance. Alibaba adopte une approche d'application immédiate et de monétisation. Son modèle Qwen est intégré à Taobao pour des fonctionnalités comme l'essayage virtuel et la comparaison de prix, visant à transformer l'expérience d'achat. L'entreprise se positionne comme l'infrastructure ("eau, électricité, gaz") et la "caisse enregistreuse" de l'ère IA, avec ses services cloud alimentant de nombreux modèles locaux. Cette stratégie, soutenue par des réorganisations internes et l'initiative "AI Credit", génère déjà des revenus, comme en témoigne la croissance de 40% des revenus cloud externes. Cependant, elle suppose que les capacités des modèles de base n'évolueront pas assez vite pour rendre ses applications obsolètes. ByteDance, via son département Seed, privilégie la recherche fondamentale à long terme. Son objectif est "d'explorer les limites de l'intelligence". Son modèle de génération vidéo Seedance 2.0, salué comme le plus performant au monde, et des publications académiques ambitieuses sur les "modèles du monde" illustrent cette voie. La société, qui n'est pas cotée en bourse, peut se permettre d'engager des dépenses d'investissement massives (jusqu'à 470 milliards de yuans en 2026 selon des rapports) et d'accorder à ses chercheurs le temps de publier sans pression commerciale immédiate. Mais cette approche "laboratoire Nobel" commence à être questionnée par des signes de commercialisation sur des produits comme Doubao. L'article suggère que cette divergence stratégique tient moins à une philosophie qu'à un statut : Alibaba, société cotée, est soumis à la pression des marchés pour montrer des retours rapides, tandis que ByteDance, privée, peut investir sur le très long terme. Le jour où ByteDance envisagera une introduction en bourse, la pérennité de sa stratégie de recherche pure sera véritablement mise à l'épreuve.

marsbit06/01 00:12

Alibaba « met en rayon », ByteDance « s’entraîne »

marsbit06/01 00:12

Trois ans plus tard : Retour sur mon jugement de 2023 concernant ChatGPT

Trois ans après ses prédictions sur ChatGPT en mars 2023, Wang Jianshuo revient sur ses vingt affirmations initiales, évaluées en mai 2026 par des agents IA. Sur les vingt points, la majorité des tendances de fond étaient correctes : l'essor du RAG comme architecture dominante pour l'injection de connaissances, le rôle central de l'interface utilisateur en langage naturel (LUI), l'émergence de protocoles pour un "réseau d'agents", et le rattrapage technologique rapide des modèles chinois. Des erreurs notables portent sur des chiffres précis, comme les 100 billions de paramètres supposés de GPT-4 (en réalité environ 1,8 billion) ou une estimation trop basse des coûts de formation des grands modèles. Certaines prévisions se sont révélées trop absolues ("l'IA ne fera jamais de mathématiques pures") ou ont négligé les disparités (aucune vague de chômage massif, mais un impact sévère sur les jeunes diplômés). L'analyse révèle que les intuitions sur les mécanismes et les directions se sont avérées bien plus fiables que les prédictions numériques ou temporelles, souvent trop optimistes à court terme. La prudence dans les formulations et la reconnaissance des incertitudes se sont montrées précieuses avec le recul. Ce bilan offre des leçons pour les futurs pronostics : privilégier les tendances aux chiffres, anticiper les effets distributifs et accepter que certaines questions demandent plus de trois ans pour être tranchées.

marsbit05/31 16:13

Trois ans plus tard : Retour sur mon jugement de 2023 concernant ChatGPT

marsbit05/31 16:13

Trois ans plus tard : un retour sur mes prédictions de 2023 concernant ChatGPT

Trois ans après ses prédictions sur le ChatGPT en mars 2023, Wang Jianshuo revient sur ses 20 affirmations initiales. Évaluées en mai 2026 par des agents IA, la plupart de ses intuitions sur les grandes tendances se sont révélées justes : le RAG est devenu l'architecture standard pour intégrer des connaissances, l'Interface Utilisateur en Langage Naturel (LUI) a créé un nouvel écosystème, et les modèles chinois ont presque rattrapé les leaders mondiaux. Des concepts comme les réseaux d'agents et la nature limitée du test de Turing se sont également matérialisés. Cependant, les prévisions quantitatives et les affirmations trop absolues ont souvent échoué. Le paramétrage supposé du GPT-4 (100T) était inexact, et les coûts de développement des modèles ont dépassé les estimations. Il a sous-estimé la vitesse de personnalisation des IA et l'impact distribué sur l'emploi des jeunes. La capture de valeur a surtout bénéficié à la couche matérielle (comme Nvidia), et non aux seules applications. Les leçons clés sont que les mécanismes et les directions sont plus fiables que les chiffres précis, que l'optimisme à court terme doit être tempéré, et que les nuances ("peut-être", "pour l'instant") rendent les prédictions plus robustes. Cette rétrospective souligne l'importance de distinguer les tendances confirmées des questions toujours ouvertes.

链捕手05/31 13:44

Trois ans plus tard : un retour sur mes prédictions de 2023 concernant ChatGPT

链捕手05/31 13:44

Du Token à la main-d'œuvre machine : l'IA passe d'outil à « travailleur »

Alors que l'IA écrit du code, traite des tickets clients et révise des documents juridiques, elle ne se contente plus d'être un outil mais devient une source directe de travail. La commercialisation de l'IA évolue ainsi d'un marché de « jetons » (tokens) ou d'heures de GPU vers un nouveau marché : celui de la « main-d'œuvre machine ». Dans ce marché, le jeton n'est qu'une unité de mesure, le GPU un intrant, et le modèle un outil de production. L'objet véritablement tarifé et échangé est le travail économique accompli directement par le logiciel. Le mécanisme de prix de l'IA devrait évoluer des jetons bruts vers des capacités de modèles standardisées, puis vers une main-d'œuvre sectorielle, et enfin vers un marché de résultats programmables. À l'avenir, les entreprises pourraient ne plus se soucier du modèle ou du GPU spécifique utilisé, mais uniquement du fait que la tâche soit livrée dans des délais, avec un taux de précision, une fiabilité et un coût conformes aux standards. Ce changement ne signifie pas un simple remplacement du travail humain. Alors que la machine assume des tâches standardisées et vérifiables, le rôle humain pourrait se déplacer vers la supervision, la responsabilité finale, la gestion du contexte et les jugements critiques. Dans certains cas, les 1% de jugement humain final pourraient gagner en valeur, car ils permettent de débloquer les 99% d'automatisation à grande échelle. Le marché évolue donc vers une couche où le « travail » lui-même devient l'unité stable, standardisée, vérifiable et négociable. La prochaine phase de concurrence ne portera pas seulement sur la puissance des modèles ou le prix du calcul, mais sur la capacité à standardiser, vérifier et tarifer le « travail » accompli, faisant de la main-d'œuvre machine une nouvelle ressource productive que l'on peut acheter, facturer et échanger.

marsbit05/31 12:37

Du Token à la main-d'œuvre machine : l'IA passe d'outil à « travailleur »

marsbit05/31 12:37

La réduction de 99% du prix de Xiaomi MiMo n'est pas un coup marketing ! Luo Fuli répond aux détracteurs sur X

Dans un article intitulé "La réduction de 99% du prix de MiMo de Xiaomi n'est pas du marketing ! Luo Fuli répond aux détracteurs sur X", Luo Fuli, responsable de MiMo, a publié un billet de blog technique de 5000 mots pour expliquer la baisse drastique des prix de l'API MiMo-V2.5. Contrairement aux interprétations initiales d'une guerre des prix ou d'une stratégie de perte, cette réduction de 99% concerne spécifiquement le coût des entrées en cache ("Input Cache Hit"), c'est-à-dire la relecture du contexte historique dans les conversations longues. Le billet détaille six piliers d'ingénierie ayant permis cette réduction : 1. **Architecture Hybride SWA** : Réduction du volume de la mémoire cache (KVCache) à 1/7 grâce à une attention par fenêtre glissante sur 60 des 70 couches du modèle. 2. **Gestion en double pool** : Allocation efficace de la mémoire pour matérialiser les gains théoriques du SWA, multipliant par 5 le nombre d'utilisateurs simultanés par GPU. 3. **Cache de préfixe optimisé** : Augmentation du taux de réussite du cache à 93-95% en moyenne, évitant de recalculer les contextes répétés. 4. **Système de cache distribué GCache** : Stockage des données sur les SSD des machines GPU existantes, réduisant les coûts de stockage additionnels à zéro. 5. **Système de routage LLM-Router** : Optimisation de l'acheminement des requêtes pour maximiser l'utilisation du cache et améliorer les performances. 6. **Prédiction Multi-Token (MTP)** : Accélération de la génération des réponses du modèle, réduisant également les coûts de sortie. Cette chaîne d'optimisations systémiques a réduit le temps GPU par requête d'un ordre de grandeur, permettant une baisse de prix de 99% tout en maintenant une marge positive. Luo Fuli souligne qu'il s'agit d'un accomplissement d'ingénierie validé en production, et non d'une simple manœuvre marketing, offrant une référence pour réduire les coûts dans le secteur de l'IA.

marsbit05/31 10:42

La réduction de 99% du prix de Xiaomi MiMo n'est pas un coup marketing ! Luo Fuli répond aux détracteurs sur X

marsbit05/31 10:42

6 questions pour comprendre les tendances commerciales de l'IA

L'économie de l'IA est entrée dans sa phase d'« été », caractérisée par une coexistence entre le récit et la livraison concrète, où la rentabilité devient cruciale. Cette analyse s'appuie sur un cadre à six dimensions, chacune notée 1 point sur 2, pour un total de 6 points, situant le secteur en plein été (5-7 points). Les six dimensions évaluées sont : 1. **Narration vs Livraison** : Passage des promesses à des offres payantes (ex. : abonnements Doubao, publicité OpenAI). 2. **Connectivité système** : Les produits IA sortent de leur isolement pour s'intégrer aux workflows. 3. **Capacité de livraison** : L'IA est utilisée à grande échelle pour des tâches productives (ex. : milliards d'appels quotidiens sur Doubao). 4. **Rationalisation du ROI** : Les coûts (calcul, électricité) imposent une tarification et un calcul du retour sur investissement. 5. **Phénomène sectoriel** : Fin de la gratuité généralisée, début des discussions sur la profitabilité. 6. **Environnement capitalistique** : Les investissements continuent, mais les valorisations dépendent désormais des revenus. Deux signes récents illustrent cette transition : * **Doubao lance des abonnements payants** en raison des coûts astronomiques liés à ses centaines de milliards de requêtes quotidiennes. * **OpenAI lance une plateforme publicitaire** pour monétiser son immense audience et couvrir ses lourdes pertes. Pour les entreprises, la période estivale est le moment d'agir. La feuille de route proposée est en trois étapes : 1. **Démarrer petit** : Identifier un point de douleur précis, obtenir un résultat financier clair (économie/recettes) en moins de 3 mois. 2. **Répliquer et institutionnaliser** : Capitaliser sur les succès initiaux, créer des plateformes de partage de compétences en IA et adapter la structure organisationnelle (formation, incitations). 3. **Refondre par l'IA** : Repenser fondamentalement les processus pour une collaboration parallèle entre humains et IA, visant une automatisation intelligente des flux de travail. En résumé, l'été de l'IA est une phase de validation commerciale où la valeur tangible prime. La stratégie gagnante consiste à prouver la valeur sur un point précis, à l'étendre, puis à réinventer les processus métier autour de l'intelligence artificielle.

marsbit05/31 00:32

6 questions pour comprendre les tendances commerciales de l'IA

marsbit05/31 00:32

La philosophie d'investissement de Gavin Baker, investisseur précoce de Nvidia : Investir dans les goulots d'étranglement des infrastructures IA et se couvrir contre le risque du marché global

Le podcast explore la philosophie d'investissement de Gavin Baker, fondateur d'Atreides Management et investisseur de longue date dans Nvidia et Cerebras. Sa thèse centrale est que l'IA n'est pas une bulle, mais un super-cycle d'infrastructure piloté par des contraintes physiques : l'électricité, les plaquettes de silicium (wafers) et la puissance de calcul (token generation). Les opportunités de rendement excédentaire se situeraient non pas dans les modèles de langage grand public, mais dans les "vendeurs de pelles" (picks and shovels) : interconnexion des GPU, mémoire, puces d'inférence, procédés de fabrication avancés et alimentation électrique. Son portefeuille reflète cette vision : il investit de manière concentrée dans des actifs liés aux goulets d'étranglement physiques de l'IA (comme Astera Labs, Micron, Cerebras, Positron) tout en se couvrant contre un repli général du marché via des options de vente (puts) sur le QQQ. Il soutient que ce cycle diffère de la bulle internet des années 2000 car il est financé par les flux de trésorerie des grandes entreprises technologiques (Google, Amazon, Microsoft, Meta) et non par l'endettement. De plus, des contraintes d'offre strictes chez des acteurs comme TSMC, ASML ou dans le secteur de l'énergie empêchent une expansion excessive et rapide, limitant ainsi le risque de formation d'une bulle spéculative. Baker identifie quatre axes d'investissement principaux : les petits modèles de langage verticalisés, les infrastructures souveraines à déploiement rapide, l'optimisation des performances par watt (coût par token) et l'intersection énergie/espace (calcul en orbite). En résumé, sa stratégie consiste à "être long sur les goulets d'étranglement de l'infrastructure IA et court sur le risque de marché général".

marsbit05/30 03:32

La philosophie d'investissement de Gavin Baker, investisseur précoce de Nvidia : Investir dans les goulots d'étranglement des infrastructures IA et se couvrir contre le risque du marché global

marsbit05/30 03:32

Apple réinvente la compression d'images avec l'IA : La même qualité pour des fichiers trois fois plus petits

La compression d’image entre dans une nouvelle ère avec l’arrivée de l’IA. En février 2025, le groupe JPEG a officiellement lancé JPEG AI, le premier standard international de codage d’images basé sur l’apprentissage automatique. Toutefois, même cette avancée reste éloignée de la « compression perceptuelle », qui optimise l’expérience visuelle humaine plutôt que des indicateurs mathématiques comme le PSNR. Apple répond à ce défi avec PICO (Perceptual Image Codec), un codec conçu pour plaire à l’œil humain. Il résout trois problèmes clés : 1. **Vitesse** : grâce à un modèle de contexte « one-shot », il évite la lenteur de l’encodage autorégressif classique. 2. **Hallucinations** : une fonction de perte dédiée (TextFidelityLoss) préserve la précision du texte, réduisant de moitié les erreurs dans ces zones. 3. **Artefacts** : une perte spécifique (TilingArtifactLoss) supprime les différences de couleur entre les blocs d’image. Lors d’un test subjectif à grande échelle, PICO a réduit la taille des fichiers de 30 à 43 % par rapport aux codecs comme AV1, VVC ou JPEG AI, à qualité visuelle équivalente. Sur un iPhone 17 Pro Max, il code une photo 12 MP en 230 ms et la décode en 150 ms. Bien que moins efficace sur les images synthétiques (dessins, schémas), PICO marque un tournant en priorisant systématiquement la perception humaine, ouvrant la voie à une compression plus intelligente et intégrée dans nos appareils.

marsbit05/30 02:51

Apple réinvente la compression d'images avec l'IA : La même qualité pour des fichiers trois fois plus petits

marsbit05/30 02:51

活动图片