L'exécution locale de Gemma 4 sur iPhone fait sensation : à quelle distance se trouve l'ère du zéro token ?

marsbitPublié le 2026-04-06Dernière mise à jour le 2026-04-06

Résumé

Le nouveau modèle Gemma 4 de Google, récemment open-source, permet une exécution locale sur smartphone avec des performances remarquables. Les versions allégées (E2B et E4B) offrent une fenêtre contextuelle de 128K et atteignent une vitesse de traitement dépassant 40 tokens par seconde sur iPhone 17 Pro et appareils Android compatibles, grâce à des optimisations logicielles comme MLX d'Apple. Bien que simple à utiliser via l'application officielle Google AI Edge Gallery, Gemma 4 montre des limites dans des tâches complexes comme l'appel d'outils structurés ou le codage agent, où des modèles comme Qwen3-coder restent supérieurs. Malgré une intelligence parfois jugée "limite", sa capacité à traiter localement requêtes, discussions et génération de code ouvre la voie à une réduction de la dépendance aux APIs cloud. Cette avancée annonce un changement de paradigme : les modèles locaux pourraient à terme remplacer les solutions cloud pour les tâches courantes, poussant les fournisseurs de tokens à se concentrer sur des capacités plus avancées comme les agents complexes ou le traitement de données massives. Gemma 4 n'est qu'un début ; la frontière entre local et cloud s'estompera bientôt.

Rédaction de Machine Heart

Le nouveau modèle open source de Google, Gemma 4, a offert une belle surprise au secteur il y a quelques jours.

Il adopte une architecture technologique homologue à celle de Gemini 3, prend en charge le multimodal natif, a obtenu la troisième place mondiale au classement Arena AI, et propose plusieurs modèles. Les plus petits modèles — E2B (2,3 milliards de paramètres effectifs) et E4B (4,5 milliards de paramètres effectifs) — peuvent être déployés et exécutés localement sur un téléphone portable, avec une fenêtre contextuelle atteignant 128K. On peut dire que c'est un « substitutif à Gemini qui tient dans la poche ».

Sans surprise, le modèle est rapidement devenu un nouveau jouet pour les utilisateurs de mobiles.

Un post d'un utilisateur de X a notamment été vu des centaines de milliers de fois. Il y a partagé une vidéo montrant comment il exécutait Gemma 4 localement sur son iPhone, y compris le traitement d'images, d'audio et le contrôle de l'interrupteur de la lampe torche. Il a déclaré que Gemma 4 était incroyablement rapide, comme par magie.

Quelqu'un a quantifié cette vitesse sur un iPhone 17 Pro, indiquant que si le téléphone utilise une puce Apple, alors avec l'aide de MLX (le framework d'apprentissage automatique d'Apple) optimisé pour cette puce, la vitesse d'inférence du modèle peut dépasser 40 tokens par seconde.

D'autres ont également obtenu des vitesses similaires sur un Samsung Galaxy, et ce même avec le mode de réflexion activé. Ce qui pousse à s'exclamer que c'est « trop rapide pour être vrai ».

Une telle vitesse fait de l'exécution de modèles d'IA sur appareil mobile une option viable pour l'avenir, et elle est très utile dans des scénarios sensibles comme la santé.

La fenêtre contextuelle de 128k rend également ces petits modèles plus attractifs.

Alors, comment l'exécuter ? C'est en fait très simple, ce n'est pas réservé aux geeks, car Google a publié une application officielle — Google AI Edge Gallery. Les personnes souhaitant l'expérimenter sur leur téléphone peuvent simplement télécharger cette application, puis télécharger la version du modèle qu'ils souhaitent exécuter, l'ouvrir et c'est parti.

De plus, comme c'est une publication officielle de Google, les problèmes de sécurité ne sont pas vraiment à craindre.

Outre ces petits modèles exécutés sur mobile, certains ont testé des versions plus grandes de Gemma 4 sur du matériel plus puissant, comme l'exécution de Gemma 4 Mixture-of-Experts 26B sur un MacBook Pro version M5 Pro.

Pour une conversation directe, ce modèle est encore rapide, la génération de texte et l'explication de code sont fluides.

Mais lorsqu'il a vraiment utilisé Gemma 4 comme agent de codage, les problèmes sont apparus. Car exécuter un agent nécessite un grand contexte (Gemma 4 26B a une fenêtre contextuelle de 256k), des prompts complexes et des appels d'outils stables. Gemma 4 a clairement du mal à tenir le coup sur ces aspects, plantant souvent, générant des erreurs, ou produisant une structure de sortie incorrecte.

Le point de basculement est survenu lorsqu'il a remplacé le modèle par qwen3-coder. Dans le même environnement, la création de fichiers, l'exécution de commandes et les tâches à plusieurs étapes fonctionnaient normalement. Il estime que le problème ne vient pas du framework d'agent, mais du modèle lui-même et de son éventuelle optimisation pour les « appels d'outils + sortie structurée ». Sur ce point, Gemma 4 n'est peut-être pas encore assez abouti, ou peut-être que ce développeur n'a tout simplement pas encore trouvé la bonne méthode.

De plus, certains disent que le niveau intellectuel de Gemma 4 est encore un peu limité.

Malgré cela, l'émergence de Gemma 4, cette « petite bombe de performances », ne doit pas être sous-estimée. Si à l'avenir, une grande partie des requêtes quotidiennes, des discussions, des raisonnements simples, de la génération de code et des tâches de compréhension d'images peuvent être exécutées localement, sans avoir à acheter de tokens, les vendeurs de tokens ne se retrouveraient-ils pas dans une position délicate ?

Bien sûr, la situation actuelle n'est pas encore si pessimiste, car il existe encore un écart entre les modèles open source disponibles et les modèles propriétaires de pointe, et la plupart des modèles open source performants sont encore limités par les capacités matérielles, ne pouvant temporairement pas atteindre un niveau utilisable sur les appareils.

Mais la tendance future est claire. À court terme, les modèles propriétaires cloud conservent leur avance sur le raisonnement complexe de pointe et la collaboration multi-agents à très grande échelle ; mais à long terme, avec la progression du matériel et l'optimisation continue des techniques de quantification, les modèles on-device grignoteront progressivement les tâches simples et fréquentes du cloud.

Les acteurs qui ne vivent que de la vente de tokens et d'abonnements API devront se concentrer plus intensément sur les parties « vraiment difficiles » — les agents ultra-puissants, les contextes longs et fiables, et les capacités spécialisées nécessitant des données massives en temps réel.

Gemma 4 n'est qu'un début. La prochaine surprise pourrait bien être qu'un modèle on-device rende l'utilisateur totalement incapable de sentir la différence entre « local » et « cloud » lors d'une utilisation quotidienne. Le jour où cela arrivera, l'ensemble du modèle économique de l'industrie de l'IA connaîtra un véritable bouleversement.

Cet article provient du compte WeChat officiel « Machine Heart » (ID: almosthuman2014), auteur : Machine Heart

Questions liées

QQu'est-ce que Gemma 4 et pourquoi est-il considéré comme une surprise dans l'industrie ?

AGemma 4 est un nouveau modèle open-source de Google, basé sur la même architecture technique que Gemini 3. Il prend en charge le multimodal natif, se classe troisième au classement Arena AI et propose plusieurs modèles, dont des versions plus petites conçues pour fonctionner localement sur les téléphones. Il est considéré comme une surprise en raison de ses performances élevées et de son accessibilité sur les appareils mobiles.

QQuelle est la vitesse de traitement de Gemma 4 sur un iPhone 17 Pro avec la puce Apple ?

ASur un iPhone 17 Pro équipé d'une puce Apple et optimisé avec MLX (le framework d'apprentissage automatique d'Apple), la vitesse d'inférence de Gemma 4 peut dépasser 40 tokens par seconde.

QComment peut-on exécuter Gemma 4 localement sur un téléphone mobile ?

APour exécuter Gemma 4 localement sur un téléphone, les utilisateurs peuvent télécharger l'application officielle Google AI Edge Gallery, puis télécharger la version du modèle qu'ils souhaitent exécuter. Une fois installé, le modèle peut être exécuté directement depuis l'application.

QQuelles sont les limitations de Gemma 4 lorsqu'il est utilisé comme agent de codage ?

ALorsqu'il est utilisé comme agent de codage, Gemma 4 rencontre des problèmes avec les grands contextes (fenêtre contextuelle de 256k pour la version 26B), les invites complexes et les appels d'outils stables. Il a tendance à planter, à générer des erreurs ou à produire des structures de sortie incorrectes, contrairement à d'autres modèles comme qwen3-coder qui fonctionnent mieux dans ces scénarios.

QQuel impact Gemma 4 pourrait-il avoir sur l'avenir des modèles d'IA et les entreprises qui vendent des tokens ?

AGemma 4 pourrait permettre à de nombreuses tâches quotidiennes (requêtes, discussions, raisonnements simples, génération de code, compréhension d'images) d'être exécutées localement sans avoir à acheter des tokens. Cela pourrait menacer les entreprises qui dépendent de la vente de tokens ou d'abonnements API, les obligeant à se concentrer sur des capacités plus avancées comme les agents ultra-performants, les contextes longs et fiables, et les compétences spécialisées nécessitant des données massives en temps réel.

Lectures associées

La guerre des stablecoins vient de trouver un nouveau prétendant — et celui-ci dispose de 500 000 points de vente

MoneyGram, l'un des plus grands réseaux de transfert de fonds transfrontaliers, a lancé le 2 juin le MGUSD, un stablecoin natif adossé au dollar américain. Cette initiative marque un tournant stratégique : après s'être appuyé sur des infrastructures tierces comme l'USDC de Circle, l'entreprise émet désormais sa propre monnaie numérique, lui permettant de contrôler directement l'émission, les réserves et les rendements. L'importance de ce lancement réside dans l'envergure de MoneyGram : une institution de paiement de 85 ans, présente dans plus de 200 pays avec environ 500 000 points de vente. En ciblant les familles dépendantes des transferts d'argent, notamment en Amérique latine, en Afrique et en Asie du Sud-Est, ce stablecoin normalise l'utilisation des actifs numériques pour un public éloigné de la cryptosphère. Ce déploiement intervient dans le cadre du GENIUS Act de 2026, une loi américaine offrant un cadre réglementaire clair aux émetteurs de stablecoins. MoneyGram a progressivement construit son infrastructure numérique, via des partenariats (Stellar) et des intégrations (Fireblocks), pour réduire sa dépendance externe et maîtriser sa pile de paiement. L'entrée d'un géant des transferts d'argent dans l'émission de stablecoins signale que cette économie dépasse désormais le secteur cryptographique pour devenir un enjeu central de l'industrie mondiale des paiements.

bitcoinistIl y a 20 mins

La guerre des stablecoins vient de trouver un nouveau prétendant — et celui-ci dispose de 500 000 points de vente

bitcoinistIl y a 20 mins

a16z Crypto publie un nouvel article : Pourquoi avons-nous besoin de marchés prédictifs ?

Les marchés de prédiction, qui permettent de miser sur des résultats futurs, gagnent en popularité pour anticiper des événements allant de la politique aux prix culturels. Selon l’auteur, économiste spécialisé, ils fonctionnent comme des marchés classiques : en agrégeant les informations et croyances des participants via les prix, ils génèrent une estimation probabiliste en temps réel. Leur force réside dans leur capacité à fournir directement une probabilité, contrairement aux sondages qui ne donnent que des proportions, et à inciter les acteurs à utiliser des informations fiables grâce à des enjeux financiers. Historiquement utilisés par les entreprises et les chercheurs, ces marchés s’appuient sur des travaux académiques remontant aux années 1980 et connaissent un nouvel essor avec Internet. Ils permettent désormais de créer des contrats sur des questions très ciblées, comme les performances de modèles d’IA. Cependant, leur efficacité dépend de plusieurs conditions : une infrastructure transparente, un règlement incontestable des événements, et une participation suffisamment diversifiée pour éviter les biais. Des défis subsistent, comme la manipulation par des initiés ou la distorsion intentionnelle des prix, mais des mécanismes d’autocorrection existent. Avec une conception rigoureuse, les marchés de prédiction pourraient devenir un outil clé pour éclairer l’avenir.

链捕手Il y a 23 mins

a16z Crypto publie un nouvel article : Pourquoi avons-nous besoin de marchés prédictifs ?

链捕手Il y a 23 mins

Guardis Lance une Plateforme de Trading et de Sécurité On-Chain Propulsée par l'IA

La plateforme de trading et de sécurité on-chain Guardis, qui suit les "smart money" et identifie les fraudes, a officiellement été lancée. Initialement déployée sur Solana, il s'agit d'une plateforme non-custodiale qui combine en une seule interface des outils d'intelligence sur les portefeuilles, de détection automatique de fraudes et de trading à très faible latence. Conçue en réaction à l'augmentation des arnaques et des "rug pulls" ciblant les traders, notamment sur les memecoins, Guardis vise à sécuriser le trading en offrant plus de visibilité sur l'activité des tokens et les menaces avant toute transaction. Ses fonctionnalités principales incluent : le "Token Stream" pour suivre les nouveaux lancements de tokens en temps réel ; les "Smart Signals" qui analysent le comportement on-chain pour repérer les tokens en momentum précoce ; et le "Smart Screener", une couche d'intelligence propriétaire qui identifie les traders performants. Pour la sécurité, "Warden", son outil de surveillance automatisé, détecte proactivement les risques et activités malveillantes, attribuant un score de sécurité à chaque token. La plateforme propose également une intégration Telegram pour recevoir des alertes et trader, avec un système de frais de trading, de cashback et un programme de parrainage. Guardis prévoit de s'étendre à d'autres blockchains à l'avenir.

TheNewsCryptoIl y a 49 mins

Guardis Lance une Plateforme de Trading et de Sécurité On-Chain Propulsée par l'IA

TheNewsCryptoIl y a 49 mins

Bilan semestriel de Fidelity : 6 tendances clés pour les actifs numériques en 2026

À mi-parcours de l’année 2026, le paysage des actifs numériques présente un équilibre entre pressions à court terme et progrès structurels à plus long terme. Les principales tendances identifiées par Fidelity Digital Assets évoluent globalement comme prévu. L’intégration avec les marchés de capitaux traditionnels s’accélère, portée par une demande institutionnelle soutenue, l’expansion des produits réglementés (comme les options sur ETP Bitcoin) et des avancées réglementaires. La tokenisation gagne également en dynamisme. Cependant, les droits des détenteurs de tokens, bien que de plus en plus discutés, ne se traduisent pas encore par une prime de valorisation claire. Par ailleurs, la croissance du taux de hachage Bitcoin ralentit, possiblement en raison d’une concurrence accrue des centres de données d’IA pour les ressources énergétiques. Le réseau Bitcoin, quant à lui, reste stable malgré l’augmentation de la capacité de données OP_RETURN, mais une surveillance est nécessaire face aux fluctuations des nœuds Bitcoin Knots. Sur les marchés, le scénario baissier a dominé en 2026 (Bitcoin en baisse de 13%), bien que des fondamentaux structurels positifs persistent. L’or performe toujours, soutenu par la demande des banques centrales, mais le surperformance anticipée du Bitcoin ne s’est pas encore matérialisée. En résumé, si les cours sont volatils, les bases d’une croissance future – adoption institutionnelle, infrastructure et cadre réglementaire – continuent de se consolider.

marsbitIl y a 1 h

Bilan semestriel de Fidelity : 6 tendances clés pour les actifs numériques en 2026

marsbitIl y a 1 h

Trading

Spot
Futures

Articles tendance

Comment acheter 4

Bienvenue sur HTX.com ! Nous vous permettons d'acheter 4 (4) de manière simple et pratique. Suivez notre guide étape par étape pour commencer votre parcours crypto.Étape 1 : Création de votre compte HTXUtilisez votre adresse e-mail ou votre numéro de téléphone pour ouvrir un compte sur HTX gratuitement. L'inscription se fait en toute simplicité et débloque toutes les fonctionnalités.Créer mon compteÉtape 2 : Choix du mode de paiement (rubrique Acheter des cryptosCarte de crédit/débit : utilisez votre carte Visa ou Mastercard pour acheter instantanément 4 (4).Solde :utilisez les fonds du solde de votre compte HTX pour trader en toute simplicité.Prestataire tiers :pour accroître la commodité d'utilisation, nous avons ajouté des modes de paiement populaires tels que Google Pay et Apple Pay.P2P :tradez directement avec d'autres utilisateurs sur HTX.OTC (de gré à gré) : nous offrons des services personnalisés et des taux de change compétitifs aux traders.Étape 3 : stockage de vos 4 (4)Après avoir acheté vos 4 (4), stockez-les sur votre compte HTX. Vous pouvez également les envoyer ailleurs via un transfert sur la blockchain ou les utiliser pour trader d'autres cryptos.Étape 4 : tradez des 4 (4)Tradez facilement 4 (4) sur le marché Spot de HTX. Il vous suffit d'accéder à votre compte, de sélectionner la paire de trading, d'exécuter vos trades et de les suivre en temps réel. Nous offrons une expérience conviviale aux débutants comme aux traders chevronnés.

424 vues totalesPublié le 2025.10.20Mis à jour le 2026.06.02

Comment acheter 4

Discussions

Bienvenue dans la Communauté HTX. Ici, vous pouvez vous tenir informé(e) des derniers développements de la plateforme et accéder à des analyses de marché professionnelles. Les opinions des utilisateurs sur le prix de 4 (4) sont présentées ci-dessous.

活动图片