L'exécution locale de Gemma 4 sur iPhone fait sensation : à quelle distance se trouve l'ère du zéro token ?

marsbitPublié le 2026-04-06Dernière mise à jour le 2026-04-06

Résumé

Le nouveau modèle Gemma 4 de Google, récemment open-source, permet une exécution locale sur smartphone avec des performances remarquables. Les versions allégées (E2B et E4B) offrent une fenêtre contextuelle de 128K et atteignent une vitesse de traitement dépassant 40 tokens par seconde sur iPhone 17 Pro et appareils Android compatibles, grâce à des optimisations logicielles comme MLX d'Apple. Bien que simple à utiliser via l'application officielle Google AI Edge Gallery, Gemma 4 montre des limites dans des tâches complexes comme l'appel d'outils structurés ou le codage agent, où des modèles comme Qwen3-coder restent supérieurs. Malgré une intelligence parfois jugée "limite", sa capacité à traiter localement requêtes, discussions et génération de code ouvre la voie à une réduction de la dépendance aux APIs cloud. Cette avancée annonce un changement de paradigme : les modèles locaux pourraient à terme remplacer les solutions cloud pour les tâches courantes, poussant les fournisseurs de tokens à se concentrer sur des capacités plus avancées comme les agents complexes ou le traitement de données massives. Gemma 4 n'est qu'un début ; la frontière entre local et cloud s'estompera bientôt.

Rédaction de Machine Heart

Le nouveau modèle open source de Google, Gemma 4, a offert une belle surprise au secteur il y a quelques jours.

Il adopte une architecture technologique homologue à celle de Gemini 3, prend en charge le multimodal natif, a obtenu la troisième place mondiale au classement Arena AI, et propose plusieurs modèles. Les plus petits modèles — E2B (2,3 milliards de paramètres effectifs) et E4B (4,5 milliards de paramètres effectifs) — peuvent être déployés et exécutés localement sur un téléphone portable, avec une fenêtre contextuelle atteignant 128K. On peut dire que c'est un « substitutif à Gemini qui tient dans la poche ».

Sans surprise, le modèle est rapidement devenu un nouveau jouet pour les utilisateurs de mobiles.

Un post d'un utilisateur de X a notamment été vu des centaines de milliers de fois. Il y a partagé une vidéo montrant comment il exécutait Gemma 4 localement sur son iPhone, y compris le traitement d'images, d'audio et le contrôle de l'interrupteur de la lampe torche. Il a déclaré que Gemma 4 était incroyablement rapide, comme par magie.

Quelqu'un a quantifié cette vitesse sur un iPhone 17 Pro, indiquant que si le téléphone utilise une puce Apple, alors avec l'aide de MLX (le framework d'apprentissage automatique d'Apple) optimisé pour cette puce, la vitesse d'inférence du modèle peut dépasser 40 tokens par seconde.

D'autres ont également obtenu des vitesses similaires sur un Samsung Galaxy, et ce même avec le mode de réflexion activé. Ce qui pousse à s'exclamer que c'est « trop rapide pour être vrai ».

Une telle vitesse fait de l'exécution de modèles d'IA sur appareil mobile une option viable pour l'avenir, et elle est très utile dans des scénarios sensibles comme la santé.

La fenêtre contextuelle de 128k rend également ces petits modèles plus attractifs.

Alors, comment l'exécuter ? C'est en fait très simple, ce n'est pas réservé aux geeks, car Google a publié une application officielle — Google AI Edge Gallery. Les personnes souhaitant l'expérimenter sur leur téléphone peuvent simplement télécharger cette application, puis télécharger la version du modèle qu'ils souhaitent exécuter, l'ouvrir et c'est parti.

De plus, comme c'est une publication officielle de Google, les problèmes de sécurité ne sont pas vraiment à craindre.

Outre ces petits modèles exécutés sur mobile, certains ont testé des versions plus grandes de Gemma 4 sur du matériel plus puissant, comme l'exécution de Gemma 4 Mixture-of-Experts 26B sur un MacBook Pro version M5 Pro.

Pour une conversation directe, ce modèle est encore rapide, la génération de texte et l'explication de code sont fluides.

Mais lorsqu'il a vraiment utilisé Gemma 4 comme agent de codage, les problèmes sont apparus. Car exécuter un agent nécessite un grand contexte (Gemma 4 26B a une fenêtre contextuelle de 256k), des prompts complexes et des appels d'outils stables. Gemma 4 a clairement du mal à tenir le coup sur ces aspects, plantant souvent, générant des erreurs, ou produisant une structure de sortie incorrecte.

Le point de basculement est survenu lorsqu'il a remplacé le modèle par qwen3-coder. Dans le même environnement, la création de fichiers, l'exécution de commandes et les tâches à plusieurs étapes fonctionnaient normalement. Il estime que le problème ne vient pas du framework d'agent, mais du modèle lui-même et de son éventuelle optimisation pour les « appels d'outils + sortie structurée ». Sur ce point, Gemma 4 n'est peut-être pas encore assez abouti, ou peut-être que ce développeur n'a tout simplement pas encore trouvé la bonne méthode.

De plus, certains disent que le niveau intellectuel de Gemma 4 est encore un peu limité.

Malgré cela, l'émergence de Gemma 4, cette « petite bombe de performances », ne doit pas être sous-estimée. Si à l'avenir, une grande partie des requêtes quotidiennes, des discussions, des raisonnements simples, de la génération de code et des tâches de compréhension d'images peuvent être exécutées localement, sans avoir à acheter de tokens, les vendeurs de tokens ne se retrouveraient-ils pas dans une position délicate ?

Bien sûr, la situation actuelle n'est pas encore si pessimiste, car il existe encore un écart entre les modèles open source disponibles et les modèles propriétaires de pointe, et la plupart des modèles open source performants sont encore limités par les capacités matérielles, ne pouvant temporairement pas atteindre un niveau utilisable sur les appareils.

Mais la tendance future est claire. À court terme, les modèles propriétaires cloud conservent leur avance sur le raisonnement complexe de pointe et la collaboration multi-agents à très grande échelle ; mais à long terme, avec la progression du matériel et l'optimisation continue des techniques de quantification, les modèles on-device grignoteront progressivement les tâches simples et fréquentes du cloud.

Les acteurs qui ne vivent que de la vente de tokens et d'abonnements API devront se concentrer plus intensément sur les parties « vraiment difficiles » — les agents ultra-puissants, les contextes longs et fiables, et les capacités spécialisées nécessitant des données massives en temps réel.

Gemma 4 n'est qu'un début. La prochaine surprise pourrait bien être qu'un modèle on-device rende l'utilisateur totalement incapable de sentir la différence entre « local » et « cloud » lors d'une utilisation quotidienne. Le jour où cela arrivera, l'ensemble du modèle économique de l'industrie de l'IA connaîtra un véritable bouleversement.

Cet article provient du compte WeChat officiel « Machine Heart » (ID: almosthuman2014), auteur : Machine Heart

Questions liées

QQu'est-ce que Gemma 4 et pourquoi est-il considéré comme une surprise dans l'industrie ?

AGemma 4 est un nouveau modèle open-source de Google, basé sur la même architecture technique que Gemini 3. Il prend en charge le multimodal natif, se classe troisième au classement Arena AI et propose plusieurs modèles, dont des versions plus petites conçues pour fonctionner localement sur les téléphones. Il est considéré comme une surprise en raison de ses performances élevées et de son accessibilité sur les appareils mobiles.

QQuelle est la vitesse de traitement de Gemma 4 sur un iPhone 17 Pro avec la puce Apple ?

ASur un iPhone 17 Pro équipé d'une puce Apple et optimisé avec MLX (le framework d'apprentissage automatique d'Apple), la vitesse d'inférence de Gemma 4 peut dépasser 40 tokens par seconde.

QComment peut-on exécuter Gemma 4 localement sur un téléphone mobile ?

APour exécuter Gemma 4 localement sur un téléphone, les utilisateurs peuvent télécharger l'application officielle Google AI Edge Gallery, puis télécharger la version du modèle qu'ils souhaitent exécuter. Une fois installé, le modèle peut être exécuté directement depuis l'application.

QQuelles sont les limitations de Gemma 4 lorsqu'il est utilisé comme agent de codage ?

ALorsqu'il est utilisé comme agent de codage, Gemma 4 rencontre des problèmes avec les grands contextes (fenêtre contextuelle de 256k pour la version 26B), les invites complexes et les appels d'outils stables. Il a tendance à planter, à générer des erreurs ou à produire des structures de sortie incorrectes, contrairement à d'autres modèles comme qwen3-coder qui fonctionnent mieux dans ces scénarios.

QQuel impact Gemma 4 pourrait-il avoir sur l'avenir des modèles d'IA et les entreprises qui vendent des tokens ?

AGemma 4 pourrait permettre à de nombreuses tâches quotidiennes (requêtes, discussions, raisonnements simples, génération de code, compréhension d'images) d'être exécutées localement sans avoir à acheter des tokens. Cela pourrait menacer les entreprises qui dépendent de la vente de tokens ou d'abonnements API, les obligeant à se concentrer sur des capacités plus avancées comme les agents ultra-performants, les contextes longs et fiables, et les compétences spécialisées nécessitant des données massives en temps réel.

Lectures associées

Polymarket coincé : le véritable examen après avoir profité de l'effet de flux est arrivé

Polymarket, la principale plateforme de marchés prédictifs, fait face à de sérieux problèmes de performance et de latence qui dégradent l'expérience utilisateur. L'équipe, dirigée par le vice-président de l'ingénierie DeFi Josh Stevens, a reconnu que sa croissance a dépassé la capacité de son infrastructure actuelle, basée sur Polygon. La solution envisagée est une migration de la chaîne de base ("chain migration") et une refonte complète du système, notamment la reconstruction du carnet d'ordres (CLOB V2). L'objectif est d'obtenir plus d'espace bloc, des frais de gaz réduits et des temps de bloc plus rapides pour supporter une activité de trading plus fréquente et complexe, incluant bientôt des produits dérivés perpétuels ("Perps"). Cette annonce a déclenché une compétition entre plusieurs blockchains (Solana, Sui, Algorand, etc.) qui cherchent à accueillir Polymarket, un acteur majeur générant des revenus substantiels en frais. Pour Polygon, le départ potentiel de Polymarket représenterait une perte significative. Le véritable défi pour Polymarket n'est plus de prouver la demande pour son marché, mais de construire une infrastructure stable et fiable capable de retenir les utilisateurs et de supporter un trading intensif.

Odaily星球日报04/27 03:23

Polymarket coincé : le véritable examen après avoir profité de l'effet de flux est arrivé

Odaily星球日报04/27 03:23

Le principal obstacle à la nomination de Warsh à la présidence de la Fed le 15 mai est levé après le « revirement » d'un sénateur clé

L'obstacle clé à la nomination de Kevin Warsh comme président de la Fed a été levé après que le sénateur républicain Thom Tillis a retiré son opposition. Tillis, membre influent de la commission bancaire du Sénat, a justifié sa décision par la clôture de l'enquête criminelle visant le président sortant Jerome Powell, garantissant selon lui l'indépendance de la Fed. Le vote en commission est prévu le 29 avril, avec une confirmation finale attendue vers le 15 mai, date à laquelle le mandat de Powell expire. Warsh, largement soutenu par les républicains, prévoit des réformes majeures incluant l'abolition du "dot plot" et une révision des mécanismes de forward guidance, ce qui pourrait fondamentalement transformer le cadre de pricing des actifs globaux. Bien que l'enquête criminelle soit close, Powell reste sous scrutiny concernant des dépenses de rénovation, et sa position au conseil de la Fed (jusqu'en 2028) n'est pas encore assurée. Les marchés devront anticiper une refonte des outils de communication de la Fed, potentiellement source de volatilité et de réévaluation des modèles de prix.

marsbit04/27 02:59

Le principal obstacle à la nomination de Warsh à la présidence de la Fed le 15 mai est levé après le « revirement » d'un sénateur clé

marsbit04/27 02:59

Réduire les attentes pour le prochain cycle haussier du BTC

L'auteur Alex Xu, anciennement grand détenteur de Bitcoin, a réduit sa position à 30% malgré une vision à long terme positive. Il explique cette décision par six raisons principales : 1. L'énergie potentielle pour une nouvelle hausse cyclique est moindre, car le Bitcoin a déjà conquis les investisseurs institutionnels via les ETF. La prochaine étape nécessiterait une adoption par les banques centrales ou les fonds souverains, ce qui semble improbable à court terme. 2. Son coût d'opportunité a augmenté avec la découverte d'autres investissements attractifs. 3. L'industrie crypto dans son ensemble est en déclin, avec peu de modèles économiques viables (seul le DeFi génère des profits), ce qui réduit la base de détenteurs de BTC. 4. Le principal acheteur de BTC, Strategy, voit son coût de financement augmenter (11,5%), ce qui pourrait ralentir ses achats et exercer une pression vendeuse. 5. L'or tokenisé, un concurrent direct, offre désormais les mêmes avantages de divisibilité et de transférabilité que le Bitcoin. 6. Le problème du budget de sécurité du Bitcoin s'aggrave avec le halving, les nouvelles sources de frais (comme les inscriptions) ayant échoué. Malgré cette réduction, l'auteur conserve une exposition significative au Bitcoin et reste ouvert à racheter si les conditions évoluent favorablement.

marsbit04/27 02:50

Réduire les attentes pour le prochain cycle haussier du BTC

marsbit04/27 02:50

Les marchés prédictifs dépendent des délits d'initiés, mais les délits d'initiés sont en train de les tuer

L'article de Nic Carter explore le paradoxe central des marchés prédictifs : ils dépendent des initiés partageant des informations privilégiées pour générer des prix précis, mais cette même pratique d'initiés, comme le récent scandale d'un militaire américain ayant gagné 400 000 $ sur Polymarket, risque de détruire la confiance des petits investisseurs. L'auteur explique que la valeur sociale de ces marchés réside dans leur capacité à motiver la divulgation d'informations, mais un excès de trading d'initiés peut conduire les particuliers à se retirer, réduisant ainsi la liquidité. À l'inverse, une réglementation trop stricte étoufferait le flux d'informations précieuses. Le texte conclut sur le dilemme de trouver un équilibre entre l'efficacité informationnelle et une perception d'équité pour assurer la survie à long terme de ces plateformes.

marsbit04/27 02:39

Les marchés prédictifs dépendent des délits d'initiés, mais les délits d'initiés sont en train de les tuer

marsbit04/27 02:39

Le détroit d’Ormuz, l’Iran peut-il le « contrôler » ?

L'Iran a annoncé un projet global pour contrôler le détroit d'Ormuz, incluant l'exigence d'autorisations de transit, des frais de passage (payables de préférence en rials), et l'interdiction absolue des navires israéliens. Les analystes y voient une manœuvre pour exercer une pression économique sur les États-Unis et Israël, obtenir de nouvelles sources de revenus et lier le transit à des demandes d'indemnisation de guerre. Cependant, la mise en œuvre reste incertaine en raison des défis pratiques, des contestations juridiques internationales, de l'opposition mondiale et des contre-mesures américaines, dont le blocus des ports iraniens. Le projet pourrait surtout servir de monnaie d'échange dans de futures négociations.

marsbit04/27 01:34

Le détroit d’Ormuz, l’Iran peut-il le « contrôler » ?

marsbit04/27 01:34

Trading

Spot

Futures

Articles tendance

Comment acheter 4

Bienvenue sur HTX.com ! Nous vous permettons d'acheter 4 (4) de manière simple et pratique. Suivez notre guide étape par étape pour commencer votre parcours crypto.Étape 1 : Création de votre compte HTXUtilisez votre adresse e-mail ou votre numéro de téléphone pour ouvrir un compte sur HTX gratuitement. L'inscription se fait en toute simplicité et débloque toutes les fonctionnalités.Créer mon compteÉtape 2 : Choix du mode de paiement (rubrique Acheter des cryptosCarte de crédit/débit : utilisez votre carte Visa ou Mastercard pour acheter instantanément 4 (4).Solde ：utilisez les fonds du solde de votre compte HTX pour trader en toute simplicité.Prestataire tiers ：pour accroître la commodité d'utilisation, nous avons ajouté des modes de paiement populaires tels que Google Pay et Apple Pay.P2P ：tradez directement avec d'autres utilisateurs sur HTX.OTC (de gré à gré) : nous offrons des services personnalisés et des taux de change compétitifs aux traders.Étape 3 : stockage de vos 4 (4)Après avoir acheté vos 4 (4), stockez-les sur votre compte HTX. Vous pouvez également les envoyer ailleurs via un transfert sur la blockchain ou les utiliser pour trader d'autres cryptos.Étape 4 : tradez des 4 (4)Tradez facilement 4 (4) sur le marché Spot de HTX. Il vous suffit d'accéder à votre compte, de sélectionner la paire de trading, d'exécuter vos trades et de les suivre en temps réel. Nous offrons une expérience conviviale aux débutants comme aux traders chevronnés.

398 vues totalesPublié le 2025.10.20Mis à jour le 2025.10.20

Discussions

Bienvenue dans la Communauté HTX. Ici, vous pouvez vous tenir informé(e) des derniers développements de la plateforme et accéder à des analyses de marché professionnelles. Les opinions des utilisateurs sur le prix de 4 (4) sont présentées ci-dessous.