L'exécution locale de Gemma 4 sur iPhone fait sensation : à quelle distance se trouve l'ère du zéro token ?

marsbitPublié le 2026-04-06Dernière mise à jour le 2026-04-06

Résumé

Le nouveau modèle Gemma 4 de Google, récemment open-source, permet une exécution locale sur smartphone avec des performances remarquables. Les versions allégées (E2B et E4B) offrent une fenêtre contextuelle de 128K et atteignent une vitesse de traitement dépassant 40 tokens par seconde sur iPhone 17 Pro et appareils Android compatibles, grâce à des optimisations logicielles comme MLX d'Apple. Bien que simple à utiliser via l'application officielle Google AI Edge Gallery, Gemma 4 montre des limites dans des tâches complexes comme l'appel d'outils structurés ou le codage agent, où des modèles comme Qwen3-coder restent supérieurs. Malgré une intelligence parfois jugée "limite", sa capacité à traiter localement requêtes, discussions et génération de code ouvre la voie à une réduction de la dépendance aux APIs cloud. Cette avancée annonce un changement de paradigme : les modèles locaux pourraient à terme remplacer les solutions cloud pour les tâches courantes, poussant les fournisseurs de tokens à se concentrer sur des capacités plus avancées comme les agents complexes ou le traitement de données massives. Gemma 4 n'est qu'un début ; la frontière entre local et cloud s'estompera bientôt.

Rédaction de Machine Heart

Le nouveau modèle open source de Google, Gemma 4, a offert une belle surprise au secteur il y a quelques jours.

Il adopte une architecture technologique homologue à celle de Gemini 3, prend en charge le multimodal natif, a obtenu la troisième place mondiale au classement Arena AI, et propose plusieurs modèles. Les plus petits modèles — E2B (2,3 milliards de paramètres effectifs) et E4B (4,5 milliards de paramètres effectifs) — peuvent être déployés et exécutés localement sur un téléphone portable, avec une fenêtre contextuelle atteignant 128K. On peut dire que c'est un « substitutif à Gemini qui tient dans la poche ».

Sans surprise, le modèle est rapidement devenu un nouveau jouet pour les utilisateurs de mobiles.

Un post d'un utilisateur de X a notamment été vu des centaines de milliers de fois. Il y a partagé une vidéo montrant comment il exécutait Gemma 4 localement sur son iPhone, y compris le traitement d'images, d'audio et le contrôle de l'interrupteur de la lampe torche. Il a déclaré que Gemma 4 était incroyablement rapide, comme par magie.

Quelqu'un a quantifié cette vitesse sur un iPhone 17 Pro, indiquant que si le téléphone utilise une puce Apple, alors avec l'aide de MLX (le framework d'apprentissage automatique d'Apple) optimisé pour cette puce, la vitesse d'inférence du modèle peut dépasser 40 tokens par seconde.

D'autres ont également obtenu des vitesses similaires sur un Samsung Galaxy, et ce même avec le mode de réflexion activé. Ce qui pousse à s'exclamer que c'est « trop rapide pour être vrai ».

Une telle vitesse fait de l'exécution de modèles d'IA sur appareil mobile une option viable pour l'avenir, et elle est très utile dans des scénarios sensibles comme la santé.

La fenêtre contextuelle de 128k rend également ces petits modèles plus attractifs.

Alors, comment l'exécuter ? C'est en fait très simple, ce n'est pas réservé aux geeks, car Google a publié une application officielle — Google AI Edge Gallery. Les personnes souhaitant l'expérimenter sur leur téléphone peuvent simplement télécharger cette application, puis télécharger la version du modèle qu'ils souhaitent exécuter, l'ouvrir et c'est parti.

De plus, comme c'est une publication officielle de Google, les problèmes de sécurité ne sont pas vraiment à craindre.

Outre ces petits modèles exécutés sur mobile, certains ont testé des versions plus grandes de Gemma 4 sur du matériel plus puissant, comme l'exécution de Gemma 4 Mixture-of-Experts 26B sur un MacBook Pro version M5 Pro.

Pour une conversation directe, ce modèle est encore rapide, la génération de texte et l'explication de code sont fluides.

Mais lorsqu'il a vraiment utilisé Gemma 4 comme agent de codage, les problèmes sont apparus. Car exécuter un agent nécessite un grand contexte (Gemma 4 26B a une fenêtre contextuelle de 256k), des prompts complexes et des appels d'outils stables. Gemma 4 a clairement du mal à tenir le coup sur ces aspects, plantant souvent, générant des erreurs, ou produisant une structure de sortie incorrecte.

Le point de basculement est survenu lorsqu'il a remplacé le modèle par qwen3-coder. Dans le même environnement, la création de fichiers, l'exécution de commandes et les tâches à plusieurs étapes fonctionnaient normalement. Il estime que le problème ne vient pas du framework d'agent, mais du modèle lui-même et de son éventuelle optimisation pour les « appels d'outils + sortie structurée ». Sur ce point, Gemma 4 n'est peut-être pas encore assez abouti, ou peut-être que ce développeur n'a tout simplement pas encore trouvé la bonne méthode.

De plus, certains disent que le niveau intellectuel de Gemma 4 est encore un peu limité.

Malgré cela, l'émergence de Gemma 4, cette « petite bombe de performances », ne doit pas être sous-estimée. Si à l'avenir, une grande partie des requêtes quotidiennes, des discussions, des raisonnements simples, de la génération de code et des tâches de compréhension d'images peuvent être exécutées localement, sans avoir à acheter de tokens, les vendeurs de tokens ne se retrouveraient-ils pas dans une position délicate ?

Bien sûr, la situation actuelle n'est pas encore si pessimiste, car il existe encore un écart entre les modèles open source disponibles et les modèles propriétaires de pointe, et la plupart des modèles open source performants sont encore limités par les capacités matérielles, ne pouvant temporairement pas atteindre un niveau utilisable sur les appareils.

Mais la tendance future est claire. À court terme, les modèles propriétaires cloud conservent leur avance sur le raisonnement complexe de pointe et la collaboration multi-agents à très grande échelle ; mais à long terme, avec la progression du matériel et l'optimisation continue des techniques de quantification, les modèles on-device grignoteront progressivement les tâches simples et fréquentes du cloud.

Les acteurs qui ne vivent que de la vente de tokens et d'abonnements API devront se concentrer plus intensément sur les parties « vraiment difficiles » — les agents ultra-puissants, les contextes longs et fiables, et les capacités spécialisées nécessitant des données massives en temps réel.

Gemma 4 n'est qu'un début. La prochaine surprise pourrait bien être qu'un modèle on-device rende l'utilisateur totalement incapable de sentir la différence entre « local » et « cloud » lors d'une utilisation quotidienne. Le jour où cela arrivera, l'ensemble du modèle économique de l'industrie de l'IA connaîtra un véritable bouleversement.

Cet article provient du compte WeChat officiel « Machine Heart » (ID: almosthuman2014), auteur : Machine Heart

Cryptos en tendance

Questions liées

QQu'est-ce que Gemma 4 et pourquoi est-il considéré comme une surprise dans l'industrie ?

AGemma 4 est un nouveau modèle open-source de Google, basé sur la même architecture technique que Gemini 3. Il prend en charge le multimodal natif, se classe troisième au classement Arena AI et propose plusieurs modèles, dont des versions plus petites conçues pour fonctionner localement sur les téléphones. Il est considéré comme une surprise en raison de ses performances élevées et de son accessibilité sur les appareils mobiles.

QQuelle est la vitesse de traitement de Gemma 4 sur un iPhone 17 Pro avec la puce Apple ?

ASur un iPhone 17 Pro équipé d'une puce Apple et optimisé avec MLX (le framework d'apprentissage automatique d'Apple), la vitesse d'inférence de Gemma 4 peut dépasser 40 tokens par seconde.

QComment peut-on exécuter Gemma 4 localement sur un téléphone mobile ?

APour exécuter Gemma 4 localement sur un téléphone, les utilisateurs peuvent télécharger l'application officielle Google AI Edge Gallery, puis télécharger la version du modèle qu'ils souhaitent exécuter. Une fois installé, le modèle peut être exécuté directement depuis l'application.

QQuelles sont les limitations de Gemma 4 lorsqu'il est utilisé comme agent de codage ?

ALorsqu'il est utilisé comme agent de codage, Gemma 4 rencontre des problèmes avec les grands contextes (fenêtre contextuelle de 256k pour la version 26B), les invites complexes et les appels d'outils stables. Il a tendance à planter, à générer des erreurs ou à produire des structures de sortie incorrectes, contrairement à d'autres modèles comme qwen3-coder qui fonctionnent mieux dans ces scénarios.

QQuel impact Gemma 4 pourrait-il avoir sur l'avenir des modèles d'IA et les entreprises qui vendent des tokens ?

AGemma 4 pourrait permettre à de nombreuses tâches quotidiennes (requêtes, discussions, raisonnements simples, génération de code, compréhension d'images) d'être exécutées localement sans avoir à acheter des tokens. Cela pourrait menacer les entreprises qui dépendent de la vente de tokens ou d'abonnements API, les obligeant à se concentrer sur des capacités plus avancées comme les agents ultra-performants, les contextes longs et fiables, et les compétences spécialisées nécessitant des données massives en temps réel.

Lectures associées

Dialogue avec Ray Dalio : Nous sommes actuellement dans une bulle de l'IA, 1% de mon portefeuille est en Bitcoin

Ray Dalio, fondateur de Bridgewater Associates, met en garde contre la bulle actuelle de l'IA, présentant des signes classiques similaires aux précédents krachs financiers. Il explique qu'une combinaison de spéculation excessive, d'endettement et de changements de taux d'intérêt pourrait provoquer son éclatement, entraînant une récession économique. Dalio décrit également un « grand cycle » mondial d'environ 80 ans, caractérisé par des inégalités croissantes, des déficits publics élevés et des tensions géopolitiques. Nous serions actuellement dans une phase de déclin de ce cycle, avec un ordre mondial en transition. Pour protéger leur patrimoine, il conseille aux investisseurs de diversifier leurs actifs (actions, obligations, or, immobilier) plutôt que de détenir uniquement des liquidités. Il mentionne détenir environ 1% de Bitcoin, mais préfère l'or physique pour sa stabilité. Concernant l'IA, Dalio souligne qu'elle remplacera progressivement le travail intellectuel humain, creusant les inégalités. L'avenir appartiendra à ceux qui sauront allier intelligence humaine et collaboration avec l'IA. Enfin, il évoque un monde de plus en plus régionalisé, avec un affaiblissement de la puissance américaine, visible dans des conflits comme celui avec l'Iran, et la montée en puissance d'autres pôles, notamment la Chine.

marsbitIl y a 1 h

Dialogue avec Ray Dalio : Nous sommes actuellement dans une bulle de l'IA, 1% de mon portefeuille est en Bitcoin

marsbitIl y a 1 h

7,2 billions de KRW en une journée, les achats nets des investisseurs étrangers atteignent un record historique ce vendredi ! Wall Street : Les vents contraires sur les flux de capitaux sud-coréens se sont dissipés

Les marchés boursiers sud-coréens montrent des signes tangibles d'amélioration des flux de capitaux. Le 31 juillet, les investisseurs étrangers ont réalisé un achat net record de 7 200 milliards de wons sur une seule journée dans le KOSPI, marquant un renversement de la tendance de sorties massives observée ces derniers mois. En juillet, leurs ventes nettes mensuelles se sont fortement réduites à 9 800 milliards de wons, contre 48 400 et 44 500 milliards en juin et mai respectivement. Parallèlement, les institutions domestiques comme les fonds de pension ont inversé leur tendance, passant à un achat net de 1 000 milliards de wons en juillet. La Commission des services financiers a également resserré l'accès aux ETF à effet de levier sur actions individuelles pour les investisseurs de détail, réduisant ainsi la volatilité du marché. Citigroup Research maintient son objectif pour le KOSPI à 10 000 points, estimant que les vents contraires liés aux flux de capitaux s'atténuent. Des facteurs tels que les fondamentaux solides du secteur des puces mémoire, les faibles valorisations du marché, une économie robuste et un environnement politique favorable devraient soutenir le marché. La possibilité d'interventions des autorités pour stabiliser le marché offre également un filet de sécurité.

marsbitIl y a 1 h

7,2 billions de KRW en une journée, les achats nets des investisseurs étrangers atteignent un record historique ce vendredi ! Wall Street : Les vents contraires sur les flux de capitaux sud-coréens se sont dissipés

marsbitIl y a 1 h

Choc ! La prochaine IA d'OpenAI résout 10 problèmes du calibre de la Médaille Fields

**OpenAI provoque un séisme mathématique avec son nouveau modèle Astra** OpenAI a dévoilé des avancées mathématiques majeures réalisées par son modèle interne Astra, présenté par Sam Altman. L'IA aurait résolu ou fait progresser dix problèmes complexes dans des domaines variés comme la géométrie haute dimension, la théorie des groupes et la complexité quantique. Le résultat le plus marquant est la construction du premier groupe "non sofic" infini et finiment présenté, réfutant une conjecture de Mikhail Gromov vieille de 27 ans. Cette seule découverte est qualifiée de niveau "Prix Fields". Astra a également amélioré une borne fondamentale sur le problème de l'empilement des sphères en haute dimension, stagnant depuis 1978, et a réfuté la conjecture de rigidité d'Alain Connes en construisant une infinité de groupes non isomorphes partageant la même algèbre de von Neumann. Ces résultats, compilés dans un document de 249 pages, sont accompagnés de preuves formelles vérifiées par l'assistant Lean 4. OpenAI précise que le coût total de génération de ces démonstrations aurait été inférieur à 2000 dollars. La communauté mathématique réagit avec stupeur, certains experts y voyant un tournant historique où l'IA démontre une intuition et une capacité de raisonnement pouvant surpasser les meilleurs mathématiciens humains.

marsbitIl y a 2 h

Choc ! La prochaine IA d'OpenAI résout 10 problèmes du calibre de la Médaille Fields

marsbitIl y a 2 h

Grâce aux lancers de dés, les clés Bitcoin sont stockées hors ligne, mais tout le monde ne s'y mettra pas

Le titre « Les clés Bitcoin protégées par des dés, mais la méthode reste marginale » introduit un article sur la génération manuelle de graines de portefeuille Bitcoin à l'aide de dés. L'article explique le concept d'entropie, illustré par Claude Shannon, où un dé à six faces génère environ 2,585 bits d'incertitude. Il aborde le scandale récent de Coldcard, où une vulnérabilité du générateur de nombres aléatoires matériel a compromis des fonds. Les utilisateurs ayant généré leur phrase de récupération avec des dés (environ 99 lancers pour une haute sécurité) n'étaient pas affectés pour leur seed principal. Cependant, l'analyse du chercheur Kevin Loaec montre que d'autres fonctions du portefeuille (clés de copie, portefeuilles papier, mots de passe, etc.) utilisaient ce générateur défectueux et restaient vulnérables. L'article souligne les défis pratiques de la méthode des dés : elle est longue, sujette aux erreurs de saisie, et peu adaptée aux nouveaux utilisateurs qui pourraient mal l'exécuter. Il conclut que si cette méthode manuelle est robuste pour les experts, l'objectif à long terme est d'avoir un matériel et des logiciels générant une entropie fiable de manière simple et sécurisée. Il conseille aux propriétaires de Coldcard de vérifier leur firmware et les fonctions utilisées, et rappelle l'intérêt des solutions multi-signatures avec différents fabricants pour limiter les risques.

cryptonews.ruIl y a 6 h

Grâce aux lancers de dés, les clés Bitcoin sont stockées hors ligne, mais tout le monde ne s'y mettra pas

cryptonews.ruIl y a 6 h

Trading

Spot

Articles tendance

Comment acheter 4

Bienvenue sur HTX.com ! Nous vous permettons d'acheter 4 (4) de manière simple et pratique. Suivez notre guide étape par étape pour commencer votre parcours crypto.Étape 1 : Création de votre compte HTXUtilisez votre adresse e-mail ou votre numéro de téléphone pour ouvrir un compte sur HTX gratuitement. L'inscription se fait en toute simplicité et débloque toutes les fonctionnalités.Créer mon compteÉtape 2 : Choix du mode de paiement (rubrique Acheter des cryptosCarte de crédit/débit : utilisez votre carte Visa ou Mastercard pour acheter instantanément 4 (4).Solde :utilisez les fonds du solde de votre compte HTX pour trader en toute simplicité.Prestataire tiers :pour accroître la commodité d'utilisation, nous avons ajouté des modes de paiement populaires tels que Google Pay et Apple Pay.P2P :tradez directement avec d'autres utilisateurs sur HTX.OTC (de gré à gré) : nous offrons des services personnalisés et des taux de change compétitifs aux traders.Étape 3 : stockage de vos 4 (4)Après avoir acheté vos 4 (4), stockez-les sur votre compte HTX. Vous pouvez également les envoyer ailleurs via un transfert sur la blockchain ou les utiliser pour trader d'autres cryptos.Étape 4 : tradez des 4 (4)Tradez facilement 4 (4) sur le marché Spot de HTX. Il vous suffit d'accéder à votre compte, de sélectionner la paire de trading, d'exécuter vos trades et de les suivre en temps réel. Nous offrons une expérience conviviale aux débutants comme aux traders chevronnés.

724 vues totalesPublié le 2025.10.20Mis à jour le 2026.06.02

Comment acheter 4

Discussions

Bienvenue dans la Communauté HTX. Ici, vous pouvez vous tenir informé(e) des derniers développements de la plateforme et accéder à des analyses de marché professionnelles. Les opinions des utilisateurs sur le prix de 4 (4) sont présentées ci-dessous.

活动图片