L'exécution locale de Gemma 4 sur iPhone fait sensation : à quelle distance se trouve l'ère du zéro token ?

marsbitPublié le 2026-04-06Dernière mise à jour le 2026-04-06

Résumé

Le nouveau modèle Gemma 4 de Google, récemment open-source, permet une exécution locale sur smartphone avec des performances remarquables. Les versions allégées (E2B et E4B) offrent une fenêtre contextuelle de 128K et atteignent une vitesse de traitement dépassant 40 tokens par seconde sur iPhone 17 Pro et appareils Android compatibles, grâce à des optimisations logicielles comme MLX d'Apple. Bien que simple à utiliser via l'application officielle Google AI Edge Gallery, Gemma 4 montre des limites dans des tâches complexes comme l'appel d'outils structurés ou le codage agent, où des modèles comme Qwen3-coder restent supérieurs. Malgré une intelligence parfois jugée "limite", sa capacité à traiter localement requêtes, discussions et génération de code ouvre la voie à une réduction de la dépendance aux APIs cloud. Cette avancée annonce un changement de paradigme : les modèles locaux pourraient à terme remplacer les solutions cloud pour les tâches courantes, poussant les fournisseurs de tokens à se concentrer sur des capacités plus avancées comme les agents complexes ou le traitement de données massives. Gemma 4 n'est qu'un début ; la frontière entre local et cloud s'estompera bientôt.

Rédaction de Machine Heart

Le nouveau modèle open source de Google, Gemma 4, a offert une belle surprise au secteur il y a quelques jours.

Il adopte une architecture technologique homologue à celle de Gemini 3, prend en charge le multimodal natif, a obtenu la troisième place mondiale au classement Arena AI, et propose plusieurs modèles. Les plus petits modèles — E2B (2,3 milliards de paramètres effectifs) et E4B (4,5 milliards de paramètres effectifs) — peuvent être déployés et exécutés localement sur un téléphone portable, avec une fenêtre contextuelle atteignant 128K. On peut dire que c'est un « substitutif à Gemini qui tient dans la poche ».

Sans surprise, le modèle est rapidement devenu un nouveau jouet pour les utilisateurs de mobiles.

Un post d'un utilisateur de X a notamment été vu des centaines de milliers de fois. Il y a partagé une vidéo montrant comment il exécutait Gemma 4 localement sur son iPhone, y compris le traitement d'images, d'audio et le contrôle de l'interrupteur de la lampe torche. Il a déclaré que Gemma 4 était incroyablement rapide, comme par magie.

Quelqu'un a quantifié cette vitesse sur un iPhone 17 Pro, indiquant que si le téléphone utilise une puce Apple, alors avec l'aide de MLX (le framework d'apprentissage automatique d'Apple) optimisé pour cette puce, la vitesse d'inférence du modèle peut dépasser 40 tokens par seconde.

D'autres ont également obtenu des vitesses similaires sur un Samsung Galaxy, et ce même avec le mode de réflexion activé. Ce qui pousse à s'exclamer que c'est « trop rapide pour être vrai ».

Une telle vitesse fait de l'exécution de modèles d'IA sur appareil mobile une option viable pour l'avenir, et elle est très utile dans des scénarios sensibles comme la santé.

La fenêtre contextuelle de 128k rend également ces petits modèles plus attractifs.

Alors, comment l'exécuter ? C'est en fait très simple, ce n'est pas réservé aux geeks, car Google a publié une application officielle — Google AI Edge Gallery. Les personnes souhaitant l'expérimenter sur leur téléphone peuvent simplement télécharger cette application, puis télécharger la version du modèle qu'ils souhaitent exécuter, l'ouvrir et c'est parti.

De plus, comme c'est une publication officielle de Google, les problèmes de sécurité ne sont pas vraiment à craindre.

Outre ces petits modèles exécutés sur mobile, certains ont testé des versions plus grandes de Gemma 4 sur du matériel plus puissant, comme l'exécution de Gemma 4 Mixture-of-Experts 26B sur un MacBook Pro version M5 Pro.

Pour une conversation directe, ce modèle est encore rapide, la génération de texte et l'explication de code sont fluides.

Mais lorsqu'il a vraiment utilisé Gemma 4 comme agent de codage, les problèmes sont apparus. Car exécuter un agent nécessite un grand contexte (Gemma 4 26B a une fenêtre contextuelle de 256k), des prompts complexes et des appels d'outils stables. Gemma 4 a clairement du mal à tenir le coup sur ces aspects, plantant souvent, générant des erreurs, ou produisant une structure de sortie incorrecte.

Le point de basculement est survenu lorsqu'il a remplacé le modèle par qwen3-coder. Dans le même environnement, la création de fichiers, l'exécution de commandes et les tâches à plusieurs étapes fonctionnaient normalement. Il estime que le problème ne vient pas du framework d'agent, mais du modèle lui-même et de son éventuelle optimisation pour les « appels d'outils + sortie structurée ». Sur ce point, Gemma 4 n'est peut-être pas encore assez abouti, ou peut-être que ce développeur n'a tout simplement pas encore trouvé la bonne méthode.

De plus, certains disent que le niveau intellectuel de Gemma 4 est encore un peu limité.

Malgré cela, l'émergence de Gemma 4, cette « petite bombe de performances », ne doit pas être sous-estimée. Si à l'avenir, une grande partie des requêtes quotidiennes, des discussions, des raisonnements simples, de la génération de code et des tâches de compréhension d'images peuvent être exécutées localement, sans avoir à acheter de tokens, les vendeurs de tokens ne se retrouveraient-ils pas dans une position délicate ?

Bien sûr, la situation actuelle n'est pas encore si pessimiste, car il existe encore un écart entre les modèles open source disponibles et les modèles propriétaires de pointe, et la plupart des modèles open source performants sont encore limités par les capacités matérielles, ne pouvant temporairement pas atteindre un niveau utilisable sur les appareils.

Mais la tendance future est claire. À court terme, les modèles propriétaires cloud conservent leur avance sur le raisonnement complexe de pointe et la collaboration multi-agents à très grande échelle ; mais à long terme, avec la progression du matériel et l'optimisation continue des techniques de quantification, les modèles on-device grignoteront progressivement les tâches simples et fréquentes du cloud.

Les acteurs qui ne vivent que de la vente de tokens et d'abonnements API devront se concentrer plus intensément sur les parties « vraiment difficiles » — les agents ultra-puissants, les contextes longs et fiables, et les capacités spécialisées nécessitant des données massives en temps réel.

Gemma 4 n'est qu'un début. La prochaine surprise pourrait bien être qu'un modèle on-device rende l'utilisateur totalement incapable de sentir la différence entre « local » et « cloud » lors d'une utilisation quotidienne. Le jour où cela arrivera, l'ensemble du modèle économique de l'industrie de l'IA connaîtra un véritable bouleversement.

Cet article provient du compte WeChat officiel « Machine Heart » (ID: almosthuman2014), auteur : Machine Heart

Cryptos en tendance

Questions liées

QQu'est-ce que Gemma 4 et pourquoi est-il considéré comme une surprise dans l'industrie ?

AGemma 4 est un nouveau modèle open-source de Google, basé sur la même architecture technique que Gemini 3. Il prend en charge le multimodal natif, se classe troisième au classement Arena AI et propose plusieurs modèles, dont des versions plus petites conçues pour fonctionner localement sur les téléphones. Il est considéré comme une surprise en raison de ses performances élevées et de son accessibilité sur les appareils mobiles.

QQuelle est la vitesse de traitement de Gemma 4 sur un iPhone 17 Pro avec la puce Apple ?

ASur un iPhone 17 Pro équipé d'une puce Apple et optimisé avec MLX (le framework d'apprentissage automatique d'Apple), la vitesse d'inférence de Gemma 4 peut dépasser 40 tokens par seconde.

QComment peut-on exécuter Gemma 4 localement sur un téléphone mobile ?

APour exécuter Gemma 4 localement sur un téléphone, les utilisateurs peuvent télécharger l'application officielle Google AI Edge Gallery, puis télécharger la version du modèle qu'ils souhaitent exécuter. Une fois installé, le modèle peut être exécuté directement depuis l'application.

QQuelles sont les limitations de Gemma 4 lorsqu'il est utilisé comme agent de codage ?

ALorsqu'il est utilisé comme agent de codage, Gemma 4 rencontre des problèmes avec les grands contextes (fenêtre contextuelle de 256k pour la version 26B), les invites complexes et les appels d'outils stables. Il a tendance à planter, à générer des erreurs ou à produire des structures de sortie incorrectes, contrairement à d'autres modèles comme qwen3-coder qui fonctionnent mieux dans ces scénarios.

QQuel impact Gemma 4 pourrait-il avoir sur l'avenir des modèles d'IA et les entreprises qui vendent des tokens ?

AGemma 4 pourrait permettre à de nombreuses tâches quotidiennes (requêtes, discussions, raisonnements simples, génération de code, compréhension d'images) d'être exécutées localement sans avoir à acheter des tokens. Cela pourrait menacer les entreprises qui dépendent de la vente de tokens ou d'abonnements API, les obligeant à se concentrer sur des capacités plus avancées comme les agents ultra-performants, les contextes longs et fiables, et les compétences spécialisées nécessitant des données massives en temps réel.

Lectures associées

Des TPU aux agents auto-évolutifs : comment Jeff Dean envisage la prochaine étape de l'IA

Lors d’une intervention à la YC Startup School 2026, Jeff Dean a partagé sa vision de l’évolution de l’IA au-delà des simples modèles de grande taille. Il souligne que la prochaine étape ne consiste pas seulement à créer des modèles plus puissants, mais à les intégrer dans des systèmes capables de fonctionner de manière autonome, d’apprendre par essais et erreurs, et d’exécuter des tâches complexes sur de longues périodes. Dean insiste sur l’importance de l’ingénierie du contexte, des outils spécialisés et des boucles de rétroaction pour permettre aux agents IA d’agir efficacement, comme des ingénieurs juniors. Il met en lumière les défis techniques sous-jacents, tels que la latence, la consommation énergétique et le coût du déplacement des données, qui conditionnent la faisabilité des applications pratiques. Pour les startups, il conseille de se concentrer sur des problèmes où les modèles génériques actuels échouent (taux de succès proche de 0–1%), en exploitant des données propriétaires, des évaluateurs spécialisés ou des flux de travail métier. Il anticipe également une automatisation croissante de la recherche scientifique et du développement de l’IA elle-même, accélérant le cycle hypothèse-expérience-évaluation. Enfin, Dean rappelle que la clé reste de bien définir les problèmes, de remettre en cause les hypothèses établies et de privilégier les solutions qui auront un impact réel, tout en travaillant avec des équipes complémentaires et collaboratives.

marsbitIl y a 54 mins

Des TPU aux agents auto-évolutifs : comment Jeff Dean envisage la prochaine étape de l'IA

marsbitIl y a 54 mins

De la Corée aux États-Unis : grâce à l'IA, les cols bleus sont de plus en plus recherchés

Grâce à l'IA, les métiers manuels spécialisés connaissent une valorisation historique sur le marché du travail mondial, remettant en cause l'attrait traditionnel des diplômes universitaires. Aux États-Unis, les inscriptions dans les écoles professionnelles ont bondi de 11,4% en 2025, tandis que les licenciements liés à l'IA ont atteint un niveau record. Cette double pression - remplacement de certains emplois de bureau par l'IA et demande explosive de main-d'œuvre pour les infrastructures et data centers - pousse la nouvelle génération vers des carrières comme électricien, soudeur ou plombier. En Corée du Sud, les diplômés de lycées techniques spécialisés dans les semi-conducteurs sont recrutés à plus de 96%, avec des rémunérations très attractives chez des géants comme Samsung. Le phénomène est accentué par une vague de départs à la retraite et un déficit structurel de travailleurs qualifiés, créant une véritable pénurie. Des entreprises et banques comme JPMorgan, Meta ou Lowe's investissent massivement dans la formation. Si les salaires médians de ces métiers rivalisent désormais avec ceux de nombreux diplômés universitaires, des préjugés persistants sur la valeur des formations professionnelles constituent le principal défi pour combler l'écart entre la demande du marché et les perceptions sociales.

marsbitIl y a 55 mins

De la Corée aux États-Unis : grâce à l'IA, les cols bleus sont de plus en plus recherchés

marsbitIl y a 55 mins

Qualcomm : la fièvre de l'IA retombe, quand le marché du téléphone mobile sortira-t-il de la morosité ?

Qualcomm a publié ses résultats financiers du troisième trimestre de l'année fiscale 2026 (se terminant en juin 2026). Les revenus ont atteint 9,95 milliards de dollars, en baisse de 4% sur un an, dépassant les attentes du marché. Cependant, la rentabilité a été mise sous pression : la marge brute a chuté à 53,1% en raison de l'augmentation des coûts de production des semi-conducteurs et de la hausse des prix de la mémoire. Le segment smartphone, cœur de métier de Qualcomm, a subi un net recul de 19,6% à 5,09 milliards de dollars. Ce déclin s'explique par la faiblesse du marché des smartphones Android (hors Apple) et par une tendance des fabricants à privilégier d'anciennes plateformes pour réduire les coûts. À l'inverse, le secteur automobile a connu une croissance forte de 61%, porté par les systèmes de cockpit numérique. Face à la morosité de son marché traditionnel, Qualcomm mise sur l'IA pour son avenir. Sa stratégie couvre à la fois l'IA de périphérie (smartphones, PC, véhicules) et les centres de données. Dans ce dernier domaine, la société a dévoilé un plan ambitieux incluant des accélérateurs d'IA, des CPU, des puces sur mesure et des produits de connectivité, visant un marché potentiel de 1000 milliards de dollars. Des partenariats ont déjà été conclus avec Microsoft et Meta. Cependant, ces perspectives de croissance ne se sont pas encore concrétisées dans les chiffres. Les prévisions pour le prochain trimestre restent prudentes, reflétant la faiblesse persistante de la demande pour les terminaux et la pression sur les coûts. Après un pic lié à l'enthousiasme pour l'IA, l'action de Qualcomm est retombée, les investisseurs attendant désormais des preuves tangibles de la réussite de son virage stratégique, tout en surveillant la possible stabilisation de son activité historique.

marsbitIl y a 58 mins

Qualcomm : la fièvre de l'IA retombe, quand le marché du téléphone mobile sortira-t-il de la morosité ?

marsbitIl y a 58 mins

Trading

Spot

Articles tendance

Comment acheter 4

Bienvenue sur HTX.com ! Nous vous permettons d'acheter 4 (4) de manière simple et pratique. Suivez notre guide étape par étape pour commencer votre parcours crypto.Étape 1 : Création de votre compte HTXUtilisez votre adresse e-mail ou votre numéro de téléphone pour ouvrir un compte sur HTX gratuitement. L'inscription se fait en toute simplicité et débloque toutes les fonctionnalités.Créer mon compteÉtape 2 : Choix du mode de paiement (rubrique Acheter des cryptosCarte de crédit/débit : utilisez votre carte Visa ou Mastercard pour acheter instantanément 4 (4).Solde :utilisez les fonds du solde de votre compte HTX pour trader en toute simplicité.Prestataire tiers :pour accroître la commodité d'utilisation, nous avons ajouté des modes de paiement populaires tels que Google Pay et Apple Pay.P2P :tradez directement avec d'autres utilisateurs sur HTX.OTC (de gré à gré) : nous offrons des services personnalisés et des taux de change compétitifs aux traders.Étape 3 : stockage de vos 4 (4)Après avoir acheté vos 4 (4), stockez-les sur votre compte HTX. Vous pouvez également les envoyer ailleurs via un transfert sur la blockchain ou les utiliser pour trader d'autres cryptos.Étape 4 : tradez des 4 (4)Tradez facilement 4 (4) sur le marché Spot de HTX. Il vous suffit d'accéder à votre compte, de sélectionner la paire de trading, d'exécuter vos trades et de les suivre en temps réel. Nous offrons une expérience conviviale aux débutants comme aux traders chevronnés.

736 vues totalesPublié le 2025.10.20Mis à jour le 2026.06.02

Comment acheter 4

Discussions

Bienvenue dans la Communauté HTX. Ici, vous pouvez vous tenir informé(e) des derniers développements de la plateforme et accéder à des analyses de marché professionnelles. Les opinions des utilisateurs sur le prix de 4 (4) sont présentées ci-dessous.

活动图片