L'exécution locale de Gemma 4 sur iPhone fait sensation : à quelle distance se trouve l'ère du zéro token ?
Le nouveau modèle Gemma 4 de Google, récemment open-source, permet une exécution locale sur smartphone avec des performances remarquables. Les versions allégées (E2B et E4B) offrent une fenêtre contextuelle de 128K et atteignent une vitesse de traitement dépassant 40 tokens par seconde sur iPhone 17 Pro et appareils Android compatibles, grâce à des optimisations logicielles comme MLX d'Apple.
Bien que simple à utiliser via l'application officielle Google AI Edge Gallery, Gemma 4 montre des limites dans des tâches complexes comme l'appel d'outils structurés ou le codage agent, où des modèles comme Qwen3-coder restent supérieurs. Malgré une intelligence parfois jugée "limite", sa capacité à traiter localement requêtes, discussions et génération de code ouvre la voie à une réduction de la dépendance aux APIs cloud.
Cette avancée annonce un changement de paradigme : les modèles locaux pourraient à terme remplacer les solutions cloud pour les tâches courantes, poussant les fournisseurs de tokens à se concentrer sur des capacités plus avancées comme les agents complexes ou le traitement de données massives. Gemma 4 n'est qu'un début ; la frontière entre local et cloud s'estompera bientôt.
marsbit04/06 05:57