Ejecutar Gemma 4 localmente en iPhone se vuelve viral, ¿qué tan lejos está la era de 0 tokens?

marsbitPublicado a 2026-04-06Actualizado a 2026-04-06

Resumen

El nuevo modelo Gemma 4 de Google, con arquitectura similar a Gemini 3, ha sorprendido al poder ejecutarse localmente en dispositivos móviles como iPhone y Samsung Galaxy, alcanzando velocidades de hasta 40 tokens por segundo. Con versiones compactas (E2B y E4B) y una ventana de contexto de 128K, permite procesar texto, imágenes y audio de forma rápida y segura a través de la app oficial Google AI Edge Gallery. Aunque en tareas complejas como agentes de codificación muestra limitaciones, su rendimiento en consultas cotidianas, generación de código y comprensión multimodal es notable. Esto acerca la posibilidad de que tareas simples se realicen offline, reduciendo la dependencia de APIs pagadas. Si bien los modelos nube aún lideran en razonamiento avanzado, el avance de hardware y optimización sugiere que los modelos locales eventualmente competirán en eficiencia, impulsando un cambio en los modelos de negocio de la IA. Gemma 4 es solo el inicio de esta transición.

Redacción de Machine Heart

El nuevo modelo de código abierto de Google, Gemma 4, presentado hace unos días, dio una gran sorpresa a la industria.

Utiliza una arquitectura técnica de la misma fuente que Gemini 3, es compatible con modalidades completas nativas, obtuvo el tercer lugar global en el ranking Arena AI, y hay varios modelos para elegir. Varios modelos más pequeños — E2B (2.3B de parámetros efectivos) y E4B (4.5B de parámetros efectivos) — se pueden implementar y ejecutar localmente en dispositivos móviles, con una ventana de contexto de 128K, lo que podríamos llamar un "reemplazo de Gemini que cabe en el bolsillo".

Como era de esperar, el modelo se convirtió rápidamente en el nuevo juguete de los usuarios de teléfonos.

Entre ellos, una publicación de un usuario de X fue vista cientos de miles de veces. En la publicación, compartió un video mostrando cómo ejecuta Gemma 4 localmente en su iPhone, incluyendo el procesamiento de imágenes, audio y el control del encendido y apagado de la linterna. Mencionó que Gemma 4 es increíblemente rápido, se siente como magia.

Alguien cuantificó esta velocidad en un iPhone 17 Pro, señalando que si el teléfono utiliza un chip Apple, entonces con la ayuda de MLX (el framework de aprendizaje automático de Apple) optimizado para este chip, la velocidad de inferencia del modelo puede superar los 40 tokens por segundo.

También se lograron velocidades similares en un Samsung Galaxy, incluso con el modo de pensamiento activado. Esto hizo que la gente exclamara "demasiado rápido para ser real".

Estas velocidades convierten la ejecución de modelos de IA en dispositivos móviles en una opción viable para el futuro, y son muy útiles en escenarios sensibles como la atención médica.

La ventana de contexto de 128k también hace que estos modelos pequeños sean más atractivos.

¿Y cómo se ejecuta? En realidad, es muy simple, no es exclusivo para geeks, porque Google lanzó una aplicación oficial: Google AI Edge Gallery. Quienes quieran experimentar en sus teléfonos pueden descargar esta aplicación directamente, luego descargar la versión del modelo que deseen ejecutar, y abrirla para comenzar.

Además, al ser un lanzamiento oficial de Google, naturalmente no hay que preocuparse demasiado por la seguridad.

Además de estos modelos pequeños que se ejecutan en dispositivos móviles, algunos han probado versiones más grandes de Gemma 4 en hardware más potente, como ejecutar Gemma 4 Mixture-of-Experts 26B en una MacBook Pro con chip M5 Pro.

Si es para diálogo directo, la velocidad de este modelo sigue siendo rápida, la generación de texto y la explicación de código son fluidas.

Pero cuando realmente usó Gemma 4 como un agente de codificación, surgieron problemas. Porque ejecutar un agente requiere un contexto grande (Gemma 4 26B tiene una ventana de contexto de 256k), prompts complejos y una invocación de herramientas estable. Gemma 4 claramente no pudo soportar esto, a menudo se trababa, generaba errores o producía una estructura de salida incorrecta.

El punto de inflexión ocurrió cuando cambió el modelo a qwen3-coder. En el mismo entorno, la creación de archivos, la ejecución de comandos y las tareas de múltiples pasos funcionaban normalmente. Considera que el problema no está en el framework del agente, sino en si el modelo en sí ha sido optimizado para "invocación de herramientas + salida estructurada". En este aspecto, Gemma 4 podría no haberlo hecho lo suficiente, o quizás este desarrollador aún no ha encontrado la forma correcta de usarlo.

Además, algunos dicen que el nivel intelectual de Gemma 4 todavía es un poco limitado.

Aun así, la aparición de este "pequeño cañón de rendimiento" que es Gemma 4 no debe subestimarse. Si en el futuro una gran cantidad de consultas diarias, chats, razonamientos simples, generación de código y tareas de comprensión de imágenes se pueden ejecutar localmente, sin necesidad de comprar tokens, ¿no estarán en una situación incómoda los fabricantes que venden tokens?

Por supuesto, la situación actual no es tan pesimista, después de todo, todavía existe una brecha entre los modelos de código abierto disponibles y los modelos cerrados de vanguardia, y la mayoría de los modelos de código abierto potentes todavía están limitados por la capacidad del hardware, y temporalmente no pueden alcanzar un nivel utilizable en el edge.

Pero la tendencia futura es clara. A corto plazo, los modelos cerrados en la nube aún lideran en el razonamiento complejo más avanzado y la colaboración a超大规模超大规模 (gran escala) multiagente; pero a largo plazo, a medida que el hardware continúa avanzando y las técnicas de cuantización continúan optimizándose, los modelos en el edge erosionarán gradualmente las tareas simples y de alta frecuencia de la nube.

Aquellos fabricantes que solo dependen de vender tokens, vender suscripciones API, se verán obligados a competir más ferozmente en las partes "realmente difíciles" — Agentes súper potentes, contextos largos y confiables, y capacidades especializadas que requieren cantidades masivas de datos en tiempo real.

Gemma 4 es solo el comienzo. La siguiente sorpresa podría ser que algún modelo en el edge haga que los usuarios no perciban la diferencia entre "local" y "en la nube" en el uso diario. Cuando llegue ese día, todo el modelo comercial de la industria de la IA experimentará una verdadera reestructuración.

Este artículo proviene del WeChat público "Machine Heart" (ID: almosthuman2014), autor: Machine Heart

Criptos en tendencia

Preguntas relacionadas

Q¿Qué es Gemma 4 y por qué ha causado tanto impacto?

AGemma 4 es un nuevo modelo de inteligencia artificial de código abierto de Google, basado en la misma arquitectura técnica que Gemini 3. Es multimodal nativo, ocupa el tercer lugar en el ranking Arena AI y tiene versiones pequeñas (como E2B y E4B) que pueden ejecutarse localmente en teléfonos móviles con una ventana de contexto de 128K, lo que lo convierte en una alternativa portátil a Gemini.

Q¿Cómo de rápido puede funcionar Gemma 4 en un iPhone?

AEn un iPhone 17 Pro con chip Apple y optimizado con el framework de aprendizaje automático MLX, Gemma 4 puede alcanzar velocidades de inferencia superiores a 40 tokens por segundo, lo que se considera sorprendentemente rápido y casi mágico.

Q¿Cómo pueden los usuarios ejecutar Gemma 4 en sus dispositivos móviles?

ALos usuarios pueden descargar la aplicación oficial Google AI Edge Gallery, luego descargar la versión del modelo que deseen ejecutar y abrirla para usarla localmente. Es un proceso sencillo y no está reservado exclusivamente para expertos en tecnología.

Q¿Cuáles son algunas limitaciones de Gemma 4 según las pruebas realizadas?

AAunque Gemma 4 funciona bien en tareas básicas como generación de texto y explicación de código, tiene dificultades en escenarios más complejos, como el uso como agente de codificación con ventanas de contexto grandes (256K), prompts complejos y llamadas a herramientas estables, donde a menudo se bloquea, genera errores o produce salidas mal estructuradas.

Q¿Qué implicaciones podría tener Gemma 4 para el futuro de los modelos de IA y la industria?

AGemma 4 representa el inicio de una tendencia hacia modelos locales que pueden manejar tareas cotidianas sin depender de tokens o APIs en la nube. A largo plazo, esto podría llevar a que los modelos en dispositivos locales reemplacen gradualmente a los servicios en la nube para tareas frecuentes y simples, obligando a los proveedores de servicios en la nube a centrarse en áreas más complejas como agentes avanzados, contextos largos y confiables, y capacidades especializadas que requieren datos en tiempo real.

Lecturas Relacionadas

"Teletubbies" robots hacen limpieza a domicilio, 200 yuanes/hora, pura inteligencia *artificial*

La compañía de robótica Tau Robotics, con sede en San Francisco, ha presentado su nuevo servicio de limpieza doméstica utilizando robots humanoides teleoperados. Bautizados cariñosamente como "Teletubbies" por su antena similar a un router Wi-Fi en la cabeza, estos robots, llamados Chelsea, Elon y Tony, realizan tareas como limpiar cocinas, baños, recoger basura y trapear pisos. La gran revelación, y decepción para algunos, es que las demostraciones mostradas son operadas por control remoto en tiempo real ("inteligencia artificial 100% humana"). La empresa defiende este enfoque como una solución práctica para cerrar la brecha tecnológica actual, permitiendo la recolección de datos del mundo real para eventualmente desarrollar autonomía completa, similar al "modo sombra" en los coches autónomos. El servicio, disponible por invitación en el área de la Bahía de San Francisco, cuesta 30 dólares (unos 200 yuanes) por hora, un precio competitivo frente a los servicios de limpieza humana en EE.UU. El artículo analiza los desafíos de introducir robots humanoides en hogares, comparando el enfoque estadounidense con el chino, que prioriza entornos industriales más controlados. Se argumenta que la forma humanoide facilita la teleoperación intuitiva y podría ofrecer un valor emocional único, aunque su necesidad funcional frente a robots con ruedas sigue siendo objeto de debate.

marsbitHace 11 min(s)

"Teletubbies" robots hacen limpieza a domicilio, 200 yuanes/hora, pura inteligencia *artificial*

marsbitHace 11 min(s)

Qualcomm: La fiebre de la IA se desvanece, ¿cuándo saldrá el mercado de teléfonos de la niebla?

El 30 de julio de 2026, Qualcomm publicó sus resultados del tercer trimestre del año fiscal 2026. Los ingresos fueron de 9,950 millones de dólares, un 4% menos que el año anterior, superando las expectativas del mercado. Sin embargo, el margen bruto cayó al 53,1%, por debajo de lo previsto, debido al aumento de costes en fabricación, ensamblaje y memoria. El negocio principal de chips para teléfonos registró una fuerte caída del 19,6%, alcanzando los 5,090 millones de dólares. Esto se debió a una disminución general del 11% en los envíos de teléfonos Android y a que los fabricantes optaron por usar plataformas anteriores para reducir costes. En contraste, el segmento automotriz creció un 61%, impulsado por los sistemas de infoentretenimiento, y el de IoT aumentó un 9%. La compañía prevé unos ingresos para el próximo trimestre entre 9,700 y 10,500 millones de dólares, pero una ganancia por acción inferior a las expectativas. El mercado de teléfonos sigue débil y los precios de la memoria presionan los costes. Ante la debilidad de su negocio central, Qualcomm busca oportunidades en IA. Su estrategia incluye IA en dispositivos (teléfonos, PC, coches) y una importante incursión en centros de datos, con aceleradores de IA, CPU comerciales, chips personalizados y productos de conectividad. Aunque esta estrategia impulsó antes su cotización, las preocupaciones sobre el gasto en IA la han hecho retroceder. La empresa tiene el objetivo de alcanzar 15,000 millones de dólares en ingresos por centros de datos para 2029, pero por ahora, este negocio se percibe con escepticismo, mientras el mercado tradicional sigue enfrentando desafíos.

marsbitHace 59 min(s)

Qualcomm: La fiebre de la IA se desvanece, ¿cuándo saldrá el mercado de teléfonos de la niebla?

marsbitHace 59 min(s)

Explotación en Coldcard desata migración de Bitcoin, consolidación 'alcista' de cripto: Resumen del Hodler, 2 de agosto

Tras el drenaje de 90 millones de dólares en Bitcoin de usuarios de la billetera Coldcard, los pequeños "hodlers" buscaron refugio en exchanges centralizados. Las transferencias de menos de 1 BTC alcanzaron su máximo diario desde 2022, con 39.600 BTC movidos. Galaxy Research informó que los ataques al monedero hardware resultaron en pérdidas estimadas de 1.367 BTC (88,6 millones de dólares). Se insta a los usuarios a mover fondos de direcciones generadas por Coldcard debido a un fallo en la generación de semillas. Mientras tanto, el reloj de la "Clarity Act" se agota en EE.UU., con desacuerdos sobre su aplicación y los beneficios en cripto de Trump. Los informes de ganancias del segundo trimestre muestran pérdidas para Coinbase y Strategy, aunque Robinhood registró récords a pesar del descenso en ingresos por cripto. Un analista de ARK Invest señala que la industria entra en su mayor fase de consolidación, con el 80% de los ingresos concentrados en pocos protocolos, lo que considera "extremadamente alcista". La Copa del Mundo 2026 generó 20.000 millones de dólares en volumen de mercados de predicción blockchain. En cuanto a precios, Bitcoin y Ether cayeron alrededor de un 3% esta semana. Grayscale sugiere que Bitcoin pudo haber tocado fondo antes de lo habitual en su ciclo. Otras noticias incluyen: Rusia y Australia persiguen al fundador de Telegram; Pump.fun despidió empleados antes de que recibieran tokens valiosos; y un exoperador de teleprompter de Trump es acusado de usar información privilegiada para apostar.

cointelegraphHace 1 hora(s)

Explotación en Coldcard desata migración de Bitcoin, consolidación 'alcista' de cripto: Resumen del Hodler, 2 de agosto

cointelegraphHace 1 hora(s)

Trading

Spot

Artículos destacados

Cómo comprar 4

¡Bienvenido a HTX.com! Hemos hecho que comprar 4 (4) sea simple y conveniente. Sigue nuestra guía paso a paso para iniciar tu viaje de criptos.Paso 1: crea tu cuenta HTXUtiliza tu correo electrónico o número de teléfono para registrarte y obtener una cuenta gratuita en HTX. Experimenta un proceso de registro sin complicaciones y desbloquea todas las funciones.Obtener mi cuentaPaso 2: ve a Comprar cripto y elige tu método de pagoTarjeta de crédito/débito: usa tu Visa o Mastercard para comprar 4 (4) al instante.Saldo: utiliza fondos del saldo de tu cuenta HTX para tradear sin problemas.Terceros: hemos agregado métodos de pago populares como Google Pay y Apple Pay para mejorar la comodidad.P2P: tradear directamente con otros usuarios en HTX.Over-the-Counter (OTC): ofrecemos servicios personalizados y tipos de cambio competitivos para los traders.Paso 3: guarda tu 4 (4)Después de comprar tu 4 (4), guárdalo en tu cuenta HTX. Alternativamente, puedes enviarlo a otro lugar mediante transferencia blockchain o utilizarlo para tradear otras criptomonedas.Paso 4: tradear 4 (4)Tradear fácilmente con 4 (4) en HTX's mercado spot. Simplemente accede a tu cuenta, selecciona tu par de trading, ejecuta tus trades y monitorea en tiempo real. Ofrecemos una experiencia fácil de usar tanto para principiantes como para traders experimentados.

707 Vistas totalesPublicado en 2025.10.20Actualizado en 2026.06.02

Cómo comprar 4

Discusiones

Bienvenido a la comunidad de HTX. Aquí puedes mantenerte informado sobre los últimos desarrollos de la plataforma y acceder a análisis profesionales del mercado. A continuación se presentan las opiniones de los usuarios sobre el precio de 4 (4).

活动图片