La versión en vídeo de Nano Banana ya está aquí: con conocimiento del mundo Gemini incorporado, generar imágenes con el plátano original solo tarda 4 segundos

marsbitPublicado a 2026-07-01Actualizado a 2026-07-01

Resumen

Google ha lanzado dos nuevos modelos multimodales: **Gemini Omni Flash** y **Nano Banana 2 Lite**. **Gemini Omni Flash** es un modelo de generación y edición de video que combina la capacidad de razonamiento multimodal de Gemini con la creación de contenido visual. Permite generar videos de hasta 10 segundos mediante instrucciones de lenguaje natural, utilizando referencias de texto, imagen o video. Sus características clave incluyen edición conversacional, integración de conocimientos del mundo real y sincronización de texto con acción. Su costo es competitivo, a 0.10 USD por segundo de video. **Nano Banana 2 Lite** (gemini-3.1-flash-lite-image) es un modelo optimizado para generar imágenes a alta velocidad y bajo costo. Puede crear una imagen de resolución 1K en aproximadamente **4 segundos**, por un precio de unos **0.034 USD**, lo que lo hace ideal para aplicaciones en tiempo real como comercio electrónico o publicidad. Mantiene una buena calidad en la generación y representación de texto. La verdadera potencia, según Google, reside en combinar ambos modelos. Un flujo de trabajo típico sería generar rápidamente una imagen con Nano Banana 2 Lite y luego usarla como referencia para que Gemini Omni Flash la transforme en un video dinámico. Se presentaron tres demostraciones de esta sinergia: "Anywhere" (para crear videos de viaje a partir de una selfie), "Space Lift" (para visualizar propuestas de diseño de interiores) y "Omni Product Studio" (para generar material public...

Si bien "Coding" aún es un desastre, Google sí que tiene sus cartas bajo la manga en lo que a "multimodalidad" se refiere.

Gemini Omni Flash ya está abierto oficialmente a través de API, la versión en vídeo de Nano Banana.

Dejar de soñar con que los "muggles" rehagan "Harry Potter". Observemos estos cuatro trucos de magia digital que Google realiza con Gemini Omni:

Es una locura, esta coherencia y claridad de texto, ¿para qué necesitas croma y efectos? Se podría hacer una transmisión en directo del Doctor Strange directamente.

Mientras tanto, el tan esperado "plátano", también recibe su versión "a velocidad de la luz".

Nano Banana 2 Lite: el modelo de imagen Gemini más rápido y económico hasta la fecha.

Sin exagerar: genera una imagen en 4 segundos, una imagen en resolución 1K cuesta solo alrededor de 0.20 yuanes.

Comparado con Nano Banana 2, esta velocidad es simplemente despegue.

Por no hablar de GPT Image 2, que tarda 3 minutos en generar una imagen...

Con razón no ha salido Gemini 3.5 Pro en tanto tiempo, ¡¡parece que todo el tiempo se ha invertido en la multimodalidad tan ansiada, Hassabis!!

Gemini Omni Flash

Gemini Omni Flash, presentado por primera vez en Google I/O 2026, combina las capacidades de razonamiento multimodal de Gemini con la generación y edición de vídeo, lo que despertó gran interés en su momento.

Ahora, este modelo ya está disponible oficialmente para desarrolladores a través de Gemini API y Google AI Studio. Puede generar y editar vídeos de alta calidad fácilmente basándose en múltiples entradas como texto, imágenes y vídeo.

Cuatro capacidades clave:

Edición conversacional de vídeo: modificar y perfeccionar vídeos con lenguaje natural, como editar un documento en Lark.

Referencia multimodal: combinar entradas de imagen, texto y vídeo, manteniendo el control y la coherencia de la escena.

Conocimiento del mundo real: aprovechar los conocimientos de Gemini en historia, biología, lógica narrativa, etc., para construir vídeos, sin necesidad de escribir tres páginas de prompt describiendo estilos arquitectónicos.

Sincronización de texto y acción: conectar texto y gráficos directamente a la acción del vídeo mediante prompts simples.

El precio también es competitivo: el coste por segundo de salida de vídeo es de 0.10 dólares, igual que Veo 3.1 Fast.

En cuanto al posicionamiento, siendo también un modelo de generación de vídeo ligero, Omni Flash enfatiza más el conocimiento mundial de Gemini, y su ecosistema también está totalmente orientado hacia la capa Gemini.

Sin embargo, Google también es bastante franco, y enumera activamente una serie de limitaciones actuales:

1. Actualmente solo admite la generación de vídeos de 10 segundos, se admitirán duraciones más largas posteriormente;

2. Por ahora no admite la carga de referencias de audio ni la expansión de escenas;

3. La API admite vídeos de hasta 3 segundos como material de referencia, pero el modelo aún no puede procesar correctamente este tipo de entrada;

4. Aún hay limitaciones en la coherencia de los personajes al cambiar de escena o usar movimientos de cámara.

Nano Banana 2 Lite

Nano Banana 2 Lite (también conocido como gemini-3.1-flash-lite-image) está diseñado específicamente para un procesamiento ultrarrápido.

Optimizado de manera específica, apunta a aquellos escenarios de aplicaciones en tiempo real extremadamente sensibles a la latencia y que requieren procesar grandes volúmenes de imágenes en poco tiempo, como la generación masiva de material para e-commerce, la iteración rápida de creatividades publicitarias o las líneas de producción automatizadas de contenido.

Dos puntos clave de venta:

Velocidad de la luz: latencia de generación de imagen de unos 4 segundos, una quinta parte de Nano Banana 2 (que tarda unos 20 segundos).

Precio de ganga: una imagen en 1K cuesta solo unos 0.034 dólares, la mitad que Nano Banana 2 y una cuarta parte que Nano Banana Pro.

Se redujo la velocidad y el precio, pero las capacidades de generación y edición de imágenes no se redujeron significativamente. Nano Banana 2 Lite aún mantiene un efecto de renderizado de texto excelente, situándose al mismo nivel que modelos como Grok en los benchmarks.

Por lo tanto, la recomendación de Google es: si todavía estás usando la primera generación de Nano Banana por ser barata, cámbiala ya. La versión Lite supera a la original en todos los indicadores clave.

Combinación de dos espadas

Espera, no te vayas todavía.

Se pensaba que esto solo era el lanzamiento de dos modelos en paralelo, pero Google indica: hay un truco nuevo.

La verdadera magia reside en conectar estos modelos en cadena para su uso.

Como es sabido, la creación con AIGC requiere iteraciones repetidas y la gestión del material es bastante engorrosa.

Ahora, con estos dos modelos, finalmente no es necesario cargar archivos repetidamente, la generación de imágenes y la creación de vídeos se conectan sin problemas.

Concretamente, se puede usar primero Nano Banana 2 Lite para generar imágenes a alta velocidad, y luego alimentar las imágenes generadas como material de referencia a Gemini Omni Flash, transformándolas en vídeo con un clic.

Para mostrar esta magia de 1+1>2 en el flujo de trabajo, Google incluso desarrolló 3 aplicaciones demo:

1. Anywhere (Cualquier lugar)

Tómate un selfie o sube una foto, NB2 Lite te "photoshopea" instantáneamente en docenas de lugares emblemáticos.

Luego haz clic en la imagen y Omni Flash transforma el lugar estático en un clip dinámico.

El turismo cibernético también se convierte en un proceso integral ahora.

2. Space Lift (Elevador espacial)

Esto da un poco de miedo, parece que combinándolo con el modelo mundial Genie, en el futuro podría amenazar a muchas empresas de SaaS tradicionales de soluciones de decoración.

Sube una foto de una habitación, NB2 Lite genera primero varios estilos de decoración. Encuentra el que te guste, pulsa el botón de vídeo y Omni puede directamente darte un recorrido cinematográfico por el espacio.

3. Omni product studio (Estudio de producto Omni)

Una buena noticia para el comercio transfronterizo electrónico.

Toma una foto de tu producto sobre fondo blanco, NB2 Lite genera varias imágenes del producto en diferentes escenarios, y Omni Flash transforma la imagen estática en un vídeo corto para e-commerce.

De "producto" a "material publicitario", toda la cadena se ejecuta automáticamente.

Entonces, ¿para qué sirve realmente la multimodalidad?

Seguro que Google ha escuchado esta pregunta innumerables veces.

Sobre todo en 2026, donde "Coding" equivale prácticamente al coeficiente intelectual del modelo. Todas las empresas compiten a muerte en Coding.

¿Qué se persigue obsesionándose con la multimodalidad?

Dejemos de lado la narrativa de la AGI. A corto plazo, este conjunto de modelos multimodales de Google realmente puede potenciar muchos de sus productos.

No profundizaremos en la narrativa de la AGI. A corto plazo, este conjunto de modelos multimodales de Google realmente puede potenciar muchos de sus productos: Stitch es uno, el retoque de fotos incorporado en Pixel es otro, y el surgimiento de Notebook LM también fue bastante impresionante.

Los dos nuevos modelos lanzados esta vez permiten ver más potencial de aplicación de la multimodalidad en escenarios verticales. Comercio electrónico, decoración, vídeos cortos... la demanda en estos negocios es real, y el dinero también.

Sumado al respaldo del ecosistema Android, básicamente no hay que preocuparse demasiado por la comercialización.

Google puede que no alcance en Coding por ahora, pero en la mesa de juego de la multimodalidad, Google podría ser el único jugador capaz de formar una mano completa.

Sin embargo...

¡¡¡¿Cuándo va a llegar Gemni 3.5 Pro?!!!

Referencias:[1]https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-flash-nano-banana-2-lite/

Este artículo procede del cuenta oficial de WeChat "Qubit", autor: Tecnología de vanguardia

Criptos en tendencia

Preguntas relacionadas

Q¿Cuál es el nombre del nuevo modelo de generación de imágenes ultra rápido de Google y cuánto tiempo tarda en generar una imagen?

AEl nuevo modelo se llama Nano Banana 2 Lite (también conocido como gemini-3.1-flash-lite-image) y tarda aproximadamente 4 segundos en generar una imagen.

Q¿Cuáles son las cuatro capacidades clave del modelo Gemini Omni Flash recién lanzado?

ALas cuatro capacidades clave son: 1) Edición de video conversacional, 2) Referencia multimodal, 3) Conocimiento del mundo real integrado de Gemini, y 4) Sincronización de texto y acción.

Q¿Qué dos modelos presentados en el artículo pueden combinarse para crear un flujo de trabajo de imagen a video?

ALos modelos Nano Banana 2 Lite (para generar imágenes rápidamente) y Gemini Omni Flash (para convertir esas imágenes en video) pueden combinarse para un flujo de trabajo sin problemas desde la imagen hasta el video.

Q¿Para qué tipo de aplicaciones está diseñado específicamente el modelo Nano Banana 2 Lite según el artículo?

ANano Banana 2 Lite está diseñado específicamente para aplicaciones en tiempo real sensibles a la latencia que requieren procesar grandes volúmenes de imágenes en poco tiempo, como la generación masiva de material para comercio electrónico, la iteración rápida de creatividades publicitarias y tuberías de contenido automatizadas.

QEl artículo menciona que Google también presentó tres aplicaciones de demostración (Demos) para mostrar el flujo de trabajo combinado. Nombra una de ellas y describe brevemente su función.

AUna de las demos se llama 'Anywhere'. Permite al usuario subir una selfie o foto, usar Nano Banana 2 Lite para colocarla digitalmente en varios puntos de referencia famosos, y luego, con un clic, usar Gemini Omni Flash para transformar esa imagen estática en un video corto y dinámico, ofreciendo una experiencia de 'viaje cibernético'.

Lecturas Relacionadas

Fidelity advierte: el auge de los agentes de IA no necesariamente es una fiesta para las blockchains públicas

**Fidelity advierte: el auge de los agentes de IA no garantiza un festín para las blockchains públicas** La aparición de agentes de IA autónomos, capaces de gestionar tareas como pagos, podría apuntar a un mayor uso de cadenas de bloques. Sin embargo, Fidelity Digital Assets advierte que conectar directamente este auge con una revalorización de las criptomonedas nativas supone varias suposiciones arriesgadas. Primero, es posible que muchos agentes de IA, especialmente en entornos corporativos, operen en sistemas cerrados o privados que priorizan velocidad, control y cumplimiento normativo, en lugar de en redes públicas. Segundo, incluso si las transacciones en cadena aumentan, su valor podría ser capturado por stablecoins o proveedores de servicios, sin beneficiar directamente al token nativo de la blockchain. Tercero, aunque la IA abarate y acelere el desarrollo de software y contratos inteligentes, una mayor oferta no se traduce automáticamente en más demanda real o valor económico, pudiendo llevar a una rápida homogeneización. Además, la IA también reduce el coste de los ataques, aumentando los riesgos de seguridad si la expansión no va acompañada de infraestructuras de auditoría maduras. Por último, las grandes instituciones pueden necesitar blockchains con mayores controles de permisos e identidad, en lugar de redes completamente abiertas. En conclusión, Fidelity subraya que la narrativa combinada de IA y blockchain debe examinarse con detalle. La clave no es si la IA usará blockchains, sino **qué infraestructuras capturarán realmente el valor económico generado** y cómo se distribuirá ese valor en el ecosistema. Es necesario pasar de las historias especulativas a un análisis económico concreto.

marsbitHace 35 min(s)

Fidelity advierte: el auge de los agentes de IA no necesariamente es una fiesta para las blockchains públicas

marsbitHace 35 min(s)

Tras investigar Silicon Valley, Goldman Sachs concluye: Los Agentes entran en la era de la ejecución, la competencia de la IA se desplaza hacia los flujos de trabajo, emerge el modelo del mundo

Tras una visita al ecosistema de IA en Silicon Valley, Goldman Sachs concluye que la inteligencia artificial está entrando en una nueva fase: de "saber responder" a "poder ejecutar". La comercialización de la IA está evolucionando desde suscripciones por usuario hacia modelos basados en consumo, volumen de transacciones o resultados. Los agentes de IA están pasando de ser herramientas de asistencia a ejecutores autónomos de flujos de trabajo, lo que desplaza el valor desde el modelo en sí hacia los datos propietarios, el contexto empresarial y la experiencia de dominio específico. La competencia se centra ahora en quién domina e integra realmente los flujos de trabajo empresariales, siendo la "controlabilidad" y la trazabilidad de las decisiones barreras clave para la adopción masiva. Se observa una división del trabajo entre los modelos: los modelos de vanguardia (cerrados) se reservarán para tareas complejas de alto valor, mientras que los modelos de código abierto, con un coste inferior, absorberán la mayor parte de las tareas estandarizadas y del consumo de tokens. Goldman Sachs estima que hasta el 90% de los tokens de inferencia podrían ir a modelos de código abierto en los próximos 12-18 meses. Paralelamente, el interés de los investigadores se desplaza hacia los "modelos del mundo" (world models), que requieren comprender entornos físicos, causalidad y dinámicas del mundo real, lo que aumenta el valor de los datos propietarios de sectores industriales, científicos y robóticos. Esta evolución hacia la IA física podría generar una segunda curva de crecimiento de la demanda de potencia de cálculo, estimándose un aumento de aproximadamente 24 veces en los próximos cinco años, beneficiando a proveedores de infraestructura en la nube y de computación.

marsbitHace 35 min(s)

Tras investigar Silicon Valley, Goldman Sachs concluye: Los Agentes entran en la era de la ejecución, la competencia de la IA se desplaza hacia los flujos de trabajo, emerge el modelo del mundo

marsbitHace 35 min(s)

Telegram presentó la tecnología de proxy WEB: camuflaje del tráfico como sitios web normales

Telegram ha presentado una tecnología experimental de proxy web que enmascara el tráfico de la aplicación como navegación web normal. Esta función, lanzada el 21 de agosto de 2026, utiliza una sesión WebView basada en HTTPS o WebSocket para transmitir datos de MTProxy, haciéndolos indistinguibles de una conexión web legítima y ofreciendo una nueva perspectiva para el acceso en regiones con restricciones. El sistema canaliza múltiples conexiones lógicas de Telegram a través de un único canal encriptado, que externamente parece la carga de una página web. Un servidor retransmisor separa este flujo en conexiones individuales sin descifrar el contenido, preservando la privacidad. El proxy opera en un dominio HTTPS estándar que también aloja un sitio web público real, activándose solo con un parámetro URL específico, lo que lo oculta de los sistemas de detección automática. Actualmente en fase de prueba, la tecnología está disponible para Telegram Desktop y un cliente experimental de Android, con planes para iOS. Su implementación utiliza protocolos web comunes, lo que complica la tarea de los sistemas de filtrado que deben elegir entre bloquear todo el tráfico HTTPS o permitir el acceso a servicios normales. Esta técnica recuerda al método de "domain fronting" de la década anterior y plantea la pregunta sobre su durabilidad frente a futuras adaptaciones de los sistemas de análisis de tráfico.

cryptonews.ruHace 52 min(s)

Telegram presentó la tecnología de proxy WEB: camuflaje del tráfico como sitios web normales

cryptonews.ruHace 52 min(s)

Justin Sun declara la guerra a una altcoin: 'Congela los activos de los usuarios mediante una función oculta'

Justin Sun acusa a World Liberty Financial de incorporar funciones de "puerta trasera" en su stablecoin USD1, que permitirían congelar o destruir los activos de los usuarios en cualquier momento. Según Sun, su equipo legal logró que las demandas se mantengan en un tribunal federal público de California, en lugar de pasar a un arbitraje privado. Durante el proceso legal, Sun afirma haber descubierto que USD1 posee mecanismos de autorización similares, lo que representa un riesgo significativo para los usuarios, especialmente dentro de las estructuras centralizadas de los stablecoins. También advierte que World Liberty Financial podría haber estado dispuesta a utilizar estas facultades contra los tenedores de sus tokens WLFI en el pasado. Otra preocupación planteada por Sun es la solvencia financiera de la compañía. Sostiene que las reservas colaterales de USD1, valoradas en aproximadamente 4 mil millones de dólares, pertenecen a los usuarios del stablecoin y no podrían utilizarse para cubrir posibles demandas judiciales contra la empresa, que podrían alcanzar cientos de millones de dólares. Sun afirma no haber visto evidencia de que World Liberty Financial tenga capital suficiente para cumplir con posibles fallos judiciales u otras obligaciones, más allá de las reservas de garantía. Por ello, Justin Sun insta a los inversores a ejercer "extrema precaución". Hasta el momento, World Liberty Financial no se ha pronunciado oficialmente sobre estas acusaciones, por lo que las afirmaciones de Sun permanecen como alegaciones no verificadas.

cryptonews.ruHace 1 hora(s)

Justin Sun declara la guerra a una altcoin: 'Congela los activos de los usuarios mediante una función oculta'

cryptonews.ruHace 1 hora(s)

Trading

Spot

Artículos destacados

Cómo comprar 4

¡Bienvenido a HTX.com! Hemos hecho que comprar 4 (4) sea simple y conveniente. Sigue nuestra guía paso a paso para iniciar tu viaje de criptos.Paso 1: crea tu cuenta HTXUtiliza tu correo electrónico o número de teléfono para registrarte y obtener una cuenta gratuita en HTX. Experimenta un proceso de registro sin complicaciones y desbloquea todas las funciones.Obtener mi cuentaPaso 2: ve a Comprar cripto y elige tu método de pagoTarjeta de crédito/débito: usa tu Visa o Mastercard para comprar 4 (4) al instante.Saldo: utiliza fondos del saldo de tu cuenta HTX para tradear sin problemas.Terceros: hemos agregado métodos de pago populares como Google Pay y Apple Pay para mejorar la comodidad.P2P: tradear directamente con otros usuarios en HTX.Over-the-Counter (OTC): ofrecemos servicios personalizados y tipos de cambio competitivos para los traders.Paso 3: guarda tu 4 (4)Después de comprar tu 4 (4), guárdalo en tu cuenta HTX. Alternativamente, puedes enviarlo a otro lugar mediante transferencia blockchain o utilizarlo para tradear otras criptomonedas.Paso 4: tradear 4 (4)Tradear fácilmente con 4 (4) en HTX's mercado spot. Simplemente accede a tu cuenta, selecciona tu par de trading, ejecuta tus trades y monitorea en tiempo real. Ofrecemos una experiencia fácil de usar tanto para principiantes como para traders experimentados.

806 Vistas totalesPublicado en 2025.10.20Actualizado en 2026.06.02

Cómo comprar 4

Discusiones

Bienvenido a la comunidad de HTX. Aquí puedes mantenerte informado sobre los últimos desarrollos de la plataforma y acceder a análisis profesionales del mercado. A continuación se presentan las opiniones de los usuarios sobre el precio de 4 (4).

活动图片