La versión en vídeo de Nano Banana ya está aquí: con conocimiento del mundo Gemini incorporado, generar imágenes con el plátano original solo tarda 4 segundos

marsbit发布于2026-07-01更新于2026-07-01

文章摘要

Google ha lanzado dos nuevos modelos multimodales: **Gemini Omni Flash** y **Nano Banana 2 Lite**. **Gemini Omni Flash** es un modelo de generación y edición de video que combina la capacidad de razonamiento multimodal de Gemini con la creación de contenido visual. Permite generar videos de hasta 10 segundos mediante instrucciones de lenguaje natural, utilizando referencias de texto, imagen o video. Sus características clave incluyen edición conversacional, integración de conocimientos del mundo real y sincronización de texto con acción. Su costo es competitivo, a 0.10 USD por segundo de video. **Nano Banana 2 Lite** (gemini-3.1-flash-lite-image) es un modelo optimizado para generar imágenes a alta velocidad y bajo costo. Puede crear una imagen de resolución 1K en aproximadamente **4 segundos**, por un precio de unos **0.034 USD**, lo que lo hace ideal para aplicaciones en tiempo real como comercio electrónico o publicidad. Mantiene una buena calidad en la generación y representación de texto. La verdadera potencia, según Google, reside en combinar ambos modelos. Un flujo de trabajo típico sería generar rápidamente una imagen con Nano Banana 2 Lite y luego usarla como referencia para que Gemini Omni Flash la transforme en un video dinámico. Se presentaron tres demostraciones de esta sinergia: "Anywhere" (para crear videos de viaje a partir de una selfie), "Space Lift" (para visualizar propuestas de diseño de interiores) y "Omni Product Studio" (para generar material public...

Si bien "Coding" aún es un desastre, Google sí que tiene sus cartas bajo la manga en lo que a "multimodalidad" se refiere.

Gemini Omni Flash ya está abierto oficialmente a través de API, la versión en vídeo de Nano Banana.

Dejar de soñar con que los "muggles" rehagan "Harry Potter". Observemos estos cuatro trucos de magia digital que Google realiza con Gemini Omni:

Es una locura, esta coherencia y claridad de texto, ¿para qué necesitas croma y efectos? Se podría hacer una transmisión en directo del Doctor Strange directamente.

Mientras tanto, el tan esperado "plátano", también recibe su versión "a velocidad de la luz".

Nano Banana 2 Lite: el modelo de imagen Gemini más rápido y económico hasta la fecha.

Sin exagerar: genera una imagen en 4 segundos, una imagen en resolución 1K cuesta solo alrededor de 0.20 yuanes.

Comparado con Nano Banana 2, esta velocidad es simplemente despegue.

Por no hablar de GPT Image 2, que tarda 3 minutos en generar una imagen...

Con razón no ha salido Gemini 3.5 Pro en tanto tiempo, ¡¡parece que todo el tiempo se ha invertido en la multimodalidad tan ansiada, Hassabis!!

Gemini Omni Flash

Gemini Omni Flash, presentado por primera vez en Google I/O 2026, combina las capacidades de razonamiento multimodal de Gemini con la generación y edición de vídeo, lo que despertó gran interés en su momento.

Ahora, este modelo ya está disponible oficialmente para desarrolladores a través de Gemini API y Google AI Studio. Puede generar y editar vídeos de alta calidad fácilmente basándose en múltiples entradas como texto, imágenes y vídeo.

Cuatro capacidades clave:

Edición conversacional de vídeo: modificar y perfeccionar vídeos con lenguaje natural, como editar un documento en Lark.

Referencia multimodal: combinar entradas de imagen, texto y vídeo, manteniendo el control y la coherencia de la escena.

Conocimiento del mundo real: aprovechar los conocimientos de Gemini en historia, biología, lógica narrativa, etc., para construir vídeos, sin necesidad de escribir tres páginas de prompt describiendo estilos arquitectónicos.

Sincronización de texto y acción: conectar texto y gráficos directamente a la acción del vídeo mediante prompts simples.

El precio también es competitivo: el coste por segundo de salida de vídeo es de 0.10 dólares, igual que Veo 3.1 Fast.

En cuanto al posicionamiento, siendo también un modelo de generación de vídeo ligero, Omni Flash enfatiza más el conocimiento mundial de Gemini, y su ecosistema también está totalmente orientado hacia la capa Gemini.

Sin embargo, Google también es bastante franco, y enumera activamente una serie de limitaciones actuales:

1. Actualmente solo admite la generación de vídeos de 10 segundos, se admitirán duraciones más largas posteriormente;

2. Por ahora no admite la carga de referencias de audio ni la expansión de escenas;

3. La API admite vídeos de hasta 3 segundos como material de referencia, pero el modelo aún no puede procesar correctamente este tipo de entrada;

4. Aún hay limitaciones en la coherencia de los personajes al cambiar de escena o usar movimientos de cámara.

Nano Banana 2 Lite

Nano Banana 2 Lite (también conocido como gemini-3.1-flash-lite-image) está diseñado específicamente para un procesamiento ultrarrápido.

Optimizado de manera específica, apunta a aquellos escenarios de aplicaciones en tiempo real extremadamente sensibles a la latencia y que requieren procesar grandes volúmenes de imágenes en poco tiempo, como la generación masiva de material para e-commerce, la iteración rápida de creatividades publicitarias o las líneas de producción automatizadas de contenido.

Dos puntos clave de venta:

Velocidad de la luz: latencia de generación de imagen de unos 4 segundos, una quinta parte de Nano Banana 2 (que tarda unos 20 segundos).

Precio de ganga: una imagen en 1K cuesta solo unos 0.034 dólares, la mitad que Nano Banana 2 y una cuarta parte que Nano Banana Pro.

Se redujo la velocidad y el precio, pero las capacidades de generación y edición de imágenes no se redujeron significativamente. Nano Banana 2 Lite aún mantiene un efecto de renderizado de texto excelente, situándose al mismo nivel que modelos como Grok en los benchmarks.

Por lo tanto, la recomendación de Google es: si todavía estás usando la primera generación de Nano Banana por ser barata, cámbiala ya. La versión Lite supera a la original en todos los indicadores clave.

Combinación de dos espadas

Espera, no te vayas todavía.

Se pensaba que esto solo era el lanzamiento de dos modelos en paralelo, pero Google indica: hay un truco nuevo.

La verdadera magia reside en conectar estos modelos en cadena para su uso.

Como es sabido, la creación con AIGC requiere iteraciones repetidas y la gestión del material es bastante engorrosa.

Ahora, con estos dos modelos, finalmente no es necesario cargar archivos repetidamente, la generación de imágenes y la creación de vídeos se conectan sin problemas.

Concretamente, se puede usar primero Nano Banana 2 Lite para generar imágenes a alta velocidad, y luego alimentar las imágenes generadas como material de referencia a Gemini Omni Flash, transformándolas en vídeo con un clic.

Para mostrar esta magia de 1+1>2 en el flujo de trabajo, Google incluso desarrolló 3 aplicaciones demo:

1. Anywhere (Cualquier lugar)

Tómate un selfie o sube una foto, NB2 Lite te "photoshopea" instantáneamente en docenas de lugares emblemáticos.

Luego haz clic en la imagen y Omni Flash transforma el lugar estático en un clip dinámico.

El turismo cibernético también se convierte en un proceso integral ahora.

2. Space Lift (Elevador espacial)

Esto da un poco de miedo, parece que combinándolo con el modelo mundial Genie, en el futuro podría amenazar a muchas empresas de SaaS tradicionales de soluciones de decoración.

Sube una foto de una habitación, NB2 Lite genera primero varios estilos de decoración. Encuentra el que te guste, pulsa el botón de vídeo y Omni puede directamente darte un recorrido cinematográfico por el espacio.

3. Omni product studio (Estudio de producto Omni)

Una buena noticia para el comercio transfronterizo electrónico.

Toma una foto de tu producto sobre fondo blanco, NB2 Lite genera varias imágenes del producto en diferentes escenarios, y Omni Flash transforma la imagen estática en un vídeo corto para e-commerce.

De "producto" a "material publicitario", toda la cadena se ejecuta automáticamente.

Entonces, ¿para qué sirve realmente la multimodalidad?

Seguro que Google ha escuchado esta pregunta innumerables veces.

Sobre todo en 2026, donde "Coding" equivale prácticamente al coeficiente intelectual del modelo. Todas las empresas compiten a muerte en Coding.

¿Qué se persigue obsesionándose con la multimodalidad?

Dejemos de lado la narrativa de la AGI. A corto plazo, este conjunto de modelos multimodales de Google realmente puede potenciar muchos de sus productos.

No profundizaremos en la narrativa de la AGI. A corto plazo, este conjunto de modelos multimodales de Google realmente puede potenciar muchos de sus productos: Stitch es uno, el retoque de fotos incorporado en Pixel es otro, y el surgimiento de Notebook LM también fue bastante impresionante.

Los dos nuevos modelos lanzados esta vez permiten ver más potencial de aplicación de la multimodalidad en escenarios verticales. Comercio electrónico, decoración, vídeos cortos... la demanda en estos negocios es real, y el dinero también.

Sumado al respaldo del ecosistema Android, básicamente no hay que preocuparse demasiado por la comercialización.

Google puede que no alcance en Coding por ahora, pero en la mesa de juego de la multimodalidad, Google podría ser el único jugador capaz de formar una mano completa.

Sin embargo...

¡¡¡¿Cuándo va a llegar Gemni 3.5 Pro?!!!

Referencias:[1]https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-flash-nano-banana-2-lite/

Este artículo procede del cuenta oficial de WeChat "Qubit", autor: Tecnología de vanguardia

热门币种推荐

相关问答

Q¿Cuál es el nombre del nuevo modelo de generación de imágenes ultra rápido de Google y cuánto tiempo tarda en generar una imagen?

AEl nuevo modelo se llama Nano Banana 2 Lite (también conocido como gemini-3.1-flash-lite-image) y tarda aproximadamente 4 segundos en generar una imagen.

Q¿Cuáles son las cuatro capacidades clave del modelo Gemini Omni Flash recién lanzado?

ALas cuatro capacidades clave son: 1) Edición de video conversacional, 2) Referencia multimodal, 3) Conocimiento del mundo real integrado de Gemini, y 4) Sincronización de texto y acción.

Q¿Qué dos modelos presentados en el artículo pueden combinarse para crear un flujo de trabajo de imagen a video?

ALos modelos Nano Banana 2 Lite (para generar imágenes rápidamente) y Gemini Omni Flash (para convertir esas imágenes en video) pueden combinarse para un flujo de trabajo sin problemas desde la imagen hasta el video.

Q¿Para qué tipo de aplicaciones está diseñado específicamente el modelo Nano Banana 2 Lite según el artículo?

ANano Banana 2 Lite está diseñado específicamente para aplicaciones en tiempo real sensibles a la latencia que requieren procesar grandes volúmenes de imágenes en poco tiempo, como la generación masiva de material para comercio electrónico, la iteración rápida de creatividades publicitarias y tuberías de contenido automatizadas.

QEl artículo menciona que Google también presentó tres aplicaciones de demostración (Demos) para mostrar el flujo de trabajo combinado. Nombra una de ellas y describe brevemente su función.

AUna de las demos se llama 'Anywhere'. Permite al usuario subir una selfie o foto, usar Nano Banana 2 Lite para colocarla digitalmente en varios puntos de referencia famosos, y luego, con un clic, usar Gemini Omni Flash para transformar esa imagen estática en un video corto y dinámico, ofreciendo una experiencia de 'viaje cibernético'.

你可能也喜欢

山寨币市场大玩家在全面上涨行情中如此操作!

随着加密货币市场牛市趋势增强,大型投资者(鲸鱼)的交易活动备受关注。区块链数据显示,涉及比特币($BTC)、以太坊($ETH)和Hyperliquid($HYPE)的数亿美元头寸被开立或平仓。 一位据信与Matrixport相关的大型投资者平仓了价值约1.005亿美元的40,000 $ETH多头头寸,获利990万美元。据悉,该投资者仍持有价值约2.01亿美元的80,000 $ETH和价值3900万美元的500 $BTC多头头寸,未实现利润约为2290万美元。该投资者此前累计亏损9250万美元,得益于近期交易,其头寸已转为约3280万美元的盈利。 在Hyperliquid平台上,名为loracle.hl的大型投资者在过去三个月因$HYPE交易亏损超过7000万美元。目前,该投资者持有约685,744份$HYPE空头头寸,价值约5488万美元。据称,若$HYPE价格上涨至101.15美元,这些头寸可能面临清算。 常因高杠杆交易见诸报端的Machi Big Brother也从近期上涨中获利。据报道,这位曾经历约500次清算的投资者,在短短三天内将资产从15.2万美元增至1272万美元,估计获利超过1250万美元。 尽管$HYPE创下历史新高,Multicoin Capital的代币转移也引起市场注意。据报道,过去三天该公司共向Coinbase Prime存入427,422 $HYPE,总值约3174万美元。如此大量的代币转入机构交易平台,引发市场对其可能进行抛售或投资组合管理的猜测。 一笔比特币交易中,一位匿名大额投资者的抛售行为尤为突出。该“鲸鱼”在最近一笔交易中出售了约2700 $BTC,价值约2.118亿美元。至此,其在三天内共售出7700 $BTC,总价值约5.766亿美元。 *本文不构成投资建议。

cryptonews.ru22分钟前

山寨币市场大玩家在全面上涨行情中如此操作!

cryptonews.ru22分钟前

富达警示:AI代理的繁荣,未必是公链的盛宴

富达数字资产发布分析,对“AI代理必然推动公链繁荣”的流行叙事提出警示。报告指出,从“AI代理需要支付和身份”推导出“公链代币价值增长”至少存在三层过度假设:AI代理未必需要在公链结算;链上结算不一定发生在无需许可的公共网络;网络经济活动未必能有效传导至原生代币。 报告详细阐述了六大风险:首先,企业AI代理可能更倾向使用成本低、稳定可控的封闭系统,而非公共区块链。其次,即使链上交易量因AI微支付增加,若以稳定币结算为主,价值可能被支付层捕获,而非公链代币。第三,AI降低开发门槛可能导致应用供给过剩,代码数量不等于经济价值,竞争将转向用户、品牌等非技术壁垒。第四,技术优势因AI工具普及而稀缺性下降。第五,AI在提升开发效率的同时,也可能降低攻击成本,加剧安全风险。第六,金融机构更需要具备身份、权限和合规控制的“可控区块链”,而非完全开放的网络。 富达的核心观点是,AI与区块链的结合存在潜力,但市场不应将两条赛道简单等同。关键问题在于,哪些基础设施能真正承接AI经济的真实需求并将其转化为可持续的商业价值,而非简单地认为AI增长会自动转化为公链的繁荣。叙事需要从“讲故事”转向务实“算账”。

marsbit1小时前

富达警示:AI代理的繁荣,未必是公链的盛宴

marsbit1小时前

Telegram 推出 WEB-代理技术:将流量伪装成普通网站访问

2026年8月21日,Telegram推出了一项名为WEB-代理的全新实验性反封锁技术。该技术通过WebView,将Messenger的MTProxy流量伪装成普通的HTTPS或WebSocket网站访问数据,使其在传输过程中与合法网络浏览行为无异,为用户在受限环境下访问服务提供了新途径。 其核心原理是:客户端应用利用内置浏览器引擎,将多个加密的逻辑连接复用并封装成单一Web会话,外部观察如同加载网页。服务器端的转发器接收此流并将其分离还原给标准MTProxy,全程不解密内容或知晓最终目的地,保障了隐私。代理运行于普通的HTTPS域名上,该域名同时正常提供公开网站;只有携带特定计算参数(基于配置通过HMAC-SHA256生成)的精确请求才会激活代理桥接页面,普通访问者看到的是常规主页,有效规避自动检测。 目前该技术处于概念验证阶段,已有桌面版和实验性Android客户端,并计划支持iOS。统一的技术栈便于测试和发展。这项技术标志着抗审查手段正转向更复杂地融入合法网络基础设施,利用标准浏览器机制和安全协议,增加了流量过滤系统区分的难度。其长期价值将取决于其对抗自适应流量分析的能力以及在不损失性能下的扩展性。从技术演进看,此方案与此前受CDN限制的“域名前置”技术有相似逻辑,体现了封锁与反封锁技术之间持续循环的博弈。

cryptonews.ru1小时前

Telegram 推出 WEB-代理技术:将流量伪装成普通网站访问

cryptonews.ru1小时前

交易

现货

热门文章

如何购买4

欢迎来到HTX.com!我们已经让购买4(4)变得简单而便捷。跟随我们的逐步指南,放心开始您的加密货币之旅。第一步:创建您的HTX账户使用您的电子邮件、手机号码注册一个免费账户在HTX上。体验无忧的注册过程并解锁所有平台功能。立即注册第二步:前往买币页面,选择您的支付方式信用卡/借记卡购买:使用您的Visa或Mastercard即时购买4(4)。余额购买:使用您HTX账户余额中的资金进行无缝交易。第三方购买:探索诸如Google Pay或Apple Pay等流行支付方法以增加便利性。C2C购买:在HTX平台上直接与其他用户交易。HTX场外交易台(OTC)购买:为大量交易者提供个性化服务和竞争性汇率。第三步:存储您的4(4)购买完您的4(4)后,将其存储在您的HTX账户钱包中。您也可以通过区块链转账将其发送到其他地方或者用于交易其他加密货币。第四步:交易4(4)在HTX的现货市场轻松交易4(4)。访问您的账户,选择您的交易对,执行您的交易,并实时监控。HTX为初学者和经验丰富的交易者提供了友好的用户体验。

1.8k人学过发布于 2025.10.20更新于 2026.06.02

如何购买4

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对4(4)币价的意见。

活动图片