La versión en vídeo de Nano Banana ya está aquí: con conocimiento del mundo Gemini incorporado, generar imágenes con el plátano original solo tarda 4 segundos

marsbitXuất bản vào 2026-07-01Cập nhật gần nhất vào 2026-07-01

Tóm tắt

Google ha lanzado dos nuevos modelos multimodales: **Gemini Omni Flash** y **Nano Banana 2 Lite**. **Gemini Omni Flash** es un modelo de generación y edición de video que combina la capacidad de razonamiento multimodal de Gemini con la creación de contenido visual. Permite generar videos de hasta 10 segundos mediante instrucciones de lenguaje natural, utilizando referencias de texto, imagen o video. Sus características clave incluyen edición conversacional, integración de conocimientos del mundo real y sincronización de texto con acción. Su costo es competitivo, a 0.10 USD por segundo de video. **Nano Banana 2 Lite** (gemini-3.1-flash-lite-image) es un modelo optimizado para generar imágenes a alta velocidad y bajo costo. Puede crear una imagen de resolución 1K en aproximadamente **4 segundos**, por un precio de unos **0.034 USD**, lo que lo hace ideal para aplicaciones en tiempo real como comercio electrónico o publicidad. Mantiene una buena calidad en la generación y representación de texto. La verdadera potencia, según Google, reside en combinar ambos modelos. Un flujo de trabajo típico sería generar rápidamente una imagen con Nano Banana 2 Lite y luego usarla como referencia para que Gemini Omni Flash la transforme en un video dinámico. Se presentaron tres demostraciones de esta sinergia: "Anywhere" (para crear videos de viaje a partir de una selfie), "Space Lift" (para visualizar propuestas de diseño de interiores) y "Omni Product Studio" (para generar material public...

Si bien "Coding" aún es un desastre, Google sí que tiene sus cartas bajo la manga en lo que a "multimodalidad" se refiere.

Gemini Omni Flash ya está abierto oficialmente a través de API, la versión en vídeo de Nano Banana.

Dejar de soñar con que los "muggles" rehagan "Harry Potter". Observemos estos cuatro trucos de magia digital que Google realiza con Gemini Omni:

Es una locura, esta coherencia y claridad de texto, ¿para qué necesitas croma y efectos? Se podría hacer una transmisión en directo del Doctor Strange directamente.

Mientras tanto, el tan esperado "plátano", también recibe su versión "a velocidad de la luz".

Nano Banana 2 Lite: el modelo de imagen Gemini más rápido y económico hasta la fecha.

Sin exagerar: genera una imagen en 4 segundos, una imagen en resolución 1K cuesta solo alrededor de 0.20 yuanes.

Comparado con Nano Banana 2, esta velocidad es simplemente despegue.

Por no hablar de GPT Image 2, que tarda 3 minutos en generar una imagen...

Con razón no ha salido Gemini 3.5 Pro en tanto tiempo, ¡¡parece que todo el tiempo se ha invertido en la multimodalidad tan ansiada, Hassabis!!

Gemini Omni Flash

Gemini Omni Flash, presentado por primera vez en Google I/O 2026, combina las capacidades de razonamiento multimodal de Gemini con la generación y edición de vídeo, lo que despertó gran interés en su momento.

Ahora, este modelo ya está disponible oficialmente para desarrolladores a través de Gemini API y Google AI Studio. Puede generar y editar vídeos de alta calidad fácilmente basándose en múltiples entradas como texto, imágenes y vídeo.

Cuatro capacidades clave:

Edición conversacional de vídeo: modificar y perfeccionar vídeos con lenguaje natural, como editar un documento en Lark.

Referencia multimodal: combinar entradas de imagen, texto y vídeo, manteniendo el control y la coherencia de la escena.

Conocimiento del mundo real: aprovechar los conocimientos de Gemini en historia, biología, lógica narrativa, etc., para construir vídeos, sin necesidad de escribir tres páginas de prompt describiendo estilos arquitectónicos.

Sincronización de texto y acción: conectar texto y gráficos directamente a la acción del vídeo mediante prompts simples.

El precio también es competitivo: el coste por segundo de salida de vídeo es de 0.10 dólares, igual que Veo 3.1 Fast.

En cuanto al posicionamiento, siendo también un modelo de generación de vídeo ligero, Omni Flash enfatiza más el conocimiento mundial de Gemini, y su ecosistema también está totalmente orientado hacia la capa Gemini.

Sin embargo, Google también es bastante franco, y enumera activamente una serie de limitaciones actuales:

1. Actualmente solo admite la generación de vídeos de 10 segundos, se admitirán duraciones más largas posteriormente;

2. Por ahora no admite la carga de referencias de audio ni la expansión de escenas;

3. La API admite vídeos de hasta 3 segundos como material de referencia, pero el modelo aún no puede procesar correctamente este tipo de entrada;

4. Aún hay limitaciones en la coherencia de los personajes al cambiar de escena o usar movimientos de cámara.

Nano Banana 2 Lite

Nano Banana 2 Lite (también conocido como gemini-3.1-flash-lite-image) está diseñado específicamente para un procesamiento ultrarrápido.

Optimizado de manera específica, apunta a aquellos escenarios de aplicaciones en tiempo real extremadamente sensibles a la latencia y que requieren procesar grandes volúmenes de imágenes en poco tiempo, como la generación masiva de material para e-commerce, la iteración rápida de creatividades publicitarias o las líneas de producción automatizadas de contenido.

Dos puntos clave de venta:

Velocidad de la luz: latencia de generación de imagen de unos 4 segundos, una quinta parte de Nano Banana 2 (que tarda unos 20 segundos).

Precio de ganga: una imagen en 1K cuesta solo unos 0.034 dólares, la mitad que Nano Banana 2 y una cuarta parte que Nano Banana Pro.

Se redujo la velocidad y el precio, pero las capacidades de generación y edición de imágenes no se redujeron significativamente. Nano Banana 2 Lite aún mantiene un efecto de renderizado de texto excelente, situándose al mismo nivel que modelos como Grok en los benchmarks.

Por lo tanto, la recomendación de Google es: si todavía estás usando la primera generación de Nano Banana por ser barata, cámbiala ya. La versión Lite supera a la original en todos los indicadores clave.

Combinación de dos espadas

Espera, no te vayas todavía.

Se pensaba que esto solo era el lanzamiento de dos modelos en paralelo, pero Google indica: hay un truco nuevo.

La verdadera magia reside en conectar estos modelos en cadena para su uso.

Como es sabido, la creación con AIGC requiere iteraciones repetidas y la gestión del material es bastante engorrosa.

Ahora, con estos dos modelos, finalmente no es necesario cargar archivos repetidamente, la generación de imágenes y la creación de vídeos se conectan sin problemas.

Concretamente, se puede usar primero Nano Banana 2 Lite para generar imágenes a alta velocidad, y luego alimentar las imágenes generadas como material de referencia a Gemini Omni Flash, transformándolas en vídeo con un clic.

Para mostrar esta magia de 1+1>2 en el flujo de trabajo, Google incluso desarrolló 3 aplicaciones demo:

1. Anywhere (Cualquier lugar)

Tómate un selfie o sube una foto, NB2 Lite te "photoshopea" instantáneamente en docenas de lugares emblemáticos.

Luego haz clic en la imagen y Omni Flash transforma el lugar estático en un clip dinámico.

El turismo cibernético también se convierte en un proceso integral ahora.

2. Space Lift (Elevador espacial)

Esto da un poco de miedo, parece que combinándolo con el modelo mundial Genie, en el futuro podría amenazar a muchas empresas de SaaS tradicionales de soluciones de decoración.

Sube una foto de una habitación, NB2 Lite genera primero varios estilos de decoración. Encuentra el que te guste, pulsa el botón de vídeo y Omni puede directamente darte un recorrido cinematográfico por el espacio.

3. Omni product studio (Estudio de producto Omni)

Una buena noticia para el comercio transfronterizo electrónico.

Toma una foto de tu producto sobre fondo blanco, NB2 Lite genera varias imágenes del producto en diferentes escenarios, y Omni Flash transforma la imagen estática en un vídeo corto para e-commerce.

De "producto" a "material publicitario", toda la cadena se ejecuta automáticamente.

Entonces, ¿para qué sirve realmente la multimodalidad?

Seguro que Google ha escuchado esta pregunta innumerables veces.

Sobre todo en 2026, donde "Coding" equivale prácticamente al coeficiente intelectual del modelo. Todas las empresas compiten a muerte en Coding.

¿Qué se persigue obsesionándose con la multimodalidad?

Dejemos de lado la narrativa de la AGI. A corto plazo, este conjunto de modelos multimodales de Google realmente puede potenciar muchos de sus productos.

No profundizaremos en la narrativa de la AGI. A corto plazo, este conjunto de modelos multimodales de Google realmente puede potenciar muchos de sus productos: Stitch es uno, el retoque de fotos incorporado en Pixel es otro, y el surgimiento de Notebook LM también fue bastante impresionante.

Los dos nuevos modelos lanzados esta vez permiten ver más potencial de aplicación de la multimodalidad en escenarios verticales. Comercio electrónico, decoración, vídeos cortos... la demanda en estos negocios es real, y el dinero también.

Sumado al respaldo del ecosistema Android, básicamente no hay que preocuparse demasiado por la comercialización.

Google puede que no alcance en Coding por ahora, pero en la mesa de juego de la multimodalidad, Google podría ser el único jugador capaz de formar una mano completa.

Sin embargo...

¡¡¡¿Cuándo va a llegar Gemni 3.5 Pro?!!!

Referencias:[1]https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-flash-nano-banana-2-lite/

Este artículo procede del cuenta oficial de WeChat "Qubit", autor: Tecnología de vanguardia

Tiền kỹ thuật số thịnh hành

Câu hỏi Liên quan

Q¿Cuál es el nombre del nuevo modelo de generación de imágenes ultra rápido de Google y cuánto tiempo tarda en generar una imagen?

AEl nuevo modelo se llama Nano Banana 2 Lite (también conocido como gemini-3.1-flash-lite-image) y tarda aproximadamente 4 segundos en generar una imagen.

Q¿Cuáles son las cuatro capacidades clave del modelo Gemini Omni Flash recién lanzado?

ALas cuatro capacidades clave son: 1) Edición de video conversacional, 2) Referencia multimodal, 3) Conocimiento del mundo real integrado de Gemini, y 4) Sincronización de texto y acción.

Q¿Qué dos modelos presentados en el artículo pueden combinarse para crear un flujo de trabajo de imagen a video?

ALos modelos Nano Banana 2 Lite (para generar imágenes rápidamente) y Gemini Omni Flash (para convertir esas imágenes en video) pueden combinarse para un flujo de trabajo sin problemas desde la imagen hasta el video.

Q¿Para qué tipo de aplicaciones está diseñado específicamente el modelo Nano Banana 2 Lite según el artículo?

ANano Banana 2 Lite está diseñado específicamente para aplicaciones en tiempo real sensibles a la latencia que requieren procesar grandes volúmenes de imágenes en poco tiempo, como la generación masiva de material para comercio electrónico, la iteración rápida de creatividades publicitarias y tuberías de contenido automatizadas.

QEl artículo menciona que Google también presentó tres aplicaciones de demostración (Demos) para mostrar el flujo de trabajo combinado. Nombra una de ellas y describe brevemente su función.

AUna de las demos se llama 'Anywhere'. Permite al usuario subir una selfie o foto, usar Nano Banana 2 Lite para colocarla digitalmente en varios puntos de referencia famosos, y luego, con un clic, usar Gemini Omni Flash para transformar esa imagen estática en un video corto y dinámico, ofreciendo una experiencia de 'viaje cibernético'.

Nội dung Liên quan

Fidelity cảnh báo: Sự bùng nổ của đại lý AI không hẳn là bữa tiệc của chuỗi công khai

Tác giả QQLink, thông qua báo cáo của Fidelity Digital Assets, cảnh báo rằng sự phát triển của AI agent (tác nhân AI) không tự động đồng nghĩa với sự thịnh vượng của các blockchain công cộng. Bài viết chỉ ra sáu rủi ro chính trong lập luận đầu tư phổ biến. Thứ nhất, AI agent có thể không cần blockchain công cộng. Các doanh nghiệp có thể ưu tiên hệ thống khép kín vì lý do tốc độ, chi phí, ổn định và quy định, thay vì tính mở. Thứ hai, ngay cả khi giao dịch trên chuỗi tăng, giá trị token gốc có thể không hưởng lợi nếu thanh toán chủ yếu dùng stablecoin và giá trị bị các lớp trung gian như nhà phát hành stablecoin nắm giữ. Thứ ba, AI giúp giảm chi phí phát triển và tăng số lượng dự án, nhưng điều này không đảm bảo nhu cầu thực tế hoặc giá trị kinh tế, và có thể dẫn đến cạnh tranh khốc liệt hơn về người dùng và thương hiệu. Thứ tư, lợi thế công nghệ trở nên khan hiếm hơn khi AI có thể sao chép mã nhanh chóng, khiến các yếu tố như niềm tin và hệ sinh thái trở nên quan trọng hơn. Thứ năm, AI cũng có thể làm giảm chi phí tấn công, khiến việc tìm kiếm lỗ hổng dễ dàng hơn, làm tăng rủi ro bảo mật nếu cơ sở hạ tầng an ninh không theo kịp. Cuối cùng, các tổ chức tài chính lớn có thể cần các blockchain "có thể kiểm soát" với khả năng xác thực, quản lý quyền và tuân thủ, thay vì mạng công cộng hoàn toàn mở. Tóm lại, Fidelity nhắc nhở thị trường không nên đơn giản cộng hai câu chuyện AI và blockchain lại. Cần xem xét kỹ lưỡng từng bước trong chuỗi giá trị: liệu nhu cầu thực sự có chuyển thành hoạt động trên chuỗi công cộng không, và giá trị được tạo ra sẽ được nắm bắt ở đâu. Câu hỏi then chốt không phải là AI có "cứu" blockchain công cộng hay không, mà là cơ sở hạ tầng nào có thể đáp ứng nhu cầu thực và biến nó thành giá trị thương mại bền vững.

marsbit1 giờ trước

Fidelity cảnh báo: Sự bùng nổ của đại lý AI không hẳn là bữa tiệc của chuỗi công khai

marsbit1 giờ trước

Sau chuyến khảo sát tại Thung lũng Silicon, nhận định từ Goldman Sachs: Agent bước vào thời đại thực thi, cạnh tranh AI chuyển hướng sang luồng công việc, Mô hình Thế giới trỗi dậy

AI đang bước vào giai đoạn mới: từ "biết trả lời" tiến tới "có thể thực thi". Báo cáo mới nhất từ Goldman Sachs chỉ ra rằng thương mại hóa AI đang chuyển từ mô hình đăng ký theo chỗ ngồi sang định giá dựa trên mức tiêu thụ, khối lượng giao dịch và kết quả. Đồng thời, Agent (tác nhân AI) đang phát triển từ công cụ hỗ trợ trở thành người thực thi quy trình làm việc, và giá trị ngành dịch chuyển từ chính mô hình sang dữ liệu độc quyền, ngữ cảnh nghiệp vụ và năng lực chuyên môn lĩnh vực. Cuộc cạnh tranh trong ngành AI đang chuyển hướng từ "mô hình của ai mạnh hơn" sang "ai thực sự làm chủ được quy trình công việc". Khả năng triển khai vào môi trường sản xuất, hiểu ngữ cảnh nghiệp vụ và hoàn thành nhiệm vụ ổn định trở thành rào cản cạnh tranh quan trọng hơn. Trong quá trình triển khai Agent quy mô lớn, trở ngại lớn nhất không còn là năng lực mô hình mà là tính "có thể kiểm soát", bao gồm phân định trách nhiệm và khả năng kiểm soát toàn bộ quá trình thực thi. Các quy trình làm việc dễ tự động hóa nhất thường có ranh giới quyết định rõ ràng, kết quả có thể xác minh và lỗi có thể khôi phục. Thị trường mô hình AI dự kiến sẽ hình thành sự phân công rõ ràng: các mô hình tiên phong (frontier models) đảm nhận nhiệm vụ phức tạp có giá trị và độ tin cậy cao, còn các mô hình mã nguồn mở đảm nhiệm phần lớn nhiệm vụ tiêu chuẩn hóa và tiêu thụ token. Một quỹ đầu tư mạo hiểm dự đoán khoảng 90% token suy luận sẽ chảy về mô hình mã nguồn mở trong 12-18 tháng tới. Xu hướng nghiên cứu đang dịch chuyển từ LLM sang "mô hình thế giới" (world models), đòi hỏi hiểu biết về môi trường, quan hệ nhân quả và tương tác động trong thế giới thực, làm tăng tầm quan trọng của dữ liệu độc quyền. Khi AI tiến sâu hơn từ thế giới số sang thế giới vật lý, nhu cầu về năng lực tính toán cho đào tạo, mô phỏng và suy luận mô hình dự kiến sẽ tạo ra một đường cong tăng trưởng mới. Goldman Sachs dự báo nhu cầu năng lực tính toán có thể tăng gấp 24 lần trong 5 năm tới.

marsbit1 giờ trước

Sau chuyến khảo sát tại Thung lũng Silicon, nhận định từ Goldman Sachs: Agent bước vào thời đại thực thi, cạnh tranh AI chuyển hướng sang luồng công việc, Mô hình Thế giới trỗi dậy

marsbit1 giờ trước

Telegram giới thiệu công nghệ WEB-proxy: Ngụy trang lưu lượng truy cập thành các trang web thông thường

Telegram đã giới thiệu công nghệ WEB-proxy thử nghiệm vào ngày 21/8/2026, một phương pháp vượt tường lửa mới cho Telegram Desktop. Công nghệ này ngụy trang lưu lượng truy cập của ứng dụng nhắn tin giống như việc duyệt web thông thường qua kết nối HTTPS an toàn. WEB-proxy hoạt động bằng cách truyền dữ liệu MTProxy thông qua WebView (HTTPS hoặc WebSocket), tạo ra một luồng dữ liệu không thể phân biệt với lưu lượng web hợp pháp. Các kết nối logic của Telegram được đóng gói vào một kênh duy nhất. Một máy chủ chuyển tiếp sẽ phân tách luồng này và chuyển tiếp đến proxy MTProxy tiêu chuẩn mà không giải mã nội dung. Một điểm đặc biệt là WEB-proxy hoạt động trên một tên miền HTTPS thông thường vẫn phục vụ một trang web công cộng đầy đủ. Trang cầu nối proxy chỉ được kích hoạt với một tham số URL cụ thể, còn tất cả các yêu cầu khác đều nhận được trang web bình thường, tạo ra vỏ bọc hoàn hảo. Hiện tại, công nghệ này đang trong giai đoạn thử nghiệm với phiên bản cho desktop, một phiên bản thử nghiệm cho Android và kế hoạch hỗ trợ iOS. Sự phát triển của WEB-proxy cho thấy xu hướng tích hợp tinh vi hơn với cơ sở hạ tầng web hợp pháp, khiến các hệ thống lọc nội dung khó phân biệt và phải đối mặt với lựa chọn giữa chặn toàn bộ lưu lượng HTTPS hoặc cho phép dịch vụ hoạt động.

cryptonews.ru1 giờ trước

Telegram giới thiệu công nghệ WEB-proxy: Ngụy trang lưu lượng truy cập thành các trang web thông thường

cryptonews.ru1 giờ trước

Justin Sun tuyên chiến với altcoin: 'Nó đóng băng tài sản người dùng thông qua tính năng ẩn'

Justin Sun tuyên bố rằng stablecoin $USD1 của World Liberty Financial có chứa "tính năng backdoor" cho phép đóng băng hoặc tiêu hủy tài sản người dùng. Trong một tuyên bố trên X, ông cho biết đã ngăn thành công nỗ lực của công ty này đưa vụ việc ra trọng tài riêng và khẳng định vụ kiện sẽ tiếp tục được xét xử công khai tại tòa án liên bang California. Sun tiết lộ rằng trong quá trình tố tụng, ông phát hiện $USD1 có cơ chế ủy quyền tương tự, cho phép World Liberty kiểm soát tài sản người dùng bất cứ lúc nào. Ông cảnh báo người dùng $USD1 về rủi ro lớn này, đặc biệt trong mô hình stablecoin tập trung, và cáo buộc World Liberty đã sẵn sàng sử dụng quyền lực tương tự với chủ sở hữu token WLFI trước đây. Ông cũng đặt câu hỏi về tình hình tài chính của World Liberty, cho rằng khoản dự trữ khoảng 4 tỷ USD của $USD1 thuộc về người dùng và không thể dùng để thanh toán các khoản nợ tiềm tàng hàng trăm triệu USD của công ty. Sun tuyên bố không thấy bằng chứng nào cho thấy World Liberty có đủ vốn để đáp ứng các nghĩa vụ pháp lý, ngoài khoản dự trữ 1:1, và kêu gọi nhà đầu tư "cực kỳ thận trọng". Cho đến nay, World Liberty Financial chưa có phản hồi chính thức về các cáo buộc này. Tất cả tuyên bố của Sun vẫn chỉ là cáo buộc chưa được chứng minh.

cryptonews.ru2 giờ trước

Justin Sun tuyên chiến với altcoin: 'Nó đóng băng tài sản người dùng thông qua tính năng ẩn'

cryptonews.ru2 giờ trước

Giao dịch

Giao ngay

Bài viết Nổi bật

Làm thế nào để Mua 4

Chào mừng bạn đến với HTX.com! Chúng tôi đã làm cho mua 4 (4) trở nên đơn giản và thuận tiện. Làm theo hướng dẫn từng bước của chúng tôi để bắt đầu hành trình tiền kỹ thuật số của bạn.Bước 1: Tạo Tài khoản HTX của BạnSử dụng email hoặc số điện thoại của bạn để đăng ký tài khoản miễn phí trên HTX. Trải nghiệm hành trình đăng ký không rắc rối và mở khóa tất cả tính năng. Nhận Tài khoản của tôiBước 2: Truy cập Mua Crypto và Chọn Phương thức Thanh toán của BạnThẻ Tín dụng/Ghi nợ: Sử dụng Visa hoặc Mastercard của bạn để mua 4 (4) ngay lập tức.Số dư: Sử dụng tiền từ số dư tài khoản HTX của bạn để giao dịch liền mạch.Bên thứ ba: Chúng tôi đã thêm những phương thức thanh toán phổ biến như Google Pay và Apple Pay để nâng cao sự tiện lợi.P2P: Giao dịch trực tiếp với người dùng khác trên HTX.Thị trường mua bán phi tập trung (OTC): Chúng tôi cung cấp những dịch vụ được thiết kế riêng và tỷ giá hối đoái cạnh tranh cho nhà giao dịch.Bước 3: Lưu trữ 4 (4) của BạnSau khi mua 4 (4), lưu trữ trong tài khoản HTX của bạn. Ngoài ra, bạn có thể gửi đi nơi khác qua chuyển khoản blockchain hoặc sử dụng để giao dịch những tiền kỹ thuật số khác.Bước 4: Giao dịch 4 (4)Giao dịch 4 (4) dễ dàng trên thị trường giao ngay của HTX. Chỉ cần truy cập vào tài khoản của bạn, chọn cặp giao dịch, thực hiện giao dịch và theo dõi trong thời gian thực. Chúng tôi cung cấp trải nghiệm thân thiện với người dùng cho cả người mới bắt đầu và người giao dịch dày dạn kinh nghiệm.

Tổng lượt xem 801Xuất bản vào 2025.10.20Cập nhật vào 2026.06.02

Làm thế nào để Mua 4

Thảo luận

Chào mừng đến với Cộng đồng HTX. Tại đây, bạn có thể được thông báo về những phát triển nền tảng mới nhất và có quyền truy cập vào thông tin chuyên sâu về thị trường. Ý kiến ​​của người dùng về giá của 4 (4) được trình bày dưới đây.

活动图片