La versión en vídeo de Nano Banana ya está aquí: con conocimiento del mundo Gemini incorporado, generar imágenes con el plátano original solo tarda 4 segundos

marsbitDipublikasikan tanggal 2026-07-01Terakhir diperbarui pada 2026-07-01

Abstrak

Google ha lanzado dos nuevos modelos multimodales: **Gemini Omni Flash** y **Nano Banana 2 Lite**. **Gemini Omni Flash** es un modelo de generación y edición de video que combina la capacidad de razonamiento multimodal de Gemini con la creación de contenido visual. Permite generar videos de hasta 10 segundos mediante instrucciones de lenguaje natural, utilizando referencias de texto, imagen o video. Sus características clave incluyen edición conversacional, integración de conocimientos del mundo real y sincronización de texto con acción. Su costo es competitivo, a 0.10 USD por segundo de video. **Nano Banana 2 Lite** (gemini-3.1-flash-lite-image) es un modelo optimizado para generar imágenes a alta velocidad y bajo costo. Puede crear una imagen de resolución 1K en aproximadamente **4 segundos**, por un precio de unos **0.034 USD**, lo que lo hace ideal para aplicaciones en tiempo real como comercio electrónico o publicidad. Mantiene una buena calidad en la generación y representación de texto. La verdadera potencia, según Google, reside en combinar ambos modelos. Un flujo de trabajo típico sería generar rápidamente una imagen con Nano Banana 2 Lite y luego usarla como referencia para que Gemini Omni Flash la transforme en un video dinámico. Se presentaron tres demostraciones de esta sinergia: "Anywhere" (para crear videos de viaje a partir de una selfie), "Space Lift" (para visualizar propuestas de diseño de interiores) y "Omni Product Studio" (para generar material public...

Si bien "Coding" aún es un desastre, Google sí que tiene sus cartas bajo la manga en lo que a "multimodalidad" se refiere.

Gemini Omni Flash ya está abierto oficialmente a través de API, la versión en vídeo de Nano Banana.

Dejar de soñar con que los "muggles" rehagan "Harry Potter". Observemos estos cuatro trucos de magia digital que Google realiza con Gemini Omni:

Es una locura, esta coherencia y claridad de texto, ¿para qué necesitas croma y efectos? Se podría hacer una transmisión en directo del Doctor Strange directamente.

Mientras tanto, el tan esperado "plátano", también recibe su versión "a velocidad de la luz".

Nano Banana 2 Lite: el modelo de imagen Gemini más rápido y económico hasta la fecha.

Sin exagerar: genera una imagen en 4 segundos, una imagen en resolución 1K cuesta solo alrededor de 0.20 yuanes.

Comparado con Nano Banana 2, esta velocidad es simplemente despegue.

Por no hablar de GPT Image 2, que tarda 3 minutos en generar una imagen...

Con razón no ha salido Gemini 3.5 Pro en tanto tiempo, ¡¡parece que todo el tiempo se ha invertido en la multimodalidad tan ansiada, Hassabis!!

Gemini Omni Flash

Gemini Omni Flash, presentado por primera vez en Google I/O 2026, combina las capacidades de razonamiento multimodal de Gemini con la generación y edición de vídeo, lo que despertó gran interés en su momento.

Ahora, este modelo ya está disponible oficialmente para desarrolladores a través de Gemini API y Google AI Studio. Puede generar y editar vídeos de alta calidad fácilmente basándose en múltiples entradas como texto, imágenes y vídeo.

Cuatro capacidades clave:

Edición conversacional de vídeo: modificar y perfeccionar vídeos con lenguaje natural, como editar un documento en Lark.

Referencia multimodal: combinar entradas de imagen, texto y vídeo, manteniendo el control y la coherencia de la escena.

Conocimiento del mundo real: aprovechar los conocimientos de Gemini en historia, biología, lógica narrativa, etc., para construir vídeos, sin necesidad de escribir tres páginas de prompt describiendo estilos arquitectónicos.

Sincronización de texto y acción: conectar texto y gráficos directamente a la acción del vídeo mediante prompts simples.

El precio también es competitivo: el coste por segundo de salida de vídeo es de 0.10 dólares, igual que Veo 3.1 Fast.

En cuanto al posicionamiento, siendo también un modelo de generación de vídeo ligero, Omni Flash enfatiza más el conocimiento mundial de Gemini, y su ecosistema también está totalmente orientado hacia la capa Gemini.

Sin embargo, Google también es bastante franco, y enumera activamente una serie de limitaciones actuales:

1. Actualmente solo admite la generación de vídeos de 10 segundos, se admitirán duraciones más largas posteriormente;

2. Por ahora no admite la carga de referencias de audio ni la expansión de escenas;

3. La API admite vídeos de hasta 3 segundos como material de referencia, pero el modelo aún no puede procesar correctamente este tipo de entrada;

4. Aún hay limitaciones en la coherencia de los personajes al cambiar de escena o usar movimientos de cámara.

Nano Banana 2 Lite

Nano Banana 2 Lite (también conocido como gemini-3.1-flash-lite-image) está diseñado específicamente para un procesamiento ultrarrápido.

Optimizado de manera específica, apunta a aquellos escenarios de aplicaciones en tiempo real extremadamente sensibles a la latencia y que requieren procesar grandes volúmenes de imágenes en poco tiempo, como la generación masiva de material para e-commerce, la iteración rápida de creatividades publicitarias o las líneas de producción automatizadas de contenido.

Dos puntos clave de venta:

Velocidad de la luz: latencia de generación de imagen de unos 4 segundos, una quinta parte de Nano Banana 2 (que tarda unos 20 segundos).

Precio de ganga: una imagen en 1K cuesta solo unos 0.034 dólares, la mitad que Nano Banana 2 y una cuarta parte que Nano Banana Pro.

Se redujo la velocidad y el precio, pero las capacidades de generación y edición de imágenes no se redujeron significativamente. Nano Banana 2 Lite aún mantiene un efecto de renderizado de texto excelente, situándose al mismo nivel que modelos como Grok en los benchmarks.

Por lo tanto, la recomendación de Google es: si todavía estás usando la primera generación de Nano Banana por ser barata, cámbiala ya. La versión Lite supera a la original en todos los indicadores clave.

Combinación de dos espadas

Espera, no te vayas todavía.

Se pensaba que esto solo era el lanzamiento de dos modelos en paralelo, pero Google indica: hay un truco nuevo.

La verdadera magia reside en conectar estos modelos en cadena para su uso.

Como es sabido, la creación con AIGC requiere iteraciones repetidas y la gestión del material es bastante engorrosa.

Ahora, con estos dos modelos, finalmente no es necesario cargar archivos repetidamente, la generación de imágenes y la creación de vídeos se conectan sin problemas.

Concretamente, se puede usar primero Nano Banana 2 Lite para generar imágenes a alta velocidad, y luego alimentar las imágenes generadas como material de referencia a Gemini Omni Flash, transformándolas en vídeo con un clic.

Para mostrar esta magia de 1+1>2 en el flujo de trabajo, Google incluso desarrolló 3 aplicaciones demo:

1. Anywhere (Cualquier lugar)

Tómate un selfie o sube una foto, NB2 Lite te "photoshopea" instantáneamente en docenas de lugares emblemáticos.

Luego haz clic en la imagen y Omni Flash transforma el lugar estático en un clip dinámico.

El turismo cibernético también se convierte en un proceso integral ahora.

2. Space Lift (Elevador espacial)

Esto da un poco de miedo, parece que combinándolo con el modelo mundial Genie, en el futuro podría amenazar a muchas empresas de SaaS tradicionales de soluciones de decoración.

Sube una foto de una habitación, NB2 Lite genera primero varios estilos de decoración. Encuentra el que te guste, pulsa el botón de vídeo y Omni puede directamente darte un recorrido cinematográfico por el espacio.

3. Omni product studio (Estudio de producto Omni)

Una buena noticia para el comercio transfronterizo electrónico.

Toma una foto de tu producto sobre fondo blanco, NB2 Lite genera varias imágenes del producto en diferentes escenarios, y Omni Flash transforma la imagen estática en un vídeo corto para e-commerce.

De "producto" a "material publicitario", toda la cadena se ejecuta automáticamente.

Entonces, ¿para qué sirve realmente la multimodalidad?

Seguro que Google ha escuchado esta pregunta innumerables veces.

Sobre todo en 2026, donde "Coding" equivale prácticamente al coeficiente intelectual del modelo. Todas las empresas compiten a muerte en Coding.

¿Qué se persigue obsesionándose con la multimodalidad?

Dejemos de lado la narrativa de la AGI. A corto plazo, este conjunto de modelos multimodales de Google realmente puede potenciar muchos de sus productos.

No profundizaremos en la narrativa de la AGI. A corto plazo, este conjunto de modelos multimodales de Google realmente puede potenciar muchos de sus productos: Stitch es uno, el retoque de fotos incorporado en Pixel es otro, y el surgimiento de Notebook LM también fue bastante impresionante.

Los dos nuevos modelos lanzados esta vez permiten ver más potencial de aplicación de la multimodalidad en escenarios verticales. Comercio electrónico, decoración, vídeos cortos... la demanda en estos negocios es real, y el dinero también.

Sumado al respaldo del ecosistema Android, básicamente no hay que preocuparse demasiado por la comercialización.

Google puede que no alcance en Coding por ahora, pero en la mesa de juego de la multimodalidad, Google podría ser el único jugador capaz de formar una mano completa.

Sin embargo...

¡¡¡¿Cuándo va a llegar Gemni 3.5 Pro?!!!

Referencias:[1]https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-flash-nano-banana-2-lite/

Este artículo procede del cuenta oficial de WeChat "Qubit", autor: Tecnología de vanguardia

Kripto yang Sedang Tren

Pertanyaan Terkait

Q¿Cuál es el nombre del nuevo modelo de generación de imágenes ultra rápido de Google y cuánto tiempo tarda en generar una imagen?

AEl nuevo modelo se llama Nano Banana 2 Lite (también conocido como gemini-3.1-flash-lite-image) y tarda aproximadamente 4 segundos en generar una imagen.

Q¿Cuáles son las cuatro capacidades clave del modelo Gemini Omni Flash recién lanzado?

ALas cuatro capacidades clave son: 1) Edición de video conversacional, 2) Referencia multimodal, 3) Conocimiento del mundo real integrado de Gemini, y 4) Sincronización de texto y acción.

Q¿Qué dos modelos presentados en el artículo pueden combinarse para crear un flujo de trabajo de imagen a video?

ALos modelos Nano Banana 2 Lite (para generar imágenes rápidamente) y Gemini Omni Flash (para convertir esas imágenes en video) pueden combinarse para un flujo de trabajo sin problemas desde la imagen hasta el video.

Q¿Para qué tipo de aplicaciones está diseñado específicamente el modelo Nano Banana 2 Lite según el artículo?

ANano Banana 2 Lite está diseñado específicamente para aplicaciones en tiempo real sensibles a la latencia que requieren procesar grandes volúmenes de imágenes en poco tiempo, como la generación masiva de material para comercio electrónico, la iteración rápida de creatividades publicitarias y tuberías de contenido automatizadas.

QEl artículo menciona que Google también presentó tres aplicaciones de demostración (Demos) para mostrar el flujo de trabajo combinado. Nombra una de ellas y describe brevemente su función.

AUna de las demos se llama 'Anywhere'. Permite al usuario subir una selfie o foto, usar Nano Banana 2 Lite para colocarla digitalmente en varios puntos de referencia famosos, y luego, con un clic, usar Gemini Omni Flash para transformar esa imagen estática en un video corto y dinámico, ofreciendo una experiencia de 'viaje cibernético'.

Bacaan Terkait

Pemain Besar di Pasar Altcoin Melakukannya Saat Rally Besar-besaran!

Seiring tren bullish di pasar kripto yang menguat, transaksi oleh pemain besar (paus) mulai menarik perhatian. Data blockchain menunjukkan posisi dibuka dan ditutup senilai ratusan juta dolar dalam Bitcoin (BTC), Ethereum (ETH), dan Hyperliquid (HYPE). Seorang investor besar, diduga terkait Matrixport, menutup posisi long 40.000 ETH senilai sekitar $100,5 juta, meraih laba $9,9 juta. Investor ini masih memegang posisi long 80.000 ETH ($201 juta) dan 500 BTC ($39 juta) dengan keuntungan belum terealisasi sekitar $22,9 juta. Setelah sebelumnya rugi $92,5 juta, transaksi terbaru ini mengubah total posisinya menjadi laba sekitar $32,8 juta. Di platform Hyperliquid, investor besar loracle.hl dilaporkan kehilangan lebih dari $70 juta dari perdagangan HYPE dalam tiga bulan terakhir. Saat ini, investor ini memegang sekitar 685.744 posisi short HYPE senilai $54,88 juta, yang berisiko likuidasi jika harga HYPE naik ke $101,15. Machi Big Brother, dikenal dengan perdagangan leverage tinggi, juga untung dari rally baru-baru ini. Investor yang dilaporkan pernah mengalami 500 likuidasi ini berhasil meningkatkan ekuitinya dari $152.000 menjadi $12,72 juta hanya dalam tiga hari, meraih keuntungan lebih dari $12,5 juta. Meskipun HYPE mencapai rekor tertinggi baru, transfer token oleh Multicoin Capital juga menjadi sorotan. Perusahaan dikabarkan mendepositokan total 427.422 HYPE (sekitar $31,74 juta) ke Coinbase Prime dalam tiga hari terakhir, memicu perhatian pasar terkait potensi penjualan atau manajemen portofolio. Dalam perdagangan Bitcoin, penjualan oleh investor anonim besar menonjol. Dalam transaksi terakhir, "paus" ini menjual sekitar 2.700 BTC senilai $211,8 juta, menjadikan total penjualannya dalam tiga hari mencapai 7.700 BTC dengan nilai sekitar $576,6 juta. *Ini bukan rekomendasi investasi.

cryptonews.ru20m yang lalu

Pemain Besar di Pasar Altcoin Melakukannya Saat Rally Besar-besaran!

cryptonews.ru20m yang lalu

Fidelity Memperingatkan: Kemakmuran Agen AI Belum Tentu Pesta untuk Rantai Publik

Fidelity mengingatkan investor agar tidak terlalu cepat menyamakan kemajuan AI agent dengan kemakmuran public blockchain. Meskipun AI yang dapat bertindak secara mandiri berpotensi menggunakan blockchain untuk pembayaran atau penyelesaian transaksi, terdapat setidaknya enam risiko yang perlu diperhatikan. Pertama, AI agent mungkin tidak memerlukan blockchain publik. Sistem tertutup oleh perusahaan teknologi besar bisa lebih dipilih karena kecepatan, biaya, stabilitas, dan kepatuhan regulasi yang lebih baik. Kedua, peningkatan transaksi on-chain tidak serta-merta menguntungkan token asli jaringan. Aktivitas pembayaran AI mungkin didominasi stablecoin, sehingga nilai tertangkap oleh penyedia layanan pembayaran, bukan token dasar blockchain. Ketiga, AI membuat pengembangan perangkat lunak lebih murah, tetapi banyaknya kode tidak sama dengan peningkatan nilai ekonomi. Persaingan bisa beralih ke pengguna, likuiditas, dan merek. Keempat, keunggulan teknologi menjadi kurang langka karena AI dapat dengan cepat mereplikasi fungsi, sehingga sulit mempertahankan keunggulan kompetitif hanya melalui kode. Kelima, AI menurunkan biaya pengembangan sekaligus biaya serangan, berpotensi meningkatkan risiko keamanan jika infrastruktur audit tidak matang. Keenam, institusi besar mungkin lebih membutuhkan blockchain "terkendali" dengan manajemen identitas, izin, dan audit yang kuat, bukan jaringan publik yang sepenuhnya terbuka. Intinya, narasi gabungan AI dan blockchain perlu dikaji lebih kritis. Fokus seharusnya pada infrastruktur mana yang benar-benar dapat menangkap kebutuhan riil dan mengubahnya menjadi nilai bisnis yang berkelanjutan.

marsbit1j yang lalu

Fidelity Memperingatkan: Kemakmuran Agen AI Belum Tentu Pesta untuk Rantai Publik

marsbit1j yang lalu

Setelah Riset di Silicon Valley, Kesimpulan Goldman Sachs: Agent Masuki Era Eksekusi, Kompetisi AI Beralih ke Workflow, World Model Bangkit

Berdasarkan laporan terbaru Goldman Sachs setelah survei di Silicon Valley, industri AI sedang memasuki tahap baru dari "mampu menjawab" menuju "mampu mengeksekusi". Kompetisi beralih dari "model siapa yang lebih kuat" ke "siapa yang benar-benar menguasai alur kerja". **Agent Masuki Era Eksekusi:** Agent AI berkembang dari alat bantu menjadi pelaksana alur kerja. Kendala utama untuk adopsi besar-besaran di perusahaan bukan lagi kemampuan model, melainkan **kontrollabilitas**, pembagian tanggung jawab, dan kemampuan untuk melacak serta memperbaiki kesalahan. Alur kerja yang paling mungkin diotomatisasi pertama kali memiliki karakteristik: batasan keputusan yang jelas, hasil yang dapat diverifikasi, dan kesalahan yang dapat dikembalikan (rollback). Penyedia layanan informasi dengan konten tepercaya, model domain yang terverifikasi, dan hubungan pengawasan yang matang memiliki peluang lebih besar. **Persaingan Model: Pembagian Tugas antara Model Mutakhir dan Model Sumber Terbuka:** Pasar kemungkinan akan berkembang menjadi pembagian kerja yang lebih jelas. **Model mutakhir (seperti GPT-4)** akan menangani tugas kompleks bernilai tinggi yang membutuhkan keandalan ekstrem. Sementara **model sumber terbuka** akan mengatasi tugas standar berskala besar dan menghabiskan sebagian besar token inferensi (sekitar 90% dalam 12-18 bulan ke depan), menawarkan biaya yang lebih rendah dengan sedikit pengorbanan kinerja untuk banyak kasus penggunaan bisnis. **Kebangkitan Model Dunia (World Model) dan Implikasinya:** Perhatian penelitian bergeser dari LLM (Large Language Model) ke "Model Dunia", yang memahami lingkungan, sebab-akibat, hukum fisika, dan interaksi dinamis di dunia nyata menggunakan data dari sistem fisik dan operasi dunia nyata. Ini semakin meningkatkan nilai **data proprietary**. Transisi AI ke dunia fisik di bidang seperti industri, sains, dan robotika akan membuka ruang masalah yang lebih luas dan memicu **kurva pertumbuhan kedua untuk permintaan komputasi AI**, menguntungkan penyedia infrastruktur cloud dan komputasi seperti Microsoft, Oracle, dan CoreWeave. **Perubahan Model Bisnis:** Komersialisasi AI bergerak dari berlangganan per kursi (**seat-based**) ke pengisian berdasarkan konsumsi, volume transaksi, dan hasil (**consumption/transaction/outcome-based**). Nilai industri bermigrasi dari model itu sendiri ke data proprietary, konteks bisnis, dan keahlian domain.

marsbit1j yang lalu

Setelah Riset di Silicon Valley, Kesimpulan Goldman Sachs: Agent Masuki Era Eksekusi, Kompetisi AI Beralih ke Workflow, World Model Bangkit

marsbit1j yang lalu

Telegram Memperkenalkan Teknologi WEB-Proxy: Menyamarkan Lalu Lintas agar Terlihat Seperti Situs Web Biasa

Telegram memperkenalkan teknologi eksperimental bernama WEB-proxy pada 21 Agustus 2026. Teknologi ini menawarkan cara baru untuk mengatasi pemblokiran dengan menyamarkan lalu lintas data aplikasi agar terlihat seperti kunjungan biasa ke situs web melalui koneksi HTTPS yang aman. Cara kerjanya, Telegram Desktop menggunakan mesin browser (WebView) bawaan untuk mengirimkan semua data melalui satu sesi yang tampak seperti loading halaman web. Data dari MTProxy dikemas dalam format khusus dan dikirim melalui saluran terenkripsi HTTPS atau WebSocket. Di sisi server, relay khusus menerima aliran data ini dan meneruskannya ke MTProxy tanpa mengetahui isi atau tujuan akhirnya, sehingga menjaga privasi. WEB-proxy beroperasi pada domain HTTPS biasa yang juga menampung situs web publik asli. Halaman jembatan proxy hanya diaktifkan jika permintaan mengandung parameter rahasia tertentu yang dihitung dari konfigurasi. Tautan koneksi proxy memiliki format spesifik dan menggunakan port 443 wajib. Saat ini, teknologi ini masih dalam tahap uji konsep dan tersedia untuk Telegram Desktop serta klien Android eksperimental, dengan rencana dukungan iOS. Dengan memanfaatkan infrastruktur web standar, WEB-proxy mempersulit sistem filter untuk membedakannya dari lalu lintas internet sah tanpa memblokir keseluruhan HTTPS. Keberhasilannya akan bergantung pada ketahanannya terhadap analisis lalu lintas yang canggih dan kemampuan skalanya.

cryptonews.ru1j yang lalu

Telegram Memperkenalkan Teknologi WEB-Proxy: Menyamarkan Lalu Lintas agar Terlihat Seperti Situs Web Biasa

cryptonews.ru1j yang lalu

Trading

Spot

Artikel Populer

Cara Membeli 4

Selamat datang di HTX.com! Kami telah membuat pembelian 4 (4) menjadi mudah dan nyaman. Ikuti panduan langkah demi langkah kami untuk memulai perjalanan kripto Anda.Langkah 1: Buat Akun HTX AndaGunakan alamat email atau nomor ponsel Anda untuk mendaftar akun gratis di HTX. Rasakan perjalanan pendaftaran yang mudah dan buka semua fitur.Dapatkan Akun SayaLangkah 2: Buka Beli Kripto, lalu Pilih Metode Pembayaran AndaKartu Kredit/Debit: Gunakan Visa atau Mastercard Anda untuk membeli 4 (4) secara instan.Saldo: Gunakan dana dari saldo akun HTX Anda untuk melakukan trading dengan lancar.Pihak Ketiga: Kami telah menambahkan metode pembayaran populer seperti Google Pay dan Apple Pay untuk meningkatkan kenyamanan.P2P: Lakukan trading langsung dengan pengguna lain di HTX.Over-the-Counter (OTC): Kami menawarkan layanan yang dibuat khusus dan kurs yang kompetitif bagi para trader.Langkah 3: Simpan 4 (4) AndaSetelah melakukan pembelian, simpan 4 (4) di akun HTX Anda. Selain itu, Anda dapat mengirimkannya ke tempat lain melalui transfer blockchain atau menggunakannya untuk memperdagangkan mata uang kripto lainnya.Langkah 4: Lakukan trading 4 (4)Lakukan trading 4 (4) dengan mudah di pasar spot HTX. Cukup akses akun Anda, pilih pasangan perdagangan, jalankan trading, lalu pantau secara real-time. Kami menawarkan pengalaman yang ramah pengguna baik untuk pemula maupun trader berpengalaman.

1.0k Total TayanganDipublikasikan pada 2025.10.20Diperbarui pada 2026.06.02

Cara Membeli 4

Diskusi

Selamat datang di Komunitas HTX. Di sini, Anda bisa terus mendapatkan informasi terbaru tentang perkembangan platform terkini dan mendapatkan akses ke wawasan pasar profesional. Pendapat pengguna mengenai harga 4 (4) disajikan di bawah ini.

活动图片