Artículos Relacionados con Generación de video

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Generación de video", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

La versión en vídeo de Nano Banana ya está aquí: con conocimiento del mundo Gemini incorporado, generar imágenes con el plátano original solo tarda 4 segundos

Google ha lanzado dos nuevos modelos multimodales: **Gemini Omni Flash** y **Nano Banana 2 Lite**. **Gemini Omni Flash** es un modelo de generación y edición de video que combina la capacidad de razonamiento multimodal de Gemini con la creación de contenido visual. Permite generar videos de hasta 10 segundos mediante instrucciones de lenguaje natural, utilizando referencias de texto, imagen o video. Sus características clave incluyen edición conversacional, integración de conocimientos del mundo real y sincronización de texto con acción. Su costo es competitivo, a 0.10 USD por segundo de video. **Nano Banana 2 Lite** (gemini-3.1-flash-lite-image) es un modelo optimizado para generar imágenes a alta velocidad y bajo costo. Puede crear una imagen de resolución 1K en aproximadamente **4 segundos**, por un precio de unos **0.034 USD**, lo que lo hace ideal para aplicaciones en tiempo real como comercio electrónico o publicidad. Mantiene una buena calidad en la generación y representación de texto. La verdadera potencia, según Google, reside en combinar ambos modelos. Un flujo de trabajo típico sería generar rápidamente una imagen con Nano Banana 2 Lite y luego usarla como referencia para que Gemini Omni Flash la transforme en un video dinámico. Se presentaron tres demostraciones de esta sinergia: "Anywhere" (para crear videos de viaje a partir de una selfie), "Space Lift" (para visualizar propuestas de diseño de interiores) y "Omni Product Studio" (para generar material publicitario de productos para e-commerce). Con estos lanzamientos, Google apuesta fuerte por las aplicaciones prácticas de la multimodalidad en sectores verticales específicos, aprovechando su ecosistema, mientras continúa desarrollando sus capacidades en esta área.

marsbit07/01 01:57

La versión en vídeo de Nano Banana ya está aquí: con conocimiento del mundo Gemini incorporado, generar imágenes con el plátano original solo tarda 4 segundos

marsbit07/01 01:57

En el campo de la generación de vídeos con IA, el "liderazgo abrumador" se ha hecho realidad

Los informes indican que el modelo de generación de vídeo Seedance 2.0 de ByteDance está ganando popularidad en el extranjero, mientras que un artículo reciente sugiere que China ha tomado la delantera frente a EE.UU. en esta área, ventaja que podría mantenerse a largo plazo. La ventaja clave radica en la calidad y cantidad de datos de entrenamiento. Plataformas como Douyin y Kuaishou generan enormes volúmenes de vídeos con anotaciones de comportamiento de usuarios de alta calidad, algo que los modelos estadounidenses como Sora de OpenAI, que dependen de datos públicos de internet, no poseen. Esto se refleja en las clasificaciones de plataformas de evaluación como Artificial Analysis, donde herramientas chinas como Seedance 2.0, Kling 3.0 y HappyHorse ocupan los primeros puestos. Además, existe una clara ventaja en escenarios de aplicación comercial. Las empresas chinas han integrado estos modelos en el comercio electrónico, la publicidad y las series cortas, creando un ciclo de retroalimentación que perfecciona continuamente los productos. Mientras tanto, las herramientas estadounidenses carecen actualmente de ecosistemas comerciales similares para su implementación. Sin embargo, los modelos chinos enfrentan desafíos significativos: una brecha en la capacidad de cómputo (potencia de cálculo) en comparación con EE.UU., disputas sobre derechos de autor con grandes estudios de Hollywood, presiones crecientes de comercialización y una brecha en las capacidades de los modelos de lenguaje base, donde OpenAI y Anthropic mantienen una ventaja. En resumen, aunque China ha logrado un liderazgo tangible en la generación de vídeo por IA, impulsado por sus datos y aplicaciones prácticas, persisten obstáculos críticos relacionados con la infraestructura de cómputo, los derechos de autor y el desarrollo de modelos fundamentales.

marsbit05/21 04:40

En el campo de la generación de vídeos con IA, el "liderazgo abrumador" se ha hecho realidad

marsbit05/21 04:40

¡Llega Gemini 3.5! Esta noche, Google hace que Google quede obsoleto

**Google I/O 2026: Geminis Omni, Flash 3.5 y Spark, un salto hacia la superinteligencia** En Google I/O 2026, Sundar Pichai y Demis Hassabis presentaron una avalancha de avances en IA que redefinen el campo. La estrella fue **Gemini Omni**, un modelo “omnimodal” que entiende y genera cualquier combinación de texto, imagen, audio y, lo más destacado, **video de alta calidad**. Omni no solo crea videos realistas; los edita mediante conversación, mantiene la coherencia física y lógica entre escenas, y permite crear avatares personalizados. Ya está disponible en su versión Flash, con una versión Pro en camino. El segundo gran lanzamiento es **Gemini 3.5 Flash**, un modelo que supera ampliamente al anterior flagship, Gemini 3.1 Pro, en benchmarks de código y tareas de agente. Es extremadamente rápido (289 tokens/segundo) y se integra en **Antigravity 2.0**, una plataforma de desarrollo de agentes independiente. Una demostración impactante mostró cómo 93 sub-agentes, dirigidos por 3.5 Flash, escribieron, probaron y auditaron un **sistema operativo funcional desde cero en solo 12 horas**, por menos de 1000 dólares en costos de API. Finalmente, se anunció **Gemini Spark**, un agente personal de IA que funciona 24/7 en la nube. Integrado con las herramientas de Google (Gmail, Docs, Sheets), puede ejecutar tareas complejas como organizar eventos, redactar correos con tu estilo o gestionar información de manera autónoma, incluso mediante comandos de voz. Estará disponible en beta para suscriptores de AI Ultra. En conjunto, estos lanzamientos (creación omnimodal, agentes autónomos de alto rendimiento y asistentes personales persistentes) marcan un salto significativo. Google demostró que las barreras técnicas hacia una Inteligencia Artificial Superinteligente (ASI) se están derribando a un ritmo asombroso, redefiniendo lo que es posible en automatización y creación.

链捕手05/20 07:04

¡Llega Gemini 3.5! Esta noche, Google hace que Google quede obsoleto

链捕手05/20 07:04

Google usa IA para "matar" a Google, esta presentación te deja sin aliento

En el Google I/O, Sundar Pichai anunció hitos clave: la app Gemini supera los 900 millones de usuarios activos mensuales y procesa 3200 billones de tokens al mes. La presentación se centró en dos nuevos modelos: **Gemini Omni**, un modelo multimodal que apunta a ser un "modelo del mundo", capaz de generar y editar videos de forma avanzada entendiendo conceptos físicos, y **Gemini 3.5 Flash**, optimizado para velocidad y tareas de desarrollo, potenciando la plataforma de agentes Antigravity 2.0. Google está reimaginando la Búsqueda con IA, integrando Gemini 3.5, creando "Agentes de información" para seguimiento continuo, e introduciendo interfaces generativas. Para el usuario final, se presentó **Gemini Spark**, un agente personal que ejecuta tareas en segundo plano incluso con el dispositivo apagado, y una rediseñada app Gemini con un nuevo lenguaje visual "Neural Expressive" y un resumen matutino "Daily Brief". Se anunciaron nuevas herramientas creativas como Google Pics (edición de imágenes), Stitch (diseño) y mejoras en Google Flow (edición de video). En hardware, Google avanza en gafas inteligentes con Android XR, tanto con pantalla como de audio (estas últimas para otoño), como nuevo portal de acceso a Gemini. La presentación subraya la transición estratégica de Google: de servicios gratuitos financiados por publicidad hacia un modelo basado en suscripciones por capacidades avanzadas de IA, agentes de larga duración y automatización empresarial, enfrentando el reto de monetizar los altos costes de computación de estos servicios inteligentes.

marsbit05/20 00:00

Google usa IA para "matar" a Google, esta presentación te deja sin aliento

marsbit05/20 00:00

活动图片