Artículos Relacionados con Generación

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Generación", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

La batalla en la generación de vídeos con IA en julio: más de 200 mil millones de capital entran en masa, ¿quién ha llegado a la ronda final?

Juliol de 2026 ha estat un mes clau en la cursa per liderar la generació de vídeo amb IA, amb més de 200.000 milions de RMB invertits en només 20 dies. Cinc empreses van anunciar grans rondes de finançament: Kling AI (30.000 M$), Shengshu Technology (5.000 M$), Aishu Tech (C+), Zhixiang Future (15.000 M RMB) i la nova FlovaAI (80 M$). Aquest influx massiu de capital s'explica per diversos factors. En primer lloc, l'èxit comercial de models com Seedance de ByteDance, que domina el mercat, ha obligat la competència a accelerar per no quedar-se enrere. En segon lloc, les dades de facturació (p. ex., Kling AI té uns ingressos anuals de quasi 5.000 M$) demostren que el sector ja és rendible. En tercer lloc, la narrativa ha evolucionat de la simple "generació de vídeo" cap a models universals ("World Models") més ambiciosos, capaços d'entendre i interactuar amb el món físic. Finalment, la finestra d'OPV a Hong Kong motiva inversors a pujar a bord abans de les possibles sortides a borsa. Cada empresa segueix una estratègia diferent: Kling AI aposta per una plataforma integral; Shengshu Technology per la investigació en models universals; Aishu Tech per la interacció en temps real; Zhixiang Future per escenaris verticals com el cinema; i FlovaAI per un agent creatiu basat en fluxos de treball. Aquest juliol marca l'inici de la fase final, on les companyies amb més recursos lluitaran per definir el futur del sector, tot i que els enormes costos de còmput continuen essent un repte important.

marsbitHace 2 días 07:45

La batalla en la generación de vídeos con IA en julio: más de 200 mil millones de capital entran en masa, ¿quién ha llegado a la ronda final?

marsbitHace 2 días 07:45

Claude Opus5 se filtra, llegan las primeras pruebas reales de los internautas

Claude Opus 5 ha sido filtrado antes de su lanzamiento oficial y los primeros usuarios ya han comenzado a probarlo. Las demostraciones muestran capacidades significativamente mejoradas en la generación de gráficos 2D y 3D, con un nivel de detalle que supera a su predecesor y, según algunos, incluso rivaliza con Fable 5. Los usuarios han compartido ejemplos impresionantes: una escena 3D detallada de un ataque con catapulta que incluye parámetros físicos, interfaces de usuario con efectos de iluminación dinámicos, una cocina con texturas realistas y una recreación precisa de Minecraft con físicas y sombreado. Una comparación directa con Fable 5 en la misma escena mostró que Opus 5 genera una densidad de detalles muy superior. Las filtraciones comenzaron a aparecer a principios de julio, con menciones del modelo en Cursor y Google Vertex AI. Recientemente, usuarios reportan tener acceso a Opus 5 a través de varios proveedores, aunque la interfaz aún puede mostrar la versión 4.8. Una captura de pantalla filtrada de un posible empleado de Anthropic mostró que el sistema enrutó una solicitud a Opus 5 después de que Fable 5 activara una restricción de seguridad. Surge la pregunta de si Opus 5, con un precio por token que es la mitad del de Fable 5, podría ser un reemplazo más económico. Sin embargo, un tester advierte que Opus 5 consume tokens mucho más rápido, lo que potencialmente anularía la ventaja de precio. A la espera de su lanzamiento oficial y de evaluaciones completas, la comunidad espera ver si Opus 5 cumple con las altas expectativas generadas.

marsbit07/24 07:56

Claude Opus5 se filtra, llegan las primeras pruebas reales de los internautas

marsbit07/24 07:56

1600 líneas de código construyen un Manhattan submarino, Fable 5 deja boquiabierto a Karpathy

**Resumen: Fable 5 genera mundos 3D sorprendentes con un código mínimo** El modelo Fable 5, tras su relanzamiento, ha demostrado capacidades extraordinarias para la generación de mundos 3D interactivos y complejos a partir de especificaciones detalladas. El evaluador Peter Gostev de Arena.ai creó 63 mundos en video, la mayoría en una sola pasada, impresionando incluso a expertos como Andrej Karpathy de Anthropic. Entre los ejemplos más destacados se encuentra una "Manhattan submarina" completa, generada con solo 1600 líneas de código, que muestra un nivel de detalle asombroso en edificios y calles. Otros incluyen recreaciones 3D navegables de obras de arte como *La noche estrellada* de Van Gogh y *Los nenúfares* de Monet, paisajes naturales dinámicos (como un oso atrapando un salmón), ciudades históricas y escenarios de ciencia ficción. Gostev señala que el verdadero avance no es la belleza de escenas individuales, sino la capacidad del modelo para coordinar una gran cantidad de elementos de manera coherente, reduciendo drásticamente el tiempo de depuración necesario. Sin embargo, también reconoce limitaciones actuales, como la creación de juegos profundos y cierta tendencia del modelo a "conformarse" si no se le presiona para ser más ambicioso. Karpathy reflexionó sobre cómo el modelo, entrenado solo con datos de Internet, parece haber inferido conocimientos del mundo real (como el comportamiento de un pez atrapado) y los traduce efectivamente a componentes 3D. Tanto él como Gostev coinciden en que el potencial de esta tecnología está lejos de ser completamente explorado y que su rápido desarrollo abre nuevas posibilidades creativas y prácticas.

marsbit07/06 09:51

1600 líneas de código construyen un Manhattan submarino, Fable 5 deja boquiabierto a Karpathy

marsbit07/06 09:51

Llega Un-0, el primer modelo generativo a gran escala que usa la física como primitiva computacional. ¿Reducirá el consumo energético de la IA 1000 veces?

Unconventional AI ha presentado Un-0, el primer modelo de generación de imágenes a gran escala que utiliza sistemas físicos acoplados (osciladores) como primitivas computacionales. Desarrollado por el exdirector de IA de Databricks, Naveen Rao, el modelo busca abordar la creciente crisis energética de la IA al aprovechar la dinámica natural de los sistemas físicos para realizar cálculos, con el objetivo de reducir el consumo energético del *inference* en hasta 1000 veces en comparación con los sistemas digitales actuales basados en GPU. Un-0 funciona con un gran conjunto de osciladores acoplados, cuyas interacciones (matriz de acoplamiento) y frecuencias naturales son los parámetros principales aprendidos. Para generar una imagen, el sistema inicializa fases aleatorias, introduce una guía de categoría a través de osciladores condicionales, deja que el sistema físico evolucione hasta estabilizarse y finalmente decodifica la fase resultante en píxeles. Evaluado en ImageNet 64×64, Un-0 alcanza un FID de 6.74, un rendimiento comparable al de modelos generativos tradicionales tempranos (como BigGAN o iDDPM), aunque por debajo de los más avanzados. El modelo demuestra la viabilidad de usar sistemas dinámicos físicos para tareas modernas de IA y marca un primer paso hacia hardware no convencional que podría ofrecer ganancias masivas en eficiencia energética al integrar computación y memoria, evitando el costoso movimiento de datos de la arquitectura de von Neumann.

marsbit06/26 10:58

Llega Un-0, el primer modelo generativo a gran escala que usa la física como primitiva computacional. ¿Reducirá el consumo energético de la IA 1000 veces?

marsbit06/26 10:58

Nuevo trabajo del equipo de Kaiming He: Eliminando VAE y datos privados, la generación de texto a imagen resulta ser más potente

El equipo de investigación de He Kaiming presenta MiniT2I, un modelo de generación de imagen a partir de texto (text-to-image, T2I) minimalista y directo en el espacio de píxeles, que desafía la complejidad de los enfoques dominantes. El modelo elimina componentes estándar como el VAE para codificación, mecanismos de inyección condicional complejos (AdaLN), funciones de pérdida auxiliares, datos privados y etapas de alineación RL/DPO. Utiliza un objetivo de "flow matching" entrenado directamente sobre píxeles RGB. Con solo 258M de parámetros (versión B/16), supera a modelos de espacio de píxeles mucho más grandes en benchmarks como GenEval (0.87) y DPG-Bench (84.2). Su arquitectura, MM-JiT, simplifica el Transformer estándar: añade dos adaptadores ligeros para las características de texto de T5 (congelado) y elimina la rama AdaLN, confiando en que la imagen ruidosa ya contiene información temporal. Esto reduce parámetros y permite más capas, mejorando el FID a 13.7. El entrenamiento, de bajo costo (~3 días en 8 H100 para el modelo de ablación), se realiza en dos fases con datos completamente públicos: preentrenamiento en CC12M reetiquetado y ajuste fino en ~120K pares de alta calidad. Esto demuestra que un modelo pequeño puede igualar o superar en ciertos aspectos a gigantes como SD3-Medium en escenas imaginativas, aunque muestra limitaciones en renderizado de texto y entidades nombradas debido a los datos públicos. MiniT2I señala un cambio de paradigma hacia la simplificación y eficiencia en la generación de imágenes, haciendo que la tecnología T2I sea más accesible fuera de los laboratorios industriales líderes.

marsbit06/22 10:21

Nuevo trabajo del equipo de Kaiming He: Eliminando VAE y datos privados, la generación de texto a imagen resulta ser más potente

marsbit06/22 10:21

Google DeepMind lanza Lyria 3 Pro: la música IA pasa de "30 segundos de prueba" a canciones completas

Google DeepMind lanzó Lyria 3 Pro el 25 de marzo, una versión mejorada que extiende la generación de música de 30 segundos a 3 minutos. La clave es su nueva capacidad de "estructura consciente", que permite a los usuarios especificar secciones como introducción, estrofa, coro y puente, haciendo que el modelo entienda y organice la estructura interna de una canción. Esto representa un paso crucial para convertir las herramientas de IA musical de meros generadores en herramientas de creación reales. Aunque competidores como Suno y Udio ya ofrecían funciones similares desde principios de 2025, la ventaja de Google radica en su integración con el ecosistema Gemini, lo que amplía significativamente su alcance de usuarios. Además, la apertura de Vertex AI indica que Google también apunta a flujos de trabajo empresariales. Lyria 3 Pro acepta entradas de texto, imagen o video, genera voces, letras e instrumentos en múltiples idiomas, e incluye la marca de agua SynthID para identificar el contenido creado por IA. Está disponible para usuarios pagos de Gemini App, con límites diarios según el plan, mientras que la versión gratuita sigue limitada a 30 segundos. También está accesible para desarrolladores a través de Google AI Studio y Gemini API. Google afirma que los datos de entrenamiento siguen acuerdos con artistas, pero no detalla el origen o el alcance de la autorización, un tema aún en disputa legal en la industria de la IA musical. La herramienta se está implementando gradualmente, con posible retraso en algunas regiones.

marsbit03/26 01:00

Google DeepMind lanza Lyria 3 Pro: la música IA pasa de "30 segundos de prueba" a canciones completas

marsbit03/26 01:00

El auge del especulacionismo a largo plazo: Comprendiendo la precariedad financiera y la apuesta de alto riesgo de una nueva generación

El auge del especulacionismo a largo plazo: la nueva generación atrapada en dificultades financieras y apuestas de alto riesgo Una generación se encuentra atrapada en una jaula financiera invisible. Saben que existe una vida con casa, coche y seguridad, pero no pueden vislumbrar ningún camino viable para alcanzarla. Los mecanismos tradicionales de acumulación de riqueza están bloqueados: la generación baby boom posee el 50% de la riqueza nacional, mientras que los millennials solo el 10%. El contrato social tradicional se ha roto. La lealtad corporativa ya no es recompensada; los salarios suben un 8% mientras los precios de la vivienda se duplican. Con la llegada de la IA, que erosiona empleos de cuello blanco, la ansiedad existencial se intensifica. Las redes sociales amplifican la insatisfacción al mostrar constantemente vidas ideales inalcanzables. Atrapados entre la imposibilidad de alcanzar hitos tradicionales y la creencia de que estas vías desaparecerán, los jóvenes buscan desesperadamente una salida. El casino se convierte en su único refugio, el único lugar donde sienten control: criptomonedas, mercados de predicción, apuestas deportivas. Aquí, sus decisiones pueden, al menos perceptualmente, abrir puertas. No se trata de ignorancia financiera, sino de una adaptación racional a un entorno sin opciones viables. Cuando la opción es estancarse perpetuamente o apostar por una pequeña posibilidad de escape, la matemática favorece la apuesta. Por lo tanto, el especulacionismo a largo plazo se consolida como tema socioeconómico central. Plataformas que facilitan estas apuestas (exchange de cripto, casas de apuestas, mercados de predicción) prosperarán, beneficiándose de la desesperación generacional. La era del especulacionismo a largo plazo acaba de comenzar.

比推12/29 14:30

El auge del especulacionismo a largo plazo: Comprendiendo la precariedad financiera y la apuesta de alto riesgo de una nueva generación

比推12/29 14:30

活动图片