Artículos Relacionados con Multimodal

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Multimodal", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

Informe en profundidad de Goldman Sachs: ¿Quiénes serán los ganadores a largo plazo en la industria china de modelos de IA a gran escala?

Informe de Goldman Sachs sobre los posibles ganadores a largo plazo en la industria china de modelos de IA. Los modelos de inteligencia artificial de China se encuentran en un punto de inflexión histórico. Según Goldman Sachs, los modelos de código abierto han alcanzado un rendimiento cercano al de los modelos propietarios globales líderes. Esta evolución ha pasado del enfoque en la eficiencia de costos de DeepSeek el año pasado al momento de la inteligencia del modelo de GLM de Zhipu este año. La adopción por parte de empresas chinas y pymes globales se está expandiendo rápidamente, creando un efecto de vuelo de datos que impulsará nuevas iteraciones. La clave del éxito radica en la innovación arquitectónica y la eficiencia de parámetros, lo que permite a los modelos chinos lograr un rendimiento comparable a un costo significativamente menor. Se está formando una estructura de mercado de dos niveles: un segmento premium (ej. GLM5.2 de Zhipu) y un segmento de bajo costo para tareas de agentes inteligentes y usuarios sensibles al precio. Se proyecta que los ingresos por API y suscripciones de modelos chinos crecerán drásticamente, de 35 mil millones de RMB en 2026 a 879 mil millones en 2030. La estrategia predominante es el código abierto o de pesos abiertos, que favorece la adopción, aunque presenta desafíos para la monetización. La industria podría migrar hacia un modelo de "pesos abiertos + licencia comunitaria" con acuerdos de reparto de ingresos. La expansión internacional, especialmente en mercados no estadounidenses, representa la mayor oportunidad de crecimiento, aprovechando la ventaja de costo-rendimiento. Goldman Sachs identifica a los posibles ganadores utilizando un marco tridimensional que evalúa la capacidad de fijación de precios, la ventaja de costos y la solidez financiera. En modelos de texto básico, Zhipu AI y DeepSeek tienen la posición más sólida. En el ámbito multimodal/generación de video, ByteDance lidera con su modelo Seed. La firma mantiene su calificación de compra para MiniMax, citando su atractiva valoración.

marsbit07/10 14:35

Informe en profundidad de Goldman Sachs: ¿Quiénes serán los ganadores a largo plazo en la industria china de modelos de IA a gran escala?

marsbit07/10 14:35

La versión en vídeo de Nano Banana ya está aquí: con conocimiento del mundo Gemini incorporado, generar imágenes con el plátano original solo tarda 4 segundos

Google ha lanzado dos nuevos modelos multimodales: **Gemini Omni Flash** y **Nano Banana 2 Lite**. **Gemini Omni Flash** es un modelo de generación y edición de video que combina la capacidad de razonamiento multimodal de Gemini con la creación de contenido visual. Permite generar videos de hasta 10 segundos mediante instrucciones de lenguaje natural, utilizando referencias de texto, imagen o video. Sus características clave incluyen edición conversacional, integración de conocimientos del mundo real y sincronización de texto con acción. Su costo es competitivo, a 0.10 USD por segundo de video. **Nano Banana 2 Lite** (gemini-3.1-flash-lite-image) es un modelo optimizado para generar imágenes a alta velocidad y bajo costo. Puede crear una imagen de resolución 1K en aproximadamente **4 segundos**, por un precio de unos **0.034 USD**, lo que lo hace ideal para aplicaciones en tiempo real como comercio electrónico o publicidad. Mantiene una buena calidad en la generación y representación de texto. La verdadera potencia, según Google, reside en combinar ambos modelos. Un flujo de trabajo típico sería generar rápidamente una imagen con Nano Banana 2 Lite y luego usarla como referencia para que Gemini Omni Flash la transforme en un video dinámico. Se presentaron tres demostraciones de esta sinergia: "Anywhere" (para crear videos de viaje a partir de una selfie), "Space Lift" (para visualizar propuestas de diseño de interiores) y "Omni Product Studio" (para generar material publicitario de productos para e-commerce). Con estos lanzamientos, Google apuesta fuerte por las aplicaciones prácticas de la multimodalidad en sectores verticales específicos, aprovechando su ecosistema, mientras continúa desarrollando sus capacidades en esta área.

marsbit07/01 01:57

La versión en vídeo de Nano Banana ya está aquí: con conocimiento del mundo Gemini incorporado, generar imágenes con el plátano original solo tarda 4 segundos

marsbit07/01 01:57

JD.com y Mira Murati, ex CTO de Open AI, apuestan por la misma pista de IA

Imagina que una persona mayor que vive sola se cae en casa y no puede pedir ayuda. Su dispositivo inteligente o una cámara, impulsado por IA, detecta la situación de forma autónoma y alerta a emergencias. Este no es un escenario futurista, sino el tipo de problema que busca resolver **JoyAI-VL-Interaction**, el primer modelo de interacción visiolingüística de código abierto del mundo, presentado por JD.com. En la industria de la IA, la interacción ha estado dominada por un formato de turnos: el usuario pregunta, el modelo responde. JD.com y otros, como Thinking Machines Lab de Mira Murati, identificaron la misma limitación y convergieron en una idea: la IA debe evolucionar de ser un procesador pasivo de información a un **participante activo** que "prediga el siguiente estado físico". JoyAI-VL-Interaction observa el flujo continuo de video de una cámara y decide *autónomamente* cuándo responder, cuándo guardar silencio y cuándo derivar tareas complejas a otros modelos. Su ventaja clave es colocar al **lenguaje visual como el motor principal** para la toma de decisiones, desacoplándolo del audio. Esto lo hace ideal para aplicaciones como asistencia a personas mayores o con discapacidad visual, comentarios automáticos en eventos deportivos, inspección de almacenes o robots colaborativos, donde los eventos ocurren demasiado rápido para una orden verbal. JD.com ha optado por una estrategia de **cód abierto integral** y un diseño ligero (8B parámetros), que permite ejecutar el modelo incluso con una tarjeta gráfica NVIDIA 3090. El objetivo es democratizar el acceso y acelerar la innovación. Este movimiento refleja la estrategia más amplia de JD.com: utilizar su vasta red de operaciones en el mundo físico (logística, retail, salud) como un campo de entrenamiento y una fuente de datos única para entrenar IAs que comprendan y actúen en entornos reales. Al abrir su modelo, JD.com apuesta a que la **interacción activa y proactiva** se convierta en la principal vía para que la IA entre en el mundo físico.

marsbit06/24 10:28

JD.com y Mira Murati, ex CTO de Open AI, apuestan por la misma pista de IA

marsbit06/24 10:28

Tras las notas de la IA, se esconde un "creador de exámenes" chino

Cada vez que se lanza un modelo de IA de vanguardia, la comunidad fija su atención en ciertas "hojas de resultados" familiares: MMLU-Pro, MMMU, MMMU-Pro. Estos puntos de referencia se han convertido en exámenes estándar para evaluar y comparar modelos como GPT, Claude, Gemini, Llama, Qwen y DeepSeek. Detrás de estas influyentes evaluaciones está el investigador chino Wenhu Chen, profesor asistente en la Universidad de Waterloo y fundador del TIGERLab (apodado "虎头帮"). Su trabajo surge de una necesidad crítica: a medida que los modelos avanzaban, las pruebas antiguas como MMLU se saturaban con puntuaciones casi perfectas, dejando de ser útiles para discernir diferencias reales. En 2024, Chen y su equipo presentaron MMLU-Pro, una renovación exhaustiva del original. Con 12,032 preguntas de 14 disciplinas, aumenta las opciones de respuesta de 4 a 10 para reducir las conjeturas e incorpora problemas más complejos que requieren razonamiento. El resultado fue una caída del 16% al 33% en la precisión de los modelos y una evaluación más estable y discriminatoria, rápidamente adoptada por la industria. Su contribución se extiende al ámbito multimodal con MMMU, un conjunto de 11,500 preguntas que combinan imágenes (gráficos, mapas, fórmulas) con conocimientos académicos para probar una comprensión integrada. Incluso los mejores modelos como GPT-4V inicialmente solo alcanzaron un 56% de precisión, revelando un largo camino por recorrer. Su sucesor, MMMU-Pro, cierra aún más las brechas, obligando a los modelos a utilizar la información visual y no solo el texto. La experiencia de Chen, que incluye investigación doctoral en preguntas complejas y una etapa en Google DeepMind trabajando en Gemini, le permite anticipar cómo los modelos pueden "aparentar" competencia. Su laboratorio no solo diseña evaluaciones, sino que también desarrolla modelos (como UniVideo para video o MoCha para avatares), asegurando que sus "exámenes" reflejen desafíos reales y los límites actuales de la tecnología. Actualmente, Chen continúa este trabajo en el laboratorio de superinteligencia de Meta, enfocado en datos y evaluación multimodal. Su historia destaca el papel fundamental, aunque a menudo menos visible, de los investigadores que construyen las herramientas para medir el verdadero progreso de la IA.

marsbit06/20 03:54

Tras las notas de la IA, se esconde un "creador de exámenes" chino

marsbit06/20 03:54

Tiemblen humanos, la IA sigue acelerando a toda velocidad

Sí, la IA sigue avanzando a toda velocidad. Aunque algunos creían que la Ley de Escalado (Scaling Law) podría estar tocando techo, expertos en la conferencia BAAI 2026 señalaron que está lejos de agotarse. Su efecto continúa impulsando modelos de lenguaje grandes (LLM) y multimodales. La IA también está aprendiendo a "auto-evolucionarse", usando IA para escribir y actualizar código, acercándose a la posibilidad de tomar el control del mundo digital. El próximo campo de batalla clave son los **Modelos Mundiales (World Models)**, que buscan que la IA comprenda e interactúe con el mundo físico. Sin embargo, aún no existe un consenso sobre la ruta técnica óptima (basada en lenguaje, píxeles, estructuras 3D o representaciones visuales) y persisten desafíos con los datos. Se estima que su desarrollo y convergencia llevarán de 3 a 5 años más. En el frente de la aplicación, los **Agentes (Agents)** son clave para llevar la IA a la vida cotidiana. Han pasado de ser "utilizables" a empezar a ser "útiles", volviéndose más proactivos y capaces de manejar tareas complejas en campos como la medicina o la investigación. Para que sean realmente "buenos", es crucial perfeccionar el **Harness**: el marco o entorno de ingeniería que gestiona la comprensión de la intención del usuario, la planificación de tareas, la ejecución y la verificación, superando las limitaciones del modelo solo. En resumen, la IA está en una carrera acelerada en dos frentes: hacia dentro, dominando y auto-evolucionando el mundo digital; y hacia fuera, buscando comprender y actuar en el mundo físico a través de Modelos Mundiales y Agentes más competentes.

marsbit06/13 02:55

Tiemblen humanos, la IA sigue acelerando a toda velocidad

marsbit06/13 02:55

El viento de la IA 'activa' sopla en Silicon Valley: Hark obtiene 700 millones de dólares en financiación

"AI proactivo" llega a Silicon Valley: Hark recibe 700 millones de dólares en financiación. La startup de IA Hark, fundada a finales de 2025 y aún sin producto lanzado, ha recaudado 700 millones de dólares en una ronda Serie A, alcanzando una valoración de 60.000 millones. La ronda fue liderada por Parkway Venture Capital, con participación de NVIDIA, AMD Ventures, Intel Capital, Qualcomm Ventures y Salesforce Ventures. Hark, creada por Brett Adcock (fundador de Archer y Figure), busca desarrollar la próxima interfaz humano-máquina universal mediante una combinación de "modelo base propio + hardware personalizado". Su objetivo es crear hardware nativo de IA con capacidades de agente, modelos de voz de extremo a extremo, memoria altamente personalizada y sistemas multimodales que interactúen de forma natural. Este financiamiento masivo confirma una tendencia creciente: la próxima década de la IA no estará solo en las pantallas, sino en el mundo físico. La visión es pasar de la IA "reactiva" (herramienta que espera órdenes) a la IA "proactiva" (colaboradora que anticipa necesidades). Esto requiere un sistema integral que combine hardware nativo, percepción, memoria, inteligencia e interacción de bajo umbral (probablemente por voz). El artículo señala que, para este campo complejo, las empresas emergentes chinas tienen ventajas únicas: un ecosistema de fabricación completo en Shenzhen, un vasto mercado de aplicaciones y un fuerte apoyo político que prioriza la IA.

marsbit05/28 10:24

El viento de la IA 'activa' sopla en Silicon Valley: Hark obtiene 700 millones de dólares en financiación

marsbit05/28 10:24

¿Quién está definiendo el hardware de IA en 2026?

En 2026, la industria del hardware de IA está en un punto de inflexión. Las autoridades chinas han lanzado un nuevo estándar nacional que clasifica la inteligencia de los terminales en cuatro niveles (L1 a L4), definiendo las capacidades y proporcionando métodos de prueba para dispositivos como teléfonos, ordenadores y auriculares. Esto ofrece claridad a los consumidores. Paralelamente, Alibaba Cloud presentó logros en hardware con IA y un plan de apoyo para fabricantes, incluyendo su modelo líder Qwen3.7-Max. El sector avanza desde la validación conceptual hacia una adopción a escala mediante la **colaboración entre el dispositivo y la nube**. Mientras que muchos productos actuales están en L1/L2, el nivel L3 (comprensión de intención compleja y servicio proactivo) marca la frontera. Para alcanzarlo, se requiere una combinación de percepción multimodal y razonamiento, facilitada por modelos en la nube potentes como los de Alibaba Cloud. Ejemplos como el robot doméstico de Ecovacs o las cámaras de baja potencia de Yanjiwei demuestran que la colaboración dispositivo-nube es esencial: el dispositivo maneja la respuesta en tiempo real, mientras que la nube procesa tareas complejas de razonamiento y memoria. Esto convierte a los proveedores de nube en proveedores de infraestructura integral para Agent (agentes de IA). El futuro, hacia el nivel L4, implica **inteligencia de sistema y colaboración entre múltiples dispositivos** (gafas, altavoces, robots) que compartan memoria y preferencias del usuario. Esto redefine la comercialización, transformando el hardware en una puerta de entrada a servicios por suscripción y experiencias continuas, en lugar de ser un producto aislado. El estándar traza el rumbo, y la colaboración dispositivo-nube proporciona el camino para que la industria avance.

marsbit05/22 06:03

¿Quién está definiendo el hardware de IA en 2026?

marsbit05/22 06:03

Google lanza oficialmente la guerra

El Google I/O 2026 ha sido una declaración de guerra. La conferencia presentó avances agresivos en IA, centrados en tres lanzamientos clave y una estrategia de integración total. **Modelos Poderosos:** Se destaca **Gemini 3.5 Flash**, un modelo rápido que supera a versiones Pro anteriores gracias a una "destilación de conocimiento" extrema y una nueva arquitectura MoE con 256 expertos, logrando una latencia imperceptible (TTFT <65ms). **Tres Lanzamientos Clave:** 1. **Gemini Omni Flash:** Un modelo nativo multimodal para video que entiende escenas en tiempo real, con una latencia de 120ms, acercando la IA al mundo físico. 2. **Asistente Spark:** Integrado a nivel de sistema en Android 17, puede ejecutar tareas complejas entre apps con una simple instrucción de voz, simplificando la interacción. 3. **Gafas Inteligentes:** Dispositivo ligero con IA local (latencia ≤12ms) y pantalla transparente, diseñado para ser el "huésped definitivo" de la IA multimodal en primera persona. **Estrategia y Mercado:** Google anunció que Gemini supera los **900 millones de usuarios activos mensuales**, impulsado por su integración forzosa en Chrome, Android y Workspace. Complementó esto con **drásticos recortes de precios** en sus APIs (ej., Gemini 3.5 Flash es hasta 10 veces más barato que la competencia), aprovechando su infraestructura propia de TPUs para una guerra de precios. **Conclusión:** El mensaje es claro. La era de competir solo en el modelo ha terminado. Google está librando una **guerra en cuatro frentes: dispositivo, nube, ecosistema y hardware**, utilizando su escala, datos, integración y precios bajos para redefinir el acceso a la IA y desafiar a competidores como OpenAI y Apple.

链捕手05/21 14:01

Google lanza oficialmente la guerra

链捕手05/21 14:01

活动图片