Artículos Relacionados con Modelo Fundacional

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Modelo Fundacional", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

El último artículo de Fei-Fei Li: Cuando la generación de vídeo, la robótica y NVIDIA se autodenominan modelos del mundo, necesitamos una taxonomía

El artículo de Fei-Fei Li clarifica el término "modelo del mundo", utilizado de manera confusa en IA, proponiendo una taxonomía basada en el ciclo POMDP (Proceso de Decisión de Markov Parcialmente Observable). Identifica tres categorías funcionales: 1) **Renderizador**: genera observaciones (píxeles) visualmente fieles para humanos, como los modelos de video Sora o Genie, pero sin comprensión física precisa. 2) **Simulador**: produce estados del mundo con precisión geométrica, física y dinámica, sirviendo tanto para visualización profesional como para entrenamiento de agentes (robots, vehículos autónomos). 3) **Planificador**: deduce acciones a partir de observaciones y objetivos, cerrando el ciclo percepción-acción, como los modelos de lenguaje-visión-acción (VLA). El artículo argumenta que el simulador es el componente clave y subestimado, pues proporciona la base estructural para la renderización y la planificación. Mientras los renderizadores tienen madurez comercial pero limitaciones físicas, y los planificadores son prometedores pero inmaduros para despliegues reales, los simuladores abarcan aplicaciones cruciales en robótica, diseño y digitalización. La tendencia actual es la fusión de estas categorías, impulsada por la idea de que comparten conocimiento subyacente. Modelos como Marble de World Labs ejemplifican esta convergencia, generando tanto representaciones visuales (splats gaussianos) como mallas para simulación física. La visión final es un **modelo del mundo unificado** capaz de alternar entre renderizar, simular y planificar según la necesidad, avanzando hacia una inteligencia espacial que permita a las máquinas entender e interactuar con el mundo físico.

marsbit07/05 09:29

El último artículo de Fei-Fei Li: Cuando la generación de vídeo, la robótica y NVIDIA se autodenominan modelos del mundo, necesitamos una taxonomía

marsbit07/05 09:29

El último artículo de Fei-Fei Li: Cuando la generación de vídeo, la robótica y NVIDIA afirman ser un modelo del mundo, necesitamos una taxonomía

En su último artículo, Fei-Fei Li aborda la confusión actual en torno al término "modelo del mundo" en IA. Propone una clasificación funcional basada en el ciclo clásico de POMDP (agente → acción → estado → observación → agente), distinguiendo tres tipos: 1. **Renderizador:** Genera observaciones (píxeles) visualmente fieles para humanos, como los modelos de generación de video (ej. Sora). Su métrica clave es la calidad visual, pero puede carecer de precisión física. 2. **Simulador:** Genera el *estado* subyacente del mundo: representaciones geométricas y físicamente precisas (geometría, dinámica). Sirve tanto para visualización profesional como para entrenar agentes de IA o robots en entornos virtuales. Li argumenta que es el componente crucial y más subestimado, pues es la base para los otros dos. 3. **Planificador:** Genera *acciones*. Dada una observación y un objetivo, decide qué debe hacer un agente (ej., un robot). Es esencial para cerrar el ciclo percepción-acción. Li señala que estos tres tipos comparten un conocimiento subyacente común sobre el mundo. El campo avanza hacia su fusión, como se ve en modelos que combinan renderizado y simulación (ej., Marble de World Labs). El objetivo final es un "modelo del mundo" unificado capaz de alternar entre estas funciones según sea necesario, lo que redefiniría la inteligencia espacial y la interacción de la máquina con el mundo físico.

链捕手07/05 09:18

El último artículo de Fei-Fei Li: Cuando la generación de vídeo, la robótica y NVIDIA afirman ser un modelo del mundo, necesitamos una taxonomía

链捕手07/05 09:18

Alibaba "reabastece", ByteDance "entrena"

**Resumen en español europeo (≈1500 caracteres):** En la última semana de mayo, dos estrategias de IA chinas contrastaron claramente. Alibaba aceleró la **implementación comercial** de la IA. Integró su modelo Qwen con Taobao, permitiendo funciones como probadores virtuales y comparación de precios con IA. Su protocolo ACT busca estandarizar pagos automatizados por agentes de IA. Financieramente, apuesta por ser la "fábrica de IA" de China, con ingresos externos de su nube creciendo un 40%, demostrando un enfoque en **ROI inmediato y monetización**. Su premisa: una brecha de capacidad en modelos base no se ampliará críticamente en 5 años. ByteDance adopta una postura de **investigación a largo plazo**. Su departamento Seed, con líneas separadas para aplicaciones e investigación fundamental, tiene como meta principal "explorar el límite superior de la inteligencia". Su modelo de video Seedance 2.0 lidera benchmarks globales. Invierten masivamente en talento (programa Top Seed) y en investigación pura, como un artículo de 8 meses sobre modelos mundiales. Su presupuesto de capital se revisa al alza de forma agresiva, posible gracias a su condición de empresa **no cotizada**, lo que le otorga paciencia para perseguir avances fundamentales sin presión trimestral por beneficios. La diferencia clave no es filosófica, sino estructural. Las empresas cotizadas como Alibaba deben priorizar la monetización para el mercado. Las no cotizadas como ByteDance pueden permitirse "entrenar" a fondo. El futuro de la estrategia de IA en China depende en gran medida de este estado financiero.

marsbit06/01 00:11

Alibaba "reabastece", ByteDance "entrena"

marsbit06/01 00:11

活动图片