Artículos Relacionados con IA encarnada

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "IA encarnada", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

Observación semanal de WEEX Labs: La "reconfiguración del poder" en la infraestructura de IA y el "movimiento de inmersión profunda" en la economía real

La semana a mediados de julio de 2026 marca un punto de inflexión crucial para la industria global de la IA: el poder de distribución de la capacidad de cálculo está migrando de los "gigantes de la nube" a los "poseedores de computación", y el valor de la IA se ha anclado definitivamente en la "penetración industrial real", dejando atrás la "carrera de parámetros". El panorama se redefine con la entrada de Meta en el mercado de la nube con "MetaCompute", desafiando a actores tradicionales. Esto integra "capacidad de cálculo + modelos + datos" en un servicio unificado, comprimiendo el espacio para proveedores más pequeños y forzando a los usuarios a elegir plataformas basándose en el ecosistema de modelos subyacente. Paralelamente, los modelos base chinos de código abierto (como DeepSeek-V4) alcanzan niveles de primer orden mundial, centrando la competencia en la "relación calidad-precio extrema" y la "adaptación al escenario". Esta reducción de costes permite a las empresas enfocarse en el despliegue privado y la integración profunda en los negocios. La inteligencia embodada da el salto de los laboratorios a la "capacitación en escenarios reales" en fábricas, impulsada por políticas. El enfoque del capital se desplaza del espectáculo a la estabilidad operativa y la validación en líneas de producción reales en logística y automoción. La gobernanza global, establecida en foros como la WAIC y la UIT, evoluciona de principios éticos abstractos a marcos operativos para la "IA soberana", elevando las barreras de cumplimiento normativo geopolítico. La "conformidad" se convierte en un requisito de acceso desde el diseño del producto. **Resumen de WEEX Labs:** La prosperidad de la IA se está integrando profundamente en la manufactura global. Las recomendaciones clave para las empresas son: 1) Adoptar un enfoque de "código abierto/privatización" para construir repositorios de conocimiento propios y garantizar soberanía de datos. 2) Mantener diversidad de proveedores de nube para evitar el "bloqueo por capacidad de cálculo" y la pérdida de poder de negociación. 3) Buscar oportunidades en la "infraestructura embodada" como proveedor de servicios de datos, simulación industrial o adaptación de capacidad de cálculo para fábricas, más que en la fabricación de robots mismos.

marsbit07/19 05:17

Observación semanal de WEEX Labs: La "reconfiguración del poder" en la infraestructura de IA y el "movimiento de inmersión profunda" en la economía real

marsbit07/19 05:17

JD.com y Mira Murati, ex CTO de Open AI, apuestan por la misma pista de IA

Imagina que una persona mayor que vive sola se cae en casa y no puede pedir ayuda. Su dispositivo inteligente o una cámara, impulsado por IA, detecta la situación de forma autónoma y alerta a emergencias. Este no es un escenario futurista, sino el tipo de problema que busca resolver **JoyAI-VL-Interaction**, el primer modelo de interacción visiolingüística de código abierto del mundo, presentado por JD.com. En la industria de la IA, la interacción ha estado dominada por un formato de turnos: el usuario pregunta, el modelo responde. JD.com y otros, como Thinking Machines Lab de Mira Murati, identificaron la misma limitación y convergieron en una idea: la IA debe evolucionar de ser un procesador pasivo de información a un **participante activo** que "prediga el siguiente estado físico". JoyAI-VL-Interaction observa el flujo continuo de video de una cámara y decide *autónomamente* cuándo responder, cuándo guardar silencio y cuándo derivar tareas complejas a otros modelos. Su ventaja clave es colocar al **lenguaje visual como el motor principal** para la toma de decisiones, desacoplándolo del audio. Esto lo hace ideal para aplicaciones como asistencia a personas mayores o con discapacidad visual, comentarios automáticos en eventos deportivos, inspección de almacenes o robots colaborativos, donde los eventos ocurren demasiado rápido para una orden verbal. JD.com ha optado por una estrategia de **cód abierto integral** y un diseño ligero (8B parámetros), que permite ejecutar el modelo incluso con una tarjeta gráfica NVIDIA 3090. El objetivo es democratizar el acceso y acelerar la innovación. Este movimiento refleja la estrategia más amplia de JD.com: utilizar su vasta red de operaciones en el mundo físico (logística, retail, salud) como un campo de entrenamiento y una fuente de datos única para entrenar IAs que comprendan y actúen en entornos reales. Al abrir su modelo, JD.com apuesta a que la **interacción activa y proactiva** se convierta en la principal vía para que la IA entre en el mundo físico.

marsbit06/24 10:28

JD.com y Mira Murati, ex CTO de Open AI, apuestan por la misma pista de IA

marsbit06/24 10:28

Por primera vez, un VLA puramente preentrenado con videos humanos logra una manipulación hábil, y un fino ajuste con pocos datos permite el despliegue exitoso

La investigación "Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos", presentada por Microsoft Asia Research (MSRA) y la Universidad de Tsinghua, introduce el marco **VITRA**. Este sistema convierte automáticamente grandes volúmenes de videos de actividades humanas sin etiquetar en datos estructurados para entrenar modelos **Visión-Lenguaje-Acción (VLA)** aplicables a robots. El proceso clave implica: 1) extraer trayectorias precisas de movimiento 3D de las manos desde video monocular, 2) segmentar los videos en acciones atómicas basándose en mínimos de velocidad, y 3) generar instrucciones lingüísticas precisas utilizando modelos de lenguaje como GPT-4, a las que se superponen las trayectorias 3D. Tras el preentrenamiento en un extenso conjunto de datos (1 millón de clips, 26 millones de fotogramas), el modelo VLA (que combina un modelo visual-lingüístico con un experto en acción basado en difusión) muestra una fuerte capacidad de **predicción de acciones en entornos nuevos y no vistos** (zero-shot). Para el despliegue en robots reales, el modelo se ajusta con una pequeña cantidad de datos de demostración robótica (~1.2K). Este enfoque logra una **alta tasa de éxito** en tareas de manipulación diestra (como agarrar, colocar, verter o barrer) y demuestra una **excelente capacidad de generalización** a objetos y fondos no vistos, superando significativamente a modelos entrenados únicamente con datos robóticos de laboratorio. El hardware, específicamente la mano robótica diestra **星动XHAND1** (con su modelo URDF de alta precisión y arquitectura de accionamiento directo), es fundamental para lograr una **alineación efectiva** del espacio de acción entre la mano humana y la robótica, permitiendo una implementación exitosa. Además, el estudio confirma una **ley de escalado**: un mayor volumen de datos de preentrenamiento mejora continuamente el rendimiento. Este trabajo allana el camino para una manipulación robótica más generalizada utilizando videos humanos no estructurados.

marsbit06/08 08:57

Por primera vez, un VLA puramente preentrenado con videos humanos logra una manipulación hábil, y un fino ajuste con pocos datos permite el despliegue exitoso

marsbit06/08 08:57

活动图片