Las actuales empresas de inteligencia embodiente graban sus vídeos de demostración con un acabado tan pulido y exagerado como un anuncio, pero ¿has visto alguna vez un vídeo real sin un solo corte?

Hace unos días, un amigo de la industria me envió una demostración de 10 minutos, grabada en un solo plano, sin cortes, sin control remoto externo, sin instrucciones manuales, incluso algo tosca, pero el contenido mostrado me hizo quedarme boquiabierto, sin poder recuperar la calma durante un buen rato (doge).
En el vídeo, el robot extiende su brazo fuera de la ventana para limpiar el cristal, cuando no alcanza un lugar alto sabe coger una caja y subirse encima, puede reanudar con precisión una tarea larga tras ser interrumpido...
Lo más impactante es que en el vídeo aparecen simultáneamente los robots de YuShu y ZhiYuan, estos dos 'competidores' con arquitecturas de hardware, grados de libertad de movimiento y sistemas de sensores completamente diferentes, comparten un mismo 'cerebro', se coordinan y colaboran estrechamente, siendo un ejemplo raro a nivel mundial de un cerebro universal que cruza diferentes plataformas físicas.
Sin exagerar, podría ser una demostración capaz de reescribir la comprensión de la industria global de la inteligencia embodiente, subvertir los juicios técnicos del sector, e incluso podría haber cambiado la Ley de Escalado...
¿De dónde ha salido este prodigio?
Desglose fotograma a fotograma del vídeo, puro momento icónico
Este vídeo contiene una cantidad de información enorme. Lo desglosé fotograma a fotograma seriamente, y cuanto más lo veía, más fascinado me sentía.
Trabajando en un espacio confinado, una estabilidad impresionante
El lugar de grabación era una habitación de alquiler de unos 15m2, con muebles densamente apilados, pasillos estrechos, donde incluso darse la vuelta era difícil. En este entorno, básicamente no hay posibilidad de operación remota (no cabe una persona) ni de scripts preestablecidos.

El diseño del entorno en este vídeo te dice directamente desde el principio: esto solo puede ser un vídeo donde el robot aprende, evoluciona y toma decisiones completamente de forma autónoma.
Dos robots realizan tareas domésticas en paralelo dentro del mismo espacio, percibiendo límites y planificando rutas en tiempo real.
Durante todo el proceso, no hubo colisiones, ni pérdidas, ni paradas, se adaptaron perfectamente a un entorno real complejo y desconocido, incluso un robot desgastado atado con una correa mostró una gran flexibilidad.
Todo el vídeo carece de cambios de plano, repeticiones de escenas o intervención de instrucciones manuales.
Extender el brazo fuera de la ventana para limpiar el cristal, la encarnación cúspide de la capacidad dinámica y el razonamiento autónomo
Desde la primera tarea, el robot mostró un lado 'delicado' y que supera la imaginación humana.
Un robot YuShu utiliza un raspador de cristales para limpiar el vidrio. Quien haya usado un raspador sabe que si aplicas poca fuerza no limpia, y si aplicas demasiada produce ruidos extraños, es más exigente en cuanto al control de la fuerza y la percepción espacial que usar un trapo. Se autoimpuso una dificultad extrema desde el principio.
Se observa que el robot limpia unas cuantas veces, pero un punto no queda limpio. Entonces, él mismo razona: la suciedad probablemente está fuera.
Así que realiza una serie de movimientos que nunca había visto: girar el cuerpo de lado, inclinarse hacia atrás, asomar la cabeza, extender el brazo, sacando por la ventana la mano que sostiene el raspador. (Estable como un perro viejo).
Algunos modelos embodientes existentes logran un buen control de fuerza como máximo, pero este robot, sobre la base de un control preciso del par de fuerzas, fusiona a la perfección la percepción del entorno espacial (al extender la mano no chocó contra el marco de la ventana) y el cálculo dinámico.
No solo lleva una capacidad individual al techo de la industria, sino que el modelo muestra además un desempeño unificado de tres en uno.
Lo que me dejó más tiempo sin recuperar la calma fue que, al no poder limpiar, inmediatamente razonó y decidió sacar la mano por la ventana para limpiar el cristal. Fue la primera vez que vi un modelo razonando y evolucionando por sí mismo como un humano.
Esto refleja plenamente la capacidad del modelo para fusionar visión, tacto, dinámicas, etc., en una percepción unificada, y poseer además la capacidad de auto-evolucionar. Esta vez, finalmente creo que los robots realmente pueden trabajar, y además, lo harán de manera más perfecta que los humanos.
Circuito cerrado de tareas secuenciales largas, rechazando la acumulación de errores
Tras limpiar el cristal, el robot YuShu deja el raspador suavemente en su sitio, con un punto de colocación preciso y movimientos fluidos.
No subestimes esta acción final, significa que completó el circuito completo de 'coger herramienta - trabajar - guardar'.
Al lado, el robot ZhiYuan se acerca a la lavadora, saca una almohadilla lavada y la coloca detrás del sofá, luego regresa, saca un muñeco lavado y lo coloca con precisión en el segundo nivel del armario; cada objeto vuelve al lugar que le corresponde.
El robot ZhiYuan accidentalmente golpeó el cristal, lo que demuestra aún más que se trata de decisiones autónomas del robot, porque a veces las cámaras no pueden resolver el reflejo del vidrio, mientras que un operador humano sí podría (doge).

Estas dos escenas son un microcosmos de las capacidades más básicas del vídeo completo de 10 minutos. En las tareas secuenciales largas, cada una se completa de forma fluida, precisa y de una sola vez, sin acumular errores a medida que las tareas aumentan en número y duración, sin empeorar progresivamente.
Esto soluciona el punto débil de los modelos VLA tradicionales, que más temen las secuencias largas de tareas.
Solo por el desempeño de los movimientos, el modelo debe usar una arquitectura completamente nueva. En la cadena de tareas de 10 minutos, corrige errores continuamente y mantiene una salida estable, cada movimiento es preciso y controlable, su robustez puede calificarse como de primera clase en la industria.
Las tareas pueden interrumpirse a voluntad, el modelo puede reanudar desde el punto de interrupción
A continuación, en la imagen aparece el sonido de un despertador. (Al amplificar el sonido y escuchar con atención, no es muy evidente).
Al principio no entendí la intención del despertador, pero tras verlo repetidamente descubrí que el despertador es algún tipo de recordatorio preestablecido que interrumpe la tarea actual de los dos robots, haciendo que comiencen a ejecutar la tarea especial de guardar los objetos de la mesa y la nevera.
Lo sorprendente es que, después de guardar los objetos de la mesa y la nevera, el robot continúa reanudando la tarea que estaba realizando antes de la interrupción. Esto muestra que el modelo posee la capacidad de interrumpirse en cualquier momento, reanudar desde el punto de interrupción y recuperar tareas.
Comparado con las demostraciones actuales del mercado que solo pueden completar una tarea y requieren un cuidado exquisito, este vídeo tosco muestra la capacidad del robot en un entorno de trabajo real, no solo de ser resistente, sino incluso de poder 'hacer dos cosas a la vez' de manera excepcional.
A continuación hay un largo proceso completo de organización doméstica: el robot YuShu toma una bolsa de almacenamiento y la coloca en la mesa; el robot ZhiYuan, al ver comida encima de la nevera, juzga que debe almacenarse en frío y actúa de inmediato, aprovechando para sacar los alimentos que deben descongelarse (supongo que este misterioso equipo podría estar insinuando que el robot pronto podría preparar cuatro platos y una sopa).
Durante todo el proceso no hay instrucciones paso a paso, el robot descompone las tareas de forma autónoma, planifica movimientos y completa paso a paso todo el flujo desde tomar objetos hasta colocarlos.
La gran mayoría de los robots actuales solo pueden ejecutar procesos secuenciales de una sola tarea; si encuentran una interferencia en medio, la tarea básicamente colapsa. Pero este modelo posee una capacidad de juicio de prioridades de tareas y planificación dinámica a nivel humano, puede cambiar el flujo de tareas en cualquier momento. Esta flexibilidad y estabilidad muestran una inteligencia que supera con creces la de cualquier modelo conocido en el mercado.
ZhiYuan le pone una bufanda a YuShu, el icónico momento de colaboración entre plataformas físicas
Luego, aparece el clímax de todo el vídeo.
Los dos robots parecen haberse puesto de acuerdo: los dos hermanos deben organizar los objetos dispersos en la mesa de una vez, sin transportarlos de un lado a otro repetidamente.
Así que YuShu coloca objetos constantemente sobre su cuerpo, hasta que tiene las manos llenas y no sabe cómo proceder. En ese momento, el robot ZhiYuan se acerca gentilmente, toma lentamente una bufanda de la mesa y la coloca alrededor del cuello del robot YuShu.
El robot ZhiYuan descubre que la bufanda es larga, así que la sostiene con ambas manos. Entonces, YuShu parece entender la intención de ZhiYuan, se inclina, y ZhiYuan pasa la bufanda alrededor de la cabeza de YuShu y la coloca en su cuello.
¡¿En serio, hermano?! ¡Esta fluidez y la interacción de sus 'miradas', incluso transmiten una sensación de pareja!
El vídeo no muestra una división del trabajo preestablecida, sino un esquema de colaboración que el modelo exploró autónomamente entre dos robots de plataformas físicas diferentes. Dos robots de marcas diferentes, que juzgan autónomamente sus respectivos límites de capacidad y se complementan perfectamente, se acercan infinitamente a la colaboración humana, incluso pareciendo más coordinados al no haber lenguaje.
Esta podría ser la primera interacción entre plataformas físicas diferentes en el mundo, y también la primera vez que aparece en el mundo un modelo capaz de ser universal entre plataformas físicas.
Supongo que este misterioso equipo quiere decirle a todos con dos plataformas físicas que son mutuamente competidoras: este es el verdadero cerebro universal.
Colgar la toalla, llevar las zapatillas, ¿acaso el robot no solo trabaja, sino que ya empieza a 'flojear'?
YuShu, cargado con objetos, se aleja lentamente, mientras ZhiYuan continúa guardando los objetos restantes.
En ese momento, toma una toalla e intenta colgársela sobre sí mismo. Lo intenta una, dos, tres veces, y finalmente la coloca sobre su hombro.
¡Tres impactos seguidos!
El robot parece saber qué es lo menos costoso: colgar la toalla sobre el hombro requiere menos esfuerzo que llevarla en la mano.
El modelo puede aprender autónomamente, tras fallar una y dos veces, optimiza continuamente hasta tener éxito.
El modelo puede comprender su propia plataforma física, lo que quizás sea la razón central por la que puede aplicarse entre diferentes plataformas.
Este no es un caso aislado.
Observa con atención: cuando el robot organiza las zapatillas, lleva las nuevas colgándolas del cordón en lugar de sujetar la zapatilla en sí, porque llevar el cordón requiere menos esfuerzo.
¡Otra vez impactado! Mientras otros robots aún se visten con esmero para trabajar, ¿este modelo no solo ha trabajado, sino que directamente ha aprendido a 'flojear'? Esto es muy inteligente.
Otro clímax: el robot aprende a usar herramientas, intenta subirse a una caja para ganar altura
Y aún no termina. Aparece la escena que más me impactó. En el proceso de colocar cada objeto que llevaba colgado por todo el cuerpo, cómo poner la bufanda en el tercer nivel del armario dejó perplejo al robot YuShu G1, que mide solo 1.3 metros.
¡Aparece un momento divino! No se bloquea ni se rinde, sino que, razonando como un humano, ¡encuentra una caja! Sí, ¡encuentra una caja! Intenta subirse a la caja para ganar altura y probar de nuevo.
Se observa que encuentra una caja cercana, la empuja al suelo, intenta agacharse para levantarla, pero descubre que no puede agacharse.
Tras intentarlo varias veces, justo cuando pensaba que finalmente se rendiría, ¡de forma asombrosa da una patada a la caja hacia el borde del armario!
Todo el proceso refleja:
Capacidad de razonamiento propio y toma de decisiones. El robot comprende cómo puede alcanzar objetos altos, cómo puede mover la caja cuando no puede agacharse.
Exploración continua por parte del modelo de los límites de su cuerpo. En el proceso de intentar agacharse repetidamente, el robot parece comprender cada vez mejor los límites de su cuerpo y toma decisiones acordes a sus capacidades.
Proceso de auto-evolución. El robot, sin ningún proceso de enseñanza, de repente aprendió a usar el pie para patear la caja, aprovechando su propio cuerpo para evolucionar en el entorno.
Esta escena realmente me dejó la piel de gallina.
Recordemos que la capacidad de usar herramientas de forma autónoma es una característica distintiva humana.
Y el robot del vídeo realmente aprendió a usar herramientas. Sabe que la caja puede soportar peso, sabe que subirse encima aumenta la altura, e incluso sabe que cuando no puede agacharse puede usar el pie para patear.
Detrás de esta serie de acciones hay una comprensión profunda de las reglas del mundo físico, una exploración continua de las propias capacidades y la unión de estas dos con la evolución autónoma de la toma de decisiones.
Complementariedad de capacidades entre plataformas físicas, trabajo colaborativo, del individuo al grupo
YuShu patea la caja hacia allá, la desvía. Mientras piensa cómo enderezarla, el ZhiYuan Expedition A3, de 1.7m, se acerca. Parece entender la determinación y la dificultad de YuShu, deja el carrito pequeño que llevaba (cambia de tarea activamente) y decide ayudar a su compañero.
Se observa que, como en una ceremonia de graduación, YuShu se inclina y baja la cabeza, y ZhiYuan retira lentamente la bufanda y la coloca en el estante.
Cada paso en los detalles refleja capacidades que desprecian a otros modelos.
La comprensión y coordinación de los dos robots sobre sus capacidades de hardware propias y mutuas trascienden la inteligencia individual, dirigiéndose hacia la inteligencia colectiva.
ZhiYuan pasa la bufanda por detrás de la cabeza de YuShu para poder retirarla con habilidad (aquí se puede imaginar cómo otros robots tirarían de la bufanda), demostrando una comprensión extrema del control de fuerza y la percepción espacial.
El robot dobla la bufanda en tres partes, es un juicio autónomo sobre cómo colocarla mejor en el armario; esta es la verdadera inteligencia embodiente.
Finalmente, después de ayudar a YuShu, ZhiYuan se aleja silenciosamente y coloca la última prenda de ropa firmemente dentro de la lavadora (supongo que juzgó que la ropa colgada sobre la lavadora estaba sucia). Así termina finalmente este plano secuencia de diez minutos.
Aunque desconozco la arquitectura de este modelo, creo que todos, al igual que yo, están asombrados.
Primera colaboración entre plataformas físicas diferentes, primera vez que se ve la auto-evolución de un robot, primera vez en la toma de decisiones autónomas similar a la humana eligiendo el camino óptimo, percepción espacial y control de fuerza extremos, interrupción arbitraria de tareas, aprender a usar herramientas... cada movimiento, cada fotograma de este modelo es una buena demostración por sí mismo, pero simplemente aparecen en este vídeo de diez minutos en plano secuencia, presentados de una manera tan simple y directa.
Transmitiendo una sensación de maestría despreocupada, al alcance de la mano con aparente facilidad.
La tecnología subyacente sale del marco fijo de los modelos principales
¿Por qué los robots en el vídeo pudieron mostrar tantos momentos icónicos?
Supe por fuentes informadas que la razón más importante es que este modelo sale de todos los marcos fijos de los modelos embodientes principales actuales.
Los modelos embodientes principales actuales pueden dividirse aproximadamente en tres categorías: VLA, WAM y los modelos mundiales tradicionales. Todos tienen cuellos de botella que por ahora no pueden superar.

△Imagen generada por IA
En concreto, VLA es la 'corriente intuitiva de datos', que se basa en enormes cantidades de datos visuales, lingüísticos y de movimiento para realizar ajustes extremo a extremo. Pero su esencia es 'adivinar el movimiento a partir de imágenes', carece de capacidad de razonamiento físico, las tareas secuenciales largas acumulan errores continuamente, la capacidad de generalización en escenarios desconocidos es casi nula, y está altamente vinculado a una plataforma física exclusiva.
Mientras que WAM y los modelos mundiales tradicionales son la 'corriente especulativa y abstracta', que intentan modelar primero las leyes del mundo y luego planificar acciones, pero sufren del problema fatal de 'separación entre conocimiento y acción'. El modelo puede comprender la escena y predecir estados, pero frente a escenarios prácticos que requieren razonamiento dinámico-físico, aún depende de la deducción a partir de datos de entrenamiento y no puede adaptarse a las variables dinámicas del entorno real.
Estos modelos embodientes principales comparten un defecto subyacente fatal: el ajuste de tareas impulsado por datos.
Es decir, todas las acciones son 'conjeturas probabilísticas' basadas en grandes volúmenes de datos, y no en una comprensión profunda de las reglas físicas. Esto hace que el límite superior de las capacidades del modelo esté firmemente bloqueado por los datos de entrenamiento.
Y se dice que el modelo del vídeo se entrenó con solo unas decenas de horas de datos de vídeo. ¿Que con tan poca cantidad de datos pueda lograr un efecto tan asombroso? ¿Sigue existiendo la Ley de Escalado? Realmente hay que ponerlo en duda. (Preaviso de caída bursátil en EE.UU.)

Observando los detalles, el modelo del vídeo muestra al menos cuatro capacidades que los modelos VLA y mundiales actuales no pueden alcanzar:
Modelado dinámico: Las trayectorias cumplen la viabilidad dinámica, pueden calcular compensaciones de par y términos de prealimentación, capacidad de generalización extrapolativa excelente.
Capacidad de autoconciencia: No como VLA que depende de reflejos condicionados, ni como WAM que depende de estadísticas secuenciales; piensa como un humano 'cuál es el siguiente movimiento más cercano al objetivo'.
Capacidad de adaptación: Puede complementar el razonamiento causal, resolver problemas de cola larga, evolucionar mientras actúa.
Capacidad de auto-evolución: En el proceso de completar tareas, las habilidades aumentan por sí mismas, las estrategias evolucionan autónomamente, como si pudiera autogenerar objetivos de aprendizaje y razonar activamente para lograr valor.
Sosteniendo todo esto están tres núcleos tecnológicos subyacentes.
Aprendizaje dinámico con restricciones físicas. A diferencia del modo de entrenamiento puramente impulsado por datos de VLA y WAM, su núcleo es la preposición de reglas físicas, impulsado por predicciones dinámicas. Llevar las zapatillas del cordón, colgar la toalla en el hombro, subirse a una caja para ganar altura, no fueron enseñados por datos, son las soluciones óptimas que el modelo exploró autónomamente interactuando con el entorno.
Modelado unificado entre plataformas físicas. A través de un espacio de representación de acciones unificado y mecanismos de adaptación a la plataforma física, permite que el mismo conjunto de modelos se adapte a diferentes marcas y arquitecturas de hardware. Equivale a haber completado el 'desacoplamiento de software y hardware' para la inteligencia embodiente, poniendo fin a la era del algoritmo vinculado al hardware.
Circuito cerrado robusto de secuencias largas. Basado en un marco de planificación de tareas global, maneja autónomamente las interferencias inesperadas, errores de movimiento y cambios de tarea durante todo el proceso, evitando el problema de colapso por acumulación de errores en flujos largos de los modelos tradicionales. Posee la capacidad central para implementarse en entornos reales complejos, como hogares.

Si conoces la situación actual de los modelos embodientes, probablemente también se te caerá la mandíbula después de leer lo anterior.
Mientras las demostraciones de otros equipos aún acumulan tareas únicas de corta duración, pulidas y recortadas, este misterioso vídeo ya ha completado una implementación real en escenario real de 10 minutos sin cortes, entre marcas, con múltiples colaboraciones, flujo completo y auto-evolución.
Mientras otros modelos aún 'adivinan movimientos basándose en datos', este modelo parece haber logrado una toma de decisiones, aprendizaje y evolución completamente autónomos. Les muestra a todos que los robots no solo realmente pueden trabajar, sino que sus capacidades aún se auto-evolucionan rápidamente, dando un espacio de imaginación infinito.
Lo más importante es que este modelo parece hacernos ver que el futuro, sobre el que todos discuten acaloradamente si llegará en tres, cinco o diez años, en el que los robots realmente puedan sustituir a los humanos en el trabajo, hoy aparece ante tus ojos.

Un equipo desconocido, parece haber subvertido todas las rutas técnicas, subvertido la Ley de Escalado, creado la verdadera inteligencia embodiente, acercándose al momento ChatGPT de la inteligencia embodiente.
Actualmente aún no se sabe de quién es este misterioso modelo, pero creo que en este momento, la duda de todos es la misma que la mía: ¡¿Quién es?!
¡¿Algún experto tiene información confidencial?!
Este artículo proviene de la cuenta oficial de WeChat 'Quantum Bit' (ID: QbitAI), autor: Noé






