El 19 de agosto, Unitree cotizó en la Bolsa de Ciencia y Tecnología (SSE STAR Market). La acción abrió a 1100 yuanes por acción, con una capitalización bursátil de aproximadamente 4,449 billones de yuanes.
Ese mismo día, Huang Minshan, hija del CEO de NVIDIA, Jensen Huang, aterrizó en Beijing para visitar el Congreso Mundial de Robótica (WRC).

Justo al día siguiente, en la madrugada, hora de Beijing, la empresa de robótica de Silicon Valley, Generalist AI, lanzó su nuevo modelo base, GEN-1.5.
Hace dos meses, la profesora de Stanford, Li Feifei, invirtió personalmente en la ronda de financiación de 400 millones de dólares de Generalist AI. En esa misma ronda, los inversores ángeles fueron el cofundador de Xiaomi, Lin Bin, y el fundador de Zoom, Eric Yuan. NVIDIA también es accionista. El dinero inteligente y la gente inteligente se dirigen simultáneamente hacia la misma dirección.
GEN-1.5 proporcionó la razón de su inversión: mostrar al robot una demostración de una acción de 3 a 12 segundos, sin entrenamiento ni ajuste fino, ejecución inmediata, con una tasa de éxito promedio del 59% en 10 tareas de manipulación.

Antes, enseñar a un robot a abrir una tapa requería tres meses de programación por parte de un ingeniero. Ahora, la inversión total necesaria es una demostración de tres segundos y cero líneas de código.
Varios investigadores destacados han comparado este momento con el lanzamiento de GPT-3 en 2020, considerando que la inteligencia encarnada (embodied AI) ha alcanzado su propio "momento GPT-3".

Estrategias no enseñadas emergen del pre-entrenamiento
Lo que más impresionó a los investigadores sobre GEN-1.5 no fue su capacidad de imitación, sino su capacidad para improvisar.
Generalist AI realizó un experimento: usar 5 minutos de datos de demostración humana (con solo 1 paso de gradiente de ajuste fino) para enseñar al robot a barrer bloques de construcción hacia un tazón con un cepillo, y luego reemplazar la herramienta.
Le dieron un plátano, y usó el plátano como cepillo, barriendo los bloques hacia el tazón — esto no es sorprendente, la forma y la estrategia de contacto del plátano son similares a las del cepillo.

Le dieron un recogedor; abandonó la estrategia de "barrer", usó la otra mano para empujar los bloques sobre el recogedor, lo levantó y volcó los bloques en el tazón.

"Barrer" y "recoger y volcar" son dos secuencias de contacto completamente diferentes, y esta última no fue enseñada en los datos de entrenamiento.
Generalist AI realizó una búsqueda de vecino más cercano en el lenguaje en aproximadamente 1.89 millones de escenas de pre-entrenamiento y no encontró un uso similar del recogedor.
Nadie le dijo al modelo en ninguna etapa que debería hacer esto.
Comportamientos improvisados similares aparecieron repetidamente en las pruebas: el tazón estaba cubierto con una hoja de papel, el modelo levantó la hoja para colocar los bloques, y a veces incluso volvió a cubrirlo, pero esa escena no estaba en los datos de entrenamiento.

Un bloque de Lego se pegó a la punta del dedo mecánico; el modelo lo desprendió con la otra mano.

Los datos de entrenamiento solo mostraron girar la tapa de un frasco con una mano; en algunos intentos, el modelo cambió espontáneamente a una operación con dos manos, adoptando una estrategia de agarre y giro completamente diferente.

Un modelo entrenado solo para colocar un bloque en un tazón comenzó a clasificar espontáneamente múltiples bloques por color.
Todas estas capacidades tienen una fuente común: el pre-entrenamiento a gran escala.
GEN-1.5 ha estado en pre-entrenamiento continuo durante más de 8 meses, pasando por tres fases de entrenamiento.
La curva del conjunto de validación publicada por Generalist AI muestra que el "error de predicción de la siguiente acción" del modelo continúa disminuyendo, sin mostrar signos de convergencia hasta ahora.
En términos del campo de los grandes modelos de lenguaje, esto es la Ley de Escalado (Scaling Law) para la Inteligencia Encarnada: a medida que aumenta la escala de los datos de interacción física y se prolonga el tiempo de entrenamiento, la capacidad de generalización del modelo continúa mejorando.
Un descubrimiento contrario a la intuición hizo esta línea de evidencia aún más clara: cuantos menos pasos de gradiente en el ajuste fino, mayor es la capacidad de improvisación.
La explicación de Generalist AI es que un ajuste fino ligero acerca más al modelo a la amplia biblioteca de comportamientos acumulados durante el pre-entrenamiento, preservando más "experiencia física" que puede ser invocada.
10 pasos de gradiente solo cambiaron el 0.15% de los parámetros del modelo.
La declaración de Generalist AI es: esto ya se acerca a "recordarle al modelo algo que ya casi sabe".
GEN-1.5 también superó dos brechas que han plagado durante mucho tiempo el campo de la robótica.
Grabar una demostración en un simulador (a pesar de que los datos de pre-entrenamiento no contienen datos de simulación), introducirla en la ventana de contexto, y que el robot real ejecute la tarea directamente, además de generalizar a diferentes manos mecánicas y nuevas posiciones de objetos.
En algunas pruebas, una persona demostró directamente la acción con sus propias manos frente a la cámara del robot, y el robot luego replicó la tarea con su mano mecánica.
Generalist AI afirma que todas estas capacidades no son el resultado de un diseño intencional: no hubo cambios de arquitectura específicos para promover el aprendizaje en contexto (in-context learning), ni ciclos de metaaprendizaje, ni objetivos de entrenamiento auxiliar para fomentar la improvisación.
Estas capacidades surgieron por sí mismas del pre-entrenamiento con datos físicos a gran escala.
"El Santo Grial del Aprendizaje de la Manipulación"
Otros equipos de investigación han mostrado previamente capacidades similares de aprendizaje en contexto, pero limitadas a pocos tipos de tareas; la novedad de GEN-1.5 radica en su amplitud de cobertura; todos los resultados fueron reportados por Generalist AI y aún no han sido verificados de forma independiente.
Las tareas en sí mismas son operaciones de corto alcance simples (abrir tapas, cerrar cremalleras), aún muy lejos de las tareas complejas de largo alcance en escenarios reales.
GPT-3 se lanzó en junio de 2020. Desde GPT-3 hasta ChatGPT pasaron dos años y medio (sí, dos años y medio).
La posición actual de GEN-1.5 es similar a la de GPT-3 en 2020: capacidades rudimentarias pero dirección clara, tareas simples pero tendencia de escalado clara.
Generalist AI escribió en su blog oficial una reflexión profunda:
Después de superar un cierto umbral de pre-entrenamiento, el costo de adaptarse a una nueva tarea se vuelve insignificante.
El aprendizaje en contexto emergente, unos segundos de datos, o un paso de gradiente más un minuto de demostración, ya no son un entrenamiento específico para una tarea en el sentido tradicional, sino que se acercan más a recordarle al modelo algo que ya casi sabe.

Si la curva de escalado de la inteligencia encarnada realmente no muestra signos de convergencia (Generalist AI dice que aún no lo han visto), entonces el recurso central de la próxima ronda de competencia se convierte en quién tiene suficientes datos de interacción física para alimentar este motor.
Este guión es idéntico al de la batalla por los datos en la que entraron los grandes modelos de lenguaje en 2021.
Aprender viendo una vez, el punto de inflexión detrás de los números 59% y 83%
En junio de 2020, OpenAI lanzó GPT-3.
Este modelo hizo algo que nadie había logrado entonces: sin necesidad de reentrenamiento, con solo dar algunos ejemplos en el cuadro de diálogo, podía completar nuevas tareas lingüísticas — dar un conjunto de ejemplos "rojo→manzana, amarillo→plátano", y luego preguntar "verde→?", podía responder "sandía".
Esta capacidad se llama aprendizaje en contexto (in-context learning) y fue el punto de inflexión que transformó a los grandes modelos de lenguaje de "herramientas especializadas" a "plataformas generales".
GEN-1.5 trasladó lo mismo al mundo físico.
Generalist AI lo llama Physical Prompting (Inducción Física).
El método de operación es directo: una demostración de acción real (que contiene datos de sensores y trayectorias de movimiento) se introduce en la ventana de memoria de contexto de 30 segundos del modelo, y el espacio restante se utiliza para recibir observaciones ambientales en tiempo real.
El modelo intenta ejecutar inmediatamente, sin ningún paso de entrenamiento en todo el proceso.
Aquí es necesario explicar un concepto crucial para entender GEN-1.5: paso de gradiente (gradient step).
En el enfoque tradicional, enseñar a un robot una nueva tarea requiere decenas de miles de pasos de descenso de gradiente, cada uno es un ajuste fino de los parámetros internos del modelo — este proceso generalmente requiere muchos datos y mucha potencia de cálculo.
El modo one-shot (de un solo ejemplo) de GEN-1.5 omite todos los pasos de gradiente; los parámetros del modelo permanecen inalterados.
Generalist AI evaluó el desempeño de GEN-1.5 en 10 tareas de manipulación diferentes: abrir la tapa de un frasco de vidrio, cerrar la cremallera de un estuche para lápices, sacar dinero de una cartera, doblar papel, apilar vasos, voltear un teléfono, barrer bloques con un cepillo, abrir la portada de un libro, rasgar un cojín al vacío, barrer basura.
Los resultados se dividen en dos grupos:
One-shot (ver una vez, cero pasos de gradiente): tasa de éxito promedio del 59% en 10 tareas (desviación estándar ±10%).
Few-shot (pocos ejemplos, 5 minutos de datos, aproximadamente 50 demostraciones, 10 pasos de gradiente): tasa de éxito promedio del 83% (desviación estándar ±9%).

Para comparar, los números de GPT-3 en 2020 en tareas lingüísticas: one-shot aproximadamente 45%, few-shot (aproximadamente 100 ejemplos) aproximadamente 65%.
La estructura de ambos conjuntos de números es muy similar.
El significado de estos números se puede entender así: antes de la aparición de los grandes modelos de lenguaje, hacer que una IA realizara una nueva tarea lingüística (como traducir un formato no visto antes) requería recopilar datos específicos y entrenar un nuevo modelo, un ciclo que tomaba meses.
Después de GPT-3, esto se convirtió en "escribir algunos ejemplos en el cuadro de entrada", reduciendo el costo de tiempo de meses a segundos.
GEN-1.5 hizo la misma compresión en el campo de la manipulación física.
Antes, enseñar a un robot a abrir una tapa requería meses de programación por parte de un ingeniero o alimentar decenas de miles de datos de entrenamiento y ajustar parámetros repetidamente.
Ahora, una demostración de 3 a 12 segundos es suficiente.
Generalist AI escribió en su blog oficial: Esto cambia dos cosas: la velocidad a la que los robots se vuelven útiles (de meses a segundos), y quién puede usar robots (de expertos a cualquiera).

Una semana de ebullición robótica: Unitree cotiza, el Congreso Mundial de Robótica y los Juegos Deportivos se inauguran simultáneamente
El lanzamiento de GEN-1.5 coincide con la semana más intensa de toda la industria de la inteligencia encarnada.
A partir del 19 de agosto, el Congreso Mundial de Robótica (WRC) se inauguró en Yizhuang, Beijing, con más de 300 empresas, más de 2000 productos expuestos y más de 150 nuevos lanzamientos globales concentrados.
Tres días después, el 22 de agosto, los segundos Juegos Deportivos Mundiales de Robots Humanoides comenzaron en el Estadio Nacional de Patinaje de Velocidad "Cinturón de Hielo" — 666 equipos con 2056 robots participaron en 1301 competiciones de 51 eventos, un aumento del 138% en el número de equipos respecto a la primera edición.
Los juegos incluyeron por primera vez 21 eventos de escenarios, que requerían que los robots humanoides completaran tareas de largo alcance en entornos reales como fábricas, hoteles y servicios domésticos, siendo el "prueba de trabajo real" de los robots el tema central.
Unitree, que acaba de cotizar, tuvo una producción de más de 5500 robots humanoides en 2025, ocupando el primer lugar a nivel mundial, con ingresos de 17 mil millones de yuanes y un margen bruto del 60%. DeepSeek también participó en la colocación estratégica.
Pero el folleto de Unitree esconde un conjunto de datos contrastantes: en el primer trimestre de 2026, la tasa de crecimiento de los ingresos cayó del 332.64% interanual al 68.49%, y el beneficio neto después de deducciones no recurrentes disminuyó un 52.55% interanual. La razón principal de la desaceleración del crecimiento fue el aumento significativo de la inversión en I+D.
Lo que Unitree está persiguiendo es precisamente lo que aún no tiene: un gran modelo de inteligencia encarnada.
"New Standpoint Pro" escribió en un análisis ("El folleto de Unitree esconde la ansiedad sobre la 'fecha de caducidad' del milagro de la ingeniería") sobre el dilema estructural que enfrenta Unitree: Unitree construyó el cuerpo con mayor producción mundial, pero "falta el cerebro".
2026 ha sido llamado el "año de las salidas a bolsa" para la inteligencia encarnada, con más de 20 empresas que han aclarado planes de cotización, pero lo que impulsa la ola de ofertas públicas es en gran medida la presión financiera.
Muchos competidores dependen de rondas de financiación sucesivas para mantener sus operaciones, y el ritmo de I+D está dirigido por las ventanas de financiación.

Fuente: LatePost "El juego del dinero de la inteligencia encarnada"
Wang Xingxing, fundador de Unitree, declaró públicamente en el WRC que el principal cuello de botella que limita el desarrollo de los robots humanoides es el gran modelo de inteligencia encarnada, "se espera que en un futuro cercano, en dos o tres años, o en cinco a diez años como máximo, se logre el momento ChatGPT de los robots".
El lanzamiento de GEN-1.5 puede verse como la primera respuesta empírica a este juicio.
La Ley de Escalado existe en el campo de la inteligencia encarnada, y el pre-entrenamiento a gran escala puede hacer que el costo marginal de adaptación a nuevas tareas se acerque a cero.
Esta conclusión tiene implicaciones industriales directas para fabricantes de cuerpos como Unitree: una vez que los modelos generales a nivel de "cerebro" maduren, el valor del cuerpo dependerá de la rapidez con que pueda conectarse a ese cerebro, y no solo de los parámetros de hardware y la escala de producción.
Los antecedentes del equipo de Generalist AI son muy coherentes con esta línea tecnológica.
Los cofundadores Pete Florence y Andy Zeng provienen del equipo de robótica de Google DeepMind, y Andrew Barry viene de Boston Dynamics.

De izquierda a derecha: Pete Florence, Andrew Barry, Andy Zeng
La empresa completó una ronda de financiación de 400 millones de dólares en junio de 2026, liderada por Radical Ventures, con participación de NVIDIA y Bezos Expeditions, y una valoración posterior a la inversión de 20 mil millones de dólares.
Generalist AI está negociando una nueva ronda de financiación con una valoración de 30 mil millones de dólares.
Los magnates de Silicon Valley viven un momento de ebullición colectiva, algo que no ocurría desde hacía tiempo
Este lanzamiento generó una fuerte reacción en la comunidad de investigación en robótica.
El cofundador Pete Florence escribió en X:
Desde que comencé a investigar modelos base para robótica, el aprendizaje en contexto (in-context learning) amplio y de un solo ejemplo (one-shot) ha sido el objetivo más claro en mi mente.
Ahora veo casi una década de imaginación convertirse en realidad en el mundo real.

Florence mencionó que él y Andy Zeng discutieron en la escuela de posgrado una capacidad de "Ctrl-C-Ctrl-V": ver una acción y que el robot la copie — pero lograrlo era extremadamente difícil porque "el mundo en el que quieres pegar nunca es el mismo que el mundo del que copiaste".
El investigador en robótica de la Universidad Carnegie Mellon, Chris Paxton, calificó a GEN-1.5 en X como "posiblemente el verdadero momento GPT" y escribió:
El Santo Grial del aprendizaje de la manipulación, sin duda, es el aprendizaje de un solo ejemplo (one-shot learning).

https://x.com/chris_j_paxton/status/2090270734816092334

https://x.com/chris_j_paxton/status/2090210797125611972
El investigador de inteligencia encarnada de la Universidad Northeastern, Jimmy Yang, dijo al retuitear:
Como investigador de IA encarnada, este es un momento verdaderamente especial para este campo.

https://x.com/JimmyTYYang1/status/2090202923632366073
El comentario de Jim Fan, Director de Tecnología de Robótica en NVIDIA, proporcionó una perspectiva técnica profunda.
Señaló dos factores clave para las capacidades emergentes de GEN-1.5:
Primero, los patrones de acciones repetitivas simétricas que existen naturalmente en los datos de entrenamiento, como atornillar repetidamente al ensamblar muebles, donde el segundo tornillo es un "ejemplo de aprendizaje en contexto" del primero;
Segundo, las acciones de recuperación después de errores humanos en los datos, como recoger algo que se cayó y continuar; este arco completo de "fracaso-recuperación-continuación" permite que el modelo muestre naturalmente capacidad de corrección de errores durante las pruebas.
Jim Fan también señaló que el método de recopilación de datos UMI utilizado por Generalist AI (operación humana directa usando pinzas robóticas) preserva la "intuición física" humana, mientras que la teleoperación tradicional a través de dispositivos de realidad virtual hace que se pierda mucha de esta intuición.

https://x.com/DrJimFan/status/2090465981240086992
Por supuesto, también existe un baño de realidad fría.
Jim Fan escribió en los comentarios del mismo tuit:
Las demostraciones actuales aún son un poco demasiado simples para sacar conclusiones.

https://x.com/DrJimFan/status/2090469108764823587
Este artículo proviene del WeChat Official Account "New Zhiyuan", autor: ASI启示录





