¡El gran resultado de la inteligencia encarnada está por llegar!!!
Desde que Generalist lanzara la semana pasada el cerebro encarnado Gen 1.5, capaz de aprender movimientos de 3 a 12 segundos~
Justo ahora, la startup norteamericana de inteligencia encarnada Skild AI ha presentado el nuevo modelo base para robots S1, llevando directamente la duración de las tareas de aprendizaje en contexto a más de 10 minutos.

Este S1 se centra en el aprendizaje en contexto (in-context learning, ICL):
Sin necesidad de aprender específicamente nuevos datos de operación en una fase de entrenamiento posterior, simplemente viendo un vídeo de demostración humana, puede "copiar al gato dibujando al tigre" y completar directamente un conjunto completo de complejos procesos operativos nunca antes vistos.
En la demostración oficial, el robot completó tareas de larga duración como hacer tortitas, preparar café, trasplantar una planta y ensamblar equipos. Además, en tareas no vistas previamente, logró una tasa de éxito del 66%, muy superior al VLA basado en prompts lingüísticos (solo 9%).
Además, incluso siguiendo la ruta tradicional de ajuste fino (fine-tuning) posterior, para igualar el efecto de S1 viendo una sola demostración, probablemente sería necesario introducir alrededor de 380 demostraciones de la tarea.
¡Muy sorprendente!
Podría decirse que este reciente grupo de trabajos centrados en el aprendizaje en contexto ha vuelto a avivar las esperanzas de muchos en la inteligencia encarnada.
Un usuario de Twitter expresó que los robots generalistas podrían aparecer dentro de dos años, no dentro de siete.

Otro usuario comentó que desde Rhoda, pasando por Generalist la semana pasada, hasta las tareas de 10 minutos de Skild S1 ahora, el verdadero momento GPT para los robots parece estar surgiendo.

Porque una vez que esta capacidad se generalice realmente, desarrollar habilidades para robots en el futuro podría volverse realmente como escribir un Prompt para ChatGPT.

¿Es realmente tan increíble? Vamos a verlo juntos.
De la era BERT, hacia la era GPT
Para entender cómo realiza realmente el aprendizaje en contexto este S1, primero debemos ver cómo aprenden tradicionalmente los robots una nueva habilidad.
En el pipeline tradicional, el aprendizaje de los robots es bastante similar al de los grandes modelos:
Primero, se realiza un preentrenamiento masivo con datos, para aprender algunas capacidades básicas; luego, en escenarios específicos, se recopilan datos para una tarea concreta y, a través del entrenamiento posterior, el robot aprende habilidades especializadas.

El problema es que, aunque el proceso para robots y grandes modelos es similar, el costo de los datos no tiene nada que ver.
Los datos de preentrenamiento de los grandes modelos provienen en gran medida de Internet; incluso en escenarios especializados como programación o agentes, muchos datos de entrenamiento posterior pueden obtenerse rápidamente en línea, o incluso generarse automáticamente.
Pero los robots lo tienen peor. Los datos de preentrenamiento deben recopilarse en el mundo real, y los datos de entrenamiento posterior también deben recopilarse en el mundo real.
Por lo tanto, en su blog técnico, Skild AI lo deja claro:
Si un modelo base para robots todavía necesita decenas o cientos de horas de datos reales de máquina, y un reentrenamiento posterior, para cada nueva tarea, entonces, ¿dónde está la "base" de este "modelo base"?
Incluso citan investigaciones existentes que señalan que si ya hay suficientes datos para una nueva tarea, un modelo entrenado desde cero incluso podría igualar a un modelo base que ha sido preentrenado y luego ajustado.
Entonces, ¿cuál es realmente el significado del preentrenamiento encarnado?
La respuesta de Skild es: el aprendizaje en contexto.
Para tener un punto de referencia, Skild toma como comparación la trayectoria de desarrollo de los grandes modelos.
El BERT temprano ya era muy potente, pero cada vez que encontraba una nueva tarea, a menudo había que preparar datos de nuevo y ajustarlo (fine-tuning).
Lo que realmente cambió las reglas del juego fue la capacidad de aprendizaje en contexto que gradualmente se manifestó después de GPT-3:
Sin necesidad de cambiar los pesos del modelo, solo dando algunos ejemplos en el Prompt, el modelo podía "aprender" temporalmente una nueva tarea.

Basándose en esto, Skild considera que los robots actualmente están aún atrapados en una era BERT similar, y lo que realmente buscan es que los robots completen una transformación paradigmática similar.
Es decir, el valor real del preentrenamiento no debería ser solo que el entrenamiento posterior requiera menos datos, sino que el robot finalmente adquiera la capacidad de "aprender directamente del contexto".
Aprendizaje en contexto
Entonces, ¿qué ha aprendido realmente S1 del contexto esta vez?
Skild cree que realmente hay dos dimensiones para probar la capacidad de aprendizaje en contexto de un robot:
Una es si puede aprender nuevas habilidades que nunca vio durante el entrenamiento; la otra es si puede recombinar habilidades existentes para completar una nueva tarea larga y compleja.
Por ejemplo, el robot solo necesita ver un vídeo de voltear tortitas para aprender a hacer tortitas,
incluso si esta habilidad nunca antes apareció en sus datos de entrenamiento.
Al mismo tiempo, en comparación con los vídeos de segundos mostrados la semana pasada por Gen-1.5, S1 esta vez lleva directamente el aprendizaje en contexto a un máximo de 10 minutos.
En tareas como el trasplante de plantas, cada tarea requiere completar docenas de pasos operativos consecutivos. En las demostraciones de estas tareas de larga duración, el robot no solo necesita copiar la demostración, sino también saber:
En qué paso estoy ahora, qué debo hacer a continuación, cómo combinar habilidades y cómo continuar si algo sale mal en el medio.
Es decir, el robot necesita entender realmente la intención tarea-acción en la demostración en vídeo, adaptarse a las circunstancias y ser flexible, no es una simple clonación de comportamiento.
Además, en la tarea de trasplantar plantas, desde que comenzó la grabación de la demostración hasta que el robot la ejecutó por sí mismo, solo pasaron 11 minutos, superando directamente en eficiencia al entrenamiento posterior tradicional.
Finalmente, durante todo el proceso, S1 no utilizó fine-tuning, ni post-training, los pesos del modelo permanecieron completamente sin cambios, y con el mismo conjunto de pesos completó todas las tareas mostradas en el blog.
Básicamente se alinea con el salto de los grandes modelos desde BERT, que necesitaba ajuste específico por escenario, hasta GPT-3, que podía completar tareas OOD solo viendo una demostración.
La única diferencia es que el prompt utilizado ya no es lingüístico, sino un vídeo de acciones que puede alinearse mejor con la tarea descendente.

Experimento: ¿Es el ICL realmente más escalable?
En la parte experimental, Skild primero comparó el prompt de vídeo ICL con el prompt lingüístico tradicional VLA, tanto en tareas vistas (en datos de entrenamiento) como no vistas.

Los resultados de las pruebas mostraron que cuando los datos de entrenamiento eran solo de 1000 horas, el prompt lingüístico funcionaba mejor, y a medida que aumentaba la escala de datos, el ICL comenzó a superarlo.
Con 100.000 horas, en tareas vistas durante el entrenamiento: ICL 96%, prompt lingüístico 89%.
Mientras que en las tareas OOD realmente cruciales: ICL 66%, prompt lingüístico solo 9%, estableciendo una diferencia de más de 7 veces.
Para verificar la capacidad de generalización de S1, Skild realizó pruebas bajo diferentes condiciones experimentales.

Los resultados mostraron que la caída en el rendimiento del prompt lingüístico VLA alcanzó hasta 3 veces la del ICL.
Es decir, lo que aprende el ICL no es una repetición fija de acciones en un escenario fijo, sino que es más capaz de replanificar cómo hacerlo según el entorno actual.
Finalmente, en cuanto al aprendizaje de un solo ejemplo (One-shot learning).
S1, en nuevas tareas sin realizar ningún post-training, viendo solo una demostración en vídeo, alcanzó una tasa de éxito del 66%.

En comparación, el VLA tradicional necesitaría aproximadamente unas 380 demostraciones de entrenamiento posterior para alcanzar el mismo nivel.
Por supuesto, continuando hasta 2000 demostraciones, el post-training tradicional finalmente puede lograr un 86%.
Así que la conclusión podría no ser "los robots ya no necesitan entrenamiento", sino:
Antes, una nueva habilidad podía requerir enseñarse cientos de veces; ahora, viéndola una vez, pueden lograr directamente un nivel de 60-70 puntos.
Esta es la llamada ley de escalado ICL de Skild:
Cuantos más datos, el modelo no solo sabe más habilidades, sino que se vuelve cada vez más hábil en "aprender habilidades a partir de demostraciones".
¿Quién es Skild AI?
Skild se fundó en 2023, respaldada por dos conocidos del círculo de robótica de CMU: Deepak Pathak y Abhinav Gupta.

Ambos son profesores del Instituto de Robótica de la Universidad Carnegie Mellon. Deepak se centra principalmente en el aprendizaje robótico, el aprendizaje por refuerzo y la visión por computadora, mientras que Abhinav es una eminencia en los campos de la visión por computadora y el aprendizaje autosupervisado.
Ya en 2022, ambos colaboraron en WHIRL, permitiendo a los robots realizar imitación de un solo ejemplo mediante la observación de vídeos humanos. Podría decirse que esta línea de S1 no surgió repentinamente de la nada.

Como empresa destacada en el círculo de inteligencia encarnada en Norteamérica, en 2024, Skild, recién salida del modo sigilo, consiguió una ronda Serie A de 300 millones de dólares con una valoración de 1500 millones;
Para enero de este año, completó una ronda de financiación Serie C de 1400 millones de dólares, llevando su valoración directamente a más de 14.000 millones de dólares, liderada por SoftBank, con NVIDIA, Bezos y otros continuando en la mesa. En poco más de dos años, la valoración se multiplicó casi por 10.
En comparación horizontal, el posicionamiento de Skild en el círculo de inteligencia encarnada de Norteamérica es bastante especial.
En comparación con PI, que parece estar desarrollando el "GPT para robots", Generalist recientemente enfatiza el one-shot learner, y el impulso full-stack reciente de Genesis AI y Sunday, Skild siempre ha enfatizado una frase: Cualquier robot, cualquier tarea, un solo cerebro.
Hace más hincapié en la trans-encarnación (cross-embodiment), esperando que el mismo Skild Brain pueda ejecutarse en diferentes cuerpos como brazos robóticos, cuadrúpedos, humanoides, etc.
En términos más coloquiales, quiere convertirse en el Android de la era robótica: una capa de inteligencia, insertada en varios cuerpos diferentes.
Esto también determina la estrategia de datos de Skild: tomarlos todos.
Skild ve los datos robóticos en tres dimensiones: proximidad al hardware (hardware proximity), diversidad (diversity) y escalabilidad (scalability):
La teleoperación de robots reales está más cerca del hardware, pero es costosa; los vídeos humanos en primera persona son más fáciles de escalar, pero están muy lejos del cuerpo del robot; la simulación es barata y puede generarse masivamente, pero tiene la brecha simulación-realidad (sim-to-real gap).

Por lo tanto, su estrategia para Robot Teleop, UMI, Vídeo Egocéntrico y Simulación es básicamente utilizar todos.
Y el ICL de S1 es, en realidad, una extensión natural de esta línea:

Septiembre 2025 LocoFormer → Febrero 2026 primer ICL In-Domain → Mayo primera vez haciendo tortitas → Agosto lanzamiento de S1, llevando directamente el aprendizaje en contexto a tareas OOD de larga duración de hasta 10 minutos.
Así que el problema que realmente merece atención ahora podría no ser si los robots pueden aprender más habilidades, sino:
¿Puede el costo para que un robot aprenda una nueva habilidad realmente pasar de "enseñarle cientos de veces" a "tú lo haces una vez, él lo ve una vez"?
Si esta ley de escalado (scaling law) puede seguir manteniéndose, entonces el llamado momento GPT para los robots podría no ser solo otro eslogan de marketing.
Referencia:[1]https://www.skild.ai/blogs/s1
Este artículo proviene del WeChat Official Account "Quantum Bit", autor: henry





