El modelo de aprendizaje con cuerpo más candente en Silicon Valley hoy, sin necesidad de entrenamiento posterior, aprende con solo ver una vez

marsbitPublicado a 2026-08-26Actualizado a 2026-08-26

Resumen

El modelo de robot S1 de Skild AI introduce un aprendizaje contextual (ICL) que permite a los robots aprender nuevas tareas complejas y de larga duración (hasta 10 minutos) simplemente viendo una demostración en vídeo, sin necesidad de reentrenamiento. En tareas no vistas durante el entrenamiento, logra una tasa de éxito del 66%, superando ampliamente a los modelos basados en indicaciones lingüísticas (9%). Este enfoque, similar al salto de BERT a GPT-3 en LLMs, pretende reducir drásticamente el coste de enseñar nuevas habilidades a los robots, pasando de requerir cientos de demostraciones a una sola. Fundada por investigadores de Carnegie Mellon, Skild AI busca crear un "cerebro" único adaptable a cualquier tipo de robot.

¡El gran resultado de la inteligencia encarnada está por llegar!!!

Desde que Generalist lanzara la semana pasada el cerebro encarnado Gen 1.5, capaz de aprender movimientos de 3 a 12 segundos~

Justo ahora, la startup norteamericana de inteligencia encarnada Skild AI ha presentado el nuevo modelo base para robots S1, llevando directamente la duración de las tareas de aprendizaje en contexto a más de 10 minutos.

Este S1 se centra en el aprendizaje en contexto (in-context learning, ICL):

Sin necesidad de aprender específicamente nuevos datos de operación en una fase de entrenamiento posterior, simplemente viendo un vídeo de demostración humana, puede "copiar al gato dibujando al tigre" y completar directamente un conjunto completo de complejos procesos operativos nunca antes vistos.

En la demostración oficial, el robot completó tareas de larga duración como hacer tortitas, preparar café, trasplantar una planta y ensamblar equipos. Además, en tareas no vistas previamente, logró una tasa de éxito del 66%, muy superior al VLA basado en prompts lingüísticos (solo 9%).

Además, incluso siguiendo la ruta tradicional de ajuste fino (fine-tuning) posterior, para igualar el efecto de S1 viendo una sola demostración, probablemente sería necesario introducir alrededor de 380 demostraciones de la tarea.

¡Muy sorprendente!

Podría decirse que este reciente grupo de trabajos centrados en el aprendizaje en contexto ha vuelto a avivar las esperanzas de muchos en la inteligencia encarnada.

Un usuario de Twitter expresó que los robots generalistas podrían aparecer dentro de dos años, no dentro de siete.

Otro usuario comentó que desde Rhoda, pasando por Generalist la semana pasada, hasta las tareas de 10 minutos de Skild S1 ahora, el verdadero momento GPT para los robots parece estar surgiendo.

Porque una vez que esta capacidad se generalice realmente, desarrollar habilidades para robots en el futuro podría volverse realmente como escribir un Prompt para ChatGPT.

¿Es realmente tan increíble? Vamos a verlo juntos.

De la era BERT, hacia la era GPT

Para entender cómo realiza realmente el aprendizaje en contexto este S1, primero debemos ver cómo aprenden tradicionalmente los robots una nueva habilidad.

En el pipeline tradicional, el aprendizaje de los robots es bastante similar al de los grandes modelos:

Primero, se realiza un preentrenamiento masivo con datos, para aprender algunas capacidades básicas; luego, en escenarios específicos, se recopilan datos para una tarea concreta y, a través del entrenamiento posterior, el robot aprende habilidades especializadas.

El problema es que, aunque el proceso para robots y grandes modelos es similar, el costo de los datos no tiene nada que ver.

Los datos de preentrenamiento de los grandes modelos provienen en gran medida de Internet; incluso en escenarios especializados como programación o agentes, muchos datos de entrenamiento posterior pueden obtenerse rápidamente en línea, o incluso generarse automáticamente.

Pero los robots lo tienen peor. Los datos de preentrenamiento deben recopilarse en el mundo real, y los datos de entrenamiento posterior también deben recopilarse en el mundo real.

Por lo tanto, en su blog técnico, Skild AI lo deja claro:

Si un modelo base para robots todavía necesita decenas o cientos de horas de datos reales de máquina, y un reentrenamiento posterior, para cada nueva tarea, entonces, ¿dónde está la "base" de este "modelo base"?

Incluso citan investigaciones existentes que señalan que si ya hay suficientes datos para una nueva tarea, un modelo entrenado desde cero incluso podría igualar a un modelo base que ha sido preentrenado y luego ajustado.

Entonces, ¿cuál es realmente el significado del preentrenamiento encarnado?

La respuesta de Skild es: el aprendizaje en contexto.

Para tener un punto de referencia, Skild toma como comparación la trayectoria de desarrollo de los grandes modelos.

El BERT temprano ya era muy potente, pero cada vez que encontraba una nueva tarea, a menudo había que preparar datos de nuevo y ajustarlo (fine-tuning).

Lo que realmente cambió las reglas del juego fue la capacidad de aprendizaje en contexto que gradualmente se manifestó después de GPT-3:

Sin necesidad de cambiar los pesos del modelo, solo dando algunos ejemplos en el Prompt, el modelo podía "aprender" temporalmente una nueva tarea.

Basándose en esto, Skild considera que los robots actualmente están aún atrapados en una era BERT similar, y lo que realmente buscan es que los robots completen una transformación paradigmática similar.

Es decir, el valor real del preentrenamiento no debería ser solo que el entrenamiento posterior requiera menos datos, sino que el robot finalmente adquiera la capacidad de "aprender directamente del contexto".

Aprendizaje en contexto

Entonces, ¿qué ha aprendido realmente S1 del contexto esta vez?

Skild cree que realmente hay dos dimensiones para probar la capacidad de aprendizaje en contexto de un robot:

Una es si puede aprender nuevas habilidades que nunca vio durante el entrenamiento; la otra es si puede recombinar habilidades existentes para completar una nueva tarea larga y compleja.

Por ejemplo, el robot solo necesita ver un vídeo de voltear tortitas para aprender a hacer tortitas,

incluso si esta habilidad nunca antes apareció en sus datos de entrenamiento.

Al mismo tiempo, en comparación con los vídeos de segundos mostrados la semana pasada por Gen-1.5, S1 esta vez lleva directamente el aprendizaje en contexto a un máximo de 10 minutos.

En tareas como el trasplante de plantas, cada tarea requiere completar docenas de pasos operativos consecutivos. En las demostraciones de estas tareas de larga duración, el robot no solo necesita copiar la demostración, sino también saber:

En qué paso estoy ahora, qué debo hacer a continuación, cómo combinar habilidades y cómo continuar si algo sale mal en el medio.

Es decir, el robot necesita entender realmente la intención tarea-acción en la demostración en vídeo, adaptarse a las circunstancias y ser flexible, no es una simple clonación de comportamiento.

Además, en la tarea de trasplantar plantas, desde que comenzó la grabación de la demostración hasta que el robot la ejecutó por sí mismo, solo pasaron 11 minutos, superando directamente en eficiencia al entrenamiento posterior tradicional.

Finalmente, durante todo el proceso, S1 no utilizó fine-tuning, ni post-training, los pesos del modelo permanecieron completamente sin cambios, y con el mismo conjunto de pesos completó todas las tareas mostradas en el blog.

Básicamente se alinea con el salto de los grandes modelos desde BERT, que necesitaba ajuste específico por escenario, hasta GPT-3, que podía completar tareas OOD solo viendo una demostración.

La única diferencia es que el prompt utilizado ya no es lingüístico, sino un vídeo de acciones que puede alinearse mejor con la tarea descendente.

Experimento: ¿Es el ICL realmente más escalable?

En la parte experimental, Skild primero comparó el prompt de vídeo ICL con el prompt lingüístico tradicional VLA, tanto en tareas vistas (en datos de entrenamiento) como no vistas.

Los resultados de las pruebas mostraron que cuando los datos de entrenamiento eran solo de 1000 horas, el prompt lingüístico funcionaba mejor, y a medida que aumentaba la escala de datos, el ICL comenzó a superarlo.

Con 100.000 horas, en tareas vistas durante el entrenamiento: ICL 96%, prompt lingüístico 89%.

Mientras que en las tareas OOD realmente cruciales: ICL 66%, prompt lingüístico solo 9%, estableciendo una diferencia de más de 7 veces.

Para verificar la capacidad de generalización de S1, Skild realizó pruebas bajo diferentes condiciones experimentales.

Los resultados mostraron que la caída en el rendimiento del prompt lingüístico VLA alcanzó hasta 3 veces la del ICL.

Es decir, lo que aprende el ICL no es una repetición fija de acciones en un escenario fijo, sino que es más capaz de replanificar cómo hacerlo según el entorno actual.

Finalmente, en cuanto al aprendizaje de un solo ejemplo (One-shot learning).

S1, en nuevas tareas sin realizar ningún post-training, viendo solo una demostración en vídeo, alcanzó una tasa de éxito del 66%.

En comparación, el VLA tradicional necesitaría aproximadamente unas 380 demostraciones de entrenamiento posterior para alcanzar el mismo nivel.

Por supuesto, continuando hasta 2000 demostraciones, el post-training tradicional finalmente puede lograr un 86%.

Así que la conclusión podría no ser "los robots ya no necesitan entrenamiento", sino:

Antes, una nueva habilidad podía requerir enseñarse cientos de veces; ahora, viéndola una vez, pueden lograr directamente un nivel de 60-70 puntos.

Esta es la llamada ley de escalado ICL de Skild:

Cuantos más datos, el modelo no solo sabe más habilidades, sino que se vuelve cada vez más hábil en "aprender habilidades a partir de demostraciones".

¿Quién es Skild AI?

Skild se fundó en 2023, respaldada por dos conocidos del círculo de robótica de CMU: Deepak Pathak y Abhinav Gupta.

Ambos son profesores del Instituto de Robótica de la Universidad Carnegie Mellon. Deepak se centra principalmente en el aprendizaje robótico, el aprendizaje por refuerzo y la visión por computadora, mientras que Abhinav es una eminencia en los campos de la visión por computadora y el aprendizaje autosupervisado.

Ya en 2022, ambos colaboraron en WHIRL, permitiendo a los robots realizar imitación de un solo ejemplo mediante la observación de vídeos humanos. Podría decirse que esta línea de S1 no surgió repentinamente de la nada.

Como empresa destacada en el círculo de inteligencia encarnada en Norteamérica, en 2024, Skild, recién salida del modo sigilo, consiguió una ronda Serie A de 300 millones de dólares con una valoración de 1500 millones;

Para enero de este año, completó una ronda de financiación Serie C de 1400 millones de dólares, llevando su valoración directamente a más de 14.000 millones de dólares, liderada por SoftBank, con NVIDIA, Bezos y otros continuando en la mesa. En poco más de dos años, la valoración se multiplicó casi por 10.

En comparación horizontal, el posicionamiento de Skild en el círculo de inteligencia encarnada de Norteamérica es bastante especial.

En comparación con PI, que parece estar desarrollando el "GPT para robots", Generalist recientemente enfatiza el one-shot learner, y el impulso full-stack reciente de Genesis AI y Sunday, Skild siempre ha enfatizado una frase: Cualquier robot, cualquier tarea, un solo cerebro.

Hace más hincapié en la trans-encarnación (cross-embodiment), esperando que el mismo Skild Brain pueda ejecutarse en diferentes cuerpos como brazos robóticos, cuadrúpedos, humanoides, etc.

En términos más coloquiales, quiere convertirse en el Android de la era robótica: una capa de inteligencia, insertada en varios cuerpos diferentes.

Esto también determina la estrategia de datos de Skild: tomarlos todos.

Skild ve los datos robóticos en tres dimensiones: proximidad al hardware (hardware proximity), diversidad (diversity) y escalabilidad (scalability):

La teleoperación de robots reales está más cerca del hardware, pero es costosa; los vídeos humanos en primera persona son más fáciles de escalar, pero están muy lejos del cuerpo del robot; la simulación es barata y puede generarse masivamente, pero tiene la brecha simulación-realidad (sim-to-real gap).

Por lo tanto, su estrategia para Robot Teleop, UMI, Vídeo Egocéntrico y Simulación es básicamente utilizar todos.

Y el ICL de S1 es, en realidad, una extensión natural de esta línea:

Septiembre 2025 LocoFormer → Febrero 2026 primer ICL In-Domain → Mayo primera vez haciendo tortitas → Agosto lanzamiento de S1, llevando directamente el aprendizaje en contexto a tareas OOD de larga duración de hasta 10 minutos.

Así que el problema que realmente merece atención ahora podría no ser si los robots pueden aprender más habilidades, sino:

¿Puede el costo para que un robot aprenda una nueva habilidad realmente pasar de "enseñarle cientos de veces" a "tú lo haces una vez, él lo ve una vez"?

Si esta ley de escalado (scaling law) puede seguir manteniéndose, entonces el llamado momento GPT para los robots podría no ser solo otro eslogan de marketing.

Referencia:[1]https://www.skild.ai/blogs/s1

Este artículo proviene del WeChat Official Account "Quantum Bit", autor: henry

Preguntas relacionadas

Q¿Qué es el modelo de base robótica S1 de Skild AI y qué capacidad destaca?

AEl modelo de base robótica S1 de Skild AI es un nuevo modelo de aprendizaje por contexto (in-context learning, ICL) que permite a los robots aprender nuevas tareas complejas y de larga duración (hasta 10 minutos) simplemente observando un único video de demostración humana, sin necesidad de un entrenamiento posterior (fine-tuning o post-training).

Q¿En qué se diferencia el enfoque de 'aprendizaje en contexto' (ICL) de Skild AI del método tradicional de entrenamiento de robots?

AEl enfoque tradicional requiere recopilar datos específicos de una tarea y realizar un entrenamiento posterior (post-training o fine-tuning) del modelo para cada nueva habilidad. En cambio, el aprendizaje en contexto (ICL) de S1 no modifica los pesos del modelo; el robot generaliza y ejecuta nuevas tareas observando una demostración en video, similar a como los modelos de lenguaje grandes aprenden a partir de ejemplos en un 'prompt'.

Q¿Cómo se compara el rendimiento del S1 usando ICL frente a los modelos VLA basados en lenguaje en tareas no vistas durante el entrenamiento?

AEn tareas no vistas durante el entrenamiento (OOD), el modelo S1 con ICL logró una tasa de éxito del 66%, superando por mucho al 9% de los modelos VLA basados en instrucciones de lenguaje. Esto demuestra que la capacidad de generalización y adaptación de ICL es significativamente superior en escenarios nuevos.

Q¿Qué analogía histórica del desarrollo de modelos de lenguaje utiliza Skild AI para describir el avance del S1?

ASkild AI compara el avance del S1 con la transición de los modelos de lenguaje de la 'era BERT' a la 'era GPT'. Mientras que BERT requería ajustes específicos para cada tarea, GPT-3 introdujo el aprendizaje en contexto (ICL). De manera similar, S1 busca llevar a los robots de un paradigma que requiere post-training constante a uno donde aprenden directamente de la demostración en contexto.

Q¿Cuál es la visión y estrategia de datos de Skild AI para su 'cerebro robótico'?

ALa visión de Skild AI es 'Any robot, any task, one brain' (Cualquier robot, cualquier tarea, un solo cerebro), aspirando a crear una capa de inteligencia general que funcione en diferentes tipos de robots. Su estrategia de datos integra múltiples fuentes: teleoperación de robots, videos en primera persona de humanos, datos de simulación y métodos como UMI, buscando equilibrio entre proximidad al hardware, diversidad y escalabilidad.

Lecturas Relacionadas

El rial iraní se desploma a un mínimo récord ante nuevas sanciones dirigidas a su "salvavidas": la minería de bitcoin

El rial iraní alcanzó un mínimo histórico de aproximadamente 2,02 millones por dólar, tras las nuevas sanciones estadounidenses de la "Operación Economic Outcast". Estas sanciones, anunciadas el 19 de agosto, incluyen por primera vez al sector de activos digitales y buscan bloquear el acceso iraní al dólar, presionando al Banco Central. El FMI prevé una inflación del 68,9% y una contracción económica del 5,4% en 2026 para Irán. La respuesta de Teherán ha sido reforzar su red de criptomonedas, una "línea de vida" para eludir restricciones. Desde 2019, Irán legalizó la minería de bitcoin, con el Cuerpo de la Guardia Revolucionaria Islámica controlando alrededor del 65% de la capacidad minera. Se estima que las granjas iraníes han generado entre 1.350 y 3.150 millones de dólares en criptomonedas, y el ecosistema total alcanzó 7.780 millones en 2024. El Banco Central ha utilizado USDT para apoyar el rial. Estados Unidos ha atacado esta red, sancionando intercambios como Nobitex y confiscando casi 500 millones en activos. Un hackeo a Nobitex en 2025 robó más de 90 millones, reduciendo los flujos cripto a 3.700 millones y forzando al Banco Central a usar múltiples blockchains. Las nuevas amenazas incluyen sanciones secundarias a socios comerciales de Irán y la vulnerabilidad de la red eléctrica nacional, que podría afectar a las operaciones mineras. A pesar de la presión, Irán ha demostrado persistencia en encontrar nuevas formas de evadir las restricciones.

cryptonews.ruHace 13 min(s)

El rial iraní se desploma a un mínimo récord ante nuevas sanciones dirigidas a su "salvavidas": la minería de bitcoin

cryptonews.ruHace 13 min(s)

Los activos estatales de Hubei registran el mayor retorno de su historia

Hace tiempo que se esperaba este momento. Recientemente, la solicitud de IPO de Yangtze Memory Holdings Co., Ltd. (Cambricon) en la Bolsa STAR ha sido aceptada, con un objetivo de financiación de 33.000 millones de yuanes, lo que la convertiría en la mayor IPO en la historia de esta bolsa. Esto significa que Cambricon superará el récord establecido recientemente por Changxin Memory Technologies. Ambas empresas, fundadas en 2016 y conocidas como las "gemelas de la memoria nacional", representan hitos clave. Tras la exitosa salida a bolsa de Changxin, los capitales estatales de Hefei obtuvieron enormes retornos. Ahora, es el turno de Wuhan y Hubei. El desarrollo de Cambricon se remonta a años de apoyo estatal estratégico. Fundada en 2016 como base nacional de memoria, ha crecido hasta convertirse en un líder global en flash NAND. Su próxima salida a bolsa, con una valoración potencial de billones de yuanes, promete uno de los mayores retornos de la historia para el sistema de capital estatal de Hubei, que ha sido un accionista constante durante una década. Este éxito es parte de un fenómeno más amplio en Wuhan, particularmente en Optics Valley, donde empresas como Huagong Tech (con respaldo del capital estatal de Wuhan) también han alcanzado valoraciones superiores al billón de yuanes. La industria de información óptica y electrónica de la ciudad está cerca de convertirse en un clúster de escala billonaria. El caso de Cambricon se asemeja al de Hefei con Changxin: inversión estatal paciente y de largo plazo en sectores tecnológicos clave, incluso durante períodos de pérdidas, que finalmente da sus frutos transformando el panorama industrial de una ciudad. Estos éxitos están redefiniendo el ranking económico de las ciudades chinas, demostrando que una empresa líder puede cambiar una industria, y una industria puede cambiar una ciudad.

marsbitHace 30 min(s)

Los activos estatales de Hubei registran el mayor retorno de su historia

marsbitHace 30 min(s)

Se desvanece el mito de la inversión en IA

**Resumen: El mito de la inversión en IA se desmorona con la casi quiebra del fondo estrella Situational Awareness** El fondo de cobertura Situational Awareness (SA), fundado por el ex investigador de OpenAI Leopold Aschenbrenner y aclamado como un fenómeno de Wall Street, estuvo a 20 minutos de un colapso total a finales de julio. El fondo, que llegó a gestionar 450.000 millones de dólares en apenas dos años, apostó de manera agresiva y con alto apalancamiento (hasta 3x) por un único factor: la narrativa del crecimiento imparable de la IA. Su estrategia, considerada una "cobertura de Texas" (Texas hedge), consistía en comprar acciones de empresas beneficiadas por la IA (como semiconductores) y vender en corto las que supuestamente serían desplazadas. Sin embargo, cuando el sector de semiconductores se corrigió en julio, ambas posiciones perdieron dinero simultáneamente, desencadenando una crisis de margen. Las principales entidades bancarias exigieron el depósito de garantías adicionales. En un dramático rescate de última hora, Citadel compró con descuento la cartera pública de SA minutos antes de la apertura del mercado, evitando una liquidación forzosa masiva. La crisis redujo los activos del fondo de 450.000 a unos 100.000 millones de dólares, aunque conserva participaciones privadas en Anthropic. El caso expone los riesgos sistémicos de las estrategias de inversión altamente concentradas, apalancadas y basadas en una narrativa única, incluso cuando la tesis de fondo (el crecimiento de la IA) pueda ser válida a largo plazo. Sirve como una advertencia de que los mercados pueden mantenerse irracionales más tiempo del que un inversor apalancado puede mantenerse solvente.

marsbitHace 31 min(s)

Se desvanece el mito de la inversión en IA

marsbitHace 31 min(s)

Trading

Spot
活动图片