Tras casi dos años, Fei-Fei Li vuelve a ser invitada por a16z para hablar sobre la inteligencia espacial y la estrategia completa de World Labs en el campo de la robótica.
¡La densidad de información es máxima durante toda la entrevista, sin poder parpadear!
Nuestro objetivo es convertir la inteligencia espacial en la próxima frontera de la IA.
La capacidad de actuar en el espacio físico sigue siendo una de las habilidades más emocionantes y de mayor trascendencia en el futuro mundo de la IA, y los robots son su núcleo.
Los robots son la primera piedra de toque para la aplicación de la inteligencia espacial, y también un escenario importante para el modelado del mundo.
SceniX resuelve precisamente el problema más difícil en el campo de la robótica: la escasez de datos de entrenamiento y de evaluación.
Para que los robots funcionen realmente, debemos liberar el poder de la ley de escalado (scaling law).
La evaluación en entornos reales no solo es lenta, sino también peligrosa y costosa. En comparación, los entornos de simulación ofrecen una controlabilidad y analizabilidad completas; proporcionan un valor único tanto en fiabilidad como en eficiencia.
Qué modelo concreto se utilice no es realmente importante, porque los modelos siempre serán reemplazados, pero la infraestructura no.
Nada más subir el vídeo, la imaginación de los usuarios en los comentarios se desató por completo. ¡Incluso hubo quien planificó una "Robinson Crusoe" con robots, detallando hasta el equipamiento necesario! (¿Es eso correcto?)

Hay que admitir que el estado mental de esta generación de internautas es realmente hermoso, haciendo que uno casi quiera pasarles una claqueta y gritar "¡Acción!".

Recientemente, World Labs anunció la adquisición de SceniX y planea colaborar con ellos para crear un campo de entrenamiento digital escalable para robots.
Inmediatamente después, la CEO de World Labs, Fei-Fei Li, y el cofundador de SceniX, Yunzhu Li, fueron invitados a la última entrevista de a16z "Fei-Fei Li is Solving the Hardest Problem in Robotics", donde por primera vez analizaron públicamente el problema central que están abordando juntos: hacer que la IA no solo comprenda el mundo, sino que también pueda actuar para cambiarlo.
Curiosamente, Yunzhu Li fue un posdoctorado supervisado personalmente por Fei-Fei Li, ¿qué historia condujo a esta colaboración?

Sin alterar el significado original, hemos corregido y editado minuciosamente la transcripción textual de la entrevista utilizando IA.
Enjoy~
¿Por qué los robots son la primera piedra de toque para la aplicación de la inteligencia espacial?
Martin Casado (Anfitrión): Fei-Fei, ¿podrías presentar brevemente el trabajo de tu empresa a los oyentes que no estén familiarizados con World Labs?
Fei-Fei Li: Vale, World Labs es una startup fundada hace dos años, y también un laboratorio de modelos de vanguardia.
Nuestro objetivo es convertir la inteligencia espacial en la próxima frontera de la IA.
En pocas palabras, se trata de permitir que la IA genere, comprenda, razone e interactúe libremente en espacios reales o virtuales.
Construir grandes modelos del mundo es un camino hacia la inteligencia espacial, y también la dirección en la que World Labs se centra actualmente.

Anfitrión: Desde el principio has enfatizado que las máquinas deben poder percibir el espacio, razonar sobre él y actuar dentro de él. Pensaba que actuar en el espacio era un objetivo aún lejano, pero ahora habéis adquirido una empresa de robótica. ¿Por qué ha llegado el momento adecuado para la adquisición? ¿Cuál es la intención?
Fei-Fei Li: Los robots no son la única forma de actuar o interactuar en el espacio. En campos creativos como los efectos visuales (VFX), los videojuegos y el diseño, la gente ya puede construir mundos e interactuar de forma inmersiva en espacios virtuales.
World Labs siempre ha tenido una convicción: el mundo en el que vivimos puede convertirse en un multiverso, y podemos crear tecnología para que usuarios, creadores y desarrolladores actúen en diferentes espacios.
Sin embargo, la capacidad de actuar en el espacio físico sigue siendo una de las habilidades más emocionantes y trascendentales en el futuro mundo de la IA, y los robots son su núcleo.
World Labs siempre ha creído que los robots son la primera piedra de toque para la aplicación de la inteligencia espacial y un escenario importante para el modelado del mundo. Invitar a SceniX y a su equipo a unirse a World Labs es parte de nuestra visión y misión a largo plazo.

Anfitrión: Yunzhu, eres cofundador de SceniX. ¿Podrías presentar brevemente tu trayectoria y lo que hace SceniX?
Yunzhu Li: Hola a todos, soy Yunzhu Li, cofundador de SceniX y profesor asistente en la Universidad de Columbia.
Mi experiencia investigadora comenzó durante mi doctorado en el MIT, seguido de un posdoctorado en Stanford bajo la supervisión de la profesora Fei-Fei. Mi objetivo profesional siempre ha sido sencillo: ayudar a los robots a percibir e interactuar mejor con el mundo físico.
Soy una persona muy práctica, quiero que los robots trabajen en entornos físicos reales.
Hemos observado que los robots generales actuales enfrentan muchos cuellos de botella, la mayoría concentrados en las etapas de entrenamiento y evaluación. Por lo tanto, estamos desarrollando una tubería real-to-sim-to-real, que mapea el entorno real a un mundo digital altamente alineado con él.
Por alineación nos referimos a que lo que ocurre en el mundo digital también debería poder ocurrir en el entorno real.
De esta manera, la recopilación y evaluación de datos que originalmente debían realizarse en el entorno real puede ser parcialmente sustituida por datos generados de forma escalable en el mundo digital. Así comenzó SceniX.
Hemos formado un equipo que cubre robótica, aprendizaje robótico, simulación y renderizado, y estamos intentando construir una pila tecnológica completa real-to-sim-to-real para resolver estos cuellos de botella clave.

Fei-Fei Li: Aquí hay además una historia muy interesante (risas). Podrías pensar que, como Yunzhu fue mi posdoctorado, ya estábamos discutiendo hace tiempo la fusión de SceniX y World Labs.
En realidad, no. SceniX llegó inicialmente a World Labs como cliente.
El mundo es realmente pequeño. El pasado invierno, alrededor de noviembre o diciembre, lanzamos la primera versión de nuestro modelo generativo Marble, y SceniX fue uno de los primeros en registrarse y utilizarlo.
Al principio ni siquiera sabía que era la empresa de Yunzhu. Después de descubrirlo, le llamé y me di cuenta de que había muchas posibilidades de colaboración entre World Labs y SceniX.

Anfitrión: ¿Podrías presentar brevemente Marble?
Fei-Fei Li: Vale. Marble es el modelo base que World Labs entrena e itera continuamente. La capacidad central de la versión pública actual es recibir una o varias imágenes, texto o una combinación de estas modalidades, y transformarlas en un mundo geométricamente consistente.
Este mundo parece muy realista y sin incongruencias.

Y SceniX resuelve precisamente un problema extremadamente difícil en el campo de la robótica: la gran escasez de datos de entrenamiento y de evaluación.
Es diferente de los modelos de lenguaje, que pueden obtener datos abundantes de Internet, pero los robots no.
Para que los robots funcionen realmente, debemos liberar el poder de la ley de escalado (scaling law).
¿De dónde vienen entonces estos datos? Esta es la pregunta profunda que todo el campo de la robótica se plantea continuamente.
¿Cómo se complementan World Labs y SceniX?
Anfitrión: Ambos habéis formado equipos muy competentes. ¿En qué medida se superponen vuestras capacidades y en qué medida amplían las de World Labs?
Fei-Fei Li: Creo que los dos equipos son altamente complementarios, y comparten una misión común.
Yunzhu es uno de los cofundadores técnicos de SceniX. El otro es Changxi Zheng, profesor de la Universidad de Columbia y experto de clase mundial en tecnologías de simulación, con formación en VFX. Ha trabajado en Tencent y también tiene experiencia emprendedora.
Xiaochen Hu (Sonny) es un excelente líder de ingeniería, que trabajó en una startup posteriormente adquirida por Amazon, y participó en varios stacks tecnológicos de visión por computadora en Amazon.
Yunzhu aporta liderazgo intelectual y capacidad técnica en el campo de la robótica, cubriendo desde hardware hasta la pila completa de robótica. Cuando hizo su posdoctorado conmigo en Stanford, ya era un investigador en robótica de pila completa, abarcando tanto modelado como hardware. Los estudiantes de Yunzhu y el equipo de SceniX complementan los talentos que World Labs aún no poseía.
Changxi aporta una capacidad de simulación extremadamente sólida. El trabajo de World Labs se conecta en gran medida con mundos de simulación, mientras que lo que le faltaba relativamente a SceniX eran los modelos generativos y la capacidad de reconstrucción 3D basada en visión por computadora, precisamente las fortalezas de World Labs y la tecnología que SceniX necesitaba.
Tras la combinación, el panorama de capacidades será más completo.

Anfitrión: Yunzhu, al decidir entre continuar desarrollándose de forma independiente o unirse a World Labs, ¿cómo evaluaste si ambas partes encajaban? ¿Por qué tomaste finalmente esta decisión?
Yunzhu Li: Al principio, consideramos seguir desarrollándonos de forma independiente. Pero tras conversar con la profesora Fei-Fei y ver las sinergias, creímos que avanzar juntos era muy razonable.
El trabajo real-to-sim-to-real de SceniX implica la reconstrucción densa (Dense Reconstruction) del entorno, incluyendo la captura de su apariencia, estructura geométrica y dinámica, es decir, cómo cambia el entorno tras aplicar acciones. Actualmente, la tarea de reconstrucción densa sigue siendo relativamente pesada.
World Labs posee una profunda capacidad en reconstrucción dispersa y generación. Vemos muchas oportunidades para utilizar Marble y otras capacidades relacionadas para realizar la reconstrucción y modelado del entorno de manera más eficiente.

Anfitrión: ¿Podemos esperar que World Labs lance un modelo base para robótica?
Fei-Fei Li: World Labs está construyendo modelos base, y por supuesto no descartamos esta dirección.
Yunzhu Li: Sí. Un modelo base para robótica esencialmente requiere ser multimodal.
Debe procesar fotogramas, texto, imágenes, profundidad y otras modalidades, y la acción es una modalidad muy crucial. Si se toman fotogramas y acciones como entrada, el modelo puede actuar como un simulador, prediciendo cómo cambiará el entorno después de ejecutar acciones específicas.
Si la acción se considera una salida, esencialmente es un policy model, prediciendo qué acciones debe realizar el robot en el entorno real para acercarse a un objetivo específico.
Este tipo de Modelo Omni no solo puede ayudar a investigadores y desarrolladores de inteligencia encarnada a comprender mejor el modelado del entorno y la planificación de decisiones, sino que también puede servir como modelo base (backbone) para ser afinado para aplicaciones robóticas específicas, logrando así la fiabilidad y eficiencia que los clientes esperan.

¿Por qué enfatizar en 3D y simulación?
Anfitrión: Actualmente muchas empresas de robótica adoptan un enfoque basado puramente en modelos de vídeo, mientras que vosotros enfatizáis en 3D y simulación. ¿En qué se diferencian ambos enfoques?
Yunzhu Li: Para crear un mundo en el que los robots puedan trabajar, este mundo debe capturar la estructura esencial del problema, y una condición necesaria es la consistencia, incluyendo consistencia espacial, temporal, entre diferentes perspectivas y diferentes formas de interacción.
Es aquí donde vemos una fuerte sinergia con Marble. El mundo generado por Marble puede proporcionar parte de la infraestructura que necesitan los robots.
Imagina que un robot intenta empujar un objeto hacia adelante y este desaparece misteriosamente. Muchos modelos de predicción de vídeo existentes pueden presentar este tipo de problemas, un resultado que no proporciona la señal de acción correcta al robot.
Los modelos de vídeo están avanzando rápidamente, pero la infraestructura que construimos puede proporcionar el impulso inicial a la rueda de datos</strong, llevándola desde un modelo más orientado a la simulación hacia un modelo de política robótica capaz de ejecutarse en entornos reales, luego recopilando nuevos datos y retroalimentándose.
El modelo no tiene que depender solo de la física, ni solo del aprendizaje. Puede situarse entre ambos, capturando la estructura esencial del problema y mejorando y expandiéndose continuamente a medida que se acumulan datos.
Anfitrión: Fei-Fei tiene desde hace tiempo una "estrella polar" conceptual en torno a 3D e inteligencia espacial. ¿Tú también tienes un concepto similar? ¿O eres más pragmático, priorizando construir el sistema y hacerlo funcionar?
Yunzhu Li: Mi estrella polar es hacer que los robots trabajen en entornos reales. Soy una persona muy pragmática.
Durante mi posdoctorado con la profesora Fei-Fei, colaboramos en la construcción de un benchmark, y encuestamos al público sobre qué les gustaría que los robots hicieran por ellos. Entre más de mil tareas recopiladas, un tercio estaban relacionadas con la limpieza. A la gente no le gusta ese trabajo sucio y pesado, y esos son precisamente los escenarios que queremos resolver con robots.
Fei-Fei Li: Lo que realmente admiro es el enfoque extremadamente pragmático de los cofundadores de SceniX.
Aunque la mayoría provienen del mundo académico, optaron desde el primer momento por colaborar con diseñadores y clientes de la industria real, entrando en escenarios reales como laboratorios, almacenes y ensamblaje electrónico.
Esta forma de desarrollar robótica es refrescante y me hace tener muchas expectativas sobre la colaboración con ellos.

Anfitrión: Los sistemas robóticos deben ser bastante precisos, pero las aplicaciones creativas pueden tolerar y aceptar errores, a veces incluso los errores se convierten en musas de la creatividad. Desde una perspectiva técnica, Yunzhu, ¿cómo coordinarías estos dos requisitos?
Yunzhu Li: Creo que ambos pueden coordinarse. El modelo del entorno no tiene que ser perfecto, ni el modelo del robot tiene que ser perfecto.
Anfitrión: ¿Qué significa exactamente que el modelo no tiene que ser perfecto? ¿Al menos debe ser muy cercano a la realidad, no?
Yunzhu Li: Los modelos siempre han sido una base importante para el desarrollo de diversas aplicaciones robóticas. Los drones, robots aspiradores, robots cuadrúpedos y bípedos, todos necesitan depender de modelos para funcionar y migrar desde entornos simulados a reales.
Los robots de locomoción pueden caminar en la nieve o entre arbustos, pero el simulador no necesita replicar con precisión cada arbusto y cada acumulación de nieve.
La simulación necesita capturar la estructura esencial del problema y admitir diferentes formas de aleatorización en el entorno digital.
Estamos investigando con qué nivel de fidelidad debemos modelar el mundo que rodea al robot para que los sistemas robóticos entrenados en entornos simulados y digitales puedan transferirse de vuelta a escenarios reales.

¿Es viable el enfoque basado en simulación como pilar?
Anfitrión: Algunos investigadores piensan que la simulación eventualmente siempre se desvía del mundo físico, por lo que la recolección de datos del mundo real es crucial. ¿Es viable el enfoque que toma la simulación como pilar?
Yunzhu Li: No creo que sean contradictorios. La simulación esencialmente predice cómo cambiará el entorno tras aplicar acciones, es decir, modelar el mundo.
Este modelo no tiene que ser puramente físico, puede combinar física y aprendizaje. Estamos recolectando datos del mundo real, y también usaremos estos datos en diferentes etapas de la rueda de datos.
En las etapas iniciales, podríamos enfatizar más la física, primero haremos que el robot aprenda sobre el mundo para asegurar que tenga un ritmo de aprendizaje adecuado y una estructura de conocimiento que le permita aprender con éxito.
A medida que acumulemos más datos a través de recolección y colaboraciones con clientes, el modelado del entorno puede pasar gradualmente a estar más impulsado por el aprendizaje. Esta transición y flujo de datos pueden combinar las ventajas de la física, la geometría y la consistencia con el poder de los datos y la potencia computacional.

Fei-Fei Li: Sí, no es una elección binaria de "simular o no simular". Todos los elementos deben combinarse para que los robots funcionen realmente.
Por ejemplo, los humanos realizamos mucha simulación mental antes de actuar. La simulación asume un papel importante que los datos del mundo real no pueden asumir, que es el "razonamiento contrafáctico".
Las personas deducen eventos que aún no han ocurrido, no pueden ocurrir o para los que carecen de suficientes datos reales, y aprenden cómo actuar a partir de esa deducción. Las personas siempre hacen esto, y los robots también pueden.
Creo que la planificación de cada partido de fútbol incluye algún tipo de simulación, ya sea digital, en una pizarra u otras formas. El papel de la simulación es apoyar el razonamiento contrafáctico. Esto es crucial para los robots, porque es imposible recopilar suficientes datos del mundo real para todas las situaciones.
Los coches autónomos son un caso real. Waymo ha dicho que utilizó decenas de miles de millones de horas de datos de simulación, y su enfoque depende en gran medida de la simulación, no solo de datos del mundo real.
Los coches son un problema robótico relativamente simple, por lo que está claro que la simulación juega un papel importante en el aprendizaje robótico.

Yunzhu Li: La simulación puede aportar beneficios en dos niveles: fiabilidad y eficiencia.
En cuanto a la fiabilidad, para que un sistema robótico funcione de forma estable en un entorno real, los datos deben cubrir sistemáticamente el espacio de estados y las variaciones que el robot pueda encontrar.
En la simulación, podemos aleatorizar y controlar sistemáticamente la iluminación, el tipo de geometría y los parámetros físicos para asegurar una cobertura suficiente del espacio de estados del robot, mejorando así la fiabilidad del sistema robótico.
El segundo beneficio es la eficiencia. Muchos equipos recopilan datos mediante teleoperación. Al usar dispositivos de teleoperación y exoesqueletos existentes, la velocidad de recopilación de datos puede incluso ser más lenta que la ejecución directa por humanos.
Para muchos clientes, la velocidad de recopilación humana no es suficiente, quieren que los robots sean más rápidos que las personas. Pero acelerar un robot no equivale simplemente a aumentar la velocidad de accionamiento, porque la gravedad es constante, y el simple aumento de velocidad no puede resolver los problemas de desequilibrio dinámico resultantes.
En cambio, en la simulación, podemos acelerar sistemáticamente el comportamiento del robot, mientras entrenamos al robot para considerar los cambios en la dinámica del entorno.
Por lo tanto, la simulación proporciona un valor único tanto en fiabilidad como en eficiencia.

¿Cómo utiliza SceniX su plataforma para entrenar y evaluar robots?
Anfitrión: ¿Cómo utiliza SceniX su propia plataforma para entrenar y evaluar robots?
Yunzhu Li: Tiene dos usos principales: entrenamiento y evaluación.
Primero la evaluación, que a menudo se pasa por alto en robótica; al entrenar un modelo robótico, debemos saber cómo se desempeña, y la evaluación es la fuente de información que impulsa la iteración.
Anfitrión: Los profesionales de IA entienden la evaluación, pero la interpretación de cada uno puede ser diferente. ¿A qué te refieres exactamente con evaluación aquí?
Yunzhu Li: Creo que la evaluación se refiere a comprender el rendimiento de un checkpoint específico, por ejemplo, si la tasa de éxito es del 95% o del 99,9%.
Una medida clave en la industria para evaluar una métrica es ver cuánto tiempo se necesita para distinguir un checkpoint con un rendimiento del 90% de otro con un rendimiento del 92%. Si cada vez hay que desplegar el modelo en el mundo físico real para ejecutar pruebas y verificar esa mejora del 2%, el ciclo de verificación sería tan largo que resultaría insoportable.
Actualmente, la evaluación de robots en el mundo real es varios órdenes de magnitud más lenta que la evaluación de modelos de lenguaje. Las tareas robóticas también son altamente diversas. El robot debe ejecutar acciones reales, moverse en el espacio y obedecer las leyes físicas.
Los vídeos de demostración de robots a menudo se reproducen a 8x o 10x de velocidad, precisamente porque los robots se mueven muy lentamente.
La evaluación en entornos reales no solo es lenta, sino también peligrosa y costosa. Por lo tanto, algunos clientes necesitan entornos digitales para evaluar sistemas robóticos.
Dado que nuestros entornos digitales han demostrado estar alineados con el mundo real, si un checkpoint tiene un mejor rendimiento en simulación, es probable que también lo tenga en el entorno real. Podemos utilizar las señales del entorno digital para realizar evaluaciones mucho más seguras, escalables y rápidas de los sistemas robóticos.
Además, en cuanto al entrenamiento, la controlabilidad es crucial.
Queremos controlar las variaciones en el estado, parámetros, iluminación, fricción y otros parámetros físicos, e incluso en los tipos de geometría de los objetos; el entrenamiento debe cubrir suficientemente una diversidad de escenarios para generar datos con información suficiente, dotando al robot de Robustez. Y esto es extremadamente difícil de lograr en entornos reales.
Recopilar datos mediante teleoperación no solo es lento, sino que también está limitado por el número de robots, la cantidad de dispositivos de operación remota y una serie de problemas operativos de datos.
En comparación, los entornos de simulación ofrecen una controlabilidad y analizabilidad completas.
En el mundo digital, puedes definir claramente el alcance de la distribución de datos y tener la certeza de la fiabilidad del robot dentro de esa distribución. Esta determinismo, eficiencia y escalabilidad son los motivos centrales por los que los clientes eligen entrenar sistemas robóticos en mundos digitales.

Fei-Fei Li: Sí. Incluso antes de que SceniX se acercara a World Labs, ya había clientes que buscaban Marble por iniciativa propia, confirmando la existencia real de esta demanda. Aunque en ese momento aún no teníamos capacidad de servicio, recibimos muchas consultas de empresas de robótica, incluyendo tanto equipos de desarrollo de modelos en etapas tempranas como empresas enfocadas en aplicaciones prácticas. Estamos prestando atención a estas demandas.

Anfitrión: Cuando la gente se entera de que World Labs entra en el campo de la robótica, podría pensar que vais a fabricar hardware, a desarrollar el "cerebro" del robot. Pero parece que no es eso lo que estáis haciendo. ¿En qué etapa del ciclo de desarrollo robótico os situáis? ¿Dónde están los límites con los socios del ecosistema?
Yunzhu Li: Construimos una infraestructura y software asociado que permiten a los desarrolladores crear mundos en los que los robots puedan aprender y ser evaluados. Esta infraestructura no está vinculada de forma natural a un modelo específico, ni a una morfología robótica específica.
Anfitrión: Es decir, ¿no fabricáis robots, sino que construís entornos para que otras empresas pongan sus cerebros robóticos a navegar y aprender?
Yunzhu Li: Nuestra plataforma no discrimina robots ni modelos. Ya sea un brazo único o doble, de base fija o móvil, e incluso varios tipos de pinzas y efectores finales complejos, todos pueden colocarse directamente en nuestro mundo digital para funcionar.
El objetivo es uno solo: que sean estables y rápidos al trabajar en el entorno real.
Lo mismo con los modelos. Los datos que generamos pueden usarse para entrenar un nuevo modelo desde cero, o para afinar modelos VLA (Visión-Lenguaje-Acción) populares actualmente o modelos de Acción Mundial (World Action Model).
Qué modelo específico se utilice realmente no es importante, porque los modelos siempre serán reemplazados, pero la infraestructura no.
En pocas palabras, no nos alineamos con el hardware ni apostamos por algoritmos. Solo hacemos una cosa: construir un mundo digital universal donde cualquier robot pueda entrenar habilidades reales y seguir siendo confiable en el mundo real.

¿Cuál debería ser la ruta de aplicación de los robots?
Anfitrión: Has mencionado que las expectativas externas sobre los robots humanoides quizás sean demasiado ambiciosas, y que un punto de aplicación más realista a corto plazo son escenarios restringidos como los almacenes. ¿Cómo afectará este juicio al enfoque de trabajo de World Labs?
Yunzhu Li: Es una buena pregunta. La implementación de robots en el mundo real suele seguir una ruta de evolución: desde entornos completamente estructurados, a semiestructurados, y finalmente a no estructurados.
Los entornos completamente estructurados son como fábricas o líneas de producción de automóviles, donde todas las variables son conocidas y controlables; hemos automatizado estas escenas durante décadas.
Los entornos semiestructurados son como almacenes de Amazon, restaurantes o hoteles: el entorno es mayormente controlable y las tareas están adaptadas para robots, pero siempre aparecen elementos imprevistos como prendas de vestir.
Y los entornos no estructurados, como tu hogar o el mío, son el santo grial definitivo de la robótica.
La Robustez surge de una cobertura suficiente de los escenarios. Al menos en esta etapa, abordar primero los entornos semiestructurados es más factible que adentrarse directamente en los completamente no estructurados. Eventualmente llegaremos a estos últimos, pero queremos seguir un camino más sostenible y pragmático.
Fei-Fei Li: Los robots humanoides se adaptan a entornos no estructurados imitando el cuerpo humano, y los humanos ya nos hemos adaptado a entornos no estructurados a través de la evolución.
Nuestros dedos y piernas no son las mejores herramientas para ejecutar cualquier tarea única. Si el único objetivo de la humanidad como especie fuera trepar a los árboles, probablemente tendríamos dedos de forma diferente.
Lo que la evolución humana finalmente produjo es una forma corporal muy versátil, pero no necesariamente óptima para una sola tarea. Porque esta forma es beneficiosa para la supervivencia en entornos no estructurados.
Pero desde una perspectiva comercial y técnica pragmática, un entorno no estructurado combinado con un cuerpo versátil es el problema más difícil de resolver.
Para un problema específico, esta ni siquiera puede ser la ruta correcta. Una morfología corporal más especializada puede ser más adecuada para resolver tareas más limitadas.
Por lo tanto, el desafío para SceniX es mantenerse neutral respecto a la morfología robótica, permitiendo que la infraestructura sirva a diferentes formas corporales y diferentes entornos semiestructurados.

Anfitrión: Los modelos generativos de lenguaje pueden generar texto o código mucho más rápido y más barato que los humanos. Pero el cerebro y el cuerpo humanos son muy eficientes en navegación 3D y manipulación de objetos. En un futuro previsible, ¿podrán los robots alcanzar la eficiencia energética de los humanos en tareas físicas cotidianas? ¿Llevará cinco años, o es casi imposible?
Yunzhu Li: Creo que llevará mucho tiempo. Para que un robot funcione en un entorno real, en última instancia es un problema sistémico.
Debemos considerar seriamente cómo colaboran el hardware, el software y el "cerebro", incluso detalles como el coeficiente de fricción de los dedos. Para que el sistema se implemente realmente, se necesitan muchos elementos en su lugar y también una iteración continua.
Pero lo que me emociona es que el frente tecnológico del aprendizaje robótico ha estado avanzando a una velocidad superior a mis expectativas. Los problemas que investigo ahora son completamente diferentes a cuando comencé mi doctorado. Esto indica que todo el ecosistema está evolucionando rápidamente, y los diversos componentes necesarios para construir sistemas robóticos también están comenzando a converger.
Pero debemos calibrar nuestras predicciones. Habrá muchos avances en el futuro, pero alcanzar la eficiencia energética y las capacidades generales a nivel humano aún requerirá mucho más tiempo.
Fei-Fei Li: Lo más difícil de lograr en la IA actualmente es mantener un optimismo apropiado y calibrado.

Incluso los grandes modelos de lenguaje no tienen la eficiencia energética del cerebro humano. El cerebro humano funciona con solo unos 30W de potencia, por lo que la brecha actual sigue siendo grande.
Anfitrión: Aunque creo que en tareas específicas como la generación de imágenes o la ingeniería de software, la eficiencia energética podría estar acercándose al nivel humano. Solo que en el campo de la robótica quizás aún esté muy lejos.
¿Cuál es el objetivo dos años después de la fusión?
Anfitrión: ¿Unirse a World Labs ha cambiado la trayectoria estratégica del equipo, o ha elevado el techo de los objetivos que podéis perseguir?
Yunzhu Li: Ha cambiado nuestra trayectoria de una manera muy profunda. Vemos que se liberan muchas capacidades, especialmente tras la colaboración con World Labs, podemos completar todo el proceso de modelado del entorno de una manera más eficiente y escalable.
Las capacidades actuales de los modelos de lenguaje son asombrosas, pero probablemente aún no confiarías ciegamente en que reserven un vuelo o un hotel por ti, normalmente alguien todavía revisa la salida del modelo.
Pero con los robots es diferente, un modelo robótico listo para usar debe poder funcionar de manera confiable en un entorno real.
Actualmente, no tenemos suficientes datos, ni poseemos completamente toda la infraestructura que permita a los robots funcionar de manera confiable y lista para usar.
Por lo tanto, crear mundos digitales escalables donde los robots puedan aprender y ser evaluados liberará un enorme potencial.
Podemos utilizar los datos generados en el mundo digital para sustituir la recopilación de datos costosa o insegura en el entorno real, permitiendo un aprendizaje y evaluación escalables para los robots.
Anfitrión: Entonces, ¿os integraréis inmediatamente, o dejaréis que SceniX se mantenga relativamente independiente por ahora, avanzando a un ritmo más a largo plazo?
Fei-Fei Li: Avanzaremos con cautela, sin apresurarnos a integrar inmediatamente todos los repositorios de código y equipos. SceniX ya tiene una pila tecnológica relativamente completa y bien pensada, sus propios clientes y productos. Nos tomaremos el tiempo necesario.
Sin embargo, la integración definitivamente ocurrirá. Ya hemos comenzado a discutir sobre simulación, así como posibles modelos base y modelos condicionados por acciones, y SceniX ya está utilizando Marble como cliente interno.
Avanzaremos gradualmente en la integración, pero no nos apresuraremos a mezclar los equipos en una "ensaladera" de inmediato. (risas)

Anfitrión: ¿El equipo permanecerá en su ubicación actual?
Fei-Fei Li: Yunzhu trasladará a algunos miembros del equipo a San Francisco. Una vez completado el traslado, World Labs se convertirá oficialmente en una empresa que abarca las costas este y oeste de EE. UU. Nuestra sede está en San Francisco, yo vivo en Palo Alto. Estableceremos una oficina en Nueva York, lo cual me emociona porque nos ayudará a atraer talento de la costa este.
También hemos hablado de desplegar robots en ambas oficinas, para probar y perfeccionar la pila de ingeniería para la teleoperación de robots. En cualquier caso, finalmente también necesitaremos ofrecer esta capacidad a los clientes.
Anfitrión: Si queremos ser específicos con los objetivos, ¿cuál sería el caso de éxito ideal dentro de dos años? ¿Qué tipo de productos presentaríais entonces, quién los usaría y cómo?
Fei-Fei Li: Dentro de dos años, estaría muy satisfecha si el equipo de SceniX y World Labs lograran obtener algunos casos de clientes verificados en unos pocos casos de uso verticales importantes, y demostraran que nuestros sistemas e infraestructura realmente ayudan a satisfacer sus necesidades de automatización.
Estos clientes se convertirían en casos faro, ayudándonos a expandir aún más el negocio.

Entrevista completa:
https://www.youtube.com/watch?v=-tabaM5l3s0
Enlaces de referencia:
[1]https://marble.worldlabs.ai/
[2]https://www.worldlabs.ai/blog/scenix
Este artículo proviene de la cuenta oficial de WeChat "量子位", autor: Wenting







