La recopilación de datos para la inteligencia corporeizada (embodied AI) tiene una nueva ruta más.
Antes de la presentación formal, hagamos una pequeña interacción: dejando a un lado la IA y sin consultar información, ¿puedes mencionar en 5 segundos cuáles son las formas existentes de recopilar datos para la inteligencia corporeizada?
La recopilación por teleoperación con hardware real, la recopilación portátil sin referencia corporal (UMI/Ego), los datos sintéticos de simulación y la destilación de videos de Internet son las cuatro formas más predominantes.
(No están ordenadas por importancia, las enumeré al azar)
Si se quiere clasificar con más detalle, se puede hacer una larga lista.
Al menos, la respuesta que me da la IA es así, pueden sentirla:

Recientemente, ha comenzado a surgir y volverse popular una nueva ruta, que lleva la mirada de la recolección de datos desde las acciones externas, más adentro, hacia el lado de la salida motora del cuerpo humano.
Esta es la muy seguida solución de electromiografía de superficie (sEMG, Surface Electromyography).
OriginFlow (渊澈太初) es la startup más caliente y buscada en esta ruta.
Su fundador y CEO Qin Shentao, nacido en 2001, actualmente es estudiante de doctorado en la Escuela de Vehículos y Transporte de la Universidad Tsinghua.
En agosto del año pasado, fundó OriginFlow en Beijing; hasta mayo de este año, la empresa ha revelado públicamente que completó rondas de financiación ángel, estratégica y Pre-A1 de forma consecutiva, con un monto acumulado que supera los 500 millones de RMB, con inversores que incluyen a Lanchi, Oasis, Monolith, entre otros.
Qin Shentao nos dijo:
Entre los escenarios industriales reales y los modelos, falta una capa de capacidad que pueda abstraer la información de interacción física no estructurada, de alta precisión y con detalles complejos, en representaciones entrenables.
Por eso, él mismo emprendió para construir una infraestructura para AGI física, con la intención de utilizar la electromiografía neural como una de las entradas para la recolección de datos corporeizados.

Qin Shentao dice que, a corto plazo, para soluciones como UMI y las de visión en primera persona (Ego), NeuroScale es más un complemento; pero la recolección de datos imperceptible es sin duda una tendencia importante en el futuro.
Cuando surge una nueva transformación, la estrategia más adecuada es evolucionar en sinergia con las tecnologías existentes.
Recopilando datos de inteligencia corporeizada con 'interfaz neural'
Primero, para entender de cerca lo que OriginFlow hace actualmente.
Cuando una persona aprieta un tornillo, sostiene firmemente un plato de sopa o agarra un objeto blando, el cuerpo da continuamente pequeños ajustes en respuesta a la situación real.
¿Cuándo empiezan los dedos a apretar? ¿Cómo se ajusta la fuerza?... En realidad, las personas no piensan detenidamente en cada una de estas preguntas. A menudo, en un tiempo extremadamente corto, el cuerpo completa y ejecuta una serie de juicios sobre contacto, fricción, peso y estabilidad.
OriginFlow espera registrar este nivel de reacción como parte de los datos de inteligencia corporeizada.

Para apostar por esta dirección, hay que remontarse a la época de pregrado de Qin Shentao.
Durante su licenciatura, Qin Shentao lideró equipos que ganaron casi todos los campeonatos de competencias de robótica posibles; también fue durante esa etapa que reflexionó más a fondo:
El teclado, el ratón y la voz no son las formas de comunicación más directas entre humanos y máquinas. Las manos humanas son la herramienta más versátil. Si las máquinas entendieran la intención real detrás de los movimientos de las manos, la interacción humano-máquina alcanzaría otro nivel.
Así, las interfaces neuronales entraron en el campo de visión de Qin Shentao, quien tiene una "obsesión" con la fusión humano-máquina.
Las interfaces neuronales recopilan señales eléctricas de superficie relacionadas con los nervios motores periféricos (es decir, señales electromiográficas neurales), evitando los problemas de alta invasividad, alto número de canales y correspondencia con áreas cerebrales presentes en las interfaces cerebro-computadora.
Desde su nacimiento formal, la electromiografía neural estuvo durante mucho tiempo confinada a laboratorios universitarios.
Posteriormente, con la iteración de sensores inalámbricos, electrodos secos y algoritmos de IA, la electromiografía neural comenzó a usarse como entrada para la percepción de la intención de movimiento humano, aplicándose ampliamente en el entrenamiento de biorretroalimentación en medicina de rehabilitación, análisis de movimientos en deportes de competición, evaluación de lesiones por esfuerzo laboral y control de movimientos discretos en prótesis mioeléctricas.

△
Pongamos un ejemplo típico~
En 2019, Reality Labs, el departamento central de I+D de Meta, adquirió la empresa de interfaces neuronales no invasivas CTRL-Labs.
Antes de la adquisición, CTRL-Labs ya había lanzado un kit para desarrolladores, que incluía un dispositivo principal del tamaño de un reloj y un componente con electrodos conectado.
Mediante sensores de electromiografía de 16 canales, monitorea las señales eléctricas musculares que viajan desde las neuronas motoras hacia los dedos en la muñeca, y utiliza algoritmos de IA para decodificar estas señales, transformándolas en comandos digitales (como clics, deslizamientos, gestos, etc.).

Dos años después, Meta demostró públicamente por primera vez un prototipo de banda de interfaz neural basada en la tecnología de CTRL-Labs, la Meta Neural Band, mostrando su potencial para controlar interfaces de RA capturando señales neurales diminutas, como escribir en el aire, seleccionar menús, etc.
Zuckerberg dijo en ese entonces que, dado que puede percibir con precisión incluso las intenciones de acción que el usuario aún no ha realizado, esta forma de interacción ofrece un "control casi ilimitado".
El año pasado, la tercera generación de gafas inteligentes de Meta incorporó una muñequera de entrada neural, permitiendo a los usuarios controlar directamente la interfaz de las gafas mediante acciones manuales (imaginar deslizar, hacer clic).
(Una información adicional: el gesto de "pellizcar" en Apple Watch para confirmar o cerrar ventanas se basa principalmente en sensores ópticos).

A diferencia de Meta, cuya preocupación no es cómo hacer que las personas hagan clic, deslicen o escriban texto de manera más conveniente, la reflexión de Qin Shentao se centra en las condiciones que le faltan al AGI físico.
En su opinión, en primer lugar, la extrema falta de datos de interacción física de alta calidad se ha convertido en un cuello de botella clave que limita el avance de los robots de inteligencia corporeizada.
Las formas actuales de recopilar datos corporeizados tienen sus desventajas. ¿Se podría utilizar la electromiografía neural como punto de entrada para hacer un complemento adicional?
Además, elegir la recolección mediante electromiografía neural podría permitir sortear las diferencias de materiales y sensores en las superficies de contacto específicas, partiendo desde el lado de accionamiento tanto del humano como de la máquina, para encontrar un conjunto de representaciones de acción compartidas que puedan conectar la activación muscular, la fuerza tendinosa y el movimiento articular.
La recolección comienza con una muñequera
En 2025, Qin Shentao, aún estudiante de doctorado, formalmente emprendió, registrando y fundando OriginFlow, con la visión de construir una "base de acciones" para el AGI físico, más allá del texto y el video.
Poco después, el equipo propuso el sistema tecnológico NeuroScale.
NeuroScale no es simplemente agregar una banda electromiográfica a los equipos existentes de recolección de datos corporeizados.
Es un sistema integral de datos y modelos que abarca desde la captura de señales, la reconstrucción de cantidades físicas, la representación de acciones hasta la transferencia entre diferentes corporeizaciones (embodiments).
Este sistema toma como entrada de señal una interfaz de movimiento neural no invasiva, fusiona información multimodal como la electromiografía neural, la visión en primera perspectiva y IMU, reconstruye mediante el modelo base PULSE la postura, las fuerzas de contacto y las fuerzas de accionamiento durante las operaciones humanas, y organiza una operación real en Human Tokens que las máquinas pueden aprender.

NeuroScale se centra a largo plazo en dos problemas fundamentales.
Primero, ¿cómo lograr la escalabilidad (Scale Up) de los datos humanos?
Es decir, cómo registrar continuamente operaciones reales, produciendo más datos de interacción física de alta calidad, con la menor perturbación posible a la percepción y movimiento natural de las personas.
Segundo, ¿cómo lograr la transferencia entre diferentes corporeizaciones (Cross-Embodiment Transfer) entre el Humano y el Robot, de modo que la experiencia de acción humana, después de ser representada y adaptada, pueda integrarse en robots de diferentes estructuras?
Debajo de estos dos problemas, hay un problema técnico aún más básico: ¿en qué forma deberían ingresar las acciones humanas al modelo base?
El texto ya tiene una representación de Token relativamente madura, la visión también tiende a converger en representaciones tipo Patch o Latent, pero la modalidad de acción aún carece de una representación normativa ampliamente aceptada.
OriginFlow descompone una operación física en tres espacios interrelacionados:
MotionSpace, que describe la postura de la mano y la trayectoria del movimiento.
TactileSpace, que describe la fuerza normal, la fuerza tangencial y la retroalimentación táctil.
TendonSpace, que describe la fuerza de accionamiento muscular y tendinosa, y los momentos articulares.
La fuerza de accionamiento genera movimiento, el movimiento provoca contacto, y el contacto finalmente da lugar a fuerzas de acción. Estos tres elementos forman conjuntamente una cadena causal física.
Los Human Tokens de los que habla OriginFlow son precisamente representaciones de acción construidas sobre estas tres cantidades físicas.
"En términos formales, el ser humano puede ser visto como un caso especial dentro del espacio de configuraciones de corporeización. Por lo tanto, la transferencia de 'humano a robot' es esencialmente un subproblema de la 'transferencia entre corporeizaciones'." dice Qin Shentao.
En concreto, los datos humanos a gran escala son responsables de cubrir la distribución más amplia posible de acciones y habilidades humanas; los datos de transferencia entre corporeizaciones, de escala relativamente menor pero con una diversidad suficiente de configuraciones robóticas, proporcionan puntos de anclaje para la alineación entre humanos y diferentes corporeizaciones robóticas.
Combinando ambos tipos de datos, el modelo tiene la oportunidad de aprender un conjunto de representaciones de acción compartidas relativamente desacopladas de corporeizaciones específicas, para luego redirigir la misma secuencia de acción e información de fuerza humana a diferentes corporeizaciones robóticas con distintos grados de libertad y modos de accionamiento.
Por lo tanto, OriginFlow no pretende copiar directamente los datos de operación humana a los robots, sino primero buscar acciones, fuerzas de accionamiento y relaciones de contacto compartidas entre diferentes corporeizaciones, para luego completar la adaptación y el mapeo.
En el mundo real, NeuroScale comienza con una muñequera.

La muñequera se llama OriginKitGen 1.0. En su diseño, es ligeramente más ancha que la correa de un Apple Watch, pero su volumen total es menor y es más ligera.
La muñequera se encarga de capturar las señales electromiográficas de superficie a nivel de microvoltios emitidas por el usuario. Su sistema utiliza una adquisición de 16 canales, con un flujo de información de aproximadamente 96 KB por segundo, y modela continuamente el movimiento de la mano.

Sin embargo, la implementación de NeuroScale no depende únicamente de la muñequera.
Solo con la muñequera, el sistema solo puede saber que hay cambios en la actividad muscular del antebrazo, pero le resulta difícil determinar exactamente qué están haciendo los dedos.
Las señales capturadas por OriginKitGen 1.0 ingresan, junto con información de visión en primera perspectiva, IMU, etc., a la cadena de datos de NeuroScale.
La forma de onda original, después de ser alineada, calibrada y procesada, es analizada por el modelo base desarrollado por el equipo, PULSE, para extraer pistas relacionadas con la postura de la mano, la trayectoria del movimiento, la fuerza de contacto y la fuerza tendinosa, correspondientes a las tres cantidades físicas centrales: Motion Space (espacio de movimiento), Tactile Space (espacio táctil) y Tendon Space (espacio tendinoso). En el lado del hardware se realizan filtrado, diferenciación y supresión de artefactos de movimiento; en el lado del modelo, codificación de señales neurales y aprendizaje supervisado fuerte – gradualmente organizándolas en representaciones de acción que la máquina pueda aprender.
Esto es lo que el equipo denomina Human Tokens.
Durante la WAIC, Qin Shentao y su equipo mostraron los resultados actuales, una demo de la versión PULSE 0.2:
La muñequera se encarga de capturar señales electromiográficas de superficie de 16 canales; PULSE toma estas señales como entrada, modela continuamente el movimiento de la mano y observa los cambios en la fuerza durante acciones de pinza con los dedos.
A diferencia del reconocimiento discreto de gestos, PULSE se centra en el seguimiento continuo de la mano y la representación de la fuerza en la punta de los dedos.
Cuando un usuario realiza una acción de pinza, el sistema puede observar en tiempo real los cambios en la fuerza aplicada.
Sin embargo, reconstruir una acción a partir de una señal neural no equivale a haber obtenido datos que puedan usarse directamente para entrenar robots.
Los datos crudos aún deben pasar por alineación de relojes de múltiples dispositivos, calibración individual, procesamiento de artefactos de movimiento, segmentación de tareas, anotación de acciones y fuerzas, selección de calidad y mapeo entre corporeizaciones.
Para ello, OriginFlow también ha construido una infraestructura de datos (Data Infra) que cubre producción, procesamiento, evaluación y entrenamiento de datos.
Entre ellos, ORACLE utiliza modelos multimodales para completar la anotación automatizada de acciones, fuerzas, semántica y fragmentos de tareas; el modelo base unificado multimodal CHORD se encarga de la alineación temporal y de representación entre electromiografía neural, visión, IMU, lenguaje y estado del robot.
Los datos también pasan secuencialmente por etapas de calidad como validez física, validez de la tarea, validez de la anotación, valor del modelo y evaluación en hardware real. Solo los datos que puedan generar valor real en el entrenamiento de modelos o en tareas robóticas ingresarán al conjunto de datos final para entrega.
Es decir, no solo hay que capturar los datos, sino también poder procesar las señales originales masivas en activos de datos entrenables, evaluables y reutilizables, con un costo marginal suficientemente bajo.
De datos humanos (Human Data) hacia potenciar al humano (Enhance Human)
La demostración de PULSE 0.2 es solo una pequeña parte del negocio de la empresa actualmente, y el modelo en sí es solo un producto de etapa.
La versión PULSE 0.3, que se encuentra en desarrollo, está explorando aún más la relación entre la fuerza tendinosa y la cinemática directa (forward kinematics) de la mano.
La muñequera mencionada anteriormente es solo el terminal de captura actual, no la forma final del producto.
Para una ruta que depende de la captura a largo plazo y a gran escala, que el dispositivo pueda ser aceptado naturalmente por las personas determina si los datos pueden generarse continuamente.
Qin Shentao dice que es necesario hacer que las personas primero estén dispuestas a usar el dispositivo, y además, que estén dispuestas a usarlo durante suficiente tiempo.
En esencia, OriginFlow espera, sin alterar en lo posible la forma original de percepción y movimiento de las personas, registrar continuamente la salida de acciones humanas en el mundo real, y procesarlas como Tokens Físicos (Physical Tokens).
Solo así la recolección de datos podrá salir de las fábricas de captura y las estaciones de trabajo especialmente construidas, para ingresar a la vida cotidiana y a los procesos de producción reales.
Para entonces, las "billones de horas de datos" actualmente inalcanzables en el campo de la inteligencia corporeizada, solo requerirían registrar el comportamiento de toda la humanidad durante aproximadamente diez días.
Qin Shentao describe este proceso como una amplificación continua de la escalabilidad (Scaling) de datos.
De cara al futuro, impulsaremos la escala de los datos humanos multimodales, desde decenas de millones de horas, cientos de millones de horas, avanzando gradualmente hacia billones de horas.
Y la entrada física de próxima generación que imaginan, tenderá gradualmente hacia formas más ligeras, más naturales y más cercanas a productos de consumo.
En su visión, en el futuro, las personas solo necesitarán usar gafas, relojes con propiedades de consumo, o pulseras aún más ligeras, para modelarse continuamente a sí mismas en la vida diaria y obtener beneficios de sus modelos personales.

△
En general, lo que hace actualmente la empresa OriginFlow aún se encuentra en la primera etapa de su plan de desarrollo.
Se han trazado una hoja de ruta de desarrollo en tres etapas: Primera etapa, From Human (Desde el humano). Primero capturar lo mejor posible cómo se mueve la persona, destilar y transformar sistemáticamente la experiencia operativa humana en el mundo físico en datos y representaciones que las máquinas puedan aprender.
OriginFlow espera restaurar completamente la salida de acciones humanas sin interferir en el proceso natural de percepción y movimiento de las personas.
Todo el esquema de captura sigue siempre el principio de no invasividad, asegurando que, mientras las personas mantienen su estado original, sus acciones puedan ser observadas y reconstruidas con precisión por el sistema.
Segunda etapa, With Human (Con el humano).
Esta etapa construirá nuevos dispositivos de hardware de IA, incluidos robots, con una forma de funcionamiento constante (Always-on) que se integre en el trabajo y la vida diaria, permitiendo que más personas disfruten del valor aportado por la próxima generación de interfaces humano-máquina.
La tercera etapa es Enhance Human (Potenciar al humano), mirando hacia los próximos 10 a 30 años.
Por supuesto, desde una demostración de pinza con los dedos en PULSE 0.2, hasta la escala de billones de horas de datos humanos multimodales, hay un largo camino de validación de ingeniería en el medio.
One More Thing (Algo más)
Se sabe que otras empresas emergentes nacionales, como Strong Brain Technology, Octopus Power, SnowOrigin, Nianxiang Technology, Unbounded Veins, Shouyi Technology, también están utilizando electromiografía neural para recopilar datos de inteligencia corporeizada.
Este artículo proviene de la cuenta pública WeChat "Quantum Bit" (ID: QbitAI), autor: Heng Yu.





