La "gaokao" de la inteligencia encarnada es una locura: humanos 100 puntos, el modelo más fuerte 12.8
La inteligencia incorporada se enfrenta a su "Everest": el nuevo benchmark RoboDojo evalúa las capacidades de los robots en entornos simulados y del mundo real, revelando una brecha abismal frente al rendimiento humano.
En simulación, con 42 tareas que miden generalización, memoria, precisión, ejecución de largo horizonte y comprensión semántica abierta, la mejor estrategia actual (Hy-Embodied-0.5-VLA) alcanza solo un 8.80% de éxito promedio. En el mundo real, con 18 tareas estandarizadas en robots brazos ARX X5, Piper y Piper X, el modelo líder (π0.5) logra únicamente un 12.8% de éxito. En contraste, un experto humano logra un 76.03% en simulación y un 100% en pruebas reales.
RoboDojo, desarrollado por un consorcio académico y gestionado de forma independiente, no es solo un ranking. Incluye una infraestructura unificada (XPolicyLab) para integrar y evaluar 30 estrategias de robots de forma justa, y un sistema de evaluación estandarizada y reproducible para robots físicos. Los resultados muestran que, a pesar de los avances en demostraciones específicas, los modelos actuales carecen de robustez, generalización y fiabilidad para tareas complejas y abiertas, especialmente en la transición crucial a la realidad física.
marsbit07/08 11:54