Artículos Relacionados con Escasez de Datos

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Escasez de Datos", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

Tras tres años de retraso, el último artículo de la exalumna de la Universidad de Pekín, Lilian Weng, se viraliza

"Tras tres años sin actualizar su blog, la ex vicepresidenta de OpenAI y cofundadora de Thinking Machines, Lilian Weng, publica un extenso análisis que cuestiona la fiabilidad de las 'Scaling Laws', las leyes de escalamiento que han guiado inversiones billonarias en IA. El artículo desmonta que la mejora del rendimiento de los modelos de lenguaje (LLM) al aumentar parámetros, datos y computación sea tan predecible como se creía. Expone divergencias clave: en 2020, OpenAI concluyó que el tamaño del modelo debía crecer más rápido que los datos, mientras que DeepMind (2022) defendió un crecimiento proporcional, un desacuerdo atribuido a diferencias metodológicas y al tamaño limitado de los experimentos iniciales. Más críticamente, Weng revela que la metodología del influyente estudio 'Chinchilla' de DeepMind contenía errores, como una función de pérdida que no convergía correctamente, lo que significa que la 'fórmula óptima' utilizada durante años por la industria podría no serlo. El análisis subraya un problema fundamental: las leyes clásicas asumen datos únicos e infinitos, pero los textos de alta calidad se agotan. La repetición de datos en el entrenamiento degrada el rendimiento, especialmente en modelos grandes. Esto explica el cambio de la industria hacia el aprendizaje por refuerzo, el cómputo en tiempo de prueba y los datos sintéticos. En resumen, el artículo argumenta que la era de la escalabilidad simple ('scale is all you need') toca a su fin, y que el progreso futuro de la IA dependerá de refinamientos metodológicos precisos y de nuevas vías para superar la limitación de datos."

marsbit06/26 04:57

Tras tres años de retraso, el último artículo de la exalumna de la Universidad de Pekín, Lilian Weng, se viraliza

marsbit06/26 04:57

El mayor rival de Unitree, ¿cómo es que se ha escindido de nuevo?

El principal rival de Unitree, la empresa de robótica china, Zhìyuán, ha creado otra empresa escindida. MiBee Tech, centrada en la adquisición, gestión y distribución de datos para la inteligencia embodied, completó recientemente una ronda de financiación estratégica. Esto refleja la creciente escasez de datos de alta calidad necesarios para entrenar robots humanoides y de uso general. Mientras que modelos de lenguaje grande se entrenan con datos de Internet, los robots requieren datos multimodales del mundo físico. Se estima que solo hay unas 500.000 horas de datos de alta calidad disponibles a nivel mundial, muy por debajo de las necesidades de entrenamiento. MiBee busca abordar este cuello de botella ofreciendo un modelo de "datos como plataforma". La empresa utiliza dos métodos principales: teleoperación con robots reales y una solución de "adquisición sin cuerpo" más económica, con dispositivos portátiles y pinzas de captura. Su motor de procesamiento de datos, MEgo Engine, automatiza tareas como limpieza y etiquetado, aumentando la eficiencia. MiBee también ha establecido un mercado de datos y la iniciativa "Beehive" para crear una red colaborativa de datos en la industria. El éxito de MiBee dependerá de demostrar su neutralidad, ya que comparte origen con Zhìyuán. Debe ganar la confianza de otros fabricantes de robots, incluyendo competidores directos, que necesitan garantías de que sus datos no se compartirán. Además, enfrenta competencia de empresas como JD.com, Lumeng y otras que también buscan solucionar la "hambruna de datos" en robótica. Su objetivo declarado es alcanzar una capacidad de producción de datos de decenas de millones de horas para 2026.

marsbit06/23 10:14

El mayor rival de Unitree, ¿cómo es que se ha escindido de nuevo?

marsbit06/23 10:14

活动图片