# Pénurie de Données Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Pénurie de Données", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

Après trois ans d'attente, un nouvel article long de Lilian Weng, diplômée de l'Université de Pékin, fait le buzz

Après trois ans d'attente, Lilian Weng, ancienne vice-présidente d'OpenAI, a publié un long article analysant les "Scaling Laws" qui régissent le développement des grands modèles d'IA. Elle révèle que ces lois, fondement de milliards de dollars d'investissements, sont plus fragiles qu'imaginé. L'article souligne un désaccord clé : OpenAI (2020) préconisait une croissance plus rapide de la taille des modèles par rapport aux données, tandis que DeepMind (2022) défendait une croissance proportionnelle, ce qui a influencé l'entraînement de modèles comme GPT-3 et Chinchilla. Cette divergence proviendrait de différences dans le comptage des paramètres et de l'échelle limitée des premières expériences. Pire, la méthodologie même de l'étude Chinchilla, devenue une référence, contenait des bugs dans l'optimisation, découverts deux ans plus tard. Enfin, Weng pointe un problème fondamental : l'épuisement des données textuelles de haute qualité, remettant en cause l'hypothèse de données illimitées des lois classiques. Cela explique le virage de l'industrie vers l'apprentissage par renforcement, le calcul lors des tests et les données synthétiques. En conclusion, l'avenir de l'IA dépendra moins de la simple puissance de calcul que d'une compréhension plus fine et prudente de ces principes d'échelle.

marsbit06/26 04:58

Après trois ans d'attente, un nouvel article long de Lilian Weng, diplômée de l'Université de Pékin, fait le buzz

marsbit06/26 04:58

Le principal rival de Unitree, pourquoi se séparer à nouveau ?

L'entreprise chinoise Zhiyuan, un des principaux concurrents de la société de robots humanoïdes Unitree, a procédé à une nouvelle scission en créant la société Mi Feng Tech, qui se concentre sur la collecte, la gouvernance et la circulation de données pour l'intelligence incarnée. Cet article souligne l'importance croissante des données de haute qualité, dérivées du monde physique, pour entraîner les robots, une ressource actuellement rare et coûteuse. Mi Feng Tech vise à devenir une plateforme de données standardisée pour l'industrie en proposant deux méthodes : la collecte par téléopération avec des robots et une nouvelle approche « sans corps robotique » utilisant des équipements portables comme le MEgo, censée réduire les coûts. La société développe également un moteur de gouvernance de données (MEgo Engine) pour nettoyer, annoter et structurer les données brutes, ainsi qu'une place de marché pour les commercialiser. Cependant, Mi Feng doit relever plusieurs défis pour réussir. Sa neutralité est questionnée en raison de ses liens avec Zhiyuan. Pour gagner la confiance des concurrents de cette dernière, elle doit garantir l'isolation et la sécurité des données des clients. De plus, elle fait face à une concurrence croissante d'entreprises comme JD.com ou Luming Robotics. Enfin, atteindre son objectif ambitieux de capacité de production de dizaines de millions d'heures de données d'ici 2026 tout en maintenant une qualité et une variété suffisantes pour l'entraînement de modèles généraux représente un autre défi de taille. La séparation de Mi Feng lui donne la possibilité de servir le marché au-delà de Zhiyuan. Son succès dépendra finalement de sa capacité à établir une position d'infrastructure de données de confiance pour toute l'industrie de la robotique.

marsbit06/23 10:15

Le principal rival de Unitree, pourquoi se séparer à nouveau ?

marsbit06/23 10:15

活动图片