Après trois ans d'attente, un nouvel article long de Lilian Weng, diplômée de l'Université de Pékin, fait le buzz
Après trois ans d'attente, Lilian Weng, ancienne vice-présidente d'OpenAI, a publié un long article analysant les "Scaling Laws" qui régissent le développement des grands modèles d'IA. Elle révèle que ces lois, fondement de milliards de dollars d'investissements, sont plus fragiles qu'imaginé. L'article souligne un désaccord clé : OpenAI (2020) préconisait une croissance plus rapide de la taille des modèles par rapport aux données, tandis que DeepMind (2022) défendait une croissance proportionnelle, ce qui a influencé l'entraînement de modèles comme GPT-3 et Chinchilla. Cette divergence proviendrait de différences dans le comptage des paramètres et de l'échelle limitée des premières expériences. Pire, la méthodologie même de l'étude Chinchilla, devenue une référence, contenait des bugs dans l'optimisation, découverts deux ans plus tard. Enfin, Weng pointe un problème fondamental : l'épuisement des données textuelles de haute qualité, remettant en cause l'hypothèse de données illimitées des lois classiques. Cela explique le virage de l'industrie vers l'apprentissage par renforcement, le calcul lors des tests et les données synthétiques. En conclusion, l'avenir de l'IA dépendra moins de la simple puissance de calcul que d'une compréhension plus fine et prudente de ces principes d'échelle.
marsbit06/26 04:58