Dwarkesh Patel : La prochaine génération d'IA pourrait provenir du "travail"
Dwarkesh Patel, célèbre podcasteur tech de la Silicon Valley, s'interroge sur le prochain paradigme d'entraînement de l'IA. Il identifie le RLVR (Reinforcement Learning with Verifiable Rewards), efficace pour les tâches "grindables" comme le code ou les mathématiques (vérifiables et reproductibles à grande échelle), comme une étape clé.
Cependant, il souligne ses limites pour les tâches complexes du monde réel (entreprendre, plaider en justice, gagner une élection), où les environnements sont non stationnaires, non réinitialisables et à rétroaction lente.
L'enjeu principal, selon lui, est le "learning back to the weights" : apprendre à comprimer de manière efficace l'expérience acquise lors du déploiement réel en modifications durables des poids du modèle, au-delà de l'apprentissage contextuel temporaire.
Il évoque deux pistes prometteuses :
1. **L'OPSD (On-Policy Self-Distillation)** : distiller les connaissances d'un modèle "expérimenté" ayant appris en contexte vers le modèle de base.
2. **Le "Dreaming"** : la capacité de l'agent à construire ses propres environnements simulés à partir d'observations réelles pour s'y entraîner de manière intensive.
À terme, le futur paradigme d'entraînement pourrait combiner une phase préalable de RLVR pour des compétences agentiques de base, puis une phase continue d'apprentissage à partir de l'expérience réelle accumulée après le déploiement. L'avancée de l'IA reposerait ainsi moins sur des données humaines préexistantes que sur l'expérience autonome acquise en accomplissant des tâches authentiques.
marsbit06/28 23:54