Doug, le plus grand modèle de pré-entraînement d'OpenAI, vient d'être dévoilé
Le 9 août, un utilisateur X spécialisé dans les tendances d'OpenAI, ChrisGPT, a révélé qu'OpenAI développait un nouveau grand modèle de pré-entraînement de code "Doug". Selon lui, Doug serait le projet de pré-entraînement le plus important à ce jour pour OpenAI et ne serait pas identique au GPT-6. Ce dernier pourrait être Astra, le modèle le plus puissant dont la sortie a été récemment reportée pour des raisons de sécurité. Doug, quant à lui, pourrait être lancé d'ici novembre.
Ces informations semblent corroborées par un memo interne du cabinet de recherche SemiAnalysis daté du 9 juillet, indiquant qu'OpenAI avait surmonté ses problèmes de pré-entraînement et avançait activement sur un modèle de plus grande ampleur nommé Doug. Cela suggère qu'après près de deux ans à dépendre principalement du post-entraînement, de l'apprentissage par renforcement (RL) et du calcul au moment de l'inférence pour améliorer ses modèles, OpenAI relancerait un cycle majeur de renouvellement de son modèle de base.
Depuis GPT-4o (mai 2024), OpenAI n'aurait pas achevé de pré-entraînement à pleine échelle conduisant à un nouveau "frontier model" déployable. La croissance des capacités est venue de l'apprentissage par renforcement à grande échelle, comme démontré par les séries o1 et o3, et par l'architecture unifiée GPT-5. Cependant, sans saut générationnel de la base, cette approche pourrait voir des rendements décroissants.
La pression concurrentielle s'est accrue avec le lancement de Gemini 3 par Google en novembre 2025. Peu après, OpenAI aurait déclaré un "Code Red" en interne et accéléré le développement. En décembre, des rapports ont fait état d'un nouveau modèle de pré-entraînement de code "Garlic", performant en codage et raisonnement, qui aurait permis de résoudre des problèmes clés de pré-entraînement. Doug serait le successeur plus grand et plus avancé, bénéficiant de ces corrections.
En résumé, Doug pourrait marquer le retour d'OpenAI à un scaling agressif de son modèle de base. La question centrale est de savoir jusqu'où le système avancé de post-entraînement et de RL de l'entreprise pourra pousser les capacités d'un nouveau fondement considérablement amélioré.
marsbit08/09 23:43