Le 9 août, l'utilisateur de X ChrisGPT, qui suit de près les avancées des modèles d'OpenAI, a révélé qu'OpenAI travaillait sur un nouveau modèle de pré-entraînement à grande échelle, portant le nom de code Doug.
Selon lui, Doug constituera le projet de pré-entraînement le plus important jamais mené par OpenAI à ce jour, et il ne s'agit pas du même modèle que GPT-6.

Dans une réponse ultérieure, ChrisGPT a précisé que GPT-6 était probablement le modèle Astra, le plus puissant d'OpenAI, dont la sortie avait été reportée en urgence la veille pour des raisons de sécurité.

Concernant Doug, il estime qu'il pourrait être lancé au plus tard en novembre.

ChrisGPT n'est pas la première source à mentionner publiquement Doug.
Le 7 août, l'organisme de recherche sur les semi-conducteurs et l'IA, SemiAnalysis, a publié un extrait d'un mémo de recherche précédemment envoyé à ses clients institutionnels dans un article discutant de Gemini et de Google Cloud. Ce mémo datait du 9 juillet.
Adresse de l'article : https://newsletter.semianalysis.com/p/gemini-is-cooked-but-gcp-is-cooking
Il contenait une phrase clé : OpenAI a surmonté les problèmes liés au pré-entraînement, et un modèle beaucoup plus grand, portant le nom de code Doug, est activement en cours de développement.

Si ces informations sont exactes, Doug pourrait signifier qu'après près de deux ans à dépendre principalement du post-entraînement, de l'apprentissage par renforcement et du calcul au moment de l'inférence pour progresser, OpenAI est sur le point de relancer un cycle de renouvellement majeur des modèles de base.
L'histoire commence avec GPT-4o.
OpenAI confie davantage de croissance au RL
Le 13 mai 2024, OpenAI a lancé GPT-4o, le présentant comme son nouveau modèle phare.
Pendant près de deux ans après cela, bien qu'OpenAI ait formé et publié de nouveaux modèles de pré-entraînement comme GPT-4.5, l'entreprise n'a pas achevé un cycle de pré-entraînement à pleine échelle qui pourrait être largement déployé en tant que modèle frontière principal de nouvelle génération.
Dans le même temps, les progrès des modèles d'OpenAI ont commencé à provenir de plus en plus d'une autre voie.
Le 12 septembre 2024, OpenAI a dévoilé o1-preview.
Contrairement à la méthode passée qui reposait sur un pré-entraînement à plus grande échelle pour progresser, o1 a démontré une autre méthode de scaling : grâce à un apprentissage par renforcement à grande échelle, le modèle apprend à consacrer plus de puissance de calcul au raisonnement. Par la suite, le post-entraînement, le RL et le calcul au moment de l'inférence sont devenus de plus en plus importants dans l'écosystème des modèles d'OpenAI.
En avril 2025, o3 a été officiellement lancé. OpenAI a de nouveau souligné que les capacités de raisonnement de la série o provenaient d'un large apprentissage par renforcement.
En août 2025, GPT-5 a été lancé. Il ne s'agissait plus d'un seul modèle, mais d'une architecture unifiée composée d'un modèle rapide, d'un modèle de raisonnement approfondi et d'un système de routage.
SemiAnalysis estime que derrière o1, o3 et même la série GPT-5, il n'y a pas eu de saut générationnel complet de modèle de base comparable à celui de GPT-4o, ces modèles reposant en fait toujours sur l'écosystème de modèles de base de l'ère GPT-4o.
OpenAI n'a jamais confirmé cette filiation d'entraînement, mais si les informations de SemiAnalysis sont correctes, la stratégie des deux dernières années devient claire : la base n'a pas connu de saut générationnel de même ampleur, la croissance des capacités étant principalement tirée par un post-entraînement et un RL de plus en plus puissants.
Le scaling des modèles, qui dépendait auparavant principalement du pré-entraînement, s'est progressivement étendu à trois dimensions : pré-entraînement, RL et calcul au moment de l'inférence.
Le problème est que si le modèle de base ne connaît pas de renouvellement de même ampleur sur une longue période, et que l'on continue le scaling uniquement via le post-entraînement et le calcul d'inférence, on finira inévitablement par faire face à des rendements marginaux décroissants.
Et l'arrivée de Gemini 3 a rapidement transformé ce problème potentiel de stratégie d'entraînement en une pression concurrentielle bien réelle.
Garlic : le pré-entraînement recommence à tourner
Le 18 novembre 2025, Google a lancé Gemini 3.
Dix jours plus tard, dans une analyse du TPUv7, SemiAnalysis a émis un jugement qui a suscité de nombreux débats : Depuis GPT-4o, OpenAI n'a pas réussi à mener à bien un cycle de pré-entraînement à pleine échelle qui pourrait être largement déployé en tant que nouveau modèle frontière réussi.

Lorsque Google a sorti Gemini 3, cette différence est passée d'un problème de stratégie d'entraînement à une pression concurrentielle directe.
Le 1er décembre, plusieurs médias ont rapporté que Sam Altman avait annoncé en interne à OpenAI un « Code Red », exigeant que l'équipe priorise l'amélioration de ChatGPT et reconfigure une partie des ressources.
Un jour plus tard, des informations d'entraînement plus cruciales ont émergé.
Le 2 décembre 2025, The Information a rapporté qu'OpenAI développait un nouveau modèle de pré-entraînement portant le nom de code Garlic. L'article citait des sources internes indiquant que Garlic affichait de bonnes performances dans les évaluations de codage et de raisonnement, tout en utilisant une série de correctifs de bugs découverts par OpenAI lors de précédents entraînements.

Plus crucial encore, Mark Chen, directeur de la recherche chez OpenAI, aurait indiqué à l'équipe que l'entreprise avait résolu certains problèmes clés rencontrés précédemment dans le pré-entraînement. L'article mentionnait également que ces améliorations d'entraînement permettraient à des modèles plus petits d'intégrer des connaissances qui nécessitaient auparavant des modèles plus grands.
Dans le même article, une phrase est apparue plus tard comme particulièrement importante : OpenAI a déjà commencé, en s'appuyant sur les leçons tirées de Garlic, à développer un modèle « encore plus grand et meilleur ».
L'histoire de Doug, en fait, a commencé ici.
Le 6 janvier 2026, SemiAnalysis a de nouveau abordé la stratégie des modèles d'OpenAI. Cette fois, ils ont écrit directement : OpenAI a résolu les problèmes liés au pré-entraînement.

Autrement dit, selon les informations dont dispose SemiAnalysis, les problèmes qui entravaient auparavant le pré-entraînement à pleine échelle chez OpenAI ont été résolus.
Garlic a probablement servi à vérifier l'efficacité de ces correctifs, tandis que Doug pourrait être le résultat de l'application de ces méthodes d'entraînement à une échelle encore plus grande.
OpenAI pourrait se préparer à relancer le scaling de la base
Si les informations ci-dessus sont exactes, alors OpenAI pourrait être en train de mener de front au moins deux projets de modèles importants : Astra, déjà en phase d'évaluation avancée, et Doug, dont la taille serait encore plus grande.
Et Doug pointe vers autre chose : relancer le scaling de la base elle-même.
Au cours des deux dernières années, OpenAI a démontré qu'une ancienne base pouvait encore être poussée vers le haut grâce au RL, au raisonnement et au calcul au moment de l'inférence.
Doug doit répondre à une autre question : Lorsque la base elle-même accomplit à nouveau un saut significatif, jusqu'où ce système de post-entraînement, déjà poussé à l'extrême, pourra-t-il encore amener les capacités.
Cela pourrait bien être le véritable point de départ de la prochaine vague de compétition des modèles pour OpenAI.
Liens de référence :
https://x.com/ChrisGPT/status/2086220662264250764
https://newsletter.semianalysis.com/p/gemini-is-cooked-but-gcp-is-cooking
https://newsletter.semianalysis.com/p/rl-environments-and-rl-for-science
https://www.theinformation.com/newsletters/ai-agenda/openai-developing-garlic-model-counter-googles-recent-gains
Cet article provient du compte officiel WeChat « Machine Heart » (ID : almosthuman2014), auteur : Machine Heart, spécialisé dans les LLM





