El 9 de agosto, el usuario de X ChrisGPT, que lleva mucho tiempo siguiendo los movimientos de los modelos de OpenAI, reveló que OpenAI está avanzando en un nuevo gran modelo de preentrenamiento con nombre en código Doug.
Según sus declaraciones, Doug será el proyecto de preentrenamiento más grande de OpenAI hasta la fecha, y no es el mismo modelo que GPT-6.

En respuestas posteriores, ChrisGPT añadió que GPT-6 es probablemente el modelo más potente de OpenAI, Astra, cuyo lanzamiento se pospuso de urgencia ayer por problemas de seguridad.

En cuanto a Doug, ChrisGPT espera que pueda lanzarse antes de noviembre como muy tarde.

ChrisGPT no es la primera fuente que menciona públicamente a Doug.
El 7 de agosto, la institución de investigación sobre semiconductores e IA, SemiAnalysis, en un artículo que discutía sobre Gemini y Google Cloud, publicó un extracto de un memorando de investigación enviado previamente a sus clientes institucionales. Este memorando estaba fechado el 9 de julio.
Enlace al artículo: https://newsletter.semianalysis.com/p/gemini-is-cooked-but-gcp-is-cooking
Había una frase clave: OpenAI ha resuelto los problemas de preentrenamiento y está avanzando activamente en un modelo mucho más grande con nombre en código Doug.

Si la información es precisa, Doug podría significar que, después de casi dos años dependiendo principalmente del post-entrenamiento, el aprendizaje por refuerzo y la capacidad de cómputo en tiempo de inferencia para impulsar el crecimiento de capacidades, OpenAI está reiniciando una renovación a gran escala de sus modelos base.
La historia comienza con GPT-4o.
OpenAI delega más crecimiento al RL
El 13 de mayo de 2024, OpenAI lanzó GPT-4o y lo denominó su nuevo modelo insignia.
Durante los casi dos años posteriores, aunque OpenAI entrenó y lanzó nuevos modelos de preentrenamiento como GPT-4.5, nunca completó un ciclo de preentrenamiento a gran escala que pudiera desplegarse ampliamente como el próximo modelo frontera principal.
Al mismo tiempo, el crecimiento de las capacidades de los modelos de OpenAI comenzó a provenir cada vez más de otra ruta.
El 12 de septiembre de 2024, OpenAI lanzó o1-preview.
En comparación con el enfoque pasado de impulsar el crecimiento de capacidades mediante un preentrenamiento a mayor escala, o1 demostró otro método de escalado : a través de un aprendizaje por refuerzo a gran escala, el modelo aprende a dedicar más capacidad de cómputo al razonamiento. A partir de entonces, el post-entrenamiento, el RL y la capacidad de cómputo en tiempo de inferencia se volvieron cada vez más importantes en la arquitectura de modelos de OpenAI.
En abril de 2025, se lanzó oficialmente o3. OpenAI volvió a enfatizar que las capacidades de razonamiento de la serie o provenían de un aprendizaje por refuerzo a gran escala.
En agosto de 2025, se lanzó GPT-5. Ya no era un modelo único, sino una arquitectura unificada compuesta por un modelo rápido, un modelo de razonamiento profundo y un sistema de enrutamiento.
SemiAnalysis cree que detrás de o1, o3 e incluso la serie GPT-5, no hubo una transición generacional completamente nueva de modelo base comparable a la de GPT-4o; estos modelos en realidad todavía se basaban en la arquitectura de modelos base de la era GPT-4o.
OpenAI nunca confirmó este linaje de entrenamiento, pero si la información de SemiAnalysis es correcta, la ruta de los últimos dos años es fácil de entender: La base no experimentó una transición generacional del mismo nivel, y el crecimiento de capacidades fue impulsado principalmente por post-entrenamientos y RL cada vez más potentes.
El escalado de modelos también pasó de depender principalmente del pre-entrenamiento, a expandirse gradualmente a tres dimensiones: pre-entrenamiento, RL y capacidad de cómputo en tiempo de inferencia.
El problema es que si el modelo base no experimenta una renovación generacional del mismo nivel durante mucho tiempo, y solo se continúa escalando mediante el post-entrenamiento y la capacidad de cómputo en inferencia, eventualmente se enfrentará el problema de rendimientos marginales decrecientes.
Y la aparición de Gemini 3 convirtió rápidamente este problema potencial de la ruta de entrenamiento en una presión competitiva real.
Garlic: el preentrenamiento comienza a funcionar de nuevo
El 18 de noviembre de 2025, Google lanzó Gemini 3.
Diez días después, SemiAnalysis, en un análisis de TPUv7, lanzó un juicio que generó un amplio debate: Desde GPT-4o, OpenAI no ha completado un ciclo exitoso de preentrenamiento a gran escala que pudiera desplegarse ampliamente como un nuevo modelo frontera.

Cuando Google lanzó Gemini 3, esta diferencia dejó de ser un problema de la ruta de entrenamiento para convertirse en una presión competitiva directa.
El 1 de diciembre, varios medios informaron que Sam Altman anunció internamente en OpenAI un "Código Rojo", exigiendo al equipo que priorizara la mejora de ChatGPT y reconfigurara parte de los recursos.
Un día después, surgió información de entrenamiento aún más crucial.
El 2 de diciembre de 2025, *The Information* informó que OpenAI estaba desarrollando un nuevo modelo de preentrenamiento con nombre en código Garlic. El informe, citando fuentes internas, decía que Garlic mostraba un buen desempeño en evaluaciones de codificación y razonamiento, y utilizaba una serie de correcciones de errores descubiertas por OpenAI en procesos de entrenamiento anteriores.

Lo más importante es que, según se afirma, el director de investigación de OpenAI, Mark Chen, dijo al equipo que la empresa había resuelto algunos problemas clave en el preentrenamiento. El informe también mencionaba que estas mejoras en el entrenamiento permitirían que modelos más pequeños albergaran conocimientos que antes requerían modelos más grandes.
En el mismo informe, había otra frase que luego resultaría particularmente importante: OpenAI ya ha comenzado a desarrollar un modelo "aún más grande y mejor" basándose en las lecciones aprendidas con Garlic.
La historia de Doug, de hecho, ya comenzó aquí.
El 6 de enero de 2026, SemiAnalysis volvió a hablar sobre la ruta de modelos de OpenAI. Esta vez, escribieron directamente: OpenAI ha resuelto los problemas relacionados con el preentrenamiento.

Es decir, según la información manejada por SemiAnalysis, los problemas que habían obstaculizado el preentrenamiento a gran escala en OpenAI ya estaban resueltos.
Es probable que Garlic desempeñara el papel de verificar si estas correcciones eran efectivas, mientras que Doug podría ser el resultado de que estos métodos de entrenamiento se ampliaran realmente a una escala mayor.
OpenAI podría estar preparándose para reiniciar el escalado de la base
Si la información anterior es precisa, entonces OpenAI podría estar avanzando consecutivamente en al menos dos importantes proyectos de modelo: Astra, que ya está en una fase avanzada de evaluación, y Doug, que según se informa es de mayor escala.
Y Doug apunta a otra cosa: volver a impulsar el escalado de la base en sí misma.
En los últimos dos años, OpenAI ya ha demostrado que una base antigua aún puede potenciarse continuamente mediante RL, razonamiento y capacidad de cómputo en tiempo de inferencia.
Lo que Doug debe responder es otra pregunta: Cuando la base en sí misma vuelve a realizar un gran salto generacional, ¿hasta dónde puede llevar la capacidad este sistema de post-entrenamiento ya llevado al límite?
Este podría ser el verdadero punto de partida para la próxima ronda de competencia de modelos de OpenAI.
Referencias:
https://x.com/ChrisGPT/status/2086220662264250764
https://newsletter.semianalysis.com/p/gemini-is-cooked-but-gcp-is-cooking
https://newsletter.semianalysis.com/p/rl-environments-and-rl-for-science
https://www.theinformation.com/newsletters/ai-agenda/openai-developing-garlic-model-counter-googles-recent-gains
Este artículo proviene del WeChat público "Machine Heart" (ID:almosthuman2014), autor: Machine Heart que sigue a LLM





