Ngày 9/8, người dùng X ChrisGPT, người theo dõi sát sao các động thái mô hình của OpenAI, tiết lộ rằng OpenAI đang thúc đẩy một mô hình pre-train quy mô lớn mới với mã hiệu là Doug.
Theo nguồn tin này, Doug sẽ là dự án pre-train lớn nhất từ trước đến nay của OpenAI và nó không phải là cùng một mô hình với GPT-6.

Trong các phản hồi tiếp theo, ChrisGPT cho biết thêm, GPT-6 rất có thể chính là mô hình mạnh nhất của OpenAI - Astra - đã bị tạm hoãn phát hành khẩn cấp vào hôm qua do vấn đề an ninh.

Đối với Doug, anh ấy dự kiến mô hình này có thể sẽ ra mắt muộn nhất là trước tháng 11.

ChrisGPT không phải là nguồn tin đầu tiên công khai nhắc đến Doug.
Ngày 7/8, tổ chức nghiên cứu ngành bán dẫn và AI SemiAnalysis trong một bài viết thảo luận về Gemini và Google Cloud, đã công bố một đoạn bản ghi nhớ nghiên cứu trước đó gửi cho khách hàng tổ chức. Bản ghi nhớ này có thời gian là ngày 9/7.
Địa chỉ bài viết: https://newsletter.semianalysis.com/p/gemini-is-cooked-but-gcp-is-cooking
Trong đó có một câu rất quan trọng: OpenAI đã khắc phục được các vấn đề về pre-training, một mô hình với mã hiệu là Doug, có quy mô lớn hơn rất nhiều đang được thúc đẩy tích cực.

Nếu thông tin liên quan là chính xác, Doug có thể có nghĩa là sau gần hai năm chủ yếu dựa vào post-training, reinforcement learning và inference-time compute để thúc đẩy tăng trưởng năng lực, OpenAI đang khởi động lại một lần thay thế mô hình cơ bản quy mô lớn.
Câu chuyện bắt đầu từ GPT-4o.
OpenAI Giao Nhiều Hơn Sự Tăng Trưởng Cho RL
Ngày 13/5/2024, OpenAI phát hành GPT-4o và gọi nó là mô hình flagship mới.
Sau đó gần hai năm, mặc dù OpenAI đã huấn luyện và phát hành các mô hình pre-train mới như GPT-4.5, nhưng họ vẫn chưa hoàn thành một lần pre-train toàn quy mô có thể được triển khai rộng rãi như một frontier model chủ lực thế hệ tiếp theo.
Đồng thời, sự tăng trưởng năng lực mô hình của OpenAI bắt đầu ngày càng đến từ một con đường khác.
Ngày 12/9/2024, OpenAI phát hành o1-preview.
So với việc dựa vào pre-train quy mô lớn hơn để thúc đẩy tăng trưởng năng lực như trước đây, o1 đã cho thấy một phương pháp scaling khác: thông qua reinforcement learning quy mô lớn, để mô hình học cách đầu tư nhiều tính toán hơn vào suy luận. Sau đó, post-training, RL và inference-time compute ngày càng trở nên quan trọng trong hệ thống mô hình của OpenAI.
Tháng 4/2025, o3 chính thức phát hành. OpenAI một lần nữa nhấn mạnh, khả năng suy luận của dòng o đến từ large-scale reinforcement learning.
Tháng 8/2025, GPT-5 ra mắt. Nó không còn chỉ là một mô hình đơn lẻ, mà là một kiến trúc thống nhất bao gồm mô hình nhanh, mô hình suy luận sâu và hệ thống định tuyến.
SemiAnalysis cho rằng, đằng sau dòng o1, o3 và thậm chí cả GPT-5, không đi kèm với một lần thay đổi thế hệ base model hoàn toàn mới tương đương với GPT-4o, các mô hình liên quan trên thực tế vẫn được xây dựng trên hệ thống mô hình cơ bản từ thời GPT-4o.
OpenAI chưa bao giờ xác nhận dòng dõi huấn luyện này, nhưng nếu thông tin của SemiAnalysis là đúng, tuyến đường trong gần hai năm qua sẽ rất dễ hiểu:Phần nền tảng không có sự thay đổi thế hệ cùng cấp độ, sự tăng trưởng năng lực chủ yếu được thúc đẩy bởi post-training và RL ngày càng mạnh.
Việc scaling mô hình cũng từ chỗ chủ yếu phụ thuộc vào pre-training, dần dần mở rộng sang ba chiều: pre-training, RL và inference-time compute.
Vấn đề là, nếu mô hình cơ bản lâu dài không có sự thay đổi thế hệ cùng cấp độ, chỉ dựa vào post-training và tính toán suy luận để tiếp tục scaling, sớm muộn cũng sẽ phải đối mặt với vấn đề lợi ích biên giảm dần.
Và sự xuất hiện của Gemini 3 đã nhanh chóng biến vấn đề tuyến huấn luyện tiềm ẩn này thành áp lực cạnh tranh thực tế.
Garlic: Pre-training Bắt Đầu Vận Hành Trở Lại
Ngày 18/11/2025, Google phát hành Gemini 3.
Mười ngày sau, SemiAnalysis trong phân tích TPUv7 đã đưa ra một đánh giá gây tranh luận rộng rãi:Kể từ GPT-4o, OpenAI chưa hoàn thành một lần pre-train toàn quy mô thành công nào có thể được triển khai rộng rãi như một frontier model mới.

Khi Google ra mắt Gemini 3, sự khác biệt này cũng từ vấn đề tuyến huấn luyện, trở thành áp lực cạnh tranh trực tiếp.
Ngày 1/12, nhiều phương tiện truyền thông đưa tin, Sam Altman đã tuyên bố "Code Red" nội bộ tại OpenAI, yêu cầu nhóm ưu tiên nâng cao ChatGPT, và định cấu hình lại một phần tài nguyên.
Một ngày sau, thông tin huấn luyện then chốt hơn đã nổi lên.
Ngày 2/12/2025, tờ The Information đưa tin rằng OpenAI đang phát triển một mô hình pre-train mới với mã hiệu là Garlic. Bài báo trích dẫn nguồn tin nội bộ cho biết, Garlic thể hiện tốt trong các đánh giá coding và reasoning, đồng thời sử dụng một loạt các bản sửa lỗi mà OpenAI đã phát hiện trong quá trình huấn luyện trước đó.

Quan trọng hơn, Giám đốc nghiên cứu của OpenAI Mark Chen được cho là đã nói với nhóm rằng, công ty đã giải quyết được một số vấn đề then chốt trong pre-training trước đó. Bài báo còn đề cập, những cải tiến huấn luyện này có thể cho phép các mô hình nhỏ hơn chứa đựng kiến thức mà trước đây cần đến các mô hình lớn hơn mới có được.
Trong cùng bài báo đó, còn có một câu sau này tỏ ra đặc biệt quan trọng:OpenAI đã dựa trên kinh nghiệm học được từ Garlic, bắt đầu phát triển một mô hình "thậm chí còn lớn hơn và tốt hơn".
Câu chuyện về Doug, thực ra đã bắt đầu từ đây.
Ngày 6/1/2026, SemiAnalysis lại nói về tuyến mô hình của OpenAI. Lần này, họ trực tiếp viết:OpenAI đã giải quyết được các vấn đề về pre-training.

Nghĩa là, theo thông tin mà SemiAnalysis nắm được, các vấn đề về pre-train toàn quy mô trước đây của OpenAI đã được giải quyết.
Garlic rất có thể đã đóng vai trò xác minh xem các bản sửa lỗi này có hiệu quả hay không, còn Doug, có thể là kết quả sau khi các phương pháp huấn luyện này thực sự được phóng đại lên quy mô lớn hơn.
OpenAI Có Thể Chuẩn Bị Khởi Động Lại Việc Scaling Phần Nền Tảng
Nếu các thông tin trên là chính xác, thì OpenAI có thể đang liên tục thúc đẩy ít nhất hai dự án mô hình quan trọng: Astra đã vào giai đoạn đánh giá nâng cao, và Doug được cho là có quy mô lớn hơn.
Và Doug hướng đến một điều khác: thúc đẩy lại việc scaling bản thân phần nền tảng.
Hai năm qua, OpenAI đã chứng minh, phần nền tảng cũ vẫn có thể được đẩy lên cao hơn liên tục thông qua RL, reasoning và inference-time compute.
Doug sẽ trả lời một câu hỏi khác:Sau khi bản thân phần nền tảng hoàn thành một lần nhảy vọt lớn, hệ thống post-training đã được đẩy đến cực hạn này, còn có thể đưa năng lực đi đến đâu nữa.
Đây mới có thể là điểm khởi đầu thực sự cho cuộc cạnh tranh mô hình tiếp theo của OpenAI.
Tài Liệu Tham Khảo:
https://x.com/ChrisGPT/status/2086220662264250764
https://newsletter.semianalysis.com/p/gemini-is-cooked-but-gcp-is-cooking
https://newsletter.semianalysis.com/p/rl-environments-and-rl-for-science
https://www.theinformation.com/newsletters/ai-agenda/openai-developing-garlic-model-counter-googles-recent-gains
Bài viết này đến từ tài khoản công chúng WeChat "机器之心" (ID:almosthuman2014), tác giả: 关注LLM的机器之心





