Hai ngày gần đây, một bài đăng của cư dân mạng Max For AI@MaxForAI trên X đã thu hút sự bàn tán sôi nổi: "Thật điên rồ — bây giờ bạn thậm chí có thể xem trực tiếp quá trình huấn luyện một mô hình lớn 535B được thực hiện như thế nào."

Hóa ra là Giáo sư Đại học Stanford, người sáng lập Simile AI — Percy Liang@percyliang đã thông báo rằng Phòng thí nghiệm Mở Marin sẽ bắt đầu huấn luyện mô hình Marin 535B-A23B, và toàn bộ quá trình huấn luyện sẽ được công khai.
Marin có tổng cộng 535 tỷ tham số, 23 tỷ tham số kích hoạt. Để thực hiện điều này, Percy Liang và đội ngũ đã chuẩn bị tổng cộng 18,75 nghìn tỷ token dữ liệu huấn luyện, triển khai 11 hệ thống GB200 NVL72, tương đương với khoảng 792 GPU GB200.
Dự kiến mô hình sẽ được huấn luyện liên tục trong khoảng 3 tháng, tổng lượng tính toán huấn luyện vào khoảng 2.7e24 FLOPs. Sau khi hoàn thành huấn luyện, đội ngũ sẽ tiếp tục tiến hành giai đoạn hậu huấn luyện (post-training).

Nói cách khác: Trong vài tháng tới, tất cả mọi người đều có thể quan sát một mô hình lớn tiên tiến phát triển từ con số không như thế nào.
Một điểm đáng chú ý khác là, Percy Liang cho biết, trước khi chính thức khởi động nhiệm vụ huấn luyện này, đội ngũ đã huấn luyện trước một bộ Scaling Ladder (Thang mở rộng quy mô) gồm 4 giai đoạn, từ 1.6B-A61M (48B tokens) cho đến 27.7B-A1.2B (926B tokens).
"Làm vậy có hai mục đích, một là sử dụng các thử nghiệm quy mô nhỏ này để phát hiện và gỡ lỗi sớm các vấn đề tiềm ẩn; hai là dựa trên hiệu suất huấn luyện của các mô hình ở các quy mô khác nhau để dự đoán cho việc 'huấn luyện mô hình chính' (hero run) của chúng tôi."
Tất nhiên, Percy Liang cũng nói thêm, "Đây là lần huấn luyện có quy mô lớn nhất mà chúng tôi từng thực hiện cho đến nay, vì vậy, chúng tôi thực sự mong đợi sẽ xuất hiện một số tình huống ngoài dự kiến trong quá trình này."
Hiện tại, mô hình chính đã chính thức bắt đầu chạy, tất cả mọi người đều có thể trực tiếp xem đường cong huấn luyện thời gian thực. Sau đó, dữ liệu huấn luyện, nhật ký thí nghiệm và các vấn đề kỹ thuật cũng sẽ tiếp tục được công khai.
Ví dụ ở cấp độ dữ liệu, bao gồm tỷ lệ pha trộn dữ liệu huấn luyện, cách xử lý dữ liệu, và cách dữ liệu từ các lĩnh vực khác nhau đi vào mô hình; ở cấp độ kỹ thuật, bao gồm cấu hình huấn luyện, mã code và thiết kế thí nghiệm; quá trình huấn luyện, bao gồm sự thay đổi loss theo thời gian thực, trạng thái mô hình và kết quả dự đoán ở các giai đoạn khác nhau, v.v.
Đồng thời, Percy Liang cũng công khai các kênh theo dõi cụ thể.

Xem cấu thành dữ liệu: https://storage.googleapis.com/marin-public/held/harrier-k40-cluster-overview/2026.08.18/index.html?revision=uniform-sampling
Theo dõi quá trình huấn luyện thời gian thực trên Weights & Biases (wandb): https://wandb.ai/marin-community/marin_moe/reports/535B-A23B-18T-Token-Hero-Run-Scaling-Ladder--VmlldzoxNzc2MDM5Ng
Xem tất cả thông tin chi tiết trên GitHub: https://github.com/marin-community/marin/issues/8435
Sau khi tìm hiểu kỹ, không khó để nhận ra lý do tại sao động thái này của Percy Liang lại có thể thu hút sự chú ý của mọi người. Bởi vì trong quá khứ, đối với các mô hình như GPT-4, Claude, Gemini, chúng ta hoàn toàn không biết cụ thể chúng được huấn luyện như thế nào, giống như một "hộp đen".
Mọi người chỉ có thể thấy năng lực cuối cùng của mô hình, điểm số benchmark, một vài mô tả trong bài báo, v.v. Còn về tỷ lệ phối trộn dữ liệu, những lần huấn luyện thất bại, những siêu tham số nào hiệu quả, loss thay đổi ra sao, định luật Scaling law có dự đoán chính xác hay không, tất cả đều là ẩn số.
Marin đang cố gắng thay đổi điều này. Có lẽ, việc huấn luyện mô hình cũng có thể giống như viết bài báo, phần mềm nguồn mở: có thể quan sát, có thể thảo luận, có thể hợp tác.
Và kể từ khi thông tin này được công bố, nhiệt huyết của cộng đồng mạng vẫn tiếp tục tăng cao.
Có người dùng cho rằng, đây mới thực sự là tinh thần nguồn mở, "ngay cả khi quá trình huấn luyện gặp vấn đề, đi chệch hướng dự kiến, cũng không hề che giấu."

Một người dùng khác lại nói, mặc dù bản thân việc huấn luyện mô hình đã rất đồ sộ, nhưng điều thực sự gây sốc là bây giờ mọi người thậm chí có thể thông qua nền tảng WandB, xem trực tiếp quá trình huấn luyện một mô hình lớn với quy mô trị giá hàng chục tỷ đô la lớn lên từng bước như thế nào?
>"Điều này giống như căn 'phòng tối' vốn luôn đóng kín bên trong các phòng thí nghiệm AI hàng đầu bỗng nhiên được mở ra, tất cả mọi người đều có thể nhìn thấy bên trong đang diễn ra điều gì."Và trong ba tháng tới, điều đáng mong đợi nhất có lẽ không phải là năng lực cuối cùng của mô hình, mà là quan sát xem mô hình này trong quá trình huấn luyện sẽ trải qua bao nhiêu lần "phát nổ", sụp đổ và những tình huống bất ngờ......

Ngoài ra, một số người dùng còn cho rằng, động thái này không chỉ cung cấp một góc nhìn để xem toàn bộ quá trình huấn luyện mô hình, mà thậm chí còn cho mọi người một nền tảng để học tập, trao đổi.
Người dùng James Thewlis@jdthewlis đã liên tục theo dõi quá trình huấn luyện theo thời gian thực, trong quá trình đó anh ta không hiểu "tại sao vào khoảng step thứ 500, norms (chuẩn tham số) lại xuất hiện một đỉnh?"
Sau khi tự mình tìm hiểu ra, anh ta lại tự hỏi tự trả lời trong phần bình luận: "Đỉnh này hoàn toàn là do router_bias (thiên lệch định tuyến) gây ra. Nó không phải là tham số thu được thông qua huấn luyện gradient, mà là một phần của cơ chế cân bằng token (token balancing heuristic) trong MoE (Mô hình Chuyên gia Hỗn hợp), do đó nó có quy luật biến đổi động khác với các tham số mô hình thông thường."

Những tình huống như thế này còn rất nhiều.

Ngoài ra, đáng chú ý là, với tư cách là Giáo sư Đại học Stanford, ngoài việc thực hành thực tế lần này, Percy Liang còn có một khóa học lý thuyết: "CS336: Language Models From Scratch" (Xây dựng Mô hình Ngôn ngữ Từ Đầu), mục tiêu là để học sinh hiểu đầy đủ cách một mô hình ngôn ngữ lớn được xây dựng.
Có vẻ như, Percy Liang thực sự muốn dạy tất cả mọi người cách "chế tạo" mô hình lớn. Những ai quan tâm có thể tìm hiểu thêm.

Liên kết khóa học: https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV
Vậy bạn thì sao? Bạn nghĩ gì về buổi phát trực tiếp thực sự đưa quá trình huấn luyện mô hình lớn lên sân khấu này? Chào đón bạn để lại bình luận trao đổi!
Tài liệu tham khảo:
https://x.com/MaxForAI/status/2091270116067750089
https://x.com/percyliang/status/2090918065634684997
https://x.com/CopyRebeldia/status/2091231950774112412?s=20
https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV
Bài viết này đến từ tài khoản công chúng WeChat "机器之心" (ID:almosthuman2014), tác giả: 关注AI的





