Giáo sư Stanford phát trực tiếp quá trình huấn luyện mô hình lớn 535B, 'hộp đen' đằng sau quá trình huấn luyện mô hình đang được mở ra?

marsbitXuất bản vào 2026-08-24Cập nhật gần nhất vào 2026-08-24

Tóm tắt

Giáo sư Stanford Percy Liang và nhóm của ông đang thực hiện huấn luyện công khai mô hình ngôn ngữ lớn Marin 535B-A23B với 535 tỷ tham số, và toàn bộ quá trình này được phát trực tiếp. Mô hình sử dụng 11 hệ thống GB200 NVL72 (khoảng 792 GPU), được huấn luyện trên 18,75 nghìn tỷ token trong khoảng 3 tháng. Nhóm đã thực hiện các thử nghiệm quy mô nhỏ trước đó để dự đoán và gỡ lỗi. Dự án này cho phép bất kỳ ai theo dõi trực tiếp các đường cong huấn luyện, cấu hình, dữ liệu và nhật ký thông qua các nền tảng như Weights & Biases và GitHub. Điều này được coi là một bước đột phá trong việc mở "hộp đen" của huấn luyện mô hình lớn, vốn thường được các phòng thí nghiệm AI hàng đầu giữ kín. Cộng đồng nhiệt liệt hưởng ứng vì tính minh bạch và giá trị giáo dục, coi đây là tinh thần mã nguồn mở thực thụ. Người dùng có thể học hỏi, thảo luận các chi tiết kỹ thuật (như biến động của router_bias trong MoE) ngay trong quá trình huấn luyện. Giáo sư Liang cũng giảng dạy khóa học "CS336: Language Models From Scratch", củng cố mục tiêu chia sẻ kiến thức xây dựng mô hình ngôn ngữ lớn cho tất cả mọi người.

Hai ngày gần đây, một bài đăng của cư dân mạng Max For AI@MaxForAI trên X đã thu hút sự bàn tán sôi nổi: "Thật điên rồ — bây giờ bạn thậm chí có thể xem trực tiếp quá trình huấn luyện một mô hình lớn 535B được thực hiện như thế nào."

Hóa ra là Giáo sư Đại học Stanford, người sáng lập Simile AI — Percy Liang@percyliang đã thông báo rằng Phòng thí nghiệm Mở Marin sẽ bắt đầu huấn luyện mô hình Marin 535B-A23B, và toàn bộ quá trình huấn luyện sẽ được công khai.

Marin có tổng cộng 535 tỷ tham số, 23 tỷ tham số kích hoạt. Để thực hiện điều này, Percy Liang và đội ngũ đã chuẩn bị tổng cộng 18,75 nghìn tỷ token dữ liệu huấn luyện, triển khai 11 hệ thống GB200 NVL72, tương đương với khoảng 792 GPU GB200.

Dự kiến mô hình sẽ được huấn luyện liên tục trong khoảng 3 tháng, tổng lượng tính toán huấn luyện vào khoảng 2.7e24 FLOPs. Sau khi hoàn thành huấn luyện, đội ngũ sẽ tiếp tục tiến hành giai đoạn hậu huấn luyện (post-training).

Nói cách khác: Trong vài tháng tới, tất cả mọi người đều có thể quan sát một mô hình lớn tiên tiến phát triển từ con số không như thế nào.

Một điểm đáng chú ý khác là, Percy Liang cho biết, trước khi chính thức khởi động nhiệm vụ huấn luyện này, đội ngũ đã huấn luyện trước một bộ Scaling Ladder (Thang mở rộng quy mô) gồm 4 giai đoạn, từ 1.6B-A61M (48B tokens) cho đến 27.7B-A1.2B (926B tokens).

"Làm vậy có hai mục đích, một là sử dụng các thử nghiệm quy mô nhỏ này để phát hiện và gỡ lỗi sớm các vấn đề tiềm ẩn; hai là dựa trên hiệu suất huấn luyện của các mô hình ở các quy mô khác nhau để dự đoán cho việc 'huấn luyện mô hình chính' (hero run) của chúng tôi."

Tất nhiên, Percy Liang cũng nói thêm, "Đây là lần huấn luyện có quy mô lớn nhất mà chúng tôi từng thực hiện cho đến nay, vì vậy, chúng tôi thực sự mong đợi sẽ xuất hiện một số tình huống ngoài dự kiến trong quá trình này."

Hiện tại, mô hình chính đã chính thức bắt đầu chạy, tất cả mọi người đều có thể trực tiếp xem đường cong huấn luyện thời gian thực. Sau đó, dữ liệu huấn luyện, nhật ký thí nghiệm và các vấn đề kỹ thuật cũng sẽ tiếp tục được công khai.

Ví dụ ở cấp độ dữ liệu, bao gồm tỷ lệ pha trộn dữ liệu huấn luyện, cách xử lý dữ liệu, và cách dữ liệu từ các lĩnh vực khác nhau đi vào mô hình; ở cấp độ kỹ thuật, bao gồm cấu hình huấn luyện, mã code và thiết kế thí nghiệm; quá trình huấn luyện, bao gồm sự thay đổi loss theo thời gian thực, trạng thái mô hình và kết quả dự đoán ở các giai đoạn khác nhau, v.v.

Đồng thời, Percy Liang cũng công khai các kênh theo dõi cụ thể.

Xem cấu thành dữ liệu: https://storage.googleapis.com/marin-public/held/harrier-k40-cluster-overview/2026.08.18/index.html?revision=uniform-sampling

Theo dõi quá trình huấn luyện thời gian thực trên Weights & Biases (wandb): https://wandb.ai/marin-community/marin_moe/reports/535B-A23B-18T-Token-Hero-Run-Scaling-Ladder--VmlldzoxNzc2MDM5Ng

Xem tất cả thông tin chi tiết trên GitHub: https://github.com/marin-community/marin/issues/8435

Sau khi tìm hiểu kỹ, không khó để nhận ra lý do tại sao động thái này của Percy Liang lại có thể thu hút sự chú ý của mọi người. Bởi vì trong quá khứ, đối với các mô hình như GPT-4, Claude, Gemini, chúng ta hoàn toàn không biết cụ thể chúng được huấn luyện như thế nào, giống như một "hộp đen".

Mọi người chỉ có thể thấy năng lực cuối cùng của mô hình, điểm số benchmark, một vài mô tả trong bài báo, v.v. Còn về tỷ lệ phối trộn dữ liệu, những lần huấn luyện thất bại, những siêu tham số nào hiệu quả, loss thay đổi ra sao, định luật Scaling law có dự đoán chính xác hay không, tất cả đều là ẩn số.

Marin đang cố gắng thay đổi điều này. Có lẽ, việc huấn luyện mô hình cũng có thể giống như viết bài báo, phần mềm nguồn mở: có thể quan sát, có thể thảo luận, có thể hợp tác.

Và kể từ khi thông tin này được công bố, nhiệt huyết của cộng đồng mạng vẫn tiếp tục tăng cao.

Có người dùng cho rằng, đây mới thực sự là tinh thần nguồn mở, "ngay cả khi quá trình huấn luyện gặp vấn đề, đi chệch hướng dự kiến, cũng không hề che giấu."

Một người dùng khác lại nói, mặc dù bản thân việc huấn luyện mô hình đã rất đồ sộ, nhưng điều thực sự gây sốc là bây giờ mọi người thậm chí có thể thông qua nền tảng WandB, xem trực tiếp quá trình huấn luyện một mô hình lớn với quy mô trị giá hàng chục tỷ đô la lớn lên từng bước như thế nào?

>"Điều này giống như căn 'phòng tối' vốn luôn đóng kín bên trong các phòng thí nghiệm AI hàng đầu bỗng nhiên được mở ra, tất cả mọi người đều có thể nhìn thấy bên trong đang diễn ra điều gì."

Và trong ba tháng tới, điều đáng mong đợi nhất có lẽ không phải là năng lực cuối cùng của mô hình, mà là quan sát xem mô hình này trong quá trình huấn luyện sẽ trải qua bao nhiêu lần "phát nổ", sụp đổ và những tình huống bất ngờ......

Ngoài ra, một số người dùng còn cho rằng, động thái này không chỉ cung cấp một góc nhìn để xem toàn bộ quá trình huấn luyện mô hình, mà thậm chí còn cho mọi người một nền tảng để học tập, trao đổi.

Người dùng James Thewlis@jdthewlis đã liên tục theo dõi quá trình huấn luyện theo thời gian thực, trong quá trình đó anh ta không hiểu "tại sao vào khoảng step thứ 500, norms (chuẩn tham số) lại xuất hiện một đỉnh?"

Sau khi tự mình tìm hiểu ra, anh ta lại tự hỏi tự trả lời trong phần bình luận: "Đỉnh này hoàn toàn là do router_bias (thiên lệch định tuyến) gây ra. Nó không phải là tham số thu được thông qua huấn luyện gradient, mà là một phần của cơ chế cân bằng token (token balancing heuristic) trong MoE (Mô hình Chuyên gia Hỗn hợp), do đó nó có quy luật biến đổi động khác với các tham số mô hình thông thường."

Những tình huống như thế này còn rất nhiều.

Ngoài ra, đáng chú ý là, với tư cách là Giáo sư Đại học Stanford, ngoài việc thực hành thực tế lần này, Percy Liang còn có một khóa học lý thuyết: "CS336: Language Models From Scratch" (Xây dựng Mô hình Ngôn ngữ Từ Đầu), mục tiêu là để học sinh hiểu đầy đủ cách một mô hình ngôn ngữ lớn được xây dựng.

Có vẻ như, Percy Liang thực sự muốn dạy tất cả mọi người cách "chế tạo" mô hình lớn. Những ai quan tâm có thể tìm hiểu thêm.

Liên kết khóa học: https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

Vậy bạn thì sao? Bạn nghĩ gì về buổi phát trực tiếp thực sự đưa quá trình huấn luyện mô hình lớn lên sân khấu này? Chào đón bạn để lại bình luận trao đổi!

Tài liệu tham khảo:

https://x.com/MaxForAI/status/2091270116067750089

https://x.com/percyliang/status/2090918065634684997

https://x.com/CopyRebeldia/status/2091231950774112412?s=20

https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

Bài viết này đến từ tài khoản công chúng WeChat "机器之心" (ID:almosthuman2014), tác giả: 关注AI的

Câu hỏi Liên quan

QGiáo sư Stanford Percy Liang đã công bố huấn luyện mô hình lớn nào với quy trình hoàn toàn công khai?

AGiáo sư Percy Liang đã công bố việc khởi động huấn luyện mô hình Marin 535B-A23B, một mô hình hỗn hợp chuyên gia (MoE) với 535 tỷ tham số tổng và 23 tỷ tham số kích hoạt, với toàn bộ quá trình huấn luyện được phát trực tiếp công khai.

QQuá trình huấn luyện mô hình Marin 535B này dự kiến diễn ra trong bao lâu và sử dụng tài nguyên máy tính như thế nào?

AQuá trình huấn luyện dự kiến diễn ra liên tục trong khoảng 3 tháng. Để thực hiện, nhóm nghiên cứu đã triển khai 11 hệ thống GB200 NVL72, tương đương với 792 GPU GB200, và sử dụng 18.75 nghìn tỷ token dữ liệu huấn luyện.

QViệc công khai quá trình huấn luyện mô hình lớn này được cộng đồng mạng đón nhận và bình luận như thế nào?

ACộng đồng mạng rất hào hứng, nhiều người ca ngợi đây là tinh thần mã nguồn mở thực sự, cho phép mọi người quan sát và học hỏi từ toàn bộ quá trình, kể cả những lỗi hay sự cố ngoài dự kiến. Họ ví nó như việc 'mở cửa căn phòng tối' của các phòng thí nghiệm AI hàng đầu.

QNgoài việc huấn luyện mô hình, Percy Liang còn có hoạt động nào khác giúp cộng đồng hiểu về việc xây dựng mô hình ngôn ngữ lớn?

ABên cạnh dự án Marin, Percy Liang còn giảng dạy một khóa học lý thuyết tại Stanford mang tên 'CS336: Language Models From Scratch' (Xây dựng Mô hình Ngôn ngữ Từ Con số 0), với mục tiêu giúp sinh viên hiểu toàn diện cách một mô hình ngôn ngữ lớn được xây dựng.

QMọi người có thể theo dõi trực tiếp quá trình huấn luyện mô hình Marin 535B thông qua những kênh nào?

AMọi người có thể theo dõi trực tiếp quá trình huấn luyện thông qua bảng báo cáo trên nền tảng Weights & Biases (wandb), xem cấu trúc dữ liệu trên một trang lưu trữ được cung cấp, và tìm hiểu mọi chi tiết trên kho lưu trữ GitHub của dự án Marin. Các đường link cụ thể được cung cấp trong bài viết.

Nội dung Liên quan

Tiền gửi vào RWA tăng gấp ba - Tài chính truyền thống chọn blockchain

Lĩnh vực Tài chính phi tập trung (DeFi) đang trải qua một sự chuyển đổi cấu trúc, với sự nổi lên nhanh chóng của Tài sản Thực tế được mã hóa (RWA). Theo báo cáo từ CoinShares và Token Terminal, tổng số tiền gửi vào RWA trên các nền tảng cho vay và giao dịch phi tập trung đã đạt 7,4 tỷ USD trong quý II, tăng hơn ba lần so với 2,3 tỷ USD cùng kỳ năm ngoái. Sự tăng trưởng mạnh mẽ này diễn ra trái ngược với tình trạng đình trệ chung của các công cụ tiền mã hóa truyền thống, khi tổng tiền gửi DeFi giảm khoảng 15% trong khi khối lượng giao dịch tài sản mã hóa tăng 220%. Động lực chính của tăng trưởng là trái phiếu kho bạc Hoa Kỳ mã hóa và các quỹ đa chiến lược. Các sản phẩm như BUIDL của BlackRock và sUSDS của Sky được sử dụng làm tài sản thế chấp, cho phép nhà đầu tư vay thanh khoản bằng stablecoin trong khi vẫn nhận lợi nhuận từ tài sản cơ bản (3,2% - 5,5% mỗi năm). Mạng Ethereum chiếm ưu thế với khoảng 70% tổng giá trị RWA. Ngoài ra, cổ phiếu và phái sinh hàng hóa được mã hóa cũng đang phát triển, với thị trường cổ phiếu mã hóa ước tính đạt 2,2 tỷ USD. Giao dịch hợp đồng tương lai vĩnh cửu dựa trên RWA, như dầu mỏ và kim loại quý, trên các sàn như TradeXYZ cũng tăng mạnh. Theo dự báo của Standard Chartered, tổng vốn hóa thị trường tài sản mã hóa có thể đạt 4 nghìn tỷ USD vào cuối năm 2028. Sự tăng trưởng của RWA chứng minh rằng mã hóa không còn phụ thuộc vào tâm lý thị trường mà cung cấp giá trị thực, tính thanh khoản sâu và khả năng tiếp cận liên tục vào vốn toàn cầu.

cryptonews.ru12 phút trước

Tiền gửi vào RWA tăng gấp ba - Tài chính truyền thống chọn blockchain

cryptonews.ru12 phút trước

Dự trữ Bitcoin vẫn nguyên vẹn: Strategy bán cổ phiếu trị giá 2 tỷ USD và ra mắt khoản tiền mặt USD mới

Công ty Strategy (trước đây là MicroStrategy) đã cập nhật Khung quản lý vốn Digital Credit Capital, bổ sung một quỹ thanh khoản USD mới có tên USD Cash. Từ ngày 17 đến 23 tháng 8 năm 2026, công ty đã bán 18,26 triệu cổ phiếu MSTR, thu về 2 tỷ USD ròng. Số tiền này được phân bổ: 136,4 triệu USD để mua lại cổ phiếu ưu đãi STRC, 300 triệu USD bổ sung vào quỹ USD Reserve hiện có (chuyên trả cổ tức và lãi vay), phần còn lại hình thành quỹ USD Cash mới cho các mục đích chung của công ty như mua Bitcoin, trả cổ tức, mua lại cổ phiếu. Đáng chú ý, trong giai đoạn này, Strategy không mua hay bán Bitcoin nào. Dự trữ Bitcoin của công ty vẫn giữ nguyên ở mức 840.447 BTC, với giá mua trung bình là 75.385 USD/BTC. Các chương trình mua lại cổ phiếu ưu đãi và cổ phiếu phổ thông vẫn còn hạn mức lần lượt là 516,6 triệu USD và 1 tỷ USD. Việc tách biệt hai quỹ USD Reserve và USD Cash được xem như một nỗ lực củng cố cấu trúc vốn, đặc biệt trong bối cảnh cổ phiếu MSTR hiện đang giao dịch gần ngang giá trị tài sản ròng từ Bitcoin (mNAV ~1.0x), thấp hơn nhiều so với mức phí bảo hiểm cao trong các chu kỳ trước.

cryptonews.ru27 phút trước

Dự trữ Bitcoin vẫn nguyên vẹn: Strategy bán cổ phiếu trị giá 2 tỷ USD và ra mắt khoản tiền mặt USD mới

cryptonews.ru27 phút trước

Cục Dự trữ Liên bang tiến hành kiểm tra kỹ lưỡng nhà đầu tư và sự tăng giá của Bitcoin: Kết quả đáng chú ý! Dưới đây là chi tiết

Một nghiên cứu mới từ Ngân hàng Dự trữ Liên bang Cleveland (Fed) phát hiện rằng việc biết thông tin về hiệu suất giá trong quá khứ của Bitcoin có thể làm tăng đáng kể khả năng các nhà đầu tư tham gia vào thị trường tiền điện tử. Cụ thể, những người tham gia được cung cấp thông tin về mức tăng trưởng 14,3% của Bitcoin trong 12 tháng trước có xu hướng sở hữu tiền điện tử cao hơn khoảng 2,41 điểm phần trăm trong các cuộc khảo sát sau đó. Nhóm được xem biểu đồ giá Bitcoin cũng cho thấy mức tăng tương tự. Với tỷ lệ sở hữu ban đầu khoảng 11%, đây được coi là mức tăng tương đối khoảng 23%. Nghiên cứu cũng chỉ ra rằng việc này không chỉ ảnh hưởng đến quyết định sở hữu mà còn làm tăng tỷ trọng phân bổ cho tiền điện tử trong danh mục đầu tư lên khoảng 2 điểm phần trăm, chủ yếu được chuyển dịch từ tiền mặt và tài khoản ngân hàng. Đáng chú ý, thông tin về hiệu suất quá khứ của Bitcoin có tác động mạnh hơn đến những người ít hiểu biết về tiền điện tử. Các nhà kinh tế kết luận rằng Bitcoin và thị trường tiền điện tử có khả năng thu hút những nhà đầu tư mới vốn chưa từng theo dõi hoặc sở hữu loại tài sản này trước đây.

cryptonews.ru37 phút trước

Cục Dự trữ Liên bang tiến hành kiểm tra kỹ lưỡng nhà đầu tư và sự tăng giá của Bitcoin: Kết quả đáng chú ý! Dưới đây là chi tiết

cryptonews.ru37 phút trước

Ngân hàng, cơ quan quản lý tham gia thử nghiệm chuyển giao tiền mật mã chống lượng tử

Các ngân hàng và cơ quan quản lý tài chính từ châu Âu, Trung Đông và châu Á đã tham gia một dự án thí điểm kiểm tra cơ sở hạ tầng kháng lượng tử cho ví tài sản kỹ thuật số và chuyển giao trên chuỗi (onchain). Sáng kiến được công bố bởi Viện Fintech có Trách nhiệm (RFI) và nhà cung cấp cơ sở hạ tầng lưu ký Safeheron. Dự án sử dụng giao thức tính toán đa bên hỗ trợ ML-DSA-65, một tiêu chuẩn chữ ký số hậu lượng tử do Viện Tiêu chuẩn và Công nghệ Quốc gia Mỹ (NIST) công bố, trên mạng thử nghiệm NEAR kháng lượng tử. Các cơ quan tham gia bao gồm Abu Dhabi Global Market, Văn phòng Dịch vụ Tài chính Gelephu của Bhutan và Cơ quan Dịch vụ Tài chính Malta, trong khi Bison Bank và DK Bank tham gia với tư cách là các tổ chức tài chính. Các ngân hàng sẽ thử nghiệm tạo ví và chuyển giao trong môi trường ứng dụng chung, còn các cơ quan quản lý sẽ quan sát giai đoạn đầu và đóng góp sau vào luồng công việc quản trị. Các tổ chức dự định sẽ công bố một sách trắng bao gồm nghiên cứu, thiết kế giao thức và kết quả thử nghiệm, đồng thời cuối cùng sẽ mở mã nguồn công nghệ cơ bản. Dự án thí điểm này diễn ra trong bối cảnh các cơ quan tài chính đang chuẩn bị cho máy tính lượng tử có thể làm suy yếu mật mã khóa công khai hiện tại. Cơ quan Tiền tệ Hồng Kông đặt mục tiêu chuẩn bị đầy đủ cho lĩnh vực ngân hàng trước các rủi ro an ninh liên quan đến lượng tử vào năm 2030. Một báo cáo năm 2025 của Ngân hàng Thanh toán Quốc tế (BIS) cũng kêu gọi các tổ chức tài chính bắt đầu chuyển đổi theo từng giai đoạn sang các hệ thống hậu lượng tử.

cointelegraph47 phút trước

Ngân hàng, cơ quan quản lý tham gia thử nghiệm chuyển giao tiền mật mã chống lượng tử

cointelegraph47 phút trước

Chiến lược đột ngột dừng mua Bitcoin và tích lũy 6,69 tỷ USD tiền mặt

Công ty Strategy từ Tysons Corner, Virginia, đã thông báo tạm dừng đột ngột việc mua Bitcoin trong tuần từ 17 đến 23/8. Thay vào đó, công ty đã tích lũy một khoản tiền mặt khổng lồ lên tới 6,69 tỷ USD. Strategy hiện nắm giữ 840.447 BTC (mua với giá trung bình 75.385 USD/BTC), tương đương khoảng 4% tổng nguồn cung Bitcoin. Tuy nhiên, tuần qua họ không mua thêm đồng nào. Thay vào đó, họ đã huy động 2,01 tỷ USD thông qua chương trình phát hành cổ phiếu MSTR, đồng thời mua lại 136,4 triệu USD cổ phiếu ưu đãi STRC của chính mình. Số tiền huy động được đã được phân bổ: 300 triệu USD vào quỹ dự trữ USD, 136,4 triệu USD để mua lại cổ phiếu STRC, và phần còn lại chuyển vào quỹ "USD Cash" mới. Kết quả là Strategy hiện có 1,59 tỷ USD trong quỹ "USD Cash" linh hoạt và 5,1 tỷ USD trong quỹ dự trữ USD truyền thống, tổng cộng 6,69 tỷ USD tiền mặt. Giám đốc điều hành Michael Saylor nhấn mạnh số tiền mặt này củng cố cơ cấu tài chính, kéo dài thời gian đáp ứng các nghĩa vụ và tạo sự linh hoạt để nhanh chóng hành động - bao gồm cả việc mua Bitcoin khi có biến động thị trường. Động thái này cho thấy Strategy không từ bỏ chiến lược Bitcoin mà đang tích trữ "kho báu" tiền mặt, chuẩn bị sẵn sàng cho bước đi tiếp theo, dù đó là mua thêm BTC, hỗ trợ chứng khoán ưu đãi hay mua lại cổ phiếu.

cryptonews.ru51 phút trước

Chiến lược đột ngột dừng mua Bitcoin và tích lũy 6,69 tỷ USD tiền mặt

cryptonews.ru51 phút trước

Giao dịch

Giao ngay
活动图片