Giáo sư Stanford phát trực tiếp quá trình huấn luyện mô hình lớn 535B, 'hộp đen' đằng sau quá trình huấn luyện mô hình đang được mở ra?

marsbitXuất bản vào 2026-08-24Cập nhật gần nhất vào 2026-08-24

Tóm tắt

Giáo sư Stanford Percy Liang và nhóm của ông đang thực hiện huấn luyện công khai mô hình ngôn ngữ lớn Marin 535B-A23B với 535 tỷ tham số, và toàn bộ quá trình này được phát trực tiếp. Mô hình sử dụng 11 hệ thống GB200 NVL72 (khoảng 792 GPU), được huấn luyện trên 18,75 nghìn tỷ token trong khoảng 3 tháng. Nhóm đã thực hiện các thử nghiệm quy mô nhỏ trước đó để dự đoán và gỡ lỗi. Dự án này cho phép bất kỳ ai theo dõi trực tiếp các đường cong huấn luyện, cấu hình, dữ liệu và nhật ký thông qua các nền tảng như Weights & Biases và GitHub. Điều này được coi là một bước đột phá trong việc mở "hộp đen" của huấn luyện mô hình lớn, vốn thường được các phòng thí nghiệm AI hàng đầu giữ kín. Cộng đồng nhiệt liệt hưởng ứng vì tính minh bạch và giá trị giáo dục, coi đây là tinh thần mã nguồn mở thực thụ. Người dùng có thể học hỏi, thảo luận các chi tiết kỹ thuật (như biến động của router_bias trong MoE) ngay trong quá trình huấn luyện. Giáo sư Liang cũng giảng dạy khóa học "CS336: Language Models From Scratch", củng cố mục tiêu chia sẻ kiến thức xây dựng mô hình ngôn ngữ lớn cho tất cả mọi người.

Hai ngày gần đây, một bài đăng của cư dân mạng Max For AI@MaxForAI trên X đã thu hút sự bàn tán sôi nổi: "Thật điên rồ — bây giờ bạn thậm chí có thể xem trực tiếp quá trình huấn luyện một mô hình lớn 535B được thực hiện như thế nào."

Hóa ra là Giáo sư Đại học Stanford, người sáng lập Simile AI — Percy Liang@percyliang đã thông báo rằng Phòng thí nghiệm Mở Marin sẽ bắt đầu huấn luyện mô hình Marin 535B-A23B, và toàn bộ quá trình huấn luyện sẽ được công khai.

Marin có tổng cộng 535 tỷ tham số, 23 tỷ tham số kích hoạt. Để thực hiện điều này, Percy Liang và đội ngũ đã chuẩn bị tổng cộng 18,75 nghìn tỷ token dữ liệu huấn luyện, triển khai 11 hệ thống GB200 NVL72, tương đương với khoảng 792 GPU GB200.

Dự kiến mô hình sẽ được huấn luyện liên tục trong khoảng 3 tháng, tổng lượng tính toán huấn luyện vào khoảng 2.7e24 FLOPs. Sau khi hoàn thành huấn luyện, đội ngũ sẽ tiếp tục tiến hành giai đoạn hậu huấn luyện (post-training).

Nói cách khác: Trong vài tháng tới, tất cả mọi người đều có thể quan sát một mô hình lớn tiên tiến phát triển từ con số không như thế nào.

Một điểm đáng chú ý khác là, Percy Liang cho biết, trước khi chính thức khởi động nhiệm vụ huấn luyện này, đội ngũ đã huấn luyện trước một bộ Scaling Ladder (Thang mở rộng quy mô) gồm 4 giai đoạn, từ 1.6B-A61M (48B tokens) cho đến 27.7B-A1.2B (926B tokens).

"Làm vậy có hai mục đích, một là sử dụng các thử nghiệm quy mô nhỏ này để phát hiện và gỡ lỗi sớm các vấn đề tiềm ẩn; hai là dựa trên hiệu suất huấn luyện của các mô hình ở các quy mô khác nhau để dự đoán cho việc 'huấn luyện mô hình chính' (hero run) của chúng tôi."

Tất nhiên, Percy Liang cũng nói thêm, "Đây là lần huấn luyện có quy mô lớn nhất mà chúng tôi từng thực hiện cho đến nay, vì vậy, chúng tôi thực sự mong đợi sẽ xuất hiện một số tình huống ngoài dự kiến trong quá trình này."

Hiện tại, mô hình chính đã chính thức bắt đầu chạy, tất cả mọi người đều có thể trực tiếp xem đường cong huấn luyện thời gian thực. Sau đó, dữ liệu huấn luyện, nhật ký thí nghiệm và các vấn đề kỹ thuật cũng sẽ tiếp tục được công khai.

Ví dụ ở cấp độ dữ liệu, bao gồm tỷ lệ pha trộn dữ liệu huấn luyện, cách xử lý dữ liệu, và cách dữ liệu từ các lĩnh vực khác nhau đi vào mô hình; ở cấp độ kỹ thuật, bao gồm cấu hình huấn luyện, mã code và thiết kế thí nghiệm; quá trình huấn luyện, bao gồm sự thay đổi loss theo thời gian thực, trạng thái mô hình và kết quả dự đoán ở các giai đoạn khác nhau, v.v.

Đồng thời, Percy Liang cũng công khai các kênh theo dõi cụ thể.

Xem cấu thành dữ liệu: https://storage.googleapis.com/marin-public/held/harrier-k40-cluster-overview/2026.08.18/index.html?revision=uniform-sampling

Theo dõi quá trình huấn luyện thời gian thực trên Weights & Biases (wandb): https://wandb.ai/marin-community/marin_moe/reports/535B-A23B-18T-Token-Hero-Run-Scaling-Ladder--VmlldzoxNzc2MDM5Ng

Xem tất cả thông tin chi tiết trên GitHub: https://github.com/marin-community/marin/issues/8435

Sau khi tìm hiểu kỹ, không khó để nhận ra lý do tại sao động thái này của Percy Liang lại có thể thu hút sự chú ý của mọi người. Bởi vì trong quá khứ, đối với các mô hình như GPT-4, Claude, Gemini, chúng ta hoàn toàn không biết cụ thể chúng được huấn luyện như thế nào, giống như một "hộp đen".

Mọi người chỉ có thể thấy năng lực cuối cùng của mô hình, điểm số benchmark, một vài mô tả trong bài báo, v.v. Còn về tỷ lệ phối trộn dữ liệu, những lần huấn luyện thất bại, những siêu tham số nào hiệu quả, loss thay đổi ra sao, định luật Scaling law có dự đoán chính xác hay không, tất cả đều là ẩn số.

Marin đang cố gắng thay đổi điều này. Có lẽ, việc huấn luyện mô hình cũng có thể giống như viết bài báo, phần mềm nguồn mở: có thể quan sát, có thể thảo luận, có thể hợp tác.

Và kể từ khi thông tin này được công bố, nhiệt huyết của cộng đồng mạng vẫn tiếp tục tăng cao.

Có người dùng cho rằng, đây mới thực sự là tinh thần nguồn mở, "ngay cả khi quá trình huấn luyện gặp vấn đề, đi chệch hướng dự kiến, cũng không hề che giấu."

Một người dùng khác lại nói, mặc dù bản thân việc huấn luyện mô hình đã rất đồ sộ, nhưng điều thực sự gây sốc là bây giờ mọi người thậm chí có thể thông qua nền tảng WandB, xem trực tiếp quá trình huấn luyện một mô hình lớn với quy mô trị giá hàng chục tỷ đô la lớn lên từng bước như thế nào?

>"Điều này giống như căn 'phòng tối' vốn luôn đóng kín bên trong các phòng thí nghiệm AI hàng đầu bỗng nhiên được mở ra, tất cả mọi người đều có thể nhìn thấy bên trong đang diễn ra điều gì."

Và trong ba tháng tới, điều đáng mong đợi nhất có lẽ không phải là năng lực cuối cùng của mô hình, mà là quan sát xem mô hình này trong quá trình huấn luyện sẽ trải qua bao nhiêu lần "phát nổ", sụp đổ và những tình huống bất ngờ......

Ngoài ra, một số người dùng còn cho rằng, động thái này không chỉ cung cấp một góc nhìn để xem toàn bộ quá trình huấn luyện mô hình, mà thậm chí còn cho mọi người một nền tảng để học tập, trao đổi.

Người dùng James Thewlis@jdthewlis đã liên tục theo dõi quá trình huấn luyện theo thời gian thực, trong quá trình đó anh ta không hiểu "tại sao vào khoảng step thứ 500, norms (chuẩn tham số) lại xuất hiện một đỉnh?"

Sau khi tự mình tìm hiểu ra, anh ta lại tự hỏi tự trả lời trong phần bình luận: "Đỉnh này hoàn toàn là do router_bias (thiên lệch định tuyến) gây ra. Nó không phải là tham số thu được thông qua huấn luyện gradient, mà là một phần của cơ chế cân bằng token (token balancing heuristic) trong MoE (Mô hình Chuyên gia Hỗn hợp), do đó nó có quy luật biến đổi động khác với các tham số mô hình thông thường."

Những tình huống như thế này còn rất nhiều.

Ngoài ra, đáng chú ý là, với tư cách là Giáo sư Đại học Stanford, ngoài việc thực hành thực tế lần này, Percy Liang còn có một khóa học lý thuyết: "CS336: Language Models From Scratch" (Xây dựng Mô hình Ngôn ngữ Từ Đầu), mục tiêu là để học sinh hiểu đầy đủ cách một mô hình ngôn ngữ lớn được xây dựng.

Có vẻ như, Percy Liang thực sự muốn dạy tất cả mọi người cách "chế tạo" mô hình lớn. Những ai quan tâm có thể tìm hiểu thêm.

Liên kết khóa học: https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

Vậy bạn thì sao? Bạn nghĩ gì về buổi phát trực tiếp thực sự đưa quá trình huấn luyện mô hình lớn lên sân khấu này? Chào đón bạn để lại bình luận trao đổi!

Tài liệu tham khảo:

https://x.com/MaxForAI/status/2091270116067750089

https://x.com/percyliang/status/2090918065634684997

https://x.com/CopyRebeldia/status/2091231950774112412?s=20

https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

Bài viết này đến từ tài khoản công chúng WeChat "机器之心" (ID:almosthuman2014), tác giả: 关注AI的

Câu hỏi Liên quan

QGiáo sư Stanford Percy Liang đã công bố huấn luyện mô hình lớn nào với quy trình hoàn toàn công khai?

AGiáo sư Percy Liang đã công bố việc khởi động huấn luyện mô hình Marin 535B-A23B, một mô hình hỗn hợp chuyên gia (MoE) với 535 tỷ tham số tổng và 23 tỷ tham số kích hoạt, với toàn bộ quá trình huấn luyện được phát trực tiếp công khai.

QQuá trình huấn luyện mô hình Marin 535B này dự kiến diễn ra trong bao lâu và sử dụng tài nguyên máy tính như thế nào?

AQuá trình huấn luyện dự kiến diễn ra liên tục trong khoảng 3 tháng. Để thực hiện, nhóm nghiên cứu đã triển khai 11 hệ thống GB200 NVL72, tương đương với 792 GPU GB200, và sử dụng 18.75 nghìn tỷ token dữ liệu huấn luyện.

QViệc công khai quá trình huấn luyện mô hình lớn này được cộng đồng mạng đón nhận và bình luận như thế nào?

ACộng đồng mạng rất hào hứng, nhiều người ca ngợi đây là tinh thần mã nguồn mở thực sự, cho phép mọi người quan sát và học hỏi từ toàn bộ quá trình, kể cả những lỗi hay sự cố ngoài dự kiến. Họ ví nó như việc 'mở cửa căn phòng tối' của các phòng thí nghiệm AI hàng đầu.

QNgoài việc huấn luyện mô hình, Percy Liang còn có hoạt động nào khác giúp cộng đồng hiểu về việc xây dựng mô hình ngôn ngữ lớn?

ABên cạnh dự án Marin, Percy Liang còn giảng dạy một khóa học lý thuyết tại Stanford mang tên 'CS336: Language Models From Scratch' (Xây dựng Mô hình Ngôn ngữ Từ Con số 0), với mục tiêu giúp sinh viên hiểu toàn diện cách một mô hình ngôn ngữ lớn được xây dựng.

QMọi người có thể theo dõi trực tiếp quá trình huấn luyện mô hình Marin 535B thông qua những kênh nào?

AMọi người có thể theo dõi trực tiếp quá trình huấn luyện thông qua bảng báo cáo trên nền tảng Weights & Biases (wandb), xem cấu trúc dữ liệu trên một trang lưu trữ được cung cấp, và tìm hiểu mọi chi tiết trên kho lưu trữ GitHub của dự án Marin. Các đường link cụ thể được cung cấp trong bài viết.

Nội dung Liên quan

Memecoin Tốt Nhất để Mua vào Năm 2026: MemeToro Kết Hợp Trí Tuệ Nhân Tạo AI và Cơ Sở Hạ Tầng Mạng BNB Chain

Việc tìm kiếm meme coin tốt nhất để mua vào năm 2026 đang hướng đến các dự án có cơ sở hạ tầng thực tế. MemeToro (MT) đang chọn một hướng đi khác biệt bằng cách kết hợp tác nhân AI với cơ sở hạ tầng của BNB Chain. Mục tiêu là tạo ra một hệ sinh thái nơi trí tuệ nhân tạo hỗ trợ việc khám phá, xác thực token và ra mắt các memecoin trong tương lai. BNB Chain cung cấp nền tảng quan trọng nhờ chi phí giao dịch thấp và tốc độ cao, phù hợp với việc giao dịch lặp lại và ra mắt token thường xuyên trong lĩnh vực meme. MemeToro xây dựng trực tiếp trong môi trường này với một launchpad chạy bằng AI được thiết kế cho việc tạo và khám phá memecoin. Điểm mạnh chính của MemeToro nằm ở các tác nhân AI. Chúng có thể giám sát tín hiệu thị trường để xác định xu hướng mới nổi, xác thực hợp đồng thông minh để cảnh báo các cơ chế đáng ngờ, và lọc cơ hội giao dịch nhanh chóng. Điều này đặc biệt hữu ích trên một mạng lưới tập trung vào việc phát hành token. Thay vì cố gắng trở thành meme virus tiếp theo, MemeToro nhắm mục tiêu vào cơ sở hạ tầng. Mô hình của nó cung cấp một cách tiếp cận khác để đánh giá: không chỉ là một token giai đoạn đầu mà còn là một nền tảng hỗ trợ AI cho thế hệ ra mắt meme tiếp theo, có khả năng hưởng lợi từ hoạt động chung của cả hệ sinh thái memecoin. Dự án hiện đang trong Giai đoạn 6 của đợt bán trước.

bitcoinist3 phút trước

Memecoin Tốt Nhất để Mua vào Năm 2026: MemeToro Kết Hợp Trí Tuệ Nhân Tạo AI và Cơ Sở Hạ Tầng Mạng BNB Chain

bitcoinist3 phút trước

Tổng kết định lượng EIP-8363: Cắt 'trợ cấp' staking, Ethereum muốn đổi lại gì?

Bài viết phân tích đề xuất EIP-8363, một cơ chế giảm phát mới cho Ethereum, trong bối cảnh cơ chế đốt phí giao dịch EIP-1559 đã mất hiệu lực (chỉ hủy 2.4% lượng phát hành mới). **Cốt lõi của EIP-8363:** Đề xuất này sẽ "đốt" một phần phần thưởng cho người xác thực (validator), với tỷ lệ đốt tăng dần khi tỷ lệ ETH được stake tăng lên, đạt 100% khi 50% tổng nguồn cung được stake. Với mức stake hiện tại (~35%), nó sẽ cắt giảm khoảng 58.6% lượng ETH phát hành hàng năm, tương đương ~633k ETH (khoảng 1.55 tỷ USD), chứ không phải cắt hoàn toàn. **Tác động mô hình hóa:** * **Cơ chế tự giới hạn:** Hệ thống sẽ cân bằng ở mức stake 26-34% và lạm phát hàng năm 0.3-0.5%, tùy thuộc vào tỷ suất lợi nhuận yêu cầu của người stake. * **Tác động đến giá:** Phân tích dữ liệu 43 tháng cho thấy không có mối tương quan đáng kể giữa biến động lợi suất stake và biến động giá ETH. Mối liên hệ giữa tốc độ tăng nguồn cung ròng và giá yếu hơn nhưng vẫn không rõ ràng. * **Rủi ro với DeFi:** Các sản phẩm tài chính phi tập trung (DeFi) phụ thuộc nhiều vào LST (Liquid Staking Token) với tư cách tài sản thế chấp (chiếm 34.2% TVL cho vay), nhưng giá trị cốt lõi của chúng không bị xóa sổ. Lợi suất giảm chủ yếu ảnh hưởng đến các chiến lược stake đòn bẩy (looping) và doanh thu của các giao thức trung gian như Lido (ước tính giảm ~35 triệu USD/năm). **Bản chất cuộc tranh luận:** Đề xuất thực chất là một cuộc tái phân phối lợi ích: chuyển ~10 tỷ USD giá trị/năm từ nhóm người stake (chiếm 35% nguồn cung, nhận 100% phần thưởng phát hành) sang toàn bộ người nắm giữ ETH. Lợi ích bị ảnh hưởng tập trung (các trung gian stake) trong khi lợi ích thu được lại phân tán (người nắm giữ thông thường), dẫn đến tranh cãi gay gắt. **Kết luận:** Tác giả cho rằng trong bối cảnh cơ chế đốt phí không còn hiệu quả, việc điều chỉnh chính sách phát hành là đòn bẩy chính sách tiền tệ còn lại duy nhất. EIP-8363 về mặt kinh tế có thể hỗ trợ giá trị ETH về dài hạn bằng cách giảm áp lực bán cấu trúc, nhưng lại gây bất lợi rõ ràng cho mô hình kinh doanh của các trung gian stake. Tuy nhiên, chính động lực chính trị từ các nhóm lợi ích tập trung này khiến khả năng đề xuất được thông qua là rất thấp.

marsbit5 phút trước

Tổng kết định lượng EIP-8363: Cắt 'trợ cấp' staking, Ethereum muốn đổi lại gì?

marsbit5 phút trước

Trình Xác Thực TON Chuẩn Bị Cập Nhật Node Trước Cuộc Bỏ Phiếu Của Collator

Các trình xác thực mạng TON đã được hướng dẫn cập nhật phần mềm nút (commit 140320b) và công cụ mytonctrl (commit 7e90e26) để chuẩn bị cho một cuộc bỏ phiếu cấu hình quan trọng, được lên lịch vào 08:00 UTC ngày 21 tháng 8. Cuộc bỏ phiếu này liên quan đến việc kích hoạt kiến trúc collator mới của mạng, một phần trong nỗ lực cải thiện quy trình sản xuất khối và phân chia trách nhiệm khi mạng mở rộng quy mô. Bài viết nhấn mạnh đây mới chỉ là giai đoạn chuẩn bị và bỏ phiếu, chưa phải là việc kích hoạt đầy đủ. Việc cập nhật phần mềm kịp thời là rất quan trọng để đảm bảo mạng hoạt động trơn tru, tránh tình trạng trễ, hành vi không nhất quán hoặc mất khối. Kiến trúc collator hướng tới việc tăng cường hiệu suất xử lý giao dịch và khả năng mở rộng của TON, đặc biệt trong bối cảnh hệ sinh thái này nhắm tới lượng người dùng khổng lồ từ Telegram. Bước tiếp theo là chờ kết quả bỏ phiếu và quá trình chuyển đổi cấu hình. Thị trường cần theo dõi trạng thái kích hoạt cuối cùng trước khi coết bản nâng cấp này đã hoàn tất. Toàn bộ quá trình cho thấy lộ trình phát triển hạ tầng cơ bản của TON vẫn đang được tiến tới.

bitcoinist8 phút trước

Trình Xác Thực TON Chuẩn Bị Cập Nhật Node Trước Cuộc Bỏ Phiếu Của Collator

bitcoinist8 phút trước

Giá Trị Tài Sản Token Hóa Trên Avalanche Vượt Mốc 3 Tỷ Đô La Khi Xu Hướng RWA Phát Triển

Giá trị tài sản thế giới thực (RWA) được token hóa trên Avalanche đã vượt mốc 3 tỷ USD, đánh dấu một cột mốc quan trọng trong nỗ lực biến mạng lưới này thành cơ sở hạ tầng cho tài chính có quy định và thể chế. Con số này, được báo cáo thông qua nguồn dữ liệu được xác thực, bao gồm đóng góp lớn từ việc di chuyển chứng khoán trị giá 1,2 tỷ USD của Progmat, cùng với OpenTrade (khoảng 190 triệu USD) và Grove Finance (khoảng 260 triệu USD). Điều này cho thấy dấu chân RWA của mạng lưới đã đạt đến một mốc tổng hợp lớn hơn, được thúc đẩy bởi nhiều đợt triển khai và di chuyển tài sản được token hóa. Sự tăng trưởng RWA củng cố câu chuyện thể chế của Avalanche, cho thấy mạng lưới không chỉ cạnh tranh cho người dùng DeFi hay bán lẻ mà còn muốn trở thành cơ sở hạ tầng cho phát hành, thanh toán và phân phối tài sản. Kiến trúc subnet của Avalanche phù hợp với nhu cầu kiểm soát, tuân thủ và tích hợp cao hơn của các tài sản được quy định. Mốc 3 tỷ USD là một thước đo về mức độ áp dụng mạng lưới, không nên bị giản lược thành câu chuyện về giá token AVAX. Giá trị có thể tăng nhờ một đợt triển khai lớn, nhưng sự phù hợp lâu dài phụ thuộc vào mức độ sử dụng, thanh khoản và nhu cầu thực tế. Câu hỏi tiếp theo là liệu Avalanche có thể chuyển đổi giá trị RWA này thành một cơ sở hạ tầng tài chính năng động hay không, nơi các tài sản được giao dịch, sử dụng làm tài sản thế chấp và tích hợp vào DeFi. Điều này sẽ quyết định liệu cột mốc này có trở thành nền tảng bền vững hay chỉ là một tiêu đề.

bitcoinist13 phút trước

Giá Trị Tài Sản Token Hóa Trên Avalanche Vượt Mốc 3 Tỷ Đô La Khi Xu Hướng RWA Phát Triển

bitcoinist13 phút trước

Mức Độ Tập Trung Nợ Trên Aave Dấy Lên Câu Hỏi Về Rủi Ro Sau Biến Động Ethereum

Hồ sơ nợ của Aave đang thu hút sự chú ý sau khi một đánh giá rủi ro phát hiện ra rằng chưa đến 9% các vị thế cho vay chiếm khoảng một nửa tổng dư nợ của giao thức. Sự tập trung này chủ yếu liên quan đến người dùng chế độ E (E-mode) vận hành các vị thế đòn bẩy liên quan đến khoản vay WETH được hỗ trợ bởi các tài sản liquid-staking. Biến động mạnh trong ngày của Ethereum đã làm nổi bật cấu trúc này vì các giao dịch vòng lặp staking tương quan có thể trở nên dễ tổn thương khi điều kiện thị trường thay đổi nhanh. Điều này không có nghĩa Aave mất khả năng thanh toán hay một đợt thanh lý dây chuyền đã xảy ra. Mối quan ngại cụ thể hơn: sự tập trung nợ và rủi ro tương quan có thể khiến các bộ phận của giao thức cho vay nhạy cảm hơn với các biến động mạnh của ETH. Chế độ E-mode của Aave, được thiết kế cho các tài sản tương quan, cho phép vay mượn hiệu quả hơn nhưng đồng thời cũng có thể làm tăng đòn bẩy và rủi ro. Bài viết nhấn mạnh rằng Aave là một giao thức cho vay phi tập trung với cơ chế quản lý rủi ro khác biệt, phụ thuộc vào thị trường. Tuy nhiên, dữ liệu tập trung cho thấy các sự kiện căng thẳng có thể diễn ra phi tuyến tính. Vấn đề tiếp theo là liệu quản trị Aave có điều chỉnh các thông số như hệ số thế chấp, ngưỡng thanh lý hay giới hạn vay để cân bằng giữa nhu cầu người dùng và an toàn giao thức hay không. Aave vẫn là một thị trường cho vay quan trọng bậc nhất của DeFi, do đó rủi ro tập trung này cần được theo dõi cẩn trọng.

bitcoinist18 phút trước

Mức Độ Tập Trung Nợ Trên Aave Dấy Lên Câu Hỏi Về Rủi Ro Sau Biến Động Ethereum

bitcoinist18 phút trước

Giao dịch

Giao ngay
活动图片