斯坦福教授直播训练535B大模型,模型训练背后的「黑箱」正在被打开?

marsbit發佈於 2026-08-24更新於 2026-08-24

文章摘要

斯坦福大学教授Percy Liang及其团队正以全程公开的方式,直播训练一个名为Marin 535B-A23B的超大规模语言模型。该模型拥有5350亿总参数和230亿激活参数,计划使用18.75万亿token的数据,在792颗GB200 GPU上连续训练约3个月。 这项被称为“主模型训练”(hero run)的项目,旨在打破以往大模型训练过程不透明的“黑箱”状态。团队已公开了实时训练曲线、数据混合比例、训练配置、代码及实验日志等详细信息,公众可通过提供的链接实时观看训练过程并参与讨论。 在正式训练前,团队已进行了四个阶段的“规模扩展阶梯”实验,以调试问题并预测主模型的训练表现。Percy Liang表示,尽管准备充分,但仍期待并公开应对训练中可能出现的意外情况。 此举在社区引起热烈反响,被认为体现了真正的开源精神,为学习与协作提供了宝贵平台。此外,Percy Liang还教授一门名为《CS336: Language Models From Scratch》的课程,系统地传授构建大模型的知识。

最近两天,X 上网友 Max For AI@MaxForAI 的一篇帖子引发了网友热议:「太疯狂了 —— 现在你甚至可以直播围观一个 535B 大模型是如何被训练出来的。」

原来是斯坦福大学教授、Simile AI 创始人 Percy Liang@percyliang 宣布由 Marin 开放实验室启动训练 Marin 535B-A23B 模型,并且整个训练过程将全程公开进行。

Marin 拥有 5350 亿总参数、230 亿激活参数,为此,Percy Liang 和团队准备了总计 18.75 万亿 token 的训练数据,部署了 11 套 GB200 NVL72 系统,约合 792 颗 GB200 GPU。

预计模型将连续训练约 3 个月,总训练计算量约为 2.7e24 FLOPs。训练完成后,团队还将继续进行后训练(post-training)阶段。

换句话说:未来几个月,所有人都可以围观一个前沿大模型如何从零开始成长。

另外值得注意的是,Percy Liang 表示,在正式启动这次训练任务之前,团队已经先训练了一套包含 4 个阶段的 Scaling Ladder(规模扩展阶梯),从 1.6B-A61M(48B tokens) 一直到 27.7B-A1.2B(926B tokens)。

「这样做有两个目的,一是用这些小规模实验提前发现并调试潜在问题;二是根据不同规模模型的训练表现,对我们的「主模型训练」(hero run)进行预测。」

当然,Percy Liang 也表示,「这是迄今为止我们进行过规模最大的一次训练,因此,我们也确实在期待过程中出现一些意料之外的情况。」

目前,该主模型已经正式开始运行,所有人都可以直接查看实时训练曲线。后续,训练数据、实验日志以及工程问题也会持续公开。

比如数据层面,包括训练数据混合比例、数据处理方式,以及不同领域数据如何进入模型;工程层面,包括训练配置、代码以及实验设计;训练过程,包括实时 loss 变化、模型状态以及不同阶段预测结果等。

同步,Percy Liang还公开了的具体的观看渠道。

查看数据构成:https://storage.googleapis.com/marin-public/held/harrier-k40-cluster-overview/2026.08.18/index.html?revision=uniform-sampling

在 Weights & Biases(wandb)上实时观看训练过程:https://wandb.ai/marin-community/marin_moe/reports/535B-A23B-18T-Token-Hero-Run-Scaling-Ladder--VmlldzoxNzc2MDM5Ng

在 GitHub 上查看所有详细信息:https://github.com/marin-community/marin/issues/8435

详细了解之后不难看出,为什么 Percy Liang 的这一操作能够引起大家的围观。因为过去,对于 GPT-4、Claude、Gemini 这类模型来说,根本不知道背后具体是怎么训练的,像个「黑箱」一样。

大家只能看到最终模型能力、benchmark 分数、少量论文描述等。而对于数据配比、训练失败过什么、哪些超参数有效、loss 如何变化、Scaling law 是否预测准确等,都是未知的。

Marin 正试图改变这一点。或许,模型训练也可以像论文、开源软件一样:可观察、可讨论、可协作。

而自从这个消息公布以来,网友们的热情还在持续高涨。

有网友认为,这才是真正的开源精神,「即使训练过程出现问题、偏离预期,也毫不隐藏。」

有网友则表示,即便训练模型本身已经很庞大,但真正令人震撼的是,大家现在居然可以通过 WandB 平台,实时观看一个价值数十亿美元规模的大模型训练过程如何一步步成长?

「这就像顶级 AI 实验室内部原本紧闭的 “暗室” 突然被打开,所有人都能看到里面正在发生什么。」

而在接下来的三个月里,最令人期待的或许不是最终模型能力如何,而是观察这个模型在训练过程中究竟会经历多少次「爆炸」、崩溃和意外情况......

此外,有网友还认为,这一举动不仅是提供了一个观看模型训练全过程的视角,甚至给了大家一个学习、交流的平台。

网友 James Thewlis@jdthewlis 一直在实时跟进训练过程,过程中他不理解「为什么在大约第 500 step 附近,norms(参数范数)会出现一个峰值?」

之后自己搞明白之后,又在评论区自问自答:「这个峰值完全是由 router_bias(路由偏置) 导致的。它并不是通过梯度训练得到的参数,而是 MoE(混合专家模型)中用于 token 平衡机制(token balancing heuristic) 的一部分,因此它具有不同于普通模型参数的动态变化规律。」

像这样的情况还有很多。

此外,值得一提的是,Percy Liang 作为斯坦福大学教授,除了这次真刀真枪的实践,还有一门理论课程:《CS336: Language Models From Scratch》(从零构建语言模型),目标是让学生完整理解一个大型语言模型如何被构建的。

看样子,Percy Liang 是真的想教会所有人「造」大模型。感兴趣的网友可以了解一下。

课程链接:https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

那么你呢?如何看待这场真正将大模型训练搬上台前的直播?欢迎在评论区留言交流!

参考链接:

https://x.com/MaxForAI/status/2091270116067750089

https://x.com/percyliang/status/2090918065634684997

https://x.com/CopyRebeldia/status/2091231950774112412?s=20

https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

本文来自微信公众号 “机器之心”(ID:almosthuman2014),作者:关注AI的

相關問答

Q斯坦福大学教授Percy Liang直播训练的大模型叫什么名字?它的参数规模是多少?

A直播训练的大模型名为Marin 535B-A23B。它拥有5350亿总参数和230亿激活参数。

Q这次公开直播训练大模型,主要公开了哪些方面的信息?

A主要公开了以下信息:实时训练曲线(如loss变化)、训练数据(包括混合比例、处理方式和领域构成)、工程细节(包括训练配置、代码和实验设计)、以及训练过程中的模型状态和各阶段预测结果。

Q在启动这次“主模型训练”之前,Percy Liang的团队做了哪些前期工作?目的是什么?

A他们先训练了一套包含4个阶段的“Scaling Ladder”(规模扩展阶梯),从1.6B-A61M一直到27.7B-A1.2B。这样做有两个目的:一是通过小规模实验提前发现和调试潜在问题;二是根据不同规模模型的训练表现,对“主模型训练”的结果进行预测。

Q为什么说这次公开直播训练是试图打开模型训练的“黑箱”?

A因为过去像GPT-4、Claude这类顶尖大模型的训练过程是高度保密的,公众只能看到最终能力和测评分数,而对于具体的数据配比、训练失败经历、有效超参数、loss变化细节等内部信息一无所知。而Marin的这次公开直播,让所有人都能实时观察和讨论整个训练过程,使得原本封闭的训练过程变得透明。

Q除了直播训练,Percy Liang还通过什么方式帮助人们学习构建大模型?

A他还在斯坦福大学开设了一门名为《CS336: Language Models From Scratch》(从零构建语言模型)的课程,目标是通过理论和实践相结合的方式,让学生完整理解一个大型语言模型是如何被构建出来的。

你可能也喜歡

以太坊剧烈波动后,Aave债务集中度引发风险担忧

一篇风险分析报告发现,Aave借贷协议中不到9%的借款头寸占据了协议总未偿还债务的大约一半,这引发了对其债务集中风险的关注。 这种集中风险主要与E-mode用户有关,他们利用流动性质押衍生品(如wstETH)作为抵押品,进行高杠杆的WETH借款。当以太坊(ETH)价格剧烈波动时,这些高度相关的质押循环交易策略可能变得脆弱。需要明确的是,这并不意味着Aave已经资不抵债或发生了清算瀑布,而是指债务集中和相关风险可能使借贷协议的部分环节对ETH价格的剧烈变动更为敏感。 在DeFi中,即使协议整体看起来多元化,但如果少数大型头寸依赖相似的抵押品和策略,市场波动时它们可能同时面临压力。Aave的E-mode本是为相关性强的资产设计,以提高借款效率,但这也助长了杠杆。当市场承压、相关性假设失效或流动性下降时,这些头寸可能更快滑向清算。 文章强调,Aave是去中心化协议,其风险管理机制(如抵押品、清算参数、预言机)与传统银行不同。债务高度集中可能使压力事件的影响更具非线性。未来,Aave治理或风险团队可能通过调整抵押因子、清算阈值、E-mode设置等参数来平衡用户需求与协议安全。 目前信号并非恐慌,而是需要保持警惕。作为DeFi最重要的借贷市场之一,Aave的ETH关联杠杆集中风险值得密切关注,因其问题可能波及整个以太坊生态系统的流动性。

bitcoinist18 分鐘前

以太坊剧烈波动后,Aave债务集中度引发风险担忧

bitcoinist18 分鐘前

Pharos 引入链上机构级美债信用,RealFi 资产版图再扩大

今日,Pharos Network 宣布上线 pRNH Vault,由 R25 协议推出,为合格用户提供链上投资美国高收益企业债的通道,标志着 Pharos 的 RealFi(真实世界金融)市场从稳定币和现金类产品扩展至企业信用资产。 该 Vault 底层对接纽约人寿投资管理公司与 Anemoy 共同发起、Centrifuge 提供技术支持的美元高收益企业债组合(HYB)。用户存入 USDC 即可兑换 pRNH 代币间接持有该资产,目标年化收益率约 7%,无硬性锁定期,但申购赎回需遵循底层基金运营及合规要求。 Pharos 认为,资产代币化仅是第一步,更大的价值在于构建一个能让机构级资产被主动发现、评估并以编程方式使用的市场。pRNH 的结构展示了真实金融资产与链上智能系统的深度结合,其架构已嵌入代理辅助功能,覆盖信用筛选、风险监控等环节。 为支持高效链上金融活动,Pharos 整合了并行执行、模块化网络、合规框架、ZK-KYC/AML、原生 AI 代理支持等核心技术,旨在支撑超大规模的真实资产市场。Pharos 将自身定位为智能体经济的“价值发现层”,pRNH 的上线为其注入了机构级信用资产,并为该模式提供了实践验证。 Pharos Network 由前蚂蚁集团高管创立,投资方包括住友商事、Flow Traders 等机构,专注于为高性能 RealFi 和可编程金融市场提供基础设施。

marsbit28 分鐘前

Pharos 引入链上机构级美债信用,RealFi 资产版图再扩大

marsbit28 分鐘前

交易

現貨
活动图片