斯坦福教授直播训练535B大模型,模型训练背后的「黑箱」正在被打开?

marsbit發佈於 2026-08-24更新於 2026-08-24

文章摘要

斯坦福大学教授Percy Liang及其团队正以全程公开的方式,直播训练一个名为Marin 535B-A23B的超大规模语言模型。该模型拥有5350亿总参数和230亿激活参数,计划使用18.75万亿token的数据,在792颗GB200 GPU上连续训练约3个月。 这项被称为“主模型训练”(hero run)的项目,旨在打破以往大模型训练过程不透明的“黑箱”状态。团队已公开了实时训练曲线、数据混合比例、训练配置、代码及实验日志等详细信息,公众可通过提供的链接实时观看训练过程并参与讨论。 在正式训练前,团队已进行了四个阶段的“规模扩展阶梯”实验,以调试问题并预测主模型的训练表现。Percy Liang表示,尽管准备充分,但仍期待并公开应对训练中可能出现的意外情况。 此举在社区引起热烈反响,被认为体现了真正的开源精神,为学习与协作提供了宝贵平台。此外,Percy Liang还教授一门名为《CS336: Language Models From Scratch》的课程,系统地传授构建大模型的知识。

最近两天,X 上网友 Max For AI@MaxForAI 的一篇帖子引发了网友热议:「太疯狂了 —— 现在你甚至可以直播围观一个 535B 大模型是如何被训练出来的。」

原来是斯坦福大学教授、Simile AI 创始人 Percy Liang@percyliang 宣布由 Marin 开放实验室启动训练 Marin 535B-A23B 模型,并且整个训练过程将全程公开进行。

Marin 拥有 5350 亿总参数、230 亿激活参数,为此,Percy Liang 和团队准备了总计 18.75 万亿 token 的训练数据,部署了 11 套 GB200 NVL72 系统,约合 792 颗 GB200 GPU。

预计模型将连续训练约 3 个月,总训练计算量约为 2.7e24 FLOPs。训练完成后,团队还将继续进行后训练(post-training)阶段。

换句话说:未来几个月,所有人都可以围观一个前沿大模型如何从零开始成长。

另外值得注意的是,Percy Liang 表示,在正式启动这次训练任务之前,团队已经先训练了一套包含 4 个阶段的 Scaling Ladder(规模扩展阶梯),从 1.6B-A61M(48B tokens) 一直到 27.7B-A1.2B(926B tokens)。

「这样做有两个目的,一是用这些小规模实验提前发现并调试潜在问题;二是根据不同规模模型的训练表现,对我们的「主模型训练」(hero run)进行预测。」

当然,Percy Liang 也表示,「这是迄今为止我们进行过规模最大的一次训练,因此,我们也确实在期待过程中出现一些意料之外的情况。」

目前,该主模型已经正式开始运行,所有人都可以直接查看实时训练曲线。后续,训练数据、实验日志以及工程问题也会持续公开。

比如数据层面,包括训练数据混合比例、数据处理方式,以及不同领域数据如何进入模型;工程层面,包括训练配置、代码以及实验设计;训练过程,包括实时 loss 变化、模型状态以及不同阶段预测结果等。

同步,Percy Liang还公开了的具体的观看渠道。

查看数据构成:https://storage.googleapis.com/marin-public/held/harrier-k40-cluster-overview/2026.08.18/index.html?revision=uniform-sampling

在 Weights & Biases(wandb)上实时观看训练过程:https://wandb.ai/marin-community/marin_moe/reports/535B-A23B-18T-Token-Hero-Run-Scaling-Ladder--VmlldzoxNzc2MDM5Ng

在 GitHub 上查看所有详细信息:https://github.com/marin-community/marin/issues/8435

详细了解之后不难看出,为什么 Percy Liang 的这一操作能够引起大家的围观。因为过去,对于 GPT-4、Claude、Gemini 这类模型来说,根本不知道背后具体是怎么训练的,像个「黑箱」一样。

大家只能看到最终模型能力、benchmark 分数、少量论文描述等。而对于数据配比、训练失败过什么、哪些超参数有效、loss 如何变化、Scaling law 是否预测准确等,都是未知的。

Marin 正试图改变这一点。或许,模型训练也可以像论文、开源软件一样:可观察、可讨论、可协作。

而自从这个消息公布以来,网友们的热情还在持续高涨。

有网友认为,这才是真正的开源精神,「即使训练过程出现问题、偏离预期,也毫不隐藏。」

有网友则表示,即便训练模型本身已经很庞大,但真正令人震撼的是,大家现在居然可以通过 WandB 平台,实时观看一个价值数十亿美元规模的大模型训练过程如何一步步成长?

「这就像顶级 AI 实验室内部原本紧闭的 “暗室” 突然被打开,所有人都能看到里面正在发生什么。」

而在接下来的三个月里,最令人期待的或许不是最终模型能力如何,而是观察这个模型在训练过程中究竟会经历多少次「爆炸」、崩溃和意外情况......

此外,有网友还认为,这一举动不仅是提供了一个观看模型训练全过程的视角,甚至给了大家一个学习、交流的平台。

网友 James Thewlis@jdthewlis 一直在实时跟进训练过程,过程中他不理解「为什么在大约第 500 step 附近,norms(参数范数)会出现一个峰值?」

之后自己搞明白之后,又在评论区自问自答:「这个峰值完全是由 router_bias(路由偏置) 导致的。它并不是通过梯度训练得到的参数,而是 MoE(混合专家模型)中用于 token 平衡机制(token balancing heuristic) 的一部分,因此它具有不同于普通模型参数的动态变化规律。」

像这样的情况还有很多。

此外,值得一提的是,Percy Liang 作为斯坦福大学教授,除了这次真刀真枪的实践,还有一门理论课程:《CS336: Language Models From Scratch》(从零构建语言模型),目标是让学生完整理解一个大型语言模型如何被构建的。

看样子,Percy Liang 是真的想教会所有人「造」大模型。感兴趣的网友可以了解一下。

课程链接:https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

那么你呢?如何看待这场真正将大模型训练搬上台前的直播?欢迎在评论区留言交流!

参考链接:

https://x.com/MaxForAI/status/2091270116067750089

https://x.com/percyliang/status/2090918065634684997

https://x.com/CopyRebeldia/status/2091231950774112412?s=20

https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

本文来自微信公众号 “机器之心”(ID:almosthuman2014),作者:关注AI的

相關問答

Q斯坦福大学教授Percy Liang直播训练的大模型叫什么名字?它的参数规模是多少?

A直播训练的大模型名为Marin 535B-A23B。它拥有5350亿总参数和230亿激活参数。

Q这次公开直播训练大模型,主要公开了哪些方面的信息?

A主要公开了以下信息:实时训练曲线(如loss变化)、训练数据(包括混合比例、处理方式和领域构成)、工程细节(包括训练配置、代码和实验设计)、以及训练过程中的模型状态和各阶段预测结果。

Q在启动这次“主模型训练”之前,Percy Liang的团队做了哪些前期工作?目的是什么?

A他们先训练了一套包含4个阶段的“Scaling Ladder”(规模扩展阶梯),从1.6B-A61M一直到27.7B-A1.2B。这样做有两个目的:一是通过小规模实验提前发现和调试潜在问题;二是根据不同规模模型的训练表现,对“主模型训练”的结果进行预测。

Q为什么说这次公开直播训练是试图打开模型训练的“黑箱”?

A因为过去像GPT-4、Claude这类顶尖大模型的训练过程是高度保密的,公众只能看到最终能力和测评分数,而对于具体的数据配比、训练失败经历、有效超参数、loss变化细节等内部信息一无所知。而Marin的这次公开直播,让所有人都能实时观察和讨论整个训练过程,使得原本封闭的训练过程变得透明。

Q除了直播训练,Percy Liang还通过什么方式帮助人们学习构建大模型?

A他还在斯坦福大学开设了一门名为《CS336: Language Models From Scratch》(从零构建语言模型)的课程,目标是通过理论和实践相结合的方式,让学生完整理解一个大型语言模型是如何被构建出来的。

你可能也喜歡

RWA存款增长三倍——传统金融选择区块链

去中心化金融(DeFi)领域正在经历结构性转型,代币化现实世界资产(RWA)正迅速成为焦点。据2026年8月报告显示,第二季度RWA在去中心化平台的存款额已达74亿美元,较上年同期的23亿美元增长超三倍。这一显著的资金流入与主流加密工具的停滞形成鲜明对比。 尽管同期DeFi总存款下降了约15%,但代币化资产的现货交易量飙升了220%,而去中心化交易所(DEX)的总交易量则下跌近70%。分析指出,这证实了根本性转变:需求并非源于投机,而是基于区块链作为传统资本基础设施的实际效用。 增长的主要驱动力是代币化美国国债和多策略基金。投资者利用BlackRock的BUIDL和Sky的sUSDS等产品作为可靠抵押品,以获取稳定币流动性,同时享受3.2%至5.5%的年化基础资产收益。约70%的RWA流动性集中在以太坊网络,得益于其稳定币池及Aave、Morpho等成熟借贷平台。 此外,代币化股票和大宗商品衍生品也显著发展,股票代币化市场规模约22亿美元。基于RWA的永续期货市场同样繁荣,例如TradeXYZ平台上的石油、贵金属和标普500指数合约交易量增长了二十倍,提供传统交易所无法实现的24小时市场接入。 展望未来,预计到2028年底,代币化资产总市值可能达到4万亿美元。RWA的持续增长表明,代币化已超越市场情绪周期,凭借其提供的切实价值、深度流动性和全球资本无缝接入,正进入积极的机构化扩张阶段。

cryptonews.ru10 分鐘前

RWA存款增长三倍——传统金融选择区块链

cryptonews.ru10 分鐘前

交易

現貨
活动图片