Профессор Стэнфорда проводит прямую трансляцию обучения модели на 535B параметров: открывается ли «чёрный ящик» за тренировкой моделей?

marsbitОпубликовано 2026-08-24Обновлено 2026-08-24

Введение

Стэнфордский профессор Перси Лян запустил публичную тренировку крупной языковой модели Marin 535B-A23B с 535 млрд параметров. Весь процесс, который продлится около трех месяцев с использованием 792 GPU GB200, транслируется в реальном времени на платформе Weights & Biases. Это включает в себя открытый доступ к данным, конфигурациям тренировки, коду и логам. Проект направлен на демократизацию знаний о создании больших моделей, которые ранее были «черным ящиком» в таких системах, как GPT-4 или Claude. Команда также провела предварительные эксперименты с моделями меньшего масштаба для отладки и прогнозирования. Инициатива вызвала большой интерес в сообществе, так как позволяет в реальном времени наблюдать и анализировать все этапы тренировки, включая потенциальные сбои и динамику потерь (loss). Это дает уникальную возможность для обучения и совместного изучения процесса. Перси Лян также ведет курс «CS336: Language Models From Scratch», чтобы обучать созданию моделей с нуля.

За последние пару дней пост пользователя X Max For AI@MaxForAI вызвал бурные обсуждения: «Это безумие — теперь вы можете в прямом эфире наблюдать, как обучается модель на 535B параметров.»

Оказалось, что профессор Стэнфорда, основатель Simile AI Percy Liang@percyliang объявил о запуске тренировки модели Marin 535B-A23B открытой лабораторией Marin, причём весь процесс обучения будет публичным.

Marin имеет 535 миллиардов общих параметров и 23 миллиарда активных параметров. Для этого Percy Liang и его команда подготовили в общей сложности 18,75 триллионов токенов обучающих данных, развернули 11 систем GB200 NVL72, что примерно эквивалентно 792 GPU GB200.

Ожидается, что модель будет обучаться непрерывно около 3 месяцев, общий объём вычислений при обучении составит примерно 2.7e24 FLOPs. После завершения обучения команда продолжит этап пост-обучения (post-training).

Другими словами: В ближайшие несколько месяцев все смогут наблюдать, как передовая большая модель растёт с нуля.

Также стоит отметить, что Percy Liang сообщил, что перед официальным запуском этого учебного задания команда уже обучила набор Scaling Ladder (лестницу масштабирования), состоящую из 4 этапов, от 1.6B-A61M (48B токенов) до 27.7B-A1.2B (926B токенов).

«Это служит двум целям: во-первых, с помощью этих небольших экспериментов заранее обнаруживать и отлаживать потенциальные проблемы; во-вторых, на основе результатов обучения моделей разного масштаба прогнозировать ход нашего «главного обучения» (hero run).»

Конечно, Percy Liang также признал: «Это самое масштабное обучение, которое мы когда-либо проводили, поэтому мы действительно ожидаем некоторых непредвиденных ситуаций в процессе.»

В настоящее время основная модель уже официально запущена, и каждый может напрямую просматривать кривые обучения в реальном времени. В дальнейшем обучающие данные, журналы экспериментов и технические проблемы также будут продолжать публиковаться.

Например, на уровне данных: включая пропорции смешивания обучающих данных, способы обработки данных, а также то, как данные из разных областей поступают в модель; на инженерном уровне: включая конфигурацию обучения, код и дизайн экспериментов; процесс обучения: включая изменения потерь (loss) в реальном времени, состояние модели и прогнозируемые результаты на разных этапах.

Одновременно Percy Liang также открыл конкретные каналы для просмотра.

Посмотреть состав данных: https://storage.googleapis.com/marin-public/held/harrier-k40-cluster-overview/2026.08.18/index.html?revision=uniform-sampling

Наблюдать за процессом обучения в реальном времени на Weights & Biases (wandb): https://wandb.ai/marin-community/marin_moe/reports/535B-A23B-18T-Token-Hero-Run-Scaling-Ladder--VmlldzoxNzc2MDM5Ng

Посмотреть все детали на GitHub: https://github.com/marin-community/marin/issues/8435

При более детальном изучении становится понятно, почему это действие Percy Liang вызвало такой ажиотаж. Потому что раньше для таких моделей, как GPT-4, Claude, Gemini, было совершенно неизвестно, как именно они обучаются, это было похоже на «чёрный ящик».

Можно было видеть только итоговые возможности модели, баллы в тестах (benchmark), краткие описания в статьях и т.д. А о таких вещах, как пропорции данных, на чём обучение проваливалось, какие гиперпараметры эффективны, как менялся loss, точны ли прогнозы Scaling law, — ничего не было известно.

Marin пытается это изменить. Возможно, обучение моделей тоже может быть подобно научным статьям или открытому программному обеспечению: наблюдаемым, обсуждаемым, совместным.

С момента объявления этой новости энтузиазм пользователей продолжает расти.

Некоторые считают, что это и есть истинный дух open source: «Даже если в процессе обучения возникают проблемы или отклонения от ожиданий, ничего не скрывается.»

Другие отмечают, что даже несмотря на то, что сама обучаемая модель уже огромна, по-настоящему впечатляет то, что теперь каждый может через платформу WandB в реальном времени наблюдать, как шаг за шагом растёт большая модель стоимостью в десятки миллиардов долларов?

«Это как если бы тёмная комната внутри ведущих AI-лабораторий, ранее плотно закрытая, внезапно распахнулась, и все смогли увидеть, что там происходит.»

И в течение следующих трёх месяцев, возможно, самое интересное будет не в том, какими окажутся финальные способности модели, а в том, чтобы наблюдать, сколько раз эта модель в процессе обучения переживёт «взрывы», сбои и непредвиденные ситуации...

Кроме того, некоторые пользователи считают, что этот шаг не только предоставляет возможность наблюдать за всем процессом обучения модели, но даже даёт платформу для обучения и обмена опытом.

Пользователь James Thewlis@jdthewlis постоянно следил за процессом обучения в реальном времени и не понимал: «Почему примерно на 500-м шаге (step) возникает пик в нормах параметров (norms)?»

Позже, разобравшись самостоятельно, он сам же ответил в комментариях: «Этот пик полностью вызван router_bias (смещением маршрутизатора). Этот параметр не получается через градиентное обучение, а является частью эвристики балансировки токенов (token balancing heuristic) в MoE (Mixture of Experts, смесь экспертов), поэтому его динамика отличается от динамики обычных параметров модели.»

Подобных ситуаций было много.

Кроме того, стоит упомянуть, что Percy Liang как профессор Стэнфорда, помимо этой практической работы, также ведёт теоретический курс: «CS336: Language Models From Scratch» (Языковые модели с нуля), цель которого — позволить студентам полностью понять, как строится большая языковая модель.

Похоже, Percy Liang действительно хочет научить всех «создавать» большие модели. Заинтересованным пользователям стоит с ним ознакомиться.

Ссылка на курс: https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

А как вы относитесь к этой прямой трансляции, которая выводит обучение больших моделей на публичную сцену? Добро пожаловать в комментарии для обсуждения!

Ссылки:

https://x.com/MaxForAI/status/2091270116067750089

https://x.com/percyliang/status/2090918065634684997

https://x.com/CopyRebeldia/status/2091231950774112412?s=20

https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

Эта статья взята с официального аккаунта WeChat «机器之心» (ID: almosthuman2014), автор: 关注AI的

Связанные с этим вопросы

QЧто такое Marin 535B-A23B и почему его обучение является значимым событием?

AMarin 535B-A23B — это крупная языковая модель с 535 миллиардами параметров и 23 миллиардами активированных параметров, созданная профессором Перси Ляном. Её обучение является значимым, потому что процесс полностью публичен в реальном времени, что раскрывает «чёрный ящик» традиционно скрытой тренировки флагманских моделей ИИ, таких как GPT-4. Это позволяет исследователям и сообществу наблюдать за всем: от данных и гиперпараметров до динамики потерь и инженерных проблем.

QКакие технические ресурсы используются для обучения модели Marin 535B-A23B?

AДля обучения Marin 535B-A23B используется 11 систем GB200 NVL72, что в сумме составляет около 792 графических процессоров GB200 GPU. Объём обучающих данных — 18,75 триллиона токенов. Ожидается, что непрерывное обучение продлится примерно 3 месяца с общим объёмом вычислений около 2,7e24 FLOPs (операций с плавающей запятой).

QКакие аспекты процесса обучения будут открыты для публики?

AДля публики открыты все аспекты: состав обучающих данных (пропорции смешения, обработка), конфигурации обучения, код, журналы экспериментов. В реальном времени можно наблюдать за кривыми обучения (loss), состоянием модели, прогнозами на разных этапах, а также за инженерными проблемами и их решениями. Всё это доступно через платформы Weights & Biases, GitHub и специальный дашборд.

QКак сообщество реагирует на это открытое обучение модели?

AСообщество реагирует с огромным энтузиазмом. Многие называют это истинным духом открытого исходного кода, где даже неудачи и отклонения от плана не скрываются. Пользователи активно наблюдают за процессом, обсуждают неожиданные события (например, всплески в нормах параметров) и делятся своими выводами, превращая процесс в образовательную и совместную платформу. Это сравнивают с открытием «тёмной комнаты» ведущих AI-лабораторий.

QКаков вклад профессора Перси Ляна в образование в области больших языковых моделей?

AПомимо практического проекта Marin, профессор Перси Лян преподаёт в Стэнфорде курс CS336: «Language Models From Scratch» («Языковые модели с нуля»). Цель курса — научить студентов, как полностью построить большую языковую модель. Его лекции доступны на YouTube, что демонстрирует его стремление сделать знания о создании ИИ-моделей доступными для широкой аудитории.

Похожее

Депозиты в RWA утроились — традиционные финансы выбирают блокчейн

Сектор токенизированных реальных активов (RWA) демонстрирует стремительный рост на фоне стагнации классического DeFi. Согласно отчёту CoinShares, объём депозитов в RWA на децентрализованных платформах за второй квартал 2026 года составил $7,4 млрд, что более чем втрое превышает показатель годовой давности. Основной причиной этого структурного сдвига является не спекулятивный интерес, а реальная финансовая полезность блокчейна для традиционного капитала. Ключевыми драйверами роста выступают токенизированные казначейские облигации США и мультистратегические фонды (например, BUIDL от BlackRock), которые инвесторы используют в качестве залога для получения ликвидности в стейблкоинах. При этом около 70% рынка RWA сосредоточено в сети Ethereum. Параллельно развиваются сегменты токенизированных акций ($2,2 млрд) и бессрочных фьючерсов на товары, предлагающие круглосуточную торговлю. Прогнозы Standard Chartered указывают на то, что к концу 2028 года общая капитализация токенизированных активов может достичь $4 трлн, подтверждая переход интеграции традиционных финансов и блокчейна в фазу институционального масштабирования с осязаемой ценностью и глобальной ликвидностью.

cryptonews.ru11 мин. назад

Депозиты в RWA утроились — традиционные финансы выбирают блокчейн

cryptonews.ru11 мин. назад

Биткоин-резерв нетронут: Strategy продала акции на $2 млрд и запустила новый пул USD Cash

Компания Strategy (бывшая MicroStrategy) объявила об обновлении своей концепции управления капиталом (Digital Credit Capital Framework), создав новый резерв долларовой ликвидности USD Cash. Для его формирования компания с 17 по 23 августа 2026 года продала 18,26 млн акций MSTR, получив чистую выручку в $2,006 млрд. Средства были распределены следующим образом: $136,4 млн направлено на выкуп привилегированных акций STRC, $300 млн добавлено в существующий резерв USD Reserve, а оставшаяся сумма сформировала пул USD Cash. USD Reserve по-прежнему предназначен исключительно для выплат по привилегированным акциям и долгу. Новый пул USD Cash будет использоваться для более широкого круга корпоративных задач, включая потенциальные покупки биткоина, выкуп акций или увеличение USD Reserve. Важно отметить, что за отчетный период компания не совершала операций с биткоином: её резерв остался нетронутым и составляет 840 447 BTC со средней ценой покупки $75 385. Это разделение резервов происходит в условиях, когда премия рынка к стоимости биткоин-резерва компании (мультипликатор mNAV) близка к нулю, что отличается от высоких значений предыдущих циклов. Данный шаг можно рассматривать как меру по укреплению доверия к структуре капитала Strategy в текущей рыночной ситуации.

cryptonews.ru27 мин. назад

Биткоин-резерв нетронут: Strategy продала акции на $2 млрд и запустила новый пул USD Cash

cryptonews.ru27 мин. назад

Федеральная резервная система провела тщательную проверку инвесторов и роста цен на биткоин: результаты заслуживают внимания! Вот подробности

Новое исследование Федерального резервного банка Кливленда показало, что информация о прошлых результатах Биткоина значительно влияет на желание инвесторов выходить на рынок криптовалют. Участникам исследования, которым сообщали о доходности BTC за предыдущие 12 месяцев (14,3%), было на 2,41 процентного пункта больше шансов заявить о владении криптовалютой впоследствии. При демонстрации графика цены рост составил около 2,48 процентных пункта, что соответствует относительному увеличению владения примерно на 23% по сравнению с базовым уровнем в 11%. Кроме того, информирование о прошлых показателях Биткоина привело к увеличению доли криптовалют в инвестиционных портфелях участников примерно на 2 процентных пункта, в основном за счет перераспределения средств с наличных и банковских счетов. Эффект был наиболее выражен среди людей, ранее менее осведомленных о криптовалютах. Исследователи делают вывод, что информация о высокой исторической доходности может привлекать на рынок новых инвесторов.

cryptonews.ru37 мин. назад

Федеральная резервная система провела тщательную проверку инвесторов и роста цен на биткоин: результаты заслуживают внимания! Вот подробности

cryptonews.ru37 мин. назад

Банки и регуляторы присоединились к пилотному проекту по криптопереводам, устойчивым к квантовым компьютерам

Банки и финансовые регуляторы Европы, Ближнего Востока и Азии присоединились к пилотному проекту по тестированию квантово-устойчивой инфраструктуры для цифровых активов. Инициатива, объявленная Институтом ответственного финтеха (RFI) и провайдером инфраструктуры Safeheron, использует протокол безопасных многосторонних вычислений, поддерживающий постквантовый стандарт цифровой подписи ML-DSA-65, на тестовой сети NEAR. В пилоте участвуют регуляторы, включая Управление финансового рынка Абу-Даби (ADGM), Управление финансовых услуг Гелефу в Бутане и Управление финансовых услуг Мальты, а также банки Bison Bank и DK Bank. Финансовые учреждения протестируют создание кошельков и транзакции в общей среде, в то время как регуляторы будут наблюдать и участвовать в разработке стандартов управления. Проект направлен на подготовку к угрозам, которые квантовые компьютеры представляют для традиционной криптографии с открытым ключом. По итогам испытаний планируется опубликовать технический документ с выводами и в дальнейшем открыть исходный код технологии. Инициатива согласуется с усилиями таких органов, как Валютное управление Гонконга и Банк международных расчетов, по переходу финансового сектора на постквантовые криптографические системы.

cointelegraph47 мин. назад

Банки и регуляторы присоединились к пилотному проекту по криптопереводам, устойчивым к квантовым компьютерам

cointelegraph47 мин. назад

Стратегия резко приостановила покупку биткоинов и накопила 6,69 млрд долларов наличными

Компания Strategy (MSTR) резко приостановила покупки биткоинов в период с 17 по 23 августа, не совершив ни одной сделки. Вместо этого компания сосредоточилась на накоплении ликвидности. За счет реализации акций MSTR на рынке она привлекла около 2,01 млрд долларов. Эти средства были направлены на увеличение резервов: 300 млн долларов пополнили основной долларовый резерв (до 5,10 млрд), 136,4 млн долларов — на выкуп собственных привилегированных акций STRC, а оставшаяся часть (1,59 млрд долларов) размещена на отдельном гибком счете "USD Cash". Таким образом, общий запас наличных средств компании достиг 6,69 млрд долларов. При этом Strategy не отказывается от своей биткоин-стратегии. Компания продолжает владеть примерно 4% от всего предложения BTC (840 447 монет), купленных в среднем по 75 385 долларов. Новый ликвидный резерв предназначен для различных корпоративных целей, включая будущие покупки биткоина, выкуп акций, выплаты по ценным бумагам и быстрое реагирование на рыночные возможности. Пауза в покупках, по всей видимости, является тактическим шагом по укреплению финансовой позиции перед следующим этапом роста.

cryptonews.ru51 мин. назад

Стратегия резко приостановила покупку биткоинов и накопила 6,69 млрд долларов наличными

cryptonews.ru51 мин. назад

Торговля

Спот
活动图片