За последние пару дней пост пользователя X Max For AI@MaxForAI вызвал бурные обсуждения: «Это безумие — теперь вы можете в прямом эфире наблюдать, как обучается модель на 535B параметров.»

Оказалось, что профессор Стэнфорда, основатель Simile AI Percy Liang@percyliang объявил о запуске тренировки модели Marin 535B-A23B открытой лабораторией Marin, причём весь процесс обучения будет публичным.
Marin имеет 535 миллиардов общих параметров и 23 миллиарда активных параметров. Для этого Percy Liang и его команда подготовили в общей сложности 18,75 триллионов токенов обучающих данных, развернули 11 систем GB200 NVL72, что примерно эквивалентно 792 GPU GB200.
Ожидается, что модель будет обучаться непрерывно около 3 месяцев, общий объём вычислений при обучении составит примерно 2.7e24 FLOPs. После завершения обучения команда продолжит этап пост-обучения (post-training).

Другими словами: В ближайшие несколько месяцев все смогут наблюдать, как передовая большая модель растёт с нуля.
Также стоит отметить, что Percy Liang сообщил, что перед официальным запуском этого учебного задания команда уже обучила набор Scaling Ladder (лестницу масштабирования), состоящую из 4 этапов, от 1.6B-A61M (48B токенов) до 27.7B-A1.2B (926B токенов).
«Это служит двум целям: во-первых, с помощью этих небольших экспериментов заранее обнаруживать и отлаживать потенциальные проблемы; во-вторых, на основе результатов обучения моделей разного масштаба прогнозировать ход нашего «главного обучения» (hero run).»
Конечно, Percy Liang также признал: «Это самое масштабное обучение, которое мы когда-либо проводили, поэтому мы действительно ожидаем некоторых непредвиденных ситуаций в процессе.»
В настоящее время основная модель уже официально запущена, и каждый может напрямую просматривать кривые обучения в реальном времени. В дальнейшем обучающие данные, журналы экспериментов и технические проблемы также будут продолжать публиковаться.
Например, на уровне данных: включая пропорции смешивания обучающих данных, способы обработки данных, а также то, как данные из разных областей поступают в модель; на инженерном уровне: включая конфигурацию обучения, код и дизайн экспериментов; процесс обучения: включая изменения потерь (loss) в реальном времени, состояние модели и прогнозируемые результаты на разных этапах.
Одновременно Percy Liang также открыл конкретные каналы для просмотра.

Посмотреть состав данных: https://storage.googleapis.com/marin-public/held/harrier-k40-cluster-overview/2026.08.18/index.html?revision=uniform-sampling
Наблюдать за процессом обучения в реальном времени на Weights & Biases (wandb): https://wandb.ai/marin-community/marin_moe/reports/535B-A23B-18T-Token-Hero-Run-Scaling-Ladder--VmlldzoxNzc2MDM5Ng
Посмотреть все детали на GitHub: https://github.com/marin-community/marin/issues/8435
При более детальном изучении становится понятно, почему это действие Percy Liang вызвало такой ажиотаж. Потому что раньше для таких моделей, как GPT-4, Claude, Gemini, было совершенно неизвестно, как именно они обучаются, это было похоже на «чёрный ящик».
Можно было видеть только итоговые возможности модели, баллы в тестах (benchmark), краткие описания в статьях и т.д. А о таких вещах, как пропорции данных, на чём обучение проваливалось, какие гиперпараметры эффективны, как менялся loss, точны ли прогнозы Scaling law, — ничего не было известно.
Marin пытается это изменить. Возможно, обучение моделей тоже может быть подобно научным статьям или открытому программному обеспечению: наблюдаемым, обсуждаемым, совместным.
С момента объявления этой новости энтузиазм пользователей продолжает расти.
Некоторые считают, что это и есть истинный дух open source: «Даже если в процессе обучения возникают проблемы или отклонения от ожиданий, ничего не скрывается.»

Другие отмечают, что даже несмотря на то, что сама обучаемая модель уже огромна, по-настоящему впечатляет то, что теперь каждый может через платформу WandB в реальном времени наблюдать, как шаг за шагом растёт большая модель стоимостью в десятки миллиардов долларов?
«Это как если бы тёмная комната внутри ведущих AI-лабораторий, ранее плотно закрытая, внезапно распахнулась, и все смогли увидеть, что там происходит.»
И в течение следующих трёх месяцев, возможно, самое интересное будет не в том, какими окажутся финальные способности модели, а в том, чтобы наблюдать, сколько раз эта модель в процессе обучения переживёт «взрывы», сбои и непредвиденные ситуации...

Кроме того, некоторые пользователи считают, что этот шаг не только предоставляет возможность наблюдать за всем процессом обучения модели, но даже даёт платформу для обучения и обмена опытом.
Пользователь James Thewlis@jdthewlis постоянно следил за процессом обучения в реальном времени и не понимал: «Почему примерно на 500-м шаге (step) возникает пик в нормах параметров (norms)?»
Позже, разобравшись самостоятельно, он сам же ответил в комментариях: «Этот пик полностью вызван router_bias (смещением маршрутизатора). Этот параметр не получается через градиентное обучение, а является частью эвристики балансировки токенов (token balancing heuristic) в MoE (Mixture of Experts, смесь экспертов), поэтому его динамика отличается от динамики обычных параметров модели.»

Подобных ситуаций было много.

Кроме того, стоит упомянуть, что Percy Liang как профессор Стэнфорда, помимо этой практической работы, также ведёт теоретический курс: «CS336: Language Models From Scratch» (Языковые модели с нуля), цель которого — позволить студентам полностью понять, как строится большая языковая модель.
Похоже, Percy Liang действительно хочет научить всех «создавать» большие модели. Заинтересованным пользователям стоит с ним ознакомиться.

Ссылка на курс: https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV
А как вы относитесь к этой прямой трансляции, которая выводит обучение больших моделей на публичную сцену? Добро пожаловать в комментарии для обсуждения!
Ссылки:
https://x.com/MaxForAI/status/2091270116067750089
https://x.com/percyliang/status/2090918065634684997
https://x.com/CopyRebeldia/status/2091231950774112412?s=20
https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV
Эта статья взята с официального аккаунта WeChat «机器之心» (ID: almosthuman2014), автор: 关注AI的





