Профессор Стэнфорда проводит прямую трансляцию обучения модели на 535B параметров: открывается ли «чёрный ящик» за тренировкой моделей?

marsbitОпубликовано 2026-08-24Обновлено 2026-08-24

Введение

Стэнфордский профессор Перси Лян запустил публичную тренировку крупной языковой модели Marin 535B-A23B с 535 млрд параметров. Весь процесс, который продлится около трех месяцев с использованием 792 GPU GB200, транслируется в реальном времени на платформе Weights & Biases. Это включает в себя открытый доступ к данным, конфигурациям тренировки, коду и логам. Проект направлен на демократизацию знаний о создании больших моделей, которые ранее были «черным ящиком» в таких системах, как GPT-4 или Claude. Команда также провела предварительные эксперименты с моделями меньшего масштаба для отладки и прогнозирования. Инициатива вызвала большой интерес в сообществе, так как позволяет в реальном времени наблюдать и анализировать все этапы тренировки, включая потенциальные сбои и динамику потерь (loss). Это дает уникальную возможность для обучения и совместного изучения процесса. Перси Лян также ведет курс «CS336: Language Models From Scratch», чтобы обучать созданию моделей с нуля.

За последние пару дней пост пользователя X Max For AI@MaxForAI вызвал бурные обсуждения: «Это безумие — теперь вы можете в прямом эфире наблюдать, как обучается модель на 535B параметров.»

Оказалось, что профессор Стэнфорда, основатель Simile AI Percy Liang@percyliang объявил о запуске тренировки модели Marin 535B-A23B открытой лабораторией Marin, причём весь процесс обучения будет публичным.

Marin имеет 535 миллиардов общих параметров и 23 миллиарда активных параметров. Для этого Percy Liang и его команда подготовили в общей сложности 18,75 триллионов токенов обучающих данных, развернули 11 систем GB200 NVL72, что примерно эквивалентно 792 GPU GB200.

Ожидается, что модель будет обучаться непрерывно около 3 месяцев, общий объём вычислений при обучении составит примерно 2.7e24 FLOPs. После завершения обучения команда продолжит этап пост-обучения (post-training).

Другими словами: В ближайшие несколько месяцев все смогут наблюдать, как передовая большая модель растёт с нуля.

Также стоит отметить, что Percy Liang сообщил, что перед официальным запуском этого учебного задания команда уже обучила набор Scaling Ladder (лестницу масштабирования), состоящую из 4 этапов, от 1.6B-A61M (48B токенов) до 27.7B-A1.2B (926B токенов).

«Это служит двум целям: во-первых, с помощью этих небольших экспериментов заранее обнаруживать и отлаживать потенциальные проблемы; во-вторых, на основе результатов обучения моделей разного масштаба прогнозировать ход нашего «главного обучения» (hero run).»

Конечно, Percy Liang также признал: «Это самое масштабное обучение, которое мы когда-либо проводили, поэтому мы действительно ожидаем некоторых непредвиденных ситуаций в процессе.»

В настоящее время основная модель уже официально запущена, и каждый может напрямую просматривать кривые обучения в реальном времени. В дальнейшем обучающие данные, журналы экспериментов и технические проблемы также будут продолжать публиковаться.

Например, на уровне данных: включая пропорции смешивания обучающих данных, способы обработки данных, а также то, как данные из разных областей поступают в модель; на инженерном уровне: включая конфигурацию обучения, код и дизайн экспериментов; процесс обучения: включая изменения потерь (loss) в реальном времени, состояние модели и прогнозируемые результаты на разных этапах.

Одновременно Percy Liang также открыл конкретные каналы для просмотра.

Посмотреть состав данных: https://storage.googleapis.com/marin-public/held/harrier-k40-cluster-overview/2026.08.18/index.html?revision=uniform-sampling

Наблюдать за процессом обучения в реальном времени на Weights & Biases (wandb): https://wandb.ai/marin-community/marin_moe/reports/535B-A23B-18T-Token-Hero-Run-Scaling-Ladder--VmlldzoxNzc2MDM5Ng

Посмотреть все детали на GitHub: https://github.com/marin-community/marin/issues/8435

При более детальном изучении становится понятно, почему это действие Percy Liang вызвало такой ажиотаж. Потому что раньше для таких моделей, как GPT-4, Claude, Gemini, было совершенно неизвестно, как именно они обучаются, это было похоже на «чёрный ящик».

Можно было видеть только итоговые возможности модели, баллы в тестах (benchmark), краткие описания в статьях и т.д. А о таких вещах, как пропорции данных, на чём обучение проваливалось, какие гиперпараметры эффективны, как менялся loss, точны ли прогнозы Scaling law, — ничего не было известно.

Marin пытается это изменить. Возможно, обучение моделей тоже может быть подобно научным статьям или открытому программному обеспечению: наблюдаемым, обсуждаемым, совместным.

С момента объявления этой новости энтузиазм пользователей продолжает расти.

Некоторые считают, что это и есть истинный дух open source: «Даже если в процессе обучения возникают проблемы или отклонения от ожиданий, ничего не скрывается.»

Другие отмечают, что даже несмотря на то, что сама обучаемая модель уже огромна, по-настоящему впечатляет то, что теперь каждый может через платформу WandB в реальном времени наблюдать, как шаг за шагом растёт большая модель стоимостью в десятки миллиардов долларов?

«Это как если бы тёмная комната внутри ведущих AI-лабораторий, ранее плотно закрытая, внезапно распахнулась, и все смогли увидеть, что там происходит.»

И в течение следующих трёх месяцев, возможно, самое интересное будет не в том, какими окажутся финальные способности модели, а в том, чтобы наблюдать, сколько раз эта модель в процессе обучения переживёт «взрывы», сбои и непредвиденные ситуации...

Кроме того, некоторые пользователи считают, что этот шаг не только предоставляет возможность наблюдать за всем процессом обучения модели, но даже даёт платформу для обучения и обмена опытом.

Пользователь James Thewlis@jdthewlis постоянно следил за процессом обучения в реальном времени и не понимал: «Почему примерно на 500-м шаге (step) возникает пик в нормах параметров (norms)?»

Позже, разобравшись самостоятельно, он сам же ответил в комментариях: «Этот пик полностью вызван router_bias (смещением маршрутизатора). Этот параметр не получается через градиентное обучение, а является частью эвристики балансировки токенов (token balancing heuristic) в MoE (Mixture of Experts, смесь экспертов), поэтому его динамика отличается от динамики обычных параметров модели.»

Подобных ситуаций было много.

Кроме того, стоит упомянуть, что Percy Liang как профессор Стэнфорда, помимо этой практической работы, также ведёт теоретический курс: «CS336: Language Models From Scratch» (Языковые модели с нуля), цель которого — позволить студентам полностью понять, как строится большая языковая модель.

Похоже, Percy Liang действительно хочет научить всех «создавать» большие модели. Заинтересованным пользователям стоит с ним ознакомиться.

Ссылка на курс: https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

А как вы относитесь к этой прямой трансляции, которая выводит обучение больших моделей на публичную сцену? Добро пожаловать в комментарии для обсуждения!

Ссылки:

https://x.com/MaxForAI/status/2091270116067750089

https://x.com/percyliang/status/2090918065634684997

https://x.com/CopyRebeldia/status/2091231950774112412?s=20

https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

Эта статья взята с официального аккаунта WeChat «机器之心» (ID: almosthuman2014), автор: 关注AI的

Связанные с этим вопросы

QЧто такое Marin 535B-A23B и почему его обучение является значимым событием?

AMarin 535B-A23B — это крупная языковая модель с 535 миллиардами параметров и 23 миллиардами активированных параметров, созданная профессором Перси Ляном. Её обучение является значимым, потому что процесс полностью публичен в реальном времени, что раскрывает «чёрный ящик» традиционно скрытой тренировки флагманских моделей ИИ, таких как GPT-4. Это позволяет исследователям и сообществу наблюдать за всем: от данных и гиперпараметров до динамики потерь и инженерных проблем.

QКакие технические ресурсы используются для обучения модели Marin 535B-A23B?

AДля обучения Marin 535B-A23B используется 11 систем GB200 NVL72, что в сумме составляет около 792 графических процессоров GB200 GPU. Объём обучающих данных — 18,75 триллиона токенов. Ожидается, что непрерывное обучение продлится примерно 3 месяца с общим объёмом вычислений около 2,7e24 FLOPs (операций с плавающей запятой).

QКакие аспекты процесса обучения будут открыты для публики?

AДля публики открыты все аспекты: состав обучающих данных (пропорции смешения, обработка), конфигурации обучения, код, журналы экспериментов. В реальном времени можно наблюдать за кривыми обучения (loss), состоянием модели, прогнозами на разных этапах, а также за инженерными проблемами и их решениями. Всё это доступно через платформы Weights & Biases, GitHub и специальный дашборд.

QКак сообщество реагирует на это открытое обучение модели?

AСообщество реагирует с огромным энтузиазмом. Многие называют это истинным духом открытого исходного кода, где даже неудачи и отклонения от плана не скрываются. Пользователи активно наблюдают за процессом, обсуждают неожиданные события (например, всплески в нормах параметров) и делятся своими выводами, превращая процесс в образовательную и совместную платформу. Это сравнивают с открытием «тёмной комнаты» ведущих AI-лабораторий.

QКаков вклад профессора Перси Ляна в образование в области больших языковых моделей?

AПомимо практического проекта Marin, профессор Перси Лян преподаёт в Стэнфорде курс CS336: «Language Models From Scratch» («Языковые модели с нуля»). Цель курса — научить студентов, как полностью построить большую языковую модель. Его лекции доступны на YouTube, что демонстрирует его стремление сделать знания о создании ИИ-моделей доступными для широкой аудитории.

Похожее

Лучший мем-коин для покупки в 2026 году: MemeToro объединяет AI-агентов и инфраструктуру BNB Chain

Поиск лучшей мем-монеты для покупки в 2026 году смещается в сторону проектов с практической инфраструктурой. MemeToro выбирает особый путь, объединяя AI-агентов с инфраструктурой BNB Chain. Его цель — создать экосистему, где искусственный интеллект поддерживает поиск, проверку и запуск новых мем-токенов. BNB Chain обеспечивает важное преимущество благодаря низкой стоимости транзакций и высокой скорости, что подходит для частых запусков токенов и розничной торговли. MemeToro строит на этой основе AI-платформу для запуска и анализа мем-коинов. Ключевая особенность MemeToro — использование автономных AI-агентов. Они могут отслеживать рыночные тенденции для обнаружения новых проектов, проверять смарт-контракты на наличие рисков и помогать трейдерам быстро фильтровать возможности в динамичном рынке мем-токенов. В отличие от таких монет, как DOGE (ликвидность) или SHIB (утилита Shibarium), MemeToro фокусируется на инфраструктурной модели. Это позволяет ему получить выгоду от роста всего сектора мем-коинов, не завися полностью от собственной виральности. Токен $MT в настоящее время находится на 6-м этапе предпродажи.

bitcoinist3 мин. назад

Лучший мем-коин для покупки в 2026 году: MemeToro объединяет AI-агентов и инфраструктуру BNB Chain

bitcoinist3 мин. назад

EIP-8363: количественный разбор. Отказ от «субсидирования» стейкинга — что Ethereum хочет получить взамен?

EIP-8363 предлагает сокращать долю вознаграждений валидаторов, отправляя их на сжигание, при этом сжигание достигает 100%, когда в стейкинге находится 50% от общего предложения ETH. Анализ показывает, что механизм сжигания комиссий (EIP-1559) сейчас неэффективен, компенсируя лишь 2.4% годовой эмиссии. Таким образом, регулирование эмиссии становится основным инструментом влияния на предложение ETH. При текущем уровне стейкинга (~35%) предложение сократится примерно на 58.6%, а не обнулится. Механизм саморегулируется: при ожидаемой доходности 2% система стабилизируется на уровне стейкинга ~26% и годовой инфляции ~0.48%. Статистика не показывает значимой связи между доходностью стейкинга и ценой ETH. Предложение перераспределяет богатство: сокращая ежегодную эмиссию на ~633k ETH ($1.55 млрд), оно перенаправляет средства от стейкеров (35% держателей) ко всем остальным держателям ETH (65%). Хотя это укрепляет экономику ETH в долгосрочной перспективе, концентрированные интересы крупных стейкинг-провайдеров (таких как Lido) делают политическое принятие提案 маловероятным.

marsbit6 мин. назад

EIP-8363: количественный разбор. Отказ от «субсидирования» стейкинга — что Ethereum хочет получить взамен?

marsbit6 мин. назад

Валидаторы TON готовят обновление нод перед голосованием по коллатору

Валидаторы сети TON получили инструкции обновить программное обеспечение своих узлов (коммит 140320b) и инструмент mytonctrl (коммит 7e90e26) перед голосованием по конфигурации, связанному с новой архитектурой коллаторов. Голосование запланировано на 21 августа в 08:00 UTC. Важно подчеркнуть, что это этап подготовки и голосования; активацию коллаторов не следует считать завершённой до окончания этого процесса. Обновление важно, поскольку архитектура коллаторов может повлиять на организацию производства блоков и распределение обязанностей валидаторов по мере масштабирования сети. Координация валидаторов критична для любых обновлений блокчейна — проблемы могут привести к задержкам или несогласованной работе сети. Коллаторы обычно отвечают за сбор транзакций и подготовку кандидатов в блоки, что способствует повышению пропускной способности и эффективности сети. Для TON это часть усилий по масштабированию инфраструктуры, особенно в контексте интеграции с экосистемой Telegram. Следующим шагом будет подтверждение результатов голосования и, в случае успеха, активация новой конфигурации. Рынку следует дождаться окончательного статуса активации, прежде чем считать обновление завершённым.

bitcoinist8 мин. назад

Валидаторы TON готовят обновление нод перед голосованием по коллатору

bitcoinist8 мин. назад

Стоимость токенизированных активов Avalanche превысила $3 млрд на фоне роста тренда на RWA

Стоимость токенизированных реальных активов (RWA) в блокчейне Avalanche превысила 3 миллиарда долларов. Этот рубеж был достигнут благодаря совокупному росту, а не появлению новых средств за один день. Основной вклад внесла миграция ценных бумаг Progmat на сумму 1,2 миллиарда долларов, а также активность таких платформ, как OpenTrade (около 190 млн долларов) и Grove Finance (примерно 260 млн долларов). Рост RWA укрепляет нарратив Avalanche как инфраструктуры для институциональных финансов, выходящей за рамки розничного DeFi. Сеть делает ставку на субсети и кастомизацию, что подходит для регулируемых активов, требующих контроля и соответствия нормам. Важно отметить, что данный показатель отражает общую стоимость токенизированных активов, а не напрямую влияет на цену нативного токена AVAX. Для сети ключевым станет вопрос, сможет ли она превратить этот объем в активную финансовую инфраструктуру с реальной торговлей, использованием в качестве залога и ростом расчетных операций. Тем не менее, достижение отметки в 3 миллиарда долларов укрепляет позиции Avalanche в конкурентной гонке за институциональную токенизацию активов.

bitcoinist13 мин. назад

Стоимость токенизированных активов Avalanche превысила $3 млрд на фоне роста тренда на RWA

bitcoinist13 мин. назад

Концентрация долга в Aave вызывает вопросы о рисках после волатильности Ethereum

Концентрация долга в протоколе Aave привлекает внимание после оценки рисков, которая показала, что менее 9% заёмных позиций составляют примерно половину общего непогашенного долга протокола. Эта концентрация в основном связана с пользователями режима E-mode, использующими леверидженные позиции с займами WETH, обеспеченными токенами ликвидного стейкинга. Резкая внутридневная волатильность Ethereum вновь высветила уязвимость этой структуры, поскольку коррелированные сделки в стейкинг-лупах могут стать рискованными при быстрых изменениях рыночных условий. Это не означает неплатёжеспособность Aave или начало каскада ликвидаций. Суть проблемы более конкретна: концентрация долга и корреляционный риск могут повысить чувствительность частей кредитного протокола к резким движениям цены ETH. Режим E-mode, предназначенный для эффективного займа под коррелированные активы, повышает как эффективность, так и риски, так как позволяет наращивать леверидж. Основная опасность может возникнуть при быстром падении рынка, когда одновременный стресс у множества крупных позиций со схожим обеспечением может усилить давление продаж и нагрузку на ликвидность. Aave — это децентрализованный протокол, а не банк, и его риски управляются через параметры обеспечения, ликвидации и оракулов. Данные о концентрации важны, потому что протоколы DeFi зависят от работы рыночных стимулов в условиях стресса. В настоящее время сигнал — не паника, а осторожность. Управление Aave может пересмотреть такие параметры, как коэффициенты обеспечения или настройки E-mode, чтобы сбалансировать спрос и безопасность протокола. Как один из ключевых кредитных рынков DeFi, Aave играет важную роль в экосистеме Ethereum, поэтому мониторинг концентрации рисков, связанных с левериджем на основе ETH, остаётся важной задачей.

bitcoinist18 мин. назад

Концентрация долга в Aave вызывает вопросы о рисках после волатильности Ethereum

bitcoinist18 мин. назад

Торговля

Спот
活动图片