¿Un profesor de Stanford entrena en directo un modelo de 535B? ¿Se está abriendo la "caja negra" detrás del entrenamiento de modelos?

marsbitPublicado a 2026-08-24Actualizado a 2026-08-24

Resumen

El profesor de Stanford, Percy Liang, ha iniciado la formación pública en directo del modelo de lenguaje grande Marin 535B-A23B, de 535.000 millones de parámetros. El entrenamiento, que durará unos tres meses utilizando 792 GPUs GB200, es totalmente transparente: cualquiera puede ver en tiempo real las curvas de entrenamiento, la composición de los datos, los registros y los detalles de ingeniería en plataformas como Weights & Biases y GitHub. Este enfoque abre el tradicional "recinto cerrado" del entrenamiento de modelos grandes, permitiendo la observación y el debate público de todo el proceso, incluidos los fallos y ajustes. Liang y su equipo ya completaron una "escalera" de experimentos a menor escala para predecir y depurar el entrenamiento principal. La iniciativa, muy celebrada por su espíritu de código abierto, también incluye un curso (CS336) para enseñar a construir modelos desde cero, ofreciendo una oportunidad única de aprendizaje y colaboración en IA.

Los últimos dos días, una publicación del usuario de X, Max For AI @MaxForAI, ha generado gran interés en la comunidad: "Es una locura — ahora incluso puedes ver en directo cómo se entrena un modelo masivo de 535B."

Resulta que Percy Liang @percyliang, profesor de Stanford y fundador de Simile AI, anunció que el Laboratorio Abierto Marin iniciará el entrenamiento del modelo Marin 535B-A23B, y todo el proceso de entrenamiento se realizará de forma pública y en tiempo real.

Marin cuenta con 535 mil millones de parámetros totales y 23 mil millones de parámetros activos. Para ello, Percy Liang y su equipo han preparado un total de 18.75 billones de tokens de datos de entrenamiento, y han desplegado 11 sistemas GB200 NVL72, equivalentes a unos 792 GPUs GB200.

Se estima que el modelo se entrenará de forma continua durante unos 3 meses, con un cómputo total de entrenamiento de aproximadamente 2.7e24 FLOPs. Una vez completado el entrenamiento, el equipo continuará con la fase de post-entrenamiento (post-training).

En otras palabras: en los próximos meses, cualquiera podrá observar cómo un modelo de vanguardia crece desde cero.

Otro punto a destacar es que Percy Liang mencionó que, antes de iniciar oficialmente esta tarea de entrenamiento, el equipo ya había entrenado una "Escalera de Escalado" (Scaling Ladder) de 4 etapas, desde 1.6B-A61M (48B tokens) hasta 27.7B-A1.2B (926B tokens).

"Esto tiene dos propósitos: primero, usar estos experimentos a pequeña escala para detectar y depurar problemas potenciales con anticipación; segundo, predecir el rendimiento de nuestro 'entrenamiento principal' (hero run) basándonos en el desempeño de los modelos a diferentes escalas."

Por supuesto, Percy Liang también señaló: "Este es el entrenamiento a mayor escala que hemos realizado hasta ahora, por lo que, efectivamente, esperamos que ocurran algunas situaciones inesperadas durante el proceso."

Actualmente, el modelo principal ya está en funcionamiento y cualquiera puede ver las curvas de entrenamiento en tiempo real. Posteriormente, los datos de entrenamiento, los registros de experimentos y los problemas de ingeniería también se harán públicos de manera continua.

Por ejemplo, a nivel de datos: la proporción de mezcla de datos de entrenamiento, los métodos de procesamiento de datos y cómo ingresan los datos de diferentes dominios al modelo. A nivel de ingeniería: la configuración del entrenamiento, el código y el diseño experimental. En el proceso de entrenamiento: el cambio de la pérdida (loss) en tiempo real, el estado del modelo y los resultados predictivos en diferentes etapas.

Simultáneamente, Percy Liang también hizo públicos los canales específicos para seguir el proceso.

Ver la composición de los datos: https://storage.googleapis.com/marin-public/held/harrier-k40-cluster-overview/2026.08.18/index.html?revision=uniform-sampling

Seguir el entrenamiento en tiempo real en Weights & Biases (wandb): https://wandb.ai/marin-community/marin_moe/reports/535B-A23B-18T-Token-Hero-Run-Scaling-Ladder--VmlldzoxNzc2MDM5Ng

Ver todos los detalles en GitHub: https://github.com/marin-community/marin/issues/8435

Tras analizar los detalles, es fácil entender por qué esta iniciativa de Percy Liang ha despertado tanto interés. Porque en el pasado, para modelos como GPT-4, Claude o Gemini, no se sabía exactamente cómo se entrenaban detrás de bastidores; eran como "cajas negras".

Solo se podían ver las capacidades finales del modelo, las puntuaciones en benchmarks y algunas descripciones en artículos. Pero aspectos como la proporción de los datos, en qué falló el entrenamiento, qué hiperparámetros fueron efectivos, cómo cambiaba la pérdida, o si las leyes de escalado (Scaling laws) se predecían con precisión, eran desconocidos.

Marin está intentando cambiar esto. Quizás, el entrenamiento de modelos también puede ser como los artículos científicos o el software de código abierto: observable, debatible y colaborativo.

Desde que se anunció esta noticia, el entusiasmo de los usuarios en línea no ha dejado de crecer.

Algunos usuarios opinan que este es el verdadero espíritu del código abierto: "incluso si surgen problemas durante el entrenamiento o se desvía de lo esperado, no se oculta nada."

Otros usuarios señalan que, aunque el propio modelo a entrenar ya es enorme, lo realmente impresionante es que ahora cualquiera pueda observar, a través de la plataforma WandB y en tiempo real, cómo crece paso a paso un modelo a una escala que vale miles de millones de dólares.

"Es como si la 'sala oscura' cerrada dentro de los principales laboratorios de IA se abriera de repente, permitiendo que todos vean lo que está sucediendo allí dentro."

Y en los próximos tres meses, lo más interesante tal vez no sea la capacidad final del modelo, sino observar cuántas "explosiones", colapsos y situaciones inesperadas experimentará este modelo durante su entrenamiento...

Además, algunos usuarios también creen que esta iniciativa no solo ofrece una perspectiva para observar todo el proceso de entrenamiento, sino que incluso proporciona una plataforma para aprender e intercambiar ideas.

El usuario James Thewlis @jdthewlis ha estado siguiendo el proceso de entrenamiento en tiempo real. En un momento, no entendía "¿por qué alrededor del step 500 aproximadamente, las normas (norms) de los parámetros muestran un pico?"

Después de investigarlo por su cuenta, se respondió a sí mismo en los comentarios: "Este pico está completamente causado por el sesgo del enrutador (router_bias). No es un parámetro obtenido a través del entrenamiento por gradiente, sino parte de un mecanismo heurístico de equilibrio de tokens (token balancing heuristic) en el modelo MoE (Mixture of Experts). Por lo tanto, tiene una dinámica diferente a la de los parámetros normales del modelo."

Hay muchos casos similares a este.

Además, vale la pena mencionar que Percy Liang, como profesor de Stanford, además de esta práctica concreta, también imparte un curso teórico: "CS336: Modelos de Lenguaje Desde Cero" (Language Models From Scratch), cuyo objetivo es que los estudiantes comprendan completamente cómo se construye un modelo de lenguaje grande.

Parece que Percy Liang realmente quiere enseñar a todos a "construir" modelos grandes. Los usuarios interesados pueden echarle un vistazo.

Enlace al curso: https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

¿Y tú? ¿Qué opinas sobre esta transmisión en vivo que literalmente lleva el entrenamiento de modelos grandes al escenario público? ¡Bienvenido a dejar tus comentarios!

Referencias:

https://x.com/MaxForAI/status/2091270116067750089

https://x.com/percyliang/status/2090918065634684997

https://x.com/CopyRebeldia/status/2091231950774112412?s=20

https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

Este artículo proviene de la cuenta oficial de WeChat "机器之心" (ID: almosthuman2014), autor: 关注AI的.

Preguntas relacionadas

Q¿Qué proyecto está realizando el profesor Percy Liang de Stanford y qué lo hace excepcional?

AEl profesor Percy Liang de Stanford está dirigiendo el entrenamiento del modelo Marin 535B-A23B. Lo excepcional es que todo el proceso de entrenamiento de este modelo de gran tamaño (con 535 mil millones de parámetros) se está transmitiendo en vivo y es completamente público, permitiendo que cualquiera lo observe en tiempo real.

Q¿Cuáles son los recursos computacionales utilizados para entrenar el modelo Marin 535B-A23B?

APara entrenar el modelo Marin 535B-A23B, el equipo ha desplegado 11 sistemas GB200 NVL72, lo que equivale a aproximadamente 792 GPUs GB200. El cálculo total de entrenamiento estimado es de unos 2.7e24 FLOPs, y se utilizarán 18.75 billones de tokens de datos de entrenamiento.

Q¿Qué significa que el entrenamiento del modelo sea como 'abrir una caja negra' según el artículo?

ASignifica que, a diferencia de modelos como GPT-4 o Claude, cuyos procesos de entrenamiento son secretos y parecen una 'caja negra', el proyecto Marin hace público todo: la proporción de los datos, los fallos durante el entrenamiento, los hiperparámetros efectivos, los cambios en la pérdida (loss), etc. Esto permite observar, discutir y colaborar en el proceso de entrenamiento de un modelo de vanguardia.

Q¿Qué plataformas o canales ha proporcionado Percy Liang para que el público pueda seguir el entrenamiento?

APercy Liang ha proporcionado varios canales públicos: se puede ver la composición de los datos en un enlace de almacenamiento de Google, observar el proceso de entrenamiento en tiempo real en la plataforma Weights & Biases (wandb), y consultar todos los detalles en un repositorio de GitHub.

QAdemás del proyecto de entrenamiento en vivo, ¿qué otra iniciativa educativa relacionada menciona el artículo sobre Percy Liang?

AEl artículo también menciona que Percy Liang imparte un curso teórico en Stanford llamado 'CS336: Language Models From Scratch' (Modelos de Lenguaje Desde Cero). El objetivo del curso es que los estudiantes comprendan completamente cómo se construye un modelo de lenguaje grande. Además, hay una lista de reproducción pública disponible en YouTube.

Lecturas Relacionadas

Los depósitos en RWA se triplican: las finanzas tradicionales optan por blockchain

El sector DeFi está experimentando una transformación estructural, con los activos del mundo real tokenizados (RWA) ganando protagonismo. El volumen de depósitos en RWA en plataformas descentralizadas alcanzó los 7.400 millones de dólares en el segundo trimestre, triplicando la cifra del año anterior. Este crecimiento contrasta con la caída del 15% en los depósitos generales de DeFi y el desplome del 70% en el volumen de intercambios descentralizados (DEX). El interés por los instrumentos financieros tradicionales en blockchain crece independientemente de los ciclos de mercado. Los principales impulsores son los bonos del Tesoro de EE. UU. tokenizados y los fondos multiestratégicos, utilizados como garantía colateral para acceder a liquidez en stablecoins. La red Ethereum concentra aproximadamente el 70% del total del colateral RWA. Además de los bonos, se están desarrollando acciones tokenizadas y derivados de productos básicos. El mercado de acciones tokenizadas se estima en 2.200 millones de dólares. Las plataformas ofrecen derivados perpetuos basados en RWA, como petróleo y metales preciosos, permitiendo acceso 24/7. Los analistas de Standard Chartered pronostican que la capitalización total de activos tokenizados podría alcanzar los 4 billones de dólares para finales de 2028. La integración de las finanzas tradicionales con la tecnología blockchain ha entrado en una fase de expansión institucional, demostrando que la tokenización ofrece valor tangible y acceso global al capital.

cryptonews.ruHace 11 min(s)

Los depósitos en RWA se triplican: las finanzas tradicionales optan por blockchain

cryptonews.ruHace 11 min(s)

Reserva de Bitcoin intacta: Strategy vendió acciones por $2 mil millones y lanzó un nuevo fondo USD Cash

La empresa Strategy (anteriormente MicroStrategy) ha anunciado una actualización de su Marco de Capital de Crédito Digital. Como parte de esta actualización, ha creado un nuevo fondo de liquidez en dólares llamado USD Cash. Para financiar este fondo, Strategy vendió 18.261.118 acciones MSTR entre el 17 y el 23 de agosto de 2026, obteniendo unos ingresos netos de 2.006,5 millones de dólares. Estos fondos se destinaron de la siguiente manera: 136,4 millones para recomprar acciones preferentes STRC, 300 millones se añadieron al fondo USD Reserve existente, y el resto formó el nuevo fondo USD Cash. Al 23 de agosto, el USD Reserve tenía 5.100 millones y el USD Cash 1.590 millones. El USD Reserve sigue destinado exclusivamente a pagar dividendos de acciones preferentes e intereses de deuda. El nuevo USD Cash es un fondo separado para fines corporativos generales, que podrían incluir la compra de Bitcoin, pagos de dividendos, recompra de acciones o aumentar el USD Reserve. **Importante:** La reserva de Bitcoin de Strategy permaneció intacta durante este periodo, manteniéndose en 840.447 BTC, con un precio de compra promedio de 75.385 dólares por Bitcoin. El análisis adjunto sugiere que esta reestructuración de reservas podría ser un intento de fortalecer la confianza del mercado en la estructura de capital de la empresa, en un momento en que su valoración en bolsa se alinea estrechamente con el valor de su reserva de Bitcoin (multiplicador mNAV ~1.0x), a diferencia de las primas significativas vistas en ciclos anteriores.

cryptonews.ruHace 26 min(s)

Reserva de Bitcoin intacta: Strategy vendió acciones por $2 mil millones y lanzó un nuevo fondo USD Cash

cryptonews.ruHace 26 min(s)

Strategy detuvo abruptamente la compra de bitcoins y acumuló 6.69 mil millones de dólares en efectivo

La empresa Strategy, con sede en Tysons Corner, Virginia, anunció el 24 de agosto que no realizó ninguna transacción de bitcoin entre el 17 y el 23 de agosto. La compañía mantiene una reserva de 840.447 BTC, adquiridos por un total de 63.360 millones de dólares, con un precio promedio de compra de 75.385 dólares por moneda. En lugar de continuar las compras, Strategy ha acumulado una significativa reserva de efectivo. Su fondo separado "USD Cash" contenía 1.590 millones de dólares al 23 de agosto, mientras que su reserva principal en dólares estadounidenses alcanzó los 5.100 millones. Esto suma una "caja de guerra" total de 6.690 millones de dólares en efectivo. Estos fondos tienen propósitos distintos. La reserva principal en USD está destinada a dividendos de acciones preferentes y pagos de deuda. El efectivo en USD es más flexible y puede usarse para comprar bitcoin, recomprar valores (como acciones MSTR o preferentes STRC), pagar bonos convertibles o reforzar las propias reservas. Durante la semana, Strategy generó aproximadamente 2.010 millones de dólares mediante la venta de acciones MSTR. De estos, 300 millones se destinaron a la reserva principal en USD, 136,4 millones a la recompra de acciones preferentes STRC y el resto se añadió al fondo de efectivo flexible. Nada en los comunicados sugiere un abandono de la estrategia en bitcoin. Las compras de bitcoin siguen siendo un uso potencial del efectivo. La empresa afirma que esta liquidez adicional le proporciona mayor flexibilidad para actuar rápidamente ante movimientos significativos en el precio del bitcoin o de sus propios valores. La atención se centra ahora en cómo utilizará Strategy sus 1.590 millones de dólares en efectivo flexible.

cryptonews.ruHace 50 min(s)

Strategy detuvo abruptamente la compra de bitcoins y acumuló 6.69 mil millones de dólares en efectivo

cryptonews.ruHace 50 min(s)

Trading

Spot
活动图片