¿Un profesor de Stanford entrena en directo un modelo de 535B? ¿Se está abriendo la "caja negra" detrás del entrenamiento de modelos?

marsbitPublicado a 2026-08-24Actualizado a 2026-08-24

Resumen

El profesor de Stanford, Percy Liang, ha iniciado la formación pública en directo del modelo de lenguaje grande Marin 535B-A23B, de 535.000 millones de parámetros. El entrenamiento, que durará unos tres meses utilizando 792 GPUs GB200, es totalmente transparente: cualquiera puede ver en tiempo real las curvas de entrenamiento, la composición de los datos, los registros y los detalles de ingeniería en plataformas como Weights & Biases y GitHub. Este enfoque abre el tradicional "recinto cerrado" del entrenamiento de modelos grandes, permitiendo la observación y el debate público de todo el proceso, incluidos los fallos y ajustes. Liang y su equipo ya completaron una "escalera" de experimentos a menor escala para predecir y depurar el entrenamiento principal. La iniciativa, muy celebrada por su espíritu de código abierto, también incluye un curso (CS336) para enseñar a construir modelos desde cero, ofreciendo una oportunidad única de aprendizaje y colaboración en IA.

Los últimos dos días, una publicación del usuario de X, Max For AI @MaxForAI, ha generado gran interés en la comunidad: "Es una locura — ahora incluso puedes ver en directo cómo se entrena un modelo masivo de 535B."

Resulta que Percy Liang @percyliang, profesor de Stanford y fundador de Simile AI, anunció que el Laboratorio Abierto Marin iniciará el entrenamiento del modelo Marin 535B-A23B, y todo el proceso de entrenamiento se realizará de forma pública y en tiempo real.

Marin cuenta con 535 mil millones de parámetros totales y 23 mil millones de parámetros activos. Para ello, Percy Liang y su equipo han preparado un total de 18.75 billones de tokens de datos de entrenamiento, y han desplegado 11 sistemas GB200 NVL72, equivalentes a unos 792 GPUs GB200.

Se estima que el modelo se entrenará de forma continua durante unos 3 meses, con un cómputo total de entrenamiento de aproximadamente 2.7e24 FLOPs. Una vez completado el entrenamiento, el equipo continuará con la fase de post-entrenamiento (post-training).

En otras palabras: en los próximos meses, cualquiera podrá observar cómo un modelo de vanguardia crece desde cero.

Otro punto a destacar es que Percy Liang mencionó que, antes de iniciar oficialmente esta tarea de entrenamiento, el equipo ya había entrenado una "Escalera de Escalado" (Scaling Ladder) de 4 etapas, desde 1.6B-A61M (48B tokens) hasta 27.7B-A1.2B (926B tokens).

"Esto tiene dos propósitos: primero, usar estos experimentos a pequeña escala para detectar y depurar problemas potenciales con anticipación; segundo, predecir el rendimiento de nuestro 'entrenamiento principal' (hero run) basándonos en el desempeño de los modelos a diferentes escalas."

Por supuesto, Percy Liang también señaló: "Este es el entrenamiento a mayor escala que hemos realizado hasta ahora, por lo que, efectivamente, esperamos que ocurran algunas situaciones inesperadas durante el proceso."

Actualmente, el modelo principal ya está en funcionamiento y cualquiera puede ver las curvas de entrenamiento en tiempo real. Posteriormente, los datos de entrenamiento, los registros de experimentos y los problemas de ingeniería también se harán públicos de manera continua.

Por ejemplo, a nivel de datos: la proporción de mezcla de datos de entrenamiento, los métodos de procesamiento de datos y cómo ingresan los datos de diferentes dominios al modelo. A nivel de ingeniería: la configuración del entrenamiento, el código y el diseño experimental. En el proceso de entrenamiento: el cambio de la pérdida (loss) en tiempo real, el estado del modelo y los resultados predictivos en diferentes etapas.

Simultáneamente, Percy Liang también hizo públicos los canales específicos para seguir el proceso.

Ver la composición de los datos: https://storage.googleapis.com/marin-public/held/harrier-k40-cluster-overview/2026.08.18/index.html?revision=uniform-sampling

Seguir el entrenamiento en tiempo real en Weights & Biases (wandb): https://wandb.ai/marin-community/marin_moe/reports/535B-A23B-18T-Token-Hero-Run-Scaling-Ladder--VmlldzoxNzc2MDM5Ng

Ver todos los detalles en GitHub: https://github.com/marin-community/marin/issues/8435

Tras analizar los detalles, es fácil entender por qué esta iniciativa de Percy Liang ha despertado tanto interés. Porque en el pasado, para modelos como GPT-4, Claude o Gemini, no se sabía exactamente cómo se entrenaban detrás de bastidores; eran como "cajas negras".

Solo se podían ver las capacidades finales del modelo, las puntuaciones en benchmarks y algunas descripciones en artículos. Pero aspectos como la proporción de los datos, en qué falló el entrenamiento, qué hiperparámetros fueron efectivos, cómo cambiaba la pérdida, o si las leyes de escalado (Scaling laws) se predecían con precisión, eran desconocidos.

Marin está intentando cambiar esto. Quizás, el entrenamiento de modelos también puede ser como los artículos científicos o el software de código abierto: observable, debatible y colaborativo.

Desde que se anunció esta noticia, el entusiasmo de los usuarios en línea no ha dejado de crecer.

Algunos usuarios opinan que este es el verdadero espíritu del código abierto: "incluso si surgen problemas durante el entrenamiento o se desvía de lo esperado, no se oculta nada."

Otros usuarios señalan que, aunque el propio modelo a entrenar ya es enorme, lo realmente impresionante es que ahora cualquiera pueda observar, a través de la plataforma WandB y en tiempo real, cómo crece paso a paso un modelo a una escala que vale miles de millones de dólares.

"Es como si la 'sala oscura' cerrada dentro de los principales laboratorios de IA se abriera de repente, permitiendo que todos vean lo que está sucediendo allí dentro."

Y en los próximos tres meses, lo más interesante tal vez no sea la capacidad final del modelo, sino observar cuántas "explosiones", colapsos y situaciones inesperadas experimentará este modelo durante su entrenamiento...

Además, algunos usuarios también creen que esta iniciativa no solo ofrece una perspectiva para observar todo el proceso de entrenamiento, sino que incluso proporciona una plataforma para aprender e intercambiar ideas.

El usuario James Thewlis @jdthewlis ha estado siguiendo el proceso de entrenamiento en tiempo real. En un momento, no entendía "¿por qué alrededor del step 500 aproximadamente, las normas (norms) de los parámetros muestran un pico?"

Después de investigarlo por su cuenta, se respondió a sí mismo en los comentarios: "Este pico está completamente causado por el sesgo del enrutador (router_bias). No es un parámetro obtenido a través del entrenamiento por gradiente, sino parte de un mecanismo heurístico de equilibrio de tokens (token balancing heuristic) en el modelo MoE (Mixture of Experts). Por lo tanto, tiene una dinámica diferente a la de los parámetros normales del modelo."

Hay muchos casos similares a este.

Además, vale la pena mencionar que Percy Liang, como profesor de Stanford, además de esta práctica concreta, también imparte un curso teórico: "CS336: Modelos de Lenguaje Desde Cero" (Language Models From Scratch), cuyo objetivo es que los estudiantes comprendan completamente cómo se construye un modelo de lenguaje grande.

Parece que Percy Liang realmente quiere enseñar a todos a "construir" modelos grandes. Los usuarios interesados pueden echarle un vistazo.

Enlace al curso: https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

¿Y tú? ¿Qué opinas sobre esta transmisión en vivo que literalmente lleva el entrenamiento de modelos grandes al escenario público? ¡Bienvenido a dejar tus comentarios!

Referencias:

https://x.com/MaxForAI/status/2091270116067750089

https://x.com/percyliang/status/2090918065634684997

https://x.com/CopyRebeldia/status/2091231950774112412?s=20

https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

Este artículo proviene de la cuenta oficial de WeChat "机器之心" (ID: almosthuman2014), autor: 关注AI的.

Preguntas relacionadas

Q¿Qué proyecto está realizando el profesor Percy Liang de Stanford y qué lo hace excepcional?

AEl profesor Percy Liang de Stanford está dirigiendo el entrenamiento del modelo Marin 535B-A23B. Lo excepcional es que todo el proceso de entrenamiento de este modelo de gran tamaño (con 535 mil millones de parámetros) se está transmitiendo en vivo y es completamente público, permitiendo que cualquiera lo observe en tiempo real.

Q¿Cuáles son los recursos computacionales utilizados para entrenar el modelo Marin 535B-A23B?

APara entrenar el modelo Marin 535B-A23B, el equipo ha desplegado 11 sistemas GB200 NVL72, lo que equivale a aproximadamente 792 GPUs GB200. El cálculo total de entrenamiento estimado es de unos 2.7e24 FLOPs, y se utilizarán 18.75 billones de tokens de datos de entrenamiento.

Q¿Qué significa que el entrenamiento del modelo sea como 'abrir una caja negra' según el artículo?

ASignifica que, a diferencia de modelos como GPT-4 o Claude, cuyos procesos de entrenamiento son secretos y parecen una 'caja negra', el proyecto Marin hace público todo: la proporción de los datos, los fallos durante el entrenamiento, los hiperparámetros efectivos, los cambios en la pérdida (loss), etc. Esto permite observar, discutir y colaborar en el proceso de entrenamiento de un modelo de vanguardia.

Q¿Qué plataformas o canales ha proporcionado Percy Liang para que el público pueda seguir el entrenamiento?

APercy Liang ha proporcionado varios canales públicos: se puede ver la composición de los datos en un enlace de almacenamiento de Google, observar el proceso de entrenamiento en tiempo real en la plataforma Weights & Biases (wandb), y consultar todos los detalles en un repositorio de GitHub.

QAdemás del proyecto de entrenamiento en vivo, ¿qué otra iniciativa educativa relacionada menciona el artículo sobre Percy Liang?

AEl artículo también menciona que Percy Liang imparte un curso teórico en Stanford llamado 'CS336: Language Models From Scratch' (Modelos de Lenguaje Desde Cero). El objetivo del curso es que los estudiantes comprendan completamente cómo se construye un modelo de lenguaje grande. Además, hay una lista de reproducción pública disponible en YouTube.

Lecturas Relacionadas

Análisis cuantitativo de EIP-8363: Al reducir los "subsidios" de staking, ¿qué quiere recuperar Ethereum?

**Resumen del análisis del EIP-8363 (Ethereum)** El EIP-8363 propone quemar progresivamente las recompensas de staking, reduciendo drásticamente las emisiones de ETH. El análisis cuantifica su impacto clave: 1. **Contexto crítico**: La quema de tarifas (EIP-1559) es ineficaz, reducida en un 98% desde 2022. Controlar las emisiones es ahora la única palanca para la política monetaria de Ethereum. 2. **Impacto real (en niveles actuales)**: La propuesta reduciría las emisiones anuales en un ~58.6%, no a cero. El APR del staking caería un ~56.4%, preservando unos $1.55B anuales del valor de la oferta. 3. **Equilibrio automático**: El diseño es autolimitante. Con una rentabilidad mínima del 2%, el sistema se estabilizaría en una tasa de staking del ~26% y una inflación anual del ~0.5%. 4. **¿Afecta al precio?**: No se detecta una relación estadística significativa entre los cambios en el rendimiento del staking y los movimientos del precio de ETH. Un vínculo débil podría existir con la tasa neta de emisión. 5. **Consecuencias para DeFi**: * **Staking líquido (LST)**: Protocolos como Lido perderían una parte significativa de sus ingresos por comisiones. * **Colateral**: Las LST mantendrían su utilidad como colateral superior, pero el "staking apalancado" podría volverse inviable. 6. **Conclusión**: El debate va más allá de la seguridad de la red. Esencialmente, la propuesta redistribuye una riqueza anual de ~$1.55B desde los stakers (un grupo concentrado) hacia todos los tenedores de ETH (el grupo disperso). Esto explica la intensa oposición de los intermediarios del ecosistema de staking. El análisis concluye con una visión moderadamente positiva para ETH (menos presión de venta estructural), pero negativa para los intermediarios de staking, y anticipa que la propuesta probablemente será rechazada por la política de gobernanza.

marsbitJusto ahora

Análisis cuantitativo de EIP-8363: Al reducir los "subsidios" de staking, ¿qué quiere recuperar Ethereum?

marsbitJusto ahora

Los Validadores de TON Preparan la Actualización de Nodos Antes de la Votación del Colador

Los validadores de TON han recibido instrucciones para actualizar su software de nodo (commit 140320b) y la herramienta mytonctrl (commit 7e90e26) antes de una votación de configuración programada para el 21 de agosto a las 08:00 UTC. Esta votación está vinculada a la nueva arquitectura de coladores de la red. Es crucial destacar que este proceso se encuentra en fase de preparación y votación. No debe describirse como una activación completa de los coladores a menos que la votación finalice y el cambio de configuración se lleve a cabo con éxito. La actualización es significativa porque la arquitectura de coladores puede afectar la producción de bloques y las responsabilidades de los validadores a medida que la red escala. La coordinación de los validadores es fundamental para cualquier actualización de blockchain. Una preparación incorrecta podría provocar retrasos o comportamiento inconsistente en la red. Para TON, la introducción de coladores es parte de su esfuerzo por mejorar el rendimiento y la escalabilidad, un componente técnico clave para su ambición de ser una blockchain de alto rendimiento dentro del ecosistema de Telegram. Los próximos pasos consisten en confirmar el resultado de la votación y la transición de configuración. El mercado debe esperar a la confirmación del estado final de activación antes de considerar la actualización como completa.

bitcoinistHace 7 min(s)

Los Validadores de TON Preparan la Actualización de Nodos Antes de la Votación del Colador

bitcoinistHace 7 min(s)

La concentración de deuda de Aave plantea dudas de riesgo tras la volatilidad de Ethereum

El perfil de deuda de Aave atrae atención tras una evaluación de riesgo que reveló que menos del 9% de las posiciones de préstamo representan aproximadamente la mitad de la deuda total pendiente del protocolo. Esta concentración se vincula principalmente a usuarios del modo E que utilizan posiciones apalancadas con préstamos de WETH respaldados por activos de *staking* líquido. La reciente volatilidad de Ethereum puso de relieve los riesgos, ya que estas operaciones correlacionadas pueden volverse vulnerables en condiciones de mercado rápidas. No se trata de insolvencia ni de una cascada de liquidaciones, sino de un riesgo de concentración y correlación que puede hacer que partes del protocolo sean más sensibles a los movimientos bruscos del ETH. El modo E de Aave, diseñado para activos correlacionados, permite un endeudamiento más eficiente pero también puede aumentar el apalancamiento. Si la correlación supuesta se debilita o la liquidez empeora, las posiciones podrían acercarse a la liquidación más rápido de lo esperado. El riesgo subraya la importancia de la supervisión, ya que la concentración en grandes posiciones con colateral similar puede magnificar la presión de venta o la tensión de liquidez durante una corrección rápida. Aave, como protocolo descentralizado, gestiona el riesgo a través de colaterales, parámetros de liquidación y oráculos, pero la concentración de deuda puede hacer que los eventos de estrés sean más no lineales. La gobernanza de Aave podría revisar parámetros como factores de colateral o configuraciones del modo E para equilibrar la demanda de los usuarios con la seguridad del protocolo. Por ahora, la señal es de precaución, no de pánico, pero la concentración de apalancamiento vinculado al ETH en un mercado clave como Aave es un riesgo que merece vigilancia.

bitcoinistHace 17 min(s)

La concentración de deuda de Aave plantea dudas de riesgo tras la volatilidad de Ethereum

bitcoinistHace 17 min(s)

Trading

Spot
活动图片