GPT-5.6 llegará próximamente, con inferencia disparada a 750 tokens/s, y se rumorea que abarcará 100 obleas de silicio
**Resumen:**
OpenAI anunciará próximamente GPT-5.6 Sol, un modelo de IA con una velocidad de inferencia revolucionaria de 750 tokens/segundo. Lograda mediante una colaboración con Cerebras, esta velocidad permitirá interacciones en tiempo real para tareas complejas de agente. La clave reside en una implementación extrema: se estima que el modelo de ~3 billones de parámetros se ejecuta distribuido en 70-100 obleas (wafers) de silicio de Cerebras, asignando potencialmente una capa neuronal completa por oblea.
Este diseño exige una reestructuración del modelo, probablemente adoptando mecanismos de atención más ligeros o arquitecturas híbridas (como SSM) para minimizar la carga de la caché KV y aprovechar la memoria ultrarrápida de las obleas. El anuncio coincide con la revelación del primer chip de inferencia de IA diseñado por OpenAI, "Jalapeño", mostrando la ambición de la compañía de controlar toda la pila tecnológica, desde el modelo y el hardware hasta la implementación. Este movimiento marca un salto hacia la superación de los límites tradicionales entre el tamaño del modelo y la velocidad de respuesta.
marsbit07/09 11:57