¿La IA empieza a generar asimetría de información?
En la madrugada del 14 de agosto, OpenAI, en conjunto con el fabricante de chips de IA Cerebras, anunció oficialmente la vista previa de un nuevo nivel de servicio para su modelo insignia GPT-5.6 Sol: el «Modo Ultrafast» (Modo Ultra Rápido).
En este modo, la velocidad de generación de GPT-5.6 Sol puede alcanzar hasta 750 tokens por segundo, lo que supone una mejora de hasta 14 veces en comparación con la línea base de inferencia del modo «Standard» (Estándar), que es de aproximadamente 53 tokens/s, sin ninguna pérdida de calidad. En una comparación horizontal, GPT-5.6 Sol acelerado es 11 veces más rápido que Fable 5 y 5 veces más rápido que Opus 4.8 en su modo Fast.
El modo Ultrafast se lanzará primero en la API de OpenAI y actualmente ya está disponible en una versión de vista previa limitada para algunos clientes.

Para ello, OpenAI y Cerebras han creado una tabla comparativa de la velocidad e inteligencia actuales de los modelos de IA grandes más avanzados, donde GPT-5.6 Sol Ultrafast ocupa una posición de absoluto liderazgo:

En el blog de Cerebras, el equipo de ingeniería describió las pruebas realizadas en el «Examen Final de la Humanidad» (Humanity's Last Exam, HLE), donde compararon el modelo acelerado con sus competidores directos. Como sabemos, el HLE es un benchmark desafiante que contiene 2500 preguntas, típicamente solo respondibles por doctores en campos como química, economía o literatura.
GPT-5.6 Sol en modo Ultrafast respondió a todas las preguntas en solo 11 horas y 11 minutos. Mientras que Claude Fable 5 necesitó 78 horas y 27 minutos, es decir, más de tres días de cálculo continuo para llegar a las mismas conclusiones. El modo Ultrafast de GPT completó la frontera del conocimiento humano en un solo día laboral, con una precisión similar, siendo casi 7 veces más rápido que Claude Fable.

A medida que las capacidades de los modelos continúan mejorando, el alcance de la inferencia rápida también se ampliará. GPT-5.6 Sol es el mejor modelo de OpenAI hasta la fecha en tareas de documentación legal, modelos financieros e informes de ingeniería. En GDP-Val (un benchmark que mide tareas de trabajo de conocimiento con valor económico), Ultrafast logró una mejora de velocidad de extremo a extremo de 5.6 veces, sin afectar la calidad, demostrando plenamente cómo una velocidad de razonamiento más rápida puede acelerar el trabajo de valor económico.

El procesamiento más rápido de la IA añade muchas posibilidades a flujos de trabajo emergentes, permitiendo ahora desplegar agentes en la ruta crítica de los problemas. OpenAI enumera algunos casos de uso:
- Respuesta a incidentes y fiabilidad: cuando un sistema crítico falla, la IA analiza registros de aplicaciones, cambios recientes de código e informes de ingenieros para identificar posibles causas y ayudar a preparar soluciones mientras el fallo aún está ocurriendo.
- Investigación y seguridad financiera: analizar señales del mercado, evaluar operaciones e identificar actividades sospechosas en situaciones de mercado que cambian rápidamente.
- Soporte al cliente y voz: resolver problemas complejos de clientes en tiempo real, incluso cuando encontrar la respuesta requiere múltiples pasos o sistemas, sin interrumpir la conversación.
- Comercio: responder preguntas sobre productos, verificar inventario, personalizar recomendaciones y resolver problemas en la caja de pago mientras el comprador aún está indeciso, evitando que la indecisión se convierta en un carrito abandonado.
- Investigación y experimentación en tiempo real: convertir investigaciones que antes requerían una noche en sesiones de trabajo interactivas, permitiendo a los equipos probar ideas, revisar resultados, ajustar métodos y realizar otro experimento sin interrumpir el flujo de trabajo.
Internamente en OpenAI, los desarrolladores probaron GPT-5.6 Sol en modo Ultrafast. La respuesta a incidentes es un ejemplo de su uso. Cuando se activa una alerta, los ingenieros necesitan construir una imagen precisa del evento mientras los sistemas y la evidencia aún están cambiando. Con la inteligencia de nivel Sol, los equipos pueden leer rápidamente registros, analizar trazas, resumir conversaciones, determinar los próximos pasos de verificación y ayudar a preparar o validar soluciones. El modo Ultrafast acorta la demora entre observar una señal, verificar una hipótesis y elegir la siguiente acción, mientras los ingenieros siguen siendo responsables del juicio y la implementación.
En investigación, el equipo de OpenAI usa Ultrafast para buscar rápidamente en bases de conocimiento, consultar datos y recopilar, organizar y resumir información de diferentes herramientas de manera ágil. Un flujo común anterior en la investigación era que los miembros del equipo iniciaran un lote de experimentos por la noche y revisaran los resultados a la mañana siguiente. Con Ultrafast, el ciclo de descubrimiento se puede acortar, permitiendo múltiples iteraciones dentro de una jornada laboral.
El avance del modo Ultrafast radica en superar el cuello de botella del ancho de banda de memoria en la fase de decodificación de inferencia de modelos grandes en clústeres de GPU tradicionales. Su implementación depende principalmente de la arquitectura de hardware a nivel de oblea de Cerebras.

Entre los fabricantes de chips de IA, la solución de Cerebras es única: sus sucesivos chips están fabricados con obleas enteras, integrando una cantidad masiva de núcleos de computación y redes de interconexión ultrarrápidas en una sola pieza.
Las GPU tradicionales, al ejecutar la decodificación autoregresiva para generar tokens en modelos grandes, están limitadas por el ancho de banda de la memoria, necesitando transportar constantemente los enormes pesos del modelo entre la memoria HBM externa y los núcleos de computación; además, la división entre múltiples tarjetas introduce latencias de comunicación entre chips (PCIe/NVLink).
Mientras que cada chip de última generación de Cerebras a nivel de oblea (WSE-3) integra 4 billones de transistores, 125 petaflops de potencia de computación para IA y hasta 44 GB de SRAM ultrarrápida en el propio chip. Los parámetros del modelo residen directamente en la SRAM en el chip, que tiene un ancho de banda extremadamente alto, evitando los tiempos de espera por cargar repetidamente los pesos desde la memoria externa.
Por supuesto, GPT-5.6 Sol, como modelo insignia de vanguardia, tiene un número total de parámetros que claramente excede la capacidad de un solo chip. Cerebras también tiene un mecanismo de «paralelismo de pipeline a través de múltiples obleas» (Pipelined across wafers), que distribuye las diferentes capas de la red del modelo en múltiples obleas, manteniendo los parámetros de cada capa en la SRAM de su chip respectivo, permitiendo que los tokens se transmitan sin problemas entre obleas en un pipeline.
Para muchos usuarios de modelos grandes, una velocidad 14 veces mayor en el modelo insignia significa que muchas tareas que antes requerían cambiar a modelos secundarios (como Luna y Terra) ahora pueden ejecutarse con toda su potencia con confianza. Para tareas de Agente que requieren múltiples llamadas a herramientas, generación y depuración de código, y cadenas de pensamiento complejas, procesos que antes tomaban horas pueden comprimirse a minutos.
Una mayor velocidad quizás también signifique un cambio en nuestra forma de usar la IA:

En la comunidad de IA, la gente ya está esperando versiones Ultrafast para Luna y Terra, aunque no está claro si los chips de Cerebras serán suficientes.
Contenido de referencia:
https://openai.com/index/previewing-ultrafast/
https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai
Este artículo procede del WeChat Official Account «机器之心» (ID:almosthuman2014), autor: 关注大模型的机器之心







