De la noche a la mañana, GPT-5.6 Sol es acelerado 14 veces por OpenAI

marsbit发布于2026-08-14更新于2026-08-14

文章摘要

OpenAI y Cerebras han lanzado la vista previa del "Modo Ultrafast" para GPT-5.6 Sol, acelerando su velocidad de generación hasta 14 veces, hasta 750 tokens/segundo, sin pérdida de calidad. Este modo, ya disponible en versión limitada en la API, supera ampliamente a modelos rivales como Fable 5 y Opus 4.8 en velocidad. La mejora se basa en la arquitectura de obleas de Cerebras (WSE-3), que evita los cuellos de botella de la memoria de las GPU tradicionales al mantener los parámetros del modelo en SRAM dentro del chip. En pruebas como el "Examen Final de la Humanidad" (HLE), GPT-5.6 Sol Ultrafast completó 2500 preguntas complejas en solo 11 horas, siete veces más rápido que Claude Fable 5. Esta velocidad abre nuevas posibilidades en flujos de trabajo críticos: respuesta a incidentes en tiempo real, análisis financiero, soporte al cliente complejo, investigación interactiva y personalización comercial, permitiendo iteraciones rápidas donde antes se necesitaban horas o días. El avance permite usar el modelo de mayor capacidad para tareas que antes requerían modelos más pequeños, acelerando drásticamente procesos con agentes, llamadas a herramientas o razonamiento complejo, lo que podría transformar fundamentalmente cómo interactuamos con la IA.

¿La IA empieza a generar asimetría de información?

En la madrugada del 14 de agosto, OpenAI, en conjunto con el fabricante de chips de IA Cerebras, anunció oficialmente la vista previa de un nuevo nivel de servicio para su modelo insignia GPT-5.6 Sol: el «Modo Ultrafast» (Modo Ultra Rápido).

En este modo, la velocidad de generación de GPT-5.6 Sol puede alcanzar hasta 750 tokens por segundo, lo que supone una mejora de hasta 14 veces en comparación con la línea base de inferencia del modo «Standard» (Estándar), que es de aproximadamente 53 tokens/s, sin ninguna pérdida de calidad. En una comparación horizontal, GPT-5.6 Sol acelerado es 11 veces más rápido que Fable 5 y 5 veces más rápido que Opus 4.8 en su modo Fast.

El modo Ultrafast se lanzará primero en la API de OpenAI y actualmente ya está disponible en una versión de vista previa limitada para algunos clientes.

Para ello, OpenAI y Cerebras han creado una tabla comparativa de la velocidad e inteligencia actuales de los modelos de IA grandes más avanzados, donde GPT-5.6 Sol Ultrafast ocupa una posición de absoluto liderazgo:

En el blog de Cerebras, el equipo de ingeniería describió las pruebas realizadas en el «Examen Final de la Humanidad» (Humanity's Last Exam, HLE), donde compararon el modelo acelerado con sus competidores directos. Como sabemos, el HLE es un benchmark desafiante que contiene 2500 preguntas, típicamente solo respondibles por doctores en campos como química, economía o literatura.

GPT-5.6 Sol en modo Ultrafast respondió a todas las preguntas en solo 11 horas y 11 minutos. Mientras que Claude Fable 5 necesitó 78 horas y 27 minutos, es decir, más de tres días de cálculo continuo para llegar a las mismas conclusiones. El modo Ultrafast de GPT completó la frontera del conocimiento humano en un solo día laboral, con una precisión similar, siendo casi 7 veces más rápido que Claude Fable.

A medida que las capacidades de los modelos continúan mejorando, el alcance de la inferencia rápida también se ampliará. GPT-5.6 Sol es el mejor modelo de OpenAI hasta la fecha en tareas de documentación legal, modelos financieros e informes de ingeniería. En GDP-Val (un benchmark que mide tareas de trabajo de conocimiento con valor económico), Ultrafast logró una mejora de velocidad de extremo a extremo de 5.6 veces, sin afectar la calidad, demostrando plenamente cómo una velocidad de razonamiento más rápida puede acelerar el trabajo de valor económico.

El procesamiento más rápido de la IA añade muchas posibilidades a flujos de trabajo emergentes, permitiendo ahora desplegar agentes en la ruta crítica de los problemas. OpenAI enumera algunos casos de uso:

  • Respuesta a incidentes y fiabilidad: cuando un sistema crítico falla, la IA analiza registros de aplicaciones, cambios recientes de código e informes de ingenieros para identificar posibles causas y ayudar a preparar soluciones mientras el fallo aún está ocurriendo.
  • Investigación y seguridad financiera: analizar señales del mercado, evaluar operaciones e identificar actividades sospechosas en situaciones de mercado que cambian rápidamente.
  • Soporte al cliente y voz: resolver problemas complejos de clientes en tiempo real, incluso cuando encontrar la respuesta requiere múltiples pasos o sistemas, sin interrumpir la conversación.
  • Comercio: responder preguntas sobre productos, verificar inventario, personalizar recomendaciones y resolver problemas en la caja de pago mientras el comprador aún está indeciso, evitando que la indecisión se convierta en un carrito abandonado.
  • Investigación y experimentación en tiempo real: convertir investigaciones que antes requerían una noche en sesiones de trabajo interactivas, permitiendo a los equipos probar ideas, revisar resultados, ajustar métodos y realizar otro experimento sin interrumpir el flujo de trabajo.

Internamente en OpenAI, los desarrolladores probaron GPT-5.6 Sol en modo Ultrafast. La respuesta a incidentes es un ejemplo de su uso. Cuando se activa una alerta, los ingenieros necesitan construir una imagen precisa del evento mientras los sistemas y la evidencia aún están cambiando. Con la inteligencia de nivel Sol, los equipos pueden leer rápidamente registros, analizar trazas, resumir conversaciones, determinar los próximos pasos de verificación y ayudar a preparar o validar soluciones. El modo Ultrafast acorta la demora entre observar una señal, verificar una hipótesis y elegir la siguiente acción, mientras los ingenieros siguen siendo responsables del juicio y la implementación.

En investigación, el equipo de OpenAI usa Ultrafast para buscar rápidamente en bases de conocimiento, consultar datos y recopilar, organizar y resumir información de diferentes herramientas de manera ágil. Un flujo común anterior en la investigación era que los miembros del equipo iniciaran un lote de experimentos por la noche y revisaran los resultados a la mañana siguiente. Con Ultrafast, el ciclo de descubrimiento se puede acortar, permitiendo múltiples iteraciones dentro de una jornada laboral.

El avance del modo Ultrafast radica en superar el cuello de botella del ancho de banda de memoria en la fase de decodificación de inferencia de modelos grandes en clústeres de GPU tradicionales. Su implementación depende principalmente de la arquitectura de hardware a nivel de oblea de Cerebras.

Entre los fabricantes de chips de IA, la solución de Cerebras es única: sus sucesivos chips están fabricados con obleas enteras, integrando una cantidad masiva de núcleos de computación y redes de interconexión ultrarrápidas en una sola pieza.

Las GPU tradicionales, al ejecutar la decodificación autoregresiva para generar tokens en modelos grandes, están limitadas por el ancho de banda de la memoria, necesitando transportar constantemente los enormes pesos del modelo entre la memoria HBM externa y los núcleos de computación; además, la división entre múltiples tarjetas introduce latencias de comunicación entre chips (PCIe/NVLink).

Mientras que cada chip de última generación de Cerebras a nivel de oblea (WSE-3) integra 4 billones de transistores, 125 petaflops de potencia de computación para IA y hasta 44 GB de SRAM ultrarrápida en el propio chip. Los parámetros del modelo residen directamente en la SRAM en el chip, que tiene un ancho de banda extremadamente alto, evitando los tiempos de espera por cargar repetidamente los pesos desde la memoria externa.

Por supuesto, GPT-5.6 Sol, como modelo insignia de vanguardia, tiene un número total de parámetros que claramente excede la capacidad de un solo chip. Cerebras también tiene un mecanismo de «paralelismo de pipeline a través de múltiples obleas» (Pipelined across wafers), que distribuye las diferentes capas de la red del modelo en múltiples obleas, manteniendo los parámetros de cada capa en la SRAM de su chip respectivo, permitiendo que los tokens se transmitan sin problemas entre obleas en un pipeline.

Para muchos usuarios de modelos grandes, una velocidad 14 veces mayor en el modelo insignia significa que muchas tareas que antes requerían cambiar a modelos secundarios (como Luna y Terra) ahora pueden ejecutarse con toda su potencia con confianza. Para tareas de Agente que requieren múltiples llamadas a herramientas, generación y depuración de código, y cadenas de pensamiento complejas, procesos que antes tomaban horas pueden comprimirse a minutos.

Una mayor velocidad quizás también signifique un cambio en nuestra forma de usar la IA:

En la comunidad de IA, la gente ya está esperando versiones Ultrafast para Luna y Terra, aunque no está claro si los chips de Cerebras serán suficientes.

Contenido de referencia:

https://openai.com/index/previewing-ultrafast/

https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai

Este artículo procede del WeChat Official Account «机器之心» (ID:almosthuman2014), autor: 关注大模型的机器之心

热门币种推荐

相关问答

Q¿Qué es el modo Ultrafast de GPT-5.6 Sol anunciado por OpenAI y Cerebras?

AEl modo Ultrafast (ultra rápido) es un nuevo nivel de servicio de GPT-5.6 Sol que ofrece una velocidad de generación de tokens de hasta 750 tokens por segundo, lo que supone una aceleración de hasta 14 veces en comparación con el modo estándar, sin pérdida de calidad.

Q¿Qué hardware especial permite esta aceleración en el modo Ultrafast y cómo funciona?

ALa aceleración se logra utilizando los chips de obleas (Wafer Scale Engine, WSE-3) de Cerebras. Estos chips integran toda la oblea de silicio, con 4 billones de transistores y 44 GB de memoria SRAM en el propio chip, lo que evita los cuellos de botella de ancho de banda de memoria al mantener los parámetros del modelo en la SRAM de alta velocidad en lugar de cargarlos repetidamente desde la memoria externa.

Q¿Cuál fue el resultado del modelo en 'Humanity's Last Exam' (HLE) y cómo se compara con la competencia?

AEn el benchmark HLE (Humanity's Last Exam), GPT-5.6 Sol en modo Ultrafast respondió las 2500 preguntas en 11 horas y 11 minutos. En comparación, Claude Fable 5 necesitó 78 horas y 27 minutos, lo que hace que GPT-5.6 Sol sea aproximadamente 7 veces más rápido con una precisión similar.

Q¿Cuáles son algunas de las aplicaciones prácticas mencionadas para el modo Ultrafast de GPT-5.6 Sol?

ALas aplicaciones prácticas mencionadas incluyen: respuesta a incidentes y confiabilidad (analizar fallos en tiempo real), investigación financiera y seguridad (analizar señales de mercado), soporte al cliente y voz (resolver problemas complejos en tiempo real), comercio (personalizar recomendaciones durante la compra), e investigación y experimentación en tiempo real (acelerar ciclos iterativos de trabajo).

Q¿Cómo afecta la velocidad mejorada al uso de modelos de IA, según se sugiere en el artículo?

ALa velocidad mejorada significa que las tareas complejas que antes requerían cambiar a modelos secundarios o tomaban horas (como tareas de agente con múltiples llamadas a herramientas o pensamiento encadenado) ahora se pueden completar en minutos con el modelo principal a máxima potencia, cambiando potencialmente la forma en que interactuamos y dependemos de la IA para flujos de trabajo críticos.

你可能也喜欢

预测市场的价值、增长与风险

文章探讨了预测市场的巨大潜力、快速增长及伴随的监管与消费者保护问题。预测市场通过简单的“是/否”合约让用户对各种事件结果进行交易,价格直接反映市场认为的该结果发生概率。其核心价值在于提供高效的风险对冲工具和优于传统民调的概率预测,并能吸引用户进入平台,部分最终转化为长期投资者。以Robinhood为例,其预测市场收入已超过加密货币和股票交易。 增长主要由体育赛事(如世界杯)驱动,预测市场正在大量吸纳传统体育投注的用户和交易量。然而,这引发了严重的法律和监管争议。美国商品期货交易委员会(CFTC)认为事件合约属于其监管的衍生品,而许多州政府则视其为体育投注,应受州级监管并纳税,双方已展开多起诉讼。监管归属的模糊性带来了不确定性。 更突出的问题是消费者保护。数据显示,多数普通用户在预测市场中亏损,而专业交易者获利丰厚。平台营销方式(如推广高风险的“串关”投注)与传统投注平台类似,但针对问题性投注行为的保护措施(如年龄限制、自我排除机制)却主要依赖平台自律,而非法律强制要求,这可能导致消费者受损。 文章最后提出改进建议:将消费者保护机制内置于产品设计中,对体育类合约实施更严格的保护与税收,并利用预测市场的吸引力引导用户转向长期储蓄和投资产品,借鉴英国“有奖债券”的历史经验,将投机冲动转化为财务健康。 作者认为预测市场是“更好的市场”,但当前对普通消费者并不更友好。他呼吁平台、监管机构和州政府尽快合作,建立更完善的保护框架,以避免未来可能出现的严厉监管反弹,从而损害该市场的真正价值。

marsbit55分钟前

预测市场的价值、增长与风险

marsbit55分钟前

AI巨头实习生日薪揭秘:Anthropic超5000元,Kimi只能排第四梯队

2026年,AI行业实习生日薪差距悬殊。全球顶尖人才计划中,OpenAI Residency日薪约5625元,Anthropic AI Safety Fellows日薪约5198元,且后者每月额外提供1.5万美元算力经费。这些项目门槛极高,本质是“预招聘”。 美国科技大厂常规技术实习生薪资同样可观:Meta日薪约3780元,Google约3400元,英伟达美国均值约2106元(博士上限超5000元)。 国内巨头通过专项计划高薪抢夺顶尖人才:字节跳动Top Seed研究实习生日薪达2000元;小米相关顶尖实习岗位日薪在500-1100元区间。 相比之下,多数国内AI公司普通实习生薪资处于第二梯队:DeepSeek普通AGI实习生日薪500-1000元;字节普通研发实习生日薪500元;MiniMax、阿里巴巴、英伟达中国相关岗位日薪在350-800元;Kimi算法岗日薪400-450元;小米普通大模型实习生日薪300-400元;智谱AI最低,日薪200-300元,但其员工持股比例高,以期权作为重要补偿。 此前流传的“DeepSeek清华姚班实习生日薪5500元”仅为极端个例,非普遍标准。 分析指出,AI行业薪资“贫富分化”严重,中美大厂薪酬差距仍大。中国公司正以专项计划追赶顶尖人才待遇,而期权激励在该行业扮演着重要角色。行业最核心的竞争,依然是对顶尖人才的争夺。

Odaily星球日报1小时前

AI巨头实习生日薪揭秘:Anthropic超5000元,Kimi只能排第四梯队

Odaily星球日报1小时前

交易

现货

热门文章

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对SOL(SOL)币价的意见。

活动图片