¿¡Qué?!
GPT-5.6 Sol, resulta ser un «maestro visual» oculto.
Recientemente, la organización de evaluación visual independiente Roboflow sometió a la «familia completa» de GPT-5.6 a su propio benchmark de VLM.

Las pruebas consistían en tareas muy prácticas: encontrar objetos, contar objetos, reconocer texto, extraer información.
Solo en la tarea de detección de objetos, la generación anterior GPT-5.5 obtuvo 13.8 puntos. Esta puntuación, en el mundo de los modelos visuales, básicamente equivale a entregar un examen en blanco.
Esta vez, Sol alcanzó los 46.2, más del triple.
SkalskiP, director del proyecto en Roboflow, declaró directamente: «¡GPT-5.6 Sol es el modelo visual más potente que OpenAI ha creado hasta ahora!»

GPT-5.6 «Super Size», el modelo visual más potente de OpenAI
Históricamente, la detección de objetos ha sido el punto débil de la serie GPT. La tarea es simple: que el modelo delimite con un recuadro cada objeto en una imagen.
El rendimiento de la generación anterior, GPT-5.5, era básicamente equivalente a «sabe que hay algo en la imagen, pero dónde poner el recuadro es pura adivinanza».
La puntuación de GPT-5.6 Sol se disparó directamente a 46.2, más del triple.
Lo más interesante es que Terra y Luna le siguen de cerca, con 44.7 y 43.3 respectivamente.
Vale la pena mencionar que Luna es el modelo más económico de esta generación, y su puntuación en detección igualmente deja muy atrás a la gama alta de la generación anterior.
En cuanto al conteo, las puntuaciones también subieron.
La precisión de Sol aumentó del 64.9% de GPT-5.5 al 73%, mientras que Terra y Luna obtuvieron 67.6% y 66.2% respectivamente.


Entonces, ¿en qué es específicamente fuerte GPT-5.6?
El reconocimiento de diseño de documentos es lo más destacado: títulos, cuerpo de texto, tablas, ilustraciones, firmas; Sol puede delimitarlos todos de manera limpia.
Esto no es una cuestión menor para quienes trabajan con contratos, facturas o informes: casi todos los flujos de procesamiento de documentos comienzan primero identificando «qué parte mirar», y luego reconociendo el texto.

Incluso en escenarios densos, GPT-5.6 aguantó el tipo.
Imágenes con docenas de objetos idénticos apretados, como pastillas o huevos, son el clásico escenario de fracaso para los VLM.
Porque un modelo grande al dibujar recuadros va emitiendo coordenada por coordenada; cuantos más objetos, más larga es la salida, y mayor la probabilidad de omitir, repetir o escribir mal las coordenadas.


E incluso hubo algo más complicado: una diana, donde solo debía contar los agujeros de bala que cayeron en una región de puntuación específica.
Sol lo hizo bien directamente, no solo sabía qué contar, sino también hasta dónde aplicaba la regla.
Hay que admitir que el progreso en este aspecto es real y tangible.


¿Multiusos? No existe
La parte más contraintuitiva está aquí: la capacidad de reconocimiento de texto de Sol ha retrocedido.
En la transcripción completa de texto mediante OCR, Sol obtuvo un 90.7%, medio punto menos que el 91.2% de GPT-5.5, la diferencia no es grande.
Pero en el ítem «extracción dirigida», donde no se quiere el texto completo, solo una información específica, como extraer la fecha de una factura, Sol solo logró un 82.5%, mientras que GPT-5.5 obtuvo un 87.6%, una caída de 5 puntos.
No es que no reconozca texto. Puede transcribir párrafos completos de notas manuscritas, puede identificar con precisión una fecha, puede leer el número de tamaño impreso en el flanco sucio de un neumático.
Además, en la transmisión en vivo de un partido de hockey sobre hielo, puede devolver el marcador en tiempo real en el formato que le indiques.
Lo que falló fue la fecha de caducidad en el blíster de medicamentos: letra pequeña, en vertical, bajo contraste y con reflejos.




Un modelo capaz de entender la transmisión de un partido, pero incapaz de leer cuándo caduca esa caja de medicamentos que tienes en la mano.


OpenAI lo admite, con imágenes grandes los recuadros se desvían
En algunas imágenes, los recuadros de detección devueltos por Sol se desvían hacia áreas completamente irrelevantes de la escena.
Con casi cero superposición con el objeto real, y estos recuadros a menudo se alinean de manera anormalmente ordenada: en una línea recta, o en un grupo uniformemente distribuido.
Roboflow envió estos ejemplos a OpenAI. La respuesta de la empresa fue clara: Sol se vuelve inestable cuando el tamaño de la imagen alcanza aproximadamente 2000×2000 píxeles o más, y cuanto más bajo sea el nivel de inferencia configurado, más inestable será.
Hay dos soluciones. La primera es aumentar el nivel de inferencia, se estabiliza, pero el uso de tokens, la latencia y la facturación suben junto con él.
La segunda es la más simple y también la más efectiva: antes de enviar la imagen a la API, reducirla o recortarla.

Ahora, veamos la factura general, el costo y la velocidad medidos por Roboflow:
Sol: aprox. 2.5 centavos de dólar por imagen, aprox. 10 segundos; Terra: aprox. 1 centavo por imagen, aprox. 6 segundos; Luna: menos de 0.5 centavos por imagen, aprox. 5 segundos.
Mientras que Gemini 3.5 Flash cuesta 0.8 centavos por imagen, dos tercios más barato que Sol, y en este benchmark específico continúa liderando en detección y conteo.
Frente a tareas de detección y conteo de alto volumen y alta frecuencia, Gemini Flash sigue siendo el «rey de la relación calidad-precio».
Así que, lo que realmente sorprende de GPT-5.6 Sol esta vez, es que sus capacidades visuales están pasando de «entender una imagen» a «realizar tareas visuales reales».

Encontrar objetivos, dibujar recuadros, contar, comprender relaciones espaciales, desglosar el diseño de documentos.
Estos territorios que antes parecían más propios de modelos visuales especializados, ahora están siendo gradualmente «devorados» por los modelos grandes.
La segunda mitad del partido de los modelos visuales grandes ya ha pasado de «¿puede entender?» a competir en «¿qué tan precisa es su ejecución?».
GPT-5.6 ha mostrado sus músculos, pero la guerra por la relación calidad-precio acaba de comenzar.
Este artículo proviene del WeChat Official Account "新智元" (Nueva Era de la Inteligencia), autor: Apocalipsis ASI







