Quoi?!
GPT-5.6 Sol s'avère être un « maître de la vision » caché.
Récemment, l'organisme tiers d'évaluation visuelle Roboflow a testé toute la « gamme » GPT-5.6 sur son propre benchmark VLM.

Les tests portaient sur des tâches très concrètes : trouver des objets, compter des objets, reconnaître du texte, extraire des informations.
Rien que sur la détection d'objets, la génération précédente GPT-5.5 n'a obtenu que 13,8 points. Un score qui, dans le monde des modèles visuels, équivaut presque à une copie blanche.
Cette fois, Sol est monté à 46,2, plus du triple.
SkalskiP, responsable du projet Roboflow, a déclaré sans ambages : « GPT-5.6 Sol est le modèle visuel le plus puissant qu'OpenAI ait jamais produit » !

GPT-5.6 « Maxi Format », l'IA visuelle la plus forte d'OpenAI
La détection d'objets a toujours été le point faible de la série GPT. La tâche est simple : il s'agit de demander au modèle d'encadrer chaque élément sur une image.
Les performances de la génération précédente, GPT-5.5, équivalaient à peu près à « savoir qu'il y a quelque chose sur l'image, mais deviner où le cadrer ».
Le score de GPT-5.6 Sol a directement grimpé à 46,2, plus du triple.
Plus intéressant encore, Terra et Luna suivent de près, avec respectivement 44,7 et 43,3.
Il est à noter que Luna est l'option la moins chère de cette génération, mais son score en détection écrase tout de même le modèle phare de la génération précédente.
En matière de comptage, les scores ont également augmenté.
La précision de Sol est passée de 64,9 % pour GPT-5.5 à 73 %, tandis que Terra et Luna atteignent respectivement 67,6 % et 66,2 %.


Alors, en quoi GPT-5.6 est-il particulièrement fort ?
La reconnaissance de mise en page de documents est la plus brillante : titres, corps de texte, tableaux, illustrations, signatures, Sol peut les encadrer proprement.
Ce n'est pas une mince affaire pour ceux qui traitent des contrats, factures ou rapports : la première étape de presque tous les pipelines de traitement de documents est de trouver « quelle partie regarder », avant de reconnaître le texte.

Même les scènes denses, GPT-5.6 les gère.
Les images de comprimés, d'œufs où des dizaines d'objets identiques sont entassés sont traditionnellement des pièges pour les VLM.
Car quand un grand modèle dessine des cadres, il génère des coordonnées numériques une par une. Plus il y a d'objets, plus la sortie est longue, et plus la probabilité d'en oublier, de se répéter, ou de se tromper dans les coordonnées est élevée.


Et il y a même des cas plus coriaces : une cible de tir, en ne demandant de compter que les impacts dans une zone de score spécifique.
Sol a réussi directement. Il sait non seulement quoi compter, mais aussi jusqu'où s'appliquent les règles.
Il faut dire que les progrès dans ce domaine sont tangibles.


Tout-terrain ? Ça n'existe pas
Le plus contre-intuitif est ici : la capacité de Sol à lire le texte a régressé.
Pour la transcription OCR de paragraphes entiers, Sol obtient 90,7 %, soit un demi-point de moins que les 91,2 % de GPT-5.5, la différence est mineure.
Mais pour l'« extraction ciblée » – ne pas vouloir le texte entier, juste une information spécifique, comme extraire la date d'une facture – Sol n'a obtenu que 82,5 %, contre 87,6 % pour GPT-5.5, une baisse de 5 points.
Ce n'est pas qu'il ne lit pas. Il peut transcrire des notes manuscrites en paragraphes, et en extraire correctement la date. Il peut lire le numéro de taille imprimé sur le flanc sale d'un pneu.
Il peut aussi restituer le score en direct d'un match de hockey sur glace en direct, dans le format que vous spécifiez.
L'échec porte sur la date de péremption d'une plaquette de médicaments : petits caractères, disposition verticale, faible contraste, et reflets.




Un modèle capable de comprendre les images d'une retransmission sportive, mais incapable de lire la date de péremption de votre boîte de médicaments.


OpenAI l'admet, les cadres dérivent sur les grandes images
Sur certaines images, les cadres de détection retournés par Sol peuvent dériver vers des endroits totalement sans rapport avec le contenu de la scène.
Avec un chevauchement quasi nul avec les objets réels, et ces cadres sont souvent alignés de manière anormalement régulière : une ligne droite, ou un groupe uniformément réparti.
Roboflow a envoyé ces exemples à OpenAI. Leur réponse a été directe : Sol devient instable lorsque la taille de l'image atteint environ 2000×2000 pixels ou plus, et plus le niveau d'inférence est bas, plus l'instabilité est grande.
Il y a deux solutions. La première est d'augmenter le niveau d'inférence. C'est plus stable, mais la consommation de tokens, la latence et la facture augmentent toutes en conséquence.
La seconde est la plus simple et la plus efficace : avant d'envoyer l'image à l'API, la réduire d'abord ou la recadrer.

Voyons maintenant le coût global et la vitesse, selon les tests pratiques de Roboflow :
Sol : environ 2,5 cents/image, environ 10 secondes ; Terra : environ 1 cent/image, environ 6 secondes ; Luna : moins de 0,5 cent/image, environ 5 secondes.
Tandis que Gemini 3.5 Flash coûte 0,8 cent par image, deux tiers moins cher que Sol, et continue de mener sur cette batterie de tests en détection et comptage.
Face aux tâches de détection et de comptage à haute fréquence et en gros volume, Gemini Flash reste le « roi du rapport qualité-prix ».
Donc, ce qui est vraiment surprenant avec GPT-5.6 Sol cette fois, c'est que ses capacités visuelles sont en train de passer de « comprendre une image » à « réellement accomplir des tâches visuelles ».

Trouver des cibles, dessiner des cadres, compter, comprendre les relations spatiales, décomposer la mise en page de documents.
Ces domaines qui relevaient autrefois plutôt des modèles visuels spécialisés sont aujourd'hui progressivement grignotés par les grands modèles. Petit à petit .
La seconde moitié du match pour les grands modèles visuels est déjà passée de « est-ce qu'ils peuvent comprendre » à « est-ce qu'ils travaillent avec précision ».
GPT-5.6 a montré ses muscles, mais la guerre du rapport qualité-prix ne fait que commencer.
Cet article provient du compte public WeChat « Xin Zhi Yuan », auteur : ASI Apocalypse







