Что?!
GPT-5.6 Sol оказался скрытым «мастером визуализации».
Недавно независимая организация по оценке визуальных моделей Roboflow прогнала всё «семейство» GPT-5.6 через собственный VLM-бенчмарк.

Тестировались самые практические задачи: поиск объектов, подсчёт, распознавание текста, извлечение информации.
Только по задаче обнаружения объектов предыдущее поколение GPT-5.5 набрало всего 13,8 балла. В мире визуальных моделей этот балл практически эквивалентен незаполненной работе.
Теперь же Sol достиг 46,2 — более чем в три раза выше.
Руководитель проекта Roboflow SkalskiP прямо заявил: «GPT-5.6 Sol — самая мощная визуальная модель OpenAI за всю историю»!

GPT-5.6 «супер-версия»: самый мощный визуальный ИИ OpenAI
Обнаружение объектов всегда было слабым местом серии GPT. Задача проста: заставить модель обвести каждый объект на изображении рамкой.
Результаты предыдущего GPT-5.5 были примерно такими: «знает, что на картинке что-то есть, но где рисовать рамку — чистая догадка».
Балл GPT-5.6 Sol взлетел до 46,2 — более чем в три раза.
Что ещё интереснее, Terra и Luna следуют сразу за ним: 44,7 и 43,3 соответственно.
Стоит отметить, что Luna — это самый бюджетный уровень в этом поколении, но её показатель обнаружения всё равно оставляет предыдущий флагман далеко позади.
В подсчёте объектов баллы также выросли.
Точность Sol выросла с 64,9% у GPT-5.5 до 73%, у Terra и Luna — 67,6% и 66,2% соответственно.


Так в чём же конкретно силён GPT-5.6?
Самым ярким аспектом является распознавание структуры документов: заголовки, основной текст, таблицы, иллюстрации, подписи — Sol может аккуратно обвести их все.
Это не мелочь для тех, кто работает с договорами, счетами, отчётами: почти на первом шаге любой обработки документов нужно сначала определить, «на что смотреть», а затем уже распознавать текст.

GPT-5.6 справился даже со сложными сценами.
Изображения, на которых десятки одинаковых объектов (таблетки, яйца) расположены близко друг к другу, — это традиционный провал для VLM.
Потому что для рисования рамок большая модель выдаёт цифры координат одну за другой; чем больше объектов, тем длиннее вывод, и выше вероятность пропустить, повторить или ошибиться в координатах.


А есть и ещё более сложные задачи: дана мишень, нужно подсчитать только пулевые отверстия, попавшие в определённую зону колец.
Sol сделал это правильно. Он не только понял, что нужно считать, но и разобрался, до каких пор действуют правила.
Нельзя не сказать, что прогресс в этой области вполне ощутим.


Универсальность? Не существует
Самое контринтуитивное здесь: способность Sol распознавать текст ухудшилась.
Полное распознавание текста (OCR): Sol показал 90,7%, что на полпроцента ниже, чем 91,2% у GPT-5.5, разница невелика.
Но в задаче «целевого извлечения», где нужна не полная расшифровка, а конкретная информация (например, вытащить дату из счёта), Sol справился лишь на 82,5%, в то время как GPT-5.5 — на 87,6%, падение на 5 процентных пунктов.
Не то чтобы он не распознаёт текст. Рукописные заметки он может расшифровать полностью, может точно выделить дату, может прочитать размер на номере, напечатанном на грязной дуге шины.
И ещё: снимок прямого эфира хоккейного матча с текущим счётом — он может выдать его в указанном вами формате.
Споткнулся он на сроке годности на блистере таблеток: мелкий шрифт, вертикальная ориентация, низкая контрастность, да ещё и блики.




Модель, которая может прочитать счёт в прямом эфире матча, но не может прочитать, когда истекает срок годности у лекарства в вашей руке.


OpenAI признаёт: рамки "уплывают" на больших изображениях
На некоторых изображениях рамки обнаружения, возвращаемые Sol, «уплывают» в совершенно не связанные с реальными объектами места.
Практически нулевое перекрытие с реальным объектом, причём эти рамки часто выстраиваются подозрительно ровно: прямая линия или равномерно распределённая группа.
Roboflow отправил эти примеры OpenAI. Ответ был прямолинеен: Sol становится нестабильным, когда размер изображения достигает примерно 2000×2000 пикселей или больше, и чем ниже уровень вычислительных ресурсов, тем сильнее нестабильность.
Есть два решения. Первое — повысить уровень вычислительных ресурсов. Стабильность возрастёт, но вместе с этим увеличатся расход токенов, задержка и счёт.
Второе — самое простое и эффективное: перед отправкой в API уменьшить изображение или обрезать его.

Теперь о стоимости. Фактические затраты и скорость по данным Roboflow:
Sol: примерно 2,5 цента/изображение, около 10 секунд; Terra: примерно 1 цент/изображение, около 6 секунд; Luna: менее 0,5 цента/изображение, около 5 секунд.
А Gemini 3.5 Flash стоит 0,8 цента за изображение, что на две трети дешевле Sol, и при этом по обнаружению и подсчёту в этом бенчмарке продолжает лидировать.
Для высокочастотных, массовых задач обнаружения и подсчёта Gemini Flash по-прежнему остаётся «королём соотношения цены и качества».
Таким образом, настоящей неожиданностью в GPT-5.6 Sol стало то, что его визуальные способности развиваются от «понимания изображения» до «реального выполнения визуальных задач».

Поиск объектов, рисование рамок, подсчёт, понимание пространственных отношений, разбор структуры документов.
Эти сферы, которые раньше были скорее территорией специализированных визуальных моделей, теперь постепенно «поглощаются» большими языковыми моделями.
Второй этап развития больших визуальных моделей сместился с «способен ли он понять» на «насколько точно он справляется с работой».
GPT-5.6 продемонстрировал свою мощь, но война за соотношение цены и качества только начинается.
Эта статья из WeChat-официального аккаунта «新智元» (Новая эпоха искусственного интеллекта), автор: ASI启示录.








