Ваше представление о генерации изображений по тексту всё ещё застряло на Nano Banana?
Но, дитя, времена снова изменились.

@johnAGI168 https://x.com/johnAGI168/status/2044781168151724067

@0115hippo https://x.com/0115hippo/status/2044722124611539160
В начале апреля на платформе оценки LM Arena появились три анонимные модели генерации изображений с кодовыми названиями maskingtape-alpha, packingtape-alpha и gaffertape-alpha. Через несколько часов они исчезли.
Официально OpenAI ещё не анонсировала эту модель, но, судя по метаданным, возвращаемым API, и записям тестов пользователей, у неё уже есть широко принятое название: GPT Image 2.

Скриншоты больше не могут быть доказательством
В последние годы одним из самых очевидных недостатков моделей генерации изображений ИИ был текст на картинках. Во времена DALL-E 3, если вы просили его написать «Hello» на изображении, вы могли получить «Hellp» или даже «Hl10», буквы выглядели так, словно они пьяны и шатаются. GPT Image 1 стал намного лучше, он мог обрабатывать простые английские надписи. К GPT Image 1.5 точность рендеринга английского текста достигла почти 95%, но всё ещё были заметные недостатки в нелатинских системах письма, таких как китайский, японский, корейский и другие.
А утекшие образцы изображений GPT Image 2 изменили это впечатление.


@MrLarus https://x.com/MrLarus/status/2044824800909054181


@akokoi1 https://x.com/akokoi1/status/2044789531615056175
Текст на картинках — какой должен быть, такой и есть. Китайские иероглифы чёткие, форма символов точная, черты полные. Кто-то тестировал генерацию изображения, похожего на удостоверение личности: имя, адрес, номер документа — всё было отрендерено правильно, вёрстка аккуратная, на первый взгляд похоже на фото реального документа.

Это хорошая новость. Прогресс в рендеринге текста означает, что генерация инфографики, плакатов, упаковки продуктов, сложно вёрстанных диаграмм стала более надёжной.
Но у медали есть и обратная сторона. Модель, способная генерировать достоверно выглядящие изображения в стиле удостоверений, точно рендерить скриншоты интерфейсов, естественно, делает утверждение «скриншот может быть доказательством» всё более сомнительным.
Для сравнения, это также является ключевым различием между серией GPT Image и другими моделями. Midjourney до сих пор не достиг никаких успехов в рендеринге текста, у серии Stable Diffusion тоже старые проблемы. Согласно утёкшим результатам тестов Arena, GPT Image 2 превзошёл Midjourney по четырём параметрам: рендеринг текста, следование инструкциям, фотореалистичность и знания о мире; преимущество последнего в основном сохраняется в художественных стилях и эстетическом контроле.

Знает ли он на самом деле, как выглядит этот мир?
Один тестировщик попросил модель сгенерировать страницу с гипотетическими ценами на продукт GPT-8. В результате получилось изображение, вёрстка которого действительно была в стиле сайта OpenAI, расположение кнопок и выбор шрифтов были похожи на скриншот реального интерфейса, иерархическая логика таблицы цен также была правильной.

GPT Image 2 может генерировать изображения, чрезвычайно похожие на реальные программные интерфейсы, включая окна браузера, интерфейсы мобильных приложений, диаграммы для визуализации данных, — уровень достоверности несравним с продуктами предыдущего поколения.

@johnAGI168 https://x.com/johnAGI168/status/2044781168151724067

@levelsio https://x.com/levelsio/status/2040333489476681758
Это приведёт к некоторым很有意思的实际用途. Дизайнеры при создании прототипов продуктов не должны сначала открывать Figma и рисовать кучу框架, они могут直接用文字描述想要的界面, и на выходе得到参考图 для обсуждения с командой. При создании инвесторской презентации (Deck) можно показать «скриншот продукта», не дожидаясь, пока инженер напишет код. При написании документации примеры интерфейсов для иллюстрации можно генерировать напрямую, не думая, откуда брать скриншоты для пустой страницы.



@marmaduke091 https://x.com/marmaduke091/status/2040338311873515597
Генерация изображений — это уже не просто «генерация изображений»
OpenAI уже объявила, что DALL-E 2 и DALL-E 3 официально прекратят работу 12 мая 2026 года. DALL-E 3 в Azure OpenAI был снят с эксплуатации досрочно в феврале.
DALL-E для многих стало первым местом знакомства с генерацией изображений ИИ, от тех размытых ранних работ до сегодняшнего дня прошло всего несколько лет.
В то же время Google, которая только в начале 2026 года утвердила своё лидерство в отрасли с помощью Nano Banana Pro, возможно, почувствует давление. Согласно ранним отчётам о тестировании, GPT Image 2 одновременно превзошёл Nano Banana Pro по трём параметрам: реалистичность, рендеринг текста и знания о мире — такая тройная победа встречается нечасто.
Для создателей ощущения сложные. Иллюстраторы, графические дизайнеры, фотографы — это уже не в первый раз сталкиваются с этой темой. С момента выпуска GPT Image 1 количество вакансий внештатных графических дизайнеров сократилось примерно на 18%. ИИ в некоторых сценариях действительно заменяет решение «я найму человека для этого дела», но он также создаёт новые способы работы, позволяя одному человеку делать больше.
Скорость эволюции моделей генерации изображений уже не оставляет много времени на адаптацию. От запуска GPT Image 1 до версии 1.5 прошло всего несколько месяцев. От 1.5 до 2 — примерно полгода. Каждое поколение решает ключевые недостатки предыдущего, одновременно открывая новые возможности.
GPT Image 2 сейчас находится на этапе A/B-тестирования, некоторые пользователи ChatGPT уже случайным образом получили доступ. Окно официального выпуска, по общим прогнозам, придётся на период около мая, когда DALL-E будет снят с эксплуатации. Если хотите испытать его заранее, в настоящее время можно попытать удачу на платформе оценки LM Arena.

Адрес для тестирования: https://arena.ai
Согласно отзывам сообщества и известным преимуществам этой модели, следующие шаблоны промптов могут максимально повысить ваши шансы на успех:
Промпт для UI/скриншотов: Фотографически реалистичный скриншот мобильного банковского приложения, чётко отображающий историю транзакций, где дата, сумма и название merchantа чётко различимы. Экран iPhone 16, естественное держание телефона в руке, фон кофейни.
Промпт для этикетки продукта: Фотографическое изображение бутылки крафтового пива, детали этикетки чёткие, отображается название пивоварни «Oakridge Brewing Co.», крепость алкоголя 6.8%, логотип с горами и список ингредиентов. Студийное освещение, белый фон.
Промпт для вывесок/неона: Фотография ночной улочки в Токио, видны多处 вывески с неоновой подсветкой на японском и английском языках, включая вывеску рамэн-ресторана с надписью «Ichiban Ramen — Est. 1987», вывеску караоке-бара и различные светящиеся рекламные щиты. На мокром после дождя тротуаре отражаются огни.
Промпт для интерфейса/знаний о мире: Фотографически реалистичный скриншот видео на YouTube, демонстрирующий видео под названием «Как собрать компьютер в 2026 году», у которого 2.3 миллиона просмотров, с реалистичными комментариями, рекомендациями видео в боковой панели и информацией о канале. Вид в desktop браузере.
Промпт-триггер для широкоэкранного формата: Это кинематографичное широкоэкранное фото, снятое в сумерках с внешним видом магазина IKEA, показывает светящуюся вывеску IKEA, parking lot с реалистичными автомобилями и покупателей, входящих и выходящих. Освещение в золотой час, формат 16:9.
Источник изображений и ссылка без указания авторства: https://miraflow.ai/blog/how-to-use-duct-tape-ai-model-arena-gpt-image-2-guide
Эта статья из WeChat Official Account "APPSO", автор: 发现明日产品的 (Discover Tomorrow's Products)






