The Image Generation Model That's Hotter Than Nano Banana Has Leaked, Screenshots Are No Longer Evidence | Includes Prompts

marsbitXuất bản vào 2026-04-19Cập nhật gần nhất vào 2026-04-19

Tóm tắt

A new AI image generation model, widely referred to as "GPT Image 2," has been leaked and is demonstrating significant advancements over predecessors like DALL-E 3 and even Google's Nano Banana Pro. It excels in four key areas: text rendering, prompt adherence, photorealism, and world knowledge. The model can generate highly accurate text in multiple languages, including complex Chinese characters, making it capable of producing convincing fake documents, UI screenshots, and product labels. This capability also raises concerns about the reliability of using screenshots as evidence. The model is currently in A/B testing, with a full release expected around May 2026 when DALL-E services are officially retired. It is accessible for testing on the LM Arena platform. The article includes several prompt templates optimized for the model, such as generating realistic app screenshots, product photos with detailed labels, and street scenes with accurate signage. This advancement is reshaping creative workflows but also accelerating the displacement of some traditional design roles.

Is your impression of text-to-image still stuck on Nano Banana?

But kid, times have changed again.

@johnAGI168 https://x.com/johnAGI168/status/2044781168151724067

@0115hippo https://x.com/0115hippo/status/2044722124611539160

In early April, three anonymous image models, codenamed maskingtape-alpha, packingtape-alpha, and gaffertape-alpha, appeared on the LM Arena evaluation platform. They disappeared a few hours later.

OpenAI has not officially announced this model yet, but based on the metadata returned by the API and user-side testing records, it has already gained a widely accepted name: GPT Image 2.

Screenshots Can No Longer Be Used as Evidence

Over the past few years, one of the most obvious weaknesses of AI image generation models has been text within images. In the DALL-E 3 era, if you asked it to write "Hello" in an image, it might output "Hellp" or even "Hl10", with letters tilting drunkenly. GPT Image 1 improved a lot, handling simple English labels. By GPT Image 1.5, its accuracy in rendering English text was close to 95%, but it still had significant flaws with non-Latin scripts like Chinese, Japanese, and Korean.

But the leaked sample images from GPT Image 2 have changed this impression.

@MrLarus https://x.com/MrLarus/status/2044824800909054181

@akokoi1 https://x.com/akokoi1/status/2044789531615056175

The text in the images is exactly what it should be. Chinese characters are clear, with accurate glyphs and complete strokes. Someone tested generating an ID card-style image, where the name, address, and ID number were all rendered correctly, with neat formatting, looking at first glance like a photo of a real document.

This is good news. The improvement in text rendering means generating infographics, posters, product packaging, and complex charts becomes more reliable.

But there's always another side to the coin. A model that can generate photo-realistic ID-style images and precisely render UI screenshots naturally makes "screenshots can be used as evidence" increasingly questionable.

By comparison, this is also a core difference between the GPT Image series and other models. Midjourney still has no progress in text rendering, and the Stable Diffusion series also has this old problem. According to the leaked Arena test results, GPT Image 2 surpassed Midjourney in four dimensions: text rendering, instruction following, photorealism, and world knowledge. Midjourney's advantages are mainly retained in artistic style and aesthetic control.

Does It Really Know What the World Looks Like?

A tester asked the model to generate a hypothetical GPT-8 product pricing page. The resulting image had a layout that was indeed in the style of the OpenAI website, with button placement and font choices resembling those from a real interface, and the hierarchical logic of the price table was correct.

GPT Image 2 can generate images extremely similar to real software interfaces, including browser windows, mobile app interfaces, and data visualization charts, with a level of fidelity unmatched by the previous generation.

@johnAGI168 https://x.com/johnAGI168/status/2044781168151724067

@levelsio https://x.com/levelsio/status/2040333489476681758

This will lead to some very interesting practical uses. When designers are creating product prototypes, they don't need to open Figma first and draw a bunch of wireframes; they can directly describe the desired interface in text, and the output is a reference image that can be used for team discussions. When creating investor decks, they can show a "product screenshot" without waiting for an engineer to write code. When writing documentation, example interface images for illustration can be generated directly, without having to think about where to find screenshots for a blank page.

@marmaduke091 https://x.com/marmaduke091/status/2040338311873515597

Image Generation Is No Longer Just "Image Generation"

OpenAI has already announced that DALL-E 2 and DALL-E 3 will officially cease service on May 12, 2026. Azure OpenAI's DALL-E 3 was retired early in February.

DALL-E was the first place many people encountered AI image generation, from those blurry early works to today, in just a few short years.

Meanwhile, Google, which had just established its industry position with Nano Banana Pro in early 2026, might feel the pressure. Early test reports indicate that GPT Image 2 simultaneously surpasses Nano Banana Pro in three dimensions: realism, text rendering, and world knowledge. This kind of triple win is not common.

For creators, the feeling is complex. Illustrators, graphic designers, and photographers are not facing this topic for the first time. Since the release of GPT Image 1, the number of freelance graphic design positions has decreased by about 18%. AI has indeed replaced the decision to "hire someone to do this" in certain scenarios, but it is also creating new ways of working, allowing one person to do more.

The evolution speed of image generation models no longer leaves much time for adaptation. It was only a few months from GPT Image 1's launch to version 1.5. And from 1.5 to 2, it's only been about half a year. Each generation solves the core shortcomings of the previous one while opening up new possibilities.

GPT Image 2 is currently still in the A/B testing phase, with some ChatGPT users randomly gaining access. The official release window is widely predicted to be around May, coinciding with the retirement of DALL-E. If you want to experience it early, you can currently try your luck on the LM Arena evaluation platform.

Test Address: https://arena.ai

Based on community feedback and the known strengths of this model, the following prompt templates can maximize your chances of success:

UI/Screenshot Prompt: A photorealistic screenshot of a mobile banking app, clearly showing transaction history with dates, amounts, and merchant names legible. iPhone 16 screen, natural hand holding the phone, coffee shop background.

Product Label Prompt: A photographic product photo of a craft beer bottle, with clear label details showing the brewery name "Oakridge Brewing Co.", alcohol content 6.8%, a mountain logo, and an ingredient list. Studio lighting, white background.

Signage Prompt: A street scene photo of a Tokyo alley at night, showing multiple neon signs in both Japanese and English, including a ramen shop sign reading "Ichiban Ramen — Est. 1987", a karaoke bar sign, and various glowing advertisements. Wet, reflective pavement with light reflections.

Interface/World Knowledge Prompt: A photorealistic YouTube video screenshot showing a video titled "How to Assemble a Computer in 2026" with 2.3 million views, featuring realistic comments, sidebar video recommendations, and channel info. Desktop browser view.

Widescreen Trigger Prompt: A cinematic widescreen photo of an IKEA store exterior at dusk, showing the glowing IKEA sign, a parking lot with realistic cars, and shoppers entering and leaving. Golden hour lighting, 16:9 format.

Unattributed image sources and references: https://miraflow.ai/blog/how-to-use-duct-tape-ai-model-arena-gpt-image-2-guide

This article is from the WeChat public account "APPSO", author: Discovering Tomorrow's Products

Tiền kỹ thuật số thịnh hành

Câu hỏi Liên quan

QWhat is the name of the leaked image generation model mentioned in the article, and what is its significance?

AThe leaked model is referred to as GPT Image 2. Its significance lies in its dramatic improvement in text rendering accuracy, especially for non-Latin scripts like Chinese, and its ability to generate highly realistic images, including convincing UI screenshots and document-style images, which challenges the reliability of screenshots as evidence.

QHow does GPT Image 2's performance compare to other models like Midjourney and Google's Nano Banana Pro?

AAccording to the article, GPT Image 2 outperforms Midjourney in text rendering, prompt following, photorealism, and world knowledge, with Midjourney retaining an advantage mainly in artistic style and aesthetic control. It also reportedly surpasses Google's Nano Banana Pro in realism, text rendering, and world knowledge.

QWhat are some of the potential practical applications of GPT Image 2's capabilities?

APotential applications include generating product prototypes and UI mockups for designers, creating realistic 'screenshots' for investor decks without coding, producing example interface images for documentation, and generating accurate product labels, packaging, and information graphics.

QWhat major change is OpenAI making to its image generation services in relation to this new model?

AOpenAI has announced that DALL-E 2 and DALL-E 3 will officially stop service on May 12, 2026, with Azure's DALL-E 3 having already been retired in February. This suggests a transition to the new GPT Image model series.

QWhere can users currently try to access or test the GPT Image 2 model, and what is a recommended strategy for getting good results?

AThe model is currently in A/B testing, with some ChatGPT users randomly gaining access. Users can also try their luck on the LM Arena评测平台 (arena.ai). The article recommends using specific, detailed prompt templates focused on UI/screenshots, product labels, signage, interface/world knowledge, and widescreen formats to maximize success.

Nội dung Liên quan

Hàn Quốc Hành Động Quy Định Chuyển Tiền Xuyên Biên Giới Bằng Tiền Mã Hóa Theo Khuôn Khổ Mới

Hàn Quốc dự kiến đưa các công ty fintech vào khuôn khổ cấp phép mới cho chuyển tiền bằng tài sản ảo, có hiệu lực từ tháng 12. Theo quy định sửa đổi, các công ty thực hiện chuyển tiền xuyên biên giới qua tài sản ảo phải đăng ký với Bộ Kinh tế & Tài chính và báo cáo giao dịch qua hệ thống hối đoái. Khung pháp lý này được lập ra để đưa các giao dịch dựa trên tiền mã hóa vào diện giám sát chính thức, nhằm ngăn chặn rửa tiền và tội phạm do nhiều giao dịch trước đây hoạt động ngoài hệ thống giám sát. Ban đầu, quy định chỉ giới hạn cho các sàn giao dịch tiền mã hóa như Upbit hay Bithumb. Tuy nhiên, ngân hàng trung ương Hàn Quốc cho biết có thể mở rộng đối tượng đủ điều kiện sang các thực thể phi truyền thống nếu họ đáp ứng yêu cầu. Bộ Kinh tế & Tài chính và Ngân hàng Trung ương đang phối hợp với các bên để hoàn thiện quy tắc thực thi trước tháng 12. Động thái này nằm trong bối cảnh Hàn Quốc đang tăng cường giám sát tài sản số, bao gồm cả việc sắp công bố quy tắc mới về chứng khoán token hóa vào tháng 7.

TheNewsCrypto1 giờ trước

Hàn Quốc Hành Động Quy Định Chuyển Tiền Xuyên Biên Giới Bằng Tiền Mã Hóa Theo Khuôn Khổ Mới

TheNewsCrypto1 giờ trước

Microsoft Xác Định Phần Mềm Độc Hại Mới Nhắm Vào Địa Chỉ Ví Và Khóa Riêng Tư

Vào tháng 2/2026, Microsoft đã phát hiện một chiến dịch mã độc nhắm mục tiêu vào người dùng tiền điện tử, được đặt tên là Trojan/CryptoBandits.A. Mã độc này lây lan chủ yếu qua các file shortcut .lnk độc hại trên ổ USB. Sau khi xâm nhập hệ thống, phần mềm độc hại hoạt động như một "crypto clipper". Nó liên tục theo dõi nội dung clipboard để tìm kiếm các cụm từ khôi phục ví (12 hoặc 24 từ), khóa cá nhân Bitcoin/Ethereum và địa chỉ ví. Khi phát hiện, nó sẽ thay thế địa chỉ ví người dùng sao chép bằng địa chỉ do kẻ tấn công kiểm soát, đánh cắp tiền. Ngoài ra, mã độc còn chụp màn hình, thực thi lệnh từ xa và duy trì quyền truy cập qua các tác vụ đã lên lịch. Điểm đáng chú ý là mã độc không cần máy chủ điều khiển trực tiếp mà sử dụng Windows Script Host, ActiveX và một proxy Tor ẩn để giao tiếp. Microsoft khuyến nghị các tổ chức vô hiệu hóa tính năng auto-run, hạn chế script từ USB và giám sát các hành vi đáng ngờ như hoạt động proxy localhost:9050, theo dõi clipboard hay chụp màn hình bằng PowerShell. Chiến dịch này cho thấy mối đe dọa ngày càng tinh vi đối với lĩnh vực tiền điện tử.

TheNewsCrypto2 giờ trước

Microsoft Xác Định Phần Mềm Độc Hại Mới Nhắm Vào Địa Chỉ Ví Và Khóa Riêng Tư

TheNewsCrypto2 giờ trước

Không có đội ngũ bán hàng vẫn thu về 20 triệu đô la, AI nhân viên Viktor dựa vào điều gì để chinh phục 30.000 doanh nghiệp?

AI nhân viên Viktor đạt doanh thu 20 triệu USD/năm với hơn 30.000 doanh nghiệp mà không cần đội ngũ bán hàng, bằng cách nào? Sản phẩm "Tier 3 AI Coworker" này, do đội ngũ từ DeepMind phát triển, hoạt động như một nhân viên kỹ thuật số. Người dùng chỉ cần đề cập @Viktor trong Slack hoặc Teams và yêu cầu bằng ngôn ngữ tự nhiên (ví dụ: tạo báo cáo bán hàng), nó sẽ tự động truy cập CRM, tạo biểu đồ và gửi kết quả. Ngoài phản hồi, Viktor còn tự động kích hoạt tác vụ như đối chiếu sổ sách ban đêm hay tổng hợp dữ liệu từ nhiều công cụ để làm PowerPoint. Thành công của Viktor đến từ mô hình PLG (Product-Led Growth) thuần túy. Thay vì bán theo số ghế, họ tính phí theo tín dụng hoặc nhiệm vụ, giúp giảm chi phí thử nghiệm. Người dùng có 100 USD miễn phí để trải nghiệm, từ đó lan truyền tự nhiên trong nội bộ. Viktor phá vỡ rào cản "kỹ thuật nhắc lệnh" (prompt engineering) bằng cách chuyển từ hỗ trợ soạn thảo sang thực thi đầu-cuối. Tuy nhiên, cơ chế ra quyết định tự động cũng tiềm ẩn rủi ro khi hiểu sai yêu cầu mơ hồ. Sản phẩm đang chuyển từ Slack sang Microsoft Teams (3.2 tỷ người dùng), đối mặt với thách thức tuân thủ và kiểm soát của bộ phận IT tại các tập đoàn lớn. Rào cản chính là cân bằng giữa tự động hóa hoàn toàn và kiểm soát rủi ro (như ghi sai dữ liệu), đòi hỏi khung quản trị chặt chẽ về quyền hạn, nhật ký kiểm toán để xây dựng lòng tin.

marsbit2 giờ trước

Không có đội ngũ bán hàng vẫn thu về 20 triệu đô la, AI nhân viên Viktor dựa vào điều gì để chinh phục 30.000 doanh nghiệp?

marsbit2 giờ trước

Phương án mua lại Manus hé lộ: Bên đầu tư Trung Quốc dự kiến bỏ ra 2 tỷ USD mua lại cổ phần, lộ trình IPO tại Hồng Kông dần sáng tỏ

Bài báo ngày 18/6 từ The Information tiết lộ, các nhà đầu tư Trung Quốc ban đầu của Manus, bao gồm Tencent, Sequoia China và ZhenFund, có kế hoạch mua lại công ty từ Meta với giá 20 tỷ USD, bằng đúng số tiền Meta đã chi trả vào tháng 12 năm ngoái. Động thái này là phản ứng trực tiếp sau khi cơ quan chức năng Trung Quốc vào tháng 4 ra lệnh dừng thương vụ mua lại do lo ngại an ninh. Theo kế hoạch, Manus sẽ được tái cấu trúc thành một doanh nghiệp liên doanh trong nước để đáp ứng các quy định và mở đường cho một đợt IPO tiềm năng tại Hong Kong. Các nhà đầu tư Trung Quốc dự kiến sẽ tăng vốn bằng USD. Benchmark, một nhà đầu tư khác, sẽ không tham gia mua lại, dẫn đến việc cổ phần của Manus tập trung nhiều hơn vào tay các quỹ Trung Quốc. Manus đã chứng kiến tốc độ tăng trưởng doanh thu ấn tượng, từ mức 1 tỷ USD khi bị mua lại lên 4-5 tỷ USD hiện tại, củng cố niềm tin của các nhà đầu tư vào việc mua lại theo giá cũ. Các điều khoản chi tiết như tỷ lệ góp vốn và cơ cấu công ty liên doanh vẫn đang được đàm phán. Kịch bản "mua lại + liên doanh + IPO tại Hong Kong" này có thể trở thành một khuôn mẫu tham khảo cho các startup AI Trung Quốc trong các thương vụ M&A xuyên biên giới.

marsbit3 giờ trước

Phương án mua lại Manus hé lộ: Bên đầu tư Trung Quốc dự kiến bỏ ra 2 tỷ USD mua lại cổ phần, lộ trình IPO tại Hồng Kông dần sáng tỏ

marsbit3 giờ trước

Giao dịch

Giao ngay
Hợp đồng Tương lai

Bài viết Nổi bật

Làm thế nào để Mua BANANA

Chào mừng bạn đến với HTX.com! Chúng tôi đã làm cho mua Banana Gun (BANANA) trở nên đơn giản và thuận tiện. Làm theo hướng dẫn từng bước của chúng tôi để bắt đầu hành trình tiền kỹ thuật số của bạn.Bước 1: Tạo Tài khoản HTX của BạnSử dụng email hoặc số điện thoại của bạn để đăng ký tài khoản miễn phí trên HTX. Trải nghiệm hành trình đăng ký không rắc rối và mở khóa tất cả tính năng. Nhận Tài khoản của tôiBước 2: Truy cập Mua Crypto và Chọn Phương thức Thanh toán của BạnThẻ Tín dụng/Ghi nợ: Sử dụng Visa hoặc Mastercard của bạn để mua Banana Gun (BANANA) ngay lập tức.Số dư: Sử dụng tiền từ số dư tài khoản HTX của bạn để giao dịch liền mạch.Bên thứ ba: Chúng tôi đã thêm những phương thức thanh toán phổ biến như Google Pay và Apple Pay để nâng cao sự tiện lợi.P2P: Giao dịch trực tiếp với người dùng khác trên HTX.Thị trường mua bán phi tập trung (OTC): Chúng tôi cung cấp những dịch vụ được thiết kế riêng và tỷ giá hối đoái cạnh tranh cho nhà giao dịch.Bước 3: Lưu trữ Banana Gun (BANANA) của BạnSau khi mua Banana Gun (BANANA), lưu trữ trong tài khoản HTX của bạn. Ngoài ra, bạn có thể gửi đi nơi khác qua chuyển khoản blockchain hoặc sử dụng để giao dịch những tiền kỹ thuật số khác.Bước 4: Giao dịch Banana Gun (BANANA)Giao dịch Banana Gun (BANANA) dễ dàng trên thị trường giao ngay của HTX. Chỉ cần truy cập vào tài khoản của bạn, chọn cặp giao dịch, thực hiện giao dịch và theo dõi trong thời gian thực. Chúng tôi cung cấp trải nghiệm thân thiện với người dùng cho cả người mới bắt đầu và người giao dịch dày dạn kinh nghiệm.

Tổng lượt xem 243Xuất bản vào 2024.12.11Cập nhật vào 2026.06.02

Làm thế nào để Mua BANANA

Thảo luận

Chào mừng đến với Cộng đồng HTX. Tại đây, bạn có thể được thông báo về những phát triển nền tảng mới nhất và có quyền truy cập vào thông tin chuyên sâu về thị trường. Ý kiến ​​của người dùng về giá của BANANA (BANANA) được trình bày dưới đây.

活动图片