比Nano Banana还夯的生图模型泄露,截图不再是证据了 | 附提示词

marsbit發佈於 2026-04-19更新於 2026-04-19

文章摘要

近日,LM Arena评测平台短暂出现了三个匿名图像模型,据推测为OpenAI尚未正式发布的GPT Image 2。该模型在文字渲染、指令跟随、真实感和世界知识等方面表现突出,尤其在多语言文字(包括中文)的生成上准确率大幅提升,能生成高度逼真的证件、界面和产品标签图像。 这一进步使得截图作为证据的可信度受到挑战,但也为设计、产品原型制作及内容配图等场景带来便利。与此同时,GPT Image 2在多项测试中表现优于Google的Nano Banana Pro及Midjourney等模型。 目前该模型仍处于A/B测试阶段,预计将在5月随DALL-E系列服务退役后正式发布。用户可尝试在LM Arena平台体验,并参考社区推荐提示词生成高质量图像。

你对文生图的印象还停留在 Nano Banana 吗?

可是孩子,时代又变了。

@johnAGI168 https://x.com/johnAGI168/status/2044781168151724067

@0115hippo https://x.com/0115hippo/status/2044722124611539160

4 月初,LM Arena 评测平台上出现了三个匿名图像模型,代号分别是 maskingtape-alpha、packingtape-alpha、gaffertape-alpha。几小时后它们消失了。

OpenAI 官方还没有正式宣布这个模型,但根据 API 返回的元数据和用户侧的测试记录,它已经有了一个被广泛接受的名字:GPT Image 2。

截图不能再当证据了

过去几年,AI 生图模型最明显的短板之一就是图片里的文字。DALL-E 3 时代,你让它在图里写「Hello」,出来的可能是「Hellp」甚至「Hl10」,字母像喝醉了一样东倒西歪。GPT Image 1 好了很多,能处理简单的英文标签。到 GPT Image 1.5 ,其对英文文字的渲染准确率已经接近 95%,但在中文、日文、韩文等非拉丁字母体系上仍有明显缺陷。

而 GPT Image 2 的泄露样图改变了这个印象。

@MrLarus https://x.com/MrLarus/status/2044824800909054181

@akokoi1 https://x.com/akokoi1/status/2044789531615056175

图片里的文字,该是什么就是什么。中文清晰,字形准确,笔画完整。有人测试生成一张身份证样式的图片,姓名、地址、证件号码全部正确渲染,排版规整,初看像是真实文件的照片。

这是个好消息。文字渲染的进步,意味着生成信息图、海报、产品包装、排版复杂的图表,都变得更可靠了。

但硬币总有另一面。一个能生成以假乱真的证件样式图、精确渲染 UI 截图的模型,自然也让「截图可以作为证据」这件事变得越来越可疑。

对比来看,这也是 GPT Image 系列和其他模型的核心差异所在。Midjourney 至今在文字渲染上毫无建树,Stable Diffusion 系列也是老问题。根据泄露的 Arena 测试结果,GPT Image 2 在文字渲染、指令跟随、照片真实感和世界知识四个维度上均超过 Midjourney,后者的优势主要保留在艺术风格和美学控制上。

它真的知道这个世界长什么样吗

有测试者让模型生成一个假想的 GPT-8 产品定价页面,结果出来的图,排版确实是 OpenAI 官网的风格,按钮位置和字体选用像是从真实界面截取的,价格表格的层级逻辑也是对的。

GPT Image 2 能生成与真实软件界面极为相似的图像,包括浏览器窗口、移动端应用界面、数据可视化图表,保真度是上一代产品无法比拟的。

@johnAGI168 https://x.com/johnAGI168/status/2044781168151724067

@levelsio https://x.com/levelsio/status/2040333489476681758

这将带来一些很有意思的实际用途。设计师在做产品原型的时候,不需要先打开 Figma 画一堆框架,直接用文字描述想要的界面,出来的就是一张可以用来和团队讨论的参考图。做投资人 Deck 时,不需要等工程师写代码就能展示一个「产品截图」。写文档的时候,用来配图的示例界面可以直接生成,不用对着空白页面想截图从哪里找。

@marmaduke091 https://x.com/marmaduke091/status/2040338311873515597

生图这件事,已经不只是「生图」了

OpenAI 已经宣布 DALL-E 2 和 DALL-E 3 将于 2026 年 5 月 12 日正式停止服务。Azure OpenAI 的 DALL-E 3 已经在 2 月提前退役了。

DALL-E 是很多人第一次接触 AI 生图的地方,从那些模糊的早期作品到今天,才短短几年。

与此同时,2026 年初刚刚凭借 Nano Banana Pro 确立行业地位的 Google,或许将感受到压力。早期测试报告显示,GPT Image 2 在真实感、文字渲染和世界知识三个维度上同时超越了 Nano Banana Pro,这种三连胜并不常见。

对于创作者来说,感受是复杂的。插图师、平面设计师、摄影师,已经不是第一次面对这个话题了。自 GPT Image 1 发布以来,自由职业平面设计职位数量下降了约 18%。AI 在某些场景下确实取代了「我要雇一个人做这件事」的决策,但它也在创造新的工作方式,让一个人能做的事变多了。

生图模型的进化速度,已经不再给人留出太多适应时间了。GPT Image 1 从上线到 1.5,不过几个月。1.5 到 2,大概也就半年。每一代都在解决上一代的核心短板,同时打开新的可能性。

GPT Image 2 现在还处于 A/B 测试阶段,部分 ChatGPT 用户已经随机获得了访问权限。正式发布的时间窗口,普遍预测就在 5 月 DALL-E 退役前后。想要提前体验的话,目前可以在 LM Arena 评测平台碰碰运气。

Test Address: https://arena.ai

根据社区反馈和该模型的已知优势,以下提示模板可以最大限度地提高你的成功几率:

UI/截图提示:一张照片级逼真的手机银行应用截图,清晰显示交易记录,其中日期、金额和商户名称清晰可辨。iPhone 16 屏幕,自然手持手机,咖啡店背景。

产品标签提示:一张照片级精酿啤酒瓶产品照片,标签细节清晰,显示酒厂名称「Oakridge Brewing Co.」,酒精度 6.8%,山脉标志及配料表。棚内布光,白色背景。

标识提示:一张东京夜间巷道的街景照片,可见多处日英双语霓虹灯招牌,包括写有「Ichiban Ramen — Est. 1987」的拉面店招牌、卡拉 OK 酒吧招牌以及各种发光的广告牌。雨后湿滑的人行道上映着灯光。

界面/世界知识提示:一张照片级真实的 YouTube 视频截图,展示了一段名为「如何在 2026 年组装电脑」的视频,该视频拥有 230 万次观看,配有逼真的评论区、侧边栏推荐视频以及频道信息。桌面浏览器视图。

宽屏触发提示:这是一张电影般的宽银幕照片,拍摄了宜家门店黄昏时分的外观,展示了发光的宜家招牌、停车场里有逼真的汽车,以及进进出出的购物者。黄金时刻灯光,格式 16:9。

未标注图片来源及参考:https://miraflow.ai/blog/how-to-use-duct-tape-ai-model-arena-gpt-image-2-guide

本文来自微信公众号“APPSO”,作者:发现明日产品的

相關問答

QGPT Image 2相比前代模型在文字渲染方面有哪些显著提升?

AGPT Image 2在文字渲染方面实现了显著突破,能够准确生成中文、英文等多种语言的文字,字形和笔画完整清晰。例如,它可以生成排版规整的身份证样式图片,甚至能正确渲染复杂的UI界面文字,解决了早期模型(如DALL-E 3)文字错乱的问题。

QGPT Image 2的泄露对‘截图作为证据’的可靠性有何影响?

AGPT Image 2能够生成高度逼真的证件、UI界面等图像,且文字渲染极其准确,这使得伪造的截图难以被肉眼识别。因此,传统上依赖截图作为证据的可靠性大幅降低,因为AI生成的虚假截图可能以假乱真。

QGPT Image 2在哪些实际应用场景中具有优势?

AGPT Image 2在生成信息图、产品原型设计、投资演示、文档配图等场景中优势明显。例如,设计师可以直接用文字描述生成界面参考图,无需手动绘制;投资者能快速生成产品截图用于Deck展示,提高效率。

QGPT Image 2与Google的Nano Banana Pro相比如何?

A根据早期测试,GPT Image 2在真实感、文字渲染和世界知识三个关键维度上均超越了Google的Nano Banana Pro,实现了全面领先。而Nano Banana Pro仅在艺术风格控制上可能保留部分优势。

Q如何提前体验GPT Image 2模型?

A目前GPT Image 2处于A/B测试阶段,部分ChatGPT用户可能随机获得访问权限。用户也可以尝试通过LM Arena评测平台(https://arena.ai)碰运气,但需注意该模型尚未正式发布,OpenAI计划在2026年5月DALL-E退役前后推出。

你可能也喜歡

阿里“上货”,字节“练功”

5月最后一周,阿里和字节的两项动作展现了中国大厂在AI领域的两种不同战略路径。 阿里正将AI快速“上货”落地。5月11日,千问App与淘宝全面打通,接入40亿商品库和20年购物场景数据。随后在阿里云峰会上,吴泳铭宣布升级全栈能力,并计划未来五年资本开支远超过去三年。阿里的核心策略是将AI深度融入现有商业场景,如蚂蚁的AI支付用户数破亿、淘宝的AI比价等,并推动“智能体商业信任协议”作为信任基础设施。其商业模式依赖AI服务变现,阿里云外部收入增长40%,服务器“几乎没有一张卡是空的”。然而,这种路径可能以基础模型能力的长期领先性为代价。 字节则选择在Seed部门潜心“练功”,聚焦探索AI智能上限。其视频生成模型Seedance 2.0在权威评测中登顶,获业界高度评价。部门内部目标纯粹,如设定“国际榜单进前三”的KPI,并投入8个月撰写纯学术论文。字节计划大幅增加资本开支,最高或达4700亿元,资金来源于其巨额利润,且因其未上市,无需承受短期业绩压力,得以专注于长期技术突破。但商业化压力已初现,豆包开始测试付费和广告。 文章指出,两种路径差异的根本原因在于公司是否上市。阿里作为上市公司,必须关注季度财报和股价,战略倾向于快速变现;字节作为非上市公司,则拥有更大的自由去进行长期、前沿的技术投资。这决定了当前中国AI领域“卖AI”与“做AI”的格局分野。未来若字节启动IPO,其长期研发投入或将面临资本市场的考验。

marsbit59 分鐘前

阿里“上货”,字节“练功”

marsbit59 分鐘前

Circle 将 Zama 协议地址列入黑名单,冻结价值 1260 万美元的用户资金 - 详情

稳定币发行商Circle已将一个与隐私协议Zama相关的智能合约列入黑名单,冻结了约1260万美元的用户资金。此次冻结首先由链上调查员ZachXBT发现,涉及Zama在以太坊上部署的保密USDC(cUSDC)合约。该合约地址在Zama的公开文档中可查,其冻结过程可被实时追踪和验证。 进一步分析显示,此次冻结可能与资产管理和收益协议Overnight Finance近期的争议及法律问题间接相关。数据显示,一个疑似与Overnight Finance相关的钱包于2026年5月11日向Zama合约存入约1240万美元USDC。Overnight Finance近期正面临治理纠纷和可能被团队“拉地毯”的指控,并因此进行了国库资产分配投票。此外,该公司还卷入一起民事诉讼,原告之一是DeFi领域以激进治理策略闻名的Patagon Management。尽管Circle的行动与这些事件之间尚无直接因果证据,但法律程序、资金流动与冻结事件的重叠,引发了人们对DeFi协议间风险传导的担忧。 Circle此次单方面行动再次引发对中心化发行商透明度的批评。据ZachXBT称,Zama团队在合约被列入黑名单前似乎未获任何通知。这加剧了人们对中心化实体在无预警情况下影响去中心化应用及其用户的担忧。此前在2026年3月,Circle曾冻结多个实体相关的热钱包而未公开说明理由。本次行动则更进一步,直接冻结了协议级别的资金池合约,而非独立钱包,这引发了人们对所谓去中心化系统中托管风险的质疑。截至目前,Circle尚未就冻结Zama合约的原因发布官方解释。

bitcoinist1 小時前

Circle 将 Zama 协议地址列入黑名单,冻结价值 1260 万美元的用户资金 - 详情

bitcoinist1 小時前

三年之后:回看 2023 年我对 ChatGPT 的判断

作者王健硕在2026年5月回看其于2023年3月对ChatGPT做出的二十条预测,并借助AI代理进行验证。整体看,其大方向判断多正确,但细节和程度常有偏差。 **看对的方面:** - **技术架构**:准确预测RAG(检索增强生成)将成为解决知识更新和幻觉的主流方法,以及LUI(自然语言用户界面)将催生巨大新产业。 - **发展趋势**:预见到“机器人网络”和新的agent寻址系统将出现,中国能快速做出可用大模型并缩小与顶尖差距。 - **本质认知**:正确指出ChatGPT没有意识,图灵测试仅测表象;判断其是巨大进步但非AGI,且短期内不会造成整体失业潮。 **看错或看偏的方面:** - **具体数据错误**:关于GPT-4有100T参数的传闻完全错误。 - **绝对化判断**:断言LLM“不可能”自己学好数学被后来模型在IMO夺金证伪;认为AI生成内容可“规避”版权,实则引发史上最大侵权赔偿。 - **价值与成本误判**:认为价值终落应用层,但最大赢家是算力层(如英伟达);模型成本“5-10亿封顶”的估算严重偏离实际。 - **社会影响误读**:认为ChatGPT的“加权平均”特性可能促进“世界大同”,但实际AI正走向个性化,并可能制造新信息茧房。 **总结规律:** 1. 预测机制和方向比具体数字更可靠。 2. 倾向于高估短期变化速度,低估长期影响程度。 3. 容易忽略问题内部的“分布”差异(如失业影响集中在年轻群体)。 4. 留有餘地、分层表述的判断更经得起时间检验。 5. 一些根本性争议,三年时间仍不足以给出定论。 这次复盘旨在为未来的判断立下更审慎的规矩。

marsbit9 小時前

三年之后:回看 2023 年我对 ChatGPT 的判断

marsbit9 小時前

交易

現貨
合約

熱門文章

如何購買BANANA

歡迎來到HTX.com!在這裡,購買Banana Gun (BANANA)變得簡單而便捷。跟隨我們的逐步指南,放心開始您的加密貨幣之旅。第一步:創建您的HTX帳戶使用您的 Email、手機號碼在HTX註冊一個免費帳戶。體驗無憂的註冊過程並解鎖所有平台功能。立即註冊第二步:前往買幣頁面,選擇您的支付方式信用卡/金融卡購買:使用您的Visa或Mastercard即時購買Banana Gun (BANANA)。餘額購買:使用您HTX帳戶餘額中的資金進行無縫交易。第三方購買:探索諸如Google Pay或Apple Pay等流行支付方式以增加便利性。C2C購買:在HTX平台上直接與其他用戶交易。HTX 場外交易 (OTC) 購買:為大量交易者提供個性化服務和競爭性匯率。第三步:存儲您的Banana Gun (BANANA)購買Banana Gun (BANANA)後,將其存儲在您的HTX帳戶中。您也可以透過區塊鏈轉帳將其發送到其他地址或者用於交易其他加密貨幣。第四步:交易Banana Gun (BANANA)在HTX的現貨市場輕鬆交易Banana Gun (BANANA)。前往您的帳戶,選擇交易對,執行交易,並即時監控。HTX為初學者和經驗豐富的交易者提供了友好的用戶體驗。

287 人學過發佈於 2024.12.11更新於 2025.03.21

如何購買BANANA

相關討論

歡迎來到 HTX 社群。在這裡,您可以了解最新的平台發展動態並獲得專業的市場意見。 以下是用戶對 BANANA (BANANA)幣價的意見。

活动图片