GPT-5.6 Sol暴涨3倍,OpenAI最强视觉AI登顶

marsbit发布于2026-08-18更新于2026-08-18

文章摘要

近日,第三方评测机构Roboflow对GPT-5.6系列模型进行了视觉语言模型基准测试。结果显示,其顶级型号Sol在目标检测任务中获得46.2分,相比上一代GPT-5.5的13.8分暴涨超过三倍,被评价为“OpenAI有史以来最强的视觉模型”。同系列的Terra和Luna模型也表现强劲。 测试聚焦于实际应用能力,包括目标检测、计数、文字识别和信息抽取。Sol在文档版面分析上表现突出,能准确识别并圈出标题、正文、表格等区域。在密集物体计数(如药片、鸡蛋)和理解复杂规则(如统计靶纸特定环数内的弹孔)等传统难题上,Sol也展现出显著进步。 然而,测试也揭示了模型的局限。在定向信息提取(如从发票提取日期)任务上,Sol的成绩为82.5%,反而比GPT-5.5的87.6%有所下降。特别是在处理小字体、低对比度或特殊排版(如药板有效期)的文字时容易出错。此外,OpenAI承认,当输入图像尺寸过大(约2000×2000像素以上)时,Sol的检测框可能会出现位置漂移,建议通过调高推理配置或预先缩放图像来缓解。 成本方面,Sol处理单张图像约需2.5美分和10秒,而Gemini 3.5 Flash仅需0.8美分,且在部分检测和计数任务上仍保持领先,被视为高性价比选择。 总体而言,GPT-5.6标志着视觉大模型的能力正从“理解图像”迈向“执行具体视觉任务”,在目标检测、空间关系理解和文档分析等方面取得实质突破。视觉AI竞争的下半场,已从基本能力转向精度与实用性的比拼,而成本效益的较量才刚刚开始。

什么?!

GPT-5.6 Sol,竟是隐藏的「视觉大师」。

最近,第三方视觉评测机构Roboflow,把GPT-5.6 「全家桶」拖进自家VLM基准跑了一圈。

测试的内容,都是最实在的活儿:找东西、数东西、认字、抽信息。

仅在目标检测这项,上一代GPT-5.5只拿到13.8分。这个分数,在视觉模型圈里基本等于交白卷。

这次Sol冲到了46.2,三倍还多。

Roboflow项目负责人SkalskiP直言,「GPT-5.6 Sol是OpenAI有史以来最强的视觉模型」!

GPT-5.6「超大杯」,OpenAI最强视觉AI

一直以来,目标检测是GPT系列的重灾区。任务很简单:就是让模型在图上把每个东西框出来。

上一代GPT-5.5的表现,基本等于「知道图里有东西,但框哪儿全靠蒙」。

GPT-5.6 Sol分数,直接飙涨至46.2,三倍多。

更有意思的是,Terra和Luna也紧跟在后面,44.7和43.3。

值得一提的是,Luna是这一代里最便宜的那档,它的检测分照样把上一代旗舰按在地上摩擦。

在计数方面,分数同样在涨。

Sol的准确率从GPT-5.5的64.9%升到73%,Terra和Luna分别是67.6%和66.2%。

那么,GPT-5.6具体强在哪?

文档版面识别最亮眼,标题、正文、表格、插图、签名,Sol都能干净地圈出来。

这件事对做合同、发票、报表处理的人来说不是小事:几乎所有文档流水线的第一步,都是先找到「该看哪一块」,再去认字。

就连密集场景,GPT-5.6也扛住了。

药片、鸡蛋这类几十个同款物体挤在一起的图,是VLM的传统翻车现场。

因为大模型画框,是一个坐标一个坐标地把数字打出来,东西越多,输出越长,漏掉、重复、坐标写飞的概率就越高。

甚至还有更刁的:一张靶纸,只让它数落在指定环数区域里的弹孔。

Sol直接做对了,它不仅知道要数什么,还知道规则管到哪儿为止。

不得不说,这一块的进步是实打实的。

全能?不存在的

最反常识的一段在这儿:Sol的认字能力,是退步的。

OCR整段转写,Sol拿90.7%,比GPT-5.5的91.2%低了半个点,差别不大。

但「定向提取」这一项,不要全文,只要那一条信息,比如把发票上的日期揪出来,Sol只拿下了82.5%,GPT-5.5 是87.6%,掉了5个点。

它不是不认字。手写笔记它能整段转写,也能准确挑出日期,脏轮胎弧面上印的尺寸编号它读得出来。

还有,冰球比赛直播画面里的实时比分,它能按你指定的格式吐出来。

翻车的是药板上那行有效期:字小、竖排、低对比度、还有反光。

一个能读懂比赛转播画面的模型,却读不出你手里那盒药什么时候过期。

OpenAI承认了,图一大框就飘

在部分图片上,Sol返回的检测框会飘到画面里毫不相干的地方。

跟真实物体几乎零重叠,而且这些框往往排得异常整齐:一条直线,或者均匀分布的一组。

Roboflow把这些样例发给了OpenAI。对方的回复很干脆:Sol在图片尺寸达到2000×2000像素左右或更大时,会变得不稳定,推理档位调得越低,越不稳定。

解法有两个。一是调高推理档位,稳是稳了,但Token用量、延迟、账单全跟着涨。

二是最土也最有效的那个:在发给API之前,先把图缩小或者裁一刀。

再来看整个账单,Roboflow实测下来的成本和速度:

Sol:约2.5美分/张,约10秒;Terra:约1美分/张,约6秒;Luna:不到0.5美分/张,约5秒

而Gemini 3.5 Flash每张0.8美分,比Sol便宜三分之二,检测和计数在这套基准上还继续领先。

面对高频、大批量的检测计数任务,Gemini Flash仍是「性价比之王」。

所以,GPT-5.6 Sol这次真正让人意外的,是视觉能力正在从「看懂一张图」,跨进「真正干视觉的活」。

找目标、画框、计数、理解空间关系、拆文档版面。

这些过去更像是专用视觉模型的地盘,如今正在被大模型一 点点 吃掉。

视觉大模型的下半场,已经从「能不能看懂」卷向了「干活准不准」。

GPT-5.6亮出了肌肉,但性价比的战争,才刚刚开始。

本文来自微信公众号“新智元”,作者:ASI启示录

热门币种推荐

相关问答

Q根据文章,GPT-5.6 Sol在哪个评测基准中表现出色?具体在哪个视觉任务上取得了三倍的提升?

A在第三方视觉评测机构Roboflow的VLM基准测试中表现出色。具体在目标检测任务上,其分数从上一代GPT-5.5的13.8分提升至46.2分,涨幅超过三倍。

Q文章中提到GPT-5.6 Sol在哪种特定类型文档的版面识别能力上最亮眼?这对于哪些行业的应用很重要?

A在文档版面识别上最亮眼,特别是能准确识别并圈出文档中的标题、正文、表格、插图和签名。这对于需要处理合同、发票、报表等文档流水线工作的人(如法律、财务、行政等行业)非常重要。

Q尽管GPT-5.6 Sol视觉能力整体大幅提升,但文章指出它在哪个具体的OCR(光学字符识别)任务上反而出现了退步?

A在OCR的「定向提取」任务上出现了退步。例如,从发票中准确提取日期等信息时,GPT-5.6 Sol的准确率为82.5%,比GPT-5.5的87.6%下降了5个百分点。

QOpenAI承认GPT-5.6 Sol在处理哪种规格的图片时会出现不稳定现象?他们建议了哪两种解决方法?

AOpenAI承认当图片尺寸达到约2000×2000像素或更大时,GPT-5.6 Sol会变得不稳定。建议的两种解决方法是:1. 调高推理档位以提升稳定性(但会增加成本、延迟和Token用量)。2. 在发送图片给API之前,先将图片缩小或进行裁剪。

Q根据Roboflow的实测数据,在处理图片的成本和速度方面,哪款模型被文章称为特定任务中的“性价比之王”?

A文章称,在处理高频、大批量的检测和计数任务时,Gemini 3.5 Flash凭借每张约0.8美分的成本和不错的性能,在基准测试中继续领先,被称作“性价比之王”。

你可能也喜欢

合肥300亿换1万亿:股权财政元年,谁能抄这份作业

2026年7月27日,长鑫科技在科创板上市,首日市值飙升至约3.3万亿元,使合肥国资的账面浮盈超过1万亿元。这一惊人回报的起点,是2016年合肥市对长鑫存储(原名)一笔约300亿元的战略投资。 2016年,兆易创新创始人朱一明带着DRAM芯片产业化计划寻求支持,多地因风险过高而拒绝。合肥市却接下了这个“烫手山芋”。此后近十年,长鑫存储持续亏损超360亿元,但合肥国资与国家大基金始终陪跑,直至2026年一季度才依托AI需求扭亏为盈。这体现了“合肥模式”的核心:政府以国有资本作为风险投资,押注关键产业,追求产业生态与长期回报,而非短期财务收益。 “合肥模式”的雏形可追溯至2008年。当时合肥甚至暂停地铁建设,集中财力投资于连年亏损的京东方,最终成功打造了显示面板产业集群。这种用“资金换产业”的逻辑,在长鑫项目上再次得到验证。 当前,中国地方财政正从依赖“土地财政”转向探索“股权财政”。合肥的实践提供了一个生动样本:“十四五”期间,合肥国资投入超2200亿元,撬动了超8400亿元社会投资,并带动了人口持续流入。 然而,“合肥模式”难以简单复制。其成功依赖于多重独特因素:跨越多届领导班子的战略耐心与政策连续性;专业化国资操盘团队积累的产业判断与风控能力;恰好踩准产业与资本周期的运气;以及在长期亏损中坚守的定力。这些组织能力与时代机遇的叠加,无法通过考察学习直接移植。 长鑫上市带来的不仅是万亿浮盈,更是围绕其形成的450多家上下游企业集群,以及合肥集成电路产值7倍多的增长。这份“作业”启示在于,“股权财政”的理念和工具可学,但培育产业所需的长期主义、专业能力和战略定力,才是更珍贵、更难复制的内核。

marsbit2分钟前

合肥300亿换1万亿:股权财政元年,谁能抄这份作业

marsbit2分钟前

Solana价格预测看涨至83美元,因Solana在全链RWA资金流入中领先

**Solana价格预测:看涨目标83.75美元,关键技术位面临抉择** 根据技术分析,Solana(SOL)的价格自六月以来一直在一个对称三角形形态内盘整,预计将于九月初迎来方向性突破。目前价格在74.74美元(支撑位)和79.24美元(阻力位)之间窄幅震荡。若日收盘价能成功突破77.61至79.24美元的阻力区,下一关键目标位将是83.75美元。反之,若跌破74.74美元的三角形下轨支撑,价格可能滑向69.17美元。 **基本面利好频传,生态表现强劲** 尽管技术面胶着,Solana的基本面近期表现突出: 1. **RWA资金流入领先**:在过去30天内,Solana以2.54亿美元的净流入额,成为所有区块链中真实世界资产(RWA)资金流入的首选,超过了Stellar等其他链。与此同时,以太坊和BNB链则出现了显著资金外流。 2. **ETF资金流入加速**:Solana相关ETF上周录得1000万美元资金流入,为五月以来表现最佳的一周,显示出机构兴趣的增长。 3. **DEX交易量居首**:过去30天,Solana去中心化交易所(DEX)现货交易量达到456亿美元,位居所有区块链第一,大幅领先于BNB链(380亿美元)和以太坊(242亿美元)。 4. **Robinhood Chain异军突起**:7月1日才启动的Robinhood Chain以141亿美元的月交易量跻身DEX交易量前五,显示出其在代币化资产领域的发展潜力。 **结论与展望** Solana目前正处于技术面与基本面的分化点:其生态系统的采用率和资金流入数据表现强劲,但价格图表尚未决定突破方向。未来几周,价格对77.61至79.24美元关键区域的反应将成为决定下一步走势(上探83.75美元或下探69.17美元)的关键。

cryptonews.ru11分钟前

Solana价格预测看涨至83美元,因Solana在全链RWA资金流入中领先

cryptonews.ru11分钟前

交易

现货

热门文章

如何购买S

欢迎来到HTX.com!我们已经让购买Sonic(S)变得简单而便捷。跟随我们的逐步指南,放心开始您的加密货币之旅。第一步:创建您的HTX账户使用您的电子邮件、手机号码注册一个免费账户在HTX上。体验无忧的注册过程并解锁所有平台功能。立即注册第二步:前往买币页面,选择您的支付方式信用卡/借记卡购买:使用您的Visa或Mastercard即时购买Sonic(S)。余额购买:使用您HTX账户余额中的资金进行无缝交易。第三方购买:探索诸如Google Pay或Apple Pay等流行支付方法以增加便利性。C2C购买:在HTX平台上直接与其他用户交易。HTX场外交易台(OTC)购买:为大量交易者提供个性化服务和竞争性汇率。第三步:存储您的Sonic(S)购买完您的Sonic(S)后,将其存储在您的HTX账户钱包中。您也可以通过区块链转账将其发送到其他地方或者用于交易其他加密货币。第四步:交易Sonic(S)在HTX的现货市场轻松交易Sonic(S)。访问您的账户,选择您的交易对,执行您的交易,并实时监控。HTX为初学者和经验丰富的交易者提供了友好的用户体验。

3.6k人学过发布于 2025.01.15更新于 2026.08.06

如何购买S

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对S(S)币价的意见。

活动图片