# GPT的所有文章

在 HTX 新闻中心浏览与「GPT」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

刚刚,Claude Fable 5,又拿第一了

刚刚,Claude Fable 5在最新的MirrorCode AI编程能力排行榜上,以64%的绝对成功率断层式登顶。排名第二的GPT-5.6 Sol成绩仅为它的三分之一。更引人注目的是,Fable 5在处理Go等热门语言与Ada等冷门语言时,解出率分别为64%和61%,相差仅3个百分点,尽管网络上的Python语料量大约是Ada的230倍。这表明顶尖模型可能已不再依赖对特定语言语料的记忆,而是掌握了从零构建完整软件项目的核心能力。 MirrorCode评测环境严苛,模型需在隔离网络且无法查看源码的情况下,通过反复调用和观察原程序来推理并复现其全部功能。评测要求可见与隐藏测试完成率必须达到100%,并允许模型消耗高达100亿Token、连续运行数天以完成任务。例如,在复现一个约1.6万行的生物信息学工具时,Claude Opus 4.7在14小时内通过了2000项测试(完成度99.95%),而人类工程师完成同等任务估计需2到17周。 当前,AI正从编写单段代码转向承担整个项目级任务。例如,已有数百个AI Agent协作编写超百万行浏览器代码,或搭建能编译Linux内核的C编译器。数据显示,大量用户已开始委托AI完成预计超过数小时甚至数日的开发工作。MirrorCode的64%通过率量化了这种“项目级委托”的可行性:只要目标明确且能自动验收,前沿模型已能独立完成部分中大型软件。 这意味着,未来开发者的角色可能从逐行监工转变为在关键节点进行方向和结果的把控。代码的生产成本将越来越低,而清晰定义问题与准确验收结果的能力将愈发珍贵。

marsbit23小时前

刚刚,Claude Fable 5,又拿第一了

marsbit23小时前

GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?

近日,AI领域两大巨头OpenAI和Anthropic的最新顶级模型遭遇重大监管介入。OpenAI刚刚推出的GPT-5.6系列被拆分为Sol(前沿模型)、Terra(均衡模型)和Luna(经济模型)三个版本。其中性能最强的Sol版本并未全面发布,其访问权限被限制在“获批名单”内,绝大多数用户需等待数周才能逐步使用。此举源于监管机构在全美AI安全框架落地前,对具备“类似Mythos”能力的尖端模型进行预先管控。 在此之前,Anthropic的Fable 5模型经历了更剧烈的风波。该模型发布仅72小时后即被全球禁用,原因是其底层技术Mythos在一次闭门演示中展示了强大的网络攻击能力,例如能找出银行系统漏洞并清空账户。经过安全审查,Mythos 5仅向极少数“信任伙伴”有限开放。据报道,即将回归的Fable 5将是“阉割版”,安全护栏被大幅加强,可能导致能力下降和用户体验受限。 行业观察指出,严格的监管可能迫使AI公司对模型进行“脑叶切除”般的深度限制,以通过安全审查。这引发了开发者对“货不对板”的担忧:用户最终获得的可能是一个能力被严重削弱、反应僵化的“傀儡”,而非当初期待的“天才”。同时,模型的获取方式也可能从“付费即用”变为需要严格身份验证或额外收费。这一系列事件标志着AI发展进入“算法配给制”时代,引发对创新与安全平衡的广泛讨论。

marsbit06/29 08:37

GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?

marsbit06/29 08:37

活动图片