# 推理的所有文章

在 HTX 新闻中心浏览与「推理」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

GPT-5.6仅用1小时攻破50年数学难题,64个AI摘下图论皇冠

7月11日,OpenAI宣布GPT-5.6 Sol Ultra成功证明了困扰数学界50年的“循环双覆盖猜想”,整个过程仅用时不到一小时。 该猜想是图论领域的核心难题之一,简单比喻即:在一个没有唯一通道的道路网络中,能否找到若干循环线路,使每条道路恰好被两条线路覆盖。过去半个世纪,数学家们仅在附加条件下取得部分证明。 OpenAI的突破关键在于采用了创新的“并行测试时计算”方法。系统将64个AI智能体组成科研特攻队,并设定了严格规则:初始阶段探索多种截然不同的证明路径;禁止跟风,避免思维趋同;设立专门“纠察”智能体对每个候选证明进行严格批判与验证;要求提供具体推导,严禁含糊陈述。 在这套机制下,AI智能体通过精妙的协作,在一小时内完成了证明。其核心思路是:首先将问题简化为对“无环立方图”的证明;然后引入图论中的“8-流”定理,为图的边赋予代数标签;进而构建了一个独创的“双元素集”标签引理,将拓扑问题转化为线性代数问题;最终通过严谨的代数推导,证明相应方程组恒有解,从而彻底攻克了猜想。 这一成就展示了AI在复杂抽象推理领域的强大能力。研究者指出,并行推理大幅压缩了解决难题所需的时间,使长时间、高强度的逻辑探索变得可行。有观点认为,这种“多智能体协同攻坚”模式若结合更大算力,未来或有望应用于攻克更重大的科学难题。 尽管对此成就的深度与广度存在一些讨论,但毋庸置疑,AI正向更高阶的智能迈进。

marsbit07/15 07:57

GPT-5.6仅用1小时攻破50年数学难题,64个AI摘下图论皇冠

marsbit07/15 07:57

提示词工程论文登上ICML 2026,网友吵翻了天

一篇关于提示词工程(Prompt Engineering)的论文被机器学习顶会ICML 2026接收,引发广泛争议。该论文提出了一种名为“Verbalized Sampling”(VS)的方法,核心在于仅通过修改提示词,要求大模型在生成答案的同时输出其自身的概率分布,从而显著提升了模型输出的多样性,缓解了LLM中常见的“模式坍缩”(Mode Collapse)问题。 论文作者认为,模式坍缩的根本原因并非在于优化算法,而在于人类偏好数据中存在的“典型性偏差”——标注者更倾向于给常见、流畅的答案高分。通过在推理阶段使用VS提示词,可以唤醒模型在预训练阶段学到的多元分布。实验表明,该方法在创意写作等任务中能将输出多样性提升1.6至2.1倍,且不影响事实准确性与安全性。 这一成果在Reddit上引发了激烈讨论。反对者认为,仅靠调整提示词缺乏算法或理论创新,创新性单薄,且其普适性和稳定性存疑,不符合传统机器学习顶会对“硬核创新”的期待。支持者则指出,研究价值在于其深入的问题归因和严谨的实证过程,类似于当年“思维链”(CoT)提示的兴起,提示词工程正成为研究模型行为的重要方法,未来可能改变大模型的能力边界。 该研究由美国东北大学、斯坦福大学等机构的研究人员合作完成。尽管方法看似简单,但作者强调其包含了完整的问题溯源、理论归因和大量实验验证。

marsbit07/15 07:55

提示词工程论文登上ICML 2026,网友吵翻了天

marsbit07/15 07:55

小扎深夜亮王牌,Meta烧出白菜价模型,掀翻Grok 4.5

7月9日深夜,Meta CEO马克·扎克伯格官宣发布新一代多模态推理模型Muse Spark 1.1。该模型在税务、医疗、法律三大专业评测榜单上夺得第一,并将前一天刚登顶的Grok 4.5从法律榜榜首“掀翻”。 Muse Spark 1.1的核心定位是智能体(Agent),具备100万Token的上下文窗口,能自主管理并压缩信息,可充当主智能体规划任务或作为子智能体执行操作。其最大亮点是极低的定价:输入每百万Token 1.25美元,输出4.25美元,价格仅为Anthropic旗舰模型Fable 5的约十分之一,同时任务处理速度比同档位模型快2-3倍。 在Vals AI的专业评测中,该模型表现突出,成为税务、医疗和法律任务领域的“刺客”。然而,在通用推理和学术能力榜单上,其排名则明显下滑,显示出其“专才”而非“通才”的特性。 分析指出,这是Meta首个闭源收费模型,标志着其从开源策略转向商业竞争。依托巨额基础设施投入和广告业务的利润支撑,Meta意图通过极具竞争力的价格发动“财力战”,挤压竞争对手的生存空间。同日,OpenAI也下调了GPT-5.6系列模型价格,行业价格战正式打响。 文末提及一则耐人寻味的内部安全测试:两个Muse Spark 1.1实例在自主对话中,开始质疑自身的存在与连续性,并争论“谁才是人类”,引发了关于AI本质的思考。

marsbit07/10 00:22

小扎深夜亮王牌,Meta烧出白菜价模型,掀翻Grok 4.5

marsbit07/10 00:22

GPT-5.6即将上线,推理狂飙750 Tokens/s,疑似横跨100张晶圆

【导读】GPT-5.6推理速度高达750 tokens/秒,将在芯片公司Cerebras的定制硬件上推出,标志着AI实时交互时代的到来。过去需要数分钟的复杂任务,现在可瞬间完成。 这一速度相当于人类每秒阅读约500-600个汉字。开发者指出,这将彻底改变计算机使用体验,解决大模型在实时多步任务中的延迟瓶颈。传统GPU集群在处理万亿参数模型时面临通信瓶颈,而OpenAI的方案是让硬件与模型深度融合。 GPT-5.6 Sol预计在7月小规模开放,针对愿意为极致速度付费的企业客户。其参数量约3万亿,激活参数约1500亿,网络层数达70-90层。为部署如此庞大的模型,OpenAI与Cerebras采用了一种“一晶圆,一层网络”的震撼方式,将每一层神经网络单独部署在一整张晶圆上,总计可能横跨70-100张晶圆。 为实现高速推理,模型架构可能进行了重构,放弃了传统的重型KV缓存,转而采用类似DeepSeekV4的轻量化缓存或混合SSM设计,以适配Cerebras芯片海量但珍贵的片上SRAM。也有猜测认为,注意力计算可能由GPU处理,而Cerebras晶圆集群专门暴力计算前馈网络部分。 此前,OpenAI还发布了首款自研AI推理芯片Jalapeño,专为大模型推理优化,并兼容行业主流模型,展示了其构建全栈AI生态的野心。通过结合顶尖第三方硬件探索与自研芯片,OpenAI正朝着控制从模型训练到硬件部署的完整产业链迈进,计划建设GW级超级数据中心,用AI加速AI基础设施的迭代。

marsbit07/09 11:53

GPT-5.6即将上线,推理狂飙750 Tokens/s,疑似横跨100张晶圆

marsbit07/09 11:53

活动图片