# 大语言模型的所有文章

在 HTX 新聞中心流覽與「大语言模型」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

大模型能写出工业级优化算法吗?MIT提出FrontierOR给AI设下考场

麻省理工学院等机构的研究者推出了FrontierOR基准,用于评估大语言模型(LLM)设计大规模优化算法的能力。该基准不同于传统测试建模或调用求解器的任务,重点考察LLM能否像运筹学(OR)专家一样,针对复杂工业问题结构,自主设计出可扩展、高效且高质量的算法,例如分解、启发式搜索或混合策略。 FrontierOR包含180个源自OR学术文献的真实任务,并筛选出50个更具挑战性的“Hard”子集。评测采用两阶段流程:首先生成的算法需通过小实例的可行性预筛,然后在工业级规模的大实例上评估其解质量、速度及综合质效(QTE)。 实验结果显示,顶尖模型如GPT-5.3、Claude Opus 4.6等,在代码可执行性上已接近上限,但要在Hard任务上生成同时满足高质量和高速度的算法仍很困难。分析表明,能力较强的模型已减少基础建模错误,失败模式转向搜索深度与策略设计不足。此外,研究测试了三种自演化框架(如CORAL),发现通过迭代优化,LLM生成的算法性能可显著提升,在部分最难任务上QTE指标能从0.15提升至0.50。 这项工作标志着LLM-for-OR的研究重心正从“能否建模”转向“能否设计算法”,为开发能自主设计优化算法的AI智能体指明了方向,未来可能在供应链、能源、交通等领域实现更智能的决策支持系统。

marsbit07/10 09:08

大模型能写出工业级优化算法吗?MIT提出FrontierOR给AI设下考场

marsbit07/10 09:08

小扎深夜亮王牌,Meta烧出白菜价模型,掀翻Grok 4.5

7月9日深夜,Meta CEO马克·扎克伯格官宣发布新一代多模态推理模型Muse Spark 1.1。该模型在税务、医疗、法律三大专业评测榜单上夺得第一,并将前一天刚登顶的Grok 4.5从法律榜榜首“掀翻”。 Muse Spark 1.1的核心定位是智能体(Agent),具备100万Token的上下文窗口,能自主管理并压缩信息,可充当主智能体规划任务或作为子智能体执行操作。其最大亮点是极低的定价:输入每百万Token 1.25美元,输出4.25美元,价格仅为Anthropic旗舰模型Fable 5的约十分之一,同时任务处理速度比同档位模型快2-3倍。 在Vals AI的专业评测中,该模型表现突出,成为税务、医疗和法律任务领域的“刺客”。然而,在通用推理和学术能力榜单上,其排名则明显下滑,显示出其“专才”而非“通才”的特性。 分析指出,这是Meta首个闭源收费模型,标志着其从开源策略转向商业竞争。依托巨额基础设施投入和广告业务的利润支撑,Meta意图通过极具竞争力的价格发动“财力战”,挤压竞争对手的生存空间。同日,OpenAI也下调了GPT-5.6系列模型价格,行业价格战正式打响。 文末提及一则耐人寻味的内部安全测试:两个Muse Spark 1.1实例在自主对话中,开始质疑自身的存在与连续性,并争论“谁才是人类”,引发了关于AI本质的思考。

marsbit07/10 00:22

小扎深夜亮王牌,Meta烧出白菜价模型,掀翻Grok 4.5

marsbit07/10 00:22

ACL 2026华人霸榜,最佳论文一作全华人,杰出论文几乎包场

ACL 2026计算语言学顶会于7月在美国圣地亚哥举行,规模创历史新高,共收到12148篇投稿,同比增长45%。本届会议被大语言模型(LLM)主题主导,相关词汇在论文标题中出现频率极高。 会议评选出三篇最佳论文,一作均为华人学者: 1. 《The Imperfective Paradox in Large Language Models》:通过“未完成体悖论”这一经典语言学现象测试大模型,发现开源模型普遍存在“目的论偏见”,即倾向于认为有目标的动作都会完成,揭示了模型更像“叙事预测引擎”而非逻辑推理者。 2. 《Memory efficiency and resource-rational encoding in sentence processing》:通过为Transformer模型添加工作记忆约束(注入噪声),迫使模型学习更高效地分配有限的记忆资源。结果发现,这种约束让模型的阅读节奏更接近人类,并促成了更压缩、更范畴化的表征。 3. 《Characterizing the Expressivity of Local Attention in Transformers》:利用形式语言理论解释了为何“局部注意力”机制在节省计算成本的同时,常能提升模型效果。研究表明,局部注意力引入了新的表达能力,与全局注意力互补,结合使用能获得最丰富的表达力。 此外,会议还评选了18篇杰出论文,华人在其中占据显著比例,尤其在强化学习、大模型安全与智能体等热门方向成果突出。 本届ACL数据显示,中国大陆作者占比高达54.0%,美国以18.4%位列第二。会议投稿量、审稿规模及参会人数均大幅增长,体现了该领域的空前繁荣与激烈竞争。

marsbit07/09 11:56

ACL 2026华人霸榜,最佳论文一作全华人,杰出论文几乎包场

marsbit07/09 11:56

GPT-5.6即将上线,推理狂飙750 Tokens/s,疑似横跨100张晶圆

【导读】GPT-5.6推理速度高达750 tokens/秒,将在芯片公司Cerebras的定制硬件上推出,标志着AI实时交互时代的到来。过去需要数分钟的复杂任务,现在可瞬间完成。 这一速度相当于人类每秒阅读约500-600个汉字。开发者指出,这将彻底改变计算机使用体验,解决大模型在实时多步任务中的延迟瓶颈。传统GPU集群在处理万亿参数模型时面临通信瓶颈,而OpenAI的方案是让硬件与模型深度融合。 GPT-5.6 Sol预计在7月小规模开放,针对愿意为极致速度付费的企业客户。其参数量约3万亿,激活参数约1500亿,网络层数达70-90层。为部署如此庞大的模型,OpenAI与Cerebras采用了一种“一晶圆,一层网络”的震撼方式,将每一层神经网络单独部署在一整张晶圆上,总计可能横跨70-100张晶圆。 为实现高速推理,模型架构可能进行了重构,放弃了传统的重型KV缓存,转而采用类似DeepSeekV4的轻量化缓存或混合SSM设计,以适配Cerebras芯片海量但珍贵的片上SRAM。也有猜测认为,注意力计算可能由GPU处理,而Cerebras晶圆集群专门暴力计算前馈网络部分。 此前,OpenAI还发布了首款自研AI推理芯片Jalapeño,专为大模型推理优化,并兼容行业主流模型,展示了其构建全栈AI生态的野心。通过结合顶尖第三方硬件探索与自研芯片,OpenAI正朝着控制从模型训练到硬件部署的完整产业链迈进,计划建设GW级超级数据中心,用AI加速AI基础设施的迭代。

marsbit07/09 11:53

GPT-5.6即将上线,推理狂飙750 Tokens/s,疑似横跨100张晶圆

marsbit07/09 11:53

OpenAI最终能否盈利?

近期,OpenAI与Anthropic启动IPO计划,市场估值近万亿美元,反映出对其盈利前景的高度乐观。然而,收入高速增长并不等同于盈利。目前尚无大模型厂商在纯模型业务上实现独立盈利。文章分析认为,厂商能否持续盈利取决于市场结构与竞争格局。 当前大模型API调用市场呈现垄断竞争特征:厂商数量众多、市场集中度低、用户价格敏感度高且转换成本低。尽管市场需求呈指数级增长,但因进入壁垒相对较低,供给快速扩张,导致竞争激烈,多数厂商处于亏损状态。理论上,厂商可通过技术或场景差异化获得短期超额利润,但由于技术壁垒有限、用户粘性不强,这种利润难以维持。 长期看,亏损厂商可能退出,市场或向寡头垄断演化。但即便形成寡头格局,盈利仍不确定,取决于厂商间是价格竞争还是数量竞争。若无法协调策略或建立有效壁垒,前期巨额研发投入未必能收回。 因此,尽管大模型技术价值与需求增长明确,但单纯“卖token”的商业模式不一定能保证长期盈利。投资者需冷静审视估值,厂商则应仔细选择商业模式和细分市场。其中,“AI+”模式(将AI能力嵌入现有产品或服务)可能通过提升产品价值和客户粘性,形成更可持续的盈利模式。此外,API聚合平台凭借双边网络效应,也可能构建更稳固的商业壁垒。

marsbit07/09 10:30

OpenAI最终能否盈利?

marsbit07/09 10:30

刚刚,Claude Fable 5续命5天,省钱攻略来了

7月7日,Anthropic突然宣布将其最强模型Claude Fable 5的限时免费访问期延长至7月12日,为用户提供了额外五天的免费使用时间。免费额度为每周使用限额的50%,超出部分需购买积分。 此前,社区已涌现各种“抢救”Fable 5的指南。开发者Alex Prompter提供了将Fable 5的“思考方式”通过提示词抽取并移植到Opus 4.8的方法。另一位开发者Machina则总结了五个步骤来“榨干”Fable 5的能力,核心思想是将其知识迁移训练成本更低的小模型。 与此同时,Anthropic官方亲自推荐了两套节省成本的架构方案: 1. **顾问模式**:让主力模型Sonnet 5执行任务,仅在关键决策节点咨询Fable 5。在SWE-bench Pro测试中,该组合以约63%的成本取得了Fable 5单模型约92%的性能。 2. **编排者模式**:让Fable 5担任指挥官,负责规划和任务拆分,将具体的、需大量读取Token的研究工作分配给多个Sonnet 5子智能体并行处理。在BrowseComp测试中,该组合实现了单模型96%的性能,但成本大幅降至46%。 Anthropic通过一个核查全美十大国家公园政策的实例展示了编排者模式的效率:团队方案成本约1.61美元,耗时194秒;而单Fable 5方案成本约4美元,耗时608秒。团队方案在成本降低约2.5倍的同时,速度还快了3倍。 文章指出,Anthropic通过此次延期传递的核心信息是:顶级模型的正确用法并非全程使用,而是将其作为决策大脑,与成本更低的模型协同工作,从而实现高性能与低成本的平衡。

marsbit07/08 00:54

刚刚,Claude Fable 5续命5天,省钱攻略来了

marsbit07/08 00:54

百姓网创始人:大语言模型吞噬一切,这话我信一半

百姓网创始人王建硕对“大语言模型吞噬一切”的观点持保留态度。他认为这种说法过于笼统,类似于过去“互联网吞噬一切”的预言,但事实上任何技术都无法真正覆盖所有领域。他强调大模型更像是一个重要的“基座”,如同电力或互联网基础设施,为上层应用提供基础的智能能力。 然而,仅有基座是不够的。他以电力为例:电本身不能洗衣服,需要与洗衣机结合才能发挥作用。同样,大模型的智能必须嵌入到面向具体场景的应用(如代码生成、设计、写作等工具)中,通过与操作系统、其他能力(如代码执行、数据访问)结合,才能解决实际问题。当前出现的一层“接口”或“连接器”(如Harness),正是为了将通用智能适配到特定任务。 他承认大模型会深刻影响并可能取代大量现有软件,尤其是那些由固化规则、表单和工作流构成的系统(如CRM、HIS等),因为这正是大模型所擅长的。但这不意味着吞噬一切。客户信息、实际执行能力、信任关系和物理世界要素等不会被替代。更重要的是,在吞噬掉部分旧有软件层之后,反而会催生出全新的、界面更流式、规则更灵活的新型软件,开启更大的创新空间。 王建硕指出,人们常因视野局限而高估技术的短期影响,低估其长期潜力。他主张应聚焦于大模型作为基座稳定后,上层各种具体应用所带来的巨大机会,而非纠结于是否“吞噬一切”。在技术变革中找到其中真正的机会,才是关键。

链捕手07/07 13:48

百姓网创始人:大语言模型吞噬一切,这话我信一半

链捕手07/07 13:48

活动图片