# 效率的所有文章

在 HTX 新闻中心浏览与「效率」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

英伟达震撼开源Harness,AI自己爆改AI

英伟达开源了名为“SoL-Pi”的Harness系统,旨在通过AI自我迭代优化来显著降低AI任务执行的成本和资源消耗。该系统基于Pi模型构建,通过自动化流水线让AI充当研究员,分析Agent工作流程,识别并减少不必要的Token消耗。 SoL-Pi的核心是四大效率优化机制: 1. **动作融合**:将文件编辑与后续验证命令合并为一次调用,省去中间模型决策环节。 2. **在线上下文压缩**:动态评估子任务完成后的上下文,仅在预计节省开销覆盖重写成本时执行压缩。 3. **输出归档与索引**:将大文件或长输出归档至本地,上下文中仅保留句柄和摘要,按需分页召回。 4. **小模型初筛日志**:由低成本模型先处理长日志,输出诊断回执,并经严格核验后才提交给主模型,避免幻觉。 测试结果显示,与基础Pi相比,SoL-Pi节省了45%-49%的Token,成本降低约三分之一;与Codex等原配Harness相比,Token节省35%-64%,API调用成本降低50%-54%。在专业研究场景中,每小时可节省8.75至13.5美元。 该成果源于英伟达的高效AI团队,其采用“AI研究AI”的递归自我改进(RSI)流程:从152个候选优化方向中,通过自动实验、评审和验证,最终筛选出4个高效机制。团队展望未来实现“闭环预训练”(由Agent自主收集任务、搭建环境)和“效率复利”(用高效Harness推动更大规模的自动研究循环),以形成成本压缩的复利效应,推动Harness自身的Scaling Law发展。

marsbit昨天 01:41

英伟达震撼开源Harness,AI自己爆改AI

marsbit昨天 01:41

OpenAI展示了自家Jalapeño芯片:加速器效率高出Nvidia 1.5至2倍

2026年8月25日,OpenAI公布了其自研推理加速芯片Jalapeño的首批测试结果。在SemiAnalysis的公开基准测试InferenceX中,搭载该芯片的系统在多个大型语言模型上表现优异:相比Nvidia GB200/GB300系统,其能效(每瓦特算力)提升了1.5-1.9倍,同时响应延迟降低了1.7-3.6倍。对于日均处理海量请求的OpenAI而言,这直接关系到每次推理的成本。 Jalapeño额定功率700瓦,实测负载下稳定功耗约550瓦。一个由128颗芯片组成的单元可提供1.7 Exaflops(百亿亿次)的4位整数算力。该芯片由OpenAI与合作伙伴共同开发:Broadcom负责芯片实现与网络部分,Celestica负责板卡与机架,从设计到流片仅用九个月,计划于2026年底开始部署。 OpenAI与Broadcom达成协议,计划部署总计10吉瓦(GW)的自研加速器,部署工作将持续至2029年底。如此庞大的规模使得功耗和延迟的微小改进都将显著影响电费、冷却、基础设施等总体运营成本。 OpenAI此举旨在控制其最大规模日常推理工作负载的底层硬件架构,从而降低单次请求的总处理成本。与采购通用GPU相比,自研芯片避免了供应商的商业利润加成。Nvidia在2026财年数据中心业务收入增长68%,毛利率高达71.1%,这反映出客户承担了可观的溢价。 更廉价、快速的推理能力使得OpenAI能够支持更复杂的智能体任务、处理更多并发请求,并在不显著扩张数据中心的前提下降低服务成本。这标志着OpenAI将其在AI产业链的控制力,从模型、软件栈和产品,进一步延伸至决定成本的核心硬件架构。 分析认为,Jalapeño案例延续了行业趋势:当推理工作量达到足够大且可预测的规模时,领先公司倾向于转向为自身负载定制的专用芯片,如Anthropic和Midjourney对Google TPU的依赖。然而,这种深度定制也带来了风险:它可能降低应对未来AI架构变化的灵活性,并且将生产依赖于少数合作伙伴(如Broadcom和Celestica),形成了新的供应链风险点。芯片能否在未来几代模型迭代中保持竞争力,仍是未知数。

cryptonews.ru08/30 15:10

OpenAI展示了自家Jalapeño芯片:加速器效率高出Nvidia 1.5至2倍

cryptonews.ru08/30 15:10

OpenAI展示自家芯片Jalapeño:性能较Nvidia芯片提升1.5-2倍

2026年8月25日,OpenAI公布了其自研推理加速芯片Jalapeño的初期测试结果。在公开基准测试InferenceX中,基于新芯片的系统相比使用Nvidia GB200/GB300的系统,在单位功耗下实现的计算量提升1.5-1.9倍,响应延迟降低1.7-3.6倍。测试模型包括GPT-OSS-120B、DeepSeek R1和Kimi K2.5。这对于日处理海量请求的OpenAI而言,直接关系到每项服务的成本。 Jalapeño额定功耗700瓦,在测试负载下持续功耗约550瓦。一个由128颗芯片组成的单元可提供1.7艾(百亿亿)次浮点运算能力(4位精度)。 该芯片是与Broadcom(负责芯片实现和网络部分)和Celestica(负责板卡和机架)合作开发的,从设计到交付生产耗时九个月。计划于2026年底在OpenAI基础设施中部署,并作为其多年平台战略的第一代产品。 与需要服务广泛客户和任务的Nvidia通用加速器不同,Jalapeño专为OpenAI自身产生的、可度量且可随软件栈调整的特定负载(围绕其语言模型、计算核心、数据流、内存和网络交换)而设计。 OpenAI与Broadcom达成协议,计划部署总计10吉瓦(GW)的自研加速器,安装将从2026年下半年持续至2029年底。在此规模下,功耗和延迟的细微差别将转化为巨大的电费、冷却、内存、网络、机架及数据中心占地成本。 OpenAI并未完全转向自研芯片:前沿模型训练仍需外部加速器;Jalapeño的量产依赖制造、内存、封装和组装合作伙伴;公司将继续广泛使用Nvidia等供应商的芯片进行训练和部分推理。其策略核心在于,保留外部供应链,但将最大规模日常计算流的硬件架构控制权掌握在自己手中。 从商业角度看,自研芯片的经济性超越了节能。Nvidia 2026财年数据中心业务营收同比增长68%,毛利率高达71.1%。购买GPU需支付供应商的高额商业利润。OpenAI将芯片作为其服务的内部组件,旨在降低单次查询处理的完全成本,无需为芯片本身支付市场溢价。原本流向通用加速器供应商的部分利润,现可转化为公司自身的节省和额外的计算能力。 更廉价、更快的推理能力使得OpenAI可以执行更长时间的智能体任务、处理更多并发请求,并降低产品费用而无需数据中心规模同比扩张。服务使用量的增长反过来提高了自研平台的利用率,使下一代专用芯片的开发更具经济合理性。 Jalapeño改变了OpenAI在AI基础设施链中的地位,使其在原有模型、软件栈和产品控制权之外,新增了对决定应答成本的处理器架构的控制权。Nvidia仍将主导模型训练和通用加速器市场,但OpenAI最大量的日常工作负载对其而言不再是 guaranteed sale。 从行业模式看,此举符合大型科技公司的发展轨迹:当推理量达到足够大且可预测的规模时,它们会从通用GPU转向为自身负载定制的芯片,正如Anthropic承诺使用百万级Google TPU,Midjourney为节省成本将图像生成迁移至Google Cloud TPU。 然而,该策略也有潜在风险:针对特定模型和软件栈的优化,可能在AI架构变迁时降低灵活性;对Broadcom和Celestica的生产依赖构成了整个九个月开发周期的单一风险点。Jalapeño在两三代模型之后是否仍具竞争力,还是今日针对特定推理的优化会成为明日的限制,尚待观察。

cryptonews.ru08/30 06:55

OpenAI展示自家芯片Jalapeño:性能较Nvidia芯片提升1.5-2倍

cryptonews.ru08/30 06:55

由于AI成本上升,谷歌员工转向使用Gemini 3.8 Flash

据Business Insider报道,谷歌员工已开始在内部编程平台Jetski上测试预览版Gemini 3.8 Flash模型。这证实了AI领域的主要公司正以惊人速度开发兼具创新性与成本效益的模型。 面对AI成本上升,速度至关重要。高德纳预测,全球AI平台和模型支出将在2026年达到642.5亿美元,年增长率达63.4%,企业正更加审慎地关注支出效率。 谷歌正专注于高频次更新和定价竞争。Gemini 3.6 Flash于7月21日推出,3.7 Flash于8月13日发布,间隔仅三周多。CEO皮查伊曾表示,在开发Gemini 4的同时,公司计划以“几乎每月”的速度发布模型。Flash系列被定位为编程和智能体应用的“主力”模型,针对高频使用场景。例如,3.7 Flash的初始定价为输入0.75美元/百万令牌、输出3.75美元/百万令牌,仅为3.6 Flash首发价的一半。 然而,OpenAI的Luna计划定价更低(输入0.20美元,输出1.20美元)。同时,AI基准测试显示,Gemini 3.7 Flash的推理智商指数为56,而GPT-5.6 Sol为61,Claude Fable 5为62。 市场分析指出,尽管AI支出激增,企业预算正受到更严格审查,更关注效率、成本控制和可衡量结果。数据显示,即使像Claude Fable 5这样高性能的模型(定价输入10美元,输出50美元/百万令牌),在企业实际采购中也只占其供应商收入的较小份额。这表明企业愿意为基本生产能力支付的费用存在上限,更青睐“足够好、快速且廉价”的模型,这正是谷歌试图抢占的市场区间。 目前,谷歌官方尚未确认Gemini 3.8 Flash的公开发布日期,相关信息仍基于媒体爆料。鉴于AI市场模型名称和发布日期时常变动,最终信息仍需等待官方确认。

cryptonews.ru08/28 18:57

由于AI成本上升,谷歌员工转向使用Gemini 3.8 Flash

cryptonews.ru08/28 18:57

观点:美股的价值投资,不等于基本面投资

本文以天文学中的“标准烛光”概念为引,探讨了美股投资中估值倍数所混淆的两个关键变量:企业真实质量与市场赋予的溢价。作者指出,远期回报约等于基本面增长乘以估值倍数变化,而许多投资者错误地将市场估值(即“视亮度”)直接等同于企业内在价值(即“真实光度”)。 文章批判了当前流行的一种观点,即“基本面已死”,认为只需买入并持有科技巨头(如“美股七雄”)就能轻松获利。作者承认这些公司盈利增长强劲,但强调其股价表现很大程度上是估值倍数扩张的结果。他通过一个四象限矩阵(昂贵/便宜 vs. 事后看正确/错误)来分析历史案例,例如1999年的思科(昂贵且错误)与2015年的亚马逊(昂贵但正确),以及2022年的Meta(便宜且正确)。 作者认为,随着市场由叙事和动量驱动、头部集中度加剧以及私人市场吸收更多极端估值公司,区分企业质量与市场情绪溢价的能力变得更为关键,市场可能正在变得更低效而非更高效。真正的超额收益(Alpha)来源于识别并利用这种认知差异,而不是盲目追随“只买龙头”的共识。最终,投资成功取决于能否准确拆解估值倍数中蕴含的企业久期(增长持续性)和质量,避免为过度透支的未来增长付费,或错过因市场情绪错杀而出现的廉价优质资产。

marsbit08/21 05:26

观点:美股的价值投资,不等于基本面投资

marsbit08/21 05:26

活动图片