# 速度的所有文章

在 HTX 新闻中心浏览与「速度」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

GPT-5.6即将上线,推理狂飙750 Tokens/s,疑似横跨100张晶圆

【导读】GPT-5.6推理速度高达750 tokens/秒,将在芯片公司Cerebras的定制硬件上推出,标志着AI实时交互时代的到来。过去需要数分钟的复杂任务,现在可瞬间完成。 这一速度相当于人类每秒阅读约500-600个汉字。开发者指出,这将彻底改变计算机使用体验,解决大模型在实时多步任务中的延迟瓶颈。传统GPU集群在处理万亿参数模型时面临通信瓶颈,而OpenAI的方案是让硬件与模型深度融合。 GPT-5.6 Sol预计在7月小规模开放,针对愿意为极致速度付费的企业客户。其参数量约3万亿,激活参数约1500亿,网络层数达70-90层。为部署如此庞大的模型,OpenAI与Cerebras采用了一种“一晶圆,一层网络”的震撼方式,将每一层神经网络单独部署在一整张晶圆上,总计可能横跨70-100张晶圆。 为实现高速推理,模型架构可能进行了重构,放弃了传统的重型KV缓存,转而采用类似DeepSeekV4的轻量化缓存或混合SSM设计,以适配Cerebras芯片海量但珍贵的片上SRAM。也有猜测认为,注意力计算可能由GPU处理,而Cerebras晶圆集群专门暴力计算前馈网络部分。 此前,OpenAI还发布了首款自研AI推理芯片Jalapeño,专为大模型推理优化,并兼容行业主流模型,展示了其构建全栈AI生态的野心。通过结合顶尖第三方硬件探索与自研芯片,OpenAI正朝着控制从模型训练到硬件部署的完整产业链迈进,计划建设GW级超级数据中心,用AI加速AI基础设施的迭代。

marsbit07/09 11:53

GPT-5.6即将上线,推理狂飙750 Tokens/s,疑似横跨100张晶圆

marsbit07/09 11:53

智谱凭什么一天暴涨近30%?

智谱(02513.HK)股价单日暴涨近30%,核心触发因素是公司面向企业客户开放的GLM-5.1高速版API,其模型输出速度达到每秒400个token,刷新全球大模型API速度上限。 这一速度约为行业平均水平的3到5倍,意味着每秒可生成约200个汉字,显著提升了AI任务的执行效率。在AI进入Agent(智能体)时代、任务需要模型进行多轮自我调用的背景下,速度成为关键竞争力,直接影响任务完成时间和智能上限。 实现这一突破依赖智谱在推理引擎、并行策略和网络架构三个层面的技术创新: 1. **TileRT推理引擎**:将整个模型编译成持续运行的流水线,避免传统框架中频繁启动和等待的开销,并通过“Warp专门化”让GPU内不同计算组并行工作。 2. **异构并行策略**:针对GLM-5.1采用的MLA注意力机制,让多块GPU分工协作(如有的负责稀疏检索,有的负责密集计算),优化计算流程。 3. **ZCube网络架构**:取代行业标准的树形网络拓扑,采用扁平化互联设计,使得任意两台GPU间通信路径唯一且最短(仅需2跳),从根本上避免了网络拥塞,提升了集群整体吞吐并降低了延迟。 技术升级带来直接效益:在同等GPU投入下,集群吞吐量提升15%,相当于免费获得更多算力;任务尾延迟下降40.6%,提升了稳定性;网络建设成本因精简结构而节省约三分之一。 从行业影响看,智谱的技术路径证明,在相同算力下可以产出更多,这有助于重构GPU之外的基础设施生态。长期可能侵蚀英伟达在网络侧的溢价,利好能够提供高密度交换机的厂商以及国内光模块企业。同时,该纯软件方案理论上可移植到国产AI芯片,有望降低其软件生态门槛。

marsbit05/23 01:22

智谱凭什么一天暴涨近30%?

marsbit05/23 01:22

活动图片