# 硬件的所有文章

在 HTX 新闻中心浏览与「硬件」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

GPT-5.6即将上线,推理狂飙750 Tokens/s,疑似横跨100张晶圆

【导读】GPT-5.6推理速度高达750 tokens/秒,将在芯片公司Cerebras的定制硬件上推出,标志着AI实时交互时代的到来。过去需要数分钟的复杂任务,现在可瞬间完成。 这一速度相当于人类每秒阅读约500-600个汉字。开发者指出,这将彻底改变计算机使用体验,解决大模型在实时多步任务中的延迟瓶颈。传统GPU集群在处理万亿参数模型时面临通信瓶颈,而OpenAI的方案是让硬件与模型深度融合。 GPT-5.6 Sol预计在7月小规模开放,针对愿意为极致速度付费的企业客户。其参数量约3万亿,激活参数约1500亿,网络层数达70-90层。为部署如此庞大的模型,OpenAI与Cerebras采用了一种“一晶圆,一层网络”的震撼方式,将每一层神经网络单独部署在一整张晶圆上,总计可能横跨70-100张晶圆。 为实现高速推理,模型架构可能进行了重构,放弃了传统的重型KV缓存,转而采用类似DeepSeekV4的轻量化缓存或混合SSM设计,以适配Cerebras芯片海量但珍贵的片上SRAM。也有猜测认为,注意力计算可能由GPU处理,而Cerebras晶圆集群专门暴力计算前馈网络部分。 此前,OpenAI还发布了首款自研AI推理芯片Jalapeño,专为大模型推理优化,并兼容行业主流模型,展示了其构建全栈AI生态的野心。通过结合顶尖第三方硬件探索与自研芯片,OpenAI正朝着控制从模型训练到硬件部署的完整产业链迈进,计划建设GW级超级数据中心,用AI加速AI基础设施的迭代。

marsbit07/09 11:53

GPT-5.6即将上线,推理狂飙750 Tokens/s,疑似横跨100张晶圆

marsbit07/09 11:53

Reddit一张神图疯传,2年后,你的笔记本就能跑Fable 5

近日,r/LocalLLaMA社区的一张趋势图引发热议。该图梳理了历代前沿AI模型从云端发布到在消费级硬件上实现同级本地运行的时间间隔:GPT-3级能力约37个月,GPT-3.5级约17个月,GPT-4级约24个月,Claude 3.5 Sonnet/GPT-4o级约21个月,平均周期约为24.8个月。 依据这一趋势线外推,发帖人预测,目前被视为前沿的Fable/Mythos 5级AI能力,预计将在2028年7月左右,实现在高端笔记本电脑上本地、实用化的运行。这意味着未来用户可能无需依赖云端服务、订阅或担心数据隐私,通过一次性硬件投入即可获得顶级AI能力。 支撑该预测的主要因素包括:模型端通过MoE架构、量化技术、更好的强化学习与数据配方持续提升效率,使同等能力所需算力不断下降;现实端开源模型的追赶速度加快,例如Gemma 4 31B等模型已在多项基准测试中逼近甚至超越早期的Claude Opus与GPT-4水平。 这一趋势预示着AI能力正从云端垄断加速向桌面端民主化扩散。尽管当前存在模型访问的地域性管制,但历史表明,前沿能力难以被长期限制在云端。对于开发者、硬件厂商及整个行业而言,本地化、隐私保护、离线工作流等方向将变得愈发重要。最终,这张图以一种乐观的视角指出:技术扩散的时间力量,可能正悄然改变着AI能力的获取格局。

marsbit07/07 07:30

Reddit一张神图疯传,2年后,你的笔记本就能跑Fable 5

marsbit07/07 07:30

第一个用物理做计算原语的大规模生成模型Un-0来了,或将AI能耗降低1000倍?

在AI能耗问题日益成为行业瓶颈的背景下,前Databricks AI负责人Naveen Rao创立的Unconventional AI公司发布了其首个大规模生成模型Un-0。该模型的核心创新在于利用“模拟耦合振子系统”作为计算原语,通过物理系统的自然演化过程来完成图像生成任务,旨在将AI推理能耗降低至现有系统的千分之一。 Un-0的工作原理基于Kuramoto振子模型。成千上万个振子根据其固有频率和相互间的耦合关系,在时间维度上自然演化、同步或形成特定模式。模型的训练主要学习振子间的耦合矩阵和固有频率。生成图像时,系统首先随机初始化振子相位,然后通过条件振子输入类别标签(如“火山”)进行引导,接着让物理系统自由演化,最后在特定时刻读取振子相位状态,并通过一个轻量级解码器将其转换为图像像素。 在ImageNet 64×64数据集上,拥有3.22亿参数的Un-0模型取得了FID 6.74的成绩,其生成质量已接近一些早期主流图像生成模型(如BigGAN、iDDPM)发布时的水平,但与当前最先进的传统模型(如EDM)相比仍有差距。Unconventional AI强调,Un-0并非旨在立即成为性能冠军,而是一个“概念验证”,证明了利用物理动力学系统执行现代AI大规模生成任务是可行的。 该技术路线的长远目标是构建一种新型的非传统计算硬件,将计算与记忆合并于同一物理实体中,从而避免冯·诺依曼架构中数据搬运带来的巨大能耗。Un-0的出现,标志着AI计算范式向利用物理系统固有动力学特性转变迈出了重要一步,为未来实现能效数量级提升的AI硬件开辟了新路径。

marsbit06/26 10:53

第一个用物理做计算原语的大规模生成模型Un-0来了,或将AI能耗降低1000倍?

marsbit06/26 10:53

Dylan Patel:黄仁勋力赞的SemiAnalysis,创始人是“养蜂人”、“贴吧老哥”

SemiAnalysis是一家快速崛起的独立半导体行业投研机构,年营收有望突破1亿美元,其创始人Dylan Patel的经历颇为传奇。他并非科班出身,成长于美国佐治亚州乡村,甚至曾当过养蜂人。他的半导体知识主要通过在Reddit等技术论坛以“贴吧老哥”式交流自学而来。 2020年,Dylan创立了个人博客SemiAnalysis,起初仅为小众技术分享。后在朋友建议下转向付费订阅,并逐渐发展为一个提供深度技术分析、商业咨询和研报的机构。如今,SemiAnalysis已拥有约60人的全球团队,并在美国建立了专业的芯片拆解实验室。 该机构以其硬核、细致的分析在业内建立起极高声誉,甚至能直接影响巨头决策。其关于AMD MI300X GPU软件栈存在问题的批评性报告,曾直接促使AMD CEO苏姿丰与之进行长时间通话,后者公开感谢其“建设性反馈”。随后SemiAnalysis发布的追踪报告也对AMD的改进给予了肯定。 英伟达创始人黄仁勋也曾在公开演讲中引用并称赞其报告。其分析内容时常能引发市场波动,例如近期一份关于英伟达AI服务器内存配置调整的研报被部分解读后,曾导致多家内存概念股股价下跌,尽管Dylan本人称报告原意被断章取义。 从论坛发烧友到受行业巨头尊敬的机构创始人,Dylan Patel与SemiAnalysis的故事,展现了深度、独立的技术分析在当今半导体与AI产业中的关键影响力。

marsbit06/19 01:08

Dylan Patel:黄仁勋力赞的SemiAnalysis,创始人是“养蜂人”、“贴吧老哥”

marsbit06/19 01:08

活动图片