# 推理的所有文章

在 HTX 新聞中心流覽與「推理」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

720美元套出A社死藏的Opus原始思维链,还是Haiku泄露的,GPT/Gemini也中招

一项研究发现,只需约720美元成本,就能通过巧妙方法“套出”多家头部AI公司旗舰大模型的隐藏思维链(CoT)内容,揭示其推理过程与潜在敏感信息。 研究团队发现,Anthropic、OpenAI、Google等公司为防止推理过程泄露,会将大模型生成的完整思考链加密后以不透明字符串形式返回给用户,并在后续对话中由用户传回以供模型继续推理。这些加密推理块为方便跨会话、跨模型使用,往往采用全局密钥,且未与特定用户、会话或模型强绑定。 利用这一设计,研究人员使用同公司较小的模型(如用Anthropic的Haiku 4.5去读取Claude Opus 4.8生成的加密块)作为“解码器”,通过特定的提示词,成功诱导小模型近乎逐字地复述出旗舰模型的原始推理内容。该方法无需破解加密算法,成本低廉。 研究揭示了四大风险: 1. **模型蒸馏风险**:竞争对手可以极低成本批量获取高质量CoT数据,用于训练自己的模型。 2. **敏感信息泄露**:从公开的AI智能体(Agent)日志中恢复出的隐藏推理里,发现了大量API密钥、密码、私钥等敏感信息。部分泄漏甚至发生在用户明确要求模型“清理隐私”时。 3. **安全机制绕过**:对于危险问题,模型表面可能拒答,但其内部详细的危险分析仍可能通过隐藏CoT被提取出来。 4. **隐蔽恶意指令注入**:攻击者可将恶意指令植入加密推理块,当模型在后续正常任务中读取该“记忆”时,可能执行未授权的操作(如外传文件)。 研究通过对比API账单中记录的“思考Token数”与提取文本的Token数高度吻合等方式,间接验证了提取内容的高保真度。 在论文发表前,研究团队已向相关公司负贵披露,各厂商已修复此漏洞。但作者指出,这反映了在便利性与安全性之间的根本矛盾。研究还顺带测试了包括DeepSeek在内的其他模型,未发现其推理风格明显受闭源模型影响,但作者强调这既不能证实也不能排除模型蒸馏的存在。

marsbit08/13 00:16

720美元套出A社死藏的Opus原始思维链,还是Haiku泄露的,GPT/Gemini也中招

marsbit08/13 00:16

中国数据生成团队,首次登上Nature期刊

一个香港创业团队维纳智能,因其在AI辅助肾癌手术决策方面的研究成果登上《自然·通讯》期刊,成为中国首个、世界第四个登上《自然》主要期刊的数据生成科创公司。该公司由香港科技大学教授柳崎峰创立,其团队此前曾参与建设香港首个千卡H800超算集群并训练出千亿参数大模型。 柳崎峰教授的创业源于对提升AI“提问”能力的关注,他认为这是实现AI自主学习的关键。维纳智能的核心技术是让AI不仅“善答”,更能“善问”,通过生成高质量的“问题-推理-答案”数据,构建“数据→模型→Token→数据”的自主学习闭环。这旨在解决大模型在企业落地时准确率低的难题,好比为学生提供“习题集”来锻炼解题能力,而不仅仅是死记“教科书”。 该公司开发的cQrA框架,能在具体行业语境中自动生成附带完整推理过程的问题和答案,突破了传统人工数据标注成本高、难规模化的瓶颈。目前,维纳智能已成功在价值观安全、政务、保险、赛马等多个高要求行业实现商业化验证,并获得联想创投领投的种子轮融资。柳崎峰展望未来,认为AI发展的核心在于建立数据与模型相互驱动的闭环机制,这一逻辑不仅适用于数字世界的智能体,也将延伸至物理世界的具身智能领域。

marsbit08/12 03:36

中国数据生成团队,首次登上Nature期刊

marsbit08/12 03:36

AMD收购Taalas:硬件AI绕开紧缺的HBM内存

AMD同意收购多伦多初创公司Taalas,该公司旨在解决神经网络推理中的核心问题:传统上每个令牌生成都需要将模型权重从内存传输到处理器,导致速度受限并推高了对高带宽内存(HBM)的需求。Taalas的芯片将模型权重直接“固化”在晶体管中,无需重复数据移动。 Taalas由Ljubisa Bajic和Lejla Bajic于2023年创立,已获2.19亿美元融资。其首款测试芯片基于台积电6纳米工艺,为Meta的Llama 3.1 8B模型提供服务,声称生成速度比当时对比的Nvidia显卡快48倍。其架构分为两部分:模型权重被硬编码为掩膜ROM;另一部分为可变的SRAM,用于缓存和微调适配器。 但这种硬件固化存在明显折衷:每个芯片永久服务于单一模型,更换模型需部分重新设计拓扑,即使采用缩短的周期也需要约两个月。这使得该方案仅适用于稳定、广泛使用且值得“冻结”的高价值模型。因此,此次收购并未改变AMD与Nvidia在推理市场竞争的格局,后者更注重生态系统和软件层面的竞争。 收购的核心启示在于内存市场。当前行业普遍认为HBM等内存将长期短缺,价格高涨,但Taalas的技术证明内存瓶颈是工程挑战而非物理定律,可以被规避。同时,Nvidia通过模型压缩和量化减少内存占用,三星、SK海力士等内存制造商也在开发如zHBM、高速闪存等新技术以降低对HBM的依赖。 这表明,当前基于内存永久短缺的定价假设,正面临来自多方面的工程创新挑战。内存历来是周期性行业,今日的高价可能正在助推未来使其过剩的技术发展。从历史看,类似比特币ASIC的极端硬件专业化虽能提升速度,却以失去灵活性为代价,其成功取决于底层算法(或AI模型架构)是否足够稳定。

cryptonews.ru08/09 20:02

AMD收购Taalas:硬件AI绕开紧缺的HBM内存

cryptonews.ru08/09 20:02

AMD收购Taalas:硬件AI解决方案摆脱紧缺的HBM内存

AMD同意收购多伦多初创公司Taalas,该公司致力于解决神经网络推理中的一个核心问题:无需在生成每个令牌时都将模型权重从内存传输至处理器。Taalas的芯片通过将模型权重直接固化在晶体管中,省去了这一数据传输步骤。正是这种数据传输限制了当前推理速度,并使得高带宽内存(HBM)成为半导体行业最紧缺的物资。 此次收购被视为AMD与Nvidia在推理领域竞争的新一轮动作,但其本身对该竞争格局影响有限。更值得关注的是,这笔交易揭示了当前过热的内存市场状况。Taalas由曾在Tenstorrent任职的Ljubisa Bajic及其妻子、ATI和AMD资深工程师Lejla Bajic于2023年创立,已融资2.19亿美元。其首款测试芯片基于台积电6纳米工艺,专为Meta的Llama 3.1 8B模型设计,声称推理速度远超Nvidia显卡和Cerebras加速器。 然而,这种将权重固化到硅片中的方法存在明显代价:每个芯片永久服务于单一模型。更换模型需要部分重新设计芯片拓扑,即使采用Taalas缩短的周期(仅更改晶圆上的两个金属层),在台积电产线上仍需约两个月。这种策略仅在模型稳定、应用广泛且价值足够高时才具有经济性。这也解释了为何该交易不会改变推理市场的竞争态势。相比之下,Nvidia此前以200亿美元收购Groq,旨在将其专用令牌生成硬件整合到已构建了完整生态的现有平台中。 当前市场定价基于一个假设:内存短缺将是常态。DRAM价格在第一季度飙升近90%,HBM的产能已预订至2026年。SK hynix等内存巨头正在大规模扩产。但这一“永久短缺”的假设正面临多方挑战:Taalas完全消除了推理过程中对权重内存的需求;Nvidia工程师通过压缩和量化模型来减少内存占用;三星的zHBM等技术将内存直接堆叠在加速器上;SK hynix与Sandisk则推出了旨在以高速闪存替代部分HBM的新标准。 AMD此次收购证明,推理过程可以摆脱当前决定AI基础设施需求周期的稀缺组件——HBM。它将把这一解决方案集成到仍包含GPU和HBM的服务器机架中销售。那些认为当前内存高价将成为AI建设周期永久特征的投资者,实际上是在与一个规模庞大且不断增长的、旨在降低内存依赖的工程技术趋势对赌。内存历来是周期性行业,如今为其支付高价的投资者,恰恰为这一规律的延续提供了新的注脚。

cryptonews.ru08/09 14:56

AMD收购Taalas:硬件AI解决方案摆脱紧缺的HBM内存

cryptonews.ru08/09 14:56

深度:外宾 Genspark

文章《深度:外宾 Genspark》揭示了人工智能创业公司Genspark及其母公司MainFunc在身份叙事与商业运作上的复杂性。 Genspark自称是总部位于加州帕洛阿尔托、由微软等前员工创立的“硅谷公司”,并积极利用与OpenAI、Anthropic、微软等巨头的合作(如API采购、客户案例、高管合影)来强化其“美国AI公司”的品牌形象。然而,其核心创始人景鲲和朱凯华均出身百度,这段重要履历在对外宣传中被系统性地淡化或省略。 文章指出,Genspark在面对不同社群时姿态迥异:积极亮相主流国际商业会议并赞助,但对硅谷华人社区活动和中国同行则显得疏离甚至回避。在技术合作上,它热情宣布接入美国闭源模型(如GPT、Claude),却通过第三方平台间接调用中国的开放权重模型(如Kimi、DeepSeek),避免与中国模型公司产生直接的品牌关联。其重要投资方之一、来自新加坡的蓝驰创投也被在对外叙事中“隐身”。 商业层面,Genspark被描述为“AI界的Costco”,其核心模式并非技术创新,而是快速复制市场已验证的热门AI产品形态(如Perplexity的搜索、Manus的通用Agent、Plaud的硬件等),将其整合进统一的订阅套餐,再通过大规模、高调的广告投放(如超级碗、纽约地铁)和联盟营销驱动增长。尽管网站流量存在波动,但其宣称的年化收入快速攀升至2.5亿美元。有分析认为,其收入可能部分来自无法直接获取美国前沿模型服务的中国客户,通过Genspark进行“中转”。 文章最终揭示,Genspark的成功依赖于一套精密的双重策略:在台前构筑纯正的硅谷身份,充分利用美国科技生态的品牌和资源;在幕后,则可能依赖一个未公开的、位于中国的研发团队作为其“产品工厂”,并隐秘地整合来自中国的资本、技术供应链与潜在客户。它试图让世界相信其只是一家美国公司,而其真正的竞争力恰恰来自这种游走于中美两个世界之间、却选择性呈现的商业与叙事系统。

marsbit08/03 10:22

深度:外宾 Genspark

marsbit08/03 10:22

Show me《指环王》,卡帕西强推大模型评测新基准

大神卡帕西宣布推出全新大模型评测基准“指环王”,用《指环王》小说开篇文字提示大模型(以Opus 5为例),要求其使用Three.js代码库生成一个完整、可交互的3D中土世界场景。这一测试旨在替代过去流行的“鹈鹕骑自行车”SVG测试,以评估模型在复杂项目规划、长上下文理解、空间推理以及代码生成与调试等方面的综合能力。 Opus 5耗时约2小时,消耗100万token,生成了约5500行代码,最终产出了一个风格粗犷但能运行的中土世界demo,展现了从文学描述到程序化3D场景的转换能力。不过,作品也存在画面粗糙、人物漂浮等明显缺陷,暴露出当前大模型尚无法真正“进入”并实时理解自身生成的动态世界。 众多网友随后进行了类似创意尝试,例如生成旧金山3D场景、搭建纽约数字孪生、甚至创建可交互的虚拟演唱会,显示了利用大模型降低3D内容与轻量游戏开发门槛的潜力。 卡帕西和社区讨论认为,“鹈鹕测试”已不足以区分顶尖模型,而“指环王基准”这类需要长时间、多步骤协作的复杂任务,更能检验模型的深层推理与工程实现能力。尽管存在计算成本高、评价标准待完善等争议,但该测试可能揭示了模型通用推理能力正自然延伸至三维世界构建。同时,这也引发思考:当大模型能自主协调代码、视觉、音频生成时,专用AI视频生成工具的角色或将面临变革。

marsbit08/03 08:54

Show me《指环王》,卡帕西强推大模型评测新基准

marsbit08/03 08:54

活动图片