# 大语言模型的所有文章

在 HTX 新聞中心流覽與「大语言模型」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

Karpathy又封神,掀翻RAG,把你的笔记变成第二大脑

前OpenAI联合创始人安德烈·卡帕西提出了一种突破性的知识管理新范式“LLM-Wiki”,旨在解决信息过载时代个人知识库沦为“赛博木乃伊”的困境。他主张将个人笔记视为“不可变源代码”,而让大语言模型扮演“编译器”角色,将其一次性编译成结构化、逻辑自洽且持续更新的个人维基百科。 这一方法从根本上区别于当前主流的检索增强生成技术。RAG在每次查询时临时检索片段拼凑答案,存在无法理解全局、可能自我矛盾、知识链接易腐烂等问题。卡帕西的范式则将知识“编译”一次后持续保鲜,每次新增材料,AI会自动融合更新相关条目、修订综述、标记矛盾,使知识库始终保持鲜活与一致性。 其架构核心在于三层解耦:底层是记录原始灵感的“素材层”,中层是由用户定义格式的“规则层”,顶层则是由AI全权维护、结构化的“维基层”。用户日常只需进行三项操作:投入新素材、查询编译后的知识库,或定期让AI进行知识库“体检”以排查矛盾与缺口。这实现了认知生产关系的根本转移——人类从繁琐的知识搬运、整理与维护工作中解放出来,专注于核心的输入与审阅,而AI则承担了所有“记账”类杂活。 文章指出,这一构想实质上实现了计算机先驱范内瓦·布什在1945年设想的“Memex”记忆机器的愿景,其长久未能实现的核心障碍在于人工维护交叉引用与知识路径的成本过高。大语言模型的出现,近乎零成本地解决了这一维护难题。 卡帕西的“LLM-Wiki”是其关于人机协作系列思考的第三块拼图,其最终目的并非替代人类,而是将人类的注意力从机械的“记账”工作中解放出来,重新聚焦于决定阅读方向与思考深层意义这两件机器无法替代的事情上。

marsbit07/01 09:53

Karpathy又封神,掀翻RAG,把你的笔记变成第二大脑

marsbit07/01 09:53

刚刚,Anthropic发布Sonnet 5,性能接近Opus 4.8,但不一定更便宜

Anthropic 正式发布了 Claude Sonnet 5 模型,称其为迄今为止最具 Agent 属性的 Sonnet 模型,能够在制定计划、使用工具(如浏览器、终端)方面自主运行,其能力水平接近数月前需要更大、更昂贵模型(如 Opus 4.8)才能达到的程度。 相比前代 Sonnet 4.6,Sonnet 5 在推理、工具使用、编程和知识工作等关键维度性能有显著提升。在智能体搜索和计算机使用评测中,其性能曲线表明,在中等努力程度下成本效率显著提升,在更高努力程度下某些任务性能可媲美 Opus 4.8。用户可根据任务需求灵活调整“努力程度”以平衡成本与性能。 安全评估显示,Sonnet 5 在拒绝恶意请求、抵御提示注入攻击、降低幻觉和谄媚行为率方面整体优于 Sonnet 4.6,但失当行为率仍略高于 Opus 4.8 和 Mythos Preview。该模型未针对网络安全任务专门训练,其开发软件漏洞等危险网络能力显著弱于 Opus 4.8,因此 Anthropic 为其默认启用了网络安全护栏。 定价方面,即日起至2026年8月31日提供尝鲜价:输入每百万token 2美元,输出每百万token 10美元。之后恢复为标准定价:输入3美元,输出15美元。Anthropic 同步上调了各平台的速率限制以适应更高“努力程度”模式。需注意,Sonnet 5 采用了新tokenizer,相同内容映射的token数量约为以前的1.0-1.35倍,尝鲜价旨在使过渡期整体使用成本大致持平。 开发者上手反馈称其速度很快且针对Agent优化,在浏览器使用场景下抵御提示注入攻击的能力(成功率仅0.93%)显著优于Opus 4.8(31.5%)和Sonnet 4.6(50.7%)。但也有分析指出,由于token使用量增加,其每项任务运行成本约为2.29美元,比Sonnet 4.6高约2倍,也比Opus 4.8高出约15%,成为运行成本最高的模型之一。

marsbit07/01 00:35

刚刚,Anthropic发布Sonnet 5,性能接近Opus 4.8,但不一定更便宜

marsbit07/01 00:35

给Transformer变个形,LLM竟能变得更聪明

一篇名为《给Transformer变个形,LLM竟能变得更聪明》的文章介绍了一项来自Mila、康奈尔大学和蒙特利尔大学研究者的新工作。该研究提出了“锥形语言模型”概念,其核心思想是:在模型总参数量和计算量不变的前提下,不再为所有网络层均匀分配参数,而是让参数容量(如前馈网络宽度)沿着模型深度方向单调递减。 研究发现,传统Transformer等架构对所有层“一视同仁”的参数分配方式可能并非最优。多项前期研究已表明,模型的浅层和深层在功能与重要性上存在差异。研究者通过实验证实,将更多容量集中到模型前段的“头重脚轻”式分配,相比均匀分配或集中于后段的方案,能显著降低模型在验证集上的困惑度,提升预测准确性。 在440M参数的模型上,最优的余弦递减配置(前段宽度为基准1.5倍,后段为0.5倍)使困惑度改善了1.84点。这一结论在多种不同架构和更大规模的模型上也得到了验证,且未损害模型处理长上下文的能力。分析显示,深层网络更多是在“重复强调”已有信息,而非创造新理解,因此前段层更能有效利用额外容量。 这项研究指出了一个长期被忽视的设计维度:参数容量的分布形状本身就是一个有效的优化杠杆。它为提升模型性能提供了一个几乎零成本的思路,无需改变架构或增加参数,仅需重新分配已有参数。研究者认为,这一思路未来可能同样适用于视觉Transformer、扩散模型等其他领域。

marsbit06/29 12:53

给Transformer变个形,LLM竟能变得更聪明

marsbit06/29 12:53

美国大模型走向封闭,以安全之名

2026年6月,美国政府以安全为由,对前沿AI模型的发布实施管制。Anthropic的最强网络安全模型Mythos 5被要求下架后,仅获准有限恢复至约100家美国机构,其公众版Fable 5恢复时间未定。同时,OpenAI发布的新模型GPT-5.6系列也只对经政府审批的合作伙伴开放API。此事标志着美国政府首次成功介入商业AI模型的发布审批。 然而,涉事公司的安全评估显示,模型并未越过其自设的风险红线。OpenAI评估其模型不具备自主实施端到端网络攻击的能力;Anthropic则反驳政府的担忧基于一个狭窄、非通用的漏洞。行业批评政府的决策缺乏清晰的技术标准和透明的流程。有观点认为,管制行动的背后是模型能力的“可演示性”引发了政治担忧、竞争对手的举报以及新AI行政令寻求执法案例的需求。 文章回顾了上世纪90年代的“密码战争”,当时美国政府试图管制强加密技术的出口,最终因技术扩散无法遏制、损害美国企业竞争力而失败。历史镜鉴提示,对前沿AI的类似管制可能阻碍技术创新与产业投资,并将市场优势让位于以开源开放策略发展的竞争者。 评论指出,一个没有明确标准和时间表的审批流程,可能动摇前沿AI产业的商业逻辑,并将强大工具的访问权集中于少数特权机构,反而可能增加风险。全球开发者社区开始怀念模型自由发布、快速创新的时代,并将更多期待转向持续开放的中国大模型。

链捕手06/27 15:21

美国大模型走向封闭,以安全之名

链捕手06/27 15:21

大神Karpathy用Claude的方式,原来是这样的?

AI大神安德烈·卡帕西(Andrej Karpathy)在加入Anthropic后,开源活动减少。近期,一份据称是他本人使用的`CLAUDE.md`文件在社区流传,旨在指导Claude AI进行更高效的编程协作。该文件强调了一系列核心原则,并非简单建议而是必须遵守的规则,以规避大语言模型写代码时的常见错误。 核心原则包括: 1. **写之前先读**:在编写新代码前,务必认真阅读现有代码库,理解项目风格、既有模式和工具,确保新代码与项目保持一致。 2. **写代码之前先想清楚**:明确任务需求、澄清假设、说明方案取舍,避免基于模糊理解生成错误代码。 3. **保持简单**:抵制过度设计,避免过早抽象、臆想式错误处理和不必要的配置,编写能解决当前问题的最少代码。 4. **外科手术式修改**:修改代码时力求改动范围最小,严格匹配项目现有风格,只清理自己引入的问题,避免无谓的重构和格式化。 5. **验证**:重视测试,修复bug前先写测试复现,确保改动不破坏现有功能。 6. **目标驱动执行**:将模糊任务转化为可验证的具体步骤,并在执行前说明计划。 7. **调试**:遇到问题先深入调查、复现,理解根因,避免盲目添加临时解决方案。 8. **谨慎管理依赖**:添加新依赖前,优先考虑使用现有工具或标准库,并评估其维护状态和成本。 9. **有效沟通**:清晰说明改动内容和原因,主动指出潜在隐患和不确定之处。 文章指出,尽管这份文件的真实性存疑,但其内容高度契合卡帕西本人关于AI编程助手的公开观点。社区已据此提炼出原则并制作了模板,有测试表明能显著降低Claude的代码错误率。这些准则被认为是提升AI辅助编程效率、保证代码质量的关键。

marsbit06/27 07:31

大神Karpathy用Claude的方式,原来是这样的?

marsbit06/27 07:31

活动图片