# 大语言模型的所有文章

在 HTX 新闻中心浏览与「大语言模型」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

拆开Claude大脑也没用,AI黑箱真正的钥匙,藏在本体工程

文章《拆开Claude大脑也没用,AI黑箱真正的钥匙,藏在本体工程》探讨了AI可解释性研究的新方向。文章以Anthropic公司发现Claude模型内部“J-Space”神经活动区为例,指出当前主流的内在主义研究路径(即试图观测和解释模型内部状态)存在根本局限:它无法触及模型输出背后的“意义”和“理由”。 作者认为,大语言模型本质是信息处理器,其可解释性的核心不在于神经元的激活模式,而在于模型所处理的信息本身——这些信息与世界、知识及人类实践的关系。因此,需要将视角从“模型如何思考”转向“模型处理了什么样的信息”,即关注信息的本体论地位。 文章引入康德哲学中的“范畴”概念,提出可解释性的关键在于模型的信息结构是否能映射到人类理解世界的基本认知框架上。而将这一哲学理论转化为实践的关键是“本体工程”。本体工程能构建结构化的知识框架,为模型的推理提供可追溯、可验证的语义锚点,从而使模型的输出变得可理解、可问责。 最终,文章主张超越“打开黑箱”的单一思路,通过本体工程构建“AI友好的”语义骨架,将可解释性从一个技术难题,转化为一项可通过工程手段管理的治理目标,让AI的影响变得可追溯、可控制。

marsbit07/17 07:39

拆开Claude大脑也没用,AI黑箱真正的钥匙,藏在本体工程

marsbit07/17 07:39

提示词工程论文登上ICML 2026,网友吵翻了天

一篇关于提示词工程(Prompt Engineering)的论文被机器学习顶会ICML 2026接收,引发广泛争议。该论文提出了一种名为“Verbalized Sampling”(VS)的方法,核心在于仅通过修改提示词,要求大模型在生成答案的同时输出其自身的概率分布,从而显著提升了模型输出的多样性,缓解了LLM中常见的“模式坍缩”(Mode Collapse)问题。 论文作者认为,模式坍缩的根本原因并非在于优化算法,而在于人类偏好数据中存在的“典型性偏差”——标注者更倾向于给常见、流畅的答案高分。通过在推理阶段使用VS提示词,可以唤醒模型在预训练阶段学到的多元分布。实验表明,该方法在创意写作等任务中能将输出多样性提升1.6至2.1倍,且不影响事实准确性与安全性。 这一成果在Reddit上引发了激烈讨论。反对者认为,仅靠调整提示词缺乏算法或理论创新,创新性单薄,且其普适性和稳定性存疑,不符合传统机器学习顶会对“硬核创新”的期待。支持者则指出,研究价值在于其深入的问题归因和严谨的实证过程,类似于当年“思维链”(CoT)提示的兴起,提示词工程正成为研究模型行为的重要方法,未来可能改变大模型的能力边界。 该研究由美国东北大学、斯坦福大学等机构的研究人员合作完成。尽管方法看似简单,但作者强调其包含了完整的问题溯源、理论归因和大量实验验证。

marsbit07/15 07:55

提示词工程论文登上ICML 2026,网友吵翻了天

marsbit07/15 07:55

AI 的十字路口:为什么华尔街们正在向 ChatGPT 与 Claude 们说“不”?

本文探讨了企业及个人用户对私有化AI的迫切需求,以及当前实现AI隐私保护的技术路径与面临的挑战。文章指出,随着ChatGPT、Claude等闭源AI模型在企业工作流中的广泛应用,敏感数据(如IP、商业机密)泄露至模型服务商的风险日益凸显。华尔街投行、三星等企业早已限制其使用,转而寻求更安全的方案。 核心矛盾在于:追求最高性能需依赖闭源前沿模型,但这意味着将数据明文传输至服务商,仅能依靠“合同承诺”保障隐私;而追求可验证的隐私,则需使用开源模型,但其通用能力暂时落后于闭源模型。 文章分析了当前实现隐私AI的几种主要机制: 1. **协议层隐私**:如“零数据留存”合同和匿名代理,依赖服务商的承诺,无法验证。 2. **结构层隐私**:利用硬件或密码学技术确保数据私密性,但仅限于开源模型。包括: * **可信执行环境**:在硬件加密环境中运行模型,性能损耗已大幅降低(约7-8%),成本正变得有竞争力。 * **全同态加密**:在密文上直接计算,无需信任任何方,但速度极慢,尚不实用。 * **本地推理**:完全控制数据,但受限于硬件成本和可运行的模型能力。 研究表明,经过专家数据微调的开源模型,在特定专业任务(如金融分析)上,其准确率和成本可同时击败通用前沿模型。然而,微调过程本身也可能涉及第三方服务,并非完全私有。目前,结合TEE和E2EE(端到端加密)的托管API服务,正在为开源模型提供可验证的、成本合理的私有推理方案。 更大的挑战在于“AI智能体”工作流的隐私。模型调用外部工具(如日历、数据库、搜索引擎)时,查询内容仍以明文形式发送给这些工具的服务端。目前,网关管控、TEE托管工具等方案主要解决中间路径问题,但最终目的地(如谷歌搜索)仍需读取明文查询。加密搜索等技术仍处于实验室阶段,性能和成本尚未达到商用水平。 展望未来,私有AI的需求在增长,相关服务用户量显著上升。对普通用户,已有免费或低成本的隐私聊天选择;对企业,带隐私证明的推理端点价格已具竞争力。然而,私有AI市场体量相比主流AI仍然很小。真正的价值在于填补剩余的关键缺口:在加密环境中完成模型训练循环、实现端到端加密的工具调用、构建不暴露查询的加密搜索引擎等。文章结论是,对于依赖工具调用和最高性能的日常任务,企业可能仍需选择信任闭源模型;但对于构成其核心竞争力的高阶分析与决策(即“alpha”),应选择在可验证的私有环境中,利用专有数据微调开源模型,这已成为一条在准确性、成本和隐私上可行的路径。

链捕手07/13 14:54

AI 的十字路口:为什么华尔街们正在向 ChatGPT 与 Claude 们说“不”?

链捕手07/13 14:54

全网骂Claude变笨,Anthropic下场揭秘:坑你的不是模型

近日,Anthropic官方发文澄清了用户关于Claude“变笨”的普遍误解。问题的核心并非模型能力下降,而是用户混淆了“模型选择”与“努力度”两个关键设置。 今年3月,许多开发者发现Claude Code性能骤降,任务完成不彻底。原因在于Anthropic为降低延迟,将“努力度”默认档位从“高”调至“中”,导致模型投入工作量减少,而非模型本身变弱。 官方解释了两者的区别: - **模型**:代表AI的“脑子”,即固定的知识权重,决定其“会不会”某项任务。换模型是更换其底层能力。 - **努力度**:代表AI的“态度”,决定其单次任务中愿意投入多少工作量,如读取文件、运行测试、深入验证的彻底程度。高努力度能生成数倍于低努力度的思考与操作。 因此,当Claude表现不佳时,应先检查提示词与上下文。若AI“不够努力”(如跳过必要步骤),应调高努力度;若属于“不会”(上下文充足仍犯错),才需更换更强模型。 一个反直觉的结论是:较小模型(如Sonnet)配合高努力度,其表现可能优于强大模型(如Opus)在低努力度下的表现。关键在于根据任务复杂度合理“调度”模型与努力度,这已成为有效使用AI编程工具的核心技能。盲目升级模型而不调整努力度,可能既浪费成本又无法解决问题。

marsbit07/12 05:56

全网骂Claude变笨,Anthropic下场揭秘:坑你的不是模型

marsbit07/12 05:56

高盛报告拆解中国AI大模型竞争格局:谁将成为长期赢家?

高盛发布报告深入分析中国AI大模型竞争格局,认为行业正处历史拐点。中国开源/开放权重大模型的智能性能已逼近全球顶尖专有模型,凭借架构创新和参数效率,能以远低于美国模型的成本实现接近性能。 报告将竞争演进概括为“从DeepSeek的成本效率时刻到智谱GLM的模型智能时刻”。市场呈现“双层结构”:高端模型(如智谱GLM5.2、阿里Qwen3.7 Max)定价约为每百万token 1美元,推理毛利率约10%-20%;低端模型定价低至每百万token 0.06-0.2美元,主攻价格敏感的中小企业及个人用户。高盛预测,中国AI模型的API及订阅收入将从2026年估算的350亿元人民币增至2030年的8790亿元。 开源是中国模型主流策略,利于部署和生态,但现有纯开源模式导致公司披露的ARR严重低估实际部署规模。行业正逐步转向“开放权重+社区许可证”模式以改善变现。 企业AI使用范式正从“token最大化”转向“ROI优先”。中国模型凭借性价比优势,正加速拓展国际市场,并已入驻AWS Bedrock等全球主流平台。 高盛通过定价能力、成本优势与财务实力三维框架评估长期赢家。在基础文本模型领域,智谱与DeepSeek定位最强;在多模态领域,字节跳动领跑。报告维持对MiniMax和快手的买入评级,看好其发展前景。

marsbit07/11 07:50

高盛报告拆解中国AI大模型竞争格局:谁将成为长期赢家?

marsbit07/11 07:50

活动图片